ラベル 装置 の投稿を表示しています。 すべての投稿を表示
ラベル 装置 の投稿を表示しています。 すべての投稿を表示

2018年4月23日月曜日

ローディングリコメンデーションという「推奨」

PacBioに限らず、ローディングリコメンデーションという単語があります。
アプライDNA量の推奨値、という方がわかりやすいでしょうか。
シークエンスデータが最も最適に出力されるような、DNAライブラリの濃度と量のことを示しています。

「最適に出力」という意味は「より長いリードをより多く出力」と考えてかまいません。

その前に、、、
P0、P1、P2、というPacBioに特別な単語があります。
これはZMWの中にポリメラーゼとSMRT Bellライブラリのコンプレックスが入ってシークエンスされるわけですが、そのデータを見て、

  • P0:データ無し→つまりZMWにライブラリが入っていない。空っぽ
  • P1:きれいな1分子のDNAデータが出てくる→きちんとZMWにライブラリが入って、かつシークエンスがされていた
  • P2:上記以外→データがノイズばかりの場合。ZMWに複数ライブラリが入った場合。クオリティが低いリードしか読まれていない場合など
を区別しています。
実際解析に使用されるデータは、P1のデータです。
アプライDNA量が極端に少なければ、ZMWに入るライブラリが少ししかないのでP0が増えます。逆に極端に多くライブラリを入れた場合は、オーバーロードと言って、P0は減るかもしれませんがP2が増えることが予想されます。

RSIIや初期のSequelの場合、ZMW全体のうち20%~40%のZMWからP1データが出力されることが望ましい、と言われていました。
ポワソン分布に従うならば33%、それをもっと上げるためにマグビーズなどが使用されて40%、多い時は50%を目指していました。

Sequelの5.1になり、そのリコメンデーションが改訂されました。ここ
  • P1はほとんどのアプリケーションで50%以上を目指すように
    (ただし、あまり多くのP1リードを目指すとリード長が短くなる恐れもある)
  • オーバーロード(ライブラリの入れすぎ)の指標は、P0の値を参考にする。P0は20%くらいが望ましく、10%を切るようならばライブラリ量を減らした方が良い
  • Iso-Seqやアンプリコンの場合、Pre-extension(読む前にシークエンス反応をある程度進める方法)をするので、P1は70%を目指すことが可能で、P2は20%未満を狙う
  • Expressキットを使うゲノムアセンブリ用のロングライブラリの場合、P1は50%台を目指す
  • バクテリアのマルチプレックスは、P1は50~65%を狙う
と、細かいことですがつまり長いライブラリでもZMWの半分からは良いデータが出てくるような濃度でアプライすることを推奨しているのですね。
SequelセルのZMWは100万あるので、50万本のロングリードが1セルから出力されることを想定して、最適なライブラリ濃度を調整することが必要というわけです。

短めのライブラリ、Iso-Seqやアンプリコンの場合は、最高70万本の配列が出力されることが十分あり得るのでデータ単位のコストはかなり低くなると思います。

ここまで書きまして思うところがあるのですが、
P1の数字を狙って濃度調整することは難しい!
というのがユーザの本音だと思います。

なのであくまでもリコメンデーション、推奨、なのです。
「その値を狙ってアプライしたときが一番良い結果を生むと思います。ですが結果はサンプルにも依存するので必ず良い出力を出すという保証はございません」
という意味です。

なので受託に頼んでスループットが予想ほど良く無くても、受託会社さんを責めないでくださいね。

2018年3月20日火曜日

PacBio Sequel v.5.1  ~もうバージョン5.1になってました、、、

装置やソフトウェア、試薬のバージョンアップは、この業界では頻繁にあることです。
今のSequelでは、装置ソフトウェアと解析ソフトウェアが同じバージョンでそろっていて、試薬やケミストリーが別のバージョン番号で管理しているのです。
ちょっとややこしいですが、試薬・ケミストリーが v.2.1で、ソフトウェアが v.5.0 という感じだったんですね。
解析ソフトウェアSMRT Link(SMRT Analysisを含む)のバージョンが、装置ソフトウェアと同じバージョンです。

そこで今回、新たなバージョンアップ!

ソフトウェアが v.5.1になり、ケミストリーが 2.1 version 2 に!
ん? v.2.1 のさらに v.2 って・・・ と思う方もいるでしょうが、そこは気にしないでください。

装置&ソフトウェアの v.5.1と、試薬 v.2.1(v2)を使った場合のスループットがこちら。
ロングライブラリ(35kb)を10時間読んだとき

ショートライブラリ、5kbアンプリコンを20時間で読んだとき

そう、v.5.1から、10時間ムービーと20時間ムービーが選べます。
20時間で読む場合は、LRという別のSMRT Cellを使う必要があります。
(因みにスタンダードのセルよりもLRセルの方が若干高価)

どう使い分けるのか?ですが、今のところ、
  • ゲノムアセンブリのような長いインサートライブラリは10時間
  • PCRアンプリコンやIso-Seqのような短いライブラリは20時間
をお勧めしています。将来的には変わるかもしれませんが、今はこのように、長いライブラリは今まで通りの10時間で読み、短いライブラリは、もちろん10時間でも良いけれど20時間で読むこともお勧め、ということです。
もちろん、20時間で読んだ方がロングライブラリでも長く読めるのでは?という疑問が出てくると思いますが、今のところ、ロングライブラリを20時間で読んでも、10時間で読んだときと平均リード長はほぼ同じ(最長リードは長いが)。というデータが出ています。
LRセルの方が高価だということを考えると、10時間でも費用対効果は良い。

ところが短いライブラリで、主にCCSを作ることを目的としたシークエンスでは、20時間は生きてくるのです。
先のデータによると、

35kbライブラリの場合、10時間で読んだとき
  • データの半分以上は、30kb以上の長さのリード(ポリメラーゼリードとサブリードはほぼ同じ長さとみて良い)
  • 最長リードは90kb超え
  • 1セルあたりの出力塩基数は 10Gb
  • 出力リード数は40万

5kbアンプリコンライブラリの場合、20時間で読んだとき
  • データの半分以上は、70kb以上の長さのリード(アンプリコンサイズが5kbだから何度もインサートを繰り返し読むことのできるポリメラーゼリード、が多く出力される)
  • 最長ポリメラーゼリードは180kb超え
  • 1セルあたりの出力塩基数は20Gb
  • 出力リード数(この場合出力CCS数と言っても良い)は40万

アプリケーションごとのSequel v5.1パフォーマンス(1 SMRT Cell あたりの出力)は以下のようになっています(v5.1 Software Upgrade and Performance Overview - Customer Training より引用)

Whole Genome Sequencing for De Novo Assembly
-Up to 10 Gb:サイズセレクション済の 40kb以上のロングライブラリの場合
-Up to ~7-10 Gb:サイズセレクション済の 15-40 kbロングライブラリの場合

Iso-Seq 完全長 cDNAシークエンス
-Up to 20 Gb
-Up to 250,000-350,000本の full-length non-chimeric (FLNC) reads

Targeted Sequencing (アンプリコンシークエンス)
-Up to 20 Gb
-Up to 300,000 CCS reads:2.5 kb アンプリコンの場合
-Up to 200,000 CCS reads:5 kb アンプリコンの場合
-P1リードのうち 40% 以上は QV 30 のCCSを作成可能:5 kb アンプリコンの場合

Structural Variation Calling (構造変異解析)
-Up to ~7.5 Gb: サイズセレクション済の 15kb ロングライブラリの場合

「Up to」と書かれていますね。これは、そういう意味です。
必ず出る保証はないけれども、うまくいけばこのくらいの塩基は読めるという。

と書いていて自分で言うのも何ですが、数字ばかり並べてもあまり説得力がないと思います。
それぞれ、研究にどれだけ使えるのかを具体的に示せなければ意味が無い。
これについては次に書く予定です。

お知らせ:
3/25-26 日本育種学会総会
3/27-28 日本細菌学会総会
にそれぞれ出展します。どちらも福岡での開催です!

2017年1月12日木曜日

予想外れてショートリードからハイスループットマシン登場

2個前のブログでJPMのことを書いたけれど、HiSeqのような超スループットマシンは出てこないだろうという予想が大きく外れ、我ながら見る目が無いなあと凹んでます。

ええ、これのことを言ってます。NovoSeq
これから誰が買うのかな?なんて余計な心配でしょうね。
フローセルも、ケミストリーも、ファイルフォーマットも今までとは違うらしい。
リード長が150bpとか100bpというのは変わらないですが。
しかし、データ量が半端無くでかい。クラウドで解析するにしても、転送が大変でしょう。

100ドルゲノム、というキャッチフレーズだそうです。
でも100ドル/検体を実現するためには年間数億円の試薬購入が必要とか、そういうことは良くある話。
GAIIのデータ量に圧倒されていたのが遠い昔に感じます。
もう歳をとったのかな。

今日のところはこれにて
凹んでますので

2015年10月1日木曜日

PacBio 新型シークエンサー Sequel System

皆さん、驚かれるかも知れませんが、PacBioの新型シークエンサーが発表されました。

私も全く知らなかった。
本当にサプライズ。
PacBio本社でも、知っているひとは限られていたそうです。

ついこの間まで、PacBioの誰もが「PacBioはあの大きな装置、RSIIを、これからも売っていく。小型シークエンサーは出ない」って明言していましたから。
 私もそれを信じて、あちこちで「新型装置は出ない」って言ってきたので、結果として嘘を言っていたことになり、申し訳ないです。

とは言っても、MiSeqくらいの大きさ・・・というわけではないようですね。まだでかい。
横に立っている女性、背が高いです。
装置の大きさは幅x奥行きx高さが、36.5 in x 34 in x 66 in(168 cmくらい)
重さは381kg
今までのRSに比べると確かに小型です。軽乗用車サイズから冷蔵庫サイズに、なった感じ。
デザインは・・・ ちょっと・・・ まあ、いろいろあると思いますがあえて言いません。

プレスリリースはこちら

では今までのRS IIとどう変わったのか?
SMRT Cellが大きくなりました。大きさにして約4倍、ZMWの数は約100万
ここから出力されるリードの本数は、今までと比べておよそ6~7倍

リードの長さやMovie時間はRSIIと変わらない予定です。
1セルあたりの出力塩基数は~5Gb(うまくいけば10Gbも?)
最大16セルまで1ランで使用可能

SMRT Cellが大きくなったということで、今までは8セルが1本のStripにまとまっていましたが、Sequel Systemは4セルで1本です。
これを最大4本、装置にセットすることができます。(合計最大16セル)

Sequel Systemでできることは、
デノボアセンブリ、Iso-Seq、ロングアンプリコン、Methylation解析、というふうにRSIIと同じです。
サンプル調製も、一部はRSIIと同じキットを使い、一部は特別のものを使う、というふうに分かれています。
窒素ガスはRSII同様、必要です。

この機械の、前面の黒いところは、スライドして下に降りるようになっています。
すると、中からロボットと試薬セットを置く台が現れます。
ここでユーザが、SMRT Cellをセットしたり、キットやチップを置いたりします。
スライドを閉めてから、上段右のタッチパネルで操作します。
Real Timeでシークエンスが始まり、データはこの装置の下のほうにあるサーバで、ベースコールされます。

ベースコールされたデータは、ユーザのサーバに転送されるか、USB3.0でユーザが抽出します。
データ解析はRSIIと同様、SMRT Analysis 3.0 を使います。
あ、SMRT Analysisは次に3.0になります。ちなみに3.0はRSIIのデータも解析できますのでご安心を。

Sequel Systemを使えば、うまくいけば、30xのヒトゲノム・90Gbを、1回のランで得ることも可能。
それも平均10kbの超ロングリードで!!



今年のASHG(アメリカ人類遺伝学会)の大きな目玉になることは間違いない!

そもそも、どうしてこんな製品が突然出てきたのでしょうか?

ご存知の方もいると思いますが、PacBioはRocheと共同で、Roche向けの診断用NGS装置を開発するという契約がありました。以前ここにも書きました。
この装置も、Roche次世代シークエンサーの開発の過程で作られたものだそうです。
極秘裏に開発されたのも仕方が無い。

こちらSequel Systemは、Research Onlyなので、Roche向け診断用NGSとは、別物です。
診断向けNGSについては、Rocheさんにお問い合わせ下さいね。


肝心のデータですが、実は、まだオープンにできるものはありません。
現在、本社でサンプル調製の最適化と共に、良いデータ出しをしているところだと思います。
乞うご期待!

価格は来週決まりますので、お問い合わせはトミーデジタルまでお気軽に!


しかし、当然ですが、気になるのは今後RSIIの運命はどうなるのか? ということですよね。
先ほどのプレスリリースによると、RSIIの試薬の開発・サポートは続くとのことです。
これは信じる。

それに、RSIIは販売してから歴史があるので、トラブルシュートの経験がある。
新しいSequel Systemよりは安定してデータを出してくれるでしょう。 
しばらくは共存していくと思います。 

来週アメリカに行くので、いろいろ突っ込んで聞いてきます。



あーあ、それにしても、あちこちで「新型機械は出ない!」って言ってきたなあ。 やばい。
サプライズとしては良いかも知れないけれど。
出るとわかっていたらもっと嬉しかったかも知れない。そう思う社員は、PacBio本社の中にも多いと思う。
まあ、この業界では良くある話ですけどねえ。

良いニュースとして、前向きに考えることにしました!

2015年3月3日火曜日

AGBTレポート2:Synthetic Long Read Again ?

Bio IT World の記事です。


AGBTでは、NGS関連での大きな新製品発表のニュースはありませんでした。

Illumina社は1月に、HiSeq3500、4000、HiSeq X5をもう発表していたので、新しい発表は無し
Thermo Fisher (LifeTech)社は、P2チップの販売はまだ無し
Oxford Nanopore社は、いつも通りで、インパクトに欠ける
Qiagen社のシークエンサー、Gene Readerはまだ形が出るまで時間がかかる
AGBT唯一のゴールドスポンサー、Pacific Biosciences社は、「いよいよベンチトップマシンを発表するか!?」 という噂があったそうですが、それはあくまで噂。
PacBioの大きさは変わりませんよー!

さて、そんな中、注目されたのが、10X Genomicsという会社
この機械の名前は、GemCode


ユーザはDNAサンプルを、GemCode Chipといわれるカセットに投入します。
すると、ゲルビーズとオイルが充填された微細管流路(Microfluidics)の中を、DNA分子が分かれていって、ひとつのGem(ウェルと訳せるのかな?)に一分子のDNAが入るそうです。
このときはまだ、DNAも100kbくらいのロング配列。
で、そのGemごとに、ロングDNAは、Illuminaシークエンサー用に断片化され、14-baseのバーコードが付けられる(この辺の技術は公開されていない?)。
Gemごとにバーコードが付いているので、断片化した後ライブラリが作られシークエンスされても、元のDNA分子がどのロングDNA由来だったかがわかるので、ショートリードからソフトウェアで元のロングDNA配列が再現できるというわけ。

ん?

何かどこかで似たような技術があったかと。
Moleculo 社の Symthetic Long Read !!
これも、切断前のDNAにタグをつけて、ライブラリを作ってHiSeqでシークエンス、そのあとタグを元にアセンブリし、切断前のDNAを再現する。

結局、10X Genomicsのテクノロジーも、真のLong Readではないのです。
ショートリードのテクノロジーを使ってシークエンスする以上、GCリッチの連続配列など、読みきれない場所が必ずあると思うんですが、まだデータを見ていないので何とも言えませんけど。



2014年1月20日月曜日

HiSeq X 10

軽い気持ちで読んでください。

先週、シークエンス業界の巨人、Illumina社から、こんなリリースがされました。
曰く、1000ドルゲノムついに実現!その名もHiSeq X Ten
http://www.illumina.com/systems/hiseq-x-sequencing-system.ilmn

これって、HiSeqを10台並べただけじゃ・・・・ない?
天下のIlluimnaがそんなことするわけない! って思って良く読んでみたが、どう読んでも裏があるようには思えない。
1000ドルでヒトゲノムが完全に読めるかどうかは別問題ですが、HiSeq 10台分のデータはすごいだろうな。


台数を増やす、うーん、その手があったか・・・。
真面目に新機種を開発するだけじゃあ、生き馬の目を抜くようなこの業界は生きていけないか。
それとも、超高性能新機種をドーンとリリースする前に、ライバルをこのようなジョークで安心させて、ちょっと気を抜いた時を狙って撃ち落とす、新たなマーケティング戦略か?

考えすぎか。
CLIA承認のラボでHiSeq X 10があるのは世界でもBroad Instituteと韓国とオーストラリアの3カ所だそうです(2014年1月現在:Illumina社WebSiteより)
単にHiSeqを10台持っているところは他にもありそうですが。


で、それに対抗して、今日PacBioからもこんなニュースが。
その名も RSII Eleven
総重量11トン!
床抜けるかも!!

まだPacBioシークエンサーを11台持っている研究所は世界中どこも無いです。
ですのですぐに、世界最高のPacBioシークエンスセンターになれます!
1ランでヒトゲノム20X、それも平均数キロのリード長で出力、も可能です。
勿論、こちらは冗談です。
忘れて下さいね。



さてさて、もう一つ、こちらは冗談では無いまじめな話

前にも書きましたが、トミーデジタルバイオロジー株式会社・PacBio事業部では、私たちと一緒に働いてくれる人材を募集しています(2014年1月現在)。
実験・アプリケーションサポート職と、解析・ソフトウェアサポート職、の2つです。
しかしいまいち募集してくれるひとが少ない。
時期が悪いのか、募集事項が厳しすぎたのか。

メールで、info_pac(アットまーく)digital-biology.co.jp に連絡頂ければ、募集要項をメールします。

英語力や必要スキルは、万が一足りなくても、元気と努力でカバーできる人は是非チャレンジしてみてはどうでしょう?
新卒、中途、国籍、に制限はありません。
PacBio以外にも楽しいことが多い職場ですよ。



2013年12月24日火曜日

年越し前に、今年最後のアップデートの話

NGS現場の会・第3回研究会で、PacBioのリードがあと2か月で平均8.5Kbpに伸びる、と発表しました。
試薬・酵素と、Movie時間のアップデートで可能になるのです。 もうリリースしてユーザのアップデートもほぼ完了したのでこの話は年明け前にしておかないと。

先ず、試薬・酵素

PacBioの酵素はPolymeraseでP、試薬はChemistryでC、と表します。
組み合わせは、P4C2とか、P5C3とか、で略します。

といっても、少し前まで、XL酵素とXL試薬、C2酵素とC2試薬という厄介な名前のものがあり、XLC2、XLXL、C2C2と略すとどっちがどっちだ!ということも良く聞かれました。
ちなみにXLC2はXL酵素とC2試薬、XLXLはXL酵素とXL試薬、C2C2はC2酵素とC2試薬の略です。
それがややこしいというのはアメリカでもクレームがあったらしく、これからはPとCではっきり分かるようにさせたということらしい。

それはともかく、今のシークエンスに使われているのは、P4C2です。
P4は、2013年の夏ごろリリースした酵素です。
C2酵素よりも安定してロングリードを作ることができる酵素です。
P4C2で読んだとき、120分Movieでは平均リード長4500bpを出していました。

C2試薬(酵素では無い)は、ヌクレオチドと蛍光色素の距離が近く、レーザーが照射したとき、蛍光色素からのエネルギーが酵素に移動するため、それによって酵素の活性が失われやすいという欠点がありました。
そこで、ヌクレオチドと蛍光色素の間に、分子を入れて、レーザーによる励起エネルギーが酵素に届かないように改善、これがC3試薬の登場です!
左側がC2試薬と酵素X、右側がC3試薬と酵素X
Protecting Scaffoldというのが、ヌクレオチドと蛍光色素の間に新たに挿入した分子です。
これがC3


C3試薬を使うと、レーザー光によってDye(蛍光色素)が出すエネルギーが、Protective Scaffold(分子)によって遮られ、酵素には届かない、という図

こうしてC3試薬が生まれ、酵素との組み合わせ実験がR&Dにて行われました。
P4酵素とC3試薬はあまり組み合わせが良くなかったのです。
夏前からいろんな酵素を試していて、最終的に残った、一番成績の良い酵素君が、P5と名付けられました。


次にMovie時間アップデートの話

今までは120分がMovie時間のMaxでしたが、これを180分まで読めるようにしました。
Movie時間を変えるのはソフトウェアをちょっと変えれば可能なので、実は、酵素が180分たっても大丈夫、になったことの方が大きい。
120分で読んだ時の1.5倍かかるわけですから、1日何セル読めるかは、新たに計算する必要がありますね。
今までは120分Movieで8セル読むとすると、機械にセットしてからデータ転送が終わるまで20時間くらいでした。180分Movieだと、おおよそ28時間。


以下のグラフは、カタログでも登場するものです。 
大腸菌ゲノムで、20Kbpライブラリを作り、Blue Pippinでサイズセレクションして、180分Movieで読んだ時の平均データです。



平均リード長5500bpのP4C2は、今まで通り、デノボアセンブリやcDNAシークエンスなどに向いています。
同8500bpのP5C3は、精度がP4C2に比べて低いので、今のところスキャフォールドへの使用を推奨しています。

私たちもそのうち、こうしたデータを公開しようと思います。
でも、ポリメラーゼリード単位のデータでは、へー、で終わってしまう。
やっぱりサブリードのグラフも欲しいし、実際アセンブリした結果も欲しい。
なので、公開するときはそういうデータも一緒に。


2013年9月30日月曜日

PacBio RS II によるバクテリアゲノムアセンブリ:海外トップユーザの状況から

今日は久しぶりに会社のチームみんなで集まってビアガーデンパーティをしました。
出張が多いメンバーが一度にみんなそろうことはめったに無いのです。
9月30日、ビアガーデンとしてはちょっと肌寒い時期でしたが、大手町サンケイビル4階の「天空のビアガーデン」 
今年の夏を締めくくるにふさわしい、とても良いひと時でした。


さてさて、バクテリアサイズのゲノムのデノボアセンブリには、PacBio RSを超える機械はこの世に存在しない! というのはこのブログを読んでいる皆様にはもう常識?ですが、海外でももちろんその通りです。
JGI(Joint Genome Institute)という、アメリカエネルギー省管轄の研究所がカリフォルニア州ウォルナットクリークにありまして、ここでは2台のPacBio RSがフル活動しています。 
エネルギー省の施設なので、読んでいるバクテリアの種類は、病原菌というよりもどちらかというと環境や生態系に関する重要バクテリアや、バイオ燃料開発などで重要なバクテリアで、これらをがんがん読んでいるそうです。

彼らのホームページにもPacBioシークエンサーのことが書かれていて、HGApのことについても触れられています。HGApはもうご存知、PacBioのロングリードだけでエラー補正からアセンブリ、Contig Polishingまでを自動で行うパイプラインのことですね。
このアルゴリズムの開発にも、JGIは大きな貢献をしました。
http://www.jgi.doe.gov/News/news_13_05_06.html

さて、JGIでは、大量のサンプルをガンガン読んでいるために、サンプル調整を手で行うのは大変になりました。
そこで導入したのが、PerkinElmer社から売られている自動分注装置。
Caliper社のScicloneという自動サンプル調整ロボット機械には、PacBio用のアプリケーションが作られ、その名も  Maestro PacBio 10Kb DNA Library Prep
マエストロですよ!好きです、こういう自身満々の名前
http://www.perkinelmer.com/Catalog/Family/ID/Sciclone%20NGS%20Workstation
この装置は、PacBioの3Kb - 10Kbのライブラリ調整を自動で行ってくれるそうです。
スループットは一度に8 から 96 サンプルで、8時間以内で終了するそうです。

このような装置は、いろんな種類のサンプルを読む場合、たくさんのライブラリを作る必要があるので、大活躍するかもしれませんね。
反対に、大型ゲノムを数種類だけ読むような場合、最初にライブラリを作ってしまえばあとはできているライブラリをたくさん読むだけなので、サンプル調整は手で行った方が安上りかもしれません。

いずれにせよ、たくさんの種類のバクテリアを読んでいるJGIには、この手の機械が有用なのでしょう。
これがその自動化マシンを使ったときの、DNAサンプルからContigデータまでの流れです。
PacBioのプレゼンより引用
DNAのシェアリングまではG-tubeでやるんですね。ここはマニュアルかあ。

断片化した後の、ライブラリ調整を、PacBioプロトコルに合わせてこの装置がやってくれるわけですね。
出来上がったライブラリをシークエンサーに乗せるわけですが、サイズセレクションは当然これもマニュアルでしょうね。

回収率はどれくらいなんでしょう?

2013年6月21日金曜日

150KとP4

突然ですが、今年の流行語大賞は何でしょうね? 
「アベノミクス」、「今でしょう?」、この2つのどっちかじゃないか、と今から予想しています。
http://singo.jiyu.co.jp/index.htmlを見ると、ああ、そういう言葉もはやったね、と思いますが、流行語ってほとんど定着しないんですね。
アベノミクスが来年忘れられるようでは困りますが、「今でしょう?」はまさに今しか受けない、というか、そろそろ使用期限が切れるフレーズかな?
小学生の間ではまだすごいブームらしいです。


さてさて、ユーザーの方にはもちろんアナウンス済みですが、PacBioはハード・ソフトの両面でバージョンアップします(しました)。

ハードは、以前「第一回アジアユーザーミーティング in シンガポール」でも触れた、RSIIです。 

これは今まで、一度に読めるZMWの数が75,000だったのが、レーザーの光を分散させる光学機器の改善で、一度に150,000読めるようになったことです。
120分Movieで今まで750,000しか読めなかったのが2倍読めるようになった。つまりデータスループットが2倍になったことを意味します。
 
1セルあたりおよそ200Mbp、というのは控えめかもしれません。
私たちがあるバクテリアを10kbライブラリで読んでみた時、Productivity=1(信頼のあるリードデータ)が31%くらいのデータで、220Mbpでした。
その時はN=3でしたが、以来サンプルを変えて何セル読んでも大体今までの2倍は読める。
宣伝に偽り無し、でほっと一安心! (← ユーザーの立場での感想)
上図の、左側が今までのRS、右がRSII
リード長がX軸で、Y軸にその本数を示しています。 縮尺を合わせました。 どちらもProductivity=1が31%で、RSが102Mbp、RSIIが221Mbpのスループットでした。
分布「形」にはあまり差は無いのがわかるでしょう? 高さは大きく変わっています。
 
 
バージョンアップのソフトの方、こちらは、 酵素です。
P4という酵素がリリースされました。
こちらは、すごい改善! というわけでは無いのですが、より安定して、今までと同じく長く読める酵素です。
今まで、C2とXLという2種類の酵素がありました。
C2は精度は良いがスピードが遅いので長さがいまいち(平均3300bpくらい)
XLは精度が若干落ちるがスピードが速いので平均4000bpくらい
 
P4は、C2とXLの良いとこ取り、で、C2の精度を保ちつつXLの長さを獲得した酵素です。
例えば、4.65Mbpのゲノムサイズのバクテリアを、C2、XL、P4の3種類で読んだデータがPacBioのプレゼンにあります。
10kbライブラリでセルを2個使って読み、HGAP-Celera Assembler でアセンブリしています。
C2とP4は最終的にContigが1つになりました。
XLでContigが1つにならなかったのは何で?とツッコミたくなりますが、それには触れていません。
注目すべきはマッピングできたサブリードの精度で、
  • C2  86.21%
  • XL  84.09%
  • P4  88.28%
 
さらにContigの精度も、Phredスコアで言うと
  • C2  58 (21x, 97x)
  • XL  49 (16x, 113x)
  • P4  57 (22x, 112x)
括弧内最初は、アセンブルする直前の、HGAPでエラー補正した後のリードカバレッジ、次はHGAPエラー補正する前のリードカバレッジ
つまりP4では、セル2個使って112カバレッジのリードを得、HGApでエラー補正して22xに減ったものの、22xを使ってアセンブルしたらQV57のContigが1本できた、という意味です。
 
私たちでも、20kbライブラリを作って、P4酵素で読んでいます。
結果は素晴らしいものでした。
これは日を改めて、お知らせしたいと思います。
「NGS現場の会」のネタにもしたいと思っています!!
 
 

2012年2月17日金曜日

New Chemistry ! - C2 とは

PacBioのシーケンスアプリケーションについて報告です!

現在、インストールしているシーケンサーは、C2という新しいバージョンです。
これからインストールされるものは全て、C2バージョンになります。
世界的にも、すべてのマシンが次々にアップグレードされていく計画です。

今までのC1バージョンとどこが変わったのかというと、
  1. より長く読める(10Kb のライブラリーを読むことができる)
  2. より多く読める(ZMWの穴に1つちゃんと入る「DNA‐ポリメラーゼ」が多くなった)
  3. 解析ソフトウェアがちょっと良くなった
  4. ソフト上でデータのグループ管理ができるようになった
ポリメラーゼ酵素がより安定するように改善されましたので、より長く、より安定して読めるようになったのです。
それに伴って、今までStrobeという、長いライブラリーを飛び飛びに読むプロトコールが無くなりました。 
ショートリードでいう、メイトペア、のかわりにStrobeがあったのですが、もうそのまま10キロ読んじゃえ!ってことでこれは無くなったのです。
実際どれくらい長く読めるのか? というのが気になるところでしょう。
10Kbのライブラリーを作って読んでも、すべてのリードが10Kbというわけではありません。
平均は数Kb、何割かが10Kbいくかどうか。
正確な数値を伏せているのはまだオフィシャルになっていないかもしれないので。
近くお知らせします。

解析ソフトについては、細かい機能がちょこちょこアップデートしたり、バグが直ったりと、いまいち地味ですが、使い勝手はいいと思います。
各セルごとに、塩基ごとのシグナル:ノイズ比がわかるようになりました。
使ったことはまだありませんが、GATKとのインテグレーションができるようになったそうです。

もう少ししたら、カタログもプレゼンも、すべてC2用に変わります。
今までC1で覚えたことが、C2ではいろいろ変わっていて大変ですが、すぐ慣れるでしょう。

そんなところで、明日も頑張ります。

2012年1月31日火曜日

とりあえず装置について

最近特に寒いですね。
うちの近所の雪がまだ融けません。 もう1週間近く経つのに。

今日は、PacBio RSの装置について書きます。


左の少し小さい黒い箱が、Blade Centerという名のサーバーです。
ここではシーケンサーからでてきたデータの一次解析を行います。
一次解析については別の日に詳しく書きます。
実際は、このBlade Centerと隣のシーケンサーはLANケーブルでつながれています。
そしてシーケンスデータは、Blade Centerからユーザの用意した二次解析用サーバーに転送されます。

このBlade Centerは、ユーザは直接触ることはできません。
PacBioの人間か、私たちDistributorの人間が、機械の調整を行ったり、ログを取ったり、通信試験をしたりするときにPCをつなげることはあります。
ちなみにこのBlade Centerは、アメリカのPac本社から遠隔で操作することができます。 何か不具合があったときの原因究明のため、ログだけは取れるようになっているのです。(ユーザの協力が必要)


シーケンサー本体の、上のタッチパネルはRS Touchという操作画面です。
ランを設定するときに使います。 
ランが動いているときは、あとどれだけ時間がかかるか、という情報が、SMRT Cellの蛍光のきれいなネオンと共にが表示されます。


シーケンサー下の左から順に、Wasteボックス、試薬・サンプルローダー、SMRT Cell・チップローダー、水タンク、があります。

試薬プレートとサンプルを格納する引出し、SMRT Cellとチップ(Tip)をのせる引出し、はボタンを押すと厳かに開閉されます。
たまに、ちゃんと閉じないでランプが点滅していることがあるそうなので、そういうときは再度閉めましょう。
この試薬プレートやチップは純正品を使います。代替品では収まりません。
全ては専用のキットを用いるのです。

PacBioのYouTubeより


Wasteボックスには使用した後のSMRT Cellが捨てられます。
このボックスは閉めるときに真ん中あたりを押してしっかり閉めましょう。

水タンクは適度な湿気を維持するために必要です。
ボタンを押すと扉が開いて、中に1リットルのペットボトルみたいな容器があり、そこに水が入っています。
個人的には、ここを開け閉めする扉のスピードが好きです。
スターウオーズに出てくる宇宙船内の扉を連想させます。 エンジニアのこだわりでしょうか?

と、まあ、ユーザーが目にする場所の装置の説明でした。

今後は、
  1. PacBioはどんな研究に用いられるべきか
  2. 論文ではどのように使用されているか
  3. ライブラリーはどうやって作るか
  4. IT関連はどれくらいのスペックが必要か
  5. 一次解析はどうやって行われるか
  6. PacBioに付属する解析ソフトウェアにはどんなものがあるか
  7. PacBioデータを扱える他のソフトウェアにはどんなものがあるか
  8. その他苦労話(これは書けないか!?)
ということを中心に紹介していこうと思います。(順不同になりますが)

スクリーンショットは主に、PacBio社のサイトやYouTube、プレゼンテーションから引用します。
当たり前ですがConfidentialなものは一切ありませんので、ご安心ください。

2012年1月24日火曜日

Movie って?

前回、45分とか75分とか、Movieの時間を最後に書きましたが、説明が足りなかったので付け足します。

PacBioは、ほかの次世代シーケンサーと違って、DNA合成の様子をビデオで撮ります。
SMRT Cellの中には150,000のZMWがあり、この中でDNA合成が行われるわけです。
ヌクレオチドが取り込まれるときに、リン酸についた蛍光が自動的に切り離され、そのときCellの下からあてているレーザーの波長に励起して、A、T、C、Gに特徴的な波形データが得られます。

「自動的に切り離される」ので、Real Timeなわけです。
Wash & Detect ではないので、反応は止めません。
そこで、カメラによる撮影ではなく、ムービーなのです。

150,000のZMWは、ポリメラーゼが入っていなくても、とりあえずMovieは撮られます。

例えば2kbくらいのインサートの場合、それほど長く撮影しなくても良いので、30分くらい読むとします。
この設定にすると、150,000のZMWは2回に分けて撮影されます(各75,000ZMW)。
1回目のムービーと、2回目のムービーで撮影されるZMWは別々で、それぞれ30分間撮影されます。

今は例として30分にしましたが、長いインサートの場合、最高75分まで撮影することができます。
しかし、75分では1回のムービーしか撮られません。
1回のムービーで撮影できるZMWは75,000なので、75分のムービーではCellの半分のZMWしか実際は読んでいないことになりますね。

なぜ長い時間のムービーは1回しか撮られないのでしょうか。

30分を2回撮る場合は、1回目のムービーの時、読まれている75,000ZMW以外の、2回目のムービーで読まれるはずの75,000ZMWでも反応は行われているのです。
2回目のムービーでに読まれるZMWでは、もうすでに30分以上、反応が進んでいるので、ポリメラーゼが弱っています。
したがって、1回目のムービーで読まれるZMWのデータより、2回目のムービーで読まれるZMWのデータの方が、「若干弱気」です。

75分も読んだら、2回目のムービーはもうすでに75分以上経っているのでポリメラーゼはかなりヘタっていることは想像できるでしょう。
他にも理由はありますが、これも長い時間のムービーは1回しか撮られない理由です。

ちなみに、ZMW内のポリメラーゼは、1秒間に1~3くらいの塩基を合成しています。
WTのポリメラーゼはもっと高速でしょうが、それでは機械の検出技術が追い付かないので、わざと遅いMutantを作って使っているのです。

2012年1月15日日曜日

PacBioシーケンサー本体の概略と周りの環境

今年もよろしくお願いします。 

先週から、PacBioシーケンサーにとっぷり浸かる生活が始まりました。
待ちに待っていましたが、実物を前にすると、さすがにすごい代物です。
昨夜はついに、夢にまでこの巨体が出てきました。

見たことが無い、という方のために説明しますと、右側の大きい方が、シーケンサー本体です。
高さ158.0 cm、幅200.4 cm、奥行き77.0 cmで、重さは約1トンあります。

左側の黒い箱が、一時的なデータストレージ+ベースコール計算機です。 100kg 以上あります。

さらに、外付け窒素ボンベが最低2本必要です。 窒素ボンベからは常に一定の圧が右の装置に送り込まれ、内部のレーザー光学機器を水平に保っているのです。

操作方法と機器について、よくまとめられたオーバービューをYouTubeで見つけました。

SMRT Cell というのは、他社製のシーケンサーでいうフローセルやチップと同義語です。
このCellの底に、ZMWという小さい穴が15万個空いていて、その穴の中でポリメラーゼが実際にDNAを合成するわけです。 
一つのSMRT Cellはこんなに小さいんですよ。
これが8個で1セット。 ちょうど8レーンで1フローセル、と似ていますね。

サンプル調整した後は、指定された場所にキットをガチャッとセットして、タッチパネルをいじくってRunします。 具体的には、サンプルを選んだり、読む時のムービー時間をセットしたり、など。

ついでに言うと、このタッチパネルの反応が、日本人には遅く感じるかもしれません。(私だけ?)
例えて言うと、一昔前の郵便局のATM  ちゃんとタッチしてもちょっと遅れる。
そこはがまんで割り切るべきですね。

PacBioを置く環境についていうと、大事なのは床が丈夫で、水平であること。
水平であることは最も重要です。 これは設置前にエンジニアが厳しくチェックします。

そして温度が常に一定であること。 温度変化は内部の光学機器に大きな影響を及ぼします。
なので、空調設備は大事です。 休み中でも空調は切ってはいけません。
長時間作業をする場合は、上着を忘れずに。

先ほど紹介したYouTubeにはシーケンサー内部の様子が少し登場します。
サンプルのローディングはロボットが行います。 産業ロボット大国の日本製でないのが残念ですが、動きは意外と速いです。

無事データが出てくれば、シーケンサー横の黒い箱で、QCを行います。
あまり読めていない時、データが汚いときは教えてくれます。
ここでのクオリティ結果は、先のタッチパネルでも参照できますが、別の2次解析用サーバに転送して、RS Remoteというソフトで参照するのが一般的だそうです。
このあたりはまた、おいおい。