ラベル データの精度 の投稿を表示しています。 すべての投稿を表示
ラベル データの精度 の投稿を表示しています。 すべての投稿を表示

2018年4月9日月曜日

ロングリード解析やっているひとはこの論文を絶対読まないと!

NGS解析をやっているひと、特にロングリード解析をやっているひとは絶対読まなければいけない論文、それがこれ
Piercing the dark matter: bioinformatics of long-range sequencing and mapping
Sedlazeck et al., (2018)Nature Reviews Genetics.
ロングレンジ技術を使ったゲノム解析に関する、すごくComprehensiveにまとめられた、バイオインフォマティクスのレビューです。
これはほんと超おすすめ。
このレビューはいくつかのパートに分かれてまして、

1.ロングリードテクノロジーのまとめ
ここでいうロングレンジ技術とは、Pacific Biosciences (PacBio)や Oxford Nanopore Technologies (ONT)のように、「本当の」ロングリードと、10X Genoimics のリンクドリード、BioNanoのフィジカルマッピング、Hi-Cのような超ロングレンジメイトぺア、を含みます。
それぞれの技術の特徴(ロングリードのエラー率の高さなど)がまとめられています。
Bamファイルの今のフォーマットが、ロングリードマッピングデータにはもはや向いていない、という点は前から言われていましたね

2.De Novo Assemblyへの挑戦

  • ゲノムに存在するリピート配列の存在が、ショートリードでのゲノムアセンブリを難しくしている
  • ロングリードが30カバレッジ未満しか無いときは、ショートリードとのハイブリッドを使うべきだろう
  • しかしショートリードでのロングリードエラー補正(PBcR, Nanocorr, Spades and MaSuRCA,)は、GCバイアスなどの問題でロングリードを正しくエラー補正できない可能性がある
  • ロングリード同士のSelf Correction (HGAP, PBcR, Canu, MARVEL or FALCON)が、もっとも良い
  • 倍数性の高いゲノムのアセンブルは今も、難しい (NRGeneという会社は倍数体があっても独自の秘密プログラムで行っているそうですが仕組みは非公開です)
  • コンティグを作った後のポリッシングには、QuiverやArrow(PacBio用)、Nonopolish(ONT用)、Pilon(ショートリードをポリッシングに使用)などがある
3.スキャフォルディングとギャップフィリング

  • スキャフォルディングには、10XやHi-Cなどが有効
  • しかしアセンブルの時点で高精度のコンティグを作ることが何より重要
4.SV解析
  • まずはSVの定義をはっきりさせている(挿入とか欠損とか、転移とか)
  • SV検出精度はマッピングの精度に依存する(BLASR, BWA-MEM, minimap/minimap2, LASTなどについても言及)
  • コスト、倍数体、リファレンス配列の精度、などがSV解析の大きな問題点

そのほか、ここには書ききれないほどのトピックスがたくさんあって、とにかく、一度読んでみてくださいと言うしかない!
バイオインフォマティクスのレビューなので、アセンブルからSVコール、RNAシークエンスまで、巷にあふれるたくさんのツールの解説があります。

もちろんこのレビューは、決してPacBio贔屓ではありません。
ロングリードはPacBioとONTがありますが、むしろ、最長ロングリードはONTに軍配が上がっている。
PacBioは、エラーのランダム性から、コンセンサス配列の精度は最も高いロングリードと言える。

どうやってもロングリードの場合、PacBioもONTもリード長には限界があり、結果、10XとかHi-Cとか、ショートリードによる擬似的な超ロングリードとの組み合わせがアセンブル結果や構造解析、フェージング解析の結果を大きく改善することは間違いない。

今の時代、複数のテクノロジーを、最適なバイオインフォマティクスツールをうまく使いこなして解析することが重要なんだなと、改めて実感するレビュー論文でした。



--------- 5/18(金)は秋葉原へ集合!------------
「PacBio 現場の会 2018」
登録はこちらから
5名の招待演者と
PacBio、Dovetail、その他最新NGS情報を
一度に聞ける年に一度のイベントです!
情報交換会もあります。
参加無料、PacBioに興味のある研究者なら誰でも参加OK!

2018年3月31日土曜日

CCSは精度では全てのNGSに勝る。コストではサンガーに勝る。カナダの生物種同定プロジェクトの例


これは私がずーーーっと前にこのブログで説明したCCS(Circular Consensus Sequence)についての絵です。
一時期、CCSのことをROI(Reads Of Insert)と呼んでいたこともありましたが、わかりにくいということでCCSの呼び名が復活しました。

今のSequelでは、1セルあたり100万のZMWから30万本~60万本のリードが出てきます。
平均10kbのリード長とすると(実際は平均12kbのときもあればそれ以上のときもありますが、少な目に見積もって10kbとした)、15万本~30万本のリードは10kb以上読めていることになる。
例えば1kbのライブラリを作りランするとしたら、10回以上同じインサートDNAを繰り返し読んで作られたCCSが、15万~30万本作られることになりますね。
10回以上繰り返し同じDNAを読めば、かなり精度が高いCCSが作られます。
実際の解析ではもちろんパス数でフィルタリングするよりも、QVでフィルタリングした方が良いでしょう。


ミトコンドリア配列中にあるシトクロムCオキシダーゼI(COI)遺伝子の配列は、さまざまな生物で配列に違いがある。
GC含量が15%~45%とバリエーションが広く、サンガー法ではホモポリマーなどが原因で読みにくい。
この配列を読むことで生物種多様性を研究しているひとたちがいる。

International Barcode Of Life という国際プロジェクトがある。
Dr. Paul Hebert, Director of the Biodiversity Institute at Guelph, Canadaは、今までサンガー法で行っていたCOI配列のDNAフィンガープリントを、Sequelでバーコードを使って読み、大幅なコストダウンを実現したという。
Hebert博士のプレゼンの様子はこちらから録画が見れます。
Dr. Hebertのプレゼンから
実際にはCOI遺伝子の658塩基の領域を増幅して、アシンメトリーのバーコードを付けて、Sequelで読んだ。
100種類のバーコード配列をアシンメトリーにヘアピンアダプターに付けるので、100x100種類で合計10,000種類の識別が可能になる。

10,000種類の識別が一度に可能ということで、1日に4セルランし、1週間で260,000種類のDNA検体を解析したとのこと。



実験の詳しい内容はここの論文に書かれています。
サンガー法と比べても、コストと手間の面でSequelが圧倒的に優れています
精度もサンガー法と引けをとりません。
もっとも、一度に10,000サンプルとか言われると、DNA検体を集める方が大変かもしれませんが。
Hebert博士らの論文(2018)
なお、ショートリードでは658bpを連続して読むことはできません。
MiSeqを使った250bpメイトペアシークエンスでも届かないでしょう
同じロングリードのオックスフォード・ナノポアはどうか?
残念ながらCCSのように同じライブラリを何度も読むことはできないので、サンガー法のような精度を達成することはできないでしょう。

ということでSequel(もちろんRSIIも)は、PCRアンプリコンをたくさん一度に精度を高く読むことのできる唯一のNGSと言えるでしょう!

2017年11月20日月曜日

PacBioとナノポア 違いはここだ! (2017年版)

2017年は、PacBioにとってのライバル、オックスフォード・ナノポアテクノロジーズ(以下ONT)がいよいよ本格的に市場に登場、ロングリード業界に新たな風が生まれました。
(正確には、2016年でもMinIONを購入することはできましたが、誰でも手軽に買えるようになったという意味では2017年が国内リリースの年といっても良いでしょう)

そこで聞くのが、PacBioより長いリードが出てくるとか、バクテリアアセンブリにはONTだけで十分とか、ロングリードはナノポアに席巻されるのでは?という、PacBioに否定的な意見。
一方、ナノポアのデータはまだ精度が悪い、超ロングリードはエラーだらけ、ノートPCではランはできるけど解析はできない、というONTに否定的な意見も。

どちらもロングリードを謳っているだけあって、目的がデノボアセンブリやゲノム構造変異解析、16S解析など、ガチでぶつかるのは当たり前です。
では2017年11月の現時点で、このふたつの製品はどこがどう違うのか?

注!:皆さんご存じ、私はPacBio側の人間なので、これから書くことは多少ともPacBioバイアスがかかっています。そこを承知の上、お進みくださいね。


さて、PacBioとONT、現時点でどこがどう違うのか?

【テクノロジーの違い】単純にいうと
  • PacBio:DNAポリメラーゼがDNAを合成するときに、取り込む塩基に付加されている蛍光を、レーザーによって1塩基ずつ検出する。1つのウェルからは1本の配列データしか出力されない
  • ONT:DNAがナノサイズの穴を通るときに生じるわずかな電位差を検出し、アルゴリズムが塩基配列に変換する。1つのポアから複数本の配列データが出力される
つまり、
  • PacBio:DNA合成を伴う、蛍光色素を使う。レーザー励起エネルギー検出
  • ONT:DNA合成は行わない、蛍光色素は使わない。電位差検出
皆さんご存じの方も多いと思います。

【リード長はどうか?】
  • 平均リード長:PacBioもONTも同じくらい (10kb~20kb)
  • 最大リード長:PacBioは読むライブラリのサイズ、ムービー時間などで制限されるので60kb~100kb程度ではないかと思う。数百kbのリードは見たことが無い。一方ONTは、ポアを通るDNAが長ければ、最大1Mbのリードも出るそうだ
  • しかしリードの本数や分布には注意が必要。PacBioもONTも、短い(とはいっても数キロbpはあるが)リードは多く出力され、長いリードほど出力数は少なくなる。先のONTの超ロングリードも、出力本数でいうと数本
  • 因みにランタイムはPacBioのSequelが30分~10時間、ONTのMinIONが1分~48時間、だそうで。
数値についてはこちらを参照(オフィシャルな情報です)

で、精度はどうか?
生リードとコンセンサスリードで精度の意味は違う。
ここを一緒にして、「ロングリードは精度が悪い」という研究者のなんと多いことか!!

【生リードの精度】
  • PacBio:RSIIのP6C4ケミストリーや今のSequelは、平均86%
  • ONT:精度の数字はケミストリーのバージョンによって様々のようだけど、R9.2は平均80%~85%くらいか(違ってたらゴメン)。でも使うベースコーラーによって精度は変わってくるそうです。ベースコーラーは何種類かある
つまり、どちらも生リードの精度はほぼ同じ、ということになる。しかしもっと重要な点は、エラーの入り方。
【エラーの入り方】
  • PacBioはランダム
  • ONTはランダムという話も聞くが、実は決まった場所に必ずエラーが入るというユーザーのポスターも見るので本当のところはわからない
【コンセンサス配列の精度】
  • PacBio:エラーがランダムに入るので20~30カバレッジでQV50(99.999%)も可能
  • ONT:ONTだけのデータでQV50を達成している結果は私は聞いたことが無い。たいていイルミナデータをエラー補正に使っているようである
とまあ、ここまで読んで、いやそんなことは無い!と思った方もいるでしょう。
あくまでバイアスがかかった私見ですので。
この辺の技術の数字は、すぐに変わる可能性があります。少なくともPacBioは、来年データ量が増える予定なので。この辺はONTとの競争ですよ

【ベースコール】

  • PacBio:装置から出てくるデータは既にベースコール済み
  • ONT:ベースコーラーが数種類あるのでユーザが適切なものを使用してベースコールをかける必要がある

【PacBioしかできない解析】
  • CCS:ライブラリを1分子DNAの単位で何度も繰り返し読むことができ、精度を上げることが可能。Iso-Seq(完全長cDNAを高い精度で読む解析)ができる
【ONTしかできない解析】
  • ダイレクトRNAシークエンス? 今どこまで現実的に使えるのか、知っているひといたら教えてください
【PacBioでもONTでもできる解析】
これはいつくかリストした後に考えてやっぱり消しました。というのは、「できる」という言葉の定義がひとによってさまざまだから。
バクテリアのゲノムアセンブリができる、と言っても、精度99.99%以上でできるというのと、ラフなドラフトでいいからできる、というのとでは全然違う。
HLAなどのロングアンプリコンシークエンスもそうです。求められる精度が6桁なのか8桁なのかで同じく「できる」というべきか。
あと、メチレーションや16SなどでもONTのデータを私は知らないのでできると言うのはやめました。
あと、意外と知られていないことですが、ノートPCにUSB挿してランができるMinIONも、データ解析には普通のサーバが必要です。

それでは技術以外の、それぞれの特徴を考えてみましょう!

【PacBioの特徴】

  • 装置型なのでシークエンスを行う環境が安定している
  • 実験プロトコルが用意されている
  • 解析パイプライン(マッパーやアセンブラ)がほぼ確立されている。これを使っておけば大丈夫的なツールがある
  • グローバルに数百台入っていて、国際プロジェクトにも正式採用されている(例えばG10K(脊椎動物のゲノムプロジェクト)ではPacBio、10XGenomics、Hi-Cのみが正式採用)ので信頼が高い
  • PacBioを使った研究の論文数、学会でのポスター数は圧倒的にONTのそれより多い(これは先行者だからかもしれません。来年が勝負の年かも)
【ONTの特徴】
  • MinIONはコンパクトで持ち運べる
  • 初期投資額が少なくて済む
  • 誰でもどこでもいつでもシークエンス、を謳っているが、「どこでも」シークエンスをするとデータにバラつきが出やしないか?(逆に、誰がどこでランしても一定のデータが出てくるなら凄い)
  • ユーザーコミュニティの中からプロトコルや解析ツールが作られる、ボトムアップなイメージ。NGSは昔からサードパーティのツールがユーザーから作られるものだが、ONTはよりその傾向が強いように感じる
  • バージョンアップのスピードが速い。PacBioもそこそこ速いけれどONTはもっと速いイメージ


と、つれづれなるままに書いてみましたが、いかがでしょうか?
結局はコストだと言われるかもしれませんが、シンプルにランニングコストで比較すればPacBioも負けていませんよ。アプリケーションによっては。

結論!
PacBioやONTのどちらも持っていない場合:

  • どうしても自分でランしたくて、ユーザーコミュニティでどんどん聞いて行くのが好きで、インフォマティクスにも強ければONT(ベースコールも何種類かあるのをお忘れなく)
  • 自分でランすることにはこだわらず、安定したデータを早く出したい、インフォを誰かに頼めるか自分でできれば、受託か共同研究でPacBio
  • 限られた予算を無駄なく効果的に使いたければ・・・ (答:     )

PacBioを持っている場合:
迷わずPacBio(笑) これ一本!

以上、2017年11月現在の私の意見でした。

2017年8月4日金曜日

PacBio 2017年後半戦が見通し明るいそのわけとは?

これを書いている今日は8月4日、昨日のPacBioの株価は前日比で14%も上昇しました。
こういう時は何かニュースがあったのでとりあえず本社のサイトやSNSをチェック!

アメリカ時間で8月2日に第二四半期の発表がありました。
CEO自らが投資家向けにプレゼンする場で、これは録音されて、翌日には誰でも聞くことができます。 一応、視聴するには登録が必要

数字については、私はその辺(アメリカ企業の経営に関する数字)は詳しく無いので評価できません。
でも、悲観的か楽観的かというと、明らかに楽観的な見通しでした。
このプレゼン時間の半分以上が投資家からの質疑応答になるのですが、厳しくは無かったです。

で、良いニュース(これが今回の株価14%UPにつながっているかは不明)はこちらです。

  • 装置の売り上げは顧客のバジェットタイミングによるので不安定だが、試薬売り上げはSequel台数が増えるにしたがって着実に増えている
  • 中国のNovogeneがSequelを10台追加で注文(これで20台購入!)するなど、中国の売り上げが堅調
  • Sequelの新ソフトウェア version 5 のアップデートが始まり、テストデータはとても良い
全世界でRSIIとSequelを合わせると、現在300台以上が導入されています。
この数字は5月のものなので、最新ではもっと行っているはず。
装置が増えればそれに伴い試薬の購入も増えるわけですが、この傾向はシークエンスラボで顕著だそうです。

どういうことかというと、一般のアカデミアは、プロジェクト単位でシークエンスが行われるので、プロジェクトが終わると一息つくことが多いですね。
日本以外でもこれは同じで、プロジェクトごとに予算が付く。そうすると、それが終わったとたんにシークエンスしなくなる。

ところが、営利企業やシークエンスコアラボでは、ひとつのプロジェクトに左右されないので通年シークエンスされるとのこと。
日本でもまあ、そんな感じでしょうか。年度末は忙しい、というバラつきは多少あるでしょうが。

中国のNovogeneという会社、これは世界最大のシークエンスラボのひとつです。
ここ2年くらいで、PacBioの最大の顧客になりました。
Sequelを10台保有し、さらにこの度もう10台の購入を決定! 世界一、Sequelを保有する機関になりました。
彼らがなんでこんなに(20台も)Sequelを買ったのかというと、ロングリードに積極的に投資しているからです。ちなみにここには政府系の投資会社もお金を出しているそうです。
Novogeneでは、中国人ゲノムを1000人分読み、構造変異を解析し、世界初の構造変異データベースを完成させる、という壮大な計画があります。
ここに、Sequelが使われるのです。
さらに、Novogeneはシークエンス受託解析企業なので、世界中から顧客を集め、世界一のシークエンス受託会社になることを目指しています。
そんなこんなで今、PacBioのRevenueの25%は中国から得ているそうです。

中国だけでなく、世界の営利企業は積極的にSequelに投資する傾向にあるそうです。

HistogeneticsというアメリカのHLAタイピング企業は、ショートリード数十台に加えてRSIIが動いています。もちろんSequelも。
これは、HLA遺伝子の完全シークエンス(ショートリードでどうしても型が判定できないような難しいローカスのシークエンス)のためにPacBioのロングリードが絶対必要だ!ということで、アグレッシブにRSII、Sequelが使われているそうです。


これらの発表がもしかすると、昨日の株価14%アップに影響したのかな?

PacBioは、先月Sequel用に、これは解析ソフトと装置のソフトの両方で新しいソフトウェアをリリースしました。
昨日のCEOのプレゼンでは、このソフトが順調に動いていて、ある顧客では平均リード長33kb、またある顧客では1セルあたりの出力が15Gbに達したと言っていました。
まあ、これは極端な例でしょう。
実際は、良くて平均12kb、N50 で20kb、塩基出力も良くて10Gb くらいかな、という感じです。
でも2017年の末には、わかりませんよ。

CEOははっきり言っていました。
2018年末までには、今の8倍のウェルを持ったセルが登場し、新試薬などで今よりスループットが30倍Upすると。

2017年2月10日金曜日

Oxford Nanopore Technologies (ONT) と PacBio のデータ比較論文

昨日は東京も2月の雪!
20代の前半をカナダの極寒で過ごしたので寒さには強いと思っていたんですが、やっぱり年取ったせいでしょうかねえ。寒いの嫌いです。

さてさて、
先日面白い論文(まだレビュー前)を見つけました。


トランスクリプトーム解析(ゲノムアセンブリではない)で、PacBioとONTのデータを比較した論文です。
オーサーのひとり Dr. Kin Fai Auは ISO-SEQの解析に詳しく、数年前からPacBioを使っています。ロングリードがアイソフォーム解析に有効だということはとても理解しています。

中立な立場で書かれた評価論文なので、どちらにも偏りの無い記述が目立ちます。

ロングリードの欠点は、精度が低い、ということだと彼らはいいます。
確かに、転写産物の1分子を読むには、数十回もカバレッジを重ねられないのである意味当たっています。

このブログを読んでいれば分かるかと思いますが、PacBioには、CCSという同じDNA分子を何度も読むことで精度を上げる方法があります。
1本の転写産物を、何度も繰り返し読んで精度を上げるのです。
また近年では、TofuというIso-Seqの解析アルゴリズムの中で、完全長cDNAを読んだ配列同士でクラスタリングを行い、1本の転写産物をCCSで読む以上にコンセンサス配列の精度を上げる方法も有ります。
ですが、この論文では、わかりやすい CCS で比較をしています。

一方の ONT は、同じDNA分子をポアに2回通す2Dという方法があり、精度は1回しか通さない 1D よりも高いです。1D は、PacBioでいう subread に対応します。
まずはこれがその比較

エラー率に注目!
  • PacBio の CCS : 1.72 %
  • 対するONT の 2D : 13.40 %
  • PacBio の subread : 14.20 %
  • 対するONT の 1D : 20.19 %
ONTの精度はもう少し高いと聞いていましたのでびっくりしました。
試薬バージョンによるのでしょうかね。
しかし、2Dが使われなくなるかも(PacBioから特許侵害訴訟を起こされているため)しれませんから、そうすると ONT としては 1D + ショートリード補正、というのが今後の使い方になるのでしょうか?

さて、論文の中に下のような文章があります。

"Results: PacBio shows overall better data quality, while ONT provides a higher yield. As with data quality, PacBio performs marginally better than ONT in most aspects for both long reads only and Hybrid-Seq strategies in transcriptome analysis."

なるほど。
いいんじゃないでしょうか。まだまだ勝ってる(笑)。

PacBioのエラー補正にショートリードを使わなくても良い、と個人的には思いますが、一方のONTをそうやって補正しているので、比較のために同じ条件でエラー補正したんでしょうかね。
PacBioとONTのエラーのパターンなんかも述べられていて、面白いです。
もちろん、転写産物解析にどちらのデータが使えるか、というのもちゃんと比較しています。

論文のリンク、忘れていました。
ここです。 





2017年1月13日金曜日

Sequel 新試薬登場でスループット向上!


もうアナウンスされましたが、PacBioのJPMネタは、「Sequelの試薬・ケミストリー・ソフトウェアのバージョンアップによってスループットがすごくUP!」です。

カタログもそれにあわせて改訂されました。ここからダウンロードできます。
6ページ目に注目!
これが今のSequelのスループットだ!!

これはあくまでゲノムアセンブリ用の長ーいライブラリ(例えば60kbとか)を読んだ場合です。サイズセレクションは30kbでしています(つまりライブラリは30kb以上の長さ)。
これを2.0ケミストリーで10時間(!)読んでいます。
セルあたりの出力リード数は365,000本で、うち半分のリードの長さは20kb以上。
この図では出力塩基数が 7.5 Gbです。バラツキはありますが5Gb ~8Gbというところでしょうか。

試薬のバージョンが2.0とか、ソフトウェアのバージョンが4.0とか、実際使っているユーザ以外にはどうでもいい数字だと思いますが、重要な点は、
  • 少ない量のライブラリからシークエンスできるようになった
  • 長ーいライブラリもローディングできるようになった
  • ラン時間が最大10時間までできるようになった
  • ベールコールアルゴリズムが改善された (精度がUp)
  • 短いライブラリでのシークエンス結果が改善された

という感じです。

ゲノムアセンブリにはできるだけ長ーいライブラリを作ることが重要です。
一方、構造解析などでは30kbとか40kbとかの長いものを作る必要はなく(もちろん目的によりますが)、10kb程度のライブラリでも十分解析できるのでは?というのが今のところのPacBio社内で一致した意見です。
ヒトゲノムのほとんどの構造変異は、Segmental Duplicationなどを除けば、だいたいは10kb程度に収まるのでは無いか?
もちろんお金とサンプルが潤沢にあれば、長いライブラリを作って読んだほうが、より多くのゲノム構造解析を検出できるでしょう。
でも現実的には、コストと検出感度・精度はトレードオフの関係にあります。
検体数にもよりますしね。
リードが長くなったおかげで、検出できる構造変異の数で見ると、新試薬の方が従来試薬の半分のコストで解析できるそうです。
コスト表を改訂しなきゃ。

2016年12月31日土曜日

今年最後は・・・Quiver と Arrowの話 我ながら地味

2016年、大晦日です。
紅白見ながら書いてます。PPAP、ゴジラ、真田丸、ブラタモリ。
今年は面白いな。

さて今年最後の投稿は、地味なネタです。
QuiverとArrowの違いであまり知られていないこと
GitHubのサイトでもあまり詳しくは説明されていないので、少しお話しします。

【はじめに】
QuiverとArrowは、どちらも、CCS(Circular Consensus Sequence)を作るアルゴリズムに由来します。
QuiverはRSIIのデータ用、ArrowはSequelのデータ用の、コンセンサス配列作製アルゴリズムです。
SMRT Analysis v2.3 まではQuiverが標準搭載されていて、v3.x からはArrowになりました。
v3.xは、SMRT Linkというパッケージソフトになったのですが、引き続きSMRT Analysisという名前も解析用ソフトとして使われています。
SMRT LinkでもP6-C4のRSIIのデータは解析できるよう、Arrowも対応されました。

【QuiverよりArrowの方が精度が高い】
CCSを作るとき、Quiverベースのアルゴリズムでは、何回パスを重ねても平均QVフレッドスコア30くらいで精度に限界がありました。
また、ホモポリマーもうまく認識できないという欠点もあったそうです。
これは様々なクオリティ値を使ったエラーモデルが複雑すぎて余計ノイズになったとか。
そこで開発されたのがArrowというアルゴリズム。
トレーニングモデルやエラーモデルをより単純にし、またZMWごとの違いを考慮するようにした。(2016年アジアユーザグループミーティングより)

Arrowを使ったCCSは、パスを増やすとQVをフレッドスコア50、60に高めることが可能になりました。
Old = Quiver, New = Arrow

【QuiverよりArrowの方が使っているQV値は少ない】
普通、シークエンサーから出力されるリードの塩基には、その塩基をその塩基であろうとしたクオリティ値(QV)があります。
つまりAである塩基をAとコールしたとき、Cではなく、Gでもなく、Tでもなく、Aであったという「確からしさ」を表現する方法として、QVがあります。

RSIIは、ベースコールの結果、各塩基ごとのQVのほかに詳細QV (DeletionQV, InsertionQV, SubstitutionQV, SubstitutionTag, DeletionTag)という複数のQVを出力し、Quiverはこれらの情報も利用してコンセンサス配列を補正します。

Sequelは、これら詳細QVは出力せず、各塩基ごとの全体のQV(QUAL/FASTQ qv)のみを出力します。
(実データを見たことがあるかたは、現在のSequelリード BAMファイルではQVの情報が全て「!」になっているのに驚くかもしれません。この問題は次バージョンで改善される予定です)
ですがArrowではそもそも、塩基ごとのQVを使用しません!

ではArrowは何のデータをもとにエラー補正&コンセンサス作製をするのでしょう?
Arrowは、

  1. 各リードのシグナルノイズ比
  2. 各塩基のパルス幅の情報

この2つを使用して、マッピング後のコンセンサス配列を補正して作ります。
これらの情報は今もリードBAMファイルに記載が有ります。

P6-C4のRSIIデータも、Arrowを使えます。
このときは、RSIIデータ(bax.h5)をSequelのBamファイルに変換し、リードごとのSN比と各塩基のパルス幅情報を使って、Arrowが使われます。
結局、補正に使うデータを単純にしたほうが精度が上がったということでしょう。

今後、Arrowで塩基ごとのQV(詳細QVではなく、全体のQV)が使われるようになるかは、現在のところ何ともいえません。
精度が向上するようであれば、使われるようになる可能性はあります。



ああー、もうすぐ2016年も終わります。
しかし笑ったのは、白組の方がダントツで票が入ったのに何故か赤組が勝った、というアメリカ大統領選挙よりも摩訶不思議な紅白歌合戦。
明日の新聞で説明あるかな?

また来年も宜しくお願いしまーす!
2月7日の「PacBioセミナー@秋葉原」も宜しく

2016年11月10日木曜日

10X Genomics のデータだけに頼ってはいけない理由

 10X Genomics (10XG)という会社をご存知ですか?
Synthetic Long Read、またの名をLinked Read と呼ばれるデータを出力し、Scaffoldを作ります。
Synthetic Long Readというのは訳すと、合成ロングリード?擬似的ロングリード?でしょうか。
でも、これは本当の意味でロングリードじゃない! という意見があったのか、最近は Linked Read、リンクしたリード?、という呼び方がされるようです。
http://www.10xgenomics.com/products/より

バンクーバーのASHGでも、ランチョンやその他のワークショップでも存在感を出していた10XGですが、この会社の対象マーケットは、大きく、1)デノボアセンブリ、2)シングルセル発現解析、の2つがメインだと言えます。
シングルセル発現解析のほうは既存の技術に比べて何十倍ものハイスループット解析ができる、といった優位性があると思います。
ですが、もうひとつのデノボアセンブリは、どうかなあ・・・
10XGに頼って解析を進めていると、大きな情報を見落としていることに気づかないことがあるでしょう。今日はそういう話。

ここから先は、PacBioのJasonさん(Falconなどの開発者)が解析してくれた結果。
彼はバイアスをかけない解析をしますので、私は、とても客観的なデータだと思います。


まず、NA19240サンプルを、PacBioでアセンブルした結果と、10XG v.1.3 でアセンブルした結果があります。
Contiguityを比較するのは大人気ない、というかそもそもContigとScaffoldを比較するのはあまり意味が無い。
そこで、アセンブルした後の結果の、構造変異を検出した場所(Segmental Duplication以外の場所で)を見てみます。


  • 10xGアセンブリ、PacBioアセンブリ共に、数千~1万強の、挿入、欠損部位を検出した
  • 10xGアセンブリの方が多くの欠損変異を検出し、5,573個は、PacBioアセンブリでは検出していなかった
  • 反対に、2,693個の欠損変異は、PacBioアセンブリでは検出され、10xGアセンブリでは検出されなかった


【欠損:10XGで検出されたがPacBioで検出されなかった5,573のうちの1例】
これは、10XGのアセンブリでは176bpの欠損を示していた箇所。
リファレンスには確かに176bpあり、PacBioのアセンブリでも、アセンブリ前の補正後リード(p-reads)でも、確かに176bpがあった例。
この箇所は、GCの連続配列で、10xGが使用しているショートリードでは読めない。
なので間違ってコールされてしまった例。

ほかランダムに抽出した9例

最初の1例を合わせた10例のうち、8例は擬陽性だった。

【欠損:PacBioアセンブリでは検出されたが、10xGでは検出されなかった2,693例のうちの1例】
この配列も、GCが多い場所で、10xGでは読めていない。しかし、この場所には、リファレンスには無い58塩基の欠損領域が、PacBioアセンブリから検出できている。
しかもそれは、ヘテロ欠損。
研究者なら、このようなヘテロな場所の変異に、より興味が湧くのでは深いのでは?

ほかにランダムに抽出した9例
先の1例を除き、全てで10xGのアセンブリでは、読めていない箇所に、実際は欠損変異が存在した。

ということで結論、
読めない配列が原因でコールされた変異は擬陽性の可能性が高い
読めない場所から変異をコールするのは不可能
10xGのデータだけに頼って解析していては、重要な変異を取りこぼすことになる

今回は欠損変異だけに注目しました。(スライドはJasonさん作)

どんな技術もそうですが、それだけに頼って解析していては、見落とすものは必ずあります。 なのでバリデーションは大事。
特に、比較的新しい技術に関しては、一見素晴らしいように見えても、欠点もちゃんと意識して使わないと、レビューワーから突っ込みを受けることになりますね。

10xGユーザの方は、上記のような擬陽性の可能性もあることを考えて、一度、PacBioで読んでバリデートしましょう!!

2016年8月16日火曜日

ハイブリッドアセンブリ 悩みどころとそのヒント

リオオリンピック、日本選手の活躍が目立っていますね。
ところで皆さんはどの競技が好きですか? 水泳?マラソン?陸上?

私はやっぱり陸上ですね。
ボルトの100mもすごかったですが、見入ってしまうのは普段あまり目にしない、ハンマー投げとか、円盤投げとか、3000m障害とかですよ。
投げ系は単純に飛距離を競うところがわかりやすいし、投げた後の雄たけびで、こっちも力が入る。
障害はもはや、何でもありでしょう。飛んだり跳ねたり、水辺に入ったり、誰がこんなルール作ったのか。
最初はみんな一緒にスタートするのに、途中で離されたり、転んだり、抜き返したり、ドラマがありますね。

さて、ドラマがあるといえば「ハイブリッドアセンブリ」
使うツールとデータ量のサジ加減で結果がずいぶん違ってくる=ドラマがある


ハイブリッドアセンブリとは、異なる技術のシークエンサーデータを組み合わせてアセンブルすることです。
7年前くらいは、ハイブリッドといえば、数十bpのイルミナリードと、数百bpの454リードを合わせてアセンブルする、ということを良く聞きました、が、
PacBioの登場で、ハイブリッドアセンブリは大きく2つの意味に分かれました
  1. PacBioロングリードを、イルミナショートリードでエラー補正してからアセンブリする(2012年ごろ登場したPacBioToCA, ECToolsでは主にこの意味)
  2. イルミナショートリードで作ったContigを、PacBioロングリードでScaffoldする(2013年ごろのPBJellyの登場からはこの意味も加わる)
厳密には、2はアセンブリというよりScaffoldingですが、これもハイブリッドアセンブリと呼ばれることが多いです。
ちなみに研究者のひとと話をするとき、どちらの意味でハイブリッドと呼んでいるのか、最初に確認するようにします。でないと、話がすれ違いになってしまう!

では、最近多い、2の意味でハイブリッドアセンブルするとして、どのデータをどれくらい用意して、どのツールでアセンブルしたら良いのでしょうね?

で、ちょうど良い論文があります!




この論文は、PacBioリードのアセンブリ戦略をこれから検討するかたに、いくつかヒントを与えてくれます。
彼らはショウジョウバエのゲノムをサンプルにして、PacBioとイルミナのシークエンスをおのおのどの程度(ゲノムカバレッジ)読んで、どのツールで解析すれば良い結果(ContiguityやCompleteness)を得られるか調べています。

ハイブリッドアセンブリの方は、いろいろ試した結果、DBG2OLCを採用。
Platanusを使って67.4xのイルミナデータ(DPGPプロジェクトデータを拝借)をアセンブリし、そのContigとPacBioロングリード(様々なカバレッジ量)をハイブリッドアセンブリするパイプライン。

比較としてPacBioのみのアセンブリは、PBcRを採用(注:いまはCanuというツールになっています)

ま、詳しくは論文を参照して頂くとして、ネタばれします。(先入観持たずに論文読みたいひとはここから先は読まないで)

---------------------------------------------------------------------------

M&Mの最初に、ショウジョウバエのゲノムを抽出して、サイズセレクションして・・・って書いてあるけど、シークエンスしたデータはこのアセンブル解析には使っていない、ってはっきり書いてある! え?
全ての解析データはpublicly availableのものだって!?
ま、それはみんなが試せるから良いとして、ここはスルー

NG50のグラフ(論文中Fig 5)を見ると、PacBioリード40x、53xまでは、ハイブリッドアセンブリの結果の方がNG50が長い(下のほうの3本はハイブリッド、真ん中の青はPacオンリー、一番上の赤線は両方のマージ)
でもその上、62x、77x、99x、121xのPacBioリードでアセンブリすると、NG50は一気に長くなる!

Chakraborty et al. Fig 5

だからPacデータを使うなら、Pacオンリーデータでアセンブリしたほうが良い!

と、言ってもやっぱりハイブリッドは、需要があるわけです。
理由はコストとサンプル量の制限です。

ほぼ無制限に予算があって、ほぼ無制限にDNAが取れれば、Pacだけでアセンブリしたほうが良いに決まってますが、普通そうはいかない。
この論文でも言っていますが、PacBioを30x程度と、イルミナを70x程度用意できれば、そこそこリーズナブルな結果は得られるでしょう。
この論文の例では、Pacデータ30xと、イルミナデータ70xのハイブリッドの結果のNG50は、Pacオンリーの50xアセンブリのときより長かった、そうです。
もちろんゲノムの複雑さによっては、Pacデータは30xでは足りない、なんてこともあるでしょうが、最初のステップとして、30xはお勧めできます(10xは少ないだろうなあ)。

最後に、必要DNAですが、これは結構盲点かもしれませんね。
マイクログラムオーダーのゲノムDNAを用意して、ようやく数個のSMRT Cellを流せるのですから。必要カバレッジのデータ量を得るために、どれくらいのゲノムDNAを抽出する必要があるのか、これを逆算したら結構な量になるかもしれません。
抽出できるDNA量から、カバレッジの限界を計算して、ハイブリッドを選択するケースもあると思います。

2013年4月5日金曜日

BioTechniques の記事から

春ですね。
新学期開始かな? 早稲田大学の近くを通ったら、サークル勧誘のブースが見えました。
地下鉄にも、社会人一年生らしきスーツ姿がちらほら。
 
今日はBioTechniques の記事「Going to Great Read Lengths」を紹介します。
原文はこちら

 

NGSの登場は、シークエンスのコストを格段に下げました。 
1000ドルゲノムも夢ではない! と言われてから数年、それが現実にならないのは、NGSが、コストと引き換えにリード長を犠牲にしているからです。
(ヒトゲノム3Gと同じ量の塩基を仮に数千ドルで出せても、情報量ではサンガーで数十億ドルかけて読んだ20年前に負けるのです。 と言うと言い過ぎかな?)

アカゲザルのゲノム、はNGSで読まれたそうですが、ゲノム全体の20%もギャップがあるそうです。
リード長が数百bpではそれ以上のリピートは読めない。 
実際にアカゲザルゲノムではそれだけたくさんのリピート、ショートでは読めない領域があるということでしょうか。

自然の流れで、長い配列を読む必然性が出てくるのですが、こちらもいくつか方法が分かれます。
DNAをそのまま、連続して長く読むPacBioのような方法。
DNAを長いまま別々に維持し、その長いDNAをショートで読むけれども後でどのDNA由来だったのかをわかるようにしておいて、アセンブルすることで元の長いDNAを再現する、Moleculoのような方法。
いずれも、長く読むニーズがあるからこそ、注目されているのでしょう。


さて、この記事で2つのツールが紹介されています。
1つは、ショートリードで読んで作ったContig、SuperContigの中のギャップを、PacBioのロングリードでクローズする、PB-Jellyというツール
もう一つは、東大の浜田先生らによる、PacBioデータのシュミレーションツール、PBSIM
浜田先生とは何度か会って話す機会がありましたが、PacBioの精度は世間で思われているより悪くない、そうです。 私が言うより説得力があると思います。

PB‐Jellyは、私もギャップクローズに用いています。 
大型ゲノムのScaffoldの、ギャップクローズ用のツールとしては、今はこれが一番良いような気がします。
PacBioの二次解析ソフトウェアの一部、BLASRとAlloraを使います。  
ちょっとそれなりに時間がかかるかなあ、という感じ。
論文ではサルやセキセイインコ(1.3Gb)レベルのゲノムに挑戦していました。


PB‐Jelly
English, A.C., S. Richards, Y. Han, M. Wang, V. Vee, J. Qu, X. Qin, D.M. Muzny, J.G. Reid, K.C. Worley, and R.A. Gibbs. 2012. Mind the gap: upgrading genomes with Pacific Biosciences RS long-read sequencing technology. PLoS One 7(11):e47768. doi: 10.1371/journal.pone.0047768.

PBSIM
Ono, Y., K. Asai, and M. Hamada. 2013. PBSIM: PacBio reads simulator--toward accurate genome assembly. Bioinformatics 29(1):119-21. doi: 10.1093/bioinformatics/bts649.

2013年3月15日金曜日

もうショートリードはいらない?

私の話し方が、松岡修造に似ているそうです。(良い意味で?)
ある方から言われて、何人かに「そう?似てる?」って聞いたら「うん!」という答えが。
喜んでいいのかなあ・・・。 少し複雑。
暑苦しいプレゼンは嫌だ。


まあ、それはそれとして、タイトルに「もうショートリードはいらない?」
と書きましたが、バクテリアサイズのゲノムアセンブリには、いらないかも? という意味です。

昨年(2012年)は、ロングリードの精度を上げるためのエラーコレクションという手法(pacBioToCAとLCS)が少し流行りました。このブログでも何度か取り上げたので、ご存知のかたも多いと思います。 

昨年後半くらいから、ショートリードを使わずにエラーコレクションをする方法がいろいろ開発されて、PacBioではHGApという手法が作られました。
Hierarchical Genome Assembly processing の略で、開発したのは元A社のJason Chin。

Pacのリード(サブリード)は、長さと数をプロットすると、このような感じになります。形に注目!

これはセル1個ではないので、リードの本数は気にしないでください。 1個でも8個でも、リードの長さの分布はこのような形になります。
長いリードはあまり多くないですね。
でも、アセンブリに有利なのは長いリードです。
そこで、超長いリード(例えば6kb以上)だけをアセンブリに使用し、それ以下の長さのリードは、超ロングリードのエラー補正に使おう、というのがHGApの考え方です。

超ロングリード(Seedリード)に対し、それ以下の長さのリードをマッピングして、多数決のような感じでコンセンサスを作ります。 
そうすると結果的に精度が向上した超ロングリードができる(Seedを6kbにしたときは精度の高い6kbができる)わけです。
知っての通り、シングルリードの精度は約85%、それがHGApのあとは、QV45以上になる超ロングリードも得られるのです。
このような、QV45の6kb超リードを20x~30xくらい得て、Celera Assembler等でアセンブリすれば、数MbサイズのバクテリアゲノムであればPacのみでFinishできる!
というわけです。

実際はリピートの存在などにより、完全に1本になるとは限りませんが、他のどのテクノロジーよりもコスパが良い、と言えると思います。

さて、今月フロリダで行われたAGBTで、PacBioのCSO、Korlach氏の講演がとても良かったので、紹介しようと思います。

動画はこちらから見れますので、是非どうぞ。
前半はHGApの話、後半でその素晴らしい応用例が出てきます。

私が一番いいなと思ったのは、百日咳菌のゲノムアセンブリのところ。
百日咳の原因となるBordetella pertussisのゲノムは、今年(2013年)の初めまでに2株読まれていました。
2003年にサンガー研で行われた、130,000以上のサンガーリードをアセンブリした例(Parkhil et al, Nature Genetics 35: 32-40)と、2011年に33万本の454リードと1万本以上のサンガーリードでアセンブリした例(Zhang et al, J Bacteriology 193: 4017-4018)だけです。ちなみにゲノムサイズは4Mb程です。
どちらも一大プロジェクトです。

PacBioでは、オランダのグループとの協力で、このほか9つの株を1週間足らずで読んでしまいました。 
1株あたり使用したSMRT Cellの数は4個から8個、アセンブラーはHGAP+CAのパイプラインです。
実際は1台のシークエンサーだと、ライブラリ作成に2日、8個Cellのランに1日、解析に1日、というのが現実的でしょう。
ライブラリ作成を同時にすれば時間短縮はできるでしょうね。

この菌は、リピートやゲノムの複雑さで知られており、実際に読んだゲノムから複雑な構造変異があることもわかりました。

他の菌でも、例えば新規Plasmidを発見したり、遺伝子の新規Horizontal Transferを検出したり、と、昨年から次々と結果を出しています。
そのうち論文になることでしょう。

論文といえば、HGApについても近々Publishされると思います。
私も数Mbサイズのゲノムアセンブリには、まず、これを使います。
やろうと思えば数十Mbサイズまでいけます。
Pacによると、将来的には高等生物ゲノムでもできるようにしたいとのことです。

それにはスループットが・・・という声が聞こえてきそうですが、ご安心ください。
スループットは向上します。
光学系と、サイズセレクション(サンプル調整時)と、酵素と、蛍光
この4つが今年のキーになるでしょう。

2012年12月15日土曜日

カバレージで精度が上がることを確率で証明(?)

分子生物学会も終わり、今年も残すところあとわずかになりましたね。
年末といえばジャンボ宝くじ! 宝くじといえば当選確率、ということで、無理やりですが今日は確率の話です。


PacBioのリードには、エラーがランダムに入ります。
その割合は前にも書きましたが13~15%くらい。 
ということでリード1本あたりの精度がおよそ85%、というふうになるわけです。

で、この精度を上げるために、カバレージを増やします。
この図は、カタログなどにも載せてますが、これは実測値だそうです。
でも精度85%のリードを重ねただけで、そんなに正確性が上がるのはなぜ?
という疑問を持たれる方もいるかもしれませんね。
高校の確率・統計で苦しんだ私がご説明致します。

話を単純にするために、正しい塩基を多数決で決めることとします。
また、PacBioのエラー率は実際より少し高めの、16.7%とします。

つまり、16.7% = 1/6 の確率でランダムに間違える。
リードが1本の場合、間違える確率は1/6 です。 ここまではOK?

次にリードが2本の場合、
1本が間違える確率 P(1 of 2) + 2本とも間違える確率 P(2 of 2) が、間違える確率です。
ちょっと格好良く言うと、1/6の確率で起こる事象があり、それを2回試したとき、1回以上起こる確率です。
サイコロを2回振って、1が1回以上出る確率と同じですね。

リードが3本の場合、
2本が間違える確率 P(2 of 3) +3本とも間違える確率 P(3 of 3) が、間違える確率です。
同じく格好良く言うと、1/6の確率で起こる事象があり、それを3回試したとき、2回以上起こる確率です。
サイコロを3回振って、1が2回以上出る確率と同じです。

絵にするとこんな感じで、上から1本のとき、2本のとき、3本のとき、の「間違い」リードの組み合わせです。間違いリードは×印です。

さて、ではリード4本のとき、
2本が間違える確率 P(2 of 4) + 3本が間違える確率 P(3 of 4) + 4本とも間違える確率 P(4 of 4)
=>1/6の確率で起こる事象があり、それを4回試したとき、2回以上起こる確率
(サイコロを4回振って1が2回以上出る確率)
リード5本のときは?
3本が間違える確率 P(3 of 5) + 4本が間違える確率 P(4 of 5) + 5本とも間違える確率 P(5 of 5)
=>1/6の確率で起こる事象があり、それを5回試したとき、3回以上起こる確率
(サイコロを5回振って1が3回以上出る確率)

さてさて、これらの確率を実際に計算してみましょう!
1回の試行で特定の事象が起きる確率がpのとき、n回の試行で特定の事象がm回起きる確率Pは、
 
です。 これ、関数電卓なら頑張れば計算できますけど、今は便利なサイトがあるもので、
こちら、その名もke!san http://keisan.casio.jp/#menu

ホーム/ 計算応用集/ 確率・統計/ サイコロの目の出る確率 で、上の式の計算が簡単にできます。

そうすると、先ほどのリードの場合は以下のような数字になります。
ここまで 0.167 -> 0.306 -> 0.074 -> 0.132 -> 0.035 というふうに間違い確率「エラー率」は上がり下がりしながら全体としては下がってきました。
これを、n - > 50 までやってみるとどうなるか?
11カバレージでQV23、19カバレージでQV34、30カバレージでQV46、40カバレージでQV59
このグラフ、上がったり下がったりしながらも、0に近似されていく、・・・ 美的ですね。
 
これを、1000bpのシュミレーションデータで検証した方がおります。
Sergey Koren et al., “Hybrid error correction and de novo assembly of single-molecule sequencing reads” Nature Biotechnology  (2012)
 
先のグラフと非常に似ていますね。
 
エラーが「ランダムに起こる」ということがこの大前提にあります。
ランダムであれば、リードを重ねれば全体としてのエラー率は確実に下がっていくのです。
どうでしょうか?
85%精度のリードでも、重ねると100%に近くなる、というのは本当なんですよ。

と、今日はデータの精度を、確率論で説明を試みました。
数学者からはツッコミが入りそうですけれど。
どうでしょうね。


2012年10月21日日曜日

LSC Long-Readのエラーコレクション

秋は学会・展示会シーズンですね。 
私は10月10日のBioJapan、10月15日のCBI、に行きました。 
来週の日本遺伝学会は残念ながら行けないのですが、来月サンフランシスコで行われるアメリカ人類遺伝学会には行く予定です。
今から楽しみです!

10月10日のBioJapanでは、前回のブログでも書きましたが、沖縄県のセミナーでPacBioの発表がありました。
そこでちょっとサプライズゲストとして、PacBioの創始者で現CTO、Steve Turner氏の挨拶を頂きました。
その場にいたひとは聞いたと思いますが、PacBioはこれからも進化します。 
リード長ももっと長くなります。
新酵素の開発、新ケミストリーの開発、Movie開始時期の改良、ソフトウェアの改良・・・。

そこで良く聞かれるのが、「リードは長くなっても、精度は低いままじゃあちょっと・・・」という声。

リード単位の精度はもっと上がるのか? 
リファレンスにアラインしたとき、塩基がリファレンスと異なる(InDelも含め)率が約15%
これが劇的に改善されるか?
本音はというと、ちょっと・・・

そこで、バイオインフォマティクスでエラー率を低くする方法がたくさん開発されているのです。

7月5日のブログにも書きましたが、エラーコレクションといえば、Nature Biotecで発表されたpacBioToCA が有名?でしょうか。 最近のセミナーでも、さかんにこれを使った発表がされています。

そんな中、先週別のアルゴリズムが論文化されました。 これはRNA-Seq用にも適したエラーコレクションアルゴリズムだそうです。

Au et al.,  Improving PacBio Long Read Accuracy by Short Read Alignment
PLoS One 7(10), e46679.

Homopolymer Compression という方法で例えば、GCGAAAATA => GCGATA
に情報を圧縮します。 Pylosequencerなどでのエラーコレクションに使われる手法で、これをPacBioにも応用しています。
情報量は意外と失われないそうで、私も近いうち試してみたくなりました。
 

pacBioToCAと同様、ショートリードでPacのロングリードを「修正」するアルゴリズムですが、Mammalianのトランスクリプトーム用に開発されただけあって、メモリー消費やラン時間に工夫がされているようです。 pacBioToCAは処理時間が長い、LSCよりメモリを食う、と。
LSCというのがこのアルゴリズムの名前です。

軽いなら是非試してみたい!
ツールも公開されていますので。
そのうちこのツールを使用した発表も、学会などで多く見られるようになるでしょう。

そういえば今年の7月くらいにPacBio本社で、cDNA解析のPacでの可能性についてディスカッションをしたとき、マッピングの方法と合わせて、エラーコレクションの話をしたことを思い出しました。 
ちなみにPac社内では、「error correcton」という言葉を嫌うひともいます。
correction = 修正です。 修正するってことは、もとが間違っているということ。 なるほど。
ですので、私は気を利かせて「improve accuracy = 精度の向上」と言うようにしています。
ま、単なる言葉ですけど。

ショートリードでロングリードを「修正」する方法は目新しくなくなりましたが、「修正」すること無しにAccuracyを良くする方法も出てきています。
それがQuiverというツールです。 
これに関してはまた今度。

最後に、精度には2つの意味があります。
リード単位の精度とマッピング精度です!

リード単位の精度ではショートリードの方がずっと良い。 これは認める。 
では、リファレンスやゲノムにマッピングさせたときの、真の場所に正しくマッピングされるという意味での精度は、どうか?
Yes! ロングリードであればある程、良い、でしょう。

本当はリード一本で精度がphred 40 以上くらいあって、かつ数十キロ以上読めれば(+低コストで)、向かうところ敵無しなんでしょうが。
まだ無理かなあ。

2012年1月20日金曜日

PacBio の精度 (2) 出力リード数

前回、リードの精度が85%くらい、と書きましたが、もう少し正確には、「ポリメラーゼによって合成される1本のリードに含まれる塩基が、平均して85%は正しく読まれる」 ということです。

精度と間違われえやすいのが、出力されるリード数です。
1 SMRT Cellあたり、何本のリードが出力されるか、ですが、2kbくらいの長さのライブラリの場合、理想的には35,000本以上です。

1つのSMRT Cellには、15万個のZMW(zero mode waveguides)があり、その15万個の穴の中でポリメラーゼによるDNA合成が行われます。


もちろん15万個のすべてのZMWで合成が行われるわけではなく、次の3つの場合に分かれます。

0.  空(から)のZMW:合成は行われない
1.  1つのポリメラーゼ+テンプレートの入ったZMW:正しく合成が行われる
2.  それ以外:こちらはノイズになるので検出対象にならない

確率的には1/3の割合(厳密にはポアソン分布)で、正しく合成が行われる状態のZMWができるわけです。

35,000本のリード数は23.3% (35,000/150,000)
実際には30% を超えれば非常に良いとし、20-30%はAcceptableであるとしています。
10%台はちょっと低いです。

ちなみにこの出力リードの数は、ライブラリーの大きさに依存します。
ライブラリーが例えば6kbや10kbなどと長い場合、できるだけ長く読むにはムービー時間を長く設定しなくてはなりません。
現在は、45分を超えるムービーを撮影する場合、SMRT Cellに含まれる15万のZMWの、半分の75,000 ZMWしか読まれません。
したがって、75,000の30%で正しく合成が行われるとすると22,000本、20%では15,000本が読まれる計算になります。

このあたりの計算は、実験計画を組む際に必要でしょう。 

長く読もうとすると、それだけ出力されるリード数を犠牲にしなければいけないのです。

2012年1月17日火曜日

PacBioの精度 (1)

PacBioのデータの精度と聞いて、皆さんどんな印象を持っているでしょうか?
一分子で読むことのインパクトや原理のことは注目されますが、研究者にとってはやはりデータの精度がどれくらいのものなのか、が重要な基準でしょう。

前から(私が聞くところでは2年くらい前から)言われていたことで、データの精度は70-80%くらいだ、というのがあります。
これは、額面通りに受け取ってしまうと、つまり他の次世代シーケンサーと比較してしまうと、とても効率の悪いシステムに聞こえてしまいそうです。

しかし、これはPacBioの1本あたりのリードの精度です。
ちなみに85%というのが最近の値です。 8割以上、塩基を正しく読んでいます。

でも、インサート配列が数百塩基の場合、同じインサート配列を何度も読むことによって、この精度を限りなく100%に近づけることができます。 「何度も」というのは5回くらいで、結果99%に近づくそうです(λファージを読んだときの結果です)。 

同じインサートを何度も読むことを可能にしているのが、ダンベル型のライブラリーです。
数字は無視してください。
左のアダプターにくっついているのがポリメラーゼですが、これが2本鎖DNAを何度も読むことができることが、明らかでしょう。
センス鎖とアンチセンス鎖が何度も読まれるわけです。
これを、Circular Consensus と呼びます。


一方、できるだけ長く読みたい、そんな場合は15%の読み取り間違いも許しましょう。
PacBioの特徴は、最大6kbのリードを出すことができる超ロングリードにあります。
(この数字は近い将来更新されます)
その場合の読み取りエラーは、別のショートリードシーケンサー、例えばHiSeqなどで補うことができると思います。

ということで、読み取り精度が低い、というのは
  • 1分子インサートをたった1回しか読まない場合で、
  • インサートが短ければ何回も繰り返し読めるので精度を限りなく100%に近づけることが可能
です。

この絵は、以前のExpression Analysis社のWeb セミナーの絵ですが、真ん中がCircular Consensus、何度も同じ配列を読むパターンです。 アダプターを除いた後の配列を重ねれば、その場所の精度が上がるわけです。

一番上が6kbのインサートを読むケースです。 一本しかありませんが超ロングリードです。
一番下のStrobeは今は無視して下さい。

以前Roche454のユーザから聞いたことがあるのですが、長いリードは長いということに大変価値があるので、読み取りのエラーはショートリードで補う方が良いとのことです。
Pacの価値も超ロングリードということにあるので、同様な使われ方をされるのではないかと、信じています。