ラベル リシークエンス の投稿を表示しています。 すべての投稿を表示
ラベル リシークエンス の投稿を表示しています。 すべての投稿を表示

2018年4月4日水曜日

PacBio現場の会 2018 登録スタート!

5月18日は、年に一度の現場の会、といっても「PacBio現場の会」です。
今年はもうNGS現場の会が無いので、復活しました、この名前!
場所は秋葉原UDX Next1

ロングリードを愛する全てのひとへ心を込めて

あえてロングリードとしたのは、今やPacBio以外でもOxford Nanoporeのシークエンサーで読んでいる研究者も多いだろうと思うからです。
もしあなたが、MinIONデータで何かを読んでいるとしても、私たちは拒みません。
PacBioがいまだにロングリード市場でメジャーなシークエンサーだということは、紛れもない事実なのですから。

前置きが長くなりましたが、登録サイトがスタートしたのでこちらからどうぞ!
英語名がPacBio User Group Meetingとなっているのは各国で統一感を出すための便宜的な名前なのでユーザーでなくとも参加できますよ



顔写真入りの紹介って、案外良いですねぇ
最新のプログラム、時間割りは「最新プログラムはこちらから」のリンクからダウンロードできます。
まだ変更が入るかもしれませんがご了承下さい。

5月18日ですよー
アキバですよー
時間は1時から開始で、情報交換会もあります 
結構びっちり、勉強になると思います

奮ってご参加下さい ここから

2018年3月31日土曜日

CCSは精度では全てのNGSに勝る。コストではサンガーに勝る。カナダの生物種同定プロジェクトの例


これは私がずーーーっと前にこのブログで説明したCCS(Circular Consensus Sequence)についての絵です。
一時期、CCSのことをROI(Reads Of Insert)と呼んでいたこともありましたが、わかりにくいということでCCSの呼び名が復活しました。

今のSequelでは、1セルあたり100万のZMWから30万本~60万本のリードが出てきます。
平均10kbのリード長とすると(実際は平均12kbのときもあればそれ以上のときもありますが、少な目に見積もって10kbとした)、15万本~30万本のリードは10kb以上読めていることになる。
例えば1kbのライブラリを作りランするとしたら、10回以上同じインサートDNAを繰り返し読んで作られたCCSが、15万~30万本作られることになりますね。
10回以上繰り返し同じDNAを読めば、かなり精度が高いCCSが作られます。
実際の解析ではもちろんパス数でフィルタリングするよりも、QVでフィルタリングした方が良いでしょう。


ミトコンドリア配列中にあるシトクロムCオキシダーゼI(COI)遺伝子の配列は、さまざまな生物で配列に違いがある。
GC含量が15%~45%とバリエーションが広く、サンガー法ではホモポリマーなどが原因で読みにくい。
この配列を読むことで生物種多様性を研究しているひとたちがいる。

International Barcode Of Life という国際プロジェクトがある。
Dr. Paul Hebert, Director of the Biodiversity Institute at Guelph, Canadaは、今までサンガー法で行っていたCOI配列のDNAフィンガープリントを、Sequelでバーコードを使って読み、大幅なコストダウンを実現したという。
Hebert博士のプレゼンの様子はこちらから録画が見れます。
Dr. Hebertのプレゼンから
実際にはCOI遺伝子の658塩基の領域を増幅して、アシンメトリーのバーコードを付けて、Sequelで読んだ。
100種類のバーコード配列をアシンメトリーにヘアピンアダプターに付けるので、100x100種類で合計10,000種類の識別が可能になる。

10,000種類の識別が一度に可能ということで、1日に4セルランし、1週間で260,000種類のDNA検体を解析したとのこと。



実験の詳しい内容はここの論文に書かれています。
サンガー法と比べても、コストと手間の面でSequelが圧倒的に優れています
精度もサンガー法と引けをとりません。
もっとも、一度に10,000サンプルとか言われると、DNA検体を集める方が大変かもしれませんが。
Hebert博士らの論文(2018)
なお、ショートリードでは658bpを連続して読むことはできません。
MiSeqを使った250bpメイトペアシークエンスでも届かないでしょう
同じロングリードのオックスフォード・ナノポアはどうか?
残念ながらCCSのように同じライブラリを何度も読むことはできないので、サンガー法のような精度を達成することはできないでしょう。

ということでSequel(もちろんRSIIも)は、PCRアンプリコンをたくさん一度に精度を高く読むことのできる唯一のNGSと言えるでしょう!

2017年11月20日月曜日

PacBioとナノポア 違いはここだ! (2017年版)

2017年は、PacBioにとってのライバル、オックスフォード・ナノポアテクノロジーズ(以下ONT)がいよいよ本格的に市場に登場、ロングリード業界に新たな風が生まれました。
(正確には、2016年でもMinIONを購入することはできましたが、誰でも手軽に買えるようになったという意味では2017年が国内リリースの年といっても良いでしょう)

そこで聞くのが、PacBioより長いリードが出てくるとか、バクテリアアセンブリにはONTだけで十分とか、ロングリードはナノポアに席巻されるのでは?という、PacBioに否定的な意見。
一方、ナノポアのデータはまだ精度が悪い、超ロングリードはエラーだらけ、ノートPCではランはできるけど解析はできない、というONTに否定的な意見も。

どちらもロングリードを謳っているだけあって、目的がデノボアセンブリやゲノム構造変異解析、16S解析など、ガチでぶつかるのは当たり前です。
では2017年11月の現時点で、このふたつの製品はどこがどう違うのか?

注!:皆さんご存じ、私はPacBio側の人間なので、これから書くことは多少ともPacBioバイアスがかかっています。そこを承知の上、お進みくださいね。


さて、PacBioとONT、現時点でどこがどう違うのか?

【テクノロジーの違い】単純にいうと
  • PacBio:DNAポリメラーゼがDNAを合成するときに、取り込む塩基に付加されている蛍光を、レーザーによって1塩基ずつ検出する。1つのウェルからは1本の配列データしか出力されない
  • ONT:DNAがナノサイズの穴を通るときに生じるわずかな電位差を検出し、アルゴリズムが塩基配列に変換する。1つのポアから複数本の配列データが出力される
つまり、
  • PacBio:DNA合成を伴う、蛍光色素を使う。レーザー励起エネルギー検出
  • ONT:DNA合成は行わない、蛍光色素は使わない。電位差検出
皆さんご存じの方も多いと思います。

【リード長はどうか?】
  • 平均リード長:PacBioもONTも同じくらい (10kb~20kb)
  • 最大リード長:PacBioは読むライブラリのサイズ、ムービー時間などで制限されるので60kb~100kb程度ではないかと思う。数百kbのリードは見たことが無い。一方ONTは、ポアを通るDNAが長ければ、最大1Mbのリードも出るそうだ
  • しかしリードの本数や分布には注意が必要。PacBioもONTも、短い(とはいっても数キロbpはあるが)リードは多く出力され、長いリードほど出力数は少なくなる。先のONTの超ロングリードも、出力本数でいうと数本
  • 因みにランタイムはPacBioのSequelが30分~10時間、ONTのMinIONが1分~48時間、だそうで。
数値についてはこちらを参照(オフィシャルな情報です)

で、精度はどうか?
生リードとコンセンサスリードで精度の意味は違う。
ここを一緒にして、「ロングリードは精度が悪い」という研究者のなんと多いことか!!

【生リードの精度】
  • PacBio:RSIIのP6C4ケミストリーや今のSequelは、平均86%
  • ONT:精度の数字はケミストリーのバージョンによって様々のようだけど、R9.2は平均80%~85%くらいか(違ってたらゴメン)。でも使うベースコーラーによって精度は変わってくるそうです。ベースコーラーは何種類かある
つまり、どちらも生リードの精度はほぼ同じ、ということになる。しかしもっと重要な点は、エラーの入り方。
【エラーの入り方】
  • PacBioはランダム
  • ONTはランダムという話も聞くが、実は決まった場所に必ずエラーが入るというユーザーのポスターも見るので本当のところはわからない
【コンセンサス配列の精度】
  • PacBio:エラーがランダムに入るので20~30カバレッジでQV50(99.999%)も可能
  • ONT:ONTだけのデータでQV50を達成している結果は私は聞いたことが無い。たいていイルミナデータをエラー補正に使っているようである
とまあ、ここまで読んで、いやそんなことは無い!と思った方もいるでしょう。
あくまでバイアスがかかった私見ですので。
この辺の技術の数字は、すぐに変わる可能性があります。少なくともPacBioは、来年データ量が増える予定なので。この辺はONTとの競争ですよ

【ベースコール】

  • PacBio:装置から出てくるデータは既にベースコール済み
  • ONT:ベースコーラーが数種類あるのでユーザが適切なものを使用してベースコールをかける必要がある

【PacBioしかできない解析】
  • CCS:ライブラリを1分子DNAの単位で何度も繰り返し読むことができ、精度を上げることが可能。Iso-Seq(完全長cDNAを高い精度で読む解析)ができる
【ONTしかできない解析】
  • ダイレクトRNAシークエンス? 今どこまで現実的に使えるのか、知っているひといたら教えてください
【PacBioでもONTでもできる解析】
これはいつくかリストした後に考えてやっぱり消しました。というのは、「できる」という言葉の定義がひとによってさまざまだから。
バクテリアのゲノムアセンブリができる、と言っても、精度99.99%以上でできるというのと、ラフなドラフトでいいからできる、というのとでは全然違う。
HLAなどのロングアンプリコンシークエンスもそうです。求められる精度が6桁なのか8桁なのかで同じく「できる」というべきか。
あと、メチレーションや16SなどでもONTのデータを私は知らないのでできると言うのはやめました。
あと、意外と知られていないことですが、ノートPCにUSB挿してランができるMinIONも、データ解析には普通のサーバが必要です。

それでは技術以外の、それぞれの特徴を考えてみましょう!

【PacBioの特徴】

  • 装置型なのでシークエンスを行う環境が安定している
  • 実験プロトコルが用意されている
  • 解析パイプライン(マッパーやアセンブラ)がほぼ確立されている。これを使っておけば大丈夫的なツールがある
  • グローバルに数百台入っていて、国際プロジェクトにも正式採用されている(例えばG10K(脊椎動物のゲノムプロジェクト)ではPacBio、10XGenomics、Hi-Cのみが正式採用)ので信頼が高い
  • PacBioを使った研究の論文数、学会でのポスター数は圧倒的にONTのそれより多い(これは先行者だからかもしれません。来年が勝負の年かも)
【ONTの特徴】
  • MinIONはコンパクトで持ち運べる
  • 初期投資額が少なくて済む
  • 誰でもどこでもいつでもシークエンス、を謳っているが、「どこでも」シークエンスをするとデータにバラつきが出やしないか?(逆に、誰がどこでランしても一定のデータが出てくるなら凄い)
  • ユーザーコミュニティの中からプロトコルや解析ツールが作られる、ボトムアップなイメージ。NGSは昔からサードパーティのツールがユーザーから作られるものだが、ONTはよりその傾向が強いように感じる
  • バージョンアップのスピードが速い。PacBioもそこそこ速いけれどONTはもっと速いイメージ


と、つれづれなるままに書いてみましたが、いかがでしょうか?
結局はコストだと言われるかもしれませんが、シンプルにランニングコストで比較すればPacBioも負けていませんよ。アプリケーションによっては。

結論!
PacBioやONTのどちらも持っていない場合:

  • どうしても自分でランしたくて、ユーザーコミュニティでどんどん聞いて行くのが好きで、インフォマティクスにも強ければONT(ベースコールも何種類かあるのをお忘れなく)
  • 自分でランすることにはこだわらず、安定したデータを早く出したい、インフォを誰かに頼めるか自分でできれば、受託か共同研究でPacBio
  • 限られた予算を無駄なく効果的に使いたければ・・・ (答:     )

PacBioを持っている場合:
迷わずPacBio(笑) これ一本!

以上、2017年11月現在の私の意見でした。

2017年10月4日水曜日

ASHG2017でのイベント情報

すっかり涼しくなってきたな~と思えるときもある10月。
10月と言えばアメリカ人類遺伝学会(ASHG)。
毎年恒例で多くの日本人研究者も集まりますが、今年は特に多い。
場所がフロリダ州オーランドだからでしょうか?

ということで、PacBioのイベント情報をお知らせします。
ASHG学会に行く人も行かないひともぜひチェック!

このページ行けば全部書いてあるんですけど、まとめますね。

ワークショップは10/18(水)の現地時間12時半から
テーマはヒトゲノム構造解析
Cas9を使った配列特異的ターゲットシークエンスを使って脊髄小脳失調症タイプ10のメカニズム解明に挑む例や、大きなゲノム構造変異と知的障害の関係性の研究、1000人ゲノムプロジェクトの最新情報など。
特に1000人ゲノムの発表は、今年HUGOのPresidentでもあるDr. Charles Leeです!
参加はこちらから、学会には行けないけど後で講演を聞きたい!というひとも、レジストして
Not attending. Send the recording
を選択すればOKですよ! (もちろん参加したひとにも録画のリンクが送られてきます)

それ以外の注目イベントはこれ!

10/19 11:00 am-12:30 pmの Concurrent Platform Session “Advances in the Genetics of Autoimmune Disease,”では、“The MHC Diversity in Africa Resource: A roadmap to understanding HLA diversity in Africa,”(Martin Pollard of the Wellcome Trust Sanger Institute)というタイトルの発表があります。PacBioを使ったMHCシークエンスの実例が示されるそうです。

同日午後4:15-6:15の Concurrent Invited Session “Analysis of Cancer Genome Variation Using Long-read Sequencing”では、Dr. Fritz Sedlazeck (Baylor College of Medicine)、Dr. Jacques Banchereau (Jackson Labs for Genomic Medicine) らによるガンゲノムへのPacBioの応用例がこれでもか!と発表される予感。

Dr. Xufeng Zhao、Dr. Mark Chaissonらは、the Human Genome Structural Variation Consortiumを代表して, “Comprehensive Discovery of Structural Genomic Variants Through Integration of Multiple Sequencing Platforms,” というタイトルのポスターを18日の 午後2:00-3:00 のポスターセッションで発表するそうです (Poster #1501).
彼らは最近、3組のトリオの全ゲノムをPacBioで読んで解析し、1000 Genome Projectのショートリードデータ解析よりも10倍以上の構造変異を見つけたとして bioRxiv に発表。この論文はチェックしているかたも多いでしょう。

PacBio社からの注目は、Tyson Clark が “Targeted Enrichment Without Amplification and SMRT Sequencing of Repeat-expansion Disease Causative Genomic Regions” というポスターを18日の 3:00-4:00 pm で発表します。
これが例のCas9ターゲットです!(Poster #1480).

さらにさらに、初日17日(火)の午後1時から4時にあるGenome Reference Consortium (GRC) & Genome in a Bottle consortium (GIAB) Workshop も見逃せませんよ。
ヒトゲノムリファレンスのアップデートが話し合われるとても面白いワークショップです!PacBioのロングリードも大活躍しています。

と、いろいろ書きましたがプレスリリースにも書いてありますので時間がある方はどうぞ。
PacBio関連のプレゼンだけで約30もあるそうです! 全部をフォローするのは難しいけれどできるだけ聞いてきます。


2017年4月27日木曜日

沖縄からのレビュー論文

日本にPacBio RSを初めてインストールした、本当に最初の最初のお客様の中に、沖縄綜合科学研究所、があります。
こちら、沖縄県うるま市の沖縄バイオ産業振興センター内にあり、もちろん何度も行ったことがあります。
これまでにもPacBio現場の会や、PacBioアジアユーザーミーティングでのご発表など、いろいろとご協力頂きました。

さて、3月31日にPublishされていて、ここでも紹介しようとしていてうっかり忘れていたレビュー論文があります。お客さんが書いた論文の紹介なのに「忘れていた」とはなんとも申しわけない。
でもファーストオーサーの中野さんは、優しいひとなので許してくれるでしょう。


沖縄綜研さんでは、これまでに本当にたくさんのサンプルを、RS/RSIIを読んできました。
PacBioの一分子シークエンサーが、ゲノム解析や構造解析、メチレーション解析、SNPフェージング解析にいかに優れているか、をよーくご存知です。
私が言うより、実際のお客さんが言うほうが、説得力ありますよね。
ちなみにロングリードの記録として、92.7kbのリード長を2016年11月に出しているそうです!(もうちょっとで100kbでしたね)

このHuman Cell レビュー論文の中では、さまざまな種が登場しますが、その中からほんの少し紹介します。論文は無料みたいです。
PacBioの、GCバイアスの無いロングリードだからこそ読めた例の数々です

Mycobacterium tuberculosis (結核菌)
4.4MbでGCが65.6%のGCリッチゲノム。ゲノム中にはGCが80%に達する2,000bp以上の配列部位が存在し、1,000bp以上のまったく同じ配列ペアが117か所あるとのこと

MDR Acinetobacter baumannii (多剤耐性菌アシネトバクター)
4Mbの染色体と189kbのプラズミドを持つ。どちらもGCが39%程度の低GCゲノム。
多剤耐性の遺伝子の位置を同定

Carbapenem-resistant Pseudomonas aeruginosa  (カルバペネム抗生物質耐性緑膿菌)
6.85Mb、GCが66%のゲノム
ゲノムには、10,000bp以上(最長27,239bp)の同じ配列ペアが6か所あり、これらはプロファージとのこと

Helicobacter pylori (ピロリ菌)
沖縄は、内地と比べて胃がんの割合がとても低い。これは胃がんの原因として近年言われているピロリ菌の種類が違うからではないか?という話。
ピロリ菌の毒性とcagA, vacA遺伝子のジェノタイプをプロファイリングし、さらにはメチレーションとの関係性も明らかにした例

ほかにも、沖縄由来のバクテリアや、インフルエンザウイルスのゲノムを解析した例、ヒトのCM-SJS(スティーブンス・ジョンソンシンドローム)/TEM(中毒性表皮壊死症)関連IKZF1遺伝子のターゲットアンプリコンシークエンスをして新規にSNPフェージングを発見した例など、これまでの成果は相当な数に上ります。



と、お客さんをよいしょしたところで、今日はこれくらいに。

2016年11月22日火曜日

IGVでの格好いい見せ方

Integrative Genomics Viewer (IGV) といえば、NGSやっているひとなら一度は聞いたことのある、ゲノムビューワーですね。
フリーで使えてさくっと見るのにはとても便利。
先日、本社とのウェブミーティングで、このIGVを使って、PacBioのデータを格好良く見せる方法を教わりました。
皆さんも知っていると便利なツールだったのでシェアします!

まず、普通にIGV(ここではv.2.3.88)を使ってPacBioのアライメントファイルを開くとこう見えます。
ぜんぜん綺麗じゃない! 
SubreadをアラインしているのでInDelエラーが目立ってるんです。

これをある方法を使うと、このように見ることができます。
とてもすっきりしてますねえ。

これ、Development Snapshot版を使っています。

先ず、バイナリを落としてきます(上図カーソルの場所から)。
Zipを解凍して、中に作られる、igv.batファイルをダブルクリックして起動させます(テスト環境はWindows 7&10)

最初は、これまでIGVで表示していた、デフォルトで、PacBioアライメントが表示されるかもしれません。ここで、View > Preferences を選択
Alignmentsタブを開き、とりあえず以下のように数字を入れてみて下さい。
特に、
  • Label indels > 1: 2塩基以上のindelに表示が出る
  • Hide indels < 20: 19塩基以下のindelは表示されない

としてチェックを入れて、OKします。

ちなみに、普通のIGV(v.2.3.88)でも、これに似た画面はありますが、上記オプションはありませんね。
これはv.2.3.88のIGV
さてこれで、先ほどのような綺麗な表示ができるようになりました!
こんな感じに。

しかし例えば、下図のような場所があったとします。
大きなDeletionがある領域です。
そのほかにも、小さなInDelが点在するようですね。
では、Allele Frequencyが小さいものはエラーの可能性が高いので、除くことにします。
例えば、35%以上のアレルだけを残したい、そんな場合は、再び View > Preferences > Alignments から、Coverage allele-fraction threshold: を、0.35としてみる

そうするとこんなにすっきりします!
大きなDeletionがあるところの上流側に、ハプロタイプ(ここでは黄緑のA、リファレンスはT)があるのに気がつきます。
この黄緑色Aを右クリックして、Group alignments by > base at [塩基の場所] を選択
するとこうなります
大きなDeletionと上流SNV(T -> A)がリンクしているのがわかると思います。


IGVはあくまでビューワーですので、これ自体が解析するソフトではありませんが、データを見せる方法としてはとても使えるツールだと思います。

尚、この機能は、PacBioのプログラマー、Aaronさんによって作られました。

さて、次回は、この例に使用したヒトゲノムデータについてお話ししたいと思います。
多分誰でも使えるデモデータ、のはず。。

2016年1月7日木曜日

今年もやります「PacBio現場の会」ワークショップセミナー@秋葉原 2月23日(火)


NGS現場の会メーリングリストに登録されているかたは既にご存知かもしれませんが、今年も、「PacBio現場の会」と称したワークショップセミナーを東京で行ないます!

【「第二回PacBio現場の会」ワークショップセミナー】

これはPacBioに関心のあるすべての研究者向けのセミナーイベントです。
すべて、というのはつまり、「PacBioの名前は聞いたことあるけれど、良く知らない」という方でも、「PacBioデータ解析をやっているけれど他のひとはどういうふうにしているのかなあ」という方でも、「うちはショートリードしか使ってないけど何となくロングリードの情報も知りたいなあ」という方でも、参加OKということ。
初心者から達人まで、満足できる内容にしたいと思います。

参加費用は、無料!
使用言語は、日本語(海外ユーザ様の発表は英語です)です。

日時:
2016年2月23日(火)
10:15~17:30(9:45受付開始 終了時間は若干変更の場合があります)

ちなみに過去30年間の2月23日の東京の天気は、このサイトによると、
最高気温の平均:12.3度(昨年は19.2度、一昨年は8.3度)
最低気温の平均:4.2度(昨年は6.2度、一昨年は2.9度)
1mm以上の降水があった日は、7日(23%)
ま、これで今年の天気がわかるわけではありませんが、ご参考に(笑)

場所:
東京 秋葉原UDX 6階、UDX Conference Room A+B
アクセス:秋葉原から徒歩5分くらい ここ 
UDXの6階です。お間違えなく!
定員 100名を予定しています
こんな感じの部屋

内容:
PacBioユーザ様や、実際に実験・解析を行なった研究者からのご発表
PacBio最新情報の紹介
PacBio実験にあると良い、周辺装置の紹介と展示
Sequel Systemデモ機展示
NGS解析の強力ツールの紹介(これは、PacBioとは直接は関係ない、例のアレです。初公開デモします)
その他、わくわくするようなこと

講師の方々(発表順ではございません):
  • 荒川和晴先生(慶應義塾大学 政策・メディア研究科) 
  • 小森智貴先生(東京大学大学院理学系研究科 生物科学専攻 光計測生命学講座 )
  • 坂井寛章先生(国立研究開発法人 農業生物資源研究所 農業生物先端ゲノム研究センター) 
  • 田中裕二郎先生(東京医科歯科大学 難治疾患研究所遺伝生化学分野)
  • 細道一善先生(金沢大学大学院 医薬保健学総合研究科・医薬保健学域医学類)
  • 中野和真先生(一般社団法人 沖縄綜合科学研究所 研究開発部)

皆さん、PacBioのSMRTテクノロジーを使った実験・解析のプロです!
バクテリアから高等真核生物、ヒトのシークエンス、さらには、PacBioRSのシークエンサー以外の使い方、などなど、とても面白い話が聞けると思います。
タイトル、要旨については、来月上旬にアップデートします。

アメリカからの招待講演:
  • Icahn School of Medicine at Mount Sinai Robert Sebra先生

Sebra先生は、前回も講演されましたね。PacBioRSIIを3台保有し、ヒトをはじめとする高等生物のアプリケーションに早くから挑戦されてきた第一人者です。また、PacBioの最新機種、Sequel Systemのアーリーアクセスユーザでもあります。
どんなお話が聞けるか楽しみですね!

協力メーカー様からの特別セッション:
  • 日本ジェネティクス株式会社様 ランチョンセミナー(ということは、皆さんランチの心配は要りません! ライブラリのサイズセレクション用の機械、Blue Pippin、ELFの紹介です)
  • アズワン株式会社様 コーヒーセッション (BioNano Genomics社のIrysの紹介です)

そして今回は、懇親会を会場近くのレストラン、プロント!で予定しています。
参加希望者は当日受付でお聞きしますのでお伝え下さい。

あ、その後の二次会はみなさんご自由に。
秋葉原で飲むも良し、神田まで出るも良し!です。


さて話を戻します。
ワークショップセミナー参加ご希望の方は、
http://www.digital-biology.co.jp/allianced/workshop/
から、
「第二回 PacBio現場の会」ワークショップセミナー [PBWS]
の項目をご確認頂き、
「カレンダーで確認」の、2月23日 PBWSリンクからご登録下さい。



前回同様、PacBioユーザ様との情報交換や、最新情報を得る貴重なワークショップにしたいと思っています。
是非お誘い合わせの上、ご参加下さい。

またプログラムが決まり次第アップデートします!お楽しみに!


2015年12月20日日曜日

PacBio メディカル関係の記事3つ

12月も半ばを越えると、もうアメリカはクリスマスモード。メールもほとんど来ません。
ブログを書く暇があるので、今日は、最近ウェブで紹介された、メディカル関係の記事を3つ紹介します。

まずはこちら、Diagnostics Worldからの記事

Long-Read Sequencing in the Age of Genomic Medicine


Icahn School of Medicine at Mount SinaiのBobby Sebra氏曰く、「Pseudogenes, large structural variants, validation, repeat disorders, polymorphic regions of the genome―all those are categories where you practically need PacBio」
ヒトゲノムに存在する変異には、ショートリードでは検出できない大きな構造変異、リピート変異が多く存在します。これらを検出するにはPacBioのロングリードが不可欠、という話。

技術はある。マシーンもある。あとはソフトだけ。

ソフトウェアは、研究者向けには一通り揃っていますが、お世辞にも現場の医者向けではありません。
それはどのNGS機器でも同じ問題を抱えているでしょう。
Mount Sinaiでも、3台のPacBio RSIIから出てくるデータを効率よく解析できる様に、彼ら独自のソフトウェア・アルゴリズムを作っています。(例:構造変異検出ツールとか)
また、ひとつのテクノロジーにこだわらず、10Xや、BioNano、Oxford Nanoporeなどいろいろな技術を次々に取り入れ試しています。
最近2倍体ヒトゲノムをPacBioとBioNanoで解析し、それまでのどの結果より優れたContig/Scaffold配列を作りました。

このように、他のNGSとは明らかに優位性を持つPacBioのロングリード。
メディカルの現場に持ってくるにはどうしたら良いか?

言うまでも無く、機械の使いやすさと安定性、低コスト、わかりやすいソフトウェア、が必要でしょう。
RSIIからSequelになって、実際のところはどうでしょうか?

Sebra氏は、Sequelのアーリーアクセスユーザでもあります。
その辺の話は、また今度、2月23日(火)に秋葉原で行なわれる、「第二回PacBio現場の会」ワークショップセミナーにて、詳しく聞けますよ。
お時間があれば是非ご参加下さい!お楽しみに!

ちなみにこの記事の中に登場する英語で、「Off-the-shelf」というのがあります。
いつでも買える、とか、入手可能な、という意味です。
Off-the-shelf analysis, with readable diagnostic reports for doctors
というと、医者が読みやすい、臨床レポートが出てくる解析ツールの存在、という意味。
今はまだありませんが、これなくしてクリニカルシークエンスの現場に普及するのは難しいですから、絶対できるはずです。


次はGenomeWebから(ごめんなさい、これは有料みたいです)

Baylor Team Explores PacBio Long Reads for Detecting Pathogenic Structural Variants in Patients

こちらはBaylor College of Medicine & Miraka が考えている、ヒト診断への可能性についての記事です。
BaylorのAssistant Prof. Bainbrigdeは述べています(ざっくり翻訳)。
「ヒト全ゲノムのシークエンスが現実的なものになり、皆さんこれで構造変異などの問題は全て解決できる!と思ったはずです。でも、たいていの構造変異検出プログラムは、変異全体の1/3~1/4ほどしか検出できていないんです。それらを合わせても半分くらいしか実は検出できていないことになります。でも、6,000~10,000 bpのロングリードを使えば、もっと簡単にできるはず」

Proof-of-Concept(できるかどうか試してみよう実験)にて、Baylorのチームは、PacBioのロングリードが、どれだけ遺伝子検査に応用できるかを調べました。
彼らはまず、既知の疾患関連遺伝子ベスト100にフォーカスしています。その中には、がん関連遺伝子60余りや、シングルセキソンの抜け落ちが原因で引き起こされる疾患関連遺伝子、Fragile Xシンドロームなどリピートの数が重要となる遺伝子、が含まれます。

そのような、重要遺伝子だけをキャプチャーする技術、キャプチャーシークエンスとかターゲットリシークエンスとか呼ばれますが、これをPacBioのロングリードにも応用できます。
前のブログ「PacBio-LITS PacBioでターゲットリシークエンス 1& 2」でも紹介しましたが、プローブを用いて、7kb程度のロングリードをキャプチャーできるようになったのです。

今までのキャプチャーシークエンスといえば、タンパクコーディング箇所に焦点を当てた、エキソームシークエンスが有名ですね。
各メーカーがキットを出しています。
PacBioのロングリードでできるキャプチャーは、エキソンのみならず、遺伝子全体なんです。
遺伝子全体をキャプチャーできるアプリケーションはPacBioのロングリード無しではできない。
これはがん遺伝子もそうですが、HLA遺伝子なんかも、全体をキャプチャーしたほうが複雑な変異(phasingなど)を検出できるので良いと思います。


最後は、こちら
Front Line Genomics Magazine  Issue Six


こちらの雑誌はフリーで全文読むことができます。
その42~43ページめにPacBioの記事があります。
インタビューに答えているのは、PacBio本社のマーケ担当、イケメンLuke Hickey

内容は、これまでPacBioを使って挑戦されてきたヒトゲノムアセンブリの紹介と、On-Goingなプロジェクト。

ハプロイドのヒトゲノム(hydatidiform mole, CHM1)をPacBioで読んで読んで・・・というのは、以前このブログでも紹介しましたが、その時はWashington University in St. Louisのプロジェクト。
大学名が似ているのでたまにごっちゃになるのですが、こちらはthe University of Washington、さらにUniversity of Bari Aldo Moro と University of Pittsburghのチームは、同じくハプロイド株を40X PacBioで読んで、リファレンスゲノムに存在する160箇所のギャップのうち半数以上を、クローズするかギャップを縮めたそうです。
そのほとんどはGCリッチな場所、反復領域だったとのこと。
さらに、100万塩基以上の新規の配列を追加。
彼らが見つけた26,079個の変異箇所のうち、コピー数変異の85%、挿入変異の92%、欠損変異の69%が、これまでに報告の無い新規だったそうです。

ということは、リファレンス配列といっても、まだまだ完璧ではなかったんですねえ。

リファレンス配列といえば、ここ数年、人種ごとにリファレンスを作ろう!的なプロジェクトが動いています。
韓国のマクロジェン社とソウル大学が推し進める、韓国人リファレンスゲノム計画は、PacBio、BioNano、BACシークエンスを使ってデータを出し、完成に近づいています。
GRC(Genome Reference Consortium)アセンブリよりも、よりアジア人を代表するリファレンスゲノムになる予定です。

さらに、あのCraig Venter博士が率いるHuman Longevity, Inc. では、世界の人種を代表するゲノム、30リファレンスを作成する計画があるそうです!
何とも壮大な計画・・・
Front Line Genomics Magazine,  Issue Six, p43
こういう夢のある計画、いいですね。

ヒト以外の生物でも、もう一回PacBioで全ゲノム読んでみたら、意外と新規配列がたくさん見つかるかも。






2015年4月14日火曜日

ターゲットリシークエンス 続き 一般論

2回にわたって、PacBioでのターゲットリシークエンスについて書いてきましたが、今日はPacBio関係ではありません
Pacは次回までお休み


ターゲットリシークエンスをした後の解析のひとつが、変異検出です。
そういえば、この「パックマンの挑戦」ブログを始める前に書いていた、「ショートリードの憂鬱」ブログでは、良くこの変異検出について書いたものでした。

見返したところ、2011年7月に、「Exome 解析 non-synonymous SNVを見つけた後は・・・」というタイトルで、SNV(SNP)を見つけた後に行なう解析あれこれ、みたいなことを書いていました。
今から4年前、フリーツールを駆使して、見つけたSNPをフィルタリングしたり、意味付けしたり

人類遺伝学会などでは毎年、ヒトゲノムリシークエンス、エキソームシークエンス、など、NGS(主にショートリードだけど)を使用した大規模プロジェクトの発表を聞きます。
特にアメリカは、やたらヒトゲノム読んでいますね。大きな病院を拠点にして、周辺の大学や病院と、患者ゲノム情報を共有する、、、なんて話を3年前のASHGでも聞きました。

遺伝子検査ビジネス大手、deCODE社やAmbry Genomics社も、やはりヒトゲノム、またはエキソームを読んで、検出したSNVを、データベースと照らし合わせて意味付けをしています

そういう会社、大学、プロジェクトは大抵、解析パイプラインが決まっています
どのゲノムリファレンスを使うか、マッパーは何を使うか、変異検出ツールは何をつかうか・・・等
逆に決まっていないと、後でデータ間比較をしたいときに整合性がとれない

例えば、BWAでHG19にマップしてGATKで変異コールして・・・という流れでも、途中のfastqフィルタリングやマッピングパラメータ、冗長性除去の有無など、いろいろ決めなければいけない項目はあるはずです

さて、決められたルールに従って変異が検出されたとしましょう
この後はその変異の意味付けです

意味付け?

先の「ショートリードの憂鬱」ブログにも、いろいろSNVフィルタリングを紹介したのですが、ナレッジを使った意味付け、というのもあります

ナレッジって何でしょう。これは論文や発表、色んな種類の公開データを、人間が精査して集めたデータベースです
SRA(sequence read archive)のようなNGS配列データベースは、中身のデータ量が爆発的に増えていますが、ここではナレッジに入れないでおきます。

ナレッジのわかりやすい例は論文です。
世界最大の医学生命科学論文データベース・MEDLINEは、今や2400万件の論文を保持しているそうです(5年前くらいまでは、1400万件と言っていましたからその増加分たるや!)

論文をまとめて遺伝子同士の関係や、化合物との関係をまとめたデータベースが、実は結構価値あるんですよ。
私も前職でPathway Studioというソフトを扱っていたのでわかるんですが、遺伝子を中心にして
周辺のレギュレーターとかを検索するのが、わずか数分でできてしまうんです
残念ながらこのソフトは某大手出版会社に買収されてしまいましたが

で、そのころはマイクロアレイなどの実験の解析に、論文ナレッジデータは使われていたのですが、今や時代はNGS(と言ったらアレイやっているひとに怒られるかな? アレイはアレイで、良いところたくさんあります!)

先のようにリシークエンスをして、変異解析をしたら、VCFというフォーマットのファイルでSNVを表現すると思います。
このファイルには、SNVの場所情報が記載されている
どこの遺伝子のどこに変異があったか、がわかる

そんな遺伝子が、今わかっている遺伝子間の制御関係において、どこに位置するのか?
それはどんな機能のパスウェイに影響するのか?
変異が起こったことによって、どんなフェノタイプに関連すると示唆されるのか?

というような情報がナレッジによってわかってくるのです。

さ、前置き長くなりましたが、そういうナレッジの解析をクリック&クリック、簡便化して行うことができるソフトウェアがあります。
~Ingenuity Variant Analysis~

自社の製品の宣伝になってますが、今、市場にあるどんなソフトウェアより使いやすいしわかりやすい
Pathway Studioもここまで頑張れば良かったのに・・・ と思ってしまいました

5月29日まで無料解析キャンペーンをやっています
このチラシの裏面のチャートがわかりにくい、という方、とりあえずNGS使ってヒトでリシークエンスやっていて、VCFまで出したけど、変異の絞込みこれでいいのかなあー?ってちょっと不安に思っていて、まあアンケートに協力してやってもいいかな? 
って思っているひとなら誰でも申し込みOKです
申し込みはこちら



このソフトで使われているナレッジは、人間が実際に論文を読んで集められたもの。
すごい人海戦術です。インド人恐るべし

しかし将来は、人工知能がこういうナレッジを作るのでしょうか
2045年問題(コンピュータが人間の脳を超える日)というのがありますが、コンピュータによる論文からのナレッジ抽出は、実は前述のPathway Studioで10年前に実現されていました。
もちろん完璧ではなくミスもありました。(ああ懐かしい!ちなみにPathway Studioはロシア製)


2045年は今からちょうど30年後
30年後を待たずとも、データベース検索や、もっと言えばシークエンスデータからのフェノタイプ予測などが、人工知能で全部できる時代が、意外と早く来る予感がします。
そうなったとき、世界はどうなっているのでしょうね。

今から30年後

子供の世代の生命観は、全く予想がつきません

2015年4月11日土曜日

PacBio-LITS PacBioでターゲットリシークエンス 2

ターゲットリシークエンスの話の続きです。

Roche-NimbleGen社では、いくつかのエンリッチメントキットを用意しています。
SeqCap EZ Designs というキットをPacBioでは試しているそうです。


  • Comprehensive Cancer Design
  • Neurology Panel Design
  • Human MHC Design
などなど

先のアプリケーションノートで、紹介されている例は、Human MHCとComprehensive Cancerの2つ
このアプリケーションは新しすぎるのか、まだWebsiteにUpされていません
そのうち www.pacb.com/target から落とせるようになると思います

ま、SeqCapEZ のキットで、平均6kbのフラグメントを濃縮できた、ということはすごい!
ゲノムにアラインした様子がこちら
BRCA1遺伝子、上がPacBio、下がIlluminaのデータです
PacBioのデータは、長いのでイントロンまでカバーしているので、イントロン部分のSNVも検出しています


こちらは35kbの長さの遺伝子
あれ? カバレッジが均一でない
それは、おそらく、エンリッチのときの、PCR増幅バイアスでしょうか?

PacBioで行なうターゲットエンリッチメントは、せっかくなので、ロングリードで読むことに意味がある使い方をしないといけませんね
それにはどんな使い方があるか?

ある程度場所が既知の、Fusion Geneのところだけを読む?
数遺伝子だけに絞って、その遺伝子のSNP Phasing を調べる?
そのほかにも、アイデア次第では面白い実験が考えられそうですね。

Phasingといえば、エンリッチしてPacBioで読んだデータ、Reads Of Insertをゲノムにマップした後、Samtoolsを使ってphasingを見ることができます。
Samtoolsでそんな機能があったのか!と驚いたのですが、ここに詳しくやり方が書かれています。
このツールは、SMRT Analysisが入っているサーバで行なうことが前提です
ちょっと、Reads Of Insert mappingなどの基礎知識が必要です

とりあえず、Bamファイルやリファレンスファイル、SMRTCellデータのパスなどを指定して、シェルを流すと、数分で結果は返ってきました

たくさんのファイルが出力されますが、とりあえず表示してみたいのはprefix.0 と1の二種類のマッピングファイル
これがphasingを分けている、らしい

ちなみに私はまだエンリッチされたPacBioデータが手元になかったので、HLAのアンプリコンシークエンスをわざわざReads Of Insert マッピングして、染色体6番のHLA遺伝子近辺だけを見ました

なんか、カバレッジ深すぎ…
IGVはメモリを食うので、深すぎるカバレッジはダメ

そして phase.out ファイル
これはSNP phasingの結果らしいです
PSのところにphase set のSNPが出るはずなんだが
SNPの数が妙に少ない気がする
これはHLA-A、B、Cの遺伝子部分を増幅したアンプリコンのはず
…

アプリケーションデータで紹介されている、もう少したくさんの遺伝子エンリッチメントのデータでは無いので、イマイチ結果の解釈まではできませんでした
ツールが動く、ということを確認したのみ
サンプルデータで試してみたいですね

というところで今夜はおしまい


2015年4月5日日曜日

PacBio-LITS PacBioでターゲットリシークエンス 1

今日は4月5日、東京は雨が降って、せっかくの桜も散ってしまっています。
今年ほど、桜満開の時期が短いと感じたことはなかったなあ。
7月のNGS現場の会に向けて、「お花見メタゲノム」の試料採取が、全国で行なわれているみたいですね。
私のFacebookの友人も、採取の様子をいろいろアップしていまいた。
結果が楽しみです!

さて、今日は、PacBioではあまり今まで話題に出てこなかった、ターゲットリシークエンスの話

リシークエンスには大きく分けて、全ゲノムリシークエンスと、ターゲットリシークエンスの2種類あります。
前者はゲノム全体をガッツリ読む方法で、後者は例えばExomeなどのような遺伝子のエキソン領域だけを濃縮して読む方法です。
濃縮キットは(「エンリッチ」キットとも呼ばれますが)、ゲノム配列を断片化したあと、

  1. 取ってきたい(シークエンスしたい)配列領域にデザインされたプローブをハイブリして、エンリッチする方法
  2. 読みたい配列の両端にPCRプライマーを設計して、そこだけPCR増幅して、取ってくる方法
の2種類あります。
ハイブリ方式か、PCR増幅方式か

市場で良く聞く製品だと、SureSelect (Agilent社)や、SeqCap EZ (Roche社)などは、ハイブリ方式
Ion AmpliSeq(LifeTech社)は、その名の通り、Amplification(増幅)方式

これまで、どの方式、どのキットも、PacBioのロングリードには対応していませんでした。
PacBioで読むには、エンリッチした後の配列長が、そこそこ長くなくては意味が無い!
そんな中、ハイブリ方式で6kbフラグメントのターゲットエンリッチメントに成功したのが、この論文
Wang et al. BMC Genomics (2015) 16:214

Baylor College of MedicineのDr. Min Wangらは、彼らのエンリッチ方法を使って、Potocki-Lupskiシンドロームの患者に見られる、chr17p11.2の複雑な構造変異、Low Copy Repeats (LCRs; またはSegmental Duplications )のブレイクポイントを、検出することに成功しました。

そもそも何で、ゲノム全体を読まずに、特定の箇所をエンリッチして読むのか?
興味のある場所がゲノム全体の数%だったら、そこだけを濃縮(エンリッチ)してきて、PacBioの超ロングリードでがっつりカバレッジ稼いで読めば、かなり消耗品を節約できます。
ゲノム全部を読む必要が無いひとにとっては、エンリッチメントはかなり効率的な手段なのです。

彼らは、Roche NimbleGen社の、SeqCap EZ エンリッチメントキットを使用して、つまりハイブリ方式で、ターゲット領域を濃縮、PacBioで読むことに成功しています。
この方法は、PacBioのアプリケーションノートでも紹介され、今後、本格的に広まる予感がします。

通常、SeqCap EZのプローブは、200bpのフラグメントに対してハイブリするようデザインされています。
これを、彼らは、6000bpのフラグメントでも可能であることを示しました。

まず、ゲノムDNAを、G-tubeで10kbに断片化します。
その後、Blue Pippinというサイズセレクション機器を使ってゲル泳動し、5~9kbの長さのフラグメントだけを抽出します。
SeqCap EZ アダプターをつけたあと、増幅し、プローブとハイブリします。
ハイブリしなかったDNA断片(濃縮ターゲットではない部分)をWashして捨て、ハイブリした断片(濃縮ターゲット)を回収します。
もう一度、回収DNA断片を増幅し、それからSMRT Bellライブラリ作製にかかります。

このようにして、ハイブリ方式で濃縮したDNA断片から作製したライブラリを、実際にシークエンスしたデータは、かなりの数のライブラリが6kbのサイズを保っていたことを示しました。
実際にHG19ヒトゲノムリファレンスにマップしたところ、マップされたReads Of Insert(ライブラリの長さにほぼ等しい)の平均長は、4.3kb~4.7kb
これだけの長さのリードを濃縮できた例は、私は聞いたことがありません。

論文に出ているとはいえ、まだこのプロトコルはPacBio公式ではありません。
もし試してみたい方は、うまく行かない可能性も無くは無い、ということを頭に入れて、お試し下さい。

どんな遺伝子でもエンリッチできるのか?
SeqCapEZ のプロトコルにはどんな工夫があるのか?
データ解析ツールはどんなふうに使ったら良いのか?

などなど知りたいことはありますが、またフォローしていきますのでお楽しみに!



2014年1月18日土曜日

ショウジョウバエリシークエンスとFALCON

今週はサンディエゴでPAGミーティングがありましたね。
私は日本で、PacBio本社から来日しているプロダクトマネージャーと一緒に、(願わくば)将来の顧客廻りをしてました。
PAGではどんな話がされていたのでしょうか? 盛り上がったとは聞いています。
PacBioのワークショップセミナーの様子も、間もなく公開されますのでお楽しみに!

さて、そんな中、Drosophila melanogaster (ショウジョウバエ) のシークエンスデータが公開されました。
マンチェスター大学のDr. Casey Bergman、ローレンス・バークレイ国立研究所のDr. Susan Celniker と Dr. Roger Hoskinsとの共同研究で、ショウジョウバエのISO1 (y; cn, bw, sp)株をPacBioで読んだのです。読んだ個体は成虫のオスです。
このプロジェクトは昨年夏ごろから続いていて、その経過は何度かプレゼンで詳細させて頂きました。
今回はそのあと20Kbライブラリ+サイズセレクション、新しい酵素(P5-C3)で読み足したデータは結構すごい!というお話。


【生データ】

  • 総塩基数: 15,208,567,933 bp
  • 総リード数: 1,514,730
  • 平均リード長: 10,040 bp
  • N50リード長:  14,214 bp
  • PacBio RS II でシークエンスに要した時間: 6日
  • 使用したSMRT Cells: 42

平均10Kb !? 本当かよ!っていう数字ですね。 私も正直、信じられません。 
確かめてみます。 少々お待ちを。

まあ、それはおいといて、

Berkeley Drosophila Genome Project (BDGP) のリファレンスゲノムは2007年にリリース5を出しているそうですが、このリファレンス配列に対して、先ず、BLASRマッピングしています。
常染色体で90~95x、X染色体で~45xのカバレッジ(サンプルはXY)

シークエンスカバレッジは、ゲノム全体にわたって、ほぼ均一、という感じです。
一部、トランスポゾンエレメントの挿入部位は、短い配列が多めにマップされてしまうそうです。

では次にアセンブルの結果
こちらはPacBioのブログに詳しいです。(http://blog.pacificbiosciences.com/2014/01/data-release-preliminary-de-novo.html)


メリーランド大学のDr. Sergei KorenとDr. Adam Philippyは、昨年末に開発したPacBioToCAの新しいバージョンを使用して、リファレンスゲノムRelease 5 よりも少ないContigを得ることに成功しました。これはすごい!
X染色体については、読んだ個体が成虫のオスだけど、リファレンスはオスメス混合の胚由来、ということが原因かもしれない、とのこと。

ちなみにこれらのデータは上記、PacBioブログからリンクがあるので、誰でもダウンロードできます。


3L染色体が1本のContigになったというのは驚きです!

"haploid assembly" と但し書きがあったのに気が付いた方、そうです、"diploid assembly"というのもPacBioでは開発中なのです。
その名も「FALCON」
ベータ版はすでに公開されてます。 ここ
前のブログでも少し紹介しましたが、Diploid Aware のアセンブリアルゴリズムです。
すごいと思いますが、どうやって確かめるのがベストなのか?
世の中に、Diploidの情報が載っているゲノムリファレンス、ってあるんでしょうか?
もちろんヒトなどではSNPsのデータベースはありますし、ハプロタイプブロックなどの情報はあることにはあるけれど、それらが本当に正しいのかをどうやって見たら良いのでしょうね。
PacBioで読んで、FALCONでアセンブリして、DiploidにContigができたとして、それをどうやって確かめるか・・・ それが問題だ。

ともあれ、FALCONはそのうちPacBioのソフトウェアにデフォルトで入れ込まれるでしょう。


2012年9月25日火曜日

論文紹介:SNP検出のバリデーションに使用!

最近、PacBioを使っての論文がたくさん出ています。
一番最近のは、PacBioの超ロングリードに対応したMappingツール、BLASRのアルゴリズム
Mapping single molecule sequencing reads using Basic Local Alignment with Successive Refinement (BLASR): Theory and Application (PMID: 22988817)
このBLASRというMappingツールは、PacBioの二次解析ソフトウェアについてきます。
もちろんフリーなので、PacBioのユーザー以外でも使うことができます。

このBLASRがまだ前のバージョンだった頃、Broad Instituteでは、既存の有名なMappingツール、BWA-SWを使ってPacBioで読んだターゲットリードをゲノムにMappingし、その後GATKでSNPを検出、既にショートリードシーケンサーで検出したSNPを検証しています。
検証にはPacBioの他にFluidigmも使用しています。

Medulloblastoma exome sequencing uncovers subtype-specific somatic mutations. (PMID: 22820256)

92人の髄芽腫と健常人のサンプルを比較しての変異解析です。
Whole-Exomeキャプチャー法で33Mbの範囲を、HiSeq2000 2x76bpでディープシーケンスし、統計的有意な12の遺伝子変異を見つけています。
この変異遺伝子のコーディング領域をFluidigm Access ArrayとPacBio RS で読んで、検証しています。

髄芽腫の、Whole Genome Amplification サンプル(PCR増幅)と、Native DNAサンプルそれぞれ48ずつ、バーコードシーケンスしています。 ちなみにPacでバーコードはまだ製品になってません。

20ラン行い、フィルタリング後のリードが389,215本、サブリードは 4,367,852本、そのうちサンプル由来だとわかったのは64%の2,834,170本のサブリード

このサブリードを、hg19に対してBWA-SWマッピング、GATKを使ってBase-quality recalibrationとSNP 検出。
検出した変異候補は、IGV上でマニュアルキュレーションし、カバレージが十分にあった19の変異を検証しています。

結果ですが、リードごとのエラー率は高いけれど、カバレージを稼いでコンセンサス配列にするとSNPバリデーションに十分使え、実際に2bp detetion をCTDNEP1遺伝子で確認しています。
他のショートリードテクノロジーは、エラーが起こる場所に配列的特異性があり、ランダムでは無いので、コンセンサスにしてもエラーの高い場所と低い場所ができます。
PacBioのエラーは全くランダムに起こる(と言われている)ので、そのぶん、ショートリードで見つけた変異の検証に向いているということです。
しかし、PCRで十分増幅されなかった他の変異箇所、またGenomc DNAを十分な量得られなかった変異箇所は検証に使用できませんでした。

これの補助的論文として、
Pacific biosciences sequencing technology for genotyping and variation discovery in human data. (PMID: 22863213)

があります。
BWA-SWのパラメータは、
  • Missmatch penalty を3から5へ
  • Gap open penaltyを5から2へ
  • Gap extension penaltyを2から1へ
  • Heuristics (信頼性・精度)を1から20へ (Ampliconは精度が高い)
と工夫しています。こちらの論文はAmpliconを読んでいます。 同じパラメータを髄芽腫論文でも使用しているそうです。
 
この論文の途中、次のような一文があります。
“…Pacific Biosciences does not provide a simple measure of base quality score. Instead the software uses the instrument’s estimated insertion error probability as the base’s quality score.”
疑問に思って著者に聞いてみました。
この論文が書かれた時は、PacBioのSMRT Analysisという二次解析ソフトでBLASRマッピングをしてBAMを出すときに、Qualityがinsertionのエラーだけを基本に算出されていたので、実際の質とかけ離れていると問題だったそうです。
それで彼らもBLASRを使わずにBWA‐SWを使ったわけです。
今のPacBioのソフトは彼らが考えた、"PacBio Processing Pipeline" を取り入れ、Insertion以外のエラーも基本に「ある程度正しい」塩基クオリティを出すようになったそうです。
 
今度は誰かが、そのクオリティはどれくらい確かか、を研究対象にした論文を出しそうな予感が・・・。
 
 
 

2012年3月3日土曜日

ターゲットリシークエンスと変異 3 - SureSelect

Agilent Technologies社のSure SelectというターゲットエンリッチメントシステムについてはショートリードのNGSでもおなじみ。
さて、これをPacBioのロングリードでやってみるとどうなるのでしょうか?


このポスターでは、2つのHapMapサンプルと、Tumor/Normalサンプルを使って、SureSelectでターゲットをキャプチャーし、それをPacBioで読んでいます。 
(直リンクを貼るわけにはいかないので、"Development of SureSelect Target Capture Methods for Sequencing on the PacBio RS" をGoogleで検索してAgilent社のPDFをゲットして下さい。PacBioのサイトからも取れます。)

M&Mを簡単に言うと、1マイクログラムのgDNAをCovarisを使って250bpまたは2kbに切断した後、SureSelectシステムの中でベイトRNAとミックスし、0.5Mb Chr10+X(Contig + Exons)領域をキャプチャーします。 その後はPacBioのライブラリー作成プロトコールに従い、250bp、または2kbの2種類のライブラリーを作っています。


シークエンスは45分ムービーを2回、読んでいます。 つまり、250bpのライブラリーはCCS(Circular Consensus Sequence)で何回もぐるぐる読み、2kbはCLR(Continuous Long Read)で読んでいることと同じです。
実際何個のSMRT Cellを使ったのか、という情報が欠けているのですが、CLRで200X~500XのSub-readのカバレージを得たそうです。(http://www.pacificbiosciences.com/applications/target の、Technical Note: Targeted Sequencing on the PacBio RS using Agilent Technologies SureSelect Target Enrichment)
しかし実際は、ここまでカバレージを取らなくても良いでしょう。 その例はまた今度お見せします。


さて、250bpと2kbの2種類の塩基長でキャプチャーした場合、結果はどう違うでしょうか?
まず、マッピングの結果、2kbのほうが、250bpよりも均一にゲノムをカバーしました。
隣合うキャプチャーベイトのプローブをまたいでマッピングできたのも2kbのほうです。
DNA断片が2kbだと、ターゲット領域の上流・下流の配列も長くとれてくるので、のちのデータ処理では、ターゲット領域上に取れてきた配列のみにフィルタリングしたい場合、注意が必要でしょう。
話はずれますが、ショートリードの時は、
  1. リードをゲノムにマッピングし (BWA)
  2. 冗長性のあるリード・Duplicateを除去し (SamtoolsやPicard)
  3. キャプチャーしたExon領域だけを取り出し (Bedtools)
という流れが来ると思いますが、Pacのデータの場合、データ量が(HiSeqとかに比べると)少ないので、キャプチャー領域だけを取り出すのはもったいない気がします。個人的にですけど。

さて、それからSNPを見てみると、2kbでは、250kbでは見つからなかった既知SNPも見つかったそうです。 
上が2kbで下が250bpで、山の形はカバレージを表しています。 某遺伝子の3’-UTRの部分が拡大されていますね。 
青い囲みは2kbと250bpの両方で見つかった既知SNP、赤い囲みは2kbでのみ見つかったSNPだそうで。
こういうのがたくさん見つかるとしたら、2kbのライブラリーを作ってみたくもなるでしょうね。

あと、長いライブラリーのほうがGCバイアスにも強いし、ギャップも埋められる、という利点があるので、ショートでは見つからなかった変異も見つけることができる! って、言われますが、まだインパクトのある実例が無いのが残念!!

で、結局、SMRT Cellは何個必要なの?

この答は、あくまで計算上でしかわかりません。
実際に何個使って、どれくらいのカバレージで、新規SNPを見ーぃつけた! という論文やポスターがあれば参考になるのですが。
今年を期待しています。

さて、計算上はどうでしょうか。

例えば、10Mbの、ターゲットキャプチャーをして、その場所の20%の変異を見つけたい場合。
2kbのライブラリーを使うとして、最低必要カバレージは150Xと想定(前回のブログ参照)。
ターゲットの数は、単純に10Mbを2kbで割った5,000というわけではありません。
プローブがいくつ設定されているかは、ケースバイケースなので、ターゲットの数はとりあえずN としましょうか。
2kbライブラリーで「使える」CRL subreadは、1SMRT Cellあたり50,000とします(前回のブログ参照)。
サンプルバイアスを3とします。(3倍ぐらい多めに読んだ方が安全ということ。上記SureSelectの例でも200~500Xのカバレージを得たとありますので、最低カバレージ150とすると、3倍くらい多めに読むつもりでやっています)
するとSNP検出に必要リード数は、3x150xN= 450N   
必要なSMRT Cellの数は、これを50,000で割って、0.009N

ターゲット数が1,000ならSMRT Cell 9個
5,000なら45個
10,000なら90個

・・・・・・

結構な数ですよ、これは