2013年4月4日木曜日

デノボトランスクリプトームにもどうぞ

企業が主催するウェビナーは好きです。
ライフサイエンス系のウェビナーは、時間が許す限り、見ようと思います。
IT系だと昔から結構普通にありましたが、最近2、3年は、バイオ系の会社も講師を呼んでセミナーをして、それをネットで生放送するのが流行りになりつつあります。

企業のウェビナーと言えば、今日(もう昨日かな)、4月3日に参加したのが、イルミナ社のウェビナー。 時間も夕方だったので、オフィスの何人かと見てました。
最近注目しています。 内容も面白い。 本音で語る演者をうまく厳選している感じです。
やるな。

あまり褒めると立場上アレなのでコレくらいにして。

今日のお話は、基礎生物学研究所 生物機能解析センターの、重信 秀治先生による、「非モデル生物のRNA-seq解析 -- 実験デザインから解析パイプラインまで」 でした。

見逃した方も、イルミナ社のサイトから録画を閲覧できます。 ここから

今日はデノボトランスクリプトームがテーマで、これは私もとても興味のある分野です。

重信先生は、リファレンスの無い生物のRNA-Seqをしてアセンブルするツールに、Trinityを勧めていました。 
Trinityは昔は結構メモリを食うツールで、困った経験があります(2011年7月22日の書き込み参照)。でも今は大分使いやすくなったそうです。良かった。
ペアエンドのイルミナHiSeqを使っていました。 例にあげられた生物種がちょっと気持ち悪(ワモンゴキブリ)かったですが、内容はとてもためになりました。
出来ればスライドの右上に登場するゴキブリの写真を、せめて可愛いイラストに変えて欲しかった。
ゴキブリ、苦手です。

非モデル生物のRNA-Seqは、目的が2つに分かれ、それぞれに実験計画が異なる、との言葉には大賛成です。
Isoformや新規の遺伝子を見つける目的には、できるだけ異なる環境や形質(卵、幼虫、蛹、成虫など)からまんべんなくたくさんのcDNAを読む。
発現量や発現比測定の目的には、統計計算できる生物学的リプリケートを用意して読む。
(個人的には、前者、新規遺伝子発見の方に興味があります。)

デノボで遺伝子候補を見つけた後に、ORF検索したり、BLASTxしたり、と、いわゆるアノテーションという作業が続くのです。 重信先生はさらっと言っておりましたが、結構大変な作業ですよ。
私もやってましたから。

それはそうと、重信先生、今後PacBioにも期待していると仰って下さいました!
多謝!

PacBioは、平均的cDNAなら全長読むことができます。
Trinityでアセンブルした結果のContigが、本当に遺伝子を反映しているのか、白黒付きます。

まだ、私もcDNAをPacで読んでの解析は、経験が浅いですが、「全長が読めている!」というのは最初感動しました。
GMAPでゲノムにマッピングして(おっと、ここでデノボでは無いのがバレてしまいました。実は非モデル生物でのcDNAサンプルはまだ手に入っていないので、モデル生物でしかやったことが無いのが現状)、IGVやUCSCブラウザで見たときに、これが一本のリードから取れた配列なのか、としばし見入ってしまいました。

モデル生物でも非モデル生物でも、全長cDNAがバッチリ読める、そんな感動を味わいたい方、PacBioいかがですか?

2013年4月1日月曜日

リピートの秘密


PacBioの紹介プレゼンで良く登場する(させている?)のが、fragile X mental retardation 1 (FMR1)脆弱X症候群関連遺伝子の、CGGリピートを読んだ例。
この遺伝子は、5’-UTR領域にCGGリピートがあるのですが、これが55リピート未満なら正常、55以上ならその数によって、例えば200-1000リピートになると、その部分がメチル化されて正常なmRNAが転写されず、結果として運動失調や自閉症などの疾患を引き起こすそうです。OMIM Number: 309550

CGGCGGCGGCGG....と、CGGの3塩基単位がずーっと続くような配列、通称3塩基リピート(Trinucleotide repeat: TNR)と言います。
50リピートだと150塩基、普通のNGSシークエンスでもいけそうです。
200リピートだと600塩基、ショートリードでは無理ですね。
500リピートだと1500塩基、そろそろサンガーでもきつい。
750リピートだと2250塩基、これはもう無理。

で、PacBioの出番となったわけです。

ケーススタディのダウンロードはここから

昨年サンフランシスコでの人類遺伝学会でもHagerman氏の講演がありました。
また論文も出ましたね。(Loomis et al., Sequencing the unsequenceable: Expanded CGG-repeat alleles of the fragile X gene (2012) Genome Research. リンク )
リピートを読むのはチャレンジングですが、PacBioなら、何とか読める気がします。
勿論、解析はオートメーションではできませんから、その意味でも「チャレンジング」です。

リピートといえば、3塩基リピートだけでも色んな種類があるのですね。
ちょっとググったらわかったのですが、ヒトゲノムにある3塩基リピートでも
AAT, AAC, AAG, AGG, ATC, ACC, CAG, CGG, ACT, GAC などがあるそうです。

Kslowski et al., Trinucleotide repeats in human genome and exome. (2010) Nucleic Acids Research. リンク 
この論文で面白かったのは、リピートは種類によって、ゲノムに多いもの、Exomeに多いもの、それぞれ差があるということ。 
ここでリピートの定義は、3塩基が6回以上連続する配列、ゲノムはhg18、ExonはRefSeqを基準にしたそうです。
そうすると、ゲノムに対してExomeで良く出現するリピート上位3位は、CGG、CAG、AGG
逆にAAT、AAC、AAGなどはゲノムに多く出現するそうな。

でも、これはリファレンスゲノムを見て、の話しなんですよね。
hg18は、確かほとんどがサンガーシークエンスで読んでまとめられたゲノム配列だから、サンガーで読めなかった場所は、当然カウントされていない。
とすると、もし、将来(近い将来)、ロングリードで今まで読めなかったリピート領域を読んでリファレンスゲノムが作り替えられたら、上記のグラフは大きく変わるでしょうねえ。

そんなことを考えながら、リピートリピートと、テーマを探す最近です。


2013年3月22日金曜日

Pacでヒトゲノム

近い将来、ヒトゲノムを診断に使う日が来るでしょう。 実際私も、23andMeで自分のSNP解析をしてみたことがありますが、お金とチャンスがあれば是非Whole Genomeを読んでみたいものです。
23andMeのサービスはとても手軽なんですが、参考にしているデータベースが白人なんですよねえ。
え、結果ですか?
いたって健康。 特に遺伝的な異常無し。 でした。
ワーファリンによる副作用が平均より1.6倍高いかも?くらいなことが唯一気をつけるべき項目でした。

そんな来るべきゲノム診断に向けて、シークエンスメーカーはビジネスチャンスを狙っているわけです。
前回、Pac CEOのインタビューの中、クリニカルな応用を考えているユーザもいる、と書きました。
今日はそのユーザの話です。


2009年から2012年7月までPacBioのChief Scientific Officer を務め、また2011年8月からMount Sinai School of Medicineのチェアーを務めるEric Schadt氏。
彼はPacBioをクリニカルに応用できないかと追求するひとりです。
AGBTで講演内容です。
ビデオのリンクはここ
講演の後半からPacBioについての話が始まります。



彼らは、ヒトゲノム(NA12878)を、Illumia HiSeq、Roche454、PacBio RSを使ってそれぞれ30x、15x、10x+のリードを得ました。
10xのカバレッジを得るのに使用したPacBioリードは1200万本。 単純計算で360 ~ 400 SMRT Cell 使った計算になります。あるいはそれ以上?
平均リード長は4,066 bp、平均サブリード長は2,766 bp、95thパーセンタイルは11,630 bpだったそうです。
「クリニカルな応用に関しては、Pacのロングリードはリピート配列に対してアドバンテージがあります。」 
20くらいの遺伝子に存在するリピート配列が、重要な疾患マーカーとして既知だそうですが、それらはショートリードで読むことは不可能です。 

しかし彼らのPacBio10xデータによると、例えば4番染色体のHuntingtin 遺伝子ではCAGリピートとCGGリピートを同じシングルリードが12本もカバーし、また精神疾患に深く関与することが知られている19番染色体のカルシウムチャネルα1サブユニット遺伝子CACNA1Aでは、1キロほど離れた2つのリピート(CAG)nと(ACC)nを10本~15本のシングルリードがカバーしていました。


このほかに、3塩基リピートについて言えば、少なくとも50リピート以上(つまり150bp以上のリピート)の、約10,000箇所のリピートのうち84%を、今回の10xのデータでカバーできました。
これは他のテクノロジーでは真似出来ないことです!

と、ここまできて、冷静に考えると、「全ゲノムを10xで読めばいくらかかる?」
という疑問が湧いてくるでしょう。
疾患の診断に、ヒト全ゲノムを何百Cellも使って読むのは(今はまだ)“コスパ”悪すぎですね。
現実的には、重要遺伝子またはゲノムの場所だけにターゲットを絞って一分子で読む、ことになるでしょう。
この講演は、PacBioのロングリードを使えば今まで見えてこなかったヒトゲノムの構造が(一部)わかってくる、というものです。


Schadt氏らは現在、Illumina/PacBioのハイブリッドExomeテストを試みています。 これはPacBioでしか読めないような、5Mbpの箇所のキャプチャーシークエンスを、今までのショートリードExomeに組み合わせるような手法です。
個人的にはキャプチャーしてくるところが特に興味があります。
いろいろ(ハイブリや酵素処理など)手法はあるようですが、ロングリード用にExomeキャプチャープロトコルが早く確立されれば良いですね。
願わくばExome以外の特定ゲノムのキャプチャーも。


2013年3月18日月曜日

PacBio CEO インタビュー

PacBioの今のCEOといえば、伝説の男、Mike Hunkapiller (ハンカピラー、「ピ」にアクセント)
シーケンスビジネスの重鎮です。
アプライドバイオシステム(ABI)社で21年間を過ごし、1995年から2004年までは社長兼ゼネラルマネージャーでした。 
その後ベンチャーキャピタルを通じてPacBioを資金的にサポートし、2012年からPacBioの社長兼CEOです。 ゲノムプロジェクトで一世を風靡した、Celera Genomics社の創始者のひとりでもあるんですよ。

そんな彼ですが、喋ると意外に気さくな感じ。
一緒に記念撮影パチリ!も応じてくれました。

彼のインタビューがYou Tubeに載ってます。
http://www.youtube.com/watch?feature=player_embedded&v=kgz5K3evWtw


DNAシークエンサーの革命はSanger法から始まります。
長く、とても正確に読めるこの方法は、今でも広く使われていますね。 私もゲル板で読んでいたので、ガラスの中にゲルを入れて固めたあと、あの、コームを抜くときの快感が忘れられません! 
キャピラリーも、ゲル充填の後の、気泡を抜くのがあったなあ。

と、キャピラリー全盛でABIの独占状態が続くなか、いわゆる「次世代」シークエンサーが現れました。 これはSangerよりもリード長が短い、という欠点があるものの、スループットが膨大でした。
このあたりから、シークエンスを“塩基あたりコスト”で測って、「次世代の方がSangerよりお得」のような空気が出来てきます。

例え数十塩基しか読めなくても、数千万、数億本もリードが出てくる。 これは今までのシークエンサーの使い方を大きく変えました。
タグカウンティングです。
SAGE、RNA-Seq、ChIP-Seqなど、リードの本数を利用してその遺伝子やゲノム部位のコピー数や発現量、修飾などを解析していく方法です。
今までマイクロアレイの独壇場だったフィールドにシークエンサーが使われるようになったのです。

しかしこれらの解析はいずれも、リファレンス配列が必要です。
既に読まれているゲノム配列に対してマッピングし、そこからほかのサンプルと比較してどこが違うが見つけるのです。
Exome-SeqでのSNP検出なんかもそうですね。
そういうリファレンス配列は、これまたSangerで読まれて決定されていたりします(非モデル生物などでは最近はNGSも積極的に使われていますが)。

そういう参照配列がなく、未知の配列を読まなければならない(de novo )とき、確かにショートリードを使ったペアエンド技術やメイトペア技術も貢献しますが、限界もあります。
一本のリードで出来るだけ長く読むことが今も必要とされている」のです。

現在、10kb以上連続して読めるシークエンサーは、PacBio以外に存在しません。
その長さもやがて倍になり、スループットも向上します。
長く読めるという価値が今以上に大きくなれば、相対的にコストは下がるでしょう。
これがPacBioの考え方です。

CEOのインタビューに戻ります。
ライバルのIllumina社、LifeTech社は、シークエンサーの診断目的利用を視野に入れて挑戦を試みているがPacBioはどのような目標を持っているか?
という質問です。
Mike曰く、Pacのユーザの中には、クリニカルユースを目指して研究しているところもある。
勿論カウンティングベースの診断にはスループットが高いショートリードが向いている。 しかし長い領域のDNAを見なければならない分野、リピートの数が数kbに及ぶときや、HLAタイピングなど、ロングリードが必要な診断もある。 まだ研究段階だが、いずれ診断に応用できる日が来ると思う。

私も、シークエンサーの目指すべきひとつの大きな道は、診断・クリニカルユースだと思います。
Agree !

それには超えるべきいろんな壁があると思いますけどね。 挑戦です。

2013年3月15日金曜日

もうショートリードはいらない?

私の話し方が、松岡修造に似ているそうです。(良い意味で?)
ある方から言われて、何人かに「そう?似てる?」って聞いたら「うん!」という答えが。
喜んでいいのかなあ・・・。 少し複雑。
暑苦しいプレゼンは嫌だ。


まあ、それはそれとして、タイトルに「もうショートリードはいらない?」
と書きましたが、バクテリアサイズのゲノムアセンブリには、いらないかも? という意味です。

昨年(2012年)は、ロングリードの精度を上げるためのエラーコレクションという手法(pacBioToCAとLCS)が少し流行りました。このブログでも何度か取り上げたので、ご存知のかたも多いと思います。 

昨年後半くらいから、ショートリードを使わずにエラーコレクションをする方法がいろいろ開発されて、PacBioではHGApという手法が作られました。
Hierarchical Genome Assembly processing の略で、開発したのは元A社のJason Chin。

Pacのリード(サブリード)は、長さと数をプロットすると、このような感じになります。形に注目!

これはセル1個ではないので、リードの本数は気にしないでください。 1個でも8個でも、リードの長さの分布はこのような形になります。
長いリードはあまり多くないですね。
でも、アセンブリに有利なのは長いリードです。
そこで、超長いリード(例えば6kb以上)だけをアセンブリに使用し、それ以下の長さのリードは、超ロングリードのエラー補正に使おう、というのがHGApの考え方です。

超ロングリード(Seedリード)に対し、それ以下の長さのリードをマッピングして、多数決のような感じでコンセンサスを作ります。 
そうすると結果的に精度が向上した超ロングリードができる(Seedを6kbにしたときは精度の高い6kbができる)わけです。
知っての通り、シングルリードの精度は約85%、それがHGApのあとは、QV45以上になる超ロングリードも得られるのです。
このような、QV45の6kb超リードを20x~30xくらい得て、Celera Assembler等でアセンブリすれば、数MbサイズのバクテリアゲノムであればPacのみでFinishできる!
というわけです。

実際はリピートの存在などにより、完全に1本になるとは限りませんが、他のどのテクノロジーよりもコスパが良い、と言えると思います。

さて、今月フロリダで行われたAGBTで、PacBioのCSO、Korlach氏の講演がとても良かったので、紹介しようと思います。

動画はこちらから見れますので、是非どうぞ。
前半はHGApの話、後半でその素晴らしい応用例が出てきます。

私が一番いいなと思ったのは、百日咳菌のゲノムアセンブリのところ。
百日咳の原因となるBordetella pertussisのゲノムは、今年(2013年)の初めまでに2株読まれていました。
2003年にサンガー研で行われた、130,000以上のサンガーリードをアセンブリした例(Parkhil et al, Nature Genetics 35: 32-40)と、2011年に33万本の454リードと1万本以上のサンガーリードでアセンブリした例(Zhang et al, J Bacteriology 193: 4017-4018)だけです。ちなみにゲノムサイズは4Mb程です。
どちらも一大プロジェクトです。

PacBioでは、オランダのグループとの協力で、このほか9つの株を1週間足らずで読んでしまいました。 
1株あたり使用したSMRT Cellの数は4個から8個、アセンブラーはHGAP+CAのパイプラインです。
実際は1台のシークエンサーだと、ライブラリ作成に2日、8個Cellのランに1日、解析に1日、というのが現実的でしょう。
ライブラリ作成を同時にすれば時間短縮はできるでしょうね。

この菌は、リピートやゲノムの複雑さで知られており、実際に読んだゲノムから複雑な構造変異があることもわかりました。

他の菌でも、例えば新規Plasmidを発見したり、遺伝子の新規Horizontal Transferを検出したり、と、昨年から次々と結果を出しています。
そのうち論文になることでしょう。

論文といえば、HGApについても近々Publishされると思います。
私も数Mbサイズのゲノムアセンブリには、まず、これを使います。
やろうと思えば数十Mbサイズまでいけます。
Pacによると、将来的には高等生物ゲノムでもできるようにしたいとのことです。

それにはスループットが・・・という声が聞こえてきそうですが、ご安心ください。
スループットは向上します。
光学系と、サイズセレクション(サンプル調整時)と、酵素と、蛍光
この4つが今年のキーになるでしょう。

2013年2月18日月曜日

AGBT 2013

会社のオフィスはビルの23階フロアにあるんですが、先週、試しに、階段で登りました。
10階くらいで一度「限界」って感じるんですが、ペースを落として登ると、何とか15階くらいまで来れる。
そこから先は、ランナーズハイみたいな感じで呼吸を一定に整えながら無心に登ると、あと3階、あと2階というふうにいって、ついに23階までたどり着きました。
その日は朝から有酸素運動したせいか、ずっと頭が冴えてましたね。 いいこと見つけたなあ。

さて、

2月20日から、アメリカのフロリダにて、第14回Advances in Genome Biology and Technology、通称AGBT(http://agbt.org/about.html)という学会があります。
残念ながら私は行がないんですけどねえ。まあ、雰囲気だけでも、味わいたい。





このようなチラシが会場で配られるはずです。
プレゼンは後にWebで公開される予定だそうです。 その時はお知らせします。
また、Pacのブログやツイッターでも語られる予定。
ポスターは、日本からもアセンブリやエラー補正、サンプルプレップ関連のテーマがありますね。

出席する方、どうぞ楽しんできてください。

2013年2月4日月曜日

PacBio「本社の」ブログ

突然ですが、子供の時に読んでおけば良かった、と思う本って、ありますよね。
冒険ものや夢の国を題材にした本。 「海底二万マイル」「トムソーヤの冒険」
成人してから読んでも、それはそれで面白いんでしょうが、きっと感動が違いますよね。

ルイス・キャロルの「鏡の国のアリス」って読んだことありますか?
「不思議の国・・・」の方は小学生時代に読んでいたのですが、こちらは成人してから読みました。
その中に、赤の女王、というキャラクターが登場します。
「この場所にとどまりたければ、全力で走りなさい。別のところに行きたければその2倍の速さで走りなさい」と言います。
"Now, here, you see, it takes all the running you can do, to keep in the same place."
"If you want to get somewhere else, you must run at least twice as fast as that!"
この文句は進化生物学では有名で、「赤の女王仮説」と言うそうです。
いろいろな解釈があるそうです。興味のあるひとはググってみて下さい。

しかし、一般的には、この赤の女王の言うことは、我々現代人全てに共通することのように感じます。 つまり、現代社会に生き残るためには全力で頑張らなければならない。 他人より一歩リードするには2倍頑張らなければならない!
受験、スポーツ、資格、ビジネス、研究、どれにも共通する。

次世代シーケンサーの分野もそうです。
変化がとにかく速いので、追いつくにも大変です。
「ショートリードの憂鬱」に書かれていることはもう古い! 参考にしてはダメです(笑)
できるだけ新鮮な情報を、その都度得ていないといけません。
NGS現場の会とか、たくさんの知が集まるところや、もっと小さいグループ単位での勉強会も必要でしょう。

話は変わりますが、1月からPacBio本社がブログを始めています。
会社のブログなので、「Pacすごいぜ」的な話ばかりです。
http://blog.pacificbiosciences.com/

もちろん英語ですが、内容はプレスリリース的なことやバージョンアップの話が書いてありました。
最新の情報はここでも得られるでしょう。
しかし、あくまで会社のブログということを心に留めておいてください。
私のブログは個人のブログです。ですので、一部、PacBioブログと見解が異なることもあるでしょう。

「わずか1ヶ月で1,600ページビューあった!」と現場では喜んでいるそうですが、まだまだ。
「パックマンの挑戦は日本語なのにひと月平均1,800ページビューあるんだぞ」って言ってやりたい。(控えめな数字です)

でもPacBio本家のブログで書かれていることは、ちゃんとフォローしないといけませんね。
例えば100K Foodborne Pathogen Genome プロジェクト(http://100kgenome.vetmed.ucdavis.edu/)への参加、なんて、実はすごいことなんですが(実際Pacの株価もこのアナウンス後に上昇)、あまり日本では話題になっていませんので書いてませんでした。
UCデービス校と協力して、サルモネラ、カンピロバクター、大腸菌、といった食中毒関係のバクテリアのゲノムを片っ端から読んでいくプロジェクトで、とっかかりの1000株についてはPacBioのマシンがFDAのお墨付きを得たそうです。
バクテリアゲノムのアセンブルは得意中の得意ですからね。

また、今度、「生物情報若手の会@岡崎(3/1~3)」で喋ることになりました。
若手の皆様方に、PacBioの「すごいぜ」から「まあここはちょっと」的な話まで、できるだけ正直に話します。 営業トークは一切無しで。
まだ1ヶ月ありますが、この間でもアップデートはどんどん出てくるのでそれも、出来れば話したいですね。
お楽しみに。