フード&アグリ

公共データのメタ解析で、育種と素材開発の候補遺伝子を探す

公開されている RNA-seq データを共通の手順で再解析し、芝生のストレス耐性マーカー候補と、機能性素材の評価指標候補を、新しい実験を行わずに絞り込みました。

新しい実験の前に、公開データで候補を絞る

育種でも素材開発でも、どの遺伝子を目印にするかを決めるには、多くの実験が必要です。一方で、公共データベースには、世界中の研究者が登録した RNA-seq(RNA シーケンシング)データが大量に蓄積されています。プラチナバイオは、これらのデータを集めて再解析するエビデンスマーカー探索(メタ解析)で、自社で新たにサンプルを採取する前に候補遺伝子を絞り込みました。対象の異なる 2 つの事例に、同じ方法を使っています。

共通の方法

  1. 公共データベースを検索し、目的に合う研究を選ぶ
  2. 選んだ研究の RNA-seq データを集め、共通の手順で再解析する
  3. 遺伝子ごとに統合スコアを計算する
  4. 発現が一貫して変動する遺伝子を取り出す
  5. 育種や素材評価に使える候補を絞り込む

統合スコアには TN スコア(T は処理群、N は対照群)を使います。遺伝子ごとに、処理群と対照群の比較で発現が上昇した回数から、低下した回数を引いた値です(Shintani et al., 2024)。単一の実験の結果は条件の偏りに左右されることがありますが、このスコアは複数の処理群・対照群の比較から発現変化の傾向をまとめます。TN 比(処理群と対照群の発現量の比)が 2 を超える場合を上昇、0.5 未満の場合を低下として数えるものを TN2 スコアと呼びます。再解析したデータと各遺伝子のスコアは、自社開発のメタ解析データベース MATOI(纏: Meta-Analytic Transcriptome Ortholog Index)に蓄積しています。

事例 1:芝生の環境ストレス耐性マーカー候補

芝生の生産と管理では、高温、乾燥、塩害、病害への対応が課題です。環境ストレスに強い品種の開発では、選抜に使える分子の指標の整備が求められており、品種選抜は育種家の経験と勘に頼る部分が大きいのが現状です。ストレス耐性の品種開発には長い年月がかかります。

この課題に対し、2 種の芝で同じ方法を使いました。

芝種 A芝種 B
知りたいこと環境ストレス耐性の品種を選ぶ指標塩耐性の仕組みを、種をまたいで理解する
使ったデータ文献 35 件から RNA-seq 65 データ3 つのプロジェクトの 117 サンプルから組んだ 90 データペア(処理群と対照群の組)
比べた軸塩、寒冷、カドミウムの 3 種類のストレスを横断耐塩性/感受性と地上部/地下部を組み合わせた 4 区分
  • 芝種 A では、塩、寒冷、カドミウムの 3 種類のストレスに共通して応答する遺伝子が 1 つ残りました。育種への応用を検討するマーカー候補です。
  • 芝種 B では、塩ストレス応答に関わる候補として 179 遺伝子を抽出しました。イオン輸送、浸透圧の調節、アブシジン酸(ABA)のシグナル、抗酸化防御に関わる遺伝子が含まれ、耐性の促進または抑制に関わる可能性があり、育種の標的として検証する候補になります。

事例 2:機能性素材の評価指標候補

機能性素材の開発では、素材がからだにどう働くかを示す指標が乏しいことが課題です。ヒトの臨床データを自前で取得するには大きな費用がかかります。一方で、公開されている単一の研究の結果は、対象者の年齢層、性別、地域に左右される場合があり、評価指標に使うには追加の検証が必要です。

そこで、ヒトの肥満を対象にした公開 RNA-seq データを再解析し、研究の違いを越えて共通する遺伝子を探しました。肥満や脂肪組織に関する研究を公共データベースでキーワード検索し、年齢層、性別、地域、代謝状態が異なる 4 研究を目で確かめて選びました。この 4 研究は、大規模言語モデル(LLM)でメタデータを読み取って抽出した研究にも含まれていました。各研究で、非肥満に対して肥満で発現が上がった遺伝子を TN2 スコアの高い順に約 500 個取り出し、4 研究で重ね合わせました。500 位の前後には TN2 スコアが同じ遺伝子が並ぶため、スコアの切れ目のうち 500 位に近い方で区切りました。そのため、取り出した遺伝子の数は研究によって 409〜575 個です。

BioProject(研究プロジェクトの登録番号)比較出典
PRJNA434431非肥満 vs 肥満Gao et al., EBioMedicine 2018
PRJNA641129非肥満 vs 肥満(代謝状態の異なる群を含む)Cifarelli et al., J Clin Invest 2020
PRJNA682573非肥満 vs 肥満Fisk et al., EBioMedicine 2022
PRJNA847049非肥満 vs 肥満Yang et al., Nat Metab 2022

ヒト肥満の公開 RNA-seq 4 研究で発現が上がった遺伝子の重なりを示すベン図。4 研究すべてに共通する遺伝子は 6 個

図 各研究で TN2 スコアの上位約 500 遺伝子(研究によって 409〜575 個)を取り出し、4 研究で重ね合わせた結果。数字は重なりごとの遺伝子数、円のラベルは BioProject の番号。上の表の 4 研究で公開された RNA-seq データを再解析して作成しました。

4 研究すべてに共通して発現が上がる遺伝子が 6 個見つかりました。背景の異なる研究で一貫して観察された、肥満に関連する発現変化を示す候補遺伝子です。機能性素材の評価指標として使えるかは、素材への応答を調べる実験で検証する必要があります。

同じ方法を、対象を変えて使える

植物のストレス耐性とヒトの肥満という異なる対象で、同じ方法から、育種や素材評価で検証する候補を絞り込みました。研究目的に合う比較可能な公開 RNA-seq データが十分にある場合、新たな実験データの取得から始める方法に比べ、候補探索にかかる費用と期間の削減が期待できます。既存データから候補遺伝子や機能性素材の評価指標の候補を絞り込み、次の検証につなげます。

関連情報

  • パートナー: プラチナバイオ(公共データの再解析)
  • 分野: デジタル育種、機能性食品、バイオマーカー
  • 使用したサービス: 標的候補遺伝子・マーカーの探索(エビデンスマーカー探索)
  • TN スコアの手法: Shintani M, Tamura K, Bono H. Meta-analysis of public RNA sequencing data of abscisic acid-related abiotic stresses in Arabidopsis thaliana. Front Plant Sci. 2024;15:1343787. doi:10.3389/fpls.2024.1343787
  • LLM で公共データを抽出する手法: Shintani M, Andrade D, Bono H. A Pilot Evaluation of Open-Weight Large Language Models for Screening RNA-seq Metadata in Public Databases. bioRxiv 2026. doi:10.64898/2026.02.16.706241
← 取り組み一覧に戻る