公共データベースの統合からAIによるデータマイニングに向けて

公共データベースの統合からAIによるデータマイニングに向けて
复制标题

从集成公共数据库到使用人工智能进行数据挖掘

DOI:
10.11546/cicsj.35.210
复制
发表时间:
2017
期刊:
CICSJ Bulletin
影响因子:
--
通讯作者:
水口 賢司
水口 賢司
中科院分区:
--
文献类型:
--
作者:
伊藤 眞里;長尾 知生子;夏目 やよい;水口 賢司

文献摘要

相似文献

国内外を問わず, この十数年, 製薬業界では, 研究開発費の高騰と新薬の承認数の低迷に悩まされている. これらの要因として,「候補化合物をヒト臨床試験にすすめるまでの課題克服の困難さ」 および 「創薬ターゲットそのものの枯渇」 が挙げられる. 前者は, 見出した候補化合物を薬効のみならず, 薬物動態および安全性においても医薬品としての適性を獲得するまで最適化して, 臨床試験にステージアップできる確率が低いことを指している. また, 後者は, 高難易度の創薬ターゲットのみが残されている, もしくは真のターゲットが見いだせていないことを指している. すなわち, 特定の疾患と関連し, 分子機能の制御が可能であるような生体内分子を新規に同定することが難しいという状況を示している. 近年の Google (DeepMind) 社の AlphaGo や IBM 社のワトソンに代表されるように, AI (Artificial Intelligence: 人工知能) のパフォーマンスと可能性に様々な分野が大きな期待を寄せており, 医療・ヘルスケア分野への AI テクノロジーの応用も今後国際競争が激化することが必至である. 上記 「候補化合物の最適化」 および 「創薬ターゲット探索」 のいずれの課題についても, コンピューターを用いたモデリング (予測) ひいては AI により, これまで行われてきた解析のみでは見出せないような, タンパク質と化合物, 疾患, 代謝などの関係性を見出すことで, 大いに進展することが期待される [1, 2]. 創薬・医療分野で AI を有効活用するためには, 疾患や薬物に対する論文等の文献情報に加え, マルチオミックス解析, さらに実臨床情報といった, 異なる種類の膨大なデータセットを学習させる必要がある. しかしながら, それらのデータ, 特に電子カルテなどの臨床情報は, 自然言語によって自由記載され, データベースとして構造化されていない. ゲノムやタンパク質といった生物学的情報は, データベース化されているが, 分野特有の語彙や ID を用いて記述されており, データベース間で各エントリーを関係付けることは, 必ずしも自明ではない. そのため, 自然言語処理による情報の抽出, 語彙や ID 間の関係付けなどを行って, 機械可読なデータセットの構築から始める必要がある. 我々は, これまでに公共の生物学的データベースを統合した創薬ターゲット同定支援データウェアハウス TargetMine [3] の開発や,「創薬支援インフォマティクスシステム構築プロジェクト」[4] として, 薬物動態と安全性評価における高品質のデータベースの構築と薬物動態パラメータ予測システムの開発を行ってきた. これらの取り組みを通して明らかになってきたデータ作成や統合の問題点を示しながら, AI テクノロジーを駆使して創薬ターゲット分子を効果的に探索する新たなプロジェクトの目指すところを紹介する.