Protein Language Modelを活用した多タスク学習で、6つのタンパク質開発性プロパティをまとめて予測する「Prot2Prop」

論文タイトル

Prot2Prop: Structure-informed multitask protein property prediction

出典

Prot2Prop: Structure-informed multitask protein property prediction
Protein engineering often relies on separate models for related developability properties, limiting efficiency and transfer across tasks. We present Prot2Prop, ...

要旨

本研究では、構造情報を取り込んだタンパク質言語モデル「ProstT5」を基盤とし、6種類のタンパク質開発性(developability)プロパティを1つのモデルで同時に予測する多タスク学習モデル「Prot2Prop」を提案しています。

解説など

米国の Neurosnap社から発表された、タンパク質の developability を予測する機械学習モデルの開発を提案したレポートです。本手法の特徴は、1つのモデルで同時に複数のdevelopabilityを予測する多タスク学習モデル(Prot2Prop)を開発した点にあります。

モデル

Prot2Propは、Protein Language Model(タンパク質言語モデル)のProstT5をベースとしています。

特徴は、ProstT5本体を凍結(学習しない)し、その上に軽量なアダプタ(adapter)だけを学習する点です。

モデルは以下のような構成になっています。

  • ProstT5によってアミノ酸配列から残基ごとの特徴量を取得
  • 全タスクで共有するShared Residual Adapterで共通特徴を学習
  • 各タスク専用のTask-specific Residual Adapterで性質ごとの特徴を抽出
  • Attention Poolingにより重要な残基へ重み付け
  • 最後に各タスク専用ヘッドで予測

学習に使用したデータ

対象となる予測タスクは全部で6種類です。

分類タスク

  • Material production
  • Solubility
  • Temperature stability

回帰タスク

  • Aggregation propensity
  • Expression yield
  • Folding stability

分類データはAI4Protein由来、回帰データはProteinGymのDeep Mutational Scanningデータセットから構築されています。

得られた結果

分類タスク

AUROCは

  • Material production:0.8663
  • Solubility:0.8697
  • Temperature stability:0.9837

となり、特に温度安定性では非常に高い性能が報告されています。

回帰タスク

Spearman相関は

  • Aggregation propensity:0.8614
  • Expression yield:0.7321
  • Folding stability:0.8384

でした。

近年はESMシリーズやSaProtなど、大規模Protein Language Modelを各タスクごとに微調整する研究が数多く報告されています。その中で本研究は、「複数の開発性プロパティを一つのモデルで扱う」という点に特徴があると考えられます。

また、バックボーンを凍結し、軽量なアダプタのみを学習する構成は、計算資源を抑えながら多様なタスクへ対応できるため、実用面での利点が期待できます。一方で、多タスク学習ではタスク間の関連性が弱い場合に負の転移(negative transfer)が起こる可能性が一般的に指摘されています。本研究ではタスク専用アダプタによってその影響を抑える設計が採用されていますが、異なるデータセットや新規タンパク質群への汎化性能については、今後さらに検証が進むことが期待されます。