論文タイトル
Modeling the structure-conditioned sequence landscape for large-scale protein design with TriFlow
出典
https://doi.org/10.64898/2025.11.30.691458
著者: Harish Srinivasan, Rongqing Yuan, Qian Cong, Jian Zhou(UT Southwestern Medical Center / University of Chicago)
要旨
構造条件付き配列設計(inverse folding)の新モデルTriFlowが提案されました。AlphaFold2やRoseTTAFold2に着想を得た3トラックアーキテクチャと離散フローマッチングを組み合わせることで、ProteinMPNNのような自己回帰型モデルの弱点だった長距離構造依存性の捉えにくさを克服しています。
用語
- 離散フローマッチング(discrete flow matching): 拡散モデルを離散状態(20種のアミノ酸+マスク状態)に拡張した生成手法です。全残基がマスクされた状態から出発し、少数ステップで並列的にアンマスクしていきます
- 3トラックアーキテクチャ: single(残基ごとの特徴)・pair(残基対の特徴)・3D構造(バックボーンの座標)という3種の内部表現を相互更新するネットワーク構造。AlphaFold2のEvoformerに由来します
解説など
背景
de novoタンパク質設計は一般に、①バックボーン生成(RFdiffusion等)→②配列設計(ProteinMPNN等)→③AlphaFoldによる再フォールディング検証、という2段階のパイプラインで進められます。このうち②の配列設計で長年主流だったProteinMPNNは、局所的な近傍構造から1残基ずつ自己回帰的に配列を組み立てるため、タンパク質の遠く離れた部位同士の構造的な関係を捉えにくいという弱点がありました。
TriFlowはこの弱点を、AlphaFold2/RoseTTAFold2由来の大域的なアーキテクチャと、少数ステップで配列全体を並列生成できる離散フローマッチングの組み合わせで解消することを狙ったモデルです。
本論文の特徴
TriFlowが何を入出力するかを整理すると、入力はバックボーンの3D構造・サンプリングのタイムステップ・(生成途中の)配列で、出力は各アミノ酸位置の確率分布です。ProteinMPNNのように1残基ずつ確定していく自己回帰方式とは異なり、複数残基を同時に確定できる点がポイントです。
アーキテクチャはsingle・pair・3D構造の3表現を相互更新する3トラック構成で、pair表現の更新にはAlphaFold由来のtriangle multiplicative update、3D座標の更新にはInvariant Point Attention(IPA)を使います。計算量の大きいtriangle attentionを含むブロックは、バックボーン自体はサンプリング中に変化しないことを利用して最初の1回だけ計算し、以降のステップでは結果をキャッシュして使い回すことで効率化しています。
学習データにも工夫があり、ProteinMPNNと同一分割のPDBデータセットに加え、AlphaFold Protein Structure Database(AFDB)由来の単量体構造や、AFDBで予測された相互作用ドメイン-ドメインペアを追加した拡張データセットを用意し、大規模バインダー設計などの応用にはこちらを使っています。
結果
単量体の配列設計ベンチマークでは、ProteinMPNNと共通のPDBテストセット(1,392構造)を用いた評価で、TriFlowはProteinMPNN・ESM-IF・PiFoldより高い配列回収率を達成しました。
本論文の主眼であるde novoバインダー設計では、24標的の治療関連タンパク質パネルにおいて、
- RFdiffusion+TriFlow
- RFdiffusion+ProteinMPNN
- BindCraft(ColabDesign)+TriFlow
- BindCraft+SolubleMPNN
をそれぞれ比較し、いずれもTriFlowがstructure success rateで上回りました。
このほか、ヒトクラスI型サイトカイン31種全てを標的とした特異的バインダー設計デモ(IL7を除く全標的で基準を満たすバインダーを取得)や、43,000超のタンパク質ドメインについて天然配列プロファイルと設計配列プロファイルを比較し活性部位・低分子結合部位を予測する応用例も報告されており、単一モデルの汎用性の高さがうかがえます。
考察
著者ら自身が強調している通り、本論文の評価はいずれもAlphaFoldをsurrogate(代理)とした in silico 評価にとどまり、発現・結合アッセイなどのウェット実験データは含まれていません。AlphaFold上の指標改善が実際の実験成功率にどこまで結びつくかは今後の検証が必要です。
また、設計されるバインダーは現状のバックボーン生成手法(RFdiffusion・ColabDesignいずれも)の傾向としてα-ヘリックス主体に偏っており、天然のタンパク質間相互作用界面に見られるβストランドや不規則ループといった多様な構造モチーフは十分再現されていません。これは配列設計モデル単体の限界というより、AlphaFoldがMSAなしでもα-ヘリックス構造を自信を持って予測しやすいという構造生成・構造予測側の特性に起因すると著者らは指摘しており、バックボーン生成モデルの今後の進化が待たれるところです。

