【Vilya-2】非天然ペプチド医薬の構造予測でco-folding勢を圧倒する全原子拡散トランスフォーマー

論文タイトル

Accurate structural modeling of chemically diverse molecular interfaces with Vilya-2

出典

https://arxiv.org/abs/2607.25156
GitHub(Riptidesベンチマーク): https://github.com/VilyaPublic/Riptides

要旨

タンパク質標的とペプチド・低分子リガンドとの複合体構造を予測する「co-folding」モデル(AlphaFold3やBoltz-2など)は、非天然アミノ酸やマクロサイクル化を含むペプチド医薬の構造予測を苦手としてきました。Vilya-2は、タンパク質・ペプチド・低分子をすべて同一の全原子グラフとして扱う拡散トランスフォーマーで、新設のペプチド界面ベンチマークRiptidesにおいてBoltz-2を大差で上回る精度を達成しました。

用語

  • plddt-ligand: モデルが自分の予測構造の信頼度を自己採点するスコア(原子ごとのlDDT予測値)を、リガンド原子だけで平均した値です。多数生成した構造候補(ポーズ)の中から、最も確からしい1つを選ぶランキングに使います
  • PoseBusters: 生成された構造が化学的・立体的にありえない配置(結合長異常や原子の重なりなど)になっていないかをチェックするフィルタです
  • EF20%(fold enrichment): 化合物の活性予測モデルを評価する指標です。予測スコア上位20%の化合物群における「本当に活性がある化合物」の割合が、ランダムに選んだ場合の何倍かを示します

解説など

背景

de novoペプチドデザインのパイプラインでは、AlphaFold3やBoltz系のようなco-foldingモデルが「どの生成分子を実際に合成・検証すべきか」を判断するオラクル(審判役)として使われますが、これらには2つの弱点がありました。訓練データに似た相互作用がないと未知のポケットやポーズへの一般化が弱いこと、そして非天然の化学構造に対して立体化学(キラリティ)の誤りや非現実的な幾何配置を生成しやすいことです。

本論文の特徴

Vilya-2は、単一分子の構造を予測する前作Vilya-1から、タンパク質標的との界面予測に拡張したモデルです。入力はタンパク質標的・リガンド(ペプチドや低分子)・補因子を含む系全体で、これをすべて区別なく単一の化学グラフ(原子とその結合)として表現します。出力は、その系全体の原子座標です。

この統一表現には明確な狙いがあります。既存のco-foldingモデルの多くは「タンパク質は残基単位、リガンドは原子単位」という分離表現を採用していますが、これが異なる分子種間の転移学習を妨げ、モデルが物理法則そのものよりも既知の相互作用パターンを記憶する傾向を助長していると論文は指摘しています。ペプチド・低分子・タンパク質を同じ土台で扱うことで、この壁を取り払おうとしているわけです。

もう1つの特徴が、多様なポーズを大量に生成する拡散過程の使い方です。既存のco-foldingモデルは再帰処理と拡散過程を使っているにもかかわらず、生成される構造の多様性が乏しく、未知の相互作用への対応力が限られていました。Vilya-2は多様なポーズを大量に生成し、信頼度モデル(plddt-ligand)でランキングすることで、未知の相互作用にも複数の解を探索できるように設計されています。

なお、標的タンパク質側の構造情報としては、Cα原子間の疎な距離だけを追加入力として与え、側鎖の配置は与えません。全鎖のco-foldingを目指すのではなく、標的の大まかな構造とエピトープ(結合部位)が既知であるという実務上の前提に立ち、結合部位周辺の局所的な構造モデリングに問題設定を絞り込んでいる点も、既存手法との大きな違いです。

結果

最大の成果は、新設したペプチド界面ベンチマークRiptides(88件の多様なペプチド-タンパク質複合体、うち51件が非天然マクロサイクル)における精度です。Vilya-2は100サンプル生成時に、backbone RMSD 2Å未満で54.1%、1Å未満で38.0%の複合体で正解構造を再現しました。

比較対象のBoltz-2は、同じ指標で40.9%(2Å未満)、22.7%(1Å未満)にとどまりました。物理ベースのドッキング手法(Schrödinger社のMacroDock/Glide)はさらに低く、22.0%(2Å未満)、15.9%(1Å未満)と、Vilya-2の半分以下の精度です。

構造予測に加えて、基盤モデルとしての転用可能性も検証されています。社内のhit-to-lead最適化キャンペーンの実測活性データでファインチューニングしたところ、EF20%(上位20%化合物中の活性化合物濃縮率)で3倍の濃縮を達成し、ベースライン手法(KNN-ECFPやChemProp)を上回りました。

Vilya-2の標的条件付けはバックボーン(Cα間の疎な距離)のみで、側鎖配置の情報は与えていません。これは側鎖の可動性が結合ダイナミクスの主因であるという前提に基づく設計判断ですが、真の受容体コンフォメーションが未知のクロスドッキング状況にどこまで頑健かは別の問題です。論文はこれをPoseXベンチマークで検証し、自己ドッキングからクロスドッキングへの性能低下が約5%にとどまることを示して、この設計判断の妥当性を裏付けています。