論文タイトル
A blinded, prospective benchmark of in silico antibody discovery anchored to experimental affinity and developability
出典

要旨
計算機による抗体設計・親和性予測を実験的に検証する初のブラインド・プロスペクティブ(前向き)ベンチマーク「AIntibody」が実施されました。29組織から提出された511種のAI設計・予測抗体配列を、SARS-CoV-2のRBD(受容体結合ドメイン)を対象にした3つの課題で評価し、SPRとKinExAによる親和性測定、5項目のdevelopability(開発可能性)アッセイで実験的に裏づけています。
解説など
背景
タンパク質の立体構造予測では、CASPという継続的なブラインド評価の枠組みがあり、AlphaFoldの進歩を客観的に裏づけました。一方、計算機による抗体設計の分野には、これに相当する「前向き・ブラインド・実験検証つき」のベンチマークがこれまで存在しませんでした。
このギャップを埋めるべく立ち上げられたのが「AIntibody」チャレンジです。対象抗原には、史上最もよく研究されたタンパク質のひとつであるSARS-CoV-2のRBD(受容体結合ドメイン)が選ばれました。
本論文の特徴
チャレンジは、抗体創薬パイプラインの異なる段階を模した3つの課題で構成されました。
- 課題1:in silico親和性成熟 — 親抗体のCDRライブラリの選抜配列(NGSデータ)から、より高親和性・開発可能な配列を設計する
- 課題2:HCDR3クラスタ内の親和性ランキング — 選抜出力中のHCDR3クラスタの中から、最高親和性の抗体を見抜く
- 課題3:ライブラリ外CDR設計 — 選抜出力に存在しない新規CDR配列を設計し、最高親和性を狙う
それぞれの課題をもう少し詳しく見ていきます。
課題1:3種類のサブライブラリとNGSデータ
親抗体(parental antibody)のCDR配列の一部だけをランダム化した、以下の3種類のサブライブラリが用意されました。
| サブライブラリ | ランダム化した領域 |
|---|---|
| L1L2ライブラリ | LCDR1+LCDR2 |
| L3ライブラリ | LCDR3 |
| H1H2ライブラリ | HCDR1+HCDR2 |
これらをそれぞれ酵母ディスプレイでRBDへの結合選抜(セレクション)にかけ、生き残った変異体集団を次世代シーケンシング(NGS)で読んだ配列データが参加者に与えられました。参加者はHCDR3とフレームワークを変えずに、この3つの断片的な選抜結果を手がかりに、より高親和性・開発可能な配列を設計します。
課題2:HCDR3クラスタとは何か
課題1とは別の半合成抗体ライブラリ(天然由来のCDRと人工的な変異CDRを組み合わせ、既知の開発可能な抗体骨格に埋め込んだもの)をRBDで選抜した出力データが題材です。
- 選抜出力の中から、同じ、あるいは非常に似たHCDR3配列を持つ配列どうしをまとめた「HCDR3クラスタ」を3つ抽出
- クラスタごとの配列数:27F=2,524配列、28F=3,554配列、47F=410配列
- 各クラスタの中で最も出現頻度の高い配列(クラスタ対照配列)は、必ず結合はするが最高親和性とは限らない
- 課題内容:各クラスタの中から、最高親和性かつ開発可能な抗体を見抜く
課題3:ライブラリ外設計
- 元データ:32,059配列(課題2のクラスタの元になった選抜出力全体)、うち142抗体分に親和性データあり
- 制約:フレームワークは変えない(CDRのみ改変・新規設計)
- 課題内容:既存データに存在しない新規CDR配列を設計し、最高親和性を狙う
課題ごとの事前情報の違い
各課題で参加者に与えられた情報量には、実は明確な差があります。
| 課題 | 配列プール(VL+VH) | 事前開示された親和性データ |
|---|---|---|
| 課題1 | 185,097配列 | なし(親抗体のみ) |
| 課題2(27F/28F/47F) | 2,524/3,554/410配列 | 22/14/3抗体分 |
| 課題3 | 32,059配列 | 142抗体分 |
参加組織と評価体制
29組織が参加し、計511配列を提出しました。内訳は以下の通りです。
| 組織タイプ | 参加組織数 |
|---|---|
| 学術・非営利 | 10 |
| AIバイオテック | 8 |
| 中小バイオテック | 5 |
| 大手製薬 | 5 |
| ビッグテック | 1 |
提出配列はすべてIgGとして合成・発現され、独立ラボによりSPR・KinExA・5項目のdevelopabilityパネルで統一的に評価されています。手法は以下の5クラスに分類されました。
| 手法クラス | 内容 | 代表例 |
|---|---|---|
| 統計・ヒューリスティック | NGSの出現頻度集計など、学習モデルを使わない | ProBioGen(コンセンサス配列) |
| 古典的ML | GP回帰、AutoMLなど、注意機構を使わないシンプルなモデル | UCSD(課題2) |
| PLM/注意機構ベース | ESM-2等の事前学習済みタンパク質言語モデル | Xencor、WashU |
| 構造ベース | AlphaFold3、ProteinMPNN、RFdiffusion等を明示的に利用 | Aureka、Scripps |
| 非開示 | 手法を開示しなかった参加者 | — |
結果
課題1(親和性成熟)
- 25組織・165提出中118(71.5%)が結合し、86.1%がdevelopability基準を通過
- 優勝:Aureka(AIバイオテック)。親和性95 pM(実験群ベストの113 pMと統計的に同等)。手法はPLMと構造予測を組み合わせたアーキテクチャ
- 注目点:機械学習を一切使わない「コンセンサス配列」手法(ProBioGen)が540 pMでKinExA順位3位につけ、ほとんどのAI設計を上回った
課題2(HCDR3クラスタ内ランキング) — 本研究で最も厳しい結果が出た課題
- 対照配列を上回る確率:ランダムに抽出したクローンでは約39%、AIの予測ではクラスタごとに9.8〜13.8%にとどまり、「対照配列を上回る」的中率そのものがAIの方がランダム抽出よりはるかに低かった
- 唯一の例外:WashUがあるクラスタで50%を達成したが、同じ手法を別のクラスタに適用すると効果がなく、クラスタをまたいだ汎化はできなかった
課題3(ライブラリ外CDR設計)
- 23組織・168提出中117(69.6%)が結合し、53.6%が結合かつ開発可能
- 優勝:Xencor(PLM手法)。親和性2.9 pM
- ただしこの配列はHIC(疎水性相互作用クロマトグラフィー)カラムから溶出できないという重大な欠陥を抱えており、著者らは「臨床候補としては失格になる可能性が高い」と明記
- 5アッセイの合計点で合否を決める複合スコアリングの設計上、この1項目の重大な失敗が高親和性によって相殺されてしまった
考察
この研究が示した最大のメッセージは、AIが効く場面と効かない場面がタスクごとに驚くほどはっきり分かれるということです。課題1のように既存データからの最適化を行うタスクではAIが実力を発揮した一方、課題2のように選抜出力から高親和性クローンを見抜くタスクでは、大半のAI手法が「最頻出クローンを選ぶ」「ランダムに追加で拾う」という非AI的な戦略に劣後しました。著者らは「多くの参加者にとって、AIモデルによる選抜は実際には逆効果だった」と率直に記しています。課題1で機械学習なしのコンセンサス配列が好成績を収めたことも、AIの価値を測る上での重要な基準点になっています。
手法クラスとタスクの相性も課題ごとに異なりました。
| 課題 | 優勝手法クラス | 優勝組織 |
|---|---|---|
| 課題1 | PLM+構造ベース | Aureka |
| 課題2(27F/28F/47F) | 古典的ML/PLM+構造ベース、カスタムtransformer+PLM、カスタムtransformer | UCSD・Scripps/Xencor・WashU/WashU |
| 課題3 | PLMベース | Xencor |
課題1はPLMと構造予測の組み合わせが、課題3は事前学習済み言語モデル(PLM)が優勢だった一方、課題2ではクラスタごとに勝者の手法が入れ替わり、単一の手法クラスが全クラスタを制することはありませんでした。著者らはこの結果から、「1つのモデルで全てをカバーする」のではなく、タスクの性質に応じて手法を使い分ける「ポートフォリオ的アプローチ」を推奨しています。
なお、優勝5組織のうち「AI企業」を名乗るのはAurekaのみで、残りは学術機関(Scripps、UCSD、WashU)やAI専業ではない中堅バイオテック(Xencor)でした。著者らは次回2026年のチャレンジで、親和性データなしの条件や、致命的なdevelopability欠陥を即座に失格とする基準の導入を検討するとしています。

