論文タイトル
A systematic evaluation of in-context learning in large language models for antibody characterization
出典
要旨
GPT・Claude・Gemini・LLaMA・Mistralの5系統・計20個の汎用LLMを対象に、追加学習なしで抗体配列を分類する「in-context learning(ICL)」の性能を体系的に評価した論文です。ヒトらしさ(種オリジン)・抗原特異性・アイソタイプという3つの抗体分類タスクで検証し、配列類似度をもとに手本を選ぶ手法「Sim-ICL」を提案しています。
用語
- in-context learning(ICL): LLMのパラメータを一切更新せず、プロンプト中に与えた例(デモンストレーション)だけを手がかりに新しいタスクをこなす能力
- zero-shot / few-shot: デモンストレーションを一切与えないのがzero-shot、いくつか(k-shot)与えるのがfew-shot
- CoT(Chain-of-Thought)prompting: 最終回答の前にLLMへ途中の推論過程を書かせるプロンプト手法。算数・論理タスクでは精度向上に有効とされる
- kNN-LD: レーベンシュタイン距離に基づくk近傍法。LLMを使わない「検索だけ」のベースラインとして、Sim-ICLの性能がどこまで検索そのものに由来するかを切り分けるために使われる
解説など
背景
ICLは自然言語タスクでは、パラメータ更新(fine-tuning)なしにfew-shotの例だけでファインチューニング済みモデルに匹敵する性能を出せることがあります。ですが、入力がアミノ酸配列であるバイオロジカルな配列分類タスクにこの能力が転用できるかは、これまで十分に検証されていませんでした。既存研究の多くはLLMを「テキスト処理」や「特徴抽出器」として使うにとどまり、配列を直接ICLで分類させる設定はほぼ手つかずだったのです。
著者らは、抗体の性質評価(ヒトらしさ・特異性・アイソタイプ)を題材に、ICLが専用の配列ベースML分類器に匹敵する性能を出せるか、そのためにはプロンプトをどう設計すべきかを検証しました。新しいモデルアーキテクチャの提案ではなく、既存の汎用LLMだけで何ができ、何ができないかを体系的に洗い出すことが主眼の研究です。
本論文の特徴
この論文の核となる提案がSim-ICLです。仕組みはシンプルで、分類したい配列とレーベンシュタイン距離が近い「似た配列」を、ラベル付きの既知データから検索し、それらをfew-shotプロンプトの手本として提示します。
検証は3つの抗体分類タスクで行われました。
- ヒト vs マウス、ヒト vs アカゲザル(ヒトらしさ/種オリジン)
- SARS-CoV-2への結合特異性(あり/なし)
- 重鎖アイソタイプの多クラス分類
比較対象も幅広く、以下を並行して評価しています。
- zero-shotプロンプト(手本なし)
- ランダム選択のfew-shot
- LLMを使わない検索のみのkNN-LDベースライン
- 従来のアミノ酸エンコーディングを使うML分類器
- pLM embeddings(AntiBERTy等)を特徴量とするRF・MLP・CNN・TabPFN分類器
- CoTプロンプト
- moderate-scaleのfine-tuning(1,000〜5,000件で微調整)
各プロンプトは5回繰り返して再現性も確認しており、評価の作り込みが丁寧な論文です。
結果
まず、zero-shotは全タスクでほぼランダムに答えるのと変わらない精度でした。
Sim-ICLはランダム選択より一貫して有意に高精度で、易しいタスク(ヒト vs マウス)ではほぼ完璧な精度に到達しました。一方で、似た配列でも手本のラベルが全て同じ(片方のクラスだけ)に偏ると精度がランダム並みまで低下することもわかり、「似ている」ことと「ラベルが多様である」ことの両方が必要という設計原則が導かれています。
3つの実践的タスクでは、32-shotのSim-ICLが3タスク中2つ(ヒトらしさ・アイソタイプ)でpLMベースのML分類器と同等以上の精度を達成しました。ただし最も難しいタスクである抗原特異性では、最良のpLM分類器(AntiBERTy+MLP, accuracy=0.88)がSim-ICL最良構成(accuracy=0.746)を上回りました。検索のみのkNN-LDと比較すると、易しいタスクでは検索だけで満点に達しLLMの追加寄与はなかった一方、難しいタスクではLLMの多くがkNN-LDを上回り、LLM側に検索以上の寄与があることも示されています。
興味深いのはCoT(Chain-of-Thought)が一貫して逆効果だった点です。Reasoningモデルが生成する「もっともらしい生物学的説明」も、免疫学的に誤っていることが多く、事後的な取り繕いに過ぎないと結論づけられています。プロンプトの入力順・用語のゆらぎ・train-test分割・temperature・random seedといった要因はいずれも性能にほぼ影響しませんでした。
考察
著者らはこれらの知見を4つの実践的な設計原則にまとめています。①手本は配列類似度が高くラベルが多様であるべき、②入力表現はMSAなしの生アミノ酸配列で十分、③shot数は32程度の少数精鋭が効率的(それ以上は収穫逓減)、④CoTは予測精度向上ではなく事後解釈のオプションとして扱うべき、というものです。

