本文來(lái)自微信公眾號(hào): 深究科學(xué) ,作者:深究科學(xué)
AlphaFold徹底改寫(xiě)了蛋白質(zhì)結(jié)構(gòu)預(yù)測(cè)領(lǐng)域,讓整個(gè)生物醫(yī)藥界對(duì)AI抗體設(shè)計(jì)寄予極高期待。
大量論文、預(yù)印本、商業(yè)宣傳不斷渲染:AI可以直接在計(jì)算機(jī)里“造出”高親和力治療性抗體,跳過(guò)繁瑣的噬菌體、酵母展示篩選,大幅壓縮抗體藥物研發(fā)周期。
近日,一項(xiàng)名為“AIntibody Challenge”(抗體AI挑戰(zhàn)賽)的研究結(jié)果顯示,AI在某些任務(wù)上確實(shí)能贏(yíng),甚至超越傳統(tǒng)實(shí)驗(yàn),但遠(yuǎn)未到“無(wú)所不能”的程度,且不同AI模型的能力差異巨大,跨任務(wù)泛化能力有限。
8月26日,一篇發(fā)表在Nature Biotechnology的重磅工作,AIntibody盲法前瞻性挑戰(zhàn)賽,效仿CASP蛋白質(zhì)結(jié)構(gòu)預(yù)測(cè)競(jìng)賽,集結(jié)29家機(jī)構(gòu),交出511條AI設(shè)計(jì)抗體序列,全部合成真實(shí)驗(yàn)證,用SPR、KinExA測(cè)定真實(shí)親和力,搭配5項(xiàng)可開(kāi)發(fā)性實(shí)驗(yàn),完成一次不帶濾鏡的“AI抗體全真大考”。

這場(chǎng)測(cè)試沒(méi)有推翻AI的價(jià)值,但撕下行業(yè)泡沫,清晰劃出當(dāng)下AI抗體能做什么、做不到什么。
01
三大任務(wù),直面工業(yè)真實(shí)場(chǎng)景
挑戰(zhàn)賽選用研究最充分的SARS?CoV?2 RBD作為抗原,設(shè)置三個(gè)高度貼合抗體藥物管線(xiàn)的任務(wù),全部采用盲測(cè)前瞻性設(shè)計(jì):參賽團(tuán)隊(duì)拿到測(cè)序數(shù)據(jù)集,不知道真實(shí)實(shí)驗(yàn)結(jié)果,提交序列;主辦方統(tǒng)一合成全長(zhǎng)IgG,標(biāo)準(zhǔn)化實(shí)驗(yàn)檢測(cè)親和力與成藥性,杜絕回顧性分析帶來(lái)的虛高性能。
任務(wù)1:計(jì)算機(jī)親和力成熟(In?silico親和力成熟)

給定一輪篩選后的NGS測(cè)序數(shù)據(jù),固定HCDR3與框架區(qū),只修改其余CDR,在原有親本抗體基礎(chǔ)上優(yōu)化親和力,同時(shí)保證可開(kāi)發(fā)性。對(duì)應(yīng)工業(yè)界抗體后期親和力優(yōu)化環(huán)節(jié)。
任務(wù)2:HCDR3簇內(nèi)親和力排序

數(shù)據(jù)集被劃分成3個(gè)HCDR3序列簇(27F、28F、47F),團(tuán)隊(duì)需要從數(shù)千條序列里,預(yù)測(cè)每個(gè)簇內(nèi)親和力最高、成藥性合格的抗體。對(duì)應(yīng)高通量測(cè)序后,從海量克隆里挑出最優(yōu)候選的hit?expansion流程。
任務(wù)3:庫(kù)外全新CDR設(shè)計(jì)

基于全部測(cè)序數(shù)據(jù)集,生成數(shù)據(jù)庫(kù)中不存在的全新CDR組合,框架保持不變,追求高親和力與良好成藥性,代表最有想象力的“從頭AI抗體設(shè)計(jì)”。
評(píng)價(jià)標(biāo)準(zhǔn)不只有親和力KD,還引入藥物開(kāi)發(fā)至關(guān)重要的可開(kāi)發(fā)性(developability):熱穩(wěn)定性Tm、聚集溫度Tagg、疏水性HIC、多特異性BVP、自相互作用AC?SINS五項(xiàng)實(shí)驗(yàn),每條抗體打分,總分≤3才算具備藥物開(kāi)發(fā)潛力,避免“親和力爆表,但一做藥就聚集、多特異、無(wú)法生產(chǎn)”的紙上分子。
02
成績(jī)單——有高光,也有不足
任務(wù)1親和力成熟:AI真正閃光的地方
在已有親本抗體、充足測(cè)序多樣性數(shù)據(jù)加持下,AI交出了全場(chǎng)最好的答卷。Aureka的結(jié)構(gòu)感知模型拿到95?pM的抗體,和親本相比親和力提升約2000倍,與實(shí)驗(yàn)篩選得到的最優(yōu)抗體(113?pM)統(tǒng)計(jì)學(xué)上幾乎持平。
有意思的是,不用復(fù)雜AI的簡(jiǎn)單統(tǒng)計(jì)共識(shí)法(ProBioGen)也拿到第三名540?pM的優(yōu)異結(jié)果,僅僅對(duì)測(cè)序庫(kù)做位置頻率統(tǒng)計(jì),不靠深度學(xué)習(xí)就超過(guò)絕大多數(shù)AI算法。
整體統(tǒng)計(jì):166條提交序列中,63%同時(shí)做到結(jié)合抗原且可開(kāi)發(fā);3%拿到亞納摩爾親和力,0.6%實(shí)現(xiàn)小于100?pM超高親和力。
這證明:當(dāng)擁有充足真實(shí)篩選測(cè)序數(shù)據(jù),針對(duì)已有抗體做局部CDR優(yōu)化,AI確實(shí)可以縮短2?3周實(shí)驗(yàn)周期,具備實(shí)實(shí)在在工業(yè)價(jià)值。但也存在問(wèn)題:部分團(tuán)隊(duì)一條合格可開(kāi)發(fā)結(jié)合抗體都沒(méi)有,模型之間差距巨大。
任務(wù)2簇內(nèi)預(yù)測(cè):大部分AI,干不過(guò)隨機(jī)挑選克隆
這是全文最顛覆認(rèn)知的結(jié)論。
研究基線(xiàn)顯示,從HCDR3簇里隨機(jī)挑選克隆,就有39%概率比豐度最高的簇對(duì)照親和力更好。

但絕大多數(shù)AI模型的表現(xiàn)低于這個(gè)隨機(jī)基線(xiàn):AI提交序列中,只有9.8%?13.8%優(yōu)于簇對(duì)照。全26支隊(duì)伍里,僅有華盛頓大學(xué)WashU一支隊(duì)伍超過(guò)隨機(jī)基線(xiàn)。即便任務(wù)拿到部分真實(shí)親和力標(biāo)簽,大部分AI依然無(wú)法從海量序列中精準(zhǔn)定位高親和力克隆。
同時(shí),模型沒(méi)有跨集群泛化能力:同一個(gè)贏(yíng)算法,在A(yíng)簇奪冠,換到B簇就表現(xiàn)平庸。
這里暴露行業(yè)巨大痛點(diǎn):親和力預(yù)測(cè)依然是整個(gè)領(lǐng)域最大短板。即便有測(cè)序、部分親和力標(biāo)簽,想直接從序列預(yù)測(cè)真實(shí)結(jié)合強(qiáng)弱,現(xiàn)有模型依然非常吃力,遠(yuǎn)達(dá)不到工業(yè)期待。另外HCDR3深刻決定可開(kāi)發(fā)性,同一個(gè)算法,在47F簇全部抗體成藥性?xún)?yōu)秀,換到28F簇大量分子出現(xiàn)聚集、多特異性問(wèn)題,算法很難預(yù)判這些生物物理風(fēng)險(xiǎn)。
任務(wù)3庫(kù)外全新CDR設(shè)計(jì):能造出超級(jí)分子,但“藥化陷阱”重重
Xencor的蛋白語(yǔ)言模型產(chǎn)出全場(chǎng)最強(qiáng)2.9?pM的超緊密結(jié)合抗體。然而,這支冠軍抗體在疏水性HIC色譜柱無(wú)法有效洗脫——按照藥物開(kāi)發(fā)標(biāo)準(zhǔn)屬于嚴(yán)重致命缺陷。挑戰(zhàn)賽的加權(quán)計(jì)分規(guī)則允許單項(xiàng)失敗被其他指標(biāo)抵消,才讓它拿到第一名,但現(xiàn)實(shí)藥物開(kāi)發(fā)中會(huì)被直接淘汰。

全局結(jié)果:168條提交序列,接近三分之一(30.4%)完全不結(jié)合抗原;即便結(jié)合,高親和力分子往往伴隨成藥性缺陷。很多獲勝設(shè)計(jì)并非天馬行空全新HCDR3,只是在數(shù)據(jù)集已有的HCDR3基礎(chǔ)上,對(duì)周邊CDR做少量保守突變,真正意義上完全跳出原有文庫(kù)的創(chuàng)新很少。
這也意味著,當(dāng)下生成式AI更擅長(zhǎng)“微調(diào)或改良”,而不是憑空創(chuàng)造。
03
不存在“通殺一切”的萬(wàn)能模型
參賽方法被分為四大類(lèi):統(tǒng)計(jì)啟發(fā)式基線(xiàn)、傳統(tǒng)機(jī)器學(xué)習(xí)、蛋白語(yǔ)言模型PLM(Transformer/抗體大模型)、結(jié)構(gòu)感知方法(AlphaFold3、ProteinMPNN等)。
挑戰(zhàn)賽得出一個(gè)非常務(wù)實(shí)的結(jié)論:沒(méi)有一類(lèi)算法在全部任務(wù)通吃,最優(yōu)方案高度依賴(lài)任務(wù)類(lèi)型。

親和力成熟任務(wù):結(jié)構(gòu)感知+蛋白語(yǔ)言模型組合奪冠,簡(jiǎn)單統(tǒng)計(jì)基線(xiàn)也可以打出高分;
簇內(nèi)預(yù)測(cè)任務(wù):冠軍來(lái)自傳統(tǒng)高斯過(guò)程回歸、定制Transformer、PLM,不同簇勝出方法完全不同,沒(méi)有一類(lèi)技術(shù)占絕對(duì)上風(fēng);
庫(kù)外全新CDR生成:蛋白語(yǔ)言模型表現(xiàn)相對(duì)最好。
同一個(gè)團(tuán)隊(duì)的同一套算法,往往是“一個(gè)任務(wù)封神,另一個(gè)任務(wù)拉胯”,跨任務(wù)泛化能力普遍很差。
論文提出務(wù)實(shí)思路,工業(yè)管線(xiàn)不要迷信“一個(gè)模型解決全部問(wèn)題”,應(yīng)當(dāng)采用組合策略:
庫(kù)內(nèi)親和力成熟:可以使用統(tǒng)計(jì)共識(shí)+AI模型并行;
簇內(nèi)候選篩選:不能完全依賴(lài)AI預(yù)測(cè),保留隨機(jī)挑選作為重要基線(xiàn);
全新序列生成:優(yōu)先蛋白語(yǔ)言模型,但必須嚴(yán)格后續(xù)實(shí)驗(yàn)驗(yàn)證成藥性。
同時(shí),研究發(fā)現(xiàn),可開(kāi)發(fā)性很難靠計(jì)算精準(zhǔn)預(yù)判。大量AI給出高親和力序列,會(huì)出現(xiàn)多特異性、聚集風(fēng)險(xiǎn);計(jì)算打分不能可靠替代五項(xiàng)濕實(shí)驗(yàn)檢測(cè)。
AIntibody最大價(jià)值,是給整個(gè)領(lǐng)域敲了一記警鐘:很多論文的亮眼效果,來(lái)自回顧性數(shù)據(jù)集的“便利光環(huán)”,一旦切換成盲法、前瞻性、全部合成實(shí)測(cè),性能會(huì)大幅縮水。
在合適場(chǎng)景,也就是已有結(jié)合分子、擁有高質(zhì)量測(cè)序數(shù)據(jù)集,做局部CDR親和力優(yōu)化,AI確實(shí)可以產(chǎn)出媲美實(shí)驗(yàn)篩選的候選,節(jié)約實(shí)驗(yàn)時(shí)間成本。
但現(xiàn)階段AI不能完全替代濕實(shí)驗(yàn),它更適合作為“高效候選生成器”,產(chǎn)出一批候選序列,仍然必須經(jīng)過(guò)完整體外實(shí)驗(yàn)驗(yàn)證親和力與成藥性。
04
下一代AIntibody的方向
這項(xiàng)研究只是第一代基準(zhǔn),作者公布全部測(cè)序、親和力、成藥性原始數(shù)據(jù),全部獲勝團(tuán)隊(duì)開(kāi)源代碼,供全球科研人員測(cè)試迭代自己的算法。
下一代AIntibody挑戰(zhàn)賽計(jì)劃:
取消大量預(yù)先提供的親和力標(biāo)簽,模擬早期真實(shí)抗體發(fā)現(xiàn),僅輸入測(cè)序數(shù)據(jù);
修改評(píng)分規(guī)則,設(shè)置硬性成藥性一票否決,杜絕“高親和力抵消成藥性缺陷”;
拓展更多抗原靶點(diǎn),擺脫本次僅使用RBD的局限,檢驗(yàn)?zāi)P涂缈乖夯芰Α?/p>
AIntibody的啟示,不止局限抗體AI,對(duì)整個(gè)生成生物學(xué)都有借鑒意義:
仿真、回顧性測(cè)試只能作為前期篩選;真正的金標(biāo)準(zhǔn)永遠(yuǎn)是盲法前瞻性+全部實(shí)驗(yàn)驗(yàn)證。
AI抗體設(shè)計(jì)不是“已經(jīng)實(shí)現(xiàn)革命”,而是站在轉(zhuǎn)折點(diǎn)。它已經(jīng)拿到入場(chǎng)券,在部分場(chǎng)景可以賦能藥物研發(fā),但距離可以脫離實(shí)驗(yàn)、“輸入抗原直接輸出臨床級(jí)抗體”的終極理想,仍隔著巨大的生物現(xiàn)實(shí)鴻溝。
參考文獻(xiàn)
Erasmus M F,et al.A blinded,prospective benchmark of in silico antibody discovery anchored to experimental affinity and developability.Nature Biotechnology,2026,doi:10.1038/s41587?026?03238?6
