本文來(lái)自微信公眾號(hào): 硅基觀察Pro ,作者:硅基君
9月3日,ARC Prize(一個(gè)測(cè)試接近人類(lèi)極限推理能力的綜合考試)公布了ARC-AGI-3的最新成績(jī),數(shù)據(jù)有點(diǎn)反直覺(jué)。
同一個(gè)模型——GPT-6 Astra,同樣的推理強(qiáng)度,在兩套不同的Harness下,卻跑出來(lái)了截然不同的成績(jī):
放進(jìn)標(biāo)準(zhǔn)Harness,得分62.7%;換成Provider Adapter Harness,得分98.6%。
請(qǐng)注意,這不是兩個(gè)模型的對(duì)比,是同一個(gè)模型的兩次考試,分差35.9個(gè)百分點(diǎn)。
更反直覺(jué)的是成本。得分更高的那一組,花費(fèi)反而更低:從約2.61萬(wàn)美元降到1.73萬(wàn)美元,降了約34%。
大腦沒(méi)換,只是換了工作方式,Agent幾乎變成了另一個(gè)水平。
幾天后,YC專(zhuān)門(mén)辦了一場(chǎng)Paper Club,主題就叫《Why the Harness Matters More Than the Model》。這場(chǎng)分享由YC的Fran?ois Chaubard主持,請(qǐng)來(lái)了三組不同視角的研究員:Prime Intellect的Seth Karten、斯坦福的Jon Saad-Falcon,以及YC自己的Josh France和Regan Bell。
他們的研究側(cè)重不同,但都把目光放到了同一件事上,模型外面的那套東西——Harness。
先說(shuō)基本結(jié)論:AI競(jìng)爭(zhēng)的勝負(fù)手,正在從"誰(shuí)的模型更強(qiáng)",轉(zhuǎn)向"誰(shuí)能把模型更好地組織起來(lái)"。
模型能力正在變成一種"給定條件"。在這個(gè)條件相同的情況下,Agent之間還能差出36個(gè)百分點(diǎn)。這36個(gè)百分點(diǎn),就是Harness的價(jià)值空間。
那么問(wèn)題來(lái)了——Harness到底是什么?它為什么能拉開(kāi)這么大差距?這篇文章硅基君就順著這場(chǎng)分享拆一下。
/01/
Harness,就是模型外面那套"工作方式"
Harness這個(gè)詞的本義是"馬具"——套在馬身上,把馬的力量傳導(dǎo)到車(chē)上的那套裝置。
放在AI語(yǔ)境里,它指的就是大模型在完成真實(shí)任務(wù)時(shí),外面那一整套運(yùn)行框架:系統(tǒng)提示詞怎么寫(xiě)、上下文怎么組織、能調(diào)用哪些工具、記憶存在哪、子Agent怎么分工、會(huì)話怎么管理。
一個(gè)形象的區(qū)分是,模型決定"大腦有多聰明",Harness決定"這個(gè)大腦干活時(shí)手里有什么"。
Agent執(zhí)行任務(wù)的時(shí)候,能看到哪些資料、能用什么工具、前面做到哪一步還能不能接著干,這些都不由模型決定,而由Harness決定。
YC合伙人Fran?ois Chaubard親歷過(guò)這種變化。
今年3月,他在試用Karpathy的自動(dòng)研究項(xiàng)目時(shí),最初只是想加個(gè)界面,好看清楚Agent到底在做什么、實(shí)驗(yàn)跑到哪一步。結(jié)果做著做著,資料檢索、實(shí)驗(yàn)、評(píng)審、寫(xiě)作、進(jìn)度管理陸續(xù)被接了進(jìn)來(lái)——他后來(lái)才發(fā)現(xiàn),自己無(wú)意中搭出了一套完整的Harness。
現(xiàn)在他只需要給出研究方向和評(píng)價(jià)指標(biāo),后面的工作就由多個(gè)Agent持續(xù)推進(jìn)。三四月份產(chǎn)出的論文還比較粗糙;到后來(lái),他會(huì)一次丟進(jìn)去多個(gè)研究想法,讓系統(tǒng)自己跑,過(guò)一陣回來(lái)收結(jié)果,質(zhì)量已經(jīng)相當(dāng)不錯(cuò)。
模型沒(méi)有更新?lián)Q代,但Agent交付的結(jié)果越來(lái)越好。
這背后有一個(gè)很樸素的道理:模型決定上限,Harness決定你能不能摸到這個(gè)上限。
這里還要補(bǔ)一句背景。Harness這類(lèi)工作,過(guò)去在機(jī)器學(xué)習(xí)圈子里一直"不上臺(tái)面"。改提示詞、接工具、套任務(wù)循環(huán),聽(tīng)起來(lái)更像工程優(yōu)化而不是模型研究,甚至有人公開(kāi)質(zhì)疑這算不算真正的AI研究。
但現(xiàn)在,這個(gè)被輕視的環(huán)節(jié),已經(jīng)可以直接拉開(kāi)成績(jī)了。
/02/
Harness和模型的邊界,正在被打通
過(guò)去幾年,Harness的重心一直是增加能力。現(xiàn)在,Harness本身開(kāi)始成為優(yōu)化對(duì)象。
最先被優(yōu)化的,是提示詞。以前提示詞不好用,靠人一次次試?,F(xiàn)在DSPy這類(lèi)系統(tǒng)可以自己嘗試不同寫(xiě)法,再用測(cè)試結(jié)果挑出效果最好的版本——把"調(diào)提示詞"從手藝活變成了搜索問(wèn)題。
第二步,優(yōu)化Harness本身。
Darwin G?del Machine(DGM)走得更遠(yuǎn):它不只調(diào)提示詞,還可以直接修改運(yùn)行Agent的Harness代碼。一套任務(wù)流程不好用,就換一種寫(xiě)法,再用測(cè)試結(jié)果判斷新版本是不是更好。在論文實(shí)驗(yàn)中,這套系統(tǒng)把SWE-bench成績(jī)從20%提高到50%。
第三步,讓歷史經(jīng)驗(yàn)進(jìn)入下一版。
Continual Harness補(bǔ)上了另一塊:Agent可以回看過(guò)去的任務(wù)記錄和結(jié)果,再?zèng)Q定要不要修改提示詞、增加技能、更新記憶,或者調(diào)整子Agent配置。
也就是說(shuō),過(guò)去一次次跑任務(wù)留下的經(jīng)驗(yàn),開(kāi)始沉淀進(jìn)下一版Harness。
而當(dāng)前更激進(jìn)的方向,是開(kāi)始讓模型本身也在運(yùn)行中繼續(xù)學(xué)習(xí)——把Agent剛產(chǎn)生的數(shù)據(jù)重新用于訓(xùn)練,甚至在測(cè)試階段直接更新模型權(quán)重。
這意味著什么?
優(yōu)化的方向,正在從Harness往模型里面走。Agent的進(jìn)步,開(kāi)始依賴(lài)Harness的迭代。
換句話說(shuō),Harness和模型之間的邊界,正在被打通。
/03/
好的Harness,不需要把流程寫(xiě)死
一個(gè)反直覺(jué)的發(fā)現(xiàn)是:模型越來(lái)越強(qiáng)以后,Harness反而不需要把每一步都替它寫(xiě)好。
過(guò)去做Agent,常見(jiàn)的思路是把流程拆得很細(xì):第一步做什么,第二步調(diào)用什么工具,第三步怎么判斷結(jié)果。這樣做的好處是穩(wěn)定,但問(wèn)題也很明顯——任務(wù)一旦變長(zhǎng)、環(huán)境發(fā)生變化,提前寫(xiě)好的流程很容易失效。
Prime Intellect的Seth在演講中介紹了團(tuán)隊(duì)開(kāi)發(fā)的Prime Agent。它的思路正好相反:少規(guī)定流程,多給模型準(zhǔn)備可以調(diào)用的資源。
其中一個(gè)核心設(shè)計(jì)叫“信息分層”。Agent需要的信息,被放在三個(gè)不同的地方。
當(dāng)前最重要、正在使用的信息,直接放進(jìn)上下文;如果歷史信息太長(zhǎng),就先壓縮,只保留當(dāng)前任務(wù)真正需要的部分。
程序、計(jì)算結(jié)果和任務(wù)進(jìn)度,則保存在一個(gè)持續(xù)運(yùn)行的REPL里??梢园阉斫獬梢粋€(gè)不會(huì)因?yàn)橐淮握{(diào)用結(jié)束就清空的編程環(huán)境。Agent前面寫(xiě)過(guò)什么代碼、算出了什么結(jié)果、任務(wù)進(jìn)行到哪里,后面都可以直接接著用。
長(zhǎng)期記憶、技能和提示詞則放在外部存儲(chǔ)里,不需要一直塞進(jìn)上下文,需要的時(shí)候再取出來(lái)。
子Agent也是同樣的設(shè)計(jì)。它們完成一次任務(wù)以后,并不會(huì)馬上被“清空”。之前積累的上下文可以保留下來(lái),之后再次被喚醒時(shí),能夠直接接著原來(lái)的工作繼續(xù)做。
也就是說(shuō),Prime重新劃分了Harness和模型之間的職責(zé)。這種設(shè)計(jì)的價(jià)值,在長(zhǎng)周期任務(wù)里最容易體現(xiàn)。
Seth團(tuán)隊(duì)曾讓Agent連續(xù)玩七天《異星工廠》。這是一款非常復(fù)雜的自動(dòng)化經(jīng)營(yíng)游戲,玩家需要自己規(guī)劃生產(chǎn)線、調(diào)配資源、解鎖技術(shù),而且過(guò)程中隨時(shí)可能因?yàn)橐淮五e(cuò)誤操作改變后續(xù)路線。
七天時(shí)間里,Agent一共調(diào)用了633個(gè)子Agent,產(chǎn)生超過(guò)2300萬(wàn)輸出Token。最終完成了196項(xiàng)技術(shù)中的24項(xiàng),并把下一項(xiàng)“高級(jí)電路”的研究推進(jìn)到71%。
過(guò)程中還發(fā)生過(guò)一次嚴(yán)重失誤,進(jìn)度從已經(jīng)完成5項(xiàng)技術(shù)倒退到只剩1項(xiàng)。但系統(tǒng)并沒(méi)有因此清空狀態(tài)、重新開(kāi)始。
此前的程序、資源情況、任務(wù)記錄依然保留著,模型可以根據(jù)新的局面重新判斷下一步怎么走,然后繼續(xù)推進(jìn)。
這其實(shí)就是Harness在長(zhǎng)周期任務(wù)里的核心價(jià)值。對(duì)長(zhǎng)周期任務(wù)來(lái)說(shuō),中間會(huì)遇到大量無(wú)法提前預(yù)設(shè)的情況。模型需要根據(jù)當(dāng)前結(jié)果自己決定下一步,而Harness負(fù)責(zé)把此前的狀態(tài)和工作結(jié)果保存下來(lái),讓這些決定可以連續(xù)發(fā)生。
不過(guò),給模型更大的自主空間,并不意味著Harness可以替代模型本身。
在ARC-AGI-3公開(kāi)集上,Prime搭配Claude Opus 5的RHAE得分達(dá)到95.5%;換成Terra之后,只有25.7%。
同一套Harness,底層模型不同,結(jié)果仍然可以差出近70個(gè)百分點(diǎn)。
所以準(zhǔn)確的說(shuō)法是,Harness很重要,但它不能替代底層模型能力。它放大的是模型已有的能力,而不是憑空創(chuàng)造能力。
/04/
小模型不夠強(qiáng),全靠Harness來(lái)?yè)?/h2>
還有一個(gè)更實(shí)際的場(chǎng)景,是個(gè)人AI的本地化。
今天大量個(gè)人Agent依賴(lài)云端大模型。寫(xiě)作、研究、編程、日程都可以交給它,但代價(jià)很直接——長(zhǎng)期API費(fèi)用可能達(dá)到數(shù)千美元,而且郵件、文件這些個(gè)人資料還要不斷發(fā)到云端。
斯坦福研究者Jon Saad-Falcon在演講中介紹的OpenJarvis,想解決的就是這個(gè)問(wèn)題:盡可能把個(gè)人AI搬回自己的設(shè)備上。
麻煩在于,本地模型還沒(méi)有強(qiáng)到可以直接替代云端模型。
Saad-Falcon提到,現(xiàn)在本地模型和最前沿模型之間,大概還有6—12個(gè)月的能力差距。而且這個(gè)差距,并不是把Claude換成一個(gè)開(kāi)源模型就能解決。
他們做過(guò)一個(gè)很直接的實(shí)驗(yàn):把OpenClaw和Hermes Agent原本使用的Claude Opus 4.6,直接換成Qwen3.5-9B,其他東西全部不動(dòng)。結(jié)果兩項(xiàng)測(cè)試的準(zhǔn)確率分別掉了24.8和38.8個(gè)百分點(diǎn)。
那么問(wèn)題來(lái)了,這個(gè)差距,能不能從模型外面補(bǔ)回來(lái)一部分?
OpenJarvis的思路是,把整個(gè)AI系統(tǒng)都納入優(yōu)化范圍。它把個(gè)人AI拆成五層:模型選什么,模型怎么跑,Agent怎么工作,能調(diào)用哪些工具和記憶,以及系統(tǒng)后面怎么繼續(xù)學(xué)習(xí)。
每一層都可以單獨(dú)調(diào)整,再重新組合。比如,更強(qiáng)的云端模型可以先分析失敗案例,判斷問(wèn)題出在哪,再幫本地系統(tǒng)修改配置;等優(yōu)化結(jié)束后,真正每天運(yùn)行的仍然是本地模型。
一句話就是,大模型負(fù)責(zé)判斷,小模型負(fù)責(zé)執(zhí)行。
效果如何?在Qwen3.5-9B本身完全不變的情況下,整套系統(tǒng)優(yōu)化后,在上述兩項(xiàng)測(cè)試中分別追回了約56%和77%的性能損失。
放到更完整的八項(xiàng)測(cè)試?yán)?,表現(xiàn)最好的一套本地方案平均準(zhǔn)確率做到80.3%,而Claude Opus 4.6是83.5%,差距已經(jīng)縮小到3.2個(gè)百分點(diǎn)。其中有四項(xiàng)測(cè)試,本地方案已經(jīng)追平或者超過(guò)最好的云端結(jié)果。
更重要的是,這個(gè)結(jié)果是在很低的運(yùn)行成本下做到的。按照這組測(cè)試的口徑,本地方案的邊際API成本大約只有云端的八百分之一,端到端延遲也縮短到了大約四分之一。
OpenJarvis證明了一件事,個(gè)人AI從云端走向本地,不一定要等到小模型完全追平大模型,Harness本身就可以先把一部分能力差距補(bǔ)回來(lái)。
/05/
Agent進(jìn)了公司,Harness要管的是運(yùn)維和權(quán)限
最后一個(gè)場(chǎng)景,是企業(yè)。
當(dāng)Agent真正進(jìn)入公司,問(wèn)題就不只是"能不能干活"了。幾十個(gè)Agent同時(shí)運(yùn)行,它們?cè)趺床渴稹⒃趺淳S護(hù),能訪問(wèn)什么信息、又能修改什么,開(kāi)始變得同樣重要。
YC內(nèi)部對(duì)Agent的探索從2025年初就開(kāi)始了。最早只是系統(tǒng)提示詞、工具和任務(wù)循環(huán),后來(lái)陸續(xù)接入Slack、定時(shí)任務(wù)和虛擬機(jī),讓Agent可以修改代碼、運(yùn)行測(cè)試,甚至擁有類(lèi)似"自己電腦"的工作環(huán)境。
但當(dāng)YC把這套能力擴(kuò)到全公司,問(wèn)題馬上出現(xiàn)了。
團(tuán)隊(duì)一度在虛擬機(jī)里部署了50多個(gè)Hermes Agent,每個(gè)人都要單獨(dú)配置;某個(gè)Agent出了故障,工程師還得逐個(gè)登錄對(duì)應(yīng)實(shí)例去排查和修復(fù)。Agent數(shù)量一多,維護(hù)成本立刻就上來(lái)了。
YC的Josh France和Regan Bell介紹了他們內(nèi)部開(kāi)發(fā)的Harness——QM,就是為了解決這類(lèi)規(guī)?;瘑?wèn)題。
QM的核心改動(dòng)是:不再讓Agent"住"在某一臺(tái)機(jī)器里。對(duì)話、上下文和長(zhǎng)期狀態(tài)被集中保存,虛擬機(jī)和隔離環(huán)境則變成需要時(shí)再調(diào)用的資源。Agent可以根據(jù)任務(wù)選擇不同機(jī)器,甚至切換模型服務(wù)商。
到了這一步,Harness的角色已經(jīng)不只是"給單個(gè)Agent接工具"了,而是開(kāi)始負(fù)責(zé)一群Agent的狀態(tài)、資源和運(yùn)行方式。
但規(guī)模化之后,真實(shí)辦公環(huán)境暴露了三個(gè)很難繞開(kāi)的問(wèn)題。
第一個(gè),Agent會(huì)把局部問(wèn)題當(dāng)成全局問(wèn)題。
YC曾嘗試讓Agent根據(jù)運(yùn)行記錄自己發(fā)現(xiàn)Bug、修改系統(tǒng),效果好壞參半。團(tuán)隊(duì)把其中一種失敗模式叫"主角綜合征":Agent只看到自己遇到的那一小塊問(wèn)題,卻可能提出影響整個(gè)系統(tǒng)的修改。目前這類(lèi)修改仍需人工把關(guān)。
第二個(gè),Agent太容易提前放棄。
明明還有時(shí)間和工具,嘗試幾次之后就可能直接宣布任務(wù)失敗。YC的做法是做了個(gè)Grind Tool——給任務(wù)設(shè)定最低運(yùn)行時(shí)間或Token預(yù)算,在達(dá)到門(mén)檻以前不允許它結(jié)束。
第三個(gè),也是最麻煩的,是權(quán)限。
Agent進(jìn)入Slack之后,可以看到大量上下文,卻未必真正理解哪些信息能告訴誰(shuí)。人類(lèi)知道同事私下說(shuō)的話不能隨便轉(zhuǎn)進(jìn)另一個(gè)群,但Agent如果沒(méi)有明確的權(quán)限邊界,敏感信息就可能在不同會(huì)話之間流動(dòng)。
YC目前的做法是:大部分?jǐn)?shù)據(jù)庫(kù)權(quán)限保持只讀,需要寫(xiě)入時(shí)先由Agent提出方案,再由人確認(rèn)。
但人工審核也不是萬(wàn)能答案。隨著員工越來(lái)越信任Agent,人可能逐漸習(xí)慣直接點(diǎn)擊通過(guò)——審核本身也會(huì)退化成一道形式。
這意味著,企業(yè)Agent下一階段真正要補(bǔ)的,可能已經(jīng)不是更多能力,而是一套既能把Agent規(guī)?;芷饋?lái)、又能把權(quán)限真正管住的Harness。
過(guò)去兩年,行業(yè)的注意力幾乎全押在模型上。這沒(méi)有錯(cuò),模型仍然是地基。但接下來(lái),差距會(huì)越來(lái)越多地產(chǎn)生在地基之上。
模型決定你能走多快,Harness決定你能不能一直走下去、走多遠(yuǎn)。
