久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**ARC-AGI-3測(cè)試顯示,同一模型GPT-6 Astra在不同Harness下得分從62.7%升至98.6%,成本反降34%;YC據(jù)此判斷,AI競(jìng)爭(zhēng)重心正從模型能力轉(zhuǎn)向Harness,即模型外部的運(yùn)行框架與組織方式。** **要點(diǎn)** **1. Harness決定模型能力兌現(xiàn)程度** Harness涵蓋提示詞、上下文管理、工具調(diào)用、記憶與子Agent分工等外部框架。同一模型僅更換Harness,得分差出35.9個(gè)百分點(diǎn),證明模型能力正變成“給定條件”,勝負(fù)手轉(zhuǎn)向“如何組織模型”。 **2. Harness正與模型邊界打通** 從自動(dòng)優(yōu)化提示詞的DSPy,到能修改Harness代碼的Darwin G?del Machine,再到回看歷史經(jīng)驗(yàn)迭代的Continual Harness,優(yōu)化對(duì)象正從模型外部走向模型內(nèi)部,Agent進(jìn)步開(kāi)始依賴(lài)Harness迭代。 **3. 好Harness少寫(xiě)流程、多備資源** Prime Agent采用“信息分層”設(shè)計(jì),將上下文、REPL運(yùn)行環(huán)境和外部存儲(chǔ)分離,并保留子Agent上下文。在連續(xù)七天《異星工廠》任務(wù)中,Agent調(diào)用633個(gè)子Agent、產(chǎn)生超2300萬(wàn)Token,出現(xiàn)重大失誤后仍能基于保存的狀態(tài)繼續(xù)推進(jìn)。 **4. Harness可部分彌補(bǔ)小模型能力差距** 本地模型與云端前沿模型差距約6—12個(gè)月。OpenJarvis通過(guò)五層系統(tǒng)優(yōu)化,在Qwen3.5-9B參數(shù)不變的情況下追回56%—77%的性能損失,整體準(zhǔn)確率與Claude Opus 4.6僅差3.2個(gè)百分點(diǎn),邊際API成本約為后者八百分之一。 **5. 企業(yè)級(jí)Harness核心是運(yùn)維與權(quán)限** Agent規(guī)模化后出現(xiàn)“主角綜合征”、輕易放棄和權(quán)限失控等問(wèn)題。YC的QM將Agent狀態(tài)集中管理,并通過(guò)只讀數(shù)據(jù)庫(kù)、人工確認(rèn)等方式控制權(quán)限,但人工審核仍可能退化為形式,真正有效的權(quán)限治理尚未解決。
YC最新判斷:Harness比模型更重要
2026-09-20 19:09

YC最新判斷:Harness比模型更重要

本文來(lái)自微信公眾號(hào): 硅基觀察Pro ,作者:硅基君


9月3日,ARC Prize(一個(gè)測(cè)試接近人類(lèi)極限推理能力的綜合考試)公布了ARC-AGI-3的最新成績(jī),數(shù)據(jù)有點(diǎn)反直覺(jué)。


同一個(gè)模型——GPT-6 Astra,同樣的推理強(qiáng)度,在兩套不同的Harness下,卻跑出來(lái)了截然不同的成績(jī):


放進(jìn)標(biāo)準(zhǔn)Harness,得分62.7%;換成Provider Adapter Harness,得分98.6%。


請(qǐng)注意,這不是兩個(gè)模型的對(duì)比,是同一個(gè)模型的兩次考試,分差35.9個(gè)百分點(diǎn)。


更反直覺(jué)的是成本。得分更高的那一組,花費(fèi)反而更低:從約2.61萬(wàn)美元降到1.73萬(wàn)美元,降了約34%。


大腦沒(méi)換,只是換了工作方式,Agent幾乎變成了另一個(gè)水平。


幾天后,YC專(zhuān)門(mén)辦了一場(chǎng)Paper Club,主題就叫《Why the Harness Matters More Than the Model》。這場(chǎng)分享由YC的Fran?ois Chaubard主持,請(qǐng)來(lái)了三組不同視角的研究員:Prime Intellect的Seth Karten、斯坦福的Jon Saad-Falcon,以及YC自己的Josh France和Regan Bell。


他們的研究側(cè)重不同,但都把目光放到了同一件事上,模型外面的那套東西——Harness。


先說(shuō)基本結(jié)論:AI競(jìng)爭(zhēng)的勝負(fù)手,正在從"誰(shuí)的模型更強(qiáng)",轉(zhuǎn)向"誰(shuí)能把模型更好地組織起來(lái)"。


模型能力正在變成一種"給定條件"。在這個(gè)條件相同的情況下,Agent之間還能差出36個(gè)百分點(diǎn)。這36個(gè)百分點(diǎn),就是Harness的價(jià)值空間。


那么問(wèn)題來(lái)了——Harness到底是什么?它為什么能拉開(kāi)這么大差距?這篇文章硅基君就順著這場(chǎng)分享拆一下。


/01/


Harness,就是模型外面那套"工作方式"


Harness這個(gè)詞的本義是"馬具"——套在馬身上,把馬的力量傳導(dǎo)到車(chē)上的那套裝置。


放在AI語(yǔ)境里,它指的就是大模型在完成真實(shí)任務(wù)時(shí),外面那一整套運(yùn)行框架:系統(tǒng)提示詞怎么寫(xiě)、上下文怎么組織、能調(diào)用哪些工具、記憶存在哪、子Agent怎么分工、會(huì)話怎么管理。


一個(gè)形象的區(qū)分是,模型決定"大腦有多聰明",Harness決定"這個(gè)大腦干活時(shí)手里有什么"。


Agent執(zhí)行任務(wù)的時(shí)候,能看到哪些資料、能用什么工具、前面做到哪一步還能不能接著干,這些都不由模型決定,而由Harness決定。


YC合伙人Fran?ois Chaubard親歷過(guò)這種變化。


今年3月,他在試用Karpathy的自動(dòng)研究項(xiàng)目時(shí),最初只是想加個(gè)界面,好看清楚Agent到底在做什么、實(shí)驗(yàn)跑到哪一步。結(jié)果做著做著,資料檢索、實(shí)驗(yàn)、評(píng)審、寫(xiě)作、進(jìn)度管理陸續(xù)被接了進(jìn)來(lái)——他后來(lái)才發(fā)現(xiàn),自己無(wú)意中搭出了一套完整的Harness。


現(xiàn)在他只需要給出研究方向和評(píng)價(jià)指標(biāo),后面的工作就由多個(gè)Agent持續(xù)推進(jìn)。三四月份產(chǎn)出的論文還比較粗糙;到后來(lái),他會(huì)一次丟進(jìn)去多個(gè)研究想法,讓系統(tǒng)自己跑,過(guò)一陣回來(lái)收結(jié)果,質(zhì)量已經(jīng)相當(dāng)不錯(cuò)。


模型沒(méi)有更新?lián)Q代,但Agent交付的結(jié)果越來(lái)越好。


這背后有一個(gè)很樸素的道理:模型決定上限,Harness決定你能不能摸到這個(gè)上限。


這里還要補(bǔ)一句背景。Harness這類(lèi)工作,過(guò)去在機(jī)器學(xué)習(xí)圈子里一直"不上臺(tái)面"。改提示詞、接工具、套任務(wù)循環(huán),聽(tīng)起來(lái)更像工程優(yōu)化而不是模型研究,甚至有人公開(kāi)質(zhì)疑這算不算真正的AI研究。


但現(xiàn)在,這個(gè)被輕視的環(huán)節(jié),已經(jīng)可以直接拉開(kāi)成績(jī)了。


/02/


Harness和模型的邊界,正在被打通


過(guò)去幾年,Harness的重心一直是增加能力。現(xiàn)在,Harness本身開(kāi)始成為優(yōu)化對(duì)象。


最先被優(yōu)化的,是提示詞。以前提示詞不好用,靠人一次次試?,F(xiàn)在DSPy這類(lèi)系統(tǒng)可以自己嘗試不同寫(xiě)法,再用測(cè)試結(jié)果挑出效果最好的版本——把"調(diào)提示詞"從手藝活變成了搜索問(wèn)題。


第二步,優(yōu)化Harness本身。


Darwin G?del Machine(DGM)走得更遠(yuǎn):它不只調(diào)提示詞,還可以直接修改運(yùn)行Agent的Harness代碼。一套任務(wù)流程不好用,就換一種寫(xiě)法,再用測(cè)試結(jié)果判斷新版本是不是更好。在論文實(shí)驗(yàn)中,這套系統(tǒng)把SWE-bench成績(jī)從20%提高到50%。


第三步,讓歷史經(jīng)驗(yàn)進(jìn)入下一版。


Continual Harness補(bǔ)上了另一塊:Agent可以回看過(guò)去的任務(wù)記錄和結(jié)果,再?zèng)Q定要不要修改提示詞、增加技能、更新記憶,或者調(diào)整子Agent配置。


也就是說(shuō),過(guò)去一次次跑任務(wù)留下的經(jīng)驗(yàn),開(kāi)始沉淀進(jìn)下一版Harness。


而當(dāng)前更激進(jìn)的方向,是開(kāi)始讓模型本身也在運(yùn)行中繼續(xù)學(xué)習(xí)——把Agent剛產(chǎn)生的數(shù)據(jù)重新用于訓(xùn)練,甚至在測(cè)試階段直接更新模型權(quán)重。


這意味著什么?


優(yōu)化的方向,正在從Harness往模型里面走。Agent的進(jìn)步,開(kāi)始依賴(lài)Harness的迭代。


換句話說(shuō),Harness和模型之間的邊界,正在被打通。


/03/


好的Harness,不需要把流程寫(xiě)死


一個(gè)反直覺(jué)的發(fā)現(xiàn)是:模型越來(lái)越強(qiáng)以后,Harness反而不需要把每一步都替它寫(xiě)好。


過(guò)去做Agent,常見(jiàn)的思路是把流程拆得很細(xì):第一步做什么,第二步調(diào)用什么工具,第三步怎么判斷結(jié)果。這樣做的好處是穩(wěn)定,但問(wèn)題也很明顯——任務(wù)一旦變長(zhǎng)、環(huán)境發(fā)生變化,提前寫(xiě)好的流程很容易失效。


Prime Intellect的Seth在演講中介紹了團(tuán)隊(duì)開(kāi)發(fā)的Prime Agent。它的思路正好相反:少規(guī)定流程,多給模型準(zhǔn)備可以調(diào)用的資源。


其中一個(gè)核心設(shè)計(jì)叫“信息分層”。Agent需要的信息,被放在三個(gè)不同的地方。


當(dāng)前最重要、正在使用的信息,直接放進(jìn)上下文;如果歷史信息太長(zhǎng),就先壓縮,只保留當(dāng)前任務(wù)真正需要的部分。


程序、計(jì)算結(jié)果和任務(wù)進(jìn)度,則保存在一個(gè)持續(xù)運(yùn)行的REPL里??梢园阉斫獬梢粋€(gè)不會(huì)因?yàn)橐淮握{(diào)用結(jié)束就清空的編程環(huán)境。Agent前面寫(xiě)過(guò)什么代碼、算出了什么結(jié)果、任務(wù)進(jìn)行到哪里,后面都可以直接接著用。


長(zhǎng)期記憶、技能和提示詞則放在外部存儲(chǔ)里,不需要一直塞進(jìn)上下文,需要的時(shí)候再取出來(lái)。


子Agent也是同樣的設(shè)計(jì)。它們完成一次任務(wù)以后,并不會(huì)馬上被“清空”。之前積累的上下文可以保留下來(lái),之后再次被喚醒時(shí),能夠直接接著原來(lái)的工作繼續(xù)做。


也就是說(shuō),Prime重新劃分了Harness和模型之間的職責(zé)。這種設(shè)計(jì)的價(jià)值,在長(zhǎng)周期任務(wù)里最容易體現(xiàn)。


Seth團(tuán)隊(duì)曾讓Agent連續(xù)玩七天《異星工廠》。這是一款非常復(fù)雜的自動(dòng)化經(jīng)營(yíng)游戲,玩家需要自己規(guī)劃生產(chǎn)線、調(diào)配資源、解鎖技術(shù),而且過(guò)程中隨時(shí)可能因?yàn)橐淮五e(cuò)誤操作改變后續(xù)路線。


七天時(shí)間里,Agent一共調(diào)用了633個(gè)子Agent,產(chǎn)生超過(guò)2300萬(wàn)輸出Token。最終完成了196項(xiàng)技術(shù)中的24項(xiàng),并把下一項(xiàng)“高級(jí)電路”的研究推進(jìn)到71%。


過(guò)程中還發(fā)生過(guò)一次嚴(yán)重失誤,進(jìn)度從已經(jīng)完成5項(xiàng)技術(shù)倒退到只剩1項(xiàng)。但系統(tǒng)并沒(méi)有因此清空狀態(tài)、重新開(kāi)始。


此前的程序、資源情況、任務(wù)記錄依然保留著,模型可以根據(jù)新的局面重新判斷下一步怎么走,然后繼續(xù)推進(jìn)。


這其實(shí)就是Harness在長(zhǎng)周期任務(wù)里的核心價(jià)值。對(duì)長(zhǎng)周期任務(wù)來(lái)說(shuō),中間會(huì)遇到大量無(wú)法提前預(yù)設(shè)的情況。模型需要根據(jù)當(dāng)前結(jié)果自己決定下一步,而Harness負(fù)責(zé)把此前的狀態(tài)和工作結(jié)果保存下來(lái),讓這些決定可以連續(xù)發(fā)生。


不過(guò),給模型更大的自主空間,并不意味著Harness可以替代模型本身。


在ARC-AGI-3公開(kāi)集上,Prime搭配Claude Opus 5的RHAE得分達(dá)到95.5%;換成Terra之后,只有25.7%。


同一套Harness,底層模型不同,結(jié)果仍然可以差出近70個(gè)百分點(diǎn)。


所以準(zhǔn)確的說(shuō)法是,Harness很重要,但它不能替代底層模型能力。它放大的是模型已有的能力,而不是憑空創(chuàng)造能力。


/04/


小模型不夠強(qiáng),全靠Harness來(lái)?yè)?/h2>


還有一個(gè)更實(shí)際的場(chǎng)景,是個(gè)人AI的本地化。


今天大量個(gè)人Agent依賴(lài)云端大模型。寫(xiě)作、研究、編程、日程都可以交給它,但代價(jià)很直接——長(zhǎng)期API費(fèi)用可能達(dá)到數(shù)千美元,而且郵件、文件這些個(gè)人資料還要不斷發(fā)到云端。


斯坦福研究者Jon Saad-Falcon在演講中介紹的OpenJarvis,想解決的就是這個(gè)問(wèn)題:盡可能把個(gè)人AI搬回自己的設(shè)備上。


麻煩在于,本地模型還沒(méi)有強(qiáng)到可以直接替代云端模型。


Saad-Falcon提到,現(xiàn)在本地模型和最前沿模型之間,大概還有6—12個(gè)月的能力差距。而且這個(gè)差距,并不是把Claude換成一個(gè)開(kāi)源模型就能解決。


他們做過(guò)一個(gè)很直接的實(shí)驗(yàn):把OpenClaw和Hermes Agent原本使用的Claude Opus 4.6,直接換成Qwen3.5-9B,其他東西全部不動(dòng)。結(jié)果兩項(xiàng)測(cè)試的準(zhǔn)確率分別掉了24.8和38.8個(gè)百分點(diǎn)。


那么問(wèn)題來(lái)了,這個(gè)差距,能不能從模型外面補(bǔ)回來(lái)一部分?


OpenJarvis的思路是,把整個(gè)AI系統(tǒng)都納入優(yōu)化范圍。它把個(gè)人AI拆成五層:模型選什么,模型怎么跑,Agent怎么工作,能調(diào)用哪些工具和記憶,以及系統(tǒng)后面怎么繼續(xù)學(xué)習(xí)。


每一層都可以單獨(dú)調(diào)整,再重新組合。比如,更強(qiáng)的云端模型可以先分析失敗案例,判斷問(wèn)題出在哪,再幫本地系統(tǒng)修改配置;等優(yōu)化結(jié)束后,真正每天運(yùn)行的仍然是本地模型。


一句話就是,大模型負(fù)責(zé)判斷,小模型負(fù)責(zé)執(zhí)行。


效果如何?在Qwen3.5-9B本身完全不變的情況下,整套系統(tǒng)優(yōu)化后,在上述兩項(xiàng)測(cè)試中分別追回了約56%和77%的性能損失。


放到更完整的八項(xiàng)測(cè)試?yán)?,表現(xiàn)最好的一套本地方案平均準(zhǔn)確率做到80.3%,而Claude Opus 4.6是83.5%,差距已經(jīng)縮小到3.2個(gè)百分點(diǎn)。其中有四項(xiàng)測(cè)試,本地方案已經(jīng)追平或者超過(guò)最好的云端結(jié)果。


更重要的是,這個(gè)結(jié)果是在很低的運(yùn)行成本下做到的。按照這組測(cè)試的口徑,本地方案的邊際API成本大約只有云端的八百分之一,端到端延遲也縮短到了大約四分之一。


OpenJarvis證明了一件事,個(gè)人AI從云端走向本地,不一定要等到小模型完全追平大模型,Harness本身就可以先把一部分能力差距補(bǔ)回來(lái)。


/05/


Agent進(jìn)了公司,Harness要管的是運(yùn)維和權(quán)限


最后一個(gè)場(chǎng)景,是企業(yè)。


當(dāng)Agent真正進(jìn)入公司,問(wèn)題就不只是"能不能干活"了。幾十個(gè)Agent同時(shí)運(yùn)行,它們?cè)趺床渴稹⒃趺淳S護(hù),能訪問(wèn)什么信息、又能修改什么,開(kāi)始變得同樣重要。


YC內(nèi)部對(duì)Agent的探索從2025年初就開(kāi)始了。最早只是系統(tǒng)提示詞、工具和任務(wù)循環(huán),后來(lái)陸續(xù)接入Slack、定時(shí)任務(wù)和虛擬機(jī),讓Agent可以修改代碼、運(yùn)行測(cè)試,甚至擁有類(lèi)似"自己電腦"的工作環(huán)境。


但當(dāng)YC把這套能力擴(kuò)到全公司,問(wèn)題馬上出現(xiàn)了。


團(tuán)隊(duì)一度在虛擬機(jī)里部署了50多個(gè)Hermes Agent,每個(gè)人都要單獨(dú)配置;某個(gè)Agent出了故障,工程師還得逐個(gè)登錄對(duì)應(yīng)實(shí)例去排查和修復(fù)。Agent數(shù)量一多,維護(hù)成本立刻就上來(lái)了。


YC的Josh France和Regan Bell介紹了他們內(nèi)部開(kāi)發(fā)的Harness——QM,就是為了解決這類(lèi)規(guī)?;瘑?wèn)題。


QM的核心改動(dòng)是:不再讓Agent"住"在某一臺(tái)機(jī)器里。對(duì)話、上下文和長(zhǎng)期狀態(tài)被集中保存,虛擬機(jī)和隔離環(huán)境則變成需要時(shí)再調(diào)用的資源。Agent可以根據(jù)任務(wù)選擇不同機(jī)器,甚至切換模型服務(wù)商。


到了這一步,Harness的角色已經(jīng)不只是"給單個(gè)Agent接工具"了,而是開(kāi)始負(fù)責(zé)一群Agent的狀態(tài)、資源和運(yùn)行方式。


但規(guī)模化之后,真實(shí)辦公環(huán)境暴露了三個(gè)很難繞開(kāi)的問(wèn)題。


第一個(gè),Agent會(huì)把局部問(wèn)題當(dāng)成全局問(wèn)題。


YC曾嘗試讓Agent根據(jù)運(yùn)行記錄自己發(fā)現(xiàn)Bug、修改系統(tǒng),效果好壞參半。團(tuán)隊(duì)把其中一種失敗模式叫"主角綜合征":Agent只看到自己遇到的那一小塊問(wèn)題,卻可能提出影響整個(gè)系統(tǒng)的修改。目前這類(lèi)修改仍需人工把關(guān)。


第二個(gè),Agent太容易提前放棄。


明明還有時(shí)間和工具,嘗試幾次之后就可能直接宣布任務(wù)失敗。YC的做法是做了個(gè)Grind Tool——給任務(wù)設(shè)定最低運(yùn)行時(shí)間或Token預(yù)算,在達(dá)到門(mén)檻以前不允許它結(jié)束。


第三個(gè),也是最麻煩的,是權(quán)限。


Agent進(jìn)入Slack之后,可以看到大量上下文,卻未必真正理解哪些信息能告訴誰(shuí)。人類(lèi)知道同事私下說(shuō)的話不能隨便轉(zhuǎn)進(jìn)另一個(gè)群,但Agent如果沒(méi)有明確的權(quán)限邊界,敏感信息就可能在不同會(huì)話之間流動(dòng)。


YC目前的做法是:大部分?jǐn)?shù)據(jù)庫(kù)權(quán)限保持只讀,需要寫(xiě)入時(shí)先由Agent提出方案,再由人確認(rèn)。


但人工審核也不是萬(wàn)能答案。隨著員工越來(lái)越信任Agent,人可能逐漸習(xí)慣直接點(diǎn)擊通過(guò)——審核本身也會(huì)退化成一道形式。


這意味著,企業(yè)Agent下一階段真正要補(bǔ)的,可能已經(jīng)不是更多能力,而是一套既能把Agent規(guī)?;芷饋?lái)、又能把權(quán)限真正管住的Harness。


過(guò)去兩年,行業(yè)的注意力幾乎全押在模型上。這沒(méi)有錯(cuò),模型仍然是地基。但接下來(lái),差距會(huì)越來(lái)越多地產(chǎn)生在地基之上。


模型決定你能走多快,Harness決定你能不能一直走下去、走多遠(yuǎn)。

AI行業(yè)信號(hào)頻道: 前沿科技
本內(nèi)容來(lái)源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如涉及版權(quán)問(wèn)題請(qǐng)聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
奉贤区| 台州市| 舞阳县| 庐江县| 徐水县| 昌邑市| 革吉县| 达州市| 正蓝旗| 香格里拉县| 合山市| 湟中县| 伽师县| 白水县| 兰州市| 大化| 海口市| 南城县| 滦平县| 府谷县| 闻喜县| 旬阳县| 广昌县| 越西县| 兴化市| 海丰县| 平度市| 天水市| 班戈县| 福安市| 芷江| 邵阳县| 华安县| 会同县| 淄博市| 洪江市| 盐源县| 永胜县| 延长县| 鄯善县| 义乌市|