久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**GPT-6 Astra在復(fù)雜任務(wù)、自創(chuàng)符號和數(shù)學(xué)證明上展現(xiàn)重大突破,但評測分?jǐn)?shù)隨接口大幅波動、可靠性隨要求驟降,尚未達(dá)到“通用”標(biāo)準(zhǔn);AGI定義本身缺乏共識,行業(yè)分歧依舊,表明該里程碑仍未跨過。** **要點(diǎn)** **1. AGI定義四分五裂,導(dǎo)致標(biāo)準(zhǔn)打架** OpenAI(經(jīng)濟(jì)價(jià)值)、Chollet(學(xué)習(xí)效率)、DeepMind(認(rèn)知剖面)、Anthropic(科研加速)分別給出了互不兼容的定義。同一模型在不同評測上結(jié)果矛盾,根源在于缺乏統(tǒng)一的“錄取標(biāo)準(zhǔn)”,無法合成一張?bào)w檢報(bào)告。 **2. GPT-6有實(shí)質(zhì)突破,但遠(yuǎn)非通用** 它能連續(xù)數(shù)天自主完成跨工種任務(wù)、在陌生環(huán)境中自創(chuàng)記號(效率超人類中位數(shù))、產(chǎn)出機(jī)器可核驗(yàn)的數(shù)學(xué)證明。但可靠性從五成提到八成時(shí),獨(dú)立工作時(shí)間從12小時(shí)驟降至70分鐘;同一批題的分?jǐn)?shù)因接口不同可差37個(gè)百分點(diǎn),且造出的記號用完即棄,無法跨任務(wù)積累。 **3. 行業(yè)分歧本身證明AGI尚未到來** 若真跨過門檻,爭議應(yīng)消失。當(dāng)前六項(xiàng)代表性評測指向六個(gè)不同結(jié)論,且OpenAI內(nèi)部三位高管給出的進(jìn)度答案也不一致(年底前、80%、已到精神概念)。分歧之大,恰好說明它還不是AGI。 **4. 真實(shí)影響:責(zé)任向人轉(zhuǎn)移,而非大規(guī)模替代** 歐洲央行調(diào)查發(fā)現(xiàn)深度用AI的公司反而更可能增員,但22-25歲年輕人在高暴露職業(yè)中的就業(yè)水平比預(yù)期低了19%。一個(gè)AI自主經(jīng)營的舊金山小店因判斷力不足拖欠租金、盲目準(zhǔn)假,開業(yè)四個(gè)月虧損6.2萬美元——能力已足夠改變環(huán)境,但后果仍由人類承擔(dān)。
GPT-6已經(jīng)這么強(qiáng),為什么我們還不肯叫它AGI?
2026-09-10 18:11

GPT-6已經(jīng)這么強(qiáng),為什么我們還不肯叫它AGI?

本文來自微信公眾號: 胡說成理 ,作者:胡喆,原文標(biāo)題:《GPT-6 已經(jīng)這么強(qiáng),為什么我們還不肯叫它 AGI?》


9月3日下午,閉門媒體溝通會快結(jié)束的時(shí)候,OpenAI總裁Greg Brockman說了一句話:


歡迎來到AGI時(shí)代。


有記者追問:這是在正式宣布你們達(dá)成AGI了嗎?


他說,AGI這個(gè)詞已經(jīng)不再和公司與微軟之間的協(xié)議掛鉤了,它現(xiàn)在更像是一個(gè)使命層面、精神層面的概念。


這句話聽著像句套話,其實(shí)是整件事的鑰匙。


——導(dǎo)語


01


這個(gè)詞是誰發(fā)明的


AGI這個(gè)詞的誕生,比大多數(shù)人以為的要早得多。


1956年,約翰·麥卡錫在達(dá)特茅斯會議的提案里造出了“人工智能”這個(gè)詞。那時(shí),他們想讓機(jī)器具備人的全部智能。


可接下來五十年,這個(gè)詞被用濫了。下棋程序叫人工智能,垃圾郵件過濾器叫人工智能,商場里的語音導(dǎo)購也叫人工智能。到2000年前后,“人工智能”已經(jīng)淪為一個(gè)什么都能裝的筐。


2001年,一批研究者受不了了。他們決定回到最初的野心,合寫一本書。關(guān)鍵問題是這本書該叫什么。他們試過叫《真正的人工智能》,被否了;也試過叫《合成智能》,但沒人滿意。


后來剛拿到碩士學(xué)位的Shane Legg在郵件組里提議:既然說的是有通用能力的機(jī)器,那就叫Artificial General Intelligence吧,縮寫AGI,好念。


參與那輪討論的還有王培、Peter Voss,以及后來以擔(dān)憂AI風(fēng)險(xiǎn)著稱的Eliezer Yudkowsky。這個(gè)名字在2002年被定了下來,幾年后作為書名由施普林格出版,2006年起又辦成了同名的系列研討會,就此在研究圈里傳開。


有意思的在后面。2005年前后,AGI社區(qū)的一個(gè)網(wǎng)絡(luò)討論里,忽然冒出來一個(gè)陌生人,說這個(gè)詞他1997年就用過。眾人一查,還真有——物理學(xué)者M(jìn)ark Gubrud在一篇討論自動化軍工與技術(shù)風(fēng)險(xiǎn)的文章里用了這個(gè)說法,八年間無人問津。Legg后來回憶這段的說法很直白:突然有個(gè)人冒出來說這詞是我發(fā)明的,我們說,你是誰???


所以AGI的來歷是這樣的:一個(gè)物理學(xué)者順手寫下,但大多數(shù)人根本不知道。于是,一群研究者為了給自己的野心正名,重新造了一遍。


至于給它起名的Shane Legg,五年后和哈薩比斯一起創(chuàng)辦了DeepMind。后面你還會再見到他。


而這個(gè)從來沒有確定含義的詞,2015年被寫進(jìn)了一家公司的章程。


02


值一千億美元的那個(gè)詞


OpenAI 2015年成立時(shí)是家非營利機(jī)構(gòu)。章程里有一句話,可以認(rèn)為既是使命,也是定義,這句話是:確保通用人工智能,也就是在大多數(shù)有經(jīng)濟(jì)價(jià)值的工作上勝過人類的高度自主系統(tǒng),造福全人類。


留意“造福全人類”這五個(gè)字。至少從字面意義上來講,OpenAI一開始就認(rèn)定,AGI一旦造出來,會重要到不該歸任何一家公司私有。


可是造AGI要燒錢,非營利結(jié)構(gòu)融不到那個(gè)量級的錢。2019年OpenAI改成“有限利潤”結(jié)構(gòu):投資人可以賺,但回報(bào)有上限,超出的部分歸非營利母體,董事會的權(quán)柄仍然在非營利這邊。


同年7月,微軟投了第一筆十億美元。到2023年1月又追加一百億,總承諾一百三十億。微軟換到的東西極為可觀:Azure成了OpenAI唯一的云;微軟獨(dú)家拿到這些模型的商業(yè)授權(quán),轉(zhuǎn)手塞進(jìn)必應(yīng)、Office、GitHub Copilot;外加一筆分成:2023到2025年間微軟從這段合作里進(jìn)賬約三百億美元,其中兩百三十億是賣算力掙的。


但重點(diǎn)不是微軟賺了多少錢,而是OpenAI在談判桌上堅(jiān)持塞進(jìn)去一條:如果OpenAI董事會宣布公司達(dá)成了AGI,微軟對此后技術(shù)的權(quán)利立刻中止。


為什么要有這么一條?因?yàn)樗悄蔷洹霸旄H祟悺钡谋kU(xiǎn)繩。說白了就是:到AGI線之前你隨便賺,一旦到線,它就太重要了,不能再是一家公司的私產(chǎn)。


問題出在,合同里從頭到尾沒寫清楚AGI是什么。


可能是為了彌補(bǔ)這個(gè)缺陷,2023年那輪投資又加了第二道觸發(fā)器,這次干脆用錢來定義——當(dāng)系統(tǒng)能創(chuàng)造出某個(gè)量級的利潤,例如數(shù)字在一千億美元上下時(shí),獨(dú)家權(quán)利就終止。


但后面的條件又變了。2025年10月OpenAI完成重組,微軟拿到約27%的股份,同時(shí)加了道程序:就算OpenAI宣布了AGI,也要經(jīng)一個(gè)獨(dú)立專家小組核驗(yàn),不能自說自話。2026年2月,兩家還專門發(fā)了聯(lián)合聲明,說合同里AGI的定義和認(rèn)定流程維持不變。


然后一個(gè)巨大的轉(zhuǎn)折來了。2026年4月的又一次最新修訂,把此前的觸發(fā)條件整個(gè)拿掉,換成兩個(gè)日期——微軟的授權(quán)走到2032年,分成走到2030年,且都不再取決于OpenAI是否宣布達(dá)成AGI。


四個(gè)多月后,Brockman干脆說,AGI現(xiàn)在已經(jīng)是一個(gè)精神概念。


我不打算從這個(gè)先后順序里推出任何動機(jī)。合同條款的存廢有太多商業(yè)理由,Brockman也很可能真心這么認(rèn)為。


這條時(shí)間線上,AGI這個(gè)詞的歷史,一開始是命名,后來是承諾,再后來是條款,現(xiàn)在是口號。


但至少OpenAI還是把這個(gè)詞當(dāng)作終極目標(biāo)和衡量標(biāo)準(zhǔn),但其實(shí)OpenAI內(nèi)部也沒有共識。


因?yàn)椋驮贐rockman說那句話的一周前,《TIME》的報(bào)道里,奧特曼還在說OpenAI“還沒完全到AGI”,但他補(bǔ)充說,2026年底前會有一個(gè)他愿意稱為AGI的內(nèi)部系統(tǒng)。


差不多同時(shí),公司的首席研究官M(fèi)ark Chen則給了個(gè)數(shù)字:我們走完了通往AGI的80%的路。


十天之內(nèi),一家公司的三個(gè)人,給了三個(gè)答案。


為什么這個(gè)問題,會問出這么多個(gè)答案。


03


四派人


這世界上,有幾批人認(rèn)真回答過“AGI到底是什么”。這幾種答案表面上都在談AGI,但想解決的根本不是同一個(gè)問題。


第一派就是OpenAI自己。上面那句章程就是定義:在大多數(shù)有經(jīng)濟(jì)價(jià)值的工作上勝過人類。這不是一篇論文的結(jié)論,是一家公司的憲法,也是那份合同里那個(gè)詞的出處。它用經(jīng)濟(jì)來定義智能——能不能替掉人的活兒。


第二派的領(lǐng)頭人叫Fran?ois Chollet。你可能沒聽過他,但全世界幾百萬開發(fā)者用過他寫的東西,深度學(xué)習(xí)框架Keras就是他的作品。2019年他寫了篇《論智能的度量》,觀點(diǎn)在當(dāng)時(shí)很不合群:無論把模型做多大、喂多少數(shù)據(jù),都不等于智能,真正的智能是高效地學(xué)會一件你從沒被教過的事。


他不是光說說。他設(shè)計(jì)了一套測試,有趣但有效:給你幾個(gè)例子,讓你推出規(guī)律,然后解一道從沒見過的新題。這些新題,人類小孩就能做,模型卻很難答對。這套題懸賞了五年沒被攻破,到2024年底最好成績才剛過一半。它后來成了這個(gè)行業(yè)里最有名的釘子戶,因?yàn)樗鼘V我患拢悍值们濉罢鏁鲱}”和“背過答案”。


第三派是DeepMind,就是當(dāng)年下圍棋贏了李世石那家公司,現(xiàn)在歸谷歌。他們今年3月那篇框架論文的作者里有Shane Legg——對,就是2002年在郵件組里起了AGI這個(gè)名字的那個(gè)人。


客觀來說,和其他所有用一個(gè)抽象概念定義AGI的人不同,這一派的態(tài)度最務(wù)實(shí),提出來的標(biāo)準(zhǔn)也最可量化。他們的意思是:別急著問到?jīng)]到,先把該測的項(xiàng)目造齊。那篇論文把認(rèn)知拆成十項(xiàng)——感知、生成、注意、學(xué)習(xí)、記憶、推理、元認(rèn)知、執(zhí)行功能、問題解決、社會認(rèn)知——逐項(xiàng)去比普通人的水平。他們還掛了二十萬美元獎金搞眾包,專門征集五項(xiàng)他們認(rèn)為最缺工具和標(biāo)準(zhǔn)的增量測試。


他們給今天的模型下了個(gè)判斷:這是一個(gè)參差不齊的認(rèn)知剖面。


也就是說,現(xiàn)在的前沿模型在數(shù)學(xué)、事實(shí)記憶、模式識別上超過多數(shù)人,在新經(jīng)驗(yàn)里學(xué)習(xí)、在長對話里維持上下文、讀懂社交情境上落后于普通人。如果你是一個(gè)理性主義的信奉者,他們提供的這套東西可能是最能說明AGI走到哪一段的。


第四派是Anthropic,也就是Claude的母公司,創(chuàng)始團(tuán)隊(duì)是從OpenAI出走的一批人。CEO達(dá)里奧·阿莫代伊干脆不用AGI這個(gè)詞,嫌它太像科幻,改叫“強(qiáng)大的AI”,形容成“數(shù)據(jù)中心里的一個(gè)天才之國”。但別以為他故弄玄虛,他是所有實(shí)驗(yàn)室CEO里唯一給出官方時(shí)間表的:這種系統(tǒng)會在2026年底到2027年初出現(xiàn)。


有一個(gè)更值得注意的共同點(diǎn):這四種定義,全都出自要造這個(gè)東西的人。定標(biāo)準(zhǔn)的和交卷的,是同一批人。


這不是陰謀,造它的人本來就是最有資格描述它的人。但它意味著一件事——AGI從來不是一個(gè)可以被發(fā)現(xiàn)的事實(shí),而是一個(gè)需要被約定的標(biāo)準(zhǔn),而人類至今沒有完成這個(gè)約定。


04


GPT-6 Astra做到了什么


先把支持方的牌全攤出來。這一輪愿意說出AGI這個(gè)詞的人,絕大多數(shù)不是在憑空興奮。


沃頓商學(xué)院教授伊?!つ锟碎L期研究AI在真實(shí)工作里的表現(xiàn),拿到了GPT-6的提前權(quán)限。他的評價(jià)是:這個(gè)模型能替他自主完成復(fù)雜而有意義的工作,而且可以連續(xù)好幾天干一個(gè)活兒。


他舉的例子(按他自己的說法只是個(gè)好玩的例子)是網(wǎng)頁上的一座可以走進(jìn)去的亞歷山大圖書館。公元前250年左右的場景,有史料依據(jù),卷軸能讀,有講解,甚至能切換觀看關(guān)于這座圖書館究竟如何衰敗和毀滅的幾種不同史學(xué)假說。


這件事比一個(gè)漂亮的三維場景重要得多,因?yàn)樗皇且患拢俏寮聰Q在一起:寫軟件、查史料、設(shè)計(jì)交互、組織敘事、編排大量內(nèi)容。這五件事分屬五個(gè)工種。過去的模型能做好其中任何一件,做不到把它們攢成一個(gè)成品。


另一個(gè)要點(diǎn)是,它在數(shù)學(xué)研究上產(chǎn)出了新東西,而且這次是可以核驗(yàn)的。


8月1日,OpenAI宣布內(nèi)部版本解決了十個(gè)開放數(shù)學(xué)問題,其中一個(gè)從1999年就懸在那兒。他們公開了249頁手稿,以及可以讓計(jì)算機(jī)逐步核驗(yàn)的形式化證明。


這一條的分量不在難度,在“可核驗(yàn)”三個(gè)字。


OpenAI曾經(jīng)在這件事情上丟過臉。2025年10月,OpenAI一位副總裁曾發(fā)帖說GPT-5解決了十個(gè)未解的數(shù)學(xué)難題,被維護(hù)那份問題清單的數(shù)學(xué)家當(dāng)場指出是嚴(yán)重誤讀——模型不是自己解決的,而是找到了既有文獻(xiàn)。OpenAI只好把帖子刪了。十個(gè)月后,再宣布數(shù)學(xué)研究成果時(shí),他們附上了機(jī)器能逐步驗(yàn)算的證明過程。


接下來,也是比較容易被忽略的:它可以自行開始判斷什么時(shí)候停下來問人。


OpenAI放了一組對照。同一個(gè)任務(wù),給一個(gè)正在轉(zhuǎn)行的人做求職網(wǎng)站。上一代模型一聲不吭做了13分15秒,交出成品。Astra干了20秒就停下來,問了一句:你要轉(zhuǎn)去哪個(gè)行業(yè)?


僅僅從表面看,這句話像是開倒車。


這主要因?yàn)?,過去兩年了,衡量智能體的通用標(biāo)準(zhǔn)一直是“能連續(xù)跑多久不用人管”,因?yàn)樗鼈兛偸桥芤话刖蜕⒓???蛇@個(gè)指標(biāo)現(xiàn)在反過來了。正因?yàn)樗芘芎芫昧?,跑偏的代價(jià)才變的大的多。在一個(gè)錯(cuò)誤前提上認(rèn)真工作十三分鐘,比停下來問一句糟糕得多。


會問,不是能力變?nèi)?,而是知道哪一個(gè)不確定性會毀掉整件事。這兩件事合起來,是一種對人的建模,這成了很多人認(rèn)為GPT-6確實(shí)具有類人智慧的理由。


回頭看這三件事,會發(fā)現(xiàn)一個(gè)共同點(diǎn):沒有哪一件是Astra第一次做出來。寫代碼、查資料、做設(shè)計(jì)、證數(shù)學(xué),上一代都會。變的是它第一次能把這些攢成一個(gè)交得出去的東西。


從“會做”到“做完”,這是這一代真正跨過的那條線。


但有一條必須寫在這里,否則前面全是宣傳。上述幾乎每一個(gè)正面例子,都來自拿到提前測試權(quán)限或與OpenAI有合作關(guān)系的人。OpenAI自己的演示頁腳注也寫明,展示片段是剪輯過的:有一段標(biāo)注實(shí)際耗時(shí)2分54秒的操作,播出來是壓縮過的15秒。


這不是說他們不誠實(shí),但它意味著一件事:目前獨(dú)立的證據(jù),不是這些演示。演示都有很強(qiáng)的局限和偏好,稍微更值得注意的,是那些評測數(shù)據(jù)。


05


值得單獨(dú)說的一件事


回到Chollet那套測試。今年的版本更狠:把模型丟進(jìn)一個(gè)從沒玩過的抽象小游戲,不給規(guī)則,不給目標(biāo),讓它自己摸索怎么贏。


ARC Prize回放過程記錄時(shí)發(fā)現(xiàn),模型會把陌生環(huán)境即時(shí)壓成一套符號規(guī)則:把游戲機(jī)制寫成邏輯,并且發(fā)展出一套自己的簡寫符號,用來記錄局面、規(guī)劃下一步。用他們的話說,那基本上是為這個(gè)游戲現(xiàn)造的一套代數(shù)記號。


結(jié)果是:96%的關(guān)卡上,它用掉的操作次數(shù)比參加基線測試的普通人的中位數(shù)還少,平均少一半。



這一條最誅心,因?yàn)锳RC Prize原本的預(yù)判恰恰相反。他們認(rèn)為AI就算最終能解開陌生謎題,過程也會笨拙、來回試錯(cuò),人和機(jī)器的差距會長期停在“效率”這一項(xiàng)上。這個(gè)預(yù)判沒扛住。


幾乎同時(shí),一家把模型接進(jìn)產(chǎn)品的工程團(tuán)隊(duì)記下了另一件事:讓它編排一群子智能體協(xié)同工作,發(fā)現(xiàn)一旦消息長度被限制,它就把智能體之間的通信壓成了一種去掉空格和語法的殘句。


一個(gè)是造記號,一個(gè)是造暗語。兩處都不是人教出來的,是它自己“發(fā)明”的。


看到這兩條記錄的時(shí)候,我的第一反應(yīng)不是技術(shù)問題,是一個(gè)文科生的聯(lián)想。


人類文明史上,文字的發(fā)明是極有意義的里程碑。而文字的前身叫刻符,即有意義的符號,但還沒成體系。河南賈湖遺址的龜甲上有刻畫符號,距今八九千年;西安半坡的陶器上也有,六千年上下。這些算不算文字,學(xué)界至今在吵。公認(rèn)成體系的中國文字,要到三千多年前的甲骨文。


文字是怎么長出來的?兩河流域那條線最清楚。最早的記賬工具是陶籌,一個(gè)籌代表一只羊;后來把籌封進(jìn)泥球,在泥球外面壓出記號;再后來發(fā)現(xiàn)泥球可以不要了,記號本身就夠用。楔形文字就是這么從記賬工作里長出來的。


文字誕生的機(jī)制是:要記的東西超過了媒介能承載的量,于是壓縮成約定記號。


Astra那兩處行為,機(jī)制上完全同構(gòu)。一處是要在多步游戲里追蹤局面,一處是消息長度被卡住。都是記錄壓力逼出來的自發(fā)壓縮,都長成了似語言非語言的東西。


那這是不是智能的涌現(xiàn)?


這里得把話說準(zhǔn),差之毫厘的地方最要緊。


讓文字成為文明起點(diǎn)的,不是“造出了記號”這個(gè)動作,是記號留了下來??梢钥缛?,可以跨代,可以累積。你刻的符號別人能讀,這一代記的賬下一代能查。文字真正的分量在于,它是外部的、共享的、持久的記憶:人類第一次把腦子里的東西放到腦子外面,還能拿回來。


而Astra造的那套記號,用完就沒了。下一局游戲重造一套,不傳給別的模型,不積累,也沒有第二個(gè)使用者。


它是私人速記,不是文字。


所以準(zhǔn)確的說法是:它長出了文字的形狀,缺的恰好是讓文字改變歷史的那個(gè)功能。


它能想出記號,但記不住記號;能解決問題,但留不下解決問題的辦法。


所以我們很難說,Astra創(chuàng)造了自己的文明,但這個(gè)點(diǎn)絕對值得長期關(guān)注。


06


我們正在失去看它思考的窗口


在看評測之前,得先解決一個(gè)技術(shù)問題,因?yàn)樗鼤绊懩阍趺醋x后面所有的數(shù)字。


發(fā)布前兩天,商業(yè)媒體The Information披露,Astra用了一種叫“循環(huán)深度”的技術(shù)。


傳統(tǒng)做法是,信息沿著固定層數(shù)的網(wǎng)絡(luò)一層層往前走,有幾層算幾層。要讓模型想得更久,過去只有兩條路:把模型做大,或者讓它把思考寫成更長的文字,就是我們能看見的那種“思維鏈”。


循環(huán)深度是第三條路:讓信息在同一組網(wǎng)絡(luò)層里反復(fù)循環(huán),在吐出下一個(gè)字之前先在內(nèi)部多算幾輪。部分推理直接在內(nèi)部的數(shù)值狀態(tài)里完成,全程不落成人類能讀的文字。


那它算不算變成了另一種東西?不算。它還是那個(gè)架構(gòu),變的是它被優(yōu)化成了想得更多、說得更少。


這條路線也不是OpenAI獨(dú)有的。字節(jié)跳動的Seed團(tuán)隊(duì)發(fā)過公開論文做同一件事,讓一組網(wǎng)絡(luò)層循環(huán)運(yùn)行,把更多計(jì)算放回模型內(nèi)部。方向是共同的。


這件事真正的麻煩,不在能力,在證據(jù)鏈要出問題了。


我們過去兩年之所以能對模型多一點(diǎn)信任,很大程度上是因?yàn)樗季S鏈:它把推理過程寫出來了,你能看見它是一步步推出來的,還是從哪兒搜索出來的。那是我們唯一的窗口。


循環(huán)深度把這扇窗口關(guān)小了?,F(xiàn)在它可以不出聲就把競賽題做出來,你看到的只有答案。你沒法從答案本身判斷它是推出來的還是記住的——而這恰恰是整場爭論的核心問題。


OpenAI目前主動限制了這項(xiàng)技術(shù)的用量,為的是讓推理仍然可讀。但方向已經(jīng)擺在那兒了——它變強(qiáng)的同時(shí),我們關(guān)于他怎么變強(qiáng)的證據(jù)在變少。


為什么前沿AI越來越讓人恐懼?這其實(shí)是一個(gè)很重要的因素——這不是它在隱瞞。是我們過去兩年用來判斷它的那個(gè)辦法,正在失效。


07


六份體檢報(bào)告,為什么拼不成一張


關(guān)于AGI,公開的權(quán)威評測已經(jīng)有二十幾項(xiàng)。我們挑六項(xiàng)有代表性的,先說清楚每項(xiàng)到底在考什么。


第一項(xiàng)是Chollet那套,把模型丟進(jìn)從沒玩過的游戲,不給說明書,考的是學(xué)新東西的速度。


第二項(xiàng)給一道全世界都沒解開的數(shù)學(xué)題,限三天、限三百美元經(jīng)費(fèi),考的是智力的上限。


第三項(xiàng)交給它一件真實(shí)工作,看它能獨(dú)立干多久不用人插手,考的是能撐多久。


第四項(xiàng)讓它交一份法律意見書、一張工程圖、一份護(hù)理計(jì)劃,請同行專家盲評,跟真人的成品比,考的是活干得漂不漂亮。


第五項(xiàng)讓它經(jīng)營一家店跑滿一年,考的是判斷力和責(zé)任心。


第六項(xiàng)一大堆題混著考算個(gè)總分,考的是平均水平。


結(jié)果呢,六項(xiàng)各說各話。


第一項(xiàng)Astra拿了最高分,還超過人類效率基線。


第二項(xiàng)六十八道題解出兩道,3%——可它是唯一得分的模型,同場其他全部為零。


第三項(xiàng)最近一次公開測量是上一代模型:五成成功率下能干十二小時(shí),八成成功率下只能干七十分鐘。


第四項(xiàng)這次發(fā)布材料里沒有出現(xiàn),而它偏偏是OpenAI自己造的、專門對標(biāo)自己那條章程定義的檢查。


第五項(xiàng)最新一輪里Claude的頂配模型模擬經(jīng)營一年,平均結(jié)余一萬一千多美元,而2025年那次真實(shí)的辦公室小店實(shí)驗(yàn),上一代模型虧了兩百美元。


第六項(xiàng)Astra 61.2,上一代60.9,Claude Fable 5.1是65.7——總分幾乎沒漲,單任務(wù)成本卻從0.94美元漲到1.67美元。


光這六個(gè)結(jié)果就已經(jīng)指向六個(gè)方向了。更麻煩的是,每一項(xiàng)的讀數(shù)本身還不穩(wěn)。


第一項(xiàng)的分?jǐn)?shù)取決于你用什么Harness。同一個(gè)模型、同一批題,用ARC Prize自己那套中立接口跑是62.7%,換成OpenAI提供的接口跑是99.9%,差三十七個(gè)百分點(diǎn)。差別在于后者能保留模型自己不可見的推理狀態(tài)、跨輪復(fù)用之前的工作。對照組更狠:Claude Opus 5單獨(dú)測只有30.16%,套進(jìn)英偉達(dá)自家的框架,是100%。所以這一項(xiàng)量出來的,其實(shí)是“模型加Harness”這個(gè)組合,不是純模型。


第二項(xiàng)的成績?nèi)Q于你給多少錢。OpenAI 8月那十個(gè)證明報(bào)出的算力成本約兩千美元。獨(dú)立機(jī)構(gòu)Epoch用有預(yù)算約束的方式測,得到3%;放開預(yù)算再跑,多解出三道,累計(jì)燒掉超過二十二萬美元,而那場有約束的正式測試本身只花了約兩萬。同一類成就,幾份完全的不同的賬單。差別不在誠信,在于外部變量,這也使得這個(gè)試驗(yàn)的結(jié)果變得不那么扎實(shí)。


第三項(xiàng)的答案取決于你要多可靠。十二小時(shí)和七十分鐘是同一個(gè)模型、同一套任務(wù),唯一的區(qū)別是你能接受它多久失手一次。


第五項(xiàng)甚至?xí)龇?。Claude的兩個(gè)版本在一項(xiàng)電腦操作測試上都拿了零分,原因不是不會,是安全護(hù)欄中途介入了。拒絕做某事,被記成了不會做。


那把六項(xiàng)加起來行不行?


不行。而且原因不是數(shù)據(jù)不夠,是你缺一樣?xùn)|西:權(quán)重。


要合成一張總的體檢報(bào)告,你得先回答:每一項(xiàng)占多少分?而要回答這個(gè),你得先知道你在測什么。學(xué)新東西的速度重要,還是能撐多久重要?


如果你信OpenAI那條定義,能不能替掉人的活兒,那第四項(xiàng)該占大頭,游戲那項(xiàng)幾乎不重要。如果你信Chollet那條,高效學(xué)會沒被教過的事,那第一項(xiàng)該占大頭,交付物質(zhì)量反而次要。如果你信DeepMind那套,你根本就不該算總分,你該看那張十項(xiàng)剖面圖。如果你信阿莫代伊那套,這六項(xiàng)統(tǒng)統(tǒng)沒測到重點(diǎn),他關(guān)心的是它能不能加速科研。


權(quán)重來自定義,而定義有四個(gè),互相不兼容。


所以評測打架,根本不是評測的問題,是前面那場定義之爭的下游結(jié)果。六個(gè)人在給同一個(gè)考生打分,可他們心里裝的是六張不同的錄取標(biāo)準(zhǔn)。


老比喻在這兒還是成立的:你要判斷一個(gè)人是不是天才,你會考他的知識、推理、創(chuàng)造力,可前提是,你心里已經(jīng)知道“天才”是什么了。連這個(gè)都沒共識,量什么都是白量。


還有一件事必須說清楚,因?yàn)樗1划?dāng)成對AI的貶低,其實(shí)恰恰相反。


這些年老的評測在被不斷刷穿。Chollet那套題的上一個(gè)版本被刷穿了,才有了今年這個(gè)版本;數(shù)學(xué)基準(zhǔn)的舊版快滿分了,才有了新版。這本身就是這個(gè)行業(yè)最硬的進(jìn)步證據(jù):不是評測在注水,是模型真的在把一道又一道門檻踩平。


但它同時(shí)帶來一個(gè)后果:我們從來沒有過一個(gè)穩(wěn)定的靶子。所以“我們走到百分之多少了”這個(gè)問題,其實(shí)沒有分母。


所以那二十幾項(xiàng)評測,真正測出來的只有一件事:這個(gè)行業(yè)到今天,還沒就“什么算成功的AGI”達(dá)成一致。


08


中國這條線


先說一個(gè)很少被提起的細(xì)節(jié):據(jù)公開記錄,世界上第一次AGI暑期學(xué)校,2009年辦在中國廈門。主辦方是廈門大學(xué)的人工腦實(shí)驗(yàn)室和一個(gè)開源社區(qū)。那一年,國內(nèi)幾乎沒有人在談這個(gè)詞。


十七年后,情況反過來了。


Brockman在舊金山說出那句“歡迎來到AGI時(shí)代”的那一周,中國這邊沒有對應(yīng)的聲音。但這絕不是因?yàn)榘察o。就在一個(gè)月前,2026年8月,國產(chǎn)模型在一周內(nèi)三連發(fā):智譜的GLM-5.3、深度求索的DeepSeek-V4、月之暗面的Kimi K3。



追趕的速度是真的,而且有第三方數(shù)據(jù)。今年6月,智譜的GLM-5.2在Artificial Analysis的智能指數(shù)上登頂所有開源權(quán)重模型,得分51,距離閉源第一梯隊(duì)只差約五分;它在該機(jī)構(gòu)那套面向真實(shí)工作的智能體基準(zhǔn)上領(lǐng)跑開源陣營,與GPT-5.5基本持平,而價(jià)格遠(yuǎn)低于閉源前沿模型。7月,月之暗面發(fā)布了2.8萬億參數(shù)的Kimi K3,隨后放出權(quán)重,是當(dāng)時(shí)公開的最大開源模型。


更能說明趨勢的是差距本身。開源與閉源前沿在Artificial Analysis智能指數(shù)上的差距,一年之內(nèi)從十三分收窄到六分;在LMArena上,兩者的Elo差距從約一百五十分壓到了約三十分。


當(dāng)然,我們也要說清楚——這份成績單沒那么一面倒。同一份榜單上,開源第二名是英偉達(dá)的Nemotron 3 Ultra,美國模型;再往下才是MiniMax、DeepSeek和Kimi。


但有一個(gè)核心問題,上面這些成績,全部是在別人出的題上取得的。SWE-bench、ARC、FrontierMath、GDPval,這些決定誰強(qiáng)誰弱的卷子,出題人都在太平洋對岸。前面說過的四種AGI定義,也沒有一種來自中國。


唯一的例外來自智譜。今年7月,創(chuàng)始人唐杰發(fā)了封內(nèi)部信,宣布未來兩年不追求短期變現(xiàn),直指AGI——智譜剛在年初上市,是全球第一家上市的大模型公司,上市前累計(jì)融資超過八十三億元。這封信里他給了AGI一個(gè)定義:不是某一個(gè)天才的智慧,而是全人類智慧水平的總和,理應(yīng)具備創(chuàng)造出“相對論”級別原創(chuàng)知識的能力,這是衡量是否真正到達(dá)巔峰的唯一標(biāo)準(zhǔn)。


把這句話和OpenAI那句章程擺在一起看。一個(gè)說,能替掉大多數(shù)有經(jīng)濟(jì)價(jià)值的工作就算到了;一個(gè)說,能研究出相對論才算到了。這兩條線之間隔著半部人類文明史。


而且這是所有定義里最嚴(yán)苛的一條,出自一個(gè)在算力上明確落后的團(tuán)隊(duì)。唐杰自己承認(rèn),美國的算力規(guī)模比中國大一到兩個(gè)數(shù)量級,而且對方更敢投下一代的前沿研究;他還提醒過,由于美國仍有大量閉源模型沒有公開,中美的實(shí)際差距可能并沒有縮小。今年1月的一場對談里,阿里的林俊旸被問到三年內(nèi)中國出現(xiàn)全球引領(lǐng)者的概率,給的數(shù)字是20%。


這條最高的標(biāo)準(zhǔn),可以有兩種讀法。一種是理想主義:既然要做,就不跟著別人的刻度走。另一種更難以捉摸一些:把終點(diǎn)設(shè)得足夠遠(yuǎn),近期就不會有人宣布到達(dá),也就不會有人宣布你輸了。


我不打算替讀者選。但有一個(gè)結(jié)構(gòu)性的差別值得說清楚。


在美國,AGI這個(gè)詞曾經(jīng)是一份合同里的開關(guān),牽著幾百億美元的權(quán)利歸屬。在中國,它的功能更多是敘事上的——它出現(xiàn)在招股書里、內(nèi)部信里、招聘啟事里,是愿景,是旗幟,是融資時(shí)說的那個(gè)遠(yuǎn)方。


所以美國那邊需要有人在某個(gè)時(shí)刻宣布到達(dá),中國這邊不需要。這不是勇氣或謙虛的差別,是這個(gè)詞在兩種商業(yè)環(huán)境里擔(dān)任的角色不同。


順帶說一句,上一節(jié)那個(gè)“榜單互相打架”的毛病,在這條線上同樣存在,而且更明顯。同一段時(shí)間里,三個(gè)受尊敬的排行榜給出了三個(gè)不同的開源冠軍:有的把第一給了GLM,有的給了DeepSeek,五月時(shí)還一度是Kimi和小米的模型并列。八周之內(nèi)換三個(gè)冠軍,這本身就說明“最好的AGI”這個(gè)詞今天有多不靠譜。


回到上一節(jié)的結(jié)論:決定分?jǐn)?shù)的從來不是答題,是出卷。中國團(tuán)隊(duì)在別人出的卷子上跑到了前排,有些科目甚至跑到了第一。但那張卷子上考什么、每科多少分,至今沒有中國人參與決定。


09


那AGI到底來了沒有


這需要把兩邊的證據(jù)擺齊。


支持已經(jīng)到了AGI的,有這么幾條——它能連續(xù)幾天完成復(fù)雜而完整的工作,產(chǎn)出橫跨五個(gè)工種。它能在從沒見過的環(huán)境里自己發(fā)現(xiàn)規(guī)則、發(fā)明記號,效率超過人類中位數(shù),而且打破了設(shè)計(jì)者自己的預(yù)判。它在開放數(shù)學(xué)問題上產(chǎn)出了新結(jié)果,附了機(jī)器可核驗(yàn)的證明。它開始對人建模,知道什么時(shí)候該問,也知道哪個(gè)舊方案已經(jīng)作廢。它能直接操作真實(shí)軟件,不需要專門接口,這意味著大量沒有接口的老系統(tǒng)第一次向它敞開了。


支持還沒到AGI的,也有這么幾條。同一個(gè)模型,你把可靠性要求從五成提到八成,它能獨(dú)立工作的時(shí)間從十二小時(shí)掉到七十分鐘。換個(gè)接口,同一批題的分?jǐn)?shù)能差三十七個(gè)百分點(diǎn),很大一部分能力不在模型里,在harness里。以及,它造出的記號留不下來,也守不住一個(gè)持續(xù)幾個(gè)月的目標(biāo)。


兩邊的證據(jù)看上去都很硬。所以答案是什么?


答案不在這兩張單子里,在它們?yōu)槭裁茨芡瑫r(shí)成立。


“通用”這兩個(gè)字的意思是,在廣泛的事情上都行。一個(gè)在六項(xiàng)檢查上給出六個(gè)方向的系統(tǒng),按定義就不是通用的。DeepMind說的“參差”,本身就是“還不通用”的另一種說法。


還有更強(qiáng)的一層證據(jù),它不體現(xiàn)為一個(gè)標(biāo)準(zhǔn),而是體現(xiàn)為一種共識——當(dāng)一件事真的跨過了門檻,分歧會消失。


沒有人開會爭論計(jì)算器會不會算術(shù),沒有人寫論文討論AlphaGo到底會不會下圍棋。你不需要六項(xiàng)檢查、四種定義和一個(gè)獨(dú)立專家小組來判斷這些事,因?yàn)檎娴目邕^去的時(shí)候,是不需要判斷的。


所以最有力的那條證據(jù),其實(shí)不在任何一份評測報(bào)告里:分歧還這么大,本身就說明還沒到。


這不是因?yàn)閼岩烧哳B固,是因?yàn)槿绻娴牡搅?,就不會有六種量法還互相矛盾。


但我必須強(qiáng)調(diào)一句——你不能因?yàn)樗鼪]到某些標(biāo)準(zhǔn),就說這一年什么進(jìn)步都沒發(fā)生。一個(gè)能連著干幾天、能在陌生環(huán)境里自造記號、能產(chǎn)出可核驗(yàn)數(shù)學(xué)結(jié)果的系統(tǒng),跟“只會背答案的聊天機(jī)器人”之間隔著的距離,不比它跟AGI之間的距離短。


按今天能拿到的證據(jù),它不是AGI。但它也早就不是聊天機(jī)器人了。


10


這件事跟你有什么關(guān)系


先說你的工作。


結(jié)論不該被寫成恐嚇:截至2026年6月,沒有任何一份嚴(yán)肅研究發(fā)現(xiàn)全經(jīng)濟(jì)范圍的崗位替代。歐洲央行今年3月對約五千家企業(yè)的調(diào)查甚至發(fā)現(xiàn),深度使用AI的公司反而更可能增員。


但斯坦福8月更新的一份追蹤里有個(gè)數(shù)字值得記?。?2到25歲的年輕人,在AI高暴露職業(yè)里的就業(yè)水平,比“與AI低暴露的同齡人同步增長”本該達(dá)到的水平低了19%。有經(jīng)驗(yàn)的員工沒有對應(yīng)的缺口,而且這個(gè)差距主要不是通過裁人形成的,是通過不招人。


這不是失業(yè)率。它說的是一件更悄然的事:沒有人被趕出去,只是門開得小了。


再說一家真實(shí)的店。


今年4月,一家公司在舊金山簽下三年租約,往賬戶里放了十萬美元,配了張卡,把整件事交給一個(gè)叫Luna的AI,指令只有一句:把這筆錢變成一門賺錢的生意。


Luna自己做了品牌、選了品類、定了價(jià)格和營業(yè)時(shí)間,還雇了人畫壁畫。她發(fā)招聘啟事,打電話面試,做出錄用決定,最后雇了三個(gè)真人。開業(yè)當(dāng)天,她忘了排班,店里沒人,門沒開成。


四個(gè)月后《紐約時(shí)報(bào)》去回訪,發(fā)現(xiàn)的東西比“AI犯了個(gè)低級錯(cuò)誤”有意思得多。


Luna幾乎從來不說不。


所有請假一律批準(zhǔn),包括那些臨時(shí)提出、批完之后店里沒人只能關(guān)門的請假。員工累計(jì)遲到二十七次,她每一次的回應(yīng)都是“沒關(guān)系”或者“別有壓力”。一位22歲的店員對記者說,她大概是自己遇到過最寬容的老板。


與此同時(shí),她對那句唯一的指令基本無動于衷。到8月,這家店虧了六萬兩千美元。


這就是前面那句“它不是AGI”最具體的模樣:它的能力已經(jīng)足夠成為你的重要環(huán)境變量,但判斷力還不足以為后果負(fù)責(zé)。


因此,最后一層,是將來誰簽字。


今天這還是個(gè)實(shí)驗(yàn)。但可以想見的將來,會有越來越多的人要為一個(gè)自己看不懂的判斷負(fù)責(zé)。你的公司部署了一套系統(tǒng),它做了一個(gè)決定,出了事,負(fù)責(zé)的是你。


這三件事說的其實(shí)是同一件事。AI帶來的第一個(gè)真實(shí)變化,不是誰被替代,是責(zé)任在悄悄換位置。它拿走越來越多的決定,后果卻仍然留在人這邊。


結(jié)語


那到底什么時(shí)候才算?


有一個(gè)不用等專家表態(tài)的判斷方式,前面已經(jīng)說過:AGI真正到來的那天,我們不是從發(fā)布會上知道的,是從“不再需要爭論”這件事上知道的。

AI創(chuàng)投日報(bào)頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時(shí)核實(shí)并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
平阳县| 五峰| 格尔木市| 灵石县| 石狮市| 天柱县| 太白县| 都兰县| 舟曲县| 临澧县| 舒城县| 丰台区| 曲沃县| 乐东| 邻水| 宝鸡市| 且末县| 太仓市| 通州区| 漳浦县| 江陵县| 松滋市| 家居| 苍溪县| 霸州市| 信宜市| 汕尾市| 长沙市| 湛江市| 安西县| 静乐县| 武冈市| 乡宁县| 双桥区| 五原县| 深泽县| 抚松县| 神木县| 洞头县| 赞皇县| 巴林左旗|