久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**谷歌疑似泄露下一代旗艦?zāi)P虶emini 4 Pro,在盲測中表現(xiàn)遠超當前Flash版本;同時RSI(遞歸自我改進)已成為加速AI迭代的核心驅(qū)動力,多家實驗室呼吁減速但實際行動仍在推進。** **要點** **1. Gemini 4 Pro疑似匿名現(xiàn)身,性能顯著超越現(xiàn)有Flash** Arena中突然出現(xiàn)名為gemini-3.8-flash的模型,但其寫代碼、生成SVG、構(gòu)建3D場景等實測表現(xiàn)遠強于剛發(fā)布的真正3.8 Flash,開發(fā)者推測它是谷歌藏于標簽后的旗艦Gemini 4 Pro。傳出的benchmark數(shù)據(jù)在編碼、Agent、推理等多項指標上壓倒GPT-6 Astra和Claude Fable,但該圖表未經(jīng)官方證實。 **2. RSI成為加速AI研發(fā)的關(guān)鍵驅(qū)動** RSI(遞歸自我改進)指AI參與制造更強AI,形成閉環(huán)加速。谷歌聯(lián)合創(chuàng)始人Brin已將其列為重點方向,DeepMind研究員稱3.8 Flash發(fā)布是“RSI的一大步”。Anthropic數(shù)據(jù)顯示,截至8月,Claude已主導(dǎo)26%的內(nèi)部AI研發(fā)任務(wù),而2月時這一比例不到1%。 **3. 減速倡議流于口號,各實驗室仍在推進下一代模型** 幾天前臺積電等公司呼吁減速,但共同規(guī)則未建立。谷歌疑似測試Gemini 4 Pro,Anthropic社區(qū)出現(xiàn)Opus 5.2灰度痕跡,OpenAI也被曝可能即將發(fā)布GPT-6 Sol。三家前沿實驗室的下一輪模型均已在測試中,減速并未實際發(fā)生。
Gemini 4 Pro疑似泄露,“AI減速”又成空話
2026-09-19 10:19

Gemini 4 Pro疑似泄露,“AI減速”又成空話

本文來自微信公眾號: 字母AI ,作者:袁心玥,原文標題:《Gemini 4 Pro疑似泄露,“AI減速”又成空話》


前幾個月,OpenAI和Anthropic輪番把旗艦?zāi)P屯巴?,谷歌卻顯得異常安靜。


Flash幾乎3周一更,3.6、3.7、3.8連續(xù)往前,但代表最高能力上限的Pro遲遲沒有動靜。


直到這兩天,大模型盲測競技場Arena里,突然冒出一個掛著gemini-3.8-flash名字的模型。



開發(fā)者一上手就發(fā)現(xiàn)了不對勁,真正的Gemini 3.8 Flash已經(jīng)發(fā)布了,它該是什么水平,大家心里有數(shù)??蛇@個“3.8 Flash”,寫代碼、做SVG、跑Agent,表現(xiàn)明顯又往上跳了一截。




幾輪實測之后,一個猜測迅速擴散開來:


這個模型很有可能是谷歌藏在標簽后面的下一代旗艦——Gemini 4 Pro。


緊接著,一張更夸張的benchmark對比圖開始瘋傳。編碼、Agent、推理,多項成績都把GPT-6 Astra和Claude Fable壓在下面。



就在幾天前,幾家最重要的AI公司還在公開討論,是不是該慢一點?,F(xiàn)在,減速的聲音還沒落地,新一輪競賽已經(jīng)開始狂飆。


而這個疑似Gemini 4 Pro的“神級模型”背后,還有一個更危險的關(guān)鍵詞:


RSI。


Gemini 4 Pro疑似泄露


9月2日,Google剛剛正式發(fā)布Gemini 3.8 Flash。官方稱,這是Gemini 3系列最新一代Flash,在軟件工程、Agent任務(wù)和復(fù)雜多步推理上都有明顯提升;從3.7 Flash到3.8 Flash,中間只隔了三周。


所以,當Arena里又出現(xiàn)一個同樣掛著gemini-3.8-flash名字的模型時,開發(fā)者很快就察覺到了異常。


真正的3.8 Flash已經(jīng)擺在那里,大家有現(xiàn)成的參照物。而這個模型看起來明顯更強,分明是Pro模型才會有的實力。



最早引發(fā)傳播的一批實測,集中在SVG、網(wǎng)頁和3D場景上。


開發(fā)者Harshith讓它用SVG畫一只側(cè)面的家貓,并把結(jié)果與GPT-6 Astra Max和正式版Gemini 3.8 Flash放在一起。Arena里的這個版本,無論輪廓、比例還是細節(jié)完整度,都和正式3.8 Flash拉開了肉眼可見的差距。


X網(wǎng)友@thtbee_從多個角度連續(xù)測試了這個疑似Gemini 4 Pro的模型。


一個Voxel風(fēng)格寶塔,模型跑了8分鐘,直接生成了一整套可交互3D場景。




一架空客H145直升機,它只花大約10分鐘就搭出了完整的3D展示頁面,細節(jié)非常豐富。不過,這位網(wǎng)友表示,頁面底部的UI元素“看起來有點糟”。




在網(wǎng)頁設(shè)計上,模型花了大約14分鐘就做出了一套單色主題網(wǎng)站,整體非常干凈、完整。過去Gemini經(jīng)常被吐槽的設(shè)計品味問題,這次似乎終于被補上了。




另一位網(wǎng)友@Mr_Salio直接拿這個疑似Gemini 4 Pro的模型去做游戲。成品畫面足夠流暢,世界生成和游戲設(shè)計的完成度也很高。



更關(guān)鍵的一條線索來自開發(fā)者Qwinah。


他聲稱自己成功“幽靈路由”到了Gemini 4 Pro的后端,并貼出了一張疑似內(nèi)部終端信息的截圖。


根據(jù)他的說法,這個模型的內(nèi)部標識里直接出現(xiàn)了G4P-ARGON和VIA_3.8_FLASH,最大輸出達到256K,上下文窗口超過1000萬token,還帶有跨會話永久記憶、無需API即可聯(lián)網(wǎng)、后端自動編譯運行腳本,甚至物理機器人控制等能力。



如果這些信息屬實,那它顯然已經(jīng)不是一次普通的Flash升級。


與此同時,一張Gemini 4 Pro的benchmark對比表也開始在社區(qū)瘋傳。



按照圖里的數(shù)據(jù),Gemini 4 Pro在軟件工程測試DeepSWE v1.1拿到88.7%,在終端Agent測試Terminal-Bench 2.1達到95.3%,在專家級知識推理測試HLE-Verified沖到72.1%,在電腦操作Agent測試OSWorld 2.0達到86.8%。


更夸張的是,在衡量真實知識工作的GDPval-AA v2上,它被寫成2064 Elo,直接突破2000大關(guān)。


如果這些數(shù)據(jù)屬實,Gemini 4 Pro簡直能“拳打Fable,腳踢Astra”,一舉站上前沿模型之巔。


但越是夸張,越需要小心。


值得注意的是,這張benchmark表,和Qwinah“挖”出來的那張疑似后端截圖,并不完全對得上;benchmark表里作為對照項的Astra,得分也不符合官方數(shù)據(jù);兩份材料都沒有Google、Arena或相關(guān)benchmark官方背書,目前仍然只是社區(qū)流傳的信息。


唯一能被確認的只有那個名叫g(shù)emini-3.8-flash名字的模型,和完全不符合Gemini 3.8 Flash的表現(xiàn)。


但大家之所以會迅速把答案指向Gemini 4 Pro,還有一個非常重要的原因:Google的Pro模型,已經(jīng)空窗太久了。


Gemini 3.5 Pro遲遲沒有正式落地,Gemini 4早已確認進入訓(xùn)練,過去幾個月,F(xiàn)lash一代代往前推,真正代表能力上限的Pro線始終沒有新型號出現(xiàn)。


現(xiàn)在,一個能力明顯異常的“3.8 Flash”突然從Arena里鉆了出來。


于是,猜測自然越來越像樣——Google可能根本沒打算把真正的大升級留給3.5 Pro,直接憋到了Gemini 4 Pro。


Gemini 4 Pro背后,


更大的關(guān)鍵詞是RSI


如果說Gemini 4 Pro目前還只是社區(qū)傳言,那么更值得注意的是,谷歌正在明顯加快AI參與模型研發(fā)的速度。


在這一次的Gemini 4 Pro傳聞里,RSI這個關(guān)鍵詞被反復(fù)提及。




RSI全稱為Recursive Self-Improvement,遞歸自我改進,簡單來說,就是AI開始參與制造更強的AI,而更強的AI又進一步加快下一代模型的研發(fā)。


一旦這個循環(huán)跑起來,被加速的就不只是模型能力本身。


就連模型進化的速度,也會開始被模型自己加速。


路透社今年8月披露,谷歌聯(lián)合創(chuàng)始人Sergey Brin近幾個月一直在推動Gemini提速,并把遞歸自我改進列為重點關(guān)注方向之一。


雖然谷歌目前還沒有公開宣布自己已經(jīng)實現(xiàn)了這個閉環(huán),但它正在把越來越多原本屬于研究員的工作交給Agent,包括評測模型、尋找改進方向、跑實驗,再把結(jié)果反饋回模型研發(fā)流程。


9月2日發(fā)布Gemini 3.8 Flash時,谷歌也在官方說明里提到,一套長期運行的Agent循環(huán)正在“遞歸地評估和改進底層模型”。



Google DeepMind研究員姚順宇(不是騰訊的姚順雨)則在3.8 Flash發(fā)布后,化用了阿姆斯特朗登月時的話來形容這次更新:


“這是模型的一小步,RSI的一大步?!?/p>



就在最近,谷歌還把“RSI”寫進了一篇新論文的標題里。


9月14日,谷歌、GDM等團隊發(fā)布Dream-RSI,專門研究如何讓Agent通過不斷改進探索策略,實現(xiàn)遞歸自我改進。在算法工程、數(shù)學(xué)優(yōu)化和GPU kernel任務(wù)上,這套方法都顯示出更高的探索效率和更低的搜索成本。


也正因如此,這次Gemini 4 Pro的傳聞才會迅速和RSI綁在一起。


社區(qū)里的猜測并沒有停留在“Gemini 4 Pro很強”上,也在追問,谷歌內(nèi)部到底把RSI做到了什么程度。


RSI這條路顯然不只谷歌在走。


美國時間9月17日,Anthropic公開了一組內(nèi)部AI研發(fā)自動化數(shù)據(jù)。


Anthropic官方表示,他們公開這些指標的原因是,他們認為外界需要知道,前沿實驗室里的AI研發(fā)到底有多少已經(jīng)開始由AI自己完成。



數(shù)據(jù)顯示,截至今年8月,Claude已經(jīng)能夠主導(dǎo)26%的Anthropic AI研發(fā)任務(wù)——也就是人類只需要給出高層目標并監(jiān)督,Claude基本可以端到端完成任務(wù)。這個比例在今年2、3月還不到1%。


與此同時,Anthropic內(nèi)部超過90%的AI研發(fā)任務(wù),至少已經(jīng)進入AI協(xié)作的階段。


國內(nèi),智譜創(chuàng)始人兼首席科學(xué)家唐杰最近也表示:“我們?nèi)赃h未達到遞歸自我改進,但最小的循環(huán)已經(jīng)出現(xiàn):模型優(yōu)化系統(tǒng),系統(tǒng)服務(wù)模型?!?/p>


唐杰在X上的長文,僅截取開頭部分


在智譜公開的工程實踐中,一個由GLM-5.3驅(qū)動的Infra Agent參與了GLM-5.3-Flash推理基礎(chǔ)設(shè)施的設(shè)計、調(diào)試和優(yōu)化。這套系統(tǒng)運行在超過10萬張國產(chǎn)AI芯片組成的集群上,從第一次跑通到承接全部生產(chǎn)流量,只用了兩周,把端到端吞吐提升到了初始水平的3.2倍。


“減速”最后只剩下警告


就在幾天前,阿莫迪還呼吁前沿AI公司攜手“減速”。


他列出的第一個需要警覺的條件,就是RSI。


模型進步本身當然是好事,但問題在于,如果AI開始參與制造下一代AI,模型進步的速度可能越來越快,但人類理解、評估和控制它的速度,未必能同步加快。


所以阿莫迪反復(fù)強調(diào),要在能力跨過某些門檻之前,把第三方評測、共同安全標準和減速機制提前建立起來。


因為一旦RSI真正形成正反饋,模型可能已經(jīng)越過了剎車的“安全距離”。


在風(fēng)險上,幾家前沿實驗室確實達成了共識。


奧特曼公開認同“放慢前沿AI的發(fā)展節(jié)奏”,并承諾OpenAI也會引入擁有類似員工權(quán)限的獨立評測者;馬斯克表示“Dario是對的”;哈薩比斯也稱這是正確的方向,只是具體怎么做還需要繼續(xù)討論。


但那篇倡議里也提到,單獨減速沒有意義,如果AI研發(fā)繼續(xù)被AI加速,未來真正有效的減速或暫停,需要先建立一套共同規(guī)則:比如引入獨立評測者,以及讓前沿實驗室共同設(shè)定能力門檻和安全措施,必要時協(xié)調(diào)放慢研發(fā)速度。


但到現(xiàn)在,出于各種各樣的競爭原因,共同規(guī)則并沒有被建立。


大家已經(jīng)可以一起說“應(yīng)該謹慎”,可一到“具體怎么減速、誰先減、其他國家減不減”,共識就迅速消失了。


實驗室之間有最直接的模型競爭,國家之間還有更大的AI競爭。任何一家單獨放慢,都要承擔把領(lǐng)先窗口讓給對手的風(fēng)險;任何一個國家單獨限制,都會擔心另一邊繼續(xù)加速。


幾家前沿AI實驗室,因此多少表現(xiàn)得有些言行不一。


谷歌這邊,有前面提到的疑似已經(jīng)在Arena匿名測試的Gemini 4 Pro。


Anthropic這邊,社區(qū)最近也開始出現(xiàn)Opus 5.2的灰度痕跡。有Claude Code用戶稱,通過運行狀態(tài)和請求路由信息看到了新的claude-opus-5-2模型標識,懷疑部分請求已經(jīng)被灰度到下一代Opus。



而OpenAI那里,有人稱在后臺模型列表里看到了gpt-6-sol的模型名,也有人表示自己疑似已經(jīng)被灰度到新模型。根據(jù)目前廣為流傳的消息,GPT 6 Sol可能會在下周發(fā)布,或者,也可能在美國時間9月29日的Dev Day……總之也不遠了。



三家前沿AI實驗室的下一輪模型,都已經(jīng)開始在社區(qū)里露出測試痕跡。


這輪“減速倡議”到現(xiàn)在最確定的成果,并不是任何一家真的減了速,只是這幾家最重要的AI公司,已經(jīng)把風(fēng)險提前公開講了一遍。


模型并沒有因此放緩。


但至少,如果有一天真的出事,他們可以說:我們早就提醒過了。

AI行業(yè)信號頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
景东| 曲靖市| 白朗县| 武城县| 波密县| 阜新市| 周宁县| 杨浦区| 鄂托克前旗| 罗源县| 普兰店市| 南皮县| 凤山市| 通海县| 郴州市| 兖州市| 建宁县| 柞水县| 平度市| 丰城市| 遂溪县| 苏尼特右旗| 平凉市| 四会市| 梅州市| 德钦县| 宁陕县| 新昌县| 永善县| 平原县| 阿巴嘎旗| 花莲县| 新巴尔虎左旗| 盐城市| 林口县| 大余县| 阳春市| 庆元县| 宁强县| 商南县| 东台市|