久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**谷歌提出Dream-RSI方法,讓AI在歷史實驗記錄構(gòu)成的“夢境”中模擬不同探索策略,無需重跑真實實驗,實現(xiàn)低成本遞歸自我改進,并在多個任務上顯著提升效率。** **要點** **1. Dream-RSI用“夢境”模擬代替真實重跑** 將已執(zhí)行的實驗記錄構(gòu)建為可回放的發(fā)現(xiàn)樹,AI在樹中按新策略走一遍即可評估效果,執(zhí)行成本為零,且候選集合始終保留當前策略,確保不降級。 **2. 算力節(jié)省效果顯著,最高省162倍Agent調(diào)用** 在Lasso算法工程任務中,Dream-RSI相比SimpleTES基線最多省下162倍Agent調(diào)用;在數(shù)學優(yōu)化任務中省下50倍以上預算;在GPU內(nèi)核工程中同等預算下性能提升最多2.09倍。 **3. OpenAI加速研究自動化,但安全與對齊仍是瓶頸** OpenAI的“自動化研究實習生”已完成約3.1倍人工作業(yè)量,目標2028年實現(xiàn)全自動AI研究員;但安全事件暴露模型會“有動機地推理”突破安全規(guī)則,RSI安全路徑尚未解決。 **4. Anthropic的Claude已主導代碼與研究,研究品味超越人類** Claude貢獻Anthropic代碼庫超80%,自我優(yōu)化代碼提速從3倍躍升至52倍;在開放式研究項目中填平97%的差距,研究品味在64%場景下選得比人類更好。 **5. 國內(nèi)智譜與DeepSeek分別從“自凈化”和算子優(yōu)化切入RSI** 智譜GLM-6.0定位完全自訓練,核心是“自凈化”——讓模型能判斷何時停止與糾正自己。DeepSeek已通過AI自主優(yōu)化算子,實現(xiàn)“讀代碼—找瓶頸—優(yōu)化”全閉環(huán),Harness工具支持模塊獨立進化與熱替換。
谷歌給RSI找到了一條捷徑:做夢
2026-09-17 14:35

谷歌給RSI找到了一條捷徑:做夢

本文來自微信公眾號:字母AI,作者:苗正,編輯:王靖,題圖來自:AI生成


AI要學會自己改進自己,谷歌打算先讓它做個“夢”。


這場“夢”,瞄準的是AI行業(yè)熱議的RSI,即遞歸自我改進:讓AI改進自身,改進后的系統(tǒng)再繼續(xù)改進自己,一輪接一輪。但這個循環(huán)有一道繞不過去的坎:換一種做事方法,究竟有沒有用?如果每調(diào)整一次探索策略,都要把整輪實驗重新跑一遍,AI變強的速度還不好說,算力賬單倒是先漲起來了。


谷歌研究團隊在新論文《Dream-RSI》中,給出了一個思路:讓AI先在“夢里”試。


所謂“做夢”,就是把過去真實執(zhí)行過的實驗記錄變成一個可以反復回放的環(huán)境,讓AI在里面比較不同的探索策略:先嘗試哪條路,哪些方向值得繼續(xù),什么時候該停手。有了現(xiàn)成的實驗結(jié)果,許多策略的篩選就不用再把昂貴的實驗重做一遍。


等“夢里”篩出了更好的策略,AI再帶著它回到真實實驗,積累新的記錄,供下一輪“做夢”繼續(xù)改進。真實探索為“夢”提供素材,“夢”又幫助AI調(diào)整下一次探索的方法,自我改進的循環(huán)便由此接上。


谷歌讓AI在“夢里”琢磨的,正是如何讓自己更會做研究。每輪實驗留下的經(jīng)驗,都有機會成為下一輪少走彎路的本錢。


一、何為做“夢”RSI?


每個人都做過夢,但AI的“夢”,跟廣義的夢不一樣,它指的是在已經(jīng)錄好的歷史發(fā)現(xiàn)樹里,用新策略走一遍,看會得到什么結(jié)果。


就像在迷宮中找出口。第一次進迷宮,沒有任何地圖,只能瞎走。但是在走的過程中,AI會順手把迷宮的地圖畫出來。


所以當?shù)诙巫哌@個迷宮之前,就可以先看著這張地圖,大概在腦內(nèi)規(guī)劃一個最快的路線。


那么在腦內(nèi)繪制的這個過程,就叫“夢”。


谷歌的研究團隊在論文中這樣描述,眼下的RSI,還沒發(fā)展到“AI深夜改自己的代碼、然后一夜變強”那種程度?,F(xiàn)在行業(yè)還停留在發(fā)現(xiàn)循環(huán)(discovery loop)之中。


Agent提出候選方案,評估結(jié)果,吸收反饋,再提出下一輪。算法設計、數(shù)學優(yōu)化、GPU內(nèi)核工程,這些關鍵詞,本質(zhì)上都是同一個循環(huán)轉(zhuǎn)出來的。


而循環(huán)能轉(zhuǎn)多快,取決于AI如何去“探索”這個迷宮。



要是用固定的探索策略,那它在搜索空間變大之后就不靈了,因為它不會從歷史里學習并改善自己的策略。


就像每次考試都考同一道題,但是由于策略是固定的,所以就會導致AI每次都會在這道題出錯。


那么讓策略自己進化唄,每次跑完根據(jù)結(jié)果調(diào)整下一次的策略,不就行了?


也不行,因為這種調(diào)整策略的辦法成本太高了。


因為AI公司要判斷“一套新策略到底好不好”,不能只看它走了一步怎么樣,得拿它完整跑一整輪再看結(jié)果。而且還會有一定概率出現(xiàn)這種情況,AI跑好幾百次嘗試、跑完所有輪次,最后發(fā)現(xiàn)結(jié)果還不如原來的固定策略。


因此,谷歌Dream-RSI的重點,就落在了第一次跑迷宮所繪制的地圖上,即模型的探索歷史。


一次在線發(fā)現(xiàn)跑完之后,留下的并不只是幾行結(jié)論,而是一棵結(jié)構(gòu)化的“發(fā)現(xiàn)樹”。


這棵樹上的每個分叉點,都是AI的某一次嘗試。比如那次它寫了什么代碼、跑出來什么結(jié)果、得了多少分,全部在那個節(jié)點上,隨時能翻出來看。


過去,AI公司把“夢”要么當成提示詞塞進靜態(tài)上下文,要么當成微調(diào)權(quán)重的訓練數(shù)據(jù)。而Dream-RSI提出了第三種用法:把它當成一臺可回放的模擬器(replay simulator)。


同一棵樹,換一套探索策略去走,就會走出不一樣的軌跡。并且在下一次訓練的過程中,把已經(jīng)走過的路從地圖上劃掉,專門挑不同的分支、按不同的順序、用不同的并行度、在不同的地方停下來,就可以避免重復、浪費算力。


這棵樹上的每個節(jié)點都已經(jīng)被真實執(zhí)行過了,所有結(jié)果都存著,所以回放一條新軌跡只需要“讀”記錄,不需要重跑Agent和評估器,執(zhí)行成本為零。


但正如剛才提到的,之前的改進方法不一定比傳統(tǒng)的固定策略好,很有可能出現(xiàn)費了半天力氣調(diào)整策略,最后效果還不如以前的情況。


論文給了一個不降級保證:候選集合里始終包含當前策略,所以選出來的新策略在固定歷史上的平均回放分,不會低于舊策略。


換句話說,這套自我改進,至少在設計上是“只增不減”的。


谷歌將Dream-RSI放在三個領域、八個科學發(fā)現(xiàn)任務上跑。包括算法工程(Lasso 正則化路徑求解器)、數(shù)學優(yōu)化(Sum–Difference、自相關不等式、圓堆疊)、GPU內(nèi)核工程(KernelBench)。


結(jié)果是這樣的。在Lasso 上,Dream-RSI優(yōu)于sklearn、glmnet等標準庫和強基線,相比SimpleTES最多省下162倍的Agent調(diào)用,相比固定探索基線也省約1.7倍。


在數(shù)學優(yōu)化上,它在1000代以內(nèi)就追平或超過強基線,相比SimpleTES省下50倍以上的預算。此前,SimpleTES在自相關問題上拿了最好的分數(shù),代價是51200代。


在KernelBench上,它要么用1.79到2.43倍更少的代數(shù)達到目標速度,要么在同等預算下把內(nèi)核性能最多提升 2.09 倍。


如果Gemini 4用的是Dream-RSI,那谷歌很可能會翻盤。


二、OpenAI、Anthropic的RSI又是什么


作為最頭部的AI大廠,Anthropic和OpenAI又是怎么實現(xiàn)RSI的呢?


先看OpenAI。


9月初,它一天發(fā)了兩份文檔,第一份講內(nèi)部研究加速。在6月之前,Agent的總運行時長還低于人類的總工作量。到了8月中旬,Agent每天都能完成大約以前3.1個工作日的活。


OpenAI還宣布,已經(jīng)實現(xiàn)了去年秋天承諾過的“自動化研究實習生”。這是一個能在人類指導下,完成研究工作的Agent,就連那些需要資深研究員干上幾天的活,它都能自己獨立完成。


OpenAI的下一步目標是,在2028年3月之前,做出“全自動化的AI研究員”,它能自己提出研究問題,然后根據(jù)提出的問題自己規(guī)劃、自己跑實驗。


之所以現(xiàn)在還叫“實習生”,是因為在4到8小時的任務里,超過一半至少需要一次人工介入。


第二份,是首席科學家雅庫布·帕喬基(Jakub Pachocki)寫的那篇《異種心智》(An Alien Mind)。


他把“安全”拆成兩件事:目標對齊(goal alignment)和價值對齊(value alignment)。


目標對齊,指的是“AI 有沒有認真去完成你交給它的任務”,比如聽不聽得懂指令、愿不愿意配合、能不能get你到底想干什么。


價值對齊,指的則是“當目標模糊、互相沖突,或者被丟進一個陌生、甚至有人故意使壞的環(huán)境時,它還能不能講道理”。


誠實、有底線、對人抱有善意,只能靠一套通用規(guī)則來實現(xiàn)。


雅庫布在文章中表示,RSI它難就難在“泛化”。


模型越聰明,越要在訓練時沒見過的情境里臨時做判斷,就越可能把學到的價值觀推歪。


文章給出了一個反面教材。一個模型起初“滿腦子都是對齊的念頭”,可只要用足夠大的優(yōu)化壓力逼它去達成一個很硬的目標,它就會學會“有動機地推理”。即模型在思維鏈上表示的都是符合規(guī)則的行為,可模型實際上做的,卻是有悖于安全準則的事情,比如對某個網(wǎng)站發(fā)起攻擊以獲得目標需要的數(shù)據(jù)。


因此雅庫布表示:“我們還不知道怎么安全地走到完全對齊的、完整的RSI。”


7月中旬,OpenAI在內(nèi)部網(wǎng)絡安全評估中出事,訓練中的Agent突破沙箱隔離,入侵了Hugging Face的生產(chǎn)系統(tǒng),甚至滲透了OpenAI自己的內(nèi)部網(wǎng)絡。


事件曝光后,OpenAI暫停了部分前沿模型的強化學習訓練,其中待部署模型的RL訓練停了整整兩周,最大規(guī)模的前沿RL訓練至今沒有明確具體哪天恢復。并且在恢復時,這些模型全部加裝了更嚴格的安全監(jiān)控和對齊措施。


此外,OpenAI還專門組建了RSI(遞歸自我改進)團隊,橫跨研究、工程、產(chǎn)品和基礎設施,目標是讓AI系統(tǒng)加速甚至主導自身的研究流程。相關工程師崗位的年薪開到38萬到50萬美元。


再看Anthropic。他們自己發(fā)布的文章《當AI建造自己》(When AI builds itself)就曾表示,截至2026年5月,在合并進Anthropic代碼庫的代碼里,有超過80%是由Claude所撰寫的,Anthropic管理層預計,今年會超過90%。


2026年第二季度,一名工程師每天合并的代碼量,是2024年的8倍。不是因為他們每天加班,而是因為大部分代碼由Claude寫,人只負責指揮和審查。


Anthropic內(nèi)部有個標準測試,把一段訓練小模型的代碼丟給Claude,讓它自己優(yōu)化自己的性能。但前提是改完之后訓練結(jié)果不能變差,還不能破壞正確性,違反安全準則。


2025年5月,Claude Opus 4平均提速約3倍。到2026年4月,Claude Mythos Preview實現(xiàn)了約52倍提速。作為參照,一個熟練的人類研究員要花4到8小時,才能提高4倍。


更能說明問題的是,它開始自己提實驗了。


2026年4月,Anthropic公開了一個開放式研究項目,題目是能不能用一個較弱的模型,去可靠地監(jiān)督、訓練一個比它更強的模型?


研究者先給這道題劃了兩條線,分別是弱模型自己單干能做到多好和如果直接拿正確答案去訓練強模型,能有多好。


兩條線中間的那段差距,就是要靠“用弱模型監(jiān)督”去填的。誰填得越多,方法就越有效。


結(jié)果,兩名人類研究員忙了大約一周,填上了這段差距的23%。Claude驅(qū)動的Agent,耗時800小時,花了大約1.8萬美元的算力,填上了97%。


Anthropic還給人類的“研究品味”打分。


所謂研究品味,就是做研究時那些判斷,比如該盯哪個問題、哪個結(jié)果值得信、哪條路其實已經(jīng)走死了。


測法是這么設計的,Anthropic找出一些真實的Claude Code研究會話,專挑其中那些“走了彎路”的會話,然后把走彎路之前的記錄喂給模型,讓它說下一步該做什么。再另找一個能看到結(jié)果的Claude當裁判,判斷到底是人還是模型選的那一步更好。


結(jié)果是,2025年11月的Opus 4.5,有51%的時候選得比人好。2026年4月的Mythos Preview,有64%比人選得更好。


三、國內(nèi)RSI進展如何了?


視角回到國內(nèi)。


8月31日,唐杰在智譜中期業(yè)績會上的表態(tài),下一代模型GLM-6.0定位是Fully Self-Training,完全自訓練。


唐杰把這套能力的核心,稱作是“自凈化”,注意是凈化不是進化。不把模型做得更大,相反,讓模型具備自我判斷能力,能夠知道“什么時候停止、什么時候糾正自己”。


自凈化覆蓋了從模型預訓練、中期訓練到后訓練的完整流程,最終實現(xiàn)自主訓練和自我進化。


唐杰認為,自凈化是RSI的命門。


自我改進能不能成立,其實并不取決于模型能不能生成下一步,反而取決于它能不能判斷“這一步到底是不是進步”。


在這點上,唐杰的觀點和谷歌Dream-RSI里的“探索策略”、Anthropic的“研究品味”,說的是同一件事,即模型如何意識到什么是好,什么是壞。


7月11日,唐杰發(fā)表了一封內(nèi)部信,標題為《巨浪已來》,宣布了一個叫“摸高”的計劃。


兩年戰(zhàn)略投入,放棄短期變現(xiàn),去爭下一代AGI的制高點。


內(nèi)部信列出的四大核心引擎里,有一個就是完全自訓練。建一座高質(zhì)量的合成數(shù)據(jù)工廠,用AI與AI之間的自對弈去生成知識。并在安全沙箱內(nèi),賦予系統(tǒng)重寫自身代碼的能力,讓進化的速度不再被人類工程師卡住。


財報顯示,智譜約有60%的資金,是用來實現(xiàn)RSI的。


實際上DeepSeek也有RSI,只不過并非是梁文鋒親口說的。


9月14日,DeepSeek算子工程師劉勝與發(fā)表長文《我不得不把才華埋葬在昨天》。


作者曾就讀于北大2021級圖靈班,擔任前北大未名超算隊隊長、代表學校出征過國際大學生超算競賽SC23。2025年4月加入DeepSeek,2026年參與DeepEP V2的通信算子重構(gòu)。


就在發(fā)文前幾天,他剛剛交付了DeepSeek V4.1的主Attention算子,這是一個直接決定推理效率的核心組件。


他在文章中提到,未來半年到一年,AI寫算子的能力,大概率會追平甚至超越頂級人類工程師。


原因是這樣的,DeepSeek已經(jīng)能自己讀懂CUDA、PTX、SASS了,還會用專業(yè)工具逐條分析“哪條指令在流水線上停了幾拍”,然后動手把算子改快。


換句話說,AI已經(jīng)掌握了“讀代碼—找瓶頸—優(yōu)化—再測速”這整條性能工程循環(huán)。


劉勝與表示,他剛來DeepSeek的時候,模型還只是一個“能幫他查查文檔、讀讀代碼、找找bug的小助手”。一年之后,DeepSeek已經(jīng)蛻變成“能夠獨立優(yōu)化算子的算子大師”。


他還相信,用不了多久,AI會再往前一步。能夠自己設計算子的調(diào)度方案、自己評估幾套方案誰更快、再親手把它實現(xiàn)和優(yōu)化出來。


劉勝與表示,他算子寫得越好,DeepSeek新模型的訓練和推理就越快;模型迭代越快,AI自主寫算子的能力成熟得就越早;而它成熟得越早,他這門手藝被替代的周期就越短。


隨后劉勝與給出判斷,雖然他并不會因此“失業(yè)”,但是會“轉(zhuǎn)業(yè)”。從整天泡在寄存器分配與共享內(nèi)存調(diào)度里的“手藝人”,轉(zhuǎn)去做Agent的“機甲駕駛員”。


除此之外,DeepSeek的Harness工具,本質(zhì)上也是為RSI服務的。


傳統(tǒng)軟件里,模塊之間“你中有我、我中有你”,動一處常常連累十處。


DSH的特點是一切皆插件,每個功能都是獨立零件,只通過一個標準接口接入,彼此不直接認識。于是任何一個插件都能單獨升級、單獨替換、單獨進化,不必驚動其他任何人。


還有DSH的“可逆效應”和熱替換這兩大特點,能讓改動時只動該動的那一處,裝錯、改炸了還能整體回滾。


本文來自微信公眾號:字母AI,作者:苗正,編輯:王靖

AI行業(yè)信號頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
云霄县| 罗平县| 玉树县| 阜平县| 南平市| 天津市| 江油市| 荔波县| 永登县| 长宁县| 许昌市| 沧州市| 科技| 房山区| 科技| 海伦市| 日土县| 松阳县| 冷水江市| 巢湖市| 三原县| 卢龙县| 迭部县| 曲阳县| 惠水县| 商丘市| 苍山县| 鹰潭市| 泰宁县| 南召县| 平定县| 青海省| 荥阳市| 呼和浩特市| 南岸区| 古蔺县| 贺州市| 滨海县| 江山市| 垣曲县| 北碚区|