久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

OpenAI O1推出后,大模型訓(xùn)練中后訓(xùn)練與強(qiáng)化學(xué)習(xí)的權(quán)重持續(xù)提升,基礎(chǔ)模型的角色從知識(shí)壓縮載體變?yōu)槟芰?,大模型?xùn)練邏輯發(fā)生系統(tǒng)性變革。 ## **1. 大模型訓(xùn)練算力分配發(fā)生轉(zhuǎn)變** GPT-3時(shí)代預(yù)訓(xùn)練是模型能力的核心決定因素,后訓(xùn)練僅做行為調(diào)整,強(qiáng)化學(xué)習(xí)作用有限;目前已有企業(yè)預(yù)訓(xùn)練與后訓(xùn)練的算力投入大致相等,后訓(xùn)練直接決定模型最終能力。 ## **2. 基礎(chǔ)模型角色轉(zhuǎn)變?yōu)樵幽芰d體** 當(dāng)前基礎(chǔ)模型不需要在預(yù)訓(xùn)練階段掌握完整復(fù)雜任務(wù)能力,只需提前儲(chǔ)備代碼語法、工具調(diào)用等原子基礎(chǔ)能力,復(fù)雜任務(wù)的能力組合交由后續(xù)強(qiáng)化學(xué)習(xí)完成。 ## **3. 預(yù)訓(xùn)練數(shù)據(jù)分布和目的性大幅調(diào)整** GPT-3時(shí)代網(wǎng)頁與維基百科數(shù)據(jù)占預(yù)訓(xùn)練數(shù)據(jù)的85%,當(dāng)前這類數(shù)據(jù)占比已降至15%,代碼成為占比最高的預(yù)訓(xùn)練數(shù)據(jù),合成數(shù)據(jù)的重要性也隨針對(duì)性數(shù)據(jù)需求提升。 ## **4. 新增中訓(xùn)練環(huán)節(jié)銜接預(yù)訓(xùn)練與后訓(xùn)練** 預(yù)訓(xùn)練與后訓(xùn)練的數(shù)據(jù)分布差異較大,直接跳轉(zhuǎn)可能影響模型尤其是MoE模型的專家負(fù)載平衡,中訓(xùn)練作為過渡階段,可讓模型提前適配后續(xù)任務(wù)的數(shù)據(jù)分布。
The Base Model Is Dead。
2026-08-16 16:36

The Base Model Is Dead。

本文來自微信公眾號(hào): 小蓋fun ,作者:小蓋


The Base Model Is Dead,這是我剛看完的一期分享,來自美國(guó)開源模型創(chuàng)業(yè)公司Arcee AI的預(yù)訓(xùn)練負(fù)責(zé)人Varun Singh。標(biāo)題有點(diǎn)唬人,但這哥們的觀點(diǎn)非常扎實(shí)。


他認(rèn)為,過去Base Model的任務(wù),是盡可能吸收人類已有的知識(shí)。


GPT-3那個(gè)時(shí)代,預(yù)訓(xùn)練的邏輯很簡(jiǎn)單,就是抓取大量互聯(lián)網(wǎng)文本、Wikipedia、書籍,把盡可能多的人類知識(shí)壓縮進(jìn)模型參數(shù)里。


在GPT-3的訓(xùn)練數(shù)據(jù)里,來自網(wǎng)頁和Wikipedia的數(shù)據(jù)大概占到了85%。


那個(gè)時(shí)候大家的默認(rèn)邏輯就是,模型到底有多強(qiáng),很大程度上取決于預(yù)訓(xùn)練做得好不好。


后訓(xùn)練更多是在這個(gè)基礎(chǔ)上做最后的行為調(diào)整,比如讓模型更會(huì)聊天、更會(huì)遵循指令。RL在當(dāng)時(shí)的作用也比較有限。


但是O1之后,整個(gè)行業(yè)都發(fā)現(xiàn)了RL的重要性。


大家開始發(fā)現(xiàn),只要RL做得足夠好,模型在預(yù)訓(xùn)練結(jié)束之后,能力還可以繼續(xù)明顯提升。于是就不斷加后訓(xùn)練的投入。


我記得之前羅福莉在一個(gè)訪談里提過,他們?cè)陬A(yù)訓(xùn)練和后訓(xùn)練上的算力投入已經(jīng)大致接近。


這也就是說,模型在預(yù)訓(xùn)練結(jié)束之后并沒有定型。后訓(xùn)練已經(jīng)不只是把模型調(diào)得更好用,它開始真正影響模型的最終能力。


Base Model的角色也因此發(fā)生了變化。它越來越像是在給后面的RL準(zhǔn)備一些原子能力,也就是Atomic Skills。


舉個(gè)例子,如果希望通過RL訓(xùn)練出一個(gè)非常強(qiáng)的Coding Agent,那Base Model在預(yù)訓(xùn)練結(jié)束的時(shí)候,不一定已經(jīng)能夠獨(dú)立完成十個(gè)小時(shí)的軟件工程任務(wù)。


但它最好已經(jīng)掌握了Python、代碼結(jié)構(gòu)、API、函數(shù)調(diào)用、Git、文件系統(tǒng)這些基礎(chǔ)能力。


這些就是Atomic Skills。


進(jìn)入更復(fù)雜的任務(wù)和環(huán)境之后,再通過RL學(xué)習(xí)怎么把這些基礎(chǔ)能力組合起來,這樣就可以涌現(xiàn)出復(fù)雜Agent任務(wù)的能力。


所以,如果Base Model的目標(biāo)變了,預(yù)訓(xùn)練的數(shù)據(jù)自然也會(huì)變。


前面說過,GPT-3時(shí)代網(wǎng)頁文本占了訓(xùn)練數(shù)據(jù)的85%。而現(xiàn)在一些新模型里,這個(gè)比例已經(jīng)降到了15%左右,代碼反而成了占比最大的數(shù)據(jù)來源。


背后的邏輯其實(shí)很好理解。


現(xiàn)在模型公司已經(jīng)非常清楚模型需要的關(guān)鍵能力,諸如Coding、長(zhǎng)程任務(wù)等等,那在預(yù)訓(xùn)練階段,就可以有意識(shí)地提前給它準(zhǔn)備這些能力需要的數(shù)據(jù)。


所以訓(xùn)練數(shù)據(jù)開始越來越有目的性。一些過去主要在后訓(xùn)練階段才會(huì)出現(xiàn)的問答、對(duì)話,以及更接近Agent任務(wù)的數(shù)據(jù),也開始提前進(jìn)入預(yù)訓(xùn)練。


這種訓(xùn)練邏輯下,合成數(shù)據(jù)的重要性也開始上升。因?yàn)楫?dāng)大家越來越清楚模型未來需要什么能力,然后就可以圍繞這些能力,主動(dòng)去準(zhǔn)備更合適的訓(xùn)練數(shù)據(jù)。


比如我們已經(jīng)知道,未來模型需要很強(qiáng)的Coding、Reasoning和Agent能力,那就可以圍繞這些目標(biāo),主動(dòng)生成更接近真實(shí)任務(wù)的數(shù)據(jù)。


原來只是一段代碼,現(xiàn)在可以把它變成找Bug、修改代碼、調(diào)用工具、連續(xù)完成任務(wù)的訓(xùn)練樣本。


這樣模型在預(yù)訓(xùn)練階段接觸到的,就不只是知識(shí)本身,也開始包含未來真正要用到的能力。


模型未來需要什么能力,預(yù)訓(xùn)練階段就可以圍繞這些能力去設(shè)計(jì)和生成數(shù)據(jù)。


這些變化,也催生了現(xiàn)在經(jīng)常聽到的Mid-training。


原因也很好理解。


預(yù)訓(xùn)練階段模型看到的,過去主要是網(wǎng)頁文本、書籍、代碼。但到了后訓(xùn)練階段,它突然要面對(duì)Reasoning Trace、Agent交互記錄、多輪工具調(diào)用、長(zhǎng)上下文任務(wù)。


前后兩個(gè)階段的數(shù)據(jù)分布差別可能非常大。


如果直接從一個(gè)階段跳到另外一個(gè)階段,模型就需要突然適應(yīng)一套完全不同的數(shù)據(jù)。


對(duì)MoE模型來說,這個(gè)問題會(huì)更加明顯,因?yàn)轭A(yù)訓(xùn)練過程中不同Expert已經(jīng)逐漸形成了自己的分工,數(shù)據(jù)分布突然變化,可能會(huì)影響原有的負(fù)載平衡。


所以Mid-training可以理解成一個(gè)過渡階段。


在正式進(jìn)入后訓(xùn)練之前,提前讓模型適應(yīng)更長(zhǎng)的Context、更接近Reasoning和Agent的數(shù)據(jù),以及未來真正會(huì)遇到的任務(wù)分布。


這樣Pre-training和Post-training之間就不會(huì)切得那么生硬。


所以整體來看,Pre-training、Mid-training、Post-training、RL這幾個(gè)階段之間的界限,確實(shí)已經(jīng)越來越模糊了。


或者換一種理解方式,現(xiàn)在看待模型訓(xùn)練,可以粗略簡(jiǎn)化成兩個(gè)大的范式:Supervised Learning和Reinforcement Learning。


前者幫助模型建立知識(shí)、表征和各種基礎(chǔ)能力,后者再讓模型進(jìn)入環(huán)境,通過不斷探索、試錯(cuò)和反饋,把這些能力組合起來。


回到開頭那個(gè)標(biāo)題。The Base Model Is Dead當(dāng)然是個(gè)有點(diǎn)夸張的說法。


Base Model沒有死,真正變化的是它在整個(gè)模型訓(xùn)練體系里的角色。


過去我們希望Base Model盡可能把人類知識(shí)學(xué)進(jìn)去,然后在這個(gè)基礎(chǔ)上做一些后訓(xùn)練?,F(xiàn)在它越來越像一個(gè)為Reasoning和Agent準(zhǔn)備的底子。


先把Atomic Skills準(zhǔn)備好,再把更多復(fù)雜能力留給后面的RL。


Base Model依然重要,只是它越來越像一個(gè)起點(diǎn)。

AI創(chuàng)投日?qǐng)?bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。
如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
始兴县| 盘山县| 长泰县| 西昌市| 柳州市| 通化县| 沾化县| 卓尼县| 万安县| 家居| 齐齐哈尔市| 峨山| 滕州市| 玉树县| 凌源市| 龙泉市| 舟曲县| 乌鲁木齐县| 紫金县| 靖边县| 黄大仙区| 孟津县| 乳山市| 贵港市| 康乐县| 井研县| 安阳市| 阜新市| 女性| 赫章县| 青州市| 厦门市| 舒兰市| 囊谦县| 龙口市| 鸡西市| 伊宁市| 腾冲县| 巴青县| 双鸭山市| 板桥市|