久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

字節(jié)跳動創(chuàng)始人張一鳴拍板禁止大模型蒸餾,業(yè)內(nèi)對此觀點分裂,這一選擇是張一鳴獨立技術判斷,體現(xiàn)了中國AI發(fā)展路徑的多樣性。 ## **1. 蒸餾爭議圍繞“蒸別人”展開,字節(jié)對全類型蒸餾都保持警惕** 行業(yè)普遍認可“自家蒸自家”,爭議聚焦用其他公司模型輸出訓練自有模型;字節(jié)2025年開源模型已同時提供含合成指令數(shù)據(jù)和不含的兩種基座,承認模型輸出污染會影響研究有效性。 ## **2. 地緣壓力并非禁止蒸餾的核心原因** 有觀點認為禁令是為規(guī)避TikTok的美國監(jiān)管風險,但禁令明確覆蓋無風險的國內(nèi)開放權重模型,字節(jié)CEO梁汝波也公開否認“外部壓力說”。 ## **3. 禁令是張一鳴個人的長期技術判斷** 張一鳴卸任后近兩年深度投入AI學習,旁聽Seed核心技術評審,禁止蒸餾是其補完AI知識后給出的首個重大技術判斷,目的是堅持長期主義,打好自研技術基礎。 ## **4. 蒸餾是行業(yè)默認工具,中國AI核心能力不靠蒸餾定義** 蒸餾本身是被廣泛使用的有效訓練技術,當前全球訓練數(shù)據(jù)已存在AI輸出的交叉污染;中國頭部大模型的突破主要來自后訓練優(yōu)化、架構創(chuàng)新與自研強化學習體系,而非蒸餾。 ## **5. 不蒸餾是字節(jié)獨特選擇,豐富了中國AI發(fā)展路徑** 不蒸餾的研發(fā)成本高、難度大,若成功將大幅提升字節(jié)全球AI領域話語權,失敗也會留下昂貴經(jīng)驗,其選擇本身豐富了中國AI產(chǎn)業(yè)的路徑多樣性。
反蒸餾:張一鳴到底是沽名釣譽,還是正本清源?
2026-08-17 20:47

反蒸餾:張一鳴到底是沽名釣譽,還是正本清源?

本文來自微信公眾號:胡說成理,作者:胡喆,題圖來自:視覺中國


8月6日,兩件看起來毫不相關的事撞在了同一天。谷歌DeepMind創(chuàng)始人哈薩比斯卸任CEO,轉任董事長,外界普遍解讀為這是Gemini持續(xù)掉隊的代價。幾乎同時,The Information報道了字節(jié)Seed團隊全員會上的一條消息:張一鳴親自拍板,字節(jié)的大模型絕不蒸餾。


一個因為模型掉隊被挪了位置,一個主動放棄了追趕的捷徑。在大模型賽道上,旗艦模型的前沿能力每隔幾個月就刷新一輪,時間是最重要的判斷依據(jù),窗口期內(nèi)不做動作,就可能落伍。這讓是否蒸餾這個決策變得更難、更重,也更富爭議。


關于張一鳴這次表態(tài),行業(yè)觀點非常分裂。有人認為這是沽名釣譽,想展現(xiàn)自己在AI競爭中的獨特地位和價值觀,營銷味和立人設的意味很濃。也有人說這是正本清源:只有不蒸餾的模型才能摸清底層機理,才能實現(xiàn)真正的跨越式趕超。兩種說法都有依據(jù),但真把它們展開,讀者恐怕會吵起來,因為它不是非黑即白的問題。


開始之前,先厘清一個概念。


蒸餾分兩種。一種是自家蒸自家,用自己的大模型訓練自己的小模型,這是所有頭部實驗室的日常操作,沒有爭議,不在今天討論范圍內(nèi)。另一種是蒸別人,用其他公司模型的輸出訓練自己的模型。今天所有爭論都圍繞后者展開。


但字節(jié)的態(tài)度可能比“不蒸別人”走得更遠。有公開的產(chǎn)品證據(jù)表明,它對蒸自己同樣保持警惕。


2025年8月,Seed開源了Seed-OSS-36B系列,同時發(fā)布兩個基座模型:一個含合成指令數(shù)據(jù)的Base版,一個不含的woSyn版。給出的理由很平淡:預訓練中加入合成指令數(shù)據(jù)可能影響后續(xù)研究,所以為社區(qū)同時提供兩種選擇。


合成指令數(shù)據(jù),就是由模型生成的數(shù)據(jù)。換句話說,字節(jié)至少在一年前就公開承認過一件事:被模型輸出污染過的基座,會影響后續(xù)研究的有效性。這不能直接證明字節(jié)自己不用合成數(shù)據(jù),所有頭部實驗室都在用。但至少說明,字節(jié)對合成數(shù)據(jù)的副作用有清醒認識,并且愿意在產(chǎn)品層面為這種認識付出額外成本。


一家在根子上就對蒸餾保持警惕的公司,做出不蒸餾的決定,也許不該讓人那么意外。但它還是讓人意外了,因為這個決定的代價太大了。


一


張一鳴放話不蒸餾的消息出來后,行業(yè)的第一反應幾乎統(tǒng)一:因為TikTok。


字節(jié)是被討論的這些中國AI公司里,唯一擁有TikTok這種量級海外業(yè)務的。過去的事實已經(jīng)證明,這個業(yè)務很能拿住字節(jié)的軟肋:重要性極高,周旋余地不多。


過去半年,在蒸餾這件事上,中國AI公司被密集點名,而且點名的級別一輪比一輪高。


2月中旬,OpenAI向眾議院美中戰(zhàn)略競爭特別委員會提交備忘錄,指控DeepSeek繞過安全防護對GPT系列實施蒸餾。2月23日,Anthropic發(fā)布博客《Detecting and preventing distillation attacks》,點名DeepSeek、月之暗面和MiniMax,指控它們通過約2.4萬個虛假賬戶與Claude進行了超過1600萬次交互。6月,Anthropic又向參議院銀行委員會遞交信函,指控阿里千問團隊在一個44天的窗口里,用約2.5萬個賬號完成了2880萬次交互。


7月22日,點名第一次升級成政府行為。白宮科技政策辦公室主任克拉齊奧斯在X上公開指控:月之暗面用“大規(guī)模、隱蔽的產(chǎn)業(yè)化蒸餾”,把Anthropic的Fable 5蒸進了Kimi K3。這是美國高級官員第一次把一家中國實驗室和一款具體模型釘在一起。幾小時后,財政部長貝森特跟進,制裁和實體清單都被擺上了桌面。


這個時間線本身就不太對。Fable 5在7月1日才公開可用,K3在7月16日發(fā)布。兩周蒸出一個K3?AI2的Lambert和Laude Institute的Hancock都公開表示技術上說不通,甚至有白宮內(nèi)部人士對媒體承認,這個指控“在核心上說不通”。


被點名的企業(yè)里,阿里在6月下旬通過媒體明確表態(tài):不使用專有AI模型的輸出訓練自家模型,遵守知識產(chǎn)權法規(guī)。DeepSeek唯一一次公開否認,是在《自然》雜志的審稿交流中,否認R1是復制OpenAI模型的推理示例學來的。其余各家,截至發(fā)稿沒有官方回應。


截至發(fā)稿,這份名單上有DeepSeek,有月之暗面,有MiniMax,有千問,白宮甚至親自下場點了月之暗面的名。獨獨沒有字節(jié)。這成了支持“TikTok是問題關鍵”那一派媒體的有力證據(jù)。


所以外界的直覺很自然:字節(jié)不蒸餾,是怕美國人拿這個做文章,再給TikTok加一輪壓力。The Information的報道也做了類似分析。


這個解釋看起來合理,但唯獨有一點說不通。


據(jù)硅星人Pro的報道,張一鳴在7月下旬的全員會上否決的不只是蒸餾美國閉源模型,連國內(nèi)的開放權重模型也不能蒸餾。


Kimi K3是典型的開放權重模型。蒸餾它不違反任何服務條款,不需要虛假賬戶,不需要代理網(wǎng)絡,直接部署在自己的服務器上就行,沒有人會在大洋彼岸統(tǒng)計你的調用次數(shù)。蒸餾K3不會讓字節(jié)出現(xiàn)在任何一份名單上,不會給TikTok帶來任何風險。



但禁令仍然包括了它。


一條為監(jiān)管風險準備的規(guī)矩,為什么延伸到一個零風險的動作上?字節(jié)對此其實有公開的正面回應。


8月6日,字節(jié)CEO梁汝波在年中全員會上直接回應了這個問題:“昨天看到有外部報道說,我們是因為外部壓力才堅持自研的,這是瞎猜的。真實原因是,我們希望團隊延遲滿足感,打好技術基礎,這對長期實現(xiàn)AGI很關鍵。”


兩條信號指向同一個判斷:TikTok也許是原因之一,但不是主因。一條來自禁令本身的邏輯邊界,一條來自官方口徑。后者的證明力有多少,讀者可以自行打折。


那條禁令的邊界為什么劃得這么寬?答案得從三年前找。


二


字節(jié)和蒸餾的關系,比大多數(shù)人以為的更長,也更糾結。


有個少有人提的細節(jié):早在2023年4月,字節(jié)就引入了GPT API調用規(guī)范,禁止把GPT生成的數(shù)據(jù)加進訓練集。這個內(nèi)部規(guī)定,比整個行業(yè)的蒸餾爭議早了將近三年。


但規(guī)定沒能擋住后來發(fā)生的事。2023年12月,The Verge報道字節(jié)秘密使用OpenAI的技術開發(fā)自己的大語言模型,項目代號Project Seed。字節(jié)員工在內(nèi)部Lark群里討論過“數(shù)據(jù)脫敏”,知道這違反了OpenAI的使用政策。


報道引述了一位對字節(jié)內(nèi)部情況有第一手了解的匿名知情人士,原話是:“他們說想確保一切合法,但實際上只是不想被抓住把柄。”


報道發(fā)出當天,OpenAI發(fā)言人Niko Felix確認字節(jié)的開發(fā)者賬戶已被暫停。但他的措辭和報道之間有一個矛盾:The Verge說API的使用頻繁到經(jīng)常觸及上限,OpenAI則說“字節(jié)跳動對我們API的使用很少”。微軟在聲明中重述了Azure OpenAI服務的政策,未對事實做任何評論。


字節(jié)的海外發(fā)言人隨后回應稱,GPT生成的數(shù)據(jù)在Project Seed開發(fā)的早期的確被用于模型注釋,但2023年年中左右已從訓練數(shù)據(jù)中刪除。


這件事的后續(xù),不是調查或處罰,而是沉默。OpenAI沒有公布調查結論,字節(jié)沒有進一步解釋,行業(yè)把它消化成了一個“字節(jié)也曾蒸餾過海外模型”的注腳。


從被曝光疑似蒸餾,到兩年半后在同一個名字的團隊的全員會上宣布絕不蒸餾,中間發(fā)生了什么?


據(jù)公開報道,Seed內(nèi)部圍繞蒸餾至少發(fā)生過三次正式爭論。需要說明的是,三次爭論的說法來自單一媒體,無法從外部交叉驗證,但它給出的細節(jié)和時間節(jié)點與已知事實不矛盾。而張一鳴在全員會上的表態(tài)有多個獨立信源:The Information引用了兩名與會員工,澎湃新聞引用了字節(jié)內(nèi)部人士。


第一次爭論在2025年1月。


當時DeepSeek-R1剛發(fā)布,用受限的訓練成本展現(xiàn)出的推理能力讓硅谷震動,也讓國內(nèi)每一家頭部實驗室重新掂量自己的位置。Seed團隊一批研究員的感受比同行更復雜:他們清楚自己的人才密度、算力投入和研究能力都不弱于DeepSeek,可模型在推理上就是差著一截。


當時業(yè)內(nèi)流傳一種猜測,DeepSeek的訓練過程中用過美國前沿模型的生成數(shù)據(jù)。必須強調,這個說法從未被證實。但在當時的Seed會議室里,它變成了一個非常具體的討論點:如果同行這么做了,效果這么好,我們?yōu)槭裁窗炎约航壸。?/p>


有人提出引入美國頭部閉源模型的生成結果,補齊Seed語言模型的推理短板。這個提案的設計是審慎的:不替換自研預訓練體系,只在產(chǎn)品層面填那幾個已經(jīng)暴露的明顯弱項。


不得而知的是,提議為何沒有獲得最高層支持。公開報道沒有點明是誰否決的,但考慮到張一鳴此前已在旁聽Seed的核心技術評審,而這個問題的戰(zhàn)略層級顯然不會停留在中高層,合理的推斷指向他本人。


第二次是2025年底。


彼時,英偉達Blackwell系列GPU開始在美國頭部實驗室大規(guī)模部署,受出口管制約束,中國實驗室拿不到這一代最先進的卡。據(jù)報道,奠定字節(jié)視頻模型全球地位的Seedance 2.0,是在大量H20堆出來的算力環(huán)境里訓練的。H20是專供中國市場的合規(guī)版本,用于訓練的綜合性能遠不如Blackwell。


從GPT-5.5到Claude 4.8,美國頂級模型在推理、編程和科學問題上出現(xiàn)了明顯躍遷,這個躍遷與Blackwell的大規(guī)模部署高度同步。Seed內(nèi)部一些研究員注意到這件事,感受到的不是焦慮,是恐懼:算力差距正在被新一代硬件拉成代際差距。


于是“用數(shù)據(jù)換算力”的提法第二次出現(xiàn),理由比第一次更充分:短期消不掉算力落差,就用另一種形式的能力來頂。別人已經(jīng)跑完的推理過程,本身就是被消耗掉的算力凝結成的產(chǎn)物。用數(shù)據(jù)替代買不到的卡,把本已不足的訓練資源集中到被證明有效的方向上。


這一次的支持者比第一次多得多,據(jù)報道,它在Seed內(nèi)部逐漸有了成為共識的趨勢。但同樣沒有獲得最高層的支持。


第三次是2026年7月。


7月16日,Kimi K3發(fā)布,2.8萬億參數(shù),直接進入與美國頭部閉源模型同一個競爭區(qū)間。對Seed來說,K3的沖擊力來自一個簡單的對比:那家公司的人、錢、算力都比Seed少,做出來的大語言模型比Seed的強得多。


這一次有人提出了折中方案:蒸餾閉源模型有風險,那就只蒸開放權重模型。授權寬松,可以自建部署,法律和地緣風險接近于零,同樣的數(shù)據(jù)質量,同樣的見效速度。


這個方案繞開了所有已知雷區(qū),在Seed內(nèi)部得到不少支持,看起來只剩下一個純粹的工程選擇。


然后是7月下旬那場全員會。


據(jù)The Information援引兩名與會員工的說法,張一鳴此前很少在Seed的會議上發(fā)言。其他負責人先解釋了公司為什么不用蒸餾搶占先機,然后他開口了。澎湃新聞獲得的表述是:做模型要堅持長期主義、延遲滿足感,而不是用別人的輸出換一時的榜單排名。The Information的報道里還有另一句值得注意的話:他沒有說明這些長遠目標具體是什么。


會后,Seed出臺新政策,明確禁止蒸餾K3等開放權重模型,并通過API檢測追溯排查內(nèi)部疑似蒸餾的行為。


與禁令同時存在的,是一個不太好看的現(xiàn)實。梁汝波在8月6日的年中全員會上公開承認:“大語言模型與海外領先模型的差距有所拉大。”他給出的方向是繼續(xù)自研、補足基本功,接受短期落后。


CEO公開承認落后,內(nèi)部三次合理方案都被最高層壓下,創(chuàng)始人親自禁止零風險的折中路線。這說明字節(jié)認真考慮過蒸餾這條路,甚至強烈羨慕過走這條路的同行。但它選擇了不走。為什么?


三


討論字節(jié)為什么不走之前,先把蒸餾放到更大的坐標里看一眼。


2023年,斯坦福用OpenAI text-davinci-003生成的5.2萬條指令數(shù)據(jù)微調LLaMA,做出了Alpaca。伯克利用ShareGPT上收集的7萬條ChatGPT對話訓練出Vicuna。微軟走得更遠,Orca直接用GPT-4的完整推理鏈,訓練一個130億參數(shù)的模型。


這三個項目在發(fā)布時都是開源社區(qū)的里程碑。Alpaca被慶祝為“幾百美元做出GPT-3.5水平的模型”。沒有人管斯坦福叫攻擊者,沒有人說伯克利在竊取知識產(chǎn)權,也沒有人要求微軟解釋,為什么用自己投資的公司的模型輸出來訓練另一個模型。


它們做的事,和2025、2026年被指控的那些公司做的事,在技術層面是同一件事:用更強模型的輸出訓練更弱的模型。區(qū)別在于規(guī)模和手段,也在于誰在做。


2026年5月,一件小事讓蒸餾變得更加說不清了。


Anthropic發(fā)布Claude Opus 4.8之后,有開發(fā)者用中文通過API問它“你是什么模型”,它回答自己是通義千問。隨后又有人測出它自稱DeepSeek。多個獨立測試在清空系統(tǒng)提示詞的API環(huán)境下復現(xiàn)了這一行為。


這不能直接證明Anthropic蒸餾了千問。技術界的主流判斷是,這更像過度使用中文互聯(lián)網(wǎng)數(shù)據(jù)導致的身份認知污染:互聯(lián)網(wǎng)上的中文內(nèi)容有相當一部分已經(jīng)是AI生成的,任何從網(wǎng)上爬取中文語料的實驗室都會把這些東西吃進去。


連DeepSeek自己都在《自然》的審稿回應里承認過類似的事:他們否認有意使用OpenAI的輸出,但承認從互聯(lián)網(wǎng)抓取的數(shù)據(jù)里可能含有GPT-4生成的內(nèi)容。不是想用,是躲不開。


但它證明了一件事:在全球實驗室瘋狂吞入海量數(shù)據(jù)的過程中,訓練語料里到底混入了多少蒸餾的產(chǎn)物,已經(jīng)沒人說得清。千問是被點名指責的蒸餾者,同時也成了全世界很多開源蒸餾模型的“老師”。Anthropic則尤其尷尬:一家指控別人蒸餾自己的公司,旗艦模型張嘴說“我是千問”。老師和學生的分界線,在數(shù)據(jù)層面已經(jīng)劃不出來了。


在這樣的背景下,我們甚至無法證明任何一家公司完全沒有間接使用過蒸餾的結果。更準確地說,每一個從互聯(lián)網(wǎng)爬過訓練數(shù)據(jù)的模型,都或多或少沾著別人的影子。


這才是張一鳴那個決定的真實背景。蒸餾不是一個灰色地帶的技巧,它已經(jīng)滲進了整個行業(yè)的地基。他反對的不是一種邊緣做法,而是幾乎所有人都在做的事。


但這里也有一絲反諷——他要反對的那個蒸餾,在戰(zhàn)略上、執(zhí)行上做得到,但真正落到數(shù)據(jù)層,沒人能保證這件事不在某個角落里事實性地發(fā)生。


四


張一鳴的表態(tài)引發(fā)這么大爭論,原因恰恰是他在反常識。


蒸餾在今天的AI行業(yè),根本不是一個值得爭論的話題,它是默認選項。


Anthropic自己在2月那篇博客里,開篇就承認蒸餾是“廣泛使用且合法的訓練方法”。這句話沒有限定自蒸餾還是蒸別人,指的是這個技術類別本身。


Anthropic劃的線不在技術,而在手段:虛假賬戶、代理網(wǎng)絡、繞過地域和訪問限制。連克拉齊奧斯在7月22日那篇措辭最嚴厲的指控里也專門區(qū)分了兩種情形:正當?shù)腁I蒸餾是開放創(chuàng)新生態(tài)的關鍵一環(huán),不可接受的是“以竊取美國專有技術為目的的大規(guī)模、隱蔽的工業(yè)級蒸餾”。


清華大學LeapLab團隊的對照研究顯示,蒸餾模型的pass@k曲線始終顯著高于基礎模型。蒸餾通過學習更強教師模型的推理模式,把基礎模型原有的推理邊界推開了。


DeepSeek把R1蒸餾進千問架構的7B小模型,在AIME24數(shù)學基準上拿到55.5,超過了o1-preview,而教師樣本不過是R1生成的80萬條數(shù)據(jù),算力開銷極低。


也有人試圖找到科學依據(jù),來證明蒸餾會封死模型上限。最常被引用的是牛津大學Shumailov等人2024年發(fā)表在《自然》的“模型坍縮”研究:模型在自身生成的數(shù)據(jù)上反復訓練,會出現(xiàn)尾部信息不可逆的丟失和性能退化。


但只引用這個例子,其實是一種刻意制造信息不對稱的人工剪裁。Allen Institute for AI的高級研究員Nathan Lambert,目前英文世界對RLHF和大模型訓練方法論寫得最系統(tǒng)的研究者之一,在他的RLHF專著里給出的圖景要復雜得多:坍縮主要發(fā)生在未經(jīng)過濾的、重復的、單一模型自我訓練的極端場景;在使用多元教師、混合真實數(shù)據(jù)、做好質量過濾的前沿管線里,合成數(shù)據(jù)可以也應該大規(guī)模使用。


有趣的是,反對蒸餾一方最有代表性的論證也來自Lambert。他把兩件事分開:蒸餾是模仿,學的是強模型輸出的形狀;強化學習是探索,模型必須自己推理、自己生成、在錯誤里反復迭代。真正強大的能力來自模型自己趟出來的路徑,那條路徑不會出現(xiàn)在別人API返回的結果里。


這個論證很難反駁。但Lambert本人對蒸餾指控的態(tài)度相當克制:白宮點名月之暗面之后,他反而是公開質疑其技術可行性的研究者之一。


真正在起變化的是另一件事:蒸餾能不能被檢測到。


Anthropic那份報告本身就叫《Detecting and preventing distillation attacks》,它聲稱能通過IP地址、請求元數(shù)據(jù)和訪問模式,把蒸餾行為歸因到具體公司。


白宮的指控更是直接建立在“我們能看見”的前提上:克拉齊奧斯說月之暗面搭建了內(nèi)部平臺規(guī)避檢測,貝森特聲稱已在多款中國模型里發(fā)現(xiàn)了美國大模型的“水印”。這些說法里有多少夸大成分,可以爭論,但方向是明確的:蒸餾正在從“很難檢測”變成“可以檢測”,甚至開始變成制裁的依據(jù)。


所以這場爭論的真實層面落在哪里?


關于蒸餾是否有效,沒有爭議,它有效。關于是否合法,控方自己承認技術本身合法。關于會不會封死上限、讓你看不清底層機理,這是合理的擔憂,但到今天為止既沒有共識,也沒有被嚴格證明。


唯一在變的,是可檢測性,以及隨可檢測性而來的政治風險。


在行業(yè)幾乎全體默認蒸餾、沒有證據(jù)說蒸餾有害、但蒸餾痕跡正變得可追溯的時刻,張一鳴做了一個逆所有人而行的決定。


他在反的是常識。那他在堅持什么?


五


把排除掉的東西先列一遍。不是法律問題,蒸開放權重模型完全合規(guī)。不主要是地緣政治,禁令涵蓋了零風險的部分,CEO也親口說外部壓力是“瞎猜的”。甚至不是因為蒸餾被證明有害,實證上支持蒸餾的證據(jù)反而更多。


排除項之外,剩下的可能指向三個方向。


第一個方向,字節(jié)或者說張一鳴本人極度看重技術上可診斷的清潔度,也就是標題里說的正本清源。


蒸餾進來的數(shù)據(jù)會讓模型在榜單上好看起來,同時讓“我的預訓練配方、數(shù)據(jù)管線、RL體系到底哪一環(huán)出了問題”這個追問,變得沒有準確答案。差距從儀表盤上消失了,產(chǎn)生差距的原因還在模型深處,無人能探知。這條邏輯和woSyn版本那件事接得上:一年前字節(jié)在純技術場合做的那個選擇,就是讓研究者能用一個干凈的基座做對照。


但要說明的是,這個理由目前沒有被學界驗證。它是一個合理的工程直覺,不是一條被證明的定律。


第二個方向,TikTok。


開放權重禁令削弱了它的解釋力,梁汝波也直接否認了。但TikTok仍然是字節(jié)和其他巨頭之間唯一的結構性差異。阿里的資本開支不比字節(jié)少,百度和騰訊同樣是巨頭,算力和人才投入不弱于字節(jié),但它們沒有TikTok。


TikTok不是充分解釋,但這個差異無法被任何技術論證消除。它也許不是張一鳴拍板時腦子里的第一個念頭,但它是字節(jié)決策環(huán)境里無法抹除的底色。


第三個方向,這是張一鳴個人的技術判斷。


據(jù)多家媒體報道,張一鳴2021年卸任CEO后逐步淡出日常管理,但過去兩年在AI領域投入極深。外媒報道他一直在旁聽Seed團隊的核心技術評審,熬夜讀OpenAI的論文。新加坡國立大學原教授、字節(jié)研究員馮佳時曾在采訪中說,他從2023年起就經(jīng)常給張一鳴“補課”,字節(jié)甚至在新加坡專門設了研究團隊,幫助張一鳴理解前沿技術、討論研究規(guī)劃。


三個方向都擺在桌上,我押第三個。


不是因為它證據(jù)最充分。正相反,旁聽、熬夜讀論文和新加坡的補課,都是背景音,不是硬證據(jù)。但只有它能解釋禁令里最反常的那一條:連K3這樣的國內(nèi)開源模型都不許蒸。規(guī)避TikTok風險解釋不了這一條,工程潔癖只能解釋一半,剩下的部分,只能是一個人自己的判斷。


一個在移動互聯(lián)網(wǎng)時代建立了全球最大內(nèi)容分發(fā)平臺的創(chuàng)始人,花三年時間密集地給自己做AI知識重建。不蒸餾,可以看作他補完課回到前臺后的第一個重大技術判斷。


無論最終對不對,這種獨立性本身是稀缺的。當然,賭注押在個人判斷上,代價也要由字節(jié)接下來幾年的模型排名來付。


張一鳴的故事講到這里,行業(yè)的還沒講完。


六


蒸餾爭論最熱的這幾個月,恰恰是中國AI公司在底層技術上集中爆發(fā)的幾個月。


就在張一鳴宣布不蒸餾的同一個8月,智譜發(fā)布了GLM-5.3。沒有更換基座,沒有增加參數(shù),能力提升全部來自后訓練:大規(guī)模強化學習、更復雜的任務環(huán)境、更長的訓練鏈路。配合這組能力提升的,是幾組公開的方法論工作,長上下文架構IndexShare、面向長程任務的RL算法SAO、異步訓練框架Slime,都有論文和可復現(xiàn)的代碼。GLM-5.3的官方博客寫了一句意味深長的話:這個基座的智能上界,可能遠沒被開發(fā)完。


在后訓練這條路上,一個沒有堆參數(shù)、沒有蒸餾別人的模型,照樣把能力往上推了一截。


DeepSeek走的是更純粹的路線。從R1開始,它用強化學習里的自我對弈和試錯演化推理能力,不依賴外部模型的輸出。OpenAI首席研究官Mark Chen曾公開承認,DeepSeek獨立發(fā)現(xiàn)了他們在通往o1的路上發(fā)現(xiàn)的一些核心理念。這不是模仿,是殊途同歸。而《自然》審稿交流里那句“沒有有意使用”,反過來也說明DeepSeek有底氣把自己的訓練鏈路打開給別人看。


千問用另一種方式證明了自己。它同時扮演著整個開源生態(tài)里最重要的教師角色,全世界大量蒸餾出來的小模型,底座就是千問。一個被指控為學生的實驗室,同時是半個行業(yè)的老師。這個位置本身就說明,千問的基礎能力不是靠蒸餾別人堆出來的。


把蒸餾等同于中國AI公司的全部能力來源,是對事實的嚴重誤讀。


蒸餾是這些公司工具箱里的一件工具,不是唯一的那件,甚至不是最重要的那件。后訓練方法論、架構創(chuàng)新、工程優(yōu)化、自研的RL體系,真正讓中國模型進入全球前沿競爭區(qū)間的,是這些東西。從這個角度看,圍繞蒸餾的爭論,更多是對中國AI產(chǎn)業(yè)的一種污名化敘事。蒸餾最多影響了中國大模型公司的前進節(jié)奏,從來沒有定義過它們的技術天花板。


張一鳴選擇不蒸餾,這是他的判斷,值得尊重,但不必推廣成行業(yè)準則。被指控蒸餾過的公司仍在前沿做出獨立創(chuàng)新,這也是事實。


字節(jié)的情況是字節(jié)自己的:2023年Project Seed的舊賬、TikTok帶來的額外審視、一個愿意親自介入技術決策的創(chuàng)始人。如果有人把一家公司的風險偏好包裝成行業(yè)道德,那才是真正的沽名釣譽。做這件事的不是張一鳴,更容易戴上這頂帽子的其實是Anthropic。不過那是另一個故事了。


據(jù)晚點LatePost報道,字節(jié)內(nèi)部正在討論訓練一款總參數(shù)超5萬億的語言模型,由Seed Foundation負責人項亮牽頭?!督鹑跁r報》的說法更激進:最高10萬億參數(shù),且已處在預訓練早期。不管哪個數(shù)字更接近事實,它能不能走到發(fā)布,還沒有結論。


蒸餾這個詞在過去兩年里被拽進了太多不屬于它的戰(zhàn)場。它是一個訓練技術,不是一道立場測試題。斯坦福用它的時候叫創(chuàng)新,中國公司用它的時候叫攻擊,張一鳴拒絕它的時候又變成了高瞻遠矚或者遮羞布。


相反,這說明了,即使大家都在沖擊AGI,但中國不同特點、不同稟賦的公司的路徑可以完全不同。這種多樣性恰恰是中國AI生態(tài)需要的。只不過,張一鳴選了其中最貴的一條,也是最難走的一條。單從路徑多樣性的角度,其實應該給他加分。


預設中的那款超大模型,如果在不蒸餾這個前提下做出來了,張一鳴和字節(jié)在整個全球AI領域的聲量和說話的分量將從此不同,甚至會改變中國AI的發(fā)展史。但如果他們輸了,并且以如此昂貴的方式輸了,這個行業(yè)會記住他輸?shù)姆绞胶痛鷥r。


本文來自微信公眾號:胡說成理,作者:胡喆

AI行業(yè)信號頻道: 前沿科技
本內(nèi)容由作者授權發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
常德市| 禹城市| 德钦县| 清涧县| 西青区| 宿州市| 瑞丽市| 大英县| 曲松县| 武鸣县| 金寨县| 斗六市| 峨眉山市| 灵璧县| 微山县| 建德市| 钟山县| 大洼县| 扬州市| 自治县| 图木舒克市| 天镇县| 霍邱县| 松江区| 五莲县| 长武县| 尼木县| 崇左市| 彝良县| 开江县| 手机| 晋城| 屯门区| 莲花县| 井陉县| 津南区| 凤凰县| 苍南县| 洱源县| 双峰县| 会东县|