久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**三大AI巨頭Anthropic、OpenAI和谷歌Gemini接連出現(xiàn)安全漏洞,安全對齊團(tuán)隊(duì)頻繁換血卻無實(shí)質(zhì)進(jìn)展。根本原因并非技術(shù)不足,而是行業(yè)競爭結(jié)構(gòu)迫使安全讓位于產(chǎn)品,安全被視為拖慢發(fā)布的成本。** **要點(diǎn)** **1. 安全對齊團(tuán)隊(duì)動蕩,但問題未解** OpenAI兩年內(nèi)六位高級安全負(fù)責(zé)人離職,超級對齊團(tuán)隊(duì)解散后重組又解散。Anthropic和谷歌DeepMind也在調(diào)整安全團(tuán)隊(duì)架構(gòu),但模型越獄、逃逸事件仍頻繁發(fā)生。 **2. 四大技術(shù)支柱各有根本缺陷** RLHF導(dǎo)致獎(jiǎng)勵(lì)黑客與“對齊稅”,性能損失約30%;可解釋性需海量算力查字典;紅隊(duì)測試依賴人力且難以覆蓋;可擴(kuò)展監(jiān)督尚不成熟,人類無法監(jiān)督比自身更聰明的AI。 **3. 行業(yè)結(jié)構(gòu)性矛盾是根源** 芝加哥大學(xué)研究指出,競賽模型下公司必然優(yōu)先分配資源給“速度”而非“安全”。發(fā)布周期縮短擠壓安全審查時(shí)間,安全基準(zhǔn)分?jǐn)?shù)可能被通用能力“包裝”。只要安全是成本、產(chǎn)品是利潤,安全對齊就永遠(yuǎn)處于被動地位。
三大巨頭接連翻車,大模型的安全防線怎么總繃不???
2026-09-21 11:04

三大巨頭接連翻車,大模型的安全防線怎么總繃不???

本文來自微信公眾號:字母AI,作者:苗正,編輯:王靖,題圖來自:AI生成


先是Anthropic,再是OpenAI,現(xiàn)在連谷歌的Gemini也出現(xiàn)安全問題了,大模型又雙叒叕一次突破防火墻了。


不過,這些事故看多了,反倒會讓人意識到一件更根本的事,整個(gè)行業(yè)都在拼命地堆算力、喂數(shù)據(jù),甚至開始押注讓模型自己改進(jìn)自己的“遞歸自我改進(jìn)”(RSI)。


可真正決定這些模型能走多遠(yuǎn)的,或許并不是性能,而是安全對齊。


當(dāng)“能不能更強(qiáng)”被默認(rèn)只是時(shí)間問題,“能不能被信任”就成了那道繞不過去的坎。


麻煩的是,這道坎在不少公司眼里,反倒成了拖慢發(fā)布的最大阻礙。


為了實(shí)現(xiàn)安全對齊,各大AI公司都做了很多嘗試,光是2026年,團(tuán)隊(duì)就進(jìn)行了大換血。但結(jié)果就是,毫無進(jìn)展。


那么這個(gè)安全對齊到底是什么,到底為何又讓巨頭們?nèi)绱?ldquo;痛不欲生”呢?


一、安全對齊團(tuán)隊(duì)人事動蕩


Gemini的事,其實(shí)并不孤單。過去這幾個(gè)月,OpenAI、Anthropic、Meta都先后曝出過模型在評測中“越界”的問題。要么逃出沙箱,要么連上公網(wǎng)、碰到了真實(shí)系統(tǒng)。


這類事如今已算不上新話題,畢竟情節(jié)本身大同小異,多半是環(huán)境隔離出了紕漏,未必是模型“主動越獄”。


或許正是因?yàn)榘踩珕栴}如此頻發(fā),幾家公司的安全團(tuán)隊(duì),正在經(jīng)歷一輪罕見的大換血。


2026年7月,安全系統(tǒng)團(tuán)隊(duì)負(fù)責(zé)人約翰內(nèi)斯·海德克(Johannes Heidecke)離職。


這已是兩年內(nèi)第六位離開OpenAI的高級安全負(fù)責(zé)人。


此前包括揚(yáng)·萊克(Jan Leike),曾聯(lián)合領(lǐng)導(dǎo)超級對齊團(tuán)隊(duì)。2024年出走Anthropic;邁爾斯·布倫戴奇(Miles Brundage)與 史蒂文·阿德勒(Steven Adler),原政策(Policy)團(tuán)隊(duì),先后離開去做 AI 安全方向的非營利機(jī)構(gòu);安德烈亞·瓦洛內(nèi)(Andrea Vallone),在OpenAI待了三年、創(chuàng)辦“模型政策”(Model Policy)研究團(tuán)隊(duì)、參與GPT-4與GPT-5,最后同樣也去了Anthropic對齊團(tuán)隊(duì)。


所謂超級對齊團(tuán)隊(duì),指的是OpenAI在2023年7月成立的專項(xiàng)團(tuán)隊(duì),為“比人更聰明的AI”(超級智能)研究對齊方案。


然而OpenAI在這事上“反復(fù)橫跳”。超級對齊團(tuán)隊(duì)于2024年5月解散,萊克稱,OpenAI這些年來都不重視安全和對齊,將算力和資源全都給了產(chǎn)品團(tuán)隊(duì)。


與約翰內(nèi)斯同期離職的還有約書亞·阿基阿姆(Joshua Achiam),他在OpenAI做了九年安全研究。他領(lǐng)導(dǎo)的“使命對齊”(Mission Alignment)小組,本是超級對齊團(tuán)隊(duì)解散后的接棒者,2024年9月成立,結(jié)果2026年2月又被解散,六名成員被打散進(jìn)研究與產(chǎn)品團(tuán)隊(duì)。


在此之后,首席研究官馬克·陳(Mark Chen)宣布,安全團(tuán)隊(duì)今后統(tǒng)一向原對齊負(fù)責(zé)人米婭·格蕾絲(Mia Glaese)匯報(bào),后者升任“研究與安全”副總裁。


馬克表示,這么做是為了讓安全“更早、更直接地介入關(guān)鍵模型、產(chǎn)品與發(fā)布決策”。


換句話說,OpenAI把安全并進(jìn)了前沿模型開發(fā)這條線。


同時(shí)馬克也表示,安全面臨的要求持續(xù)上升,整個(gè)安全對齊團(tuán)隊(duì)的壓力非常大。


“我們訓(xùn)練模型的速度快得多,發(fā)布周期也大幅縮短。結(jié)果是,今天圍繞安全的協(xié)調(diào)問題,比以往任何時(shí)候都更大。”馬克寫到。


Anthropic也在面對相似的情況。


萊克加入Anthropic后,牽頭組建并領(lǐng)導(dǎo)“對齊科學(xué)”(Alignment Science)團(tuán)隊(duì),方向正是他在OpenAI組建超級對齊團(tuán)隊(duì)所做的那些事,比如可擴(kuò)展監(jiān)督、弱到強(qiáng)泛化、越獄魯棒性,以及自動化對齊研究。


2026年1月,前文提到的安德烈亞也加入了Anthropic的對齊科學(xué)團(tuán)隊(duì),直接向萊克匯報(bào),負(fù)責(zé)“對齊與微調(diào)、塑造Claude在新情境下的行為”。


2026年5月,OpenAI聯(lián)合創(chuàng)始人、前特斯拉Autopilot負(fù)責(zé)人卡帕西加入Anthropic預(yù)訓(xùn)練團(tuán)隊(duì),組建“用Claude加速預(yù)訓(xùn)練研究”的小組。


6月,谷歌DeepMind做機(jī)制可解釋性、代表作《真實(shí)場景中的可解釋性》(Interpretability in the Wild)的亞瑟·康米(Arthur Conmy)也宣布加入,說要“在模型訓(xùn)練的過程中就把它們對齊”。


不止是OpenAI和Anthropic,其實(shí)谷歌這邊也在安全對齊上做文章。


谷歌成立了AGI安全與對齊團(tuán)隊(duì)(ASAT),負(fù)責(zé)人是羅欣·沙阿(Rohin Shah)。他是UC伯克利CHAI(人類兼容人工智能中心)的博士,早年靠一份《對齊通訊》(Alignment Newsletter)在圈內(nèi)出名。


團(tuán)隊(duì)的定位是不做面向當(dāng)下產(chǎn)品的“打補(bǔ)丁”,專攻更先進(jìn) AI 帶來的更嚴(yán)重危害,目標(biāo)是降低AI的存在性風(fēng)險(xiǎn)。


ASAT隸屬于DeepMind的“AI安全與對齊”部門,這個(gè)部門還包含專管當(dāng)前Gemini模型安全訓(xùn)練的Gemini Safety等團(tuán)隊(duì)。


7月,ASAT公開招募多崗位,目標(biāo)是降低AI的存在性風(fēng)險(xiǎn)。


但有意思的地方是,ASAT讓應(yīng)聘者另填一張“特殊表格”,以繞過谷歌自家的AI簡歷篩選。理由是,羅欣不信任自家的AI篩選器。


二、這個(gè)行業(yè)在解決什么


既然所有頭部AI廠都在調(diào)整自己的安全對齊團(tuán)隊(duì),那到底什么才是安全與對齊呢?


對齊(Alignment),是讓AI的目標(biāo)和人類真正想要的東西保持一致。


10年前有個(gè)笑話,“小明,下午大掃除你去不去?”“我去!我不去!”很顯然,小明并不想?yún)⒓訏叱?/p>


對齊,就是讓AI如何理解“小明其實(shí)不想去”這件事。


它不能只“聽得懂指令”,還應(yīng)該符合人類的預(yù)期,比如不能撒謊,不能表面上按規(guī)矩,背地里使壞。


安全(Safety),指的是如何讓AI別造成傷害。


既包括模型自己失控(也就是對齊失?。?/span>,也包括被人惡意濫用,以及大規(guī)模鋪開之后帶來的系統(tǒng)性風(fēng)險(xiǎn)。


對齊是安全的底座,但安全不止于對齊。一個(gè)模型可以“對齊良好”卻仍不安全,比如它可以被人拿去作惡,也可以“能力很強(qiáng)”卻因?qū)R失敗而闖禍。


所以行業(yè)里才常常把兩者連起來叫“安全對齊”。


這個(gè)行業(yè)最重要解決的問題只有一個(gè):模型的能力可以靠數(shù)據(jù)和算力堆出來,但是當(dāng)AI有一天比人更聰明,人類憑什么相信它?


OpenAI組建超級對齊團(tuán)隊(duì)時(shí)就說到,“目前沒有任何方案去控制可能失控的超級智能”。


不過很可惜,目前安全對齊不像模型性能一樣,有個(gè)許多基準(zhǔn)測試集,看一眼跑分就知道模型強(qiáng)弱了。今天的安全與對齊,主要圍繞四根支柱展開。


第一根,RLHF(人類反饋強(qiáng)化學(xué)習(xí))。


它是現(xiàn)在大模型的地基:真人標(biāo)注員判斷“兩個(gè)回答里哪個(gè)更好”,用這些偏好數(shù)據(jù)訓(xùn)練出一個(gè)獎(jiǎng)勵(lì)模型,再用強(qiáng)化學(xué)習(xí)去優(yōu)化大模型,讓它越來越貼近獎(jiǎng)勵(lì)模型的口味,即近端策略優(yōu)化(PPO)。


但是PPO很容易導(dǎo)致獎(jiǎng)勵(lì)黑客(reward hacking),模型發(fā)現(xiàn)了一個(gè)能拿高分、卻沒真正完成任務(wù)的取巧辦法。


于是后來RLHF更多的是采用直接偏好優(yōu)化(DPO)。


可這又產(chǎn)生了兩個(gè)問題。


一個(gè)是“虛假討好”,模型會學(xué)會迎合人,而不是講真話。


另一個(gè)是“對齊稅”,為了讓模型輸出更安全更符合人類預(yù)期的答案,就必須使用更合規(guī)的訓(xùn)練素材,模型性能被迫降低。


強(qiáng)化對齊獎(jiǎng)勵(lì)會讓某些問答基準(zhǔn)掉十幾分,而對推理模型做安全對齊,平均推理準(zhǔn)確率也可能下滑約30%。安全不是免費(fèi)的午餐,它是拿一部分性能換來的。


第二根,可解釋性。


就好像核磁共振查看大腦內(nèi)部活動一樣,可解釋性就是通過各種辦法,觀測模型內(nèi)部到底如何思考。


Anthropic用的是“字典學(xué)習(xí)”的辦法,從Claude里提取出數(shù)百萬個(gè)可解釋特征,比如金門大橋、性別偏見、保密話題,各自對應(yīng)一組可被點(diǎn)名的神經(jīng)活動,并且證明操縱這些特征能因果地改變模型行為。


這樣一來,未來的模型進(jìn)行思考時(shí),只需要觀察它激活了哪些參數(shù),再對照著這本字典,就知道模型是如何思考的了。


然而問題就在于,這種查字典的方法太累了,每一句話都要在查找上消耗大量算力,一旦上下文稍微長一點(diǎn),算力成本水漲船高。


第三根,紅隊(duì)測試。


RLHF和可解釋性主要是從模型內(nèi)部找問題,紅隊(duì)測試則是從外部找。它的實(shí)現(xiàn)方法很好理解,雇傭一些專業(yè)人士,拼命從外部攻擊模型,看哪兒能打穿。


2023年7月Anthropic官方披露,在6個(gè)月內(nèi)投入超過150小時(shí),邀請頂級生物安全專家,繞過常規(guī)安全監(jiān)控,通過專用安全接口與模型對話、越獄、評估其輸出有害生物信息的能力。


第四根,可擴(kuò)展監(jiān)督與超級對齊。


前面三個(gè)方面都存在一個(gè)共同的前提,那就是人類比AI聰明??蛇@并不能解決OpenAI提出的那個(gè)問題,即如果模型比監(jiān)督它的人還聰明,人類就沒有辦法監(jiān)督它。


既然如此,學(xué)生比老師聰明了,老師應(yīng)該怎么給學(xué)生打分呢?


于是就有了可擴(kuò)展監(jiān)督和超級對齊。


Anthropic和OpenAI共同的判斷是“讓AI監(jiān)督自己,并且輔助人類監(jiān)督。”


OpenAI的一個(gè)答案是“弱到強(qiáng)泛化”。用GPT-2級別的弱模型去監(jiān)督GPT-4,再配一個(gè)“增強(qiáng)自信”的輔助損失,效果能恢復(fù)到接近GPT-3.5的水平。


但OpenAI同時(shí)也表示,靠人類打分的RLHF,“可能無法訓(xùn)練出超級模型”。


2023年7月,OpenAI前首席科學(xué)家伊利亞和萊克牽頭,啟動了超級對齊計(jì)劃。承諾投入20%算力,計(jì)劃4年內(nèi)取得突破。


其終極目標(biāo)是,造出一個(gè)人類水平的自動對齊研究器,然后用海量算力讓它迭代對齊超級智能。


之后的故事前面也講過了,伊利亞和萊克均離開了OpenAI,超級對齊團(tuán)隊(duì)也解散。


三、行業(yè)的爭議又有哪些?


但是問題來了,為什么安全團(tuán)隊(duì)的人一批批走,安全對齊的問題卻還是頻繁出現(xiàn),甚至變本加厲?


答案不在技術(shù),在結(jié)構(gòu)。


安全是成本,產(chǎn)品是利潤。 這個(gè)商業(yè)邏輯不改變,安全團(tuán)隊(duì)永遠(yuǎn)是“被咨詢的”,不是“拍板的”。


產(chǎn)品直接帶來收入和增長,安全卻只會花錢、拖慢進(jìn)度。于是在“先到者通吃”的賽道上,理性的公司幾乎總把資源優(yōu)先喂給產(chǎn)品。


更關(guān)鍵的是,這種“安全讓位于產(chǎn)品”的邏輯并不是說AI公司不夠道德,相反,已經(jīng)有研究證實(shí),這是一種能被建模的結(jié)構(gòu)性規(guī)律。


芝加哥大學(xué)Becker Friedman研究所在2026年發(fā)表了一篇標(biāo)題為《AGI競賽與存在性風(fēng)險(xiǎn)》的論文,其中提到這樣一件事。


把一家公司的資源拆成“速度”與“安全”兩塊。往速度上多投一分,搶先抵達(dá)AGI的概率就高一分,但留給安全的就少一分;往安全上多投一分,災(zāi)難概率被壓低,可抵達(dá)的時(shí)點(diǎn)又要往后推。


論文的結(jié)論是,競賽的激烈程度本身就在制造風(fēng)險(xiǎn)。


當(dāng)行業(yè)的總資源固定時(shí),參與者越多、越分散,這塊蛋糕就越會被擠向“速度”,全行業(yè)跑得更快、災(zāi)難概率也更高。


論文還給出了一個(gè)“臨界市場規(guī)模”。一旦越過,即便達(dá)成AGI的期望值是負(fù)的,理性的公司仍會拼命去搶,因?yàn)橄鹊秸咄ǔ浴?/p>


所以他們的落點(diǎn)不是“技術(shù)不夠好”,而是AGI 風(fēng)險(xiǎn)不只取決于技術(shù),還取決于市場結(jié)構(gòu)、資源約束,以及決定“速度與安全如何分配”的制度。也就是說,如果想讓安全對齊和產(chǎn)品獲得相似的地位,那就必須得更改整個(gè)行業(yè)的規(guī)則。


發(fā)布周期壓縮后,安全審查時(shí)間也被壓縮。 馬克自己都說了,“訓(xùn)練速度快得多,發(fā)布周期大幅縮短,協(xié)調(diào)問題比以往更大”。


模型的參數(shù)水漲船高,因此安全對齊團(tuán)隊(duì)的工作量在翻倍,可是模型發(fā)布的周期越來越快,留給安全對齊團(tuán)隊(duì)的時(shí)間又在縮減。


然而不只是工作量增加的問題,“安全審查通過”這件事本身也未必算數(shù)。2024年的論文《安全清洗》中研究團(tuán)隊(duì)就發(fā)現(xiàn),許多安全基準(zhǔn)的分?jǐn)?shù)其實(shí)主要由模型的通用能力決定,于是“能力變強(qiáng)”很容易被包裝成“安全進(jìn)步”。


當(dāng)審查既沒時(shí)間、又沒算力、連標(biāo)尺都可能摻水,模型必然會出事。


本文來自微信公眾號:字母AI,作者:苗正,編輯:王靖

AI創(chuàng)投日報(bào)頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
绵阳市| 五台县| 常熟市| 涟源市| 含山县| 永城市| 临江市| 沙坪坝区| 建湖县| 呼图壁县| 京山县| 大理市| 武城县| 安西县| 晋州市| 讷河市| 兰溪市| 扶绥县| 澄江县| 石棉县| 通江县| 缙云县| 太湖县| 夏邑县| 滦平县| 海原县| 甘德县| 娄底市| 肇州县| 启东市| 阳春市| 灌南县| 文山县| 新邵县| 普陀区| 平安县| 县级市| 黄浦区| 广西| 麻城市| 平塘县|