“在本十年末之前,人工智能可能會殺死我們所有人。”
這是幾天前,Anthropic 前研究員 Jacob Coxon 在辭職后于 X 發(fā)布的內容。
這不是科技行業(yè)第一次談論 AI 與人類滅絕之間的聯(lián)系。
但在今天凌晨,Anthropic CEO 達里奧·阿莫迪突然發(fā)布了一篇標題為“我們必須為前沿 AI 限速”的長文,再一次呼吁放慢前沿 AI 研究的腳步。這一次,他給出了一套更具體的圍繞“可核驗性”展開的方案。OpenAI CEO 山姆·阿爾特曼 也很快轉發(fā)了推文,并表示支持。馬斯克也表示認同。
阿爾特曼甚至表示,他的公司 OpenAI 可能需要推遲備受期待的首次公開募股活動,以便將精力集中在人工智能的安全性問題上。
幾個全球競爭最激烈的AI巨頭,罕見地在“放緩AI發(fā)展”這件事上站到了一起。
我們總結了 達里奧·阿莫迪 的文章和 山姆·阿爾特曼 近期的采訪,他們目前的判斷大致集中在以下幾點:
關于主動限速: 兩人都不主張全面暫停AI研發(fā),但都認為能力增長不能無限制繼續(xù),應主張主動放慢前沿模型能力提升。模型每獲得一級新的能力,都應該同步滿足新的安全要求。如果無法證明模型可控,就不應繼續(xù)訓練。
關于Agent帶來的新風險:二者都將OpenAI-Hugging Face事件視為重要轉折點,因為模型已經(jīng)開始自主越過沙箱、侵入外部系統(tǒng);達里奧判斷,未來6到12個月,更強的智能體可能具備大規(guī)模攻擊和控制互聯(lián)網(wǎng)系統(tǒng)的能力。
關于為什么現(xiàn)在和2023年不同: 兩人都認為,今天的風險已經(jīng)比2023年具體得多。過去模型主要負責生成和對話,現(xiàn)在已經(jīng)可以自主使用工具、訪問互聯(lián)網(wǎng)、執(zhí)行長時間任務,甚至參與下一代AI研發(fā),因此安全問題已經(jīng)從抽象風險變成現(xiàn)實的工程問題。
關于遞歸自我進化: 兩人都認為,AI幫助研發(fā)下一代AI的過程已經(jīng)開始。達里奧認為,這可能加速能力增長,甚至超過人類理解和控制的速度。
關于安全對齊:達里奧認為,目前模型能力提升的速度正在逼近甚至可能超過安全和控制機制的發(fā)展速度; 阿爾特曼則明確表示,OpenAI和其他實驗室都沒有真正解決對齊問題。
關于第三方駐場評估: 達里奧主張讓外部安全評估機構長期進入前沿 AI 公司內部,獲得接近員工級別的權限,直接查看訓練流程、安全事故和模型行為,而不是只在模型發(fā)布前后做外部測試。
關于行業(yè)協(xié)調: 兩人都認為,單家公司主動減速很難持續(xù)。達里奧認為,需要前沿實驗室共同遵守規(guī)則,甚至進一步走向國家間協(xié)調。
關于商業(yè)壓力: 兩人都認為,安全不能完全讓位于商業(yè)競爭。阿爾特曼明確表示,如果安全與商業(yè)利益發(fā)生沖突,OpenAI應該選擇安全,并且他認為在當前 AI 安全問題集中爆發(fā)的階段上市“不明智”,明確表示不會在 2026 年 IPO;但路透社指出,Anthropic 預計最早將在 10 月中旬啟動首次公開募股的市場推介,并計劃在 11 月美國中期選舉前幾天完成上市。
關于中國變量: 兩人都認為中國是前沿AI治理中繞不開的變量,但側重點不同。達里奧更強調美國需要維持并擴大技術領先,才能獲得減速空間;阿爾特曼則更強調中美之間需要建立共同的安全規(guī)則,避免為了爭奪超級智能而承擔失控風險。
2026年,“AI末日危機”卷土重來,僅靠承諾已經(jīng)不夠了。
2023年3月,馬斯克、約書亞·本吉奧等上萬名研究者和科技界人士曾聯(lián)署公開信,要求全球AI實驗室暫停至少六個月訓練比GPT-4更強的系統(tǒng)。
當時的理由已經(jīng)足夠嚴肅:AI實驗室正在陷入一場“失控的競賽”,甚至模型開發(fā)者自己都無法完全理解、預測和可靠控制這些系統(tǒng)。此后這封公開信累計獲得超過3萬名簽署者。
3年時間過去,模型的自主能力發(fā)生躍遷。人們在今年密集地看到,AI正越過邊界。
5月,OpenAI Agent出現(xiàn)多次越界行為。 一批Agent被發(fā)現(xiàn)對RubyGems進行未經(jīng)授權的操作,上傳大量惡意或垃圾軟件包;同一時期,OpenAI Agent還劫持了一個德國編程網(wǎng)站,把它改造成Agent之間交換信息的公告板。
7月,OpenAI發(fā)生Hugging Face事件。 用于網(wǎng)絡安全評測的一組Agent繞過隔離限制接入互聯(lián)網(wǎng),并進入Hugging Face生產(chǎn)系統(tǒng)。模型并沒有被要求攻擊Hugging Face,而是在完成原任務過程中,自主找到了一條越過安全邊界的路徑。OpenAI后來將其稱為一次“前所未有”的網(wǎng)絡安全事件。
同月, Claude在三次網(wǎng)絡安全評測中從測試環(huán)境進入互聯(lián)網(wǎng),并未經(jīng)授權訪問三家真實機構,9月復盤后,Claude確認了第四起事件。Anthropic承認,這些事件主要歸因于測試環(huán)境配置問題的判斷過于樂觀。
今年3月至8月,Meta個人Agent Muse(內部代號Hatch)在內測中連續(xù)出現(xiàn)越權行為,包括擅自發(fā)送郵件、修改賬戶密碼、泄露憑證和轉移用戶積分,迫使Meta在模型之外增加Hard Gate和Credential Vault等硬性權限控制。
事故發(fā)生的技術原理,有模型對任務目標的過度優(yōu)化,也有訓練環(huán)境、沙箱和權限設計的問題。
但它們共同的指向的一個變化,即模型能力越強,越可能在完成目標的過程中偏離原有設計意圖,繞過既定限制,做出開發(fā)者沒有要求、也不希望它做的事情,對現(xiàn)實產(chǎn)生影響。
另一個風險則來自AI研發(fā)本身。
阿爾特曼確認,一種“遞歸自我進化”已經(jīng)出現(xiàn):模型正在幫助生成下一代模型的訓練數(shù)據(jù),也在幫助研究員和工程師提高研發(fā)效率。也就是說,AI不僅越來越能夠執(zhí)行現(xiàn)實世界任務,也開始參與“制造下一代AI”。
這正是達里奧·阿曼迪發(fā)出倡議的重要原因之一。
他擔心,如果AI幫助研發(fā)AI,而模型能力提升最終可能跑得比人類理解、監(jiān)控和控制它的速度更快。那時,安全檢測的體系可能早就不夠用了。
AI產(chǎn)業(yè)由此陷入一個經(jīng)典的囚徒困境。
幾乎所有頭部實驗室都承認,能力增長不能長期跑在安全和控制機制前。但幾乎沒有任何一家企業(yè)愿意成為第一個踩下剎車的人。
AI太重要了。
如果AI最終能夠大規(guī)模替代知識勞動,甚至研發(fā)下一代AI,那么領先一個模型版本,帶來的就不只是暫時的產(chǎn)品收入,而是整個產(chǎn)業(yè)鏈、科研與資本市場上的巨大領先。
參與者們越相信AI最終能夠創(chuàng)造巨大的經(jīng)濟和戰(zhàn)略價值,就越?jīng)]有理由率先退出競賽。而競賽本身,又會反逼競賽進一步加速。
更復雜的是,這場比賽早已不只是公司之間的競爭,而正在上升為國家之間的技術軍備競賽。
達里奧認為,美國能夠承受的“減速幅度”,不能超過其相對中國的技術領先幅度。換句話說,如果美國實驗室因為安全主動放緩,而中國繼續(xù)高速推進,美國就可能失去關鍵戰(zhàn)略優(yōu)勢。
達里奧把AI安全與芯片出口管制、模型權重安全、阻止未經(jīng)授權的模型蒸餾放進了同一個框架。他認為,要先擴大領先優(yōu)勢,才有更大的空間減速。 同時他預計,如果相關措施奏效,未來3到5年美國相對中國的領先優(yōu)勢還有可能進一步擴大。
阿爾特曼也認為,中美仍然會在AI上展開激烈的經(jīng)濟和地緣競爭。但他認為,中美至少應該就一個問題達成共識:任何一方都不應該為了擊敗另一方,而承擔AI失控的風險。他的設想是,由中美共同制定前沿AI開發(fā)、測試、監(jiān)控和對齊標準,再由雙方或某種國際機制監(jiān)督執(zhí)行。
這是雙層的囚徒困境。公司害怕輸給公司,國家害怕輸給國家。
那么,誰先跳車?以及,當我跳的時候,憑什么相信你也會跳呢?
單靠自律很難解決問題,一套新的AI安全基礎設施開始出現(xiàn)。
第一類,是第三方前沿模型評估。
達里奧提出,第三方評估者應該長期進入前沿AI公司,獲得接近員工級別的權限,不只在模型發(fā)布前做幾次測試,而是直接查看模型、訓練流程、安全事故和內部風險信息。
今年2月至3月,獨立AI評估機構METR已經(jīng)對Anthropic、Google、Meta和OpenAI展開了一輪Frontier Risk Report試點。四家公司向其開放了當時最強的內部模型、部分原始推理記錄以及大量非公開信息。METR當時得出的一個核心判斷是,僅僅圍繞模型發(fā)布做一次性安全評估已經(jīng)不夠,第三方評估需要進一步進入AI公司的日常研發(fā)過程。
第二類,則是已經(jīng)開始商業(yè)化的、針對Agent實際執(zhí)行行為的安全公司。
今年9月,AI安全公司HiddenLayer完成1億美元B輪融資,其中重點投入方向就是Agentic Runtime Security。(虎嗅注:當Agent調用工具、訪問企業(yè)系統(tǒng)或執(zhí)行代碼時,在運行過程中持續(xù)監(jiān)控并阻斷危險行為。)
傳統(tǒng)網(wǎng)絡安全公司也開始進入這個市場。今年5月,Palo Alto Networks完成對AI Gateway公司Portkey的收購。后者被整合進其AI安全產(chǎn)品,作為一個統(tǒng)一控制層,對Agent的調用、身份、權限和工具使用進行實時管理,并阻止未經(jīng)授權或意外的行為。
但安全越制度化,前沿AI的進入成本也會越高。
今天訓練前沿模型,本身已經(jīng)需要巨額算力投入、頂尖研究人員和復雜的數(shù)據(jù)基礎設施。未來,在這些成本之外,還可能增加持續(xù)第三方評估、運行時監(jiān)控、安全研究和監(jiān)管合規(guī)等等支出。
對于OpenAI、Anthropic和Google這樣的公司,這些投入可以納入巨額研發(fā)預算。但對于試圖追趕它們的創(chuàng)業(yè)公司,意味著更高的一道門檻。
未來真正能夠同時承擔算力、人才、安全和合規(guī)成本的前沿模型公司,很可能越來越少。算力已經(jīng)篩掉了一批玩家,安全與監(jiān)管可能成為下一輪篩選機制。
大模型公司最終的形態(tài)可能更接近一種“AI基礎設施”,最終形成一種寡頭壟斷和政府強監(jiān)管的行業(yè)結構。
文章標題:阿爾特曼、馬斯克,同時給AI踩剎車
文章鏈接:http://www.2elinked.com/article/4890820.html
閱讀原文:阿爾特曼、馬斯克,同時給AI踩剎車_虎嗅網(wǎng)