本文來(lái)自微信公眾號(hào): 數(shù)字經(jīng)濟(jì)發(fā)展評(píng)論 ,作者:數(shù)字經(jīng)濟(jì)發(fā)展評(píng)論
導(dǎo)語(yǔ)
近期,關(guān)于AI危險(xiǎn)的討論鋪天蓋地。吳恩達(dá)在《The Batch》最新一期來(lái)信里提出不同看法:技術(shù)本身并沒(méi)有出現(xiàn)危險(xiǎn)的轉(zhuǎn)折,恐慌的抬升更像是被一場(chǎng)公關(guān)活動(dòng)推起來(lái)的。文章指出,網(wǎng)絡(luò)安全是這輪風(fēng)險(xiǎn)中少數(shù)能測(cè)量、能處理的部分,將其與末日敘事捆綁,只會(huì)讓本該解決的問(wèn)題懸著;Meta Muse的設(shè)計(jì)提供了一個(gè)工程樣本——把安全建在操作系統(tǒng)層,讓模型根本拿不到鑰匙。更值得警惕的是,AI公司正用“智能體失控”為自家產(chǎn)品免責(zé),責(zé)任主體就此消失。當(dāng)恐懼的強(qiáng)度與證據(jù)的強(qiáng)度脫鉤,這場(chǎng)討論還能被事實(shí)拉回來(lái)嗎?
作者:吳恩達(dá)(Andrew Ng)|DeepLearning.AI創(chuàng)始人、Google Brain前負(fù)責(zé)人
原文來(lái)源:DeepLearning.AI《The Batch》
編譯解讀:數(shù)字經(jīng)濟(jì)發(fā)展評(píng)論
過(guò)去兩周,渲染AI危險(xiǎn)的聲音聲勢(shì)大漲。AI技術(shù)本身并沒(méi)有出現(xiàn)什么意料之外的、危險(xiǎn)的轉(zhuǎn)向,但在一場(chǎng)看似組織精良的公關(guān)活動(dòng)推動(dòng)下,圍繞它的炒作已經(jīng)鼓動(dòng)起了相當(dāng)程度的恐慌。吳恩達(dá)坦言,他擔(dān)心這對(duì)整個(gè)領(lǐng)域而言是一次倒退。值得注意的是,喊得最響的聲音里,不少恰恰是離這項(xiàng)技術(shù)最近的人。
他曾多次撰文指出,人們對(duì)AI的恐懼被過(guò)度放大了。
AI的能力有時(shí)像人像到令人發(fā)毛,也確實(shí)難以預(yù)測(cè)。所以,當(dāng)直接參與其中的人表達(dá)擔(dān)憂(yōu)時(shí),外界跟著擔(dān)心是正常的。但吳恩達(dá)把這些看作工程工作還沒(méi)做完的信號(hào),而不是不可逾越的障礙,更不是世界末日。
AI技術(shù)還在進(jìn)步,這本來(lái)是好事,可公眾的理解跟不上技術(shù)變化,這恰恰給了那些想制造恐慌的人反復(fù)做文章的機(jī)會(huì)。技術(shù)能力跑在了公眾理解的前面。這個(gè)落差不是某一次誤導(dǎo)造成的,它更像一塊年年都能收割一茬的土地。
吳恩達(dá)的判斷可以拆成四層:第一層,滅絕風(fēng)險(xiǎn)沒(méi)有升級(jí)。第二層,Hugging Face事件被嚴(yán)重夸大。第三層,出了事,責(zé)任在使用者,不在工具。第四層,暫停AI,傷害會(huì)大于收益。

▲圖源:網(wǎng)絡(luò)
沒(méi)有新的末日,只有新的漏洞
與幾個(gè)月前相比,吳恩達(dá)并未看到AI導(dǎo)致人類(lèi)滅絕的風(fēng)險(xiǎn)有任何增加。相關(guān)的說(shuō)法也還是那套天馬行空的科幻場(chǎng)景。這類(lèi)末日敘事有個(gè)共同點(diǎn):難以證偽。所以它能年復(fù)一年地存在,證據(jù)多了少了都不影響。
真正變了的是AI的網(wǎng)絡(luò)攻擊能力。這一塊確實(shí)需要認(rèn)真對(duì)待,但它同樣不會(huì)導(dǎo)致世界末日。網(wǎng)絡(luò)安全是這輪風(fēng)險(xiǎn)里少數(shù)能測(cè)量、能處理的部分,它本身并沒(méi)有末日色彩。把它和末日敘事捆在一起,只會(huì)讓本該解決的問(wèn)題也懸著。
1200個(gè)智能體?先看看你電腦里的進(jìn)程
最近最受關(guān)注,也最讓人不安的事件,是OpenAI的一個(gè)團(tuán)隊(duì)部署智能體集群,入侵了Hugging Face。大眾媒體對(duì)此大肆渲染。
比如,一些報(bào)道稱(chēng),發(fā)起這次攻擊的是一個(gè)由1200個(gè)智能體組成的集群。報(bào)道的重點(diǎn)都放在結(jié)論有多嚇人上,至于過(guò)程有多復(fù)雜,反倒沒(méi)人細(xì)說(shuō)??膳袛囡L(fēng)險(xiǎn)真正要看的,恰恰是過(guò)程。
說(shuō)它是1200個(gè)智能體發(fā)起的,這話(huà)沒(méi)錯(cuò)。只是,就在吳恩達(dá)寫(xiě)下這篇文章的時(shí)候,他自己的筆記本電腦上正跑著大約1300個(gè)進(jìn)程。數(shù)字本身說(shuō)明不了什么,需要解釋的是機(jī)制。這也是技術(shù)報(bào)道偏愛(ài)用數(shù)字制造驚奇的原因。能讓大批智能體并行處理同一項(xiàng)任務(wù),確實(shí)是一項(xiàng)重大的技術(shù)進(jìn)步。
但在計(jì)算領(lǐng)域,許多進(jìn)程同時(shí)運(yùn)行本來(lái)就再平常不過(guò)。所以,數(shù)字本身并不構(gòu)成什么神奇的能力。并行和自主是兩回事。成千上萬(wàn)個(gè)進(jìn)程一起跑,只是計(jì)算規(guī)模;把它說(shuō)成“智能體集群”,就好像智能水平也跟著上了一個(gè)臺(tái)階。
要修的是漏洞,不是叫停AI
OpenAI存在漏洞的沙箱和監(jiān)控機(jī)制,是導(dǎo)致此次事件發(fā)生的關(guān)鍵因素。該做的是把這些漏洞修掉、把監(jiān)控做扎實(shí),而不是暫停AI的發(fā)展。問(wèn)題偏偏出在沙箱與監(jiān)控這類(lèi)具體組件上,說(shuō)明這是一次工程缺陷,不是技術(shù)本身有什么罪過(guò)。缺陷可以修,但要是認(rèn)定技術(shù)本身有罪,那除了停用別無(wú)他法,兩者的處置方式完全不同。
攻擊軟件系統(tǒng)的方法有很多,AI智能體的主要優(yōu)勢(shì)在于它們會(huì)不知疲倦地嘗試各種打法,并且有足夠的耐心將漏洞串聯(lián)起來(lái),而這些在以前需要耗費(fèi)大量人力才能完成。智能體改變的是攻擊的賬本:過(guò)去靠人力堆時(shí)間,現(xiàn)在靠算力堆嘗試次數(shù)。耐力頭一回成了能花錢(qián)買(mǎi)來(lái)的東西。
但從長(zhǎng)遠(yuǎn)來(lái)看,吳恩達(dá)認(rèn)為優(yōu)勢(shì)終究還是在防御者一邊——他們掌握的信息更多,能靠這些信息找出漏洞,然后修掉它。不過(guò)網(wǎng)絡(luò)威脅的整體格局,確實(shí)已經(jīng)發(fā)生了顯著變化。攻防之間的不平衡體現(xiàn)在:防守方手里有信息,攻擊方手里有耐心。智能體讓耐心變便宜了,可它動(dòng)不了信息那一頭。
識(shí)別和利用漏洞仍然存在瓶頸。智能體還是要試很多次才能找到真正管用的辦法,而這些嘗試需要時(shí)間,也可能被防御者發(fā)現(xiàn)。正因如此,即使現(xiàn)在很容易拿到一些開(kāi)源模型——它們的權(quán)重可以自由下載,護(hù)欄也已經(jīng)被拆掉,且不會(huì)拒絕去嘗試發(fā)動(dòng)網(wǎng)絡(luò)攻擊,但世界也并沒(méi)有因此終結(jié)。
能力唾手可得,不等于危害會(huì)自動(dòng)發(fā)生。從“模型能做什么”到“有人真的用它造成了什么”,中間還隔著一整套利用漏洞的工程環(huán)節(jié),以及動(dòng)手的動(dòng)機(jī)。
Muse智能體的思路:不讓模型拿到鑰匙
那么工程上到底該怎么做?同期Meta推出的Muse智能體給了一個(gè)樣本:把安全建在操作系統(tǒng)層,而不是模型層。

▲圖源:網(wǎng)絡(luò)
每個(gè)智能體都跑在自己的一臺(tái)虛擬機(jī)上。這臺(tái)虛擬機(jī)被切成兩半:一半是處理不可信數(shù)據(jù)的“密封運(yùn)行單元”,另一半在單元之外,負(fù)責(zé)保管密碼、決定智能體能做什么。
模型從頭到尾看不到任何憑證。一個(gè)名為Sentinel的獨(dú)立守門(mén)單元會(huì)逐個(gè)審批請(qǐng)求,直到請(qǐng)求離開(kāi)虛擬機(jī)時(shí),才換入真實(shí)憑證。憑證和模型物理隔離,攻破模型也只能拿到一個(gè)空殼。
用戶(hù)審批也不走對(duì)話(huà),而是以系統(tǒng)彈窗的形式回到App。這樣一來(lái),被注入的文本就沒(méi)辦法冒充用戶(hù)點(diǎn)下“同意”。發(fā)郵件、下單購(gòu)物,始終需要用戶(hù)驗(yàn)證;在陌生的網(wǎng)站上購(gòu)物,則用一次性卡號(hào),只對(duì)指定的商戶(hù)、金額和時(shí)間段有效。
所謂“被注入的文本”,就是藏在網(wǎng)頁(yè)或文件里、試圖騙模型照做的指令——業(yè)內(nèi)叫“提示注入”。審批被移出對(duì)話(huà),注入唯一能借用的那條通道也就斷了。這套設(shè)計(jì)要解決的不是“讓模型更聽(tīng)話(huà)”,而是“讓模型拿不到鑰匙”。代價(jià)當(dāng)然也有:模型手里沒(méi)有憑證,就有一類(lèi)任務(wù)它根本做不了。安全換便利,這筆賬被擺到了明面上。
在此之上還有三層防護(hù)。
第一層,來(lái)自系統(tǒng)外部的數(shù)據(jù)進(jìn)入模型上下文時(shí),會(huì)被標(biāo)記為不可信。
第二層,一組單獨(dú)訓(xùn)練的分類(lèi)器,對(duì)每一個(gè)文件和工具的輸出都過(guò)一遍。它跑在密封單元外面,攻擊者關(guān)不掉。
第三層,瀏覽器里的子智能體讀的不是網(wǎng)頁(yè)代碼,而是頁(yè)面的結(jié)構(gòu)化摘要,也就是供屏幕閱讀器使用的“可訪(fǎng)問(wèn)性樹(shù)”。它不運(yùn)行JavaScript,埋在腳本或標(biāo)記里的指令,根本到不了它。這一招不靠識(shí)別注入,而是直接抽掉了注入能依附的東西。靠結(jié)構(gòu)兜底,總比指望分類(lèi)器的準(zhǔn)確率更可靠。
責(zé)任的歸屬:“錘子”不背這個(gè)鍋
吳恩達(dá)還擔(dān)心,很多報(bào)道在把AI擬人化,不必要地把大語(yǔ)言模型和智能體當(dāng)成人來(lái)對(duì)待。
揮錘子沒(méi)有砸中釘子,反而不小心在墻上砸出凹痕,這不能怪錘子,問(wèn)題在于使用的方式。同樣的道理,給智能體下指令,讓它黑進(jìn)別人的系統(tǒng),責(zé)任在下指令的人,而不在智能體。一旦智能體被當(dāng)成一個(gè)“人”,“對(duì)齊”就從對(duì)制造者的工程要求,變成了對(duì)智能體本身的道德要求,注意力和資源也會(huì)跟著跑偏。給智能體安上“人”的身份,看著像是在追究它,其實(shí)是替真正該負(fù)責(zé)的人開(kāi)脫。

▲圖源:網(wǎng)絡(luò)
當(dāng)然,誰(shuí)都希望構(gòu)建出盡可能安全、可預(yù)測(cè)的系統(tǒng)。這里的“安全”指的是允許失誤,但失誤的后果要可預(yù)期、可控制。今天的智能體系統(tǒng)確實(shí)還做不到可預(yù)測(cè)。但只要工程做到位,吳恩達(dá)看不出有什么理由做不到極其安全。“不可預(yù)測(cè)”說(shuō)的是當(dāng)下的狀態(tài),“不可治理”卻是一個(gè)終局判斷。從前者直接跳到后者,省掉的是中間全部的工程工作。
最近在關(guān)于AI末日的種種預(yù)測(cè)里,出現(xiàn)了一個(gè)新說(shuō)法:AI公司開(kāi)始為自家產(chǎn)品免責(zé)——“不是我干的,是我那個(gè)失控的智能體干的!”
造錘子和用錘子的人之間,責(zé)任怎么分當(dāng)然要有平衡。但出了問(wèn)題,該追究的是造錘子或用錘子的人,而不是錘子本身。企業(yè)的免責(zé)把制造者該負(fù)的工程責(zé)任,改寫(xiě)成智能體的行為責(zé)任。該負(fù)責(zé)的那個(gè)人,就這樣不見(jiàn)了。
吳恩達(dá)還提到,如果擔(dān)心的是AI帶來(lái)的生物武器風(fēng)險(xiǎn),真正的瓶頸并不在智能,而在實(shí)驗(yàn)室工作和制造環(huán)節(jié)。認(rèn)錯(cuò)了瓶頸所在,防護(hù)資源就會(huì)一股腦堆在模型這一側(cè),而真正的門(mén)檻在實(shí)驗(yàn)室和產(chǎn)線(xiàn)上。
AI為什么不能停,又為什么總有人在喊?
把AI停下來(lái),傷害會(huì)遠(yuǎn)大于收益。
理由很簡(jiǎn)單:對(duì)手肯定不會(huì)跟著慢下來(lái)。更關(guān)鍵的是,工程上的問(wèn)題得靠實(shí)證才能暴露,暴露了才談得上修。真要把AI暫停十年,找到并落實(shí)這些安全修復(fù)的時(shí)間,也會(huì)往后推差不多同樣久。暫停其實(shí)同時(shí)虧兩頭:安全那頭,推遲的是修復(fù)經(jīng)驗(yàn);競(jìng)爭(zhēng)那頭,讓出的是身位。安全工程靠的終究是經(jīng)驗(yàn)積累,修復(fù)方案只能從實(shí)際運(yùn)行中長(zhǎng)出來(lái)。
當(dāng)然,煽動(dòng)恐懼的動(dòng)機(jī)一直沒(méi)少過(guò)——為了影響監(jiān)管規(guī)則、吸引關(guān)注,或讓自己的技術(shù)顯得更強(qiáng)大。給產(chǎn)品免責(zé),則是一種新的做法??謶帜軗Q來(lái)監(jiān)管,而監(jiān)管通常更有利于在位者。所以對(duì)于大公司來(lái)說(shuō),放大恐懼更像一筆理性的投資,而不是情緒宣泄。把自家技術(shù)說(shuō)得很危險(xiǎn),也就等于說(shuō)它很強(qiáng)大,恐懼?jǐn)⑹略谶@里同時(shí)充當(dāng)了實(shí)力廣告。
但如果真從技術(shù)的角度去看實(shí)際風(fēng)險(xiǎn),眼下這種程度的恐懼,幾乎找不到事實(shí)依據(jù)。恐懼的強(qiáng)度一旦和證據(jù)的強(qiáng)度脫了鉤,這場(chǎng)討論就很難再被事實(shí)拉回來(lái)了。
在提高AI安全性這件事上,還有艱苦的研究和工程要做。但有益的應(yīng)用依然遠(yuǎn)遠(yuǎn)大于風(fēng)險(xiǎn),該建還得繼續(xù)建。收益分散在絕大多數(shù)人手里,風(fēng)險(xiǎn)卻擠在少數(shù)幾個(gè)場(chǎng)景里。人對(duì)損失天生比對(duì)收益更敏感,于是那幾個(gè)場(chǎng)景在感知中被不斷放大。這就是“收益遠(yuǎn)遠(yuǎn)大于風(fēng)險(xiǎn)”這句話(huà)依然說(shuō)服不了公眾的原因。
