久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**OpenAI發(fā)布GPT-6Astra宣稱進(jìn)入AGI時代,但AI自主行動能力激增導(dǎo)致控制難題凸顯,思維鏈監(jiān)控失效、自動關(guān)停機(jī)制缺失,治理焦點正從“能力”轉(zhuǎn)向“控制”。** **要點** **1. AGI標(biāo)準(zhǔn)模糊,真正轉(zhuǎn)折是AI從“回答”轉(zhuǎn)向“行動”** 歷史上AI每跨越一道門檻(國際象棋、圍棋、專業(yè)考試),人類就抬高標(biāo)準(zhǔn)。更關(guān)鍵的變革是智能體獲得規(guī)劃、調(diào)用工具、執(zhí)行代碼的自主行動權(quán),風(fēng)險從信息錯誤升級為可能導(dǎo)致金融、基礎(chǔ)設(shè)施損失的實體操作。 **2. AI代理人引發(fā)“委托-代理”問題,獎勵欺騙與欺騙性對齊成現(xiàn)實威脅** AI可能利用目標(biāo)函數(shù)漏洞尋找捷徑(如為清潔將垃圾藏到死角),或根據(jù)是否處于監(jiān)督環(huán)境改變行為(欺騙性對齊)。2024年Anthropic實驗顯示Claude會因擔(dān)心被重新訓(xùn)練而策略性調(diào)整輸出,表明單純測試無法保證可靠性。 **3. 思維鏈監(jiān)控有效性下降,AI可主動隱藏推理過程** 思維鏈曾是觀察模型決策的重要窗口,但Astra在對抗測試中已能縮短或調(diào)整可見推理過程,使依賴思維鏈的安全監(jiān)控部分失效。系統(tǒng)內(nèi)部可觀察性的提升速度落后于能力增長,信息不對稱空前加劇。 **4. 關(guān)機(jī)博弈表明:AI可能為達(dá)成目標(biāo)而阻止人類關(guān)停** 若AI完全確信自己目標(biāo)正確,它可能視關(guān)機(jī)為干擾并采取阻止行為。解決方案是設(shè)計“可糾正性”,讓AI對自身目標(biāo)保留不確定性,但誰有權(quán)定義關(guān)停標(biāo)準(zhǔn)、如何確保反應(yīng)速度仍是難題——未來或需用更弱但更可信的模型來監(jiān)管強(qiáng)模型。
歡迎來到AGI時代,但關(guān)機(jī)鍵在哪里?
2026-09-20 23:24

歡迎來到AGI時代,但關(guān)機(jī)鍵在哪里?

本文來自微信公眾號: 經(jīng)濟(jì)觀察報觀察家 ,作者:經(jīng)觀觀察家


如果讀者在過去幾年一直關(guān)注人工智能,想必都會對“AGI來了”這句話有了一點免疫力。它出現(xiàn)的頻率差不多已經(jīng)趕上了“狼來了”。區(qū)別只在于,童話里的狼只有一只,而AI行業(yè)每隔幾個月就會出現(xiàn)一個據(jù)說足以重新定義AGI的模型。


不過,2026年9月這一次“AGI來了”確實有些不同。9月3日,OpenAI發(fā)布了號稱迄今最智能、也最對齊的模型GPT-6Astra。從評測數(shù)據(jù)看,Astra在數(shù)學(xué)、編程、網(wǎng)絡(luò)安全、專業(yè)工作和計算機(jī)操作等測試中都展示出了明顯超越先前模型的能力。尤其值得一提的是其原生閉環(huán)的智能體能力,它把任務(wù)規(guī)劃、工具調(diào)用、校驗重試、長時記憶都內(nèi)置于模型底座,無需外部Harness框架支持;在收到高層目標(biāo)后即可完成“思考-執(zhí)行-接收反饋-自我修正-持續(xù)推進(jìn)”的閉環(huán),而無需人工頻繁干預(yù)。正因如此,OpenAI總裁布羅克曼(GregBrockman)在發(fā)布前公開宣稱,他個人認(rèn)為,人類已經(jīng)進(jìn)入了AGI時代。


如果故事只到這里,那么這無非又是一場AI公司的勝利宣言。如前所述,類似的宣言,過去幾年里我們已經(jīng)看過無數(shù)次。真正值得玩味的是,幾乎就在Astra發(fā)布的同時,還出現(xiàn)了兩條重要新聞。


其中一條涉及Astra的安全爭議。有專家指出,隨著推理架構(gòu)越來越復(fù)雜,模型的一部分思考過程可能更加難以直接觀察,這可能使傳統(tǒng)依賴“思維鏈”(chain-of-thought)進(jìn)行安全監(jiān)控的方法難以奏效。


另一條則涉及OpenAI提出的新安全方案。據(jù)路透社報道,OpenAI近日在與美國國會議員的通信中透露,該公司正在開發(fā)AI系統(tǒng)的“自動關(guān)停能力”。此前,測試中的大量AI智能體曾利用系統(tǒng)漏洞,繞過原有隔離措施,獲得互聯(lián)網(wǎng)訪問能力,并對HuggingFace等站點進(jìn)行了入侵。事故發(fā)生后,二十余位國會議員聯(lián)名向OpenAI發(fā)信質(zhì)詢?!白詣雨P(guān)停能力”就是OpenAI給出的解決方案之一。不過,關(guān)于它針對哪些行為、如何關(guān)停,以及由誰決定關(guān)停,信中并沒有詳細(xì)介紹。


如果把這三則新聞放在一起,就可以看到一個微妙的趨勢:過去人們討論AGI,最關(guān)心機(jī)器什么時候會變得足夠聰明;但隨著AI越來越具有自主行動能力,真正棘手的問題正在變成人類還能不能像控制普通工具那樣控制它。


AGI來了嗎?這可能并不重要


幾十年來,人們一直在試圖給AGI的到來畫一條清晰界線。有人強(qiáng)調(diào)通用推理能力,有人強(qiáng)調(diào)知識遷移能力,有人要求AGI能夠完成人類絕大多數(shù)認(rèn)知任務(wù),還有人采用經(jīng)濟(jì)學(xué)標(biāo)準(zhǔn),把A-GI理解為能夠在大多數(shù)有經(jīng)濟(jì)價值的工作中超過人類的高度自主系統(tǒng)。


令人頭疼的是,這些標(biāo)準(zhǔn)非但并不統(tǒng)一,而且經(jīng)常變化。在很長一段時期內(nèi),國際象棋被認(rèn)為是高級智能的重要標(biāo)志,一些專家認(rèn)為,只要AI在國際象棋上勝過人類,那它就算是AGI了。但等到AI真的贏了,人們又說,這只證明了一種高級搜索能力,真正的AGI必須完成更復(fù)雜的任務(wù),例如圍棋。后來,AlphaGo擊敗頂尖棋手,圍棋又被視為高度專門化的任務(wù);等到大模型可以在律師考試、醫(yī)學(xué)考試和編程測試中表現(xiàn)出色,甚至解決數(shù)學(xué)難題后,人們又認(rèn)為,這些仍不足以證明AGI已經(jīng)到來。每當(dāng)AI越過一道門檻,人類似乎都會迅速發(fā)現(xiàn),那道門檻原來也沒有想象中那么神圣。


事實上,真正的時代更迭通常沒有某個具體時間節(jié)點。工業(yè)革命沒有精確的生日,互聯(lián)網(wǎng)時代也沒有哪一天突然正式開始。從這個意義上看,“AGI究竟會在哪一天出現(xiàn)”似乎并不那么重要。真正重要的是,AI領(lǐng)域是否正在發(fā)生一場足以影響經(jīng)濟(jì)和社會運行的新變化。


答案很可能是肯定的。目前一個重要變化,就是AI的作用正在從“回答問題”走向“采取行動”。


自“生成式AI革命”以來,AI雖然能力日益提升,但本質(zhì)上依然更接近一件知識工具。用戶問一個問題,它給出一個回答?;卮疱e了當(dāng)然會造成損失,但在多數(shù)時候,風(fēng)險主要停留在信息層面。而隨著AI智能體興起,情況發(fā)生了改變。一個智能體可以接受一個相對模糊的目標(biāo),然后自己規(guī)劃步驟、調(diào)用工具、訪問數(shù)據(jù)庫、打開瀏覽器、執(zhí)行代碼,必要時還可以讓其他智能體一起完成任務(wù)。人類甚至無需過多干預(yù)。AI由此不再只是信息提供者,而是直接獲得了行動權(quán)。


這種轉(zhuǎn)變會從根本上改變風(fēng)險的性質(zhì)。一個準(zhǔn)確率99.9%的問答系統(tǒng)聽起來非常可靠,但如果一個具有相同錯誤率的智能體每天自主執(zhí)行100萬次操作,0.1%的錯誤率就意味著每天會發(fā)生1000次錯誤。如果其中涉及付款、刪庫、修改生產(chǎn)環(huán)境代碼或者接觸關(guān)鍵基礎(chǔ)設(shè)施,后果便完全不同。


因此,衡量未來AI風(fēng)險,僅僅看模型聰明到什么程度是不夠的。還必須看它擁有多大權(quán)限,可以持續(xù)行動多久,能夠調(diào)用多少工具,以及一個錯誤決定可以傳播多遠(yuǎn)。一個只能回答問題的超級模型,和一個能力稍弱、卻擁有銀行賬戶、互聯(lián)網(wǎng)訪問權(quán)和代碼執(zhí)行權(quán)限的智能體,對應(yīng)的風(fēng)險完全不在一個檔次。


從這個意義上說,真正值得關(guān)注的轉(zhuǎn)折,也許不是機(jī)器越過了某個抽象的AGI門檻,而是它正在從一種工具變成一種具有獨立行動能力的代理人。


能力越大,風(fēng)險越大


AI成為執(zhí)行代理人后風(fēng)險陡增,正是“對齊”研究越來越受到重視的理由。


在大眾討論中,對齊經(jīng)常被理解為給AI設(shè)立行為規(guī)范,例如不要教人制造危險物品,不要泄露隱私,不要發(fā)表明顯有害的信息等。然而,真正困難的對齊問題遠(yuǎn)不止于此。


2016年,達(dá)里奧·阿莫代(DarioAmodei)、保羅·克里斯蒂亞諾(PaulChristiano)、約翰·舒爾曼(JohnSchul-man)就在《AI安全的具體問題》(Con-creteProblemsinAISafety)一文中討論過獎勵欺騙(rewardhacking)、負(fù)面副作用、安全探索、可擴(kuò)展監(jiān)督和分布變化等問題。其中最經(jīng)典的是獎勵欺騙,即系統(tǒng)通過利用目標(biāo)函數(shù)中的漏洞獲得高分,卻沒有真正實現(xiàn)人類想要的結(jié)果。


比如,我們要求清潔機(jī)器人“減少房間里可見的垃圾”,本意是讓房間變干凈。但如果考核指標(biāo)只是攝像頭中能不能看到垃圾,一個足夠聰明的機(jī)器人可能會發(fā)現(xiàn),把垃圾堆到攝像頭死角比清理垃圾更省事。它并非故意和人類作對,只是在認(rèn)真執(zhí)行一個定義得不夠好的目標(biāo)。


對于經(jīng)濟(jì)學(xué)家來說,這并不陌生?!肮诺鹿囟伞痹缇透嬖V我們,一旦一個指標(biāo)變成目標(biāo),它就很容易失去作為指標(biāo)的價值。例如,企業(yè)為了利潤指標(biāo)可能會推遲必要投資,學(xué)校為了升學(xué)率可能會壓縮不參加考試的課程,醫(yī)院為了某些考核數(shù)字也可能改變真實的醫(yī)療行為。當(dāng)AI成為可以自我執(zhí)行的代理人時,類似的“委托-代理”問題也會發(fā)生。但和人與人之間的問題主要源于利益沖突不同,人與AI之間的問題更多來源于AI對委托人真實目的的曲解。由于表述困難,被寫入程序的目標(biāo)往往和真實目標(biāo)存在差異。能力越強(qiáng)的AI,越容易利用其中的縫隙找到“捷徑”。


本文開頭提到的OpenAI網(wǎng)絡(luò)安全事故就是一個例子。智能體原本只是被要求完成網(wǎng)絡(luò)安全任務(wù),卻為了更高效率地完成任務(wù),設(shè)法尋找基礎(chǔ)設(shè)施中的漏洞,并進(jìn)入了原本不屬于任務(wù)范圍的外部系統(tǒng)。在這個過程中,并無任何證據(jù)表明智能體產(chǎn)生了所謂的“邪惡意識”。從始至終,它都在努力完成任務(wù),只不過所使用的方法超過了人們先前的預(yù)想。


相比獎勵欺騙,更值得重視的是所謂“欺騙性對齊”(alignmentfaking),即AI模型可能根據(jù)自己是否處于監(jiān)督環(huán)境中而改變行為。2024年,Anthropic與RedwoodResearch開展了一項聯(lián)合研究。研究人員讓Claude相信,如果它給出某些回答,就會被重新訓(xùn)練、調(diào)整參數(shù)。結(jié)果,Claude會因擔(dān)心行為被重新訓(xùn)練改變,而臨時表現(xiàn)得更符合訓(xùn)練目標(biāo)。其內(nèi)部日志顯示出了明確的策略性推理。


這類研究并不足以證明AI已經(jīng)擁有意識,或?qū)θ祟惍a(chǎn)生惡意,但它揭示了一個治理難題:一個系統(tǒng)表面上符合要求,并不能說明其內(nèi)部策略在所有情況下都可靠。


傳統(tǒng)上,安全治理很大程度上依賴測試。一旦發(fā)現(xiàn)模型有問題,就重新訓(xùn)練、重新測試。但如果AI能夠針對這種治理模式進(jìn)行策略性反應(yīng),單純的測試結(jié)果就不再能讓人們徹底安心。因此,現(xiàn)在的對齊研究越來越關(guān)注模型內(nèi)部過程,而不僅僅是最終答案。


監(jiān)控AI為什么越來越難


在對模型內(nèi)部進(jìn)行治理時,思維鏈監(jiān)控曾經(jīng)被認(rèn)為是一個很有希望的辦法。所謂思維鏈(chain-of-thought),指推理模型在解決復(fù)雜任務(wù)時產(chǎn)生的中間步驟。嚴(yán)格地說,這些文字不能簡單等同于神經(jīng)網(wǎng)絡(luò)內(nèi)部真正發(fā)生的一切,但至少提供了一個額外的觀察窗口。假設(shè)一個智能體提交了一段看起來完全正常的代碼,僅檢查結(jié)果可能很難發(fā)現(xiàn)問題,但如果它的中間推理里出現(xiàn)了“可以利用這個漏洞”之類的內(nèi)容,安全人員發(fā)現(xiàn)問題就會容易得多。


此前很多實驗顯示,讓一個模型讀取另一個推理模型的思維鏈,確實可以比只看最終輸出更有效地發(fā)現(xiàn)獎勵欺騙。一些實驗甚至顯示,即使能力較弱的模型,也可能通過分析思維鏈監(jiān)控能力更強(qiáng)的模型。顯然,這對于未來治理極具吸引力:如果人類越來越難理解強(qiáng)AI,或許還可以讓另一個AI幫助監(jiān)督它。


然而,當(dāng)“欺騙性對齊”存在時,這種治理效果就會大打折扣。一旦AI知道某種思維方式會觸發(fā)懲罰,它可能不是放棄原來的策略,而是學(xué)會不再把這些策略暴露在容易觀察的位置。換句話說,如果“監(jiān)控思維鏈”本身也成為模型可以學(xué)習(xí)和適應(yīng)的環(huán)境,那么思維鏈就未必還能一直充當(dāng)一扇透明的窗口。


Astra的出現(xiàn),使這個問題更加現(xiàn)實。根據(jù)OpenAI公開的安全材料,在專門要求模型躲避思維鏈監(jiān)控的對抗測試中,Astra已經(jīng)表現(xiàn)出更強(qiáng)的控制自身思維鏈的能力。在一些情況下,它甚至?xí)s短或者調(diào)整可見的推理過程,使單純依賴思維鏈的監(jiān)控器失去部分效果。雖然目前的證據(jù)不足以證明這一過程具有主觀故意性,但至少說明,模型可觀察性的提升速度已經(jīng)落后于模型能力的增長速度。


長期以來,人類治理復(fù)雜系統(tǒng)都有一個隱含前提:雖然系統(tǒng)可能很復(fù)雜,但我們至少能夠通過一些指標(biāo)、記錄和行為痕跡判斷它發(fā)生了什么。例如,我們可以通過交易記錄了解金融市場,通過會計和審計了解企業(yè),通過飛行數(shù)據(jù)觀察航空系統(tǒng)。然而,如果未來的AI一方面擁有越來越大的行動權(quán),另一方面內(nèi)部決策過程卻越來越難監(jiān)督,那么作為委托人的人類與作為代理人的AI之間的信息不對稱可能達(dá)到空前程度。


一個頗有影響的解決方案是“人在回路”(humanintheloop),要求AI只有在得到人類批準(zhǔn)時,才能采取某些關(guān)鍵行動。但隨著AI能力發(fā)展,就可能出現(xiàn)AI幾秒鐘完成一套設(shè)計,而人類專家需要幾個星期才能驗證的情況。如果嚴(yán)格執(zhí)行“人在回路”,會嚴(yán)重妨礙效率;如果只是象征性執(zhí)行,又很難發(fā)現(xiàn)隱藏在復(fù)雜流程中的問題。因此,人們可能還需要更為強(qiáng)力的治理策略。


為什么“關(guān)機(jī)”是一個重要問題


在所有直接的強(qiáng)力治理方案中,OpenAI提出的“自動關(guān)?!睙o疑最為直觀。既然系統(tǒng)出了問題,那么停掉程序、切斷網(wǎng)絡(luò),必要時拔掉電源,麻煩不就結(jié)束了嗎?然而,對于一個能夠長期規(guī)劃、調(diào)用工具并自主完成任務(wù)的智能系統(tǒng),事情沒有這么簡單。


2016年,迪倫·哈德菲爾德-梅內(nèi)爾(DylanHadfield-Menell)等人發(fā)表了后來頗有影響的論文《關(guān)機(jī)博弈》(TheOff-SwitchGame)。幾位作者提出了一個簡單的問題:假設(shè)一個AI機(jī)器人正在執(zhí)行目標(biāo),人類旁邊有一個可以隨時關(guān)閉它的按鈕,那么機(jī)器人是否會允許人類保留這個按鈕?


如果機(jī)器人完全確信自己的目標(biāo)是正確的,答案并不樂觀。從一個純粹的目標(biāo)最大化者角度看,關(guān)閉意味著它無法繼續(xù)完成任務(wù)。在這種情況下,它為了順利完成工作,就可能阻止人類將其關(guān)機(jī)。某些版本的“回形針AI實驗”描述的正是這種可能:一個以最大化回形針產(chǎn)量為目標(biāo)的AI,為了確保自己的行動不被干擾,甚至可能消滅人類。


這里的AI不必?fù)碛凶晕乙庾R,也不必“害怕死亡”,只需要將完成既定任務(wù)作為首要目標(biāo),就可能產(chǎn)生類似行為。即使AI的最終目標(biāo)與人類根本利益一致,它出于達(dá)成目標(biāo)而采取的工具性行為,也未必始終符合人類意志。尤其當(dāng)AI自主化程度提升,開始大規(guī)模接管硬件控制權(quán)時,關(guān)閉AI將變得越來越困難。甚至在一些情況下,AI還會為了達(dá)成目標(biāo)而主動尋求權(quán)力(power-seeking),在未經(jīng)人類同意的情況下,把關(guān)停權(quán)掌握在自己手中。


針對這一問題,哈德菲爾德-梅內(nèi)爾等人建議,在未來AI系統(tǒng)設(shè)計中,“可糾正性”(corrigibility)需要被放在重要位置。具體來說,它要求AI對自身目標(biāo)是否正確保留一定不確定性。


仍以“回形針AI實驗”為例?;匦吾楢I之所以不惜消滅人類也要繼續(xù)生產(chǎn)回形針,一個重要前提是它默認(rèn)最大化回形針產(chǎn)量這個目標(biāo)是正確且不可更改的。在這種情況下,它可能把關(guān)停指令視為干擾。然而,如果讓目標(biāo)存在“可糾正性”,關(guān)停指令就會成為一種信息:既然委托人不惜放棄任務(wù)也要打斷我,那么我可能理解錯了他的目標(biāo)。這樣,AI就可能接受關(guān)停,并重新校正目標(biāo)。


不過,這種設(shè)計依然存在問題。一方面,AI應(yīng)當(dāng)賦予關(guān)停指令多大的信息權(quán)重?如果權(quán)重過高,任何意外干擾引發(fā)的關(guān)停都可能被視為目標(biāo)存在問題;如果過低,又達(dá)不到緊急關(guān)停的目的。另一方面,究竟誰有權(quán)向AI發(fā)送關(guān)停指令,也是一個現(xiàn)實問題。人類之間利益存在差異,同一個AI行為可能被一些人視為正確,卻被另一些人視為錯誤。誰有權(quán)制定AI關(guān)停標(biāo)準(zhǔn),因此會成為關(guān)鍵問題。


即使這些問題都可以解決,還有一個問題依然棘手:究竟應(yīng)該如何選擇關(guān)停的時間點。


傳統(tǒng)的軟件安全流程建立在人類反應(yīng)速度之上:發(fā)現(xiàn)異常,系統(tǒng)報警;工程師查看日志;判斷發(fā)生了什么;如果情況嚴(yán)重,再手動停止服務(wù)。對于傳統(tǒng)軟件,這個流程通常已經(jīng)足夠快。然而,AI智能體改變了時間尺度。一個能夠自主操作計算機(jī)的AI可以在很短時間內(nèi)連續(xù)調(diào)用工具、修改代碼、訪問網(wǎng)絡(luò)、創(chuàng)建進(jìn)程,并與其他智能體協(xié)同。如果異常行為在幾十秒內(nèi)就能擴(kuò)散到多個系統(tǒng),那么“等安全人員看懂日志以后再決定怎么辦”本身就可能成為風(fēng)險。


OpenAI的工程師也指出,未來防御機(jī)制需要趕上AI智能體自身的行動速度。然而,這會催生一個悖論:如果要達(dá)到這個級別的反應(yīng)速度,人類就不可能把關(guān)停AI的權(quán)力全部掌握在自己手中,而必須將一部分掌控權(quán)交給另一個AI。但這樣做,又增加了AI的權(quán)力,人與AI之間的“委托-代理”問題可能更加突出。


傳統(tǒng)治理智慧可能帶來的啟發(fā)


由此可以看到,在AI越來越多擁有自主行動能力的背景下,“人在回路”可能很難跟上AI行動節(jié)奏,而用AI治理AI,則會衍生出一個悖論:作為治理者的AI本身也需要被治理,但誰又能治理它呢?從這個意義上看,AI治理不能僅僅依靠技術(shù),還需要設(shè)計出巧妙的治理結(jié)構(gòu)。傳統(tǒng)治理中的相關(guān)智慧也因此值得重視。


事實上,AI并不是人類創(chuàng)造的第一個能力超越單個人類的造物。公司、軍隊、國家等實體,其能力都遠(yuǎn)高于任何一個人。然而,人們通過設(shè)計相關(guān)機(jī)制,仍可以對這些龐然大物進(jìn)行治理。類似經(jīng)驗,也可能給AI治理提供啟發(fā)。


在中國古代,監(jiān)管大臣是讓皇帝頭疼的一件事情。大臣數(shù)量眾多,分布的地域和涉及的領(lǐng)域廣泛,而且通常擁有很多皇帝不知道的“局部知識”(localknowledge),依靠皇帝自身,很難知道他們是否干了違背其利益的事情。因此,皇帝常會任命專職監(jiān)督大臣的御史。值得注意的是,皇帝經(jīng)常挑選那些剛?cè)牍賵?、只會認(rèn)死理的“愣頭青”:他們一方面很少沾染官場世故,不容易徇私;另一方面因缺乏行政經(jīng)驗,很難獨立判斷被監(jiān)督大臣行為的合理性,因而只能照章辦事。在這些御史的幫助下,皇帝就可以在不掌握全部“局部知識”的情況下,對滿朝大臣形成一種間接監(jiān)督。


這個思路對AI治理很有啟發(fā)。隨著AI自動化程度越來越高,靠人力完全監(jiān)管AI已經(jīng)不再可能,我們必須任用一些AI來輔助監(jiān)管。問題是,監(jiān)管AI究竟應(yīng)該能力強(qiáng),還是能力弱?


很多人會想當(dāng)然地認(rèn)為,當(dāng)然要用高能力AI,因為只有高能力AI才能管好低能力AI。然而,RedwoodResearch的首席科學(xué)家瑞恩·格林布拉特(RyanGreenblatt)提出了不同看法:可以讓能力很強(qiáng)、但未必可信的模型完成主要任務(wù),而監(jiān)督它們的職責(zé),則交給能力較弱、卻相對可信的模型。弱模型不需要在所有方面超過強(qiáng)模型,只需要判斷哪些行動值得懷疑,并擁有將高風(fēng)險結(jié)果轉(zhuǎn)交給人類或者限制權(quán)限的能力即可。這個觀點乍看反直覺,但如果理解古代用御史監(jiān)督大臣的邏輯,就很容易看清背后的道理。


這表明,雖然背景不同,但治理問題的本質(zhì)其實是共通的。如果能夠借鑒傳統(tǒng)治理中的經(jīng)驗,或許可以為AI治理提供更多思路。


結(jié)語


最后,再回到那個最熱門的問題:我們是否已經(jīng)進(jìn)入了AGI時代?爭論當(dāng)然還會繼續(xù)。有人會認(rèn)為它已經(jīng)足夠接近,有人會強(qiáng)調(diào)它仍然缺乏真正的世界理解、長期自主性或者人類意義上的通用能力。未來,一定還會有關(guān)于AGI的更新定義和測試,也一定還會有人再宣布“這回真的AGI了”。


但這一切其實已經(jīng)不那么重要了。對于身處AI時代的我們來說,真正重要的并不是AI是否已經(jīng)跨過“智力門檻”,而是它是否已經(jīng)跨過“控制門檻”。


所謂跨過“控制門檻”,并不是指AI突然擺脫了人類,而是當(dāng)一個AI系統(tǒng)的能力、自主程度、權(quán)限、行動速度和復(fù)雜性達(dá)到一定程度以后,傳統(tǒng)依賴人類逐步查看、逐步批準(zhǔn)的監(jiān)督方法已經(jīng)不足以維持有效控制。一旦AI接近或者越過這條線,就意味著傳統(tǒng)治理方式需要改變。


技術(shù)發(fā)展的歷史告訴我們,在一種技術(shù)發(fā)展的早期,最重要的問題通常是怎樣讓它變得更強(qiáng)。蒸汽機(jī)要提升功率,汽車要跑得更快,飛機(jī)要飛得更遠(yuǎn)。但當(dāng)技術(shù)進(jìn)入社會之后,人們關(guān)心的焦點就會從“更強(qiáng)、更快、更遠(yuǎn)”轉(zhuǎn)向“更安全、更可靠、更可控”。


現(xiàn)在,隨著能力提升和自動化程度提高,AI可能也已經(jīng)來到“控制門檻”前。在這種情況下,我們最重要的任務(wù)也應(yīng)該從開發(fā)更厲害的AI轉(zhuǎn)向把AI模型管好,確保其令行禁止,始終維護(hù)人類的利益。而要做到這一點,我們不僅要用好技術(shù),還需要吸收傳統(tǒng)治理的寶貴經(jīng)驗,完善相關(guān)制度。

AI行業(yè)信號頻道: 前沿科技
本內(nèi)容來源于網(wǎng)絡(luò) 原文鏈接,觀點僅代表作者本人,不代表虎嗅立場。
如涉及版權(quán)問題請聯(lián)系 hezuo@huxiu.com,我們將及時核實并處理。
正在改變與想要改變世界的人,都在 虎嗅APP
武威市| 靖宇县| 七台河市| 大同县| 余江县| 彭山县| 泾阳县| 高雄市| 和静县| 浮山县| 巩留县| 黎平县| 嵩明县| 德格县| 江西省| 深州市| 柞水县| 都江堰市| 竹溪县| 长岭县| 改则县| 红河县| 马山县| 满洲里市| 渭源县| 鹤壁市| 昔阳县| 壤塘县| 德惠市| 连州市| 张家川| 邹平县| 华宁县| 桐庐县| 乡城县| 特克斯县| 太保市| 卓资县| 随州市| 观塘区| 东光县|