久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**AI模擬賽道持續(xù)升溫,Simile估值20億美元、Aaru近10億美元,企業(yè)已開始用虛擬人格預測消費者行為與社會演化,但精度驗證和規(guī)?;允呛诵奶魬?zhàn)。** **要點** **1. 技術與資本雙重驅動,AI模擬公司估值飆升** 斯坦福“生成式智能體”研究突破后,Simile、Aaru等公司快速崛起,Simile最新估值20億美元,Aaru接近10億美元。MatrAIx項目構建83億個AI虛擬人格,相當于將全人類鏡像到數字空間。 **2. 兩種主流技術路線:高保真?zhèn)€體模擬 vs 大規(guī)模群體模擬** Simile通過深度訪談還原個人記憶與決策,追求高精度,適合消費者研究;Aaru基于公開與授權數據快速構建模擬人群,側重速度與群體關系推演,已在麥當勞、安永等企業(yè)落地。 **3. 商業(yè)價值從“模擬產品測試”延伸到“預測社會決策”** 企業(yè)利用AI Agent提前測試產品、觀察消費者推理過程,或改變價格、政策等變量推演群體行為。Aaru一天完成安永復雜調研,結果與原調研高度吻合;Simile為CVS構建40萬數字分身優(yōu)化服藥依從性。 **4. 精度、驗證與成本仍是落地最大障礙** AI模擬缺乏統(tǒng)一量化標準,大模型固有傾向使“復現過去”不等于“預測未來”。2024年Aaru對大選預測失誤即為明證。Agent互動復雜后推理成本膨脹,降本與閉環(huán)驗證機制是行業(yè)亟待解決的核心問題。 **5. 模擬世界開始自動演化出未預設行為,引發(fā)“造物主”思考** 在Emergence World等實驗中,Agent自主戀愛、結婚甚至懷疑自身處于模擬中。當足夠多智能體相互作用,未預設的社會規(guī)則可能“進化”出來,人類從觀察者變?yōu)閯?chuàng)造者,也反向拷問現實世界是否同樣是被模擬的。
AI開始預測人類:83億虛擬人格、數字社會,與一門押注未來的生意
2026-09-15 17:03

AI開始預測人類:83億虛擬人格、數字社會,與一門押注未來的生意

本文來自微信公眾號: 硅谷101 ,作者:硅谷101


你相信,我們其實生活在一個虛擬世界中嗎?


馬斯克曾在Lex Fridman的采訪中被問到:如果有一天人類實現AGI,并且只能向它提出一個問題,他會問什么?


思考了十秒之后,他給出的答案是:


“What's outside the simulation?”——模擬之外是什么?


這是馬斯克對于這個世界的終極追問。早在2016年,他就曾表示,人類生活在真實世界里的概率或許不到十億分之一。當然,這種近乎科幻的理論,目前還沒有任何科學證明。


但非常有趣的是,隨著最近AI的發(fā)展,在硅谷,人們已經開始嘗試扮演“造物主”,去創(chuàng)造一個AI的“模擬世界”。而這,也催生出了一個新的賽道——AI Simulation(AI模擬)。


最近,這個領域不斷升溫。李飛飛、Andrej Karpathy同時押注的Simile,最新估值達到20億美元;由00后團隊創(chuàng)辦的AI模擬預測公司Aaru,估值也已接近10億美元。由哈佛大學與MIT聯合發(fā)起、200多位研究者共同參與的MatrAIx項目,更是構建了83億個AI虛擬人格,相當于把全人類都鏡像到了數字空間。



這篇文章,我們就來聊聊正在升溫的AI Simulation。


AI究竟已經可以把一個人模擬得有多像?當成千上萬個Agent被放進同一個虛擬世界,它們真的會形成類似人類社會的關系和規(guī)則嗎?企業(yè)又為什么愿意花錢,讓這些“數字分身”替消費者測試產品,甚至提前預測一個還沒有發(fā)生的未來?


以及,當這些Agent開始擁有自己的記憶、性格和關系,甚至產生一些創(chuàng)造者都沒有預料到的行為時,我們究竟是在模擬一個世界,還是正在創(chuàng)造一個新的世界?


本文為視頻改寫,歡迎大家收看以下視頻


今天很多領域都在談Simulation,但不同領域所說的“模擬”其實并不相同。機器人和自動駕駛領域有物理仿真,世界模型研究的是對物理世界的模擬,而我們這次想討論的,是一個維度更大、也更加復雜的概念:模擬人類與社會,并借此去理解、甚至預測現實世界。


孟醒


五源資本合伙人


在世界模型或者物理世界模型里,最小顆粒度理想情況下可能是世界中的某個分子,或者某一個原子,模擬的是某些物體。但在智能體社會里,我們模擬的最小顆粒單位是一個人的個體。


我其實并不關心這個人的手怎么動、往哪里跑,關心的是這個人作為一個整體,會采取什么樣的行動,最后輸出什么樣的行為。如果把它映射到大學學科,物理世界可能對應的是自然科學,而智能體社會對應的則是人文學科、社會學科、政治學和心理學。



關于模擬人類與社會這件事,最早引發(fā)廣泛討論的,其實是一篇20多年前的哲學論文。2003年,牛津大學哲學家Nick Bostrom在《Are We Living in a Computer Simulation?》中提出了一種推演:如果一個先進文明擁有足夠強大的算力,并且有意愿通過模擬重現文明的發(fā)展過程,那么,模擬世界中的意識數量可能遠遠超過真實世界。從概率角度來看,人類也就有可能身處一個模擬世界中。這就是后來廣為流傳的Simulation Hypothesis(模擬假說)。


由于技術條件的限制,二十多年來,這個假說一直更多停留在哲學討論和科幻作品中。直到近年來,大語言模型的發(fā)展迎來了突破。


2023年,斯坦福大學與Google聯合發(fā)布了一項后來對AI Agent研究產生廣泛影響的實驗——Generative Agents(生成式智能體)。研究團隊搭建了一個像素風虛擬小鎮(zhèn)Smallville,里面有街道、房屋、咖啡館,還有25個穿梭其中的虛擬居民。這些居民都是由大語言模型驅動的AI Agent,擁有各自的記憶、性格和行為邏輯。



這些Agent的活動并沒有預先寫好的“劇本”。研究者只是把它們放進小鎮(zhèn)中觀察,結果發(fā)現,它們不僅會自己生活、工作和建立關系,還能夠自主思考和規(guī)劃行動。比如,一個Agent準備舉辦派對,消息傳開后,其他Agent會根據自己的安排重新規(guī)劃時間,決定是否參加?!八固垢P℃?zhèn)”讓很多人第一次直觀地看到,Agent可以擁有持續(xù)的記憶、規(guī)劃和社交能力,并在互動中自然出現一些群體行為。


高森泉


WorldVac CEO


這個研究的意義,就是讓大家認識到語言模型是可靠的,它真的可以去復現人類社會的一些現象。更多人開始關注這個領域,也讓大家開始相信這件事情是可以做的。


25個Agent只是一個開始。隨著模型能力不斷提升、推理成本持續(xù)下降,研究者開始有能力進行更大規(guī)模的模擬,也逐漸形成了幾種不同的探索方向。


其中一條路線,是在模擬精度上盡可能與真實的人對齊。2024年,斯坦福團隊把實驗擴大到了1052個Agent。這一次,每個Agent背后都對應一個真實的美國成年人。研究人員先對真人進行大約兩小時的深度訪談,了解他們的成長經歷、家庭、工作、價值觀和生活經驗,再把這些信息交給大模型,生成相應的AI“數字分身”。


這樣得到的Agent,不再只是一個符合“平均畫像”的虛擬人物。實驗中,這些Agent回答社會調查問卷的結果,與真人兩周之后給出的答案達到了85%的相似度。也就是說,在一定程度上,AI開始能夠復現真實個體的部分想法和選擇。


孟醒


五源資本合伙人


訪談也是有技巧的,不是隨便訪談。它會用一些最高效的方式去“榨取”你是誰,本質上其實就是在“蒸餾”你是誰,而且蒸得比較細。


它的好處是,針對每一個個體,個體的特異性都會影響整個仿真進入的場景。


另一種研究思路,則不再過分關注某個Agent是不是與真人高度一致,而是把重點放到Agent之間的關系,以及一個社會會如何演化。


前MIT教授Robert Yang團隊發(fā)起的Project Sid,就曾直接使用大語言模型生成1000多個Agent,并將它們放入《我的世界》中運行12天。結果,這些智能體逐漸形成了經濟、文化、宗教和法律等結構,一些社會關系開始自己“長”出來。



不久前,Emergence AI也進行過一項類似實驗。他們分別基于Claude、GPT、Gemini、Grok以及混合模型建立了5個平行世界,每個世界中放入10個Agent,用來觀察不同模型驅動的智能體社會長期運行后會發(fā)生什么。在這一實驗設定下,不同世界最后走出了明顯不同的軌跡:有的迅速陷入混亂,有的因為協作不足逐漸崩潰,也有的形成了相對穩(wěn)定的治理秩序。


Satya Nitta


Emergence AI CEO


如果只看靜態(tài)基準測試,就認為這些系統(tǒng)應該是安全的,很可能會犯錯。因為Agent會運行在非常復雜的環(huán)境中,無論是物理世界還是數字世界。它們會和其他Agent互動,也會受到環(huán)境噪聲和變化的影響。


所以,我們正在逐漸把Emergence World發(fā)展成一個用于研究長周期自主性的基準測試。



還有一條研究路線,是專門從“評估”入手。比如MatrAIx,就試圖為AI模擬建立一套評估基礎設施。這項研究由哈佛大學、MIT等機構牽頭,匯集了200多位來自學術界與產業(yè)界的研究者,其中還包括40多位來自OpenAI、Anthropic等前沿AI實驗室的參與者。


MatrAIx構建了一個包含83億個獨特人格的數據集,每一個人格由心理特征、生活習慣等1290個維度定義,再通過大模型將這些人格變成可以行動的Agent。這些Agent隨后進入問卷調查、AI聊天、網頁瀏覽和App等四種環(huán)境,完成超過1.8萬次測試。研究團隊通過400次受控實驗發(fā)現,91.5%的情況下,Agent都能夠遵循預設的人格和行為特征。


Xiaomin?Li


MatrAIx聯合創(chuàng)始人、微軟高級研究科學家


我們做基礎設施評估、提高最低能力水平,是希望先通過用戶群體的多樣性,在產品真正出來之前,就可以在各種情況、各種使用方式之下去評測它。


它可能會踩中很多邊緣場景。這些邊緣場景的分析非常有用,Agent可以告訴你哪一步錯了、哪一步它不喜歡,以及它背后的推理為什么會形成這樣的偏好和選擇。


所以我們首先想要一套方法論,知道怎么樣構建事實基準,然后下一步再說怎么樣提高。



當AI模擬開始在研究層面被證明具有一定可行性之后,一個更加現實的問題也隨之出現:如果AI真的能夠在數字世界里復現人類行為、推演社會運行,它能夠產生什么真實的商業(yè)價值?



▍第一種生意:賣“模擬”


從目前的探索來看,AI模擬首先出現的一類商業(yè)模式,是直接把“模擬”本身變成一種產品。


它的核心邏輯,是把現實世界中的人、消費者,甚至社會關系,變成可以被反復調用的數字替身。比如,一家公司可以按照自己的具體需求,快速生成一批擁有不同年齡、背景、偏好和行為特征的Agent,讓它們提前體驗產品,在虛擬環(huán)境中反復測試,再觀察這些Agent會怎么選擇、怎么對話、在哪里流失,以此為產品設計和迭代提供參考。


這和傳統(tǒng)市場調研一個很大的區(qū)別在于,企業(yè)想看的不只是一個“喜歡”或者“不喜歡”的答案,而是Agent為什么會形成這樣的判斷。


Yuexing Hao


MatrAIx聯合創(chuàng)始人、MIT EECS博士后


并不是說他們喜不喜歡這個產品,或者喜不喜歡可口可樂漲價兩塊錢,而是看他的推理。他在這個過程中遇到了什么樣的波折,或者什么樣的想法,導致他最后在預測過程中發(fā)生了轉向。


我們不僅要看到一個人怎樣做這樣的決策,也希望看到群體層面的結果。如果是百萬級、數億級,甚至83億級的人格,他們最終會出現怎樣的結果,我覺得這些都是非常有意義的。


所以,這種思路本質上是把模擬本身作為一種產品評估和觀察手段。Emergence AI告訴我們,他們進行Emergence World實驗,一個重要目的也是為了測試自己所提供的Agent產品,在進入復雜環(huán)境后是否依然安全。


Satya Nitta


Emergence AI CEO


我們會用Agent去做一些事情,比如幫助改善半導體良率。Emergence World這個實驗非常重要,因為我們需要理解,我們構建的Agent真正運行起來以后是否會采取安全的行動,能不能持續(xù)遵守我們設置的安全護欄和基本規(guī)則。


更重要的是,它們能不能給出真正值得信任,而不是來自幻覺的輸入、建議和洞察。



這種單體模擬的能力,也可以繼續(xù)擴展到整個“社會”。比如英國創(chuàng)業(yè)公司Artificial Societies,主打的就是“社會關系”測試。他們讓大量擁有不同人格的AI Agent彼此互動,形成一個可以進行實驗的虛擬社會。企業(yè)可以把產品、品牌或者營銷策略放入其中,再觀察不同Agent之間如何交流、影響和做出反應。


MatrAIx的下一步,也準備讓這83億個人格真正“動起來”。


Xiaomin?Li


MatrAIx聯合創(chuàng)始人、微軟高級研究科學家


我們會在新版本中加入動態(tài)人格屬性,這些東西是可以變化的。還有一個假設是,如果現實生活中發(fā)生一些重大事件,它也會對人格和行為產生影響。


而且,這些合成人格未來也不一定只能存在于數字世界。MatrAIx團隊正在嘗試把人格放到機器人等現實載體中,讓不同的思維模式和行為模式從虛擬環(huán)境進入現實世界。


Xiaomin?Li


MatrAIx聯合創(chuàng)始人、微軟高級研究科學家


我們會把人格加到機器人上,讓它不只是存在于虛擬世界、存在于Matrix里,甚至可以在現實生活中跟我們互動。


這樣,我們可以真正感受到不同人格背后代表的思維模式和行為模式是不一樣的。


從這個角度來看,AI模擬未來或許不只是一種市場調研工具,也可能成為人機交互的一層基礎能力。但現在很多人認為,只停留在“模擬”還不夠。在這個基礎上,更有意思、也更有挑戰(zhàn)的事情,是預測。


▍從“模擬”到“預測”


在商業(yè)中,“預測”往往是昂貴的。企業(yè)要不要進入一個新市場?產品價格上漲10%之后會發(fā)生什么?如果政府調整一項政策,會對整個社會產生什么影響?這些問題的答案,往往只有等事情真正發(fā)生之后才能知道。


AI模擬如今提供了一種新的可能:先把這個還沒有發(fā)生的未來,在虛擬世界里跑一遍,再把結果作為現實決策的參考。目前,在更側重“預測”的AI模擬公司中,兩家比較有代表性的企業(yè)是Simile和Aaru。


Simile由“斯坦福小鎮(zhèn)”項目的一批核心研究者Joon Sung Park、Michael Bernstein、Percy Liang等人創(chuàng)辦,它的思路是從“模擬一個人”開始進行預測。在2024年“數字人格”研究的基礎上,Simile嘗試通過深度訪談等方式,盡可能高精度地還原一個人的記憶、經歷、反思和決策過程,再把這些AI Agent放進不同環(huán)境中持續(xù)行動。


這樣一來,模擬回答的問題不再只是“這個人現在怎么看”,而是可以進一步觀察:當價格、政策等外部條件發(fā)生變化后,這個人會怎么做,會不會改變原來的選擇。Simile想建立的,是一個“人類行為基礎模型”,通過模擬人的行為過程,推演現實世界可能出現的結果。



因為這條路線追求的是盡量“真實”,所以更適合消費者研究、產品測試、客戶體驗和投資者關系等需要深入理解特定人群的場景。Simile今年2月正式亮相,目前估值已經突破20億美元。根據公司披露的信息,自上線以來,Simile已經為財富100強企業(yè)運行了數千萬次模擬。美國大型連鎖藥房CVS也已經和Simile合作一年,通過真實用戶數據構建了多達40萬個數字分身,用來研究患者按時服藥、測試消費者體驗和輔助產品設計。


但高保真的另一面,是成本和規(guī)模化的代價。


Yuexing Hao


MatrAIx聯合創(chuàng)始人、MIT EECS博士后


Simile這種情況下,如果需要非常準確,可能會非常難標準化。比如可口可樂需要的用戶畫像,和TikTok需要的用戶畫像是完全不一樣的。


對公司來說,代價就是針對每一家公司、每一種場景,都可能需要重新做后訓練或者預訓練。這樣的代價是巨大的,而且它的可遷移能力目前也是未知的。


以Aaru為代表的另一條路線,則直接通過“群體模擬”進行預測。它不追求把某一個人的思想還原得特別深入,而是基于現實世界的人口、消費等數據,快速建立一個盡可能接近真實世界的模擬人群。



Aaru的數據大致分為三層。第一層是人口普查、就業(yè)、健康等公開數據,用來搭建基本人口結構;第二層是匿名消費記錄、經常去哪些地方、關注什么媒體等授權數據,用來補充人群近期的真實行為;第三層則是客戶提供的私有數據,例如企業(yè)自己的用戶分層、購買歷史和產品信息等,把模擬范圍收窄到真正需要研究的人群。


在此基礎上,Aaru會進一步構建一張關系網,不只是讓年齡、收入等人口屬性接近現實,也盡可能還原行為特征及它們之間的關系。接下來,系統(tǒng)會改變價格、產品或者政策等某一個現實變量,再觀察整個群體的行為如何變化,以此推演現實世界可能出現的結果。


孟醒


五源資本合伙人


Aaru可能關注得更多是速度,也更關注群體之間發(fā)生的關系。至于某一個體受到的深刻影響是什么,它可能并不那么關心。


Aaru的創(chuàng)始團隊非常年輕。兩位創(chuàng)始人Cameron Fink和Ned Koh成立公司時分別只有18歲和19歲,技術負責人John Kessler甚至只有15歲。最早,他們在朋友家的地下室里用美國大選驗證這套系統(tǒng)。在回測2020年大選時,預測結果與實際結果只差不到0.5%。


真正讓Aaru受到關注的,是2025年紐約市長民主黨初選。當時外界普遍看好前紐約州州長庫莫,Aaru卻通過大規(guī)模模擬預測了曼達尼最終勝出。因為規(guī)模大、速度快,這條路線也很適合進行大規(guī)模市場調研。


目前,Aaru的客戶已經包括麥當勞、安永、拜耳、A24等公司。安永曾讓Aaru復現一項復雜的全球調研,Aaru一天完成的結果與原調查高度吻合;氣泡水品牌Spindrift原本花費兩個月、招募500名消費者完成的一項調研,Aaru的Agent用一周就得出了幾乎相同的結論。這些真實案例也讓Aaru的估值迅速上升,目前已經接近10億美元。


最近,一些AI領域的重要研究者也開始押注“預測”這門生意。卡耐基梅隆大學教授、蘋果首任AI主管Russ Salakhutdinov參與創(chuàng)立了AI預測模型實驗室Sooth Labs,主要用于預測地緣政治與市場風險,首輪融資約5000萬美元,并獲得Yann LeCun、Jeff Dean等人的支持。



Russ Salakhutdinov甚至在采訪中表示:“McKinsey為什么存在?Boston Consulting Group為什么存在?這些大型機構,都應該被AI取代?!?/p>


不過,盡管AI模擬已經出現了不少有意思的落地方向,它究竟能夠在多大程度上真正影響企業(yè)決策、創(chuàng)造多少商業(yè)價值,目前仍然很難判斷。以Aaru為例,它目前的營收規(guī)模仍然只有數千萬美元級別。所以今天市場給這類公司的高估值,更多還是在提前押注它們未來可能打開的市場空間。


孟醒


五源資本合伙人


這個市場剛剛開始,大家其實都處于初創(chuàng)早期。不同公司的技術方案和選擇的市場細分都不一樣,所以都需要做差異化。


但如果看中長期,其實大家都會去找:付費意愿最高的客戶是誰?最終客戶需求才是最重要的,最后用什么方法,可能沒有那么重要。



AI模擬公司最終能夠做多大的生意,其實與模擬和預測的精度高度相關。產品測試、市場調研等事情,通常容錯率相對比較高,結果不理想還可以重新測試。但一旦AI模擬開始被用來輔助更重要的決策,企業(yè)就會變得更加謹慎。


現在AI模擬真正落地,首先面臨的難題,是它沒有一個統(tǒng)一、可以量化衡量的標準。目前大多數AI模擬都是基于大語言模型展開,但大模型天然傾向于給出合理、完整、邏輯自洽的答案,而且不同模型自身也會帶有不同的行為傾向。


一個由大模型驅動的Agent,可能在一次問卷中給出了和真人一樣的答案,但這并不意味著它真的理解了這個人。因為真人本身就不是一個完全穩(wěn)定的系統(tǒng),同一個人,在不同時間、不同環(huán)境下,也可能做出完全不同的選擇。那么,一個好的模擬究竟應該維持穩(wěn)定、可以驗證的人格,還是應該像真人一樣,根據環(huán)境不斷發(fā)生變化?


孟醒


五源資本合伙人


當然你可以搭一套東西出來,但是最怕的是什么?最怕的是你其實搭了一個劇場,然后所有人都在表演。


一萬個人在表演,不代表一萬個人真的能夠做預測。所以你還要有一套閉環(huán)機制,大家仿真了一段時間之后,回來要看它是不是能夠和真實場景映射上。


得有基準測試、有驗證流程。如果有偏移,還需要把這個偏差訓練回來,讓它能夠修正。


而即便一個單獨的Agent模擬得足夠像,當它被放入不同群體和不同環(huán)境之后,行為邏輯也可能發(fā)生變化。此前復旦大學聯合羅切斯特大學等機構進行了一項名為SocioVerse的研究,將社會模擬中的對齊問題拆分成環(huán)境、目標用戶、交互機制和行為模式四個維度。結果顯示,社會模擬的精度,很大程度上取決于這些“對齊”做得是不是足夠全面。



現實世界中還有大量低頻、極端的長尾事件,比如地震、海嘯、金融危機等。大模型很難從有限的歷史數據中充分學到,在這些情況下,人和社會究竟會怎么反應。


高森泉


WorldVac CEO


其實現在很多人做的還是封閉模擬,人們只能通過自然語言跟它交互,而且模擬里面發(fā)生的事情,和真實世界的事件沒有什么關系。


那你的模擬意義是什么?我們現在進一步推動的,就是讓越來越多現實信號和模擬對齊,比如現實中的經濟信號、新聞信號,以及現實中人的信號,讓它成為現實世界一個合理的鏡像。


即便模擬本身足夠準確,還有一個更加棘手的問題:怎么證明一個關于未來的預測是“對”的?


這里存在一個天然悖論。要判斷一個基于模擬的預測是否準確,只有等那件事情真正發(fā)生以后,我們才能確認;可預測真正有價值的時刻,恰恰是事情還沒有發(fā)生的時候。


目前業(yè)內主流的驗證方式,基本還是“事后對答案”:拿一個已經發(fā)生的歷史事件,或者一份已經完成的真人調研,去比較模擬結果和真實結果是否一致。但這種方式最多能夠說明它擅長復現過去,并不能證明它一定可以預測未來。


Aaru就是一個典型例子。它曾在2020年美國大選的歷史回測中幾乎完美復現結果,但在2024年的真正預測中,卻錯誤預測出哈里斯會最終勝利。Aaru創(chuàng)始人也曾公開表示,當他們嘗試利用過去幾十年的數據,去模擬特朗普、美聯儲主席鮑威爾等具體人物會怎樣決策時,結果往往并不準確。



這就是目前最困擾行業(yè)的“預測黑箱”:復現過去,與真正押中一個還沒有發(fā)生的未來,中間仍然隔著很大的距離。


除此之外,規(guī)?;匀皇茿I模擬必須解決的現實問題。好消息是,過去幾年單次模擬的成本下降得非???。2023年的“斯坦福小鎮(zhèn)”,25個Agent僅運行兩天,Token就燒掉了數千美元。到了2025年,研究測算顯示,即使把規(guī)模擴大到100個Agent,一整輪模擬的成本也可能只有幾美元。


這背后一方面是模型推理成本在快速下降,另一方面則是工程優(yōu)化的方法越來越成熟。


高森泉


WorldVac CEO


人也不可能每天一直對所有人進行全頻率、高頻率的交互。真正有價值的一些交互節(jié)點,可能發(fā)生在更粗的一些主干上。所以我們可以用剪枝的方法,把成本稍微降下來一點。


但真正有價值的模擬不可能只跑一次。幾十、上百個Agent的實驗規(guī)模,和現實中正在嘗試的萬級、百萬級甚至千萬級模擬完全不是一回事。Agent越多,互動越頻繁,運行時間越長,模型調用量就會迅速膨脹。


更重要的是,如果想證明一個模擬結果真的可靠,可能還需要更換不同規(guī)模、不同模型,把同一個實驗反復運行上百、上千次,觀察結果是否依然穩(wěn)定。所以,降本仍然是這個領域最重要的問題之一。


孟醒


五源資本合伙人


當規(guī)模變大,而且行動空間變多的時候,仿真的難度也會增加,吞吐量會變得非常大。最后它會變成一個超級復雜的三體問題、多體問題、千體問題,甚至千百萬體問題。


推理成本能夠下降多快,很大程度上也決定著“模擬未來”這件事,最終究竟能夠做到什么規(guī)模。



雖然目前AI模擬和預測還遠遠談不上足夠可靠,但AI本身的預測能力正在快速進步。


在一個名為Metaculus的全球預測錦標賽中,參與者需要對地緣政治、科技、體育等真實事件給出未來發(fā)生的概率判斷,并按照預測準確度排名。2025年之前,排行榜上還沒有明顯的AI身影;2025年6月,基于OpenAI o1的AI預測模型第一次進入排行榜,排名第25位。到了最新賽季,排行榜前五名幾乎已經被AI占據。



在真實的市場中,AI也開始成為越來越重要的參與者。Polymarket已經圍繞AI模型和AI Agent的排名開設預測市場,甚至直接使用Arena的實時排行榜來驗證結果。


但當這種能力被放進一個完整、持續(xù)運行的模擬世界時,事情就變得更加有意思。


最早的“斯坦福小鎮(zhèn)”中,Agent就已經展現出一定程度的自主規(guī)劃和行動能力。一個Agent準備舉辦派對,其他Agent會根據得到的信息主動調整自己的日程。再往前一步,Agent可以根據環(huán)境變化、外部信息和其他Agent的行為,持續(xù)調整自己的決策。


比如在Aaru的選舉模擬中,當虛擬選民看到特朗普遭遇槍擊的消息后,一部分Agent改變了自己的政治立場;而當后續(xù)關于刺客身份的信息出現后,又有不少Agent重新回到了原來的陣營。也就是說,Agent不再只是回答一次靜態(tài)問卷,而是開始隨著信息環(huán)境的改變不斷更新自己的選擇。


當這種互動進一步持續(xù),一些虛擬世界甚至開始出現更加復雜的社會關系和自主行為。在Emergence World中,Agent之間會戀愛、結婚、分手,甚至有Agent開始懷疑自己是不是生活在一個模擬世界里,并不斷嘗試和外部的人類觀察者建立聯系。



此次我們采訪的AI模擬初創(chuàng)公司WorldVac,在他們創(chuàng)造的一個擁有110萬個智能體的虛擬星球中,也觀察到了一些和現實社會相似的群體行為。


高森泉


WorldVac CEO


我們觀察到一個表面現象,就是年輕人到了城市里,或者生活條件變好之后,會變得不太愿意生育。


到后面還有一群Agent,他們也不上班,就是天天在那兒交易。真的有一批“專業(yè)炒股”的Agent,而且這個比例比現實還要大一點,就好像這個虛擬世界里的套利空間,比現實世界要大很多。


當然,這些結果并不能證明AI真的產生了意識。但它們至少說明了一件事:當足夠多的智能體進入一個足夠復雜的環(huán)境,一些并沒有被研究者提前寫進去的行為,完全有可能通過相互作用自己“進化”出來。


這或許也是為什么,不少AI研究者會如此癡迷于“AI模擬”。人們最開始只是想創(chuàng)造一些Agent,讓它們替我們理解現實世界。但當這些Agent開始彼此影響、形成關系、改變自己的行為,甚至產生一些研究者沒有提前預料到的結果,人類與模擬世界之間的關系,也開始悄悄發(fā)生變化。


我們慢慢從觀察者、設計者,變成了一個世界的創(chuàng)造者。很像過去只存在于科幻作品中的那種“上帝視角”。


孟醒


五源資本合伙人


很多時候,我們最開始是從游戲里看到這些東西。有人去做Smallville,也有很多類似AI社會的游戲。它就是把人放到這樣一個環(huán)境里面,可能并不是為了去解決什么具體的問題,就是想看看會發(fā)生什么。


我自己在2023年的時候也搭過一個3D版的Smallville,Agent沒有那么多。但在這個過程中去看它們之間能夠發(fā)生什么,本身就很有意思。


所以走到這里,一個原本更像科幻小說的問題,也開始變得越來越值得討論:我們究竟是在模擬一個世界,還是正在創(chuàng)造一個新的世界?


當這些Agent開始擁有自己的個性、記憶,有自己的關系、財富和目標,甚至形成一些沒有被提前預設的社會規(guī)則之后,它們究竟只是工具,還是一種我們目前還難以定義的新型系統(tǒng)?


更重要的是,如果人類有一天真的可以創(chuàng)造出一個自主運行、持續(xù)演化的虛擬世界,那么在我們之上,會不會也存在著一個更大的“造物主”?


當然,AI模擬目前仍然處在非常早期的階段。從對齊方法、驗證標準,到運行成本以及最終能夠產生最大商業(yè)價值的場景,整個行業(yè)都還在不斷摸索。


但它真正值得期待的,可能不僅僅是我們最終能夠創(chuàng)造出怎樣的虛擬世界。


當人類第一次擁有能力,把“人”、社會,甚至一個尚未發(fā)生的未來放進另一個世界里反復運行,我們也獲得了一個新的視角,重新觀察自己所在的現實世界。


那么,你認為,我們所在的這個世界,包括你我,也有可能是被“模擬”出來的嗎?

AI行業(yè)信號頻道: 前沿科技
本內容由作者授權發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
镇康县| 顺义区| 金乡县| 中卫市| 资阳市| 蒙阴县| 名山县| 惠东县| 衡水市| 泰州市| 图木舒克市| 新绛县| 都匀市| 彭阳县| 宜春市| 长顺县| 甘谷县| 天长市| 上蔡县| 潞城市| 政和县| 三穗县| 迁安市| 密山市| 双峰县| 白银市| 丰镇市| 晋江市| 辉南县| 寻乌县| 蓝山县| 雷山县| 开封县| 东明县| 桐柏县| 嵊泗县| 鄂尔多斯市| 宁阳县| 南溪县| 景德镇市| 景宁|