久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**2026年解封的法庭文件顯示,OpenAI與微軟等AI公司大規(guī)模抓取人類版權(quán)內(nèi)容訓練模型,引發(fā)“死亡循環(huán)”式商業(yè)模式崩塌;同時AI開始自我訓練,但合成數(shù)據(jù)會導(dǎo)致模型崩潰,人類數(shù)據(jù)仍是最后10%-30%的關(guān)鍵“飼料”。** **要點** **1. 內(nèi)部文件證實AI公司大規(guī)模數(shù)據(jù)盜竊** 微軟內(nèi)部備忘錄將用全網(wǎng)內(nèi)容訓練大模型稱為“人類歷史上最大勞動盜竊”,OpenAI研究員承認繞過付費墻抓取新聞,并刻意刪除版權(quán)聲明;僅《紐約時報》一家就被抓取390萬份文檔。 **2. 數(shù)據(jù)采集直接沖擊內(nèi)容生產(chǎn)者生存** 微軟測算顯示,Copilot上線后《紐約時報》點擊率下降93%,內(nèi)部稱此現(xiàn)象為“死亡循環(huán)”,ChatGPT產(chǎn)品對出版機構(gòu)構(gòu)成“生存威脅”且替代性越來越強。 **3. 多家公司陷入人臉數(shù)據(jù)與員工數(shù)據(jù)訴訟** Meta因抓取用戶照片訓練人臉識別和生成式模型面臨集體訴訟,此前已賠款超7億美元;Meta還曾監(jiān)控員工鼠標鍵盤輸入以訓練AI,后因泄露敏感信息暫停。 **4. AI開始自我訓練但面臨數(shù)據(jù)塌縮** Anthropic超80%代碼由Claude編寫,OpenAI用強模型自主訓練弱模型。但《自然》論文指出,純合成數(shù)據(jù)訓練會導(dǎo)致模型“坍縮”,多樣性喪失,必須疊加10%-30%人類數(shù)據(jù)。 **5. 人類數(shù)據(jù)倒計時:AI閉環(huán)即將完成** 行業(yè)配方為10%-30%人類數(shù)據(jù)打底,其余由AI自產(chǎn)自喂;一旦合成數(shù)據(jù)質(zhì)量穩(wěn)定,采集人類數(shù)據(jù)的必要性將徹底消失。
當“AI飼料”,我都被AI嫌棄了?
2026-09-29 17:21

當“AI飼料”,我都被AI嫌棄了?

本文來自微信公眾號:字母AI,作者:苗正,編輯:王靖,題圖來自:AI生成


2026年9月18日,紐約南區(qū)聯(lián)邦法院解封了一批文件,里面包含了OpenAI和微軟的內(nèi)部記錄。


材料顯示,OpenAI和微軟通過采集別人生產(chǎn)的內(nèi)容,訓練自己的模型。


但這并不是個例,我們在網(wǎng)上記錄的點點滴滴,如今正逐漸變成AI的“飼料”。


AI不會給你點贊、收藏或者轉(zhuǎn)發(fā),因為它壓根不理解你創(chuàng)作的內(nèi)容,只是把你留下的一切收進去,變成它自己的一部分。


于是寫作、繪畫、說話、歌唱、拍照,這些原本屬于人的事,忽然變成了AI發(fā)展的核心。


但是你也不必太擔心,有一個不知道是好是壞的消息,未來AI不會再把我們當成飼料了,因為它馬上學會自己造飼料。


一、事件來龍去脈


2026年9月17日,紐約南區(qū)聯(lián)邦法院解封了一批文件。這批文件來自《紐約時報》起訴OpenAI和微軟的版權(quán)案,內(nèi)容是兩家公司的內(nèi)部記錄。


在一份內(nèi)部備忘錄里,微軟應(yīng)用科學總監(jiān)布倫特·赫克特(Brent Hecht)把用全網(wǎng)內(nèi)容訓練大模型稱為“一場規(guī)模前所未有的驚人盜竊”,并說這很可能是“人類歷史上最大的一次勞動盜竊”。這句話出自被告公司的員工,不是原告的指控。


這起官司已經(jīng)打了將近三年。


原告是《紐約時報》,被告是OpenAI和微軟。此前庭審的走向總體上支持“用版權(quán)內(nèi)容訓練模型屬于合理使用”。這批解封材料的不同之處,在于它提供的是被告自己的內(nèi)部記錄,而不是法律論證。


微軟的內(nèi)部測算顯示,Copilot上線后,《紐約時報》域名的點擊率相比傳統(tǒng)Bing搜索最多下降93%。


在內(nèi)部演示文稿中,赫克特把這種下滑稱為“死亡循環(huán)”,認為它“會同時傷害我們模型的表現(xiàn),也會傷害整個互聯(lián)網(wǎng)”。


他還寫道,一個終端產(chǎn)品威脅到自己關(guān)鍵供應(yīng)商的經(jīng)濟根基,這種情況極不尋常,但這是模型業(yè)務(wù)和它的“內(nèi)容供應(yīng)鏈”造成的局面。文稿中的“供應(yīng)商”,指的就是生產(chǎn)內(nèi)容的新聞媒體。


ChatGPT負責人尼克·特利(Nick Turley)在內(nèi)部溝通中說,ChatGPT這類產(chǎn)品對出版機構(gòu)構(gòu)成“生存威脅”,而且“在很大程度上是替代性的”,“隨著它們變得更強,會越來越具有替代性”。


OpenAI總裁布羅克曼說,這些模型“非常擅長新聞”。納德拉在今年作證時承認,和聊天機器人對話“已經(jīng)替代了直接去網(wǎng)站獲取信息”。


然而法律要求不能“替代或損害原作品的市場”。


文件同時還給出了訓練數(shù)據(jù)的規(guī)模。僅OpenAI的訓練數(shù)據(jù)集中,就包含《紐約時報》《每日新聞》和調(diào)查報道中心的作品91692份拷貝。


在一個從Common Crawl派生的數(shù)據(jù)集中,僅nytimes.com一個域名就抓取了兩百多萬份文檔。不過其他媒體表示,從《紐約時報》抓取390萬份,從《芝加哥論壇》報及其相關(guān)報刊抓取730萬份。


此外還有一個名為Project Mango的項目,其數(shù)據(jù)集包含至少160903部新聞出版方的獨立作品。OpenAI把整個GPT-3訓練數(shù)據(jù)集交給了微軟,微軟則通過Project Taxi和Project Mango把數(shù)據(jù)回輸給OpenAI。


文件中還記錄了具體操作方式。


OpenAI研究員尼克·賴德(Nick Ryder)告訴布羅克曼,自己有一個“繞過紐約時報付費墻的黑客方法”,布羅克曼回復(fù)“不錯”。


兩人搭建的數(shù)據(jù)集WebText、WebText2,有相當大一部分是從網(wǎng)上直接抓來的新聞報道。還從Common Crawl拉取了數(shù)百萬篇文章。


此外,在數(shù)據(jù)進入模型前,他們會刻意刪除版權(quán)聲明,因為研究人員“不想讓模型向用戶輸出‘版權(quán)聲明’”。


原告代理律師史蒂文·利伯曼(Steven Lieberman)說,證據(jù)表明,OpenAI和微軟知道自己在做的事是錯的。


微軟對這批文件回應(yīng)稱,相關(guān)言論只是反映了一名員工的個人觀點,不是法律分析,更不代表公司立場。赫克特并非決策者,公司雇他是為了“呈現(xiàn)不同的、非對稱的視角”。


二、還有誰在喂AI?


實際上OpenAI已經(jīng)是“二進宮”了。


2023年9月,美國作家協(xié)會連同17位作家,如約翰·格里森姆(John Grisham)、喬治·R·R·馬丁(George R. R. Martin)、朱迪·皮考特(Jodi Picoult)、大衛(wèi)·鮑爾達奇(David Baldacci)、喬納森·弗蘭岑(Jonathan Franzen)、斯科特·圖羅(Scott Turow)等人。


在紐約南區(qū)對OpenAI提起集體訴訟。此后,多起作家訴訟(特倫布萊(Tremblay)、西爾弗曼(Silverman)、夏邦(Chabon)等)陸續(xù)并入,原告規(guī)模還在擴大。


《紐約時報》訴狀里的證物J,標題叫《GPT-4 記憶〈紐約時報〉內(nèi)容的一百個例子》,整整 127 頁。喂給它一篇文章的開頭,它能幾乎逐字補完剩下的部分,連署名和引語都在。


2026 年,arXiv上發(fā)布了一篇名為《對齊打地鼠》的論文。


研究者把模型微調(diào)成“按情節(jié)寫全文”——只給情節(jié)摘要,不給原文。結(jié)果GPT-4o、Gemini 2.5 Pro能復(fù)現(xiàn)出85%到90%的版權(quán)書籍原文,單段逐字復(fù)現(xiàn)超過460個詞。研究者給這種現(xiàn)象起了個名字,叫“對齊打地鼠”:你堵住一個漏洞,它在別處又冒出來。


這不是偶然。尼古拉斯·卡爾利尼(Nicholas Carlini)早在 2023 年就說過:模型越大、你那段數(shù)據(jù)被重復(fù)喂的次數(shù)越多、上下文給得越足,它記得就越死。


實際上扒取網(wǎng)上的公開資料,把人們的記錄變成AI飼料的,遠不止于OpenAI和微軟。


2026年9月4日,一起集體訴訟遞到了伊利諾伊北區(qū)聯(lián)邦法院。原告是兩個家庭,連同他們的孩子。訴狀指控 Meta 未經(jīng)同意,抓取Facebook和Instagram用戶的照片和生物特征數(shù)據(jù),用來訓練三樣東西:人臉識別系統(tǒng)NameTag 背后的模型、給NameTag做比對用的“人臉指紋”,以及生成式圖像模型Emu和Muse Image。


NameTag是給Ray-Ban和Oakley智能眼鏡準備的。早在2026年6月初,就有人發(fā)現(xiàn)在Meta的配套App里存在NageTag相關(guān)的代碼,只不過當時并不知道這個功能是干什么用的。


Meta的回應(yīng)是:“這起訴訟沒有依據(jù),曲解了我們的工作……NameTag沒有向消費者發(fā)布,也沒有最終決定要做什么。”它還強調(diào),自己“不是在建立一個通用的人臉數(shù)據(jù)庫”。


話雖如此,但Meta已經(jīng)是第三次因為人臉識別被告上法庭了。


2021 年,它因為“自動標記好友”違反伊利諾伊《生物識別信息隱私法》,賠了6.5億美元,約142萬伊利諾伊用戶分錢,有人拿到了400多美元。2023年,Instagram的人臉識別又讓它賠了6850萬美元,約400萬伊利諾伊居民符合資格。Snap也因類似問題在2016年賠了3500萬美元。


這部法律的罰則是每人每項1000到5000美元。


從金額來看,以Meta的用戶規(guī)模,Meta可能要賠付超過10億美元。不過Meta仍然選擇付錢,畢竟相對于賠償而言,法庭并沒有阻止Meta繼續(xù)開發(fā)模型,因此賠償仍在可接受的范圍內(nèi)。


Meta的采集對象,也不只是用戶。


2026年4月21日,Meta在美國員工的工作電腦上安裝一款追蹤軟件,實時記錄鼠標移動、點擊位置和鍵盤輸入,并定期截屏,用來訓練它的AI模型。


這款工具叫“模型能力計劃”(Model Capability Initiative)。Meta首席技術(shù)官安德魯·博斯沃思(Andrew Bosworth)在內(nèi)部備忘錄中說,長期目標是把 AI 智能體培養(yǎng)成“承擔工作”的角色,人類員工則轉(zhuǎn)為“指揮、審查和協(xié)助改進”。


這個項目后來改名為“Agent轉(zhuǎn)型加速器”。Meta的發(fā)言人稱,這些數(shù)據(jù)只用于訓練模型,不用于績效考核,并設(shè)有保護敏感內(nèi)容的措施。


但據(jù)媒體報道,采集范圍覆蓋員工日常使用的各類應(yīng)用和網(wǎng)站,包括谷歌、GitHub、Slack,甚至個人Gmail;美國員工無法退出,只有受歐盟《通用數(shù)據(jù)保護條例》約束的歐洲員工被排除在外。


同一周,Meta裁掉約8000名員工,不少員工因此擔心,自己正在親手訓練將來取代自己的AI。到2026年6月,Meta暫停了這項計劃,原因是追蹤工具抓取到了敏感信息,且這些信息一度被全公司訪問。


Meta的手,也不只伸向自家平臺。


Meta專門有個用來扒視頻內(nèi)容的爬蟲,名為MSAE。Meta AI自己承認,訓練數(shù)據(jù)里有370萬條YouTube視頻轉(zhuǎn)錄文本的第三方數(shù)據(jù)集。


2026年1月,包括h3h3 Productions、Mr. ShortGame Golf、Golfholics在內(nèi)的幾位YouTube博主,合計620萬訂閱,在加州中區(qū)聯(lián)邦法院起訴Snap,指控它用后端自動化工具,把數(shù)百萬條YouTube視頻的視聽文件成批下載下來,塞進HD-VILA-100M和Panda-70M數(shù)據(jù)集,用來訓練“Imagine Lens”這類的圖像編輯能力。


訴狀沒有走傳統(tǒng)版權(quán)路線,而是主攻《數(shù)字千年版權(quán)法》第1201條的反規(guī)避:YouTube的設(shè)計是讓人在線觀看,不是讓人拿到原始文件,Snap涉嫌在規(guī)?;瘜用妫`反了該法律法規(guī)。


原告之一伊桑·克萊因(Ethan Klein)還順手把英偉達、Meta、字節(jié)跳動、亞馬遜、OpenAI、蘋果一并告了。他的說法是,這些公司“一天能抓走80年的內(nèi)容”。


搜索是谷歌的核心業(yè)務(wù),因此谷歌也在名單上。


2026年7月,阿歇特出版集團、Cengage、愛思唯爾,連同暢銷書作家斯科特·圖羅,在紐約把谷歌告了,指控它用數(shù)百萬本版權(quán)書籍訓練Gemini。訴狀稱,谷歌從“已知的盜版來源”抓內(nèi)容,甚至繞過學術(shù)網(wǎng)站的付費墻,去拿愛思唯爾旗下《柳葉刀》、《細胞》的文章。


訴狀稱:Gemini可以在20分鐘內(nèi),用0.39美元,生成一部10萬字的懸疑小說。谷歌內(nèi)部文件也警告過,這么做可能“給谷歌帶來100億到1000億美元的潛在罰款”。


語音和音樂,也沒能幸免。


蘋果的Siri,把“意外喚醒”時的錄音交給外包合同工去聽。據(jù)外媒報道,里面充斥著醫(yī)生和病人的對話、商業(yè)談判、疑似犯罪交易。有評估員一天要聽多達1000條。蘋果最終以9500萬美元和解。


2024年6月,RIAA代表環(huán)球、索尼、華納,把AI音樂公司Suno和Udio告了,指控它們用受版權(quán)保護的錄音。


三、最后一批飼料


不過我們也不需要擔心什么,因為我們即將成為AI的最后一批飼料。如今,AI公司,已經(jīng)開始自己喂自己了。


2026年6月,Anthropic發(fā)了一篇博客,標題叫《當AI建造自己》。里面提到,截至2026年5月,合并進Anthropic生產(chǎn)代碼庫的代碼,超過80%是Claude寫的,不是人寫的。在那之前,這個比例還只是個位數(shù)。


也就是說,15個月里,這家公司把絕大部分編程工作交了出去。有工程師已經(jīng)五個月沒寫過一行代碼;他們每天合并的代碼量,是幾年前的8倍。


2026年9月17日,Anthropic又發(fā)布了一份報告,標題是《衡量AI發(fā)展的速度》,這篇文章主要講的是“研發(fā)工作有多少由AI主導(dǎo)”。它采用Epoch AI提出的自動化等級,從完全沒有AI參與的AL0,到AI完全自主的AL5來劃分。


其中AL4指AI能從一句大致的目標出發(fā),端到端完成大部分工作,人類只負責監(jiān)督和最后決策。


文章提到,2026年2月,Anthropic達到AL4這一級別的研發(fā)工作還不到1%。5月是12%,7月是22%,8月已經(jīng)升到26%。


如果把標準放寬到“AI在人的密切指導(dǎo)下完成大塊工作”的AL3,則有超過90%的研發(fā)工作達標。報告還提到Anthropic內(nèi)部最主要的Agent平臺上,任意時刻約有3萬個AI Agent在從事研究和工程工作,僅在2026年8月就產(chǎn)生了超過10億次決策。


OpenAI那邊,走的是另一條路。


2026年7月,OpenAI披露,發(fā)布GPT-5.6時,它用最強的Sol模型,去自主“后訓練”了一個更小的模型Luna。研究員只給了一句“相當不充分的提示”,Sol就自己找訓練配置、挑GPU、啟動訓練腳本、驗證運行,還順帶生成了合成訓練數(shù)據(jù)。


這項工作,過去要兩個資深研究員做兩周。在OpenAI內(nèi)部的“遞歸自我改進指數(shù)”上,Sol比上一代GPT-5.5高出16.2分。


Anthropic把這件事叫遞歸自我改進。它的本質(zhì),是訓練數(shù)據(jù)的來源,正在從“人類生產(chǎn)的內(nèi)容”,切換成“AI 自己生成的內(nèi)容”。


而你,就是這次切換完成之前的,最后一茬人類飼料。


問題是,AI 自己生成的數(shù)據(jù),撐得起下一波模型嗎?


2024年,舒馬伊洛夫(Shumailov)等人在《自然》上發(fā)了一篇論文,標題為《AI模型在遞歸生成數(shù)據(jù)上訓練時會崩潰》。


他們發(fā)現(xiàn),如果反復(fù)用合成數(shù)據(jù)訓練模型,模型會“坍縮”,輸出的多樣性不斷收窄,尾部信息被系統(tǒng)性抹掉,最后變成一種“語法正確、但語義空洞”的狀態(tài)。


論文的結(jié)論是,你不能用合成數(shù)據(jù)完全替代人類數(shù)據(jù),必須兩者疊加。只要原始的人類信號還在,模型就還健康。


所以現(xiàn)在行業(yè)的配方,大概是10%到30%的真實人類數(shù)據(jù)打底,剩下的靠模型自己喂自己。


那10%到30%,就是我們還剩的用處。但很可惜,連這個用處也在倒計時。


一旦合成數(shù)據(jù)的質(zhì)量足夠穩(wěn)定,一旦這個閉環(huán)轉(zhuǎn)得夠順,人類數(shù)據(jù)就再也沒有采集的必要。


本文來自微信公眾號:字母AI,作者:苗正,編輯:王靖

AI行業(yè)信號頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
久治县| 汉川市| 融水| 古浪县| 齐河县| 田林县| 乐陵市| 嘉祥县| 淳安县| 吴桥县| 乌鲁木齐市| 邹城市| 东阳市| 阜康市| 遵化市| 淅川县| 安福县| 瑞金市| 唐河县| 长乐市| 玛纳斯县| 福鼎市| 隆德县| 宿迁市| 时尚| 荔浦县| 韶山市| 霍邱县| 大丰市| 时尚| 蚌埠市| 宜黄县| 临泽县| 鹰潭市| 秦皇岛市| 巴林右旗| 凤冈县| 仪陇县| 邹平县| 崇明县| 宁远县|