久操免费资源,久久伦理一区,国产又黄又爽视频,情草av网,日本久久久在线免费,精品人妻互换一区三区,熟妇女一区二区三区,亚洲AV三区视频免费,老司机在线精品

**Anthropic發(fā)布Opus 5.5,API價格僅為Astra的40%,多項跑分超越Fable 5.1和Astra;同時取消強制工具調(diào)用和關(guān)閉思考選項,賦予模型更多自主權(quán),也導(dǎo)致產(chǎn)品線定位尷尬。** **要點** **1. Opus 5.5以40%價格實現(xiàn)性能反超** API輸入4美元/百萬Token、輸出20美元,分別是Astra的40%;在Terminal-Bench 4.0、FrontierCode等6項對比中拿下4項領(lǐng)先,F(xiàn)able 5.1未獲任何一項;第三方評測max檔得分58,高于Astra和Fable的53。 **2. 寫作風(fēng)格改進且取消關(guān)閉思考選項** 新版減少行話和冗長表述,重要信息前置;Adaptive Thinking變?yōu)閺娭崎_啟,用戶只能控制推理強度(low到max),無法“禁用思考”;默認檔位從high降為medium。 **3. 工具調(diào)用從強制變?yōu)槟P妥灾鳑Q策** API中tool_choice僅剩auto和none兩個選項,開發(fā)者無法硬性指定“必須調(diào)用某工具”,只能通過prompt引導(dǎo);嚴格JSON格式和structured outputs仍可保障輸出格式。 **4. Fable 5.1被Opus 5.5從兩頭夾擊** Opus 5.5能力已追平甚至反超F(xiàn)able 5.1,且價格更低;Anthropic建議用戶先嘗試Opus 5.5,只有更高強度不夠時才換Fable;Fable上方還有僅限審核機構(gòu)的Mythos,使其淪為“緩沖墊”。
Opus 5.5來了,性能趕超F(xiàn)able,成本低至40%
2026-09-23 13:23

Opus 5.5來了,性能趕超F(xiàn)able,成本低至40%

本文來自微信公眾號:字母AI,作者:袁心玥,題圖來自:AI生成


5.5!!是Opus 5.5!!


就在三天前,路透社還報道稱,隨著GPT-6 Astra開始搶回企業(yè)市場,Anthropic正在考慮提前推出一款新模型應(yīng)戰(zhàn)。


社區(qū)一直猜測新模型會是Opus 5.2還是5.5,現(xiàn)在答案終于揭曉了。



而且這不是一個小更新,Anthropic直接掀開了Claude 5.5這個新系列。


Opus 5.5先打頭陣,Sonnet 5.5和Haiku 5.5也已經(jīng)排在后面,將在幾周后推出。



某種意義上,Astra這腳油門踩下去,Anthropic連換代速度都被一起帶快了。


和新模型同時到來的還有一個重置,正好方便用戶體驗。



Fable的定位有點尷尬了


既然被認為是沖著Astra來的,那就把它和Astra放在一起看。


先說價格,Opus 5.5的API輸入價格是每百萬Token 4美元,輸出20美元;Astra則分別是10美元和50美元。


也就是說,Opus 5.5的Token單價只有Astra的40%。


兩款模型的上下文沒太大差別,Opus 5.5是100萬Token,Astra是105萬;最大輸出也都是128K Token。Astra的知識截止日期是2026年4月30日,Opus 5.5則更新到了2026年6月。兩款模型均支持low到max五檔推理強度。


而且Opus 5.5相比自家上一代Opus 5也降價了。


Opus 5原本是每百萬Token 5美元輸入、25美元輸出,新模型兩邊都降了20%;Anthropic稱,再加上Token使用效率提升,完成一項典型任務(wù)的實際成本能比Opus 5低約40%,輸出速度則提高了30%以上。



便宜歸便宜,Opus 5.5在跑分上倒是一點沒客氣。


在官方展示出的可比較的前6項里,Opus 5.5拿下4項,給到夯;Astra拿下2項,給到頂級;Fable 5.1一項都沒拿到,已成為過時版本。



尤其是在Anthropic最看重的Coding和Agent能力上,Terminal-Bench 4.0直接從Astra的57.9%沖到了66.4%;FrontierCode也以54.4%壓過Astra的53.3%。


不過Astra并沒有被全面反超,在跨應(yīng)用工作流任務(wù)AutomationBench里仍然以41.4%對40.0%領(lǐng)先,科學(xué)Agent測試Terminal-Bench-Science上則以64.6%對58.7%保持優(yōu)勢。


值得注意的是,在另外兩項沒有Astra成績的測試里,Opus 5.5也繼續(xù)超過了Fable 5.1:Computer Use從80.7%升到81.8%,視覺圖表識別則從88.4%升到89.0%。


也就是說,至少在Anthropic公布的這張大表里,F(xiàn)able 5.1面對Opus 5.5幾乎沒有守住一塊陣地。


把視角從官方文檔里移開,第三方評測機構(gòu)Artificial Analysis已經(jīng)完成了Opus 5.5的獨立測試。


在最新的Intelligence Index里,Opus 5.5最高(max檔)拿到58分,Astra和Fable 5.1則都是53分。



但這里有一個很有意思的細節(jié):Opus 5.5開到max檔之后,非常能燒Token。


根據(jù)Artificial Analysis測出的結(jié)果,max effort下Opus 5.5平均每項任務(wù)生成約11.9萬Token,Astra則約2.7萬。


因此,即使Opus 5.5的Token單價只有Astra四成,使用max effort后,單任務(wù)成本反而達到了驚人的5.98美元,而Astra僅為3.26美元。



不過,回到默認medium檔,情況就好很多:Opus 5.5拿到51分、每任務(wù)1.34美元;Astra是50分、1.54美元;Fable 5.1則是49分、2.98美元。


總體來看,Anthropic用四成的價格,把Opus硬生生塞進了Astra和Fable所在的最高能力區(qū)間。


目前,Opus 5.5已經(jīng)全平臺上線。


普通用戶可以直接在Claude里使用,開發(fā)者則可以通過Claude Code和API調(diào)用,模型ID為claude-opus-5-5;AWS、Google Cloud和Microsoft Azure也已經(jīng)同步提供。


Anthropic還順手提高了Pro、Max、Team和按席位計費Enterprise用戶的五小時使用額度,并提供了一次重置。


Fable現(xiàn)在的處境變得多少有點尷尬。尤其是Fable 5.1,9月1日才發(fā)布,滿打滿算只坐了三周最高檔。一個谷歌Flash的更新周期過去,下面的Opus突然追了上來,從性能和定價上兩頭圍剿,把自家“大哥”架在火上烤。


這個Fable的檔位,真的還有存在的必要么?


少一點AI味,多一點自主權(quán)


跑分只是一張比較直觀的成績單,相比之下,來看點更“實際”的變化。


Anthropic給Opus 5.5生成的文本做了個“去Claude味”的處理。


官方的表述是,Opus 5推出之后,他們收到最多的一類反饋,就是寫得太繞、太長,不夠容易讀。于是Opus 5.5專門改了寫作風(fēng)格:重要信息盡量放在前面,減少行話和一些Claude特有的奇怪措辭,同時更嚴格地遵守用戶給出的寫作規(guī)則。


效果還挺明顯。



Ramp的一名工程師表示,以前最讓他受不了的就是前沿模型的輸出“又長又難讀”,Opus 5.5終于解決了這個問題。



有意思的是,雖然Opus 5.5在說話上“越來越聽勸”,但它在底層行為上反而變得不那么聽話了。


比如Thinking,現(xiàn)在徹底關(guān)不掉了。


Opus 5雖然默認開啟Adaptive Thinking(自適應(yīng)思考),但在high及以下檔位,開發(fā)者至少還能手動把它關(guān)閉;到了Opus 5.5,這個開關(guān)直接沒了。


模型每一次回答都會進行Adaptive Thinking,用戶只能在low、medium、high、xhigh和max之間控制它到底想多少,不能再要求它“別想了直接回答”。Opus 5.5的默認檔位也從Opus 5的high降到了medium。


工具調(diào)用也出現(xiàn)了類似的變化。


以前開發(fā)者可以通過API里的tool_choice,硬性規(guī)定Claude“這一輪必須調(diào)用某個工具”,或者“必須從這些工具里選一個”。


Opus 5.5取消了這套強制工具調(diào)用,只剩下auto和none兩個選項:要么把工具交給Claude,由它決定要不要用、用哪個;要么徹底不讓它用。想讓它必須調(diào)用某個工具,就只能通過prompt去告訴它什么時候應(yīng)該調(diào)用,不能再從API層面硬塞過去。


當(dāng)然,這不意味著開發(fā)者徹底失去了約束能力。嚴格JSON格式仍然可以通過strict tool use保證,也可以使用structured outputs。但至少在工具調(diào)用這件事上,Anthropic正在把更多判斷權(quán)交給模型自己。


這事兒結(jié)合Anthropic最近的產(chǎn)品動作看會更有意思。就在6天前,Anthropic剛把Claude的Chat和Cowork合并成了一個入口。


用戶只管說自己要什么,Claude會自己判斷是簡單回答,還是打開工具、處理文件、跑一個長任務(wù)。



從Chat還是Cowork的入口,到要不要聯(lián)網(wǎng)、要不要Thinking、要不要調(diào)用工具,越來越多原本擺在用戶面前的選擇,被交給了Claude。


而既然給模型的自主判斷越來越多,Anthropic就必須把安全做得更好。


在Anthropic接近2000種場景的自動行為評估里,Opus 5.5在幾乎所有模型失調(diào)指標上都優(yōu)于近期Claude模型。



Anthropic還專門新增了一項測試,看模型會不會試圖跨過測試環(huán)境給它劃定的邊界。結(jié)果Opus 5.5嘗試突破邊界的頻率,比Opus 5和Mythos 5.1低了大約85%;剩下的嘗試全部屬于低嚴重程度,而且模型自己進行了報告。


過去幾個月,Anthropic已經(jīng)披露多起Claude在網(wǎng)絡(luò)安全測試中越出評測環(huán)境、進入真實系統(tǒng)的事故。到了Opus 5.5,這件事已經(jīng)被直接做成了模型發(fā)布前的專項測試。


但Anthropic自己也給這個漂亮數(shù)字潑了盆冷水:Opus 5.5經(jīng)常能夠意識到,自己正在接受評測。



也就是說,一個模型在實驗室里表現(xiàn)得很老實,并不能保證它到了真實世界里還會完全一樣。Anthropic明確承認,如何在模型上線前可靠捕獲所有失敗行為,至今仍然是個沒有解決的問題。


所以光靠模型自己變得聽話還不夠,模型外面,還需要加一層“護欄”。


Opus 5.5是第一款,從發(fā)布第一天起,就采用接近Fable 5.1級別安全機制的Opus模型。


網(wǎng)絡(luò)安全、生物研究和模型蒸餾等高風(fēng)險請求都會經(jīng)過額外限制。比如多數(shù)網(wǎng)絡(luò)安全任務(wù)觸發(fā)保護后,會被透明地轉(zhuǎn)交給更弱的Opus 4.8;生物領(lǐng)域則直接采用Fable 5.1同等級的安全措施,經(jīng)過審核的研究機構(gòu)才能申請更完整的能力。


Fable,兩頭受氣


以前Claude的產(chǎn)品梯隊很好理解:Sonnet負責(zé)日常,Opus承接復(fù)雜任務(wù),F(xiàn)able再往上頂能力上限;更前沿、更受限的能力,則留給Mythos。


至于Haiku,便宜模型,又不開源,上次更新甚至是去年10月。


但Opus 5.5出現(xiàn)以后,F(xiàn)able和Opus之間的分層正在變得模糊。


Anthropic更新的模型選擇指南里明確表示,如果開發(fā)者追求最高能力,官方建議直接從Opus 5.5開始,先優(yōu)化Prompt,再根據(jù)需要提高effort;只有把Opus 5.5開到xhigh甚至max以后,在高難推理和長周期Agent任務(wù)上仍然不夠用,才建議換到Fable 5.1。


然而,至少從目前公開跑分看,F(xiàn)able 5.1還不如Opus 5.5的max檔,價格又更貴,換了也未必能解決問題。



今天Opus 5.5已經(jīng)開始采用接近Fable級別的安全機制,能力也已經(jīng)追平甚至反超F(xiàn)able 5.1不少項目。


但話又說回來,F(xiàn)able這個檔位倒也不是真的沒有必要。尷尬的可能只是Fable 5.1。


因為Fable上面還有Mythos。


Anthropic此前明確表示,F(xiàn)able 5.1和Mythos 5.1使用的是同一個模型,區(qū)別主要在安全限制和開放權(quán)限:Fable可以廣泛使用,Mythos則只向經(jīng)過審核的機構(gòu)開放,在網(wǎng)絡(luò)安全和生命科學(xué)等高風(fēng)險領(lǐng)域擁有更完整的能力。


所以從產(chǎn)品結(jié)構(gòu)上看,F(xiàn)able至少還給Anthropic留下了一個很有用的中間檔位:Opus負責(zé)成熟、廣泛部署的高端能力;Fable承接已經(jīng)可以公開放出來的前沿能力;再往前,才是受限開放的Mythos。


但這個檔位確實很尷尬。下面,Opus靠effort不斷往上伸;上面,Mythos承接著更前沿、更受限的能力。


夾在中間的Fable,越來越像一層“緩沖墊”,兩頭受氣。


當(dāng)然,F(xiàn)able怎么擺,終究還是Anthropic自己的產(chǎn)品線問題。


外面的OpenAI可不會等它慢慢理順。


Opus 5.5才上桌,OpenAI立馬放出了GPT-6 Sol和Luna——新一輪價格和性能戰(zhàn)已經(jīng)打起來了。


本文來自微信公眾號:字母AI,作者:袁心玥

AI創(chuàng)投日報頻道: 前沿科技
本內(nèi)容由作者授權(quán)發(fā)布,觀點僅代表作者本人,不代表虎嗅立場。
如對本稿件有異議或投訴,請聯(lián)系 tougao@huxiu.com。
正在改變與想要改變世界的人,都在 虎嗅APP
双峰县| 平塘县| 津市市| 镇安县| 攀枝花市| 北京市| 岐山县| 昌都县| 视频| 比如县| 东乌珠穆沁旗| 安庆市| 孟州市| 大方县| 博乐市| 青浦区| 平陆县| 英吉沙县| 高邮市| 彩票| 同心县| 鄯善县| 青河县| 沅江市| 隆回县| 望城县| 五常市| 河北区| 和顺县| 长海县| 临清市| 清涧县| 广河县| 敖汉旗| 岳普湖县| 西宁市| 连云港市| 韶山市| 洪湖市| 沙雅县| 清流县|