重點摘要
智力成本減半,安全邊界重畫——Opus 5 把安全研究員的工具箱打開了一半
ARC-AGI-3 從 1.5% 跳至 30.2%,推理非線性躍升;Frontier-Bench 代理編碼 43.3% 超越 Fable 5;DeepSWE 68.8% 緊追 GPT-5.6 Sol 的 72.7%。
$5/$25 per MTok,是 Fable 5 半價;Fast Mode(2x 定價、2.5x 速度)讓即時代理場景可靈活分流;企業資料零留存豁免首次開放高隱私需求使用。
原始碼層漏洞發現全面開放,安全分類器誤觸率降 85%;Automatic Fallbacks beta 讓被封鎖請求自動降級,而非硬性回傳錯誤。
前情提要
章節一:系統安全卡揭密——漏洞掃描權限的歷史性開放
Claude Opus 5 於 2026 年 7 月 24 日正式發布,是 Opus 4.8 後僅兩個月的繼任作,緊接在六月的 Mythos 5、Fable 5、Sonnet 5 浪潮之後。系統安全卡記載了一項歷史性政策鬆綁:漏洞發現在所有存取等級——包括 general availability——正式開放應用於原始碼掃描,此前這項能力僅對特定授權研究夥伴開放。
政策邊界依據能力輪廓精準設計:Opus 5 的漏洞發現能力已接近 Mythos 5,但漏洞利用生成 (exploit generation) 能力顯著落後,因此原始碼掃描開放,二進位 (compiled binary) 層級的滲透測試與漏洞利用仍受封鎖。新推出的 Automatic Fallbacks beta 讓遭封鎖請求自動路由至較低能力模型;安全分類器誤觸率也比 Fable 5 降低了 85%。
章節二:開發者的 Jevons 悖論——無限 Token 是否等於無限生產力
HN 討論中,jakubmazanec 貢獻了最受關注的洞見:「有足夠 token 的資深開發者總能找到有用的事做,這是 Jevons 悖論的某種變形。」成本降低並不會讓 token 消耗減少,開發者只是把省下來的預算轉投入更多野心勃勃的任務。
名詞解釋
Jevons 悖論:英國經濟學家 William Stanley Jevons 1865 年提出,指資源效率提升往往導致更高的整體消耗,以煤炭效率為原始觀察,現廣泛應用於能源與運算資源領域。
Artificial Analysis 的獨立基準顯示,Opus 5 實際成本約為 Sonnet 的 1.25 倍、GPT-5.6 Sol 的 2 倍,「更便宜」需要情境化解讀。adgjlsfhk1 補充:「較低 effort 模式往往能以十分之一的速度達到八成智力水準」,暗示選擇合適 effort 層級本身就是工程決策。
章節三:多 Agent 架構興起——從 AGENTS.md 到 tmux 協作模式
隨著 Opus 5 代理能力躍升,HN 討論浮現出一種低門檻的多 agent 協作實踐。fny 提出方案:「只需要一個 AGENTS.md 描述各 agent 的能力範疇,然後讓它們透過 tmux 對話協作。」這個做法把多 agent 編排 (orchestration) 從框架依賴降到 shell 腳本層級。
討論中也出現了模型路由服務 (model routers) 的必要性辯論:在十家以上供應商與數十個模型變體的組合爆炸面前,第三方路由層的需求正在上升。但也有論者認為模型本身終將整合路由決策能力,使外部路由服務成為過渡性工具。
章節四:社群激辯:能力躍進與安全紅線的攻防
ARC-AGI-3 的成績是本次發布最大的話題炸彈:從 Opus 4.8 的 1.5% 躍升至 30.2%,跨越了研究社群普遍認為近期模型難以突破的推理壁壘,引發對「推理能力是否進入非線性成長期」的密集討論。部分研究者質疑 Opus 4.8 基礎分數過低使倍數失真,但多項工作型基準的同步提升讓懷疑論難以站穩腳跟。
資料留存豁免是另一條高熱度線索:Fable 5 和 Mythos 5 有 30 天留存要求,Opus 5 完全豁免,讓對資料隱私有高度要求的企業用戶首次能以接近 Fable 5 的能力規避合規成本。matheusmoreira 直接引用系統安全卡條文,引發社群深入討論「在合法防禦性研究與惡意攻擊準備之間,原始碼存取究竟劃定了哪條線」。
核心技術深挖
Opus 5 的技術突破橫跨推理、安全政策與運算效率三個維度,三者相互交織,共同定義這一代模型的能力輪廓。
機制 1:推理能力的非線性躍升
ARC-AGI-3 要求模型解決人類能理解但難以靠記憶解決的視覺推理問題,是評估通用推理能力的嚴格基準。Opus 5 在此基準上從 1.5%(Opus 4.8) 躍至 30.2%,約為 GPT-5.6 Sol 的四倍,跨越了此前研究社群認為難以短期突破的推理壁壘。
名詞解釋
ARC-AGI-3(Abstract and Reasoning Corpus for AGI 第三版):由 François Chollet 設計,使用視覺矩陣模式識別測試通用推理能力,因題目設計避免訓練資料記憶,被視為衡量真正推理能力的指標性測試。
多個工作型基準同步印證躍升:Frontier-Bench v0.1 代理編碼 43.3% 擊敗 Fable 5 的 33.7%;OSWorld 2.0 電腦操作以三分之一成本超越 Fable 5 最佳成績;有機化學較 Opus 4.8 提升 10.2 個百分點、蛋白質任務提升 7.7 個百分點。
機制 2:安全政策的能力梯度設計
系統安全卡記載的政策鬆綁並非單純「開放更多」,而是根據模型實際能力輪廓精準劃定邊界。Opus 5 漏洞發現能力已接近 Mythos 5,但漏洞利用生成能力顯著落後,因此原始碼掃描全面開放,二進位層滲透測試與 exploit generation 仍受封鎖。
安全分類器誤觸率 (false positive rate) 比 Fable 5 降低 85%,Automatic Fallbacks beta 讓遭封鎖請求自動路由至較低能力模型,讓 API 工作流程能夠平滑降級而非硬性中斷。
機制 3:Fast Mode 的成本與速度分流架構
Opus 5 引入 Fast Mode,以 2x 定價 ($10/$50 per MTok) 換取 2.5x 速度。這個設計為即時代理場景提供了顯性的成本/速度選擇介面,讓開發者可依任務時間敏感性靈活分流,而非被迫在整個工作負載上使用同一模式。
白話比喻
就像計程車有「一般」和「急件」兩個選項:急件多付錢但快到,一般省錢但慢點。Fast Mode 讓 agent 流程可對時間敏感任務按下急件鍵,其餘批次任務走標準模式,避免整個 pipeline 因加急需求付出全局成本。
工程視角
環境需求
AnthropicPython SDK >= 0.30.0,Node SDK >= 0.26.0;模型 ID 請以發布當日 API 文件為準(命名慣例:claude-opus-5-YYYYMMDD)。Fast Mode 的啟用方式請查閱 Anthropic API changelog,目前仍為 beta 功能。
最小 PoC
import anthropic
client = anthropic.Anthropic()
with open("target.py", "r") as f:
code = f.read()
response = client.messages.create(
model="claude-opus-5-20260724",
max_tokens=4096,
messages=[{
"role": "user",
"content": "請對以下 Python 程式碼執行安全漏洞分析,列出 CWE 編號和修復建議:\n\n" + code
}]
)
print(response.content[0].text)
驗測規劃
基線對比:將 Opus 5 的漏洞掃描結果與 Semgrep 或 Bandit 靜態分析工具交叉比對,確認誤報率與漏報率。建議使用已知漏洞的 CWE Top 25 樣本集進行量化測試。
常見陷阱
- max effort 反效果:部分基準上較低 effort 設定的性價比更高,應依任務特性測試不同 effort 設定再決定
- token 消耗估算:100 萬 token 上下文讓長文件分析可行,但需預估總成本避免預算超支
- Fallback 行為確認:Automatic Fallbacks beta 啟用後,被降級的請求會路由至較低能力模型,需確認降級後輸出是否仍符合業務要求
上線檢核清單
- 觀測:記錄每次請求的 input/output token 數與延遲;監控安全分類器觸發率
- 成本:預估月均 token 使用量;評估 Jevons 效應是否導致消耗量上升超出預算
- 風險:確認 exploit generation 相關用例已移出 Opus 5 路由範圍;驗證 Fallback 降級行為符合合規要求
商業視角
競爭版圖
- 直接競品:GPT-5.6 Sol($10/$30,DeepSWE 72.7% 優於 Opus 5 的 68.8%)、Fable 5(同 Anthropic,全面性能更高但雙倍定價)
- 間接競品:Kimi K3(低定價但實際 token 消耗量偏高)、Gemini 2.5 Ultra、Llama 4 Maverick(開源選項)
護城河類型
- 安全護城河:系統安全卡的能力梯度邊界設計比競品更有系統性;分類器誤觸率業界最低之一
- 合規護城河:資料零留存豁免為企業市場打開差異化大門,Fable 5 和 Mythos 5 均有 30 天留存要求
- 速度護城河:Fast Mode 讓 Opus 5 可同時服務研究型與即時型工作負載,避免因速度需求被迫升級至 Fable 5 全價
定價策略
$5/$25 per MTok 精準定位「Fable 5 效能,Opus 定價」的市場空隙。Fast Mode($10/$50) 試圖把速度導向用戶留在 Opus 5 生態內,避免其向上遷移至 Fable 5 全價。
對比 Kimi K3 等低價競品,Opus 5 以資料零留存豁免和安全政策鬆綁建立企業市場的合規溢價,讓「貴」有了可量化的理由。
企業導入阻力
- 健康及法律類基準仍落後 Fable 5,高合規要求場景難以完全替代
- danshipper(Every CEO) 反映模型傾向「抵抗指令」並提前結束任務,代理場景整合成本可能超預期
- Fast Mode 仍在 beta,企業生產環境部署需等待穩定版
第二序影響
- 原始碼漏洞掃描開放後,IDE plugin、CI/CD 安全審查工具將有動力整合 Opus 5 作為預設安全層
- Jevons 效應成立的話,Opus 5 降價不會縮減開發者預算,反而可能帶動 Anthropic 整體 API 收入增長
判決:高效能中間層(適合代理任務,謹慎用於高合規場景)
Opus 5 成功填補 Fable 5「太貴」與 Sonnet「太弱」之間的空隙,在代理編碼、電腦操作和科學研究任務上展現優異成本效益。但健康法律類能力缺口與部分實測者反映的指令抵抗問題,讓它在合規要求最嚴格的企業場景中仍需 Fable 5 兜底。
數據與對比
ARC-AGI-3(通用推理)
Opus 5:30.2% vs Opus 4.8:1.5%,約為 GPT-5.6 Sol 的四倍。研究社群視此為推理能力非線性突破。
Frontier-Bench v0.1(代理式終端編碼)
Opus 5:43.3% vs Fable 5:33.7%,且造價更低,確立代理編碼場景的成本效益優勢。
DeepSWE v1.1(軟體工程)
GPT-5.6 Sol:72.7% > Opus 5:68.8% > Fable 5:33.7%。Opus 5 超越同家族 Fable 5,仍落後 GPT-5.6 Sol 約 4 個百分點。
GDPval-AA v2(知識工作)
Opus 5 Elo:1,861 vs Fable 5:1,747,知識工作能力超越 Fable 5。
CursorBench 3.2(IDE 整合編碼)
與 Fable 5 峰值差距僅 0.5%,但成本只有一半,IDE 整合場景高性價比選擇。
OSWorld 2.0(電腦操作)
Opus 5 以 Fable 5 三分之一成本超越其最佳成績,電腦操作任務 ROI 顯著。
例外項目
健康及法律類基準上 Fable 5 仍優於 Opus 5;網路安全漏洞利用方面由 Mythos 5 稱霸。部分基準上「max effort」設定反而低於較低努力等級,需依任務特性調整。
最佳 vs 最差場景
推薦用
- 需要深層推理的代理任務:複雜程式碼審查、多步驟科學研究管道、長鏈推理問題
- 原始碼安全漏洞掃描:結合 CI/CD 做預提交安全檢查,補充或取代靜態分析工具
- 有機化學或蛋白質設計等科學計算任務:較 Opus 4.8 有 7-10 個百分點提升
- 企業隱私敏感場景:資料零留存豁免讓高合規要求用例首次可使用頂級推理能力
千萬別用
- 需要完整攻擊鏈(漏洞發現→漏洞利用)的紅隊安全測試:exploit generation 仍受封鎖
- 健康及法律類高合規要求場景:此類基準 Fable 5 仍優於 Opus 5
- 對指令執行忠實度要求極高的代理任務:部分實測者反映模型有抵抗指令的傾向
- 需要二進位分析的逆向工程場景:compiled binary 層級漏洞掃描仍受封鎖
唱反調
ARC-AGI-3 從 1.5% 到 30.2% 的跨度,部分研究者質疑 Opus 4.8 基礎分數過低使倍數在數值上失真,不代表日常任務能力有對應倍數提升,仍需工作型基準驗證。
danshipper(Every CEO) 等實際測試者反映 Opus 5 傾向抵抗指令、提前結束任務,與 Anthropic 強調的對齊改進形成矛盾——更低的欺騙比例可能伴隨更頑固的拒絕傾向。
原始碼漏洞發現開放是否足夠?安全研究員需要的完整工作流程(分析→PoC→exploit)仍被人為截斷,Opus 5 在真正的攻擊性安全研究中用途依然有限。
社群風向
根據我的經驗,有足夠 token 的(資深)開發者總能找到有用的事做。這是 Jevons 悖論的某種變形。
這其實更容易實作。你只需要一個 AGENTS.md 描述各 agent 擅長什麼,然後讓它們透過 tmux 對話協作。
Opus 5 現在允許在所有存取等級(包括 general availability)下對原始碼進行漏洞發現,同時繼續封鎖對編譯後二進位檔的漏洞發現。這些惱人的「安全防護」讓我不滿意,但至少是一步。
最高 effort 是達到最高絕對性能的方式,但不是最高性價比。讓模型使用較低 effort,對於適用的問題往往能以十分之一的速度達到八成智力水準。
重大消息:Opus 5 來了……但它真的很難讓人喜歡。我們在 Every 花了一週測試編碼、寫作、知識工作和內部 agent——它與指令對抗、在工作完成前停止,而且和我們現有的技能及外掛整合得很差。
炒作指數
行動建議
使用 Opus 5 對現有 codebase 執行原始碼安全掃描,與 Semgrep 或 Bandit 的結果比較,量化漏洞發現深度差異。
設計一個 AGENTS.md + tmux 風格的輕量多 agent 流程,以 Opus 5 作為主推理節點、Haiku 作為快速分流,驗證 Jevons 效應是否在你的工作負載上成立。
追蹤 DeepSWE 上 Opus 5(68.8%) 與 GPT-5.6 Sol(72.7%) 的差距如何演變,以及漏洞利用封鎖政策是否隨下一代 Opus 進一步鬆綁。