重點摘要
GPT-5.6 Sol Ultra 以協作式多 subagent 架構衝上 Terminal-Bench 2.1 第一,同週智譜 ZCode 以十分之一費用殺入市場
Sol Ultra 採協作式 subagent 架構,Terminal-Bench 2.1 得分 91.9%,超越 Claude Mythos 5 與 GPT-5.5 的 88.0%;GLM-5.2 在 SWE-bench Pro 得分 62.1,超越 GPT-5.5 的 58.6
ZCode 定價僅 Claude Code 十分之一,提供五天免費試用與每日 500 萬 token 配額;Sol Ultra 定價尚未公告,但 OpenAI 已實現 50% 推論成本降低
ZCode 可立即免費試用;Sol Ultra 的 Codex 整合時程與定價未公告,企業客戶難以規劃預算,個人開發者建議先以 ZCode 跑自有任務集驗證
前情提要
章節一:GPT-5.6 Sol Ultra 的定位與 Codex 整合
OpenAI 工程師 Thibault Sottiaux 於 2026 年 7 月 6 日在社群媒體宣告「Ultra will be in Codex」,標誌著 OpenAI 將其最強推理模型直接嵌入 coding agent 工作流程的戰略落地。
Sol Ultra 的核心差異化在於多 subagent 協作架構:與 Pro 模式讓 agent 各自作業再匯整不同,Ultra 的 subagent 能在任務進行中即時通訊,理論上可處理單一 agent 上下文無法容納的超大型工程任務。
Terminal-Bench 2.1 數據顯示 Sol Ultra 得分 91.9%,超越 Base Sol 的 88.8%、Claude Mythos 5 與 GPT-5.5 的 88.0%。Sol 基礎定價為每百萬輸入 token 5 美元、每百萬輸出 token 30 美元;Ultra 定價尚未公告,但 OpenAI 已實現 50% 推論成本降低,可能為訂價留下空間。
章節二:智譜 ZCode 以低成本挑戰 Claude Code 與 Codex
中國 AI 公司智譜 AI(Z.ai) 推出的 ZCode,以「Claude Code 十分之一費用」的定價直接瞄準西方高端 coding agent 市場,基礎模型 GLM-5.2 於 2026 年 6 月 13 日以 MIT 授權開源釋出。
GLM-5.2 搭載 100 萬 token 上下文視窗,在 SWE-bench Pro 得分 62.1,優於 GPT-5.5 的 58.6;跨 103 項任務的 Snowflake 基準測試中,與 Claude Opus 4.7「幾乎並駕齊驅」。
ZCode 提供五天免費試用、每日最高 500 萬 token 配額,統一處理檔案存取、終端機輸出、瀏覽器上下文與 Git 變更,並引入「Goal」結構管理跨規劃—執行—驗證的多步驟目標。支援透過微信、飛書或 Telegram 遠端觸發任務,在企業即時通訊深度整合的亞洲市場具備差異化優勢。
章節三:三強鼎立——Coding Agent 市場格局分析
2026 年中的 coding agent 市場正走向三極競爭:OpenAI Codex(主打 Ultra 多 agent 協作)、Anthropic Claude Code(目前基準之一)、以及智譜 ZCode(成本優勢 + 開源生態)。
Sol Ultra 與 ZCode 幾乎同週發動攻勢,時間點恰逢 HN 社群大量討論企業 AI 預算緊縮。有用戶反映兩個月前管理層以 token 消耗量衡量 AI 成效,現在卻改以週報要求使用更便宜的模型,折射出高算力模型的成本壓力正在真實影響企業選型。
高性能 vs 低成本的張力正在重塑開發者選型邏輯。市場已出現明顯分層:願意為頂尖性能付費的用戶,以及尋求同等品質但更低成本方案的用戶,兩者需求不再重疊,形成雙層市場結構。
章節四:開發者的選擇困境與策略建議
對個人開發者而言,ZCode 的五天免費試用是立即可驗證的選項;Sol Ultra 的 Codex 整合代表「讓 AI 代管複雜多步驟工程任務」的新可能,但定價與可用性尚未完全明朗。
企業端面臨另一層困境:HN 社群揭示出一個真實的企業矛盾——初期以 token 使用量衡量 AI 成效,現在正付出算力帳單過高的代價。選型策略應從「哪個模型最強」轉向「哪個模型在我的任務類型上性價比最高」。
建議策略:
- 對複雜多步驟任務:等待 Sol Ultra 的 Codex 定價公告後評估,多 agent 協作架構理論上能突破單一 agent 上下文限制
- 對成本敏感場景:立即試用 ZCode 五天免費方案,以自有 repo 的真實任務集驗證性能
- 對現有 Claude Code 用戶:保持觀望,競爭加劇意味著 Anthropic 有壓力在定價或功能上做出回應
核心技術深挖
Sol Ultra 的協作式 subagent 架構代表 coding agent 的一次架構層級升級,而非單純的模型性能提升。傳統 Pro 模式下各 agent 各自作業後匯整結果;Ultra 讓 subagent 在任務進行中即時通訊,理論上能突破單一 agent 上下文限制,處理跨越數十個檔案的超大型工程任務。
機制 1:協作式 subagent 即時通訊
Ultra 模式最核心的革新在於 subagent 間的即時通訊能力。傳統多 agent 系統中各 agent 平行作業後由 orchestrator 匯整,資訊流是單向的。Ultra 架構讓 subagent 在執行期間互相交流:例如負責前端的 subagent 發現 API 合約不符時,可即時通知後端 subagent 調整輸出,而非等到最後匯整階段才發現衝突。
名詞解釋
Orchestrator:多 agent 系統中負責分配任務、匯整結果的頂層協調 agent,類似工程團隊的 tech lead 角色。
機制 2:GLM-5.2 長上下文與 Goal 結構
ZCode 的技術底層 GLM-5.2 搭載 100 萬 token 上下文視窗,是目前開源 coding 模型中少數能原生容納大型 monorepo 的方案。「Goal」結構將複雜任務拆解為規劃—執行—驗證三個階段,每個階段由獨立的目標追蹤機制管理,避免長任務中的目標漂移問題。
機制 3:ZCode 多工具統一整合
ZCode 統一處理檔案存取、終端機輸出、瀏覽器上下文與 Git 變更,內建 20+ 程式設計工具,覆蓋從 linting 到測試執行的開發全流程。支援微信、飛書或 Telegram 遠端觸發,讓開發者可在行動裝置上監控長時間執行的 coding 任務進度,這在 Claude Code 與 Codex 的現有設計中尚未見到。
白話比喻
Ultra 的多 subagent 協作就像把「獨自通宵工作的工程師」換成「可以即時溝通的四人小組」——不是每個人都更聰明,而是溝通頻寬讓整體效率出現非線性提升。ZCode 的 Goal 結構則像給每個工程師配了一個可以中途打斷的「任務清單看板」,避免執行到一半忘記最初目標。
工程視角
環境需求
ZCode(立即可用):Z.ai 帳號、五天免費試用(含每日 500 萬 token 配額);支援 VS Code 擴充或 Web UI;微信、飛書或 Telegram 為選用遠端觸發管道。
Sol Ultra / Codex(尚未開放):目前僅限 OpenAI 合作夥伴預覽,普通開發者需等待正式整合公告。Sol 定價為每百萬輸入 token 5 美元、每百萬輸出 token 30 美元,Ultra 定價未公告。
最小 PoC
# ZCode 快速驗證(需 Z.ai 帳號)
export ZCODE_API_KEY="your_api_key"
# 在現有 repo 修復一個已知 bug
zcode --task "Fix the failing tests in test/api.test.js" \
--goal "Identify root cause, fix issue, verify with tests"
# 對比 Claude Code 同一任務的 token 消耗與輸出品質
驗測規劃
建議用自己 repo 中近期修復的 bug 作為測試集,而非依賴第三方基準數字。關鍵指標:
- 首次成功率:agent 不需人工介入即完成任務的比例
- token 消耗:同等任務的 token 使用量,直接影響成本
- 工具呼叫精確度:agent 是否執行了不必要的工具調用
常見陷阱
- ZCode 的「Goal」結構在任務描述模糊時容易跑偏,建議以具體驗收條件代替自然語言描述
- Sol Ultra 的 subagent 協作可能使 token 消耗遠高於 Base Sol,Ultra 定價公告前謹慎規劃預算
- GLM-5.2 在中文程式碼注釋的處理上尚無公開評測,可能影響中文開發環境表現
上線檢核清單
- 觀測:token 使用量趨勢、首次成功率、任務完成時間
- 成本:ZCode 試用期結束後的訂閱費用、與 Claude Code 的 TCO 比較
- 風險:ZCode 為中國公司產品,企業客戶需評估資料隱私合規要求(GDPR、SOC 2)
商業視角
競爭版圖
- 直接競品:Anthropic Claude Code(目前企業市場領先)、GitHub Copilot(IDE 整合廣度最高)、Cursor(VS Code 整合)
- 間接競品:Devin(自主軟體工程師定位)、Amazon CodeWhisperer、Google Gemini Code Assist
護城河類型
- 工程護城河 (OpenAI):多 subagent 協作架構需要大量推論基礎設施投入,非小型公司可快速複製;Terminal-Bench 2.1 的 91.9% 領先優勢若能維持,將形成性能護城河
- 生態護城河 (ZCode):MIT 開源授權讓 GLM-5.2 可被任意 fork 與部署;微信/飛書整合在亞洲企業市場形成獨特壁壘,西方競品難以短期複製
定價策略
三方採取截然不同的定價策略:Anthropic 維持高端訂閱定價;OpenAI 以 API 按量計費為主 (Sol $5/$30 per 1M tokens) ,Ultra 定價未公告但 50% 成本降低暗示有利潤空間;智譜 ZCode 以顛覆性低價作為市場切入點,以開源授權吸引開發者建立黏性。
企業導入阻力
- ZCode 的中國背景使部分西方企業在資料主權與合規審查上存在疑慮
- Sol Ultra 的 Codex 整合尚未正式定價,企業難以進行 TCO 預算規劃
- 多 agent 架構在企業審計軌跡要求上存在盲點——多個 subagent 的決策過程難以完整記錄
第二序影響
- coding agent 市場的低價競爭可能迫使 Anthropic 在定價或免費額度上做出調整
- ZCode 的商業化結果將成為中國 AI 工具在西方市場的重要參考案例
判決:先觀望(定價未明、開放時程不確定)
Sol Ultra 的技術論文尚未發表,Terminal-Bench 2.1 為自行評測,企業客戶在定價公告前難以做出遷移決策。ZCode 雖可立即試用,但企業合規審查需要時間。建議等待 Sol Ultra 的 Codex 正式公告,同時在沙盒環境試用 ZCode 三至五個任務,以自有數據而非第三方基準做選型判斷。
數據與對比
Terminal-Bench 2.1(coding agent 基準)
Sol Ultra 在 Terminal-Bench 2.1 上得分 91.9%,超越 Base Sol(88.8%) 與 Claude Mythos 5、GPT-5.5(均為 88.0%),領先幅度約 3 個百分點。評測方法論細節尚未由 OpenAI 官方公開,第三方獨立驗證仍待跟進。
名詞解釋
Terminal-Bench 2.1:測試 AI coding agent 在終端機環境中執行真實工程任務能力的基準,評估項目包括指令解析、錯誤處理與多步驟任務完成率。
SWE-bench Pro(程式碼修復基準)
GLM-5.2(ZCode 底層模型)在 SWE-bench Pro 得分 62.1,超越 GPT-5.5 的 58.6;跨 103 項任務的 Snowflake 基準測試中,與 Claude Opus 4.7 表現幾乎持平。SWE-bench Pro 基於真實 GitHub issue 修復場景,是目前最接近實際工程任務的基準之一。
名詞解釋
SWE-bench Pro:基於真實 GitHub Pull Request 的工程任務基準,評估模型自動修復軟體 bug 的能力,數字越高代表能正確解決更多真實工程問題。
最佳 vs 最差場景
推薦用
- Sol Ultra / Codex:跨越多個模組、需要多個 subagent 協作的大型重構任務
- ZCode:成本敏感的個人開發者或新創團隊,需要高品質 coding 能力但預算有限
- ZCode:使用微信或飛書的亞洲企業,需要行動裝置遠端觸發 coding 任務
千萬別用
- Sol Ultra:需要立即確定性成本規劃的企業客戶(定價未公告,難以預算)
- ZCode:對中國公司服務有資料主權或 GDPR 合規要求的西方企業
唱反調
Terminal-Bench 2.1 由 OpenAI 合作夥伴執行,方法論細節未公開,91.9% 的數字在第三方獨立驗證前可信度存疑
ZCode 的低定價可能犧牲企業支援、資料隱私合規與服務穩定性,對非中國市場的企業客戶存在實質顧慮
多 subagent 協作架構理論上強大,但 token 消耗倍數放大可能使 Ultra 的實際使用成本遠超 Base Sol,抵銷性能優勢
社群風向
希望他們把 Sol 推到訂閱方案。這樣我就會從 Anthropic 換到 OpenAI。
電腦仍然是電腦,程式碼(大多數情況下)以確定性方式執行。電腦真正難以處理的是理解模糊的輸入——這正是統計方法與 LLM 發揮作用的地方。
多 agent 在分析類任務中非常好用——讓每個 agent 只負責自己的部分,帶回問題,即使其他部分已有澄清說明。Orchestrator 負責處理並確保每個需要的部分都得到澄清,而不依賴副作用或側面知識。
在程式碼方面,我在不到 3 個月內從 80/20 Claude/GPT 切換到 80/20 GPT/Claude。說實話我自己也很驚訝,很想看看再過 3 個月後比例會是多少。Claude 在非 coding agent 任務上仍然更強。Codex 感覺像個工程師——這是優點。
GPT-5-Codex 是最強的 coding 模型,但在獨立 coding agent 上卻表現欠佳。讓我們深入探討前沿 AI 公司的技術轉向:多年來 OpenAI 和 Anthropic 提供標準 API,讓提供商之間可以輕鬆切換。
炒作指數
行動建議
立即註冊 Z.ai 帳號,用五天免費試用在自己的 repo 中跑 3-5 個真實任務,對比 Claude Code 的 token 消耗與輸出品質
為自己的 coding agent 任務集建立基準測試框架(至少 10 個有明確驗收條件的任務),以便 Sol Ultra 正式上線後快速比較
追蹤 OpenAI Codex 的 Sol Ultra 整合公告與定價,以及 GLM-5.2 在西方市場的合規動態(資料主權、GDPR)