重點摘要
兩個兆級模型,一場沒有裁判的基準大戰
Qwen 3.8(2.4 兆,MoE)自稱「僅次於 Fable 5」但零第三方驗證;Kimi K3(2.8 兆)在 Code Arena Frontend 奪冠,卻在數學推理上與西方頂模差距達 51 個百分點。
Qwen 3.8 預覽版定價為標準售價 10%,屬市場心佔率搶奪策略;完整開放權重尚未公布,企業私有部署評估時程不明確。
中國模型已佔 OpenRouter 週度 token 使用前五名,開放權重策略正在重塑開發者選型生態,但選型決策應等待開放權重公開後的社群驗測結果再行動。
前情提要
章節一:Qwen 3.8 的 2.4 兆參數與「僅次於 Fable 5」的宣稱
Alibaba 於 2026 年 7 月 19 日發布 Qwen 3.8 預覽版,宣稱擁有 2.4 兆參數,採稀疏 MoE 架構,是「僅次於 Fable 5」的模型。這是 Qwen 團隊首個突破 1 兆參數的多模態模型,能同時處理文字、圖片、影片與文件。
然而,Alibaba 至今尚未發布任何獨立基準測試,「僅次於 Fable 5」的宣稱完全依賴自我評估,未經第三方驗證。預覽版僅透過 Token Plan、Qoder、QoderWork 平台提供,定價為標準售價的 10%;完整開放權重版本「即將推出」但未公布確切日期。
名詞解釋
稀疏 MoE(Mixture-of-Experts) :一種神經網路架構,模型由多個「專家」子網路組成,每次推論只啟動其中一小部分,因此能以較低計算成本支撐龐大的總參數量。
章節二:Kimi K3 前端程式碼稱霸但數學能力落後的矛盾
在 Qwen 3.8 發布三天前,Moonshot AI 於 7 月 16 日推出 Kimi K3,參數量達 2.8 兆,成為目前史上最大的開源模型,完整權重預計 2026-07-27 公開。Kimi K3 在 Code Arena Frontend 榜單中登頂,Elo 分數達 1,679,超越 Fable 5(1,631) 與 GPT-5.6 Sol(1,618) ,成為首個佔據該榜首位的中國模型。
然而,Kimi K3 在 FrontierMath Tier 4(專家級數學)的準確率僅約 39%,而 OpenAI 與 Anthropic 等西方頂尖模型達接近 90%,差距達 51 個百分點。這一落差揭示了關鍵事實:前端程式碼生成(相對低推理密度)與嚴格數學推理是截然不同的能力維度,單一榜單冠軍無法代表全面能力。
名詞解釋
FrontierMath Tier 4:由 EpochAI 設計的數學基準測試,Tier 4 為最難等級,需要博士等級的數學推理能力,被視為評估深度推理能力的嚴苛指標。
章節三:社群對基準測試與幻覺問題的質疑
Qwen 3.8 的發布在 Hacker News 社群引發廣泛質疑,核心爭議在於自我宣稱的可信度問題。長期以來,各大 AI 實驗室反覆以「已解決」的姿態宣布改進,卻在實際部署中屢屢打臉,社群對幻覺問題的長期積怨更令可信度雪上加霜。
Kimi K3 的情況略有不同——Code Arena 的 Elo 評分系統基於大量人類偏好投票,具有相對透明的驗證機制。然而,一個在前端代碼生成表現卓越的模型,是否只是在「評測技巧」上做了高度針對性的最佳化,而非真正具備通用推理能力,仍是社群持續追問的核心問題。
章節四:開放權重 vs 閉源模型的產業賽局
中國 AI 實驗室集體擁抱開放權重策略,並非純粹出於技術分享精神,而是一種蓄意的商業選擇:以開源模型商品化競爭對手的閉源優勢,再從雲端基礎設施、應用層與企業服務中收割實際價值。中國模型目前已佔 OpenRouter 週度 token 使用量前五名,且全為開放權重模型,印證了開源作為市場進入策略的有效性。
值得注意的是,Alibaba 持有 Moonshot AI 約 36% 股份,Qwen 3.8 恰在 Kimi K3 發布三天後推出,外界普遍解讀為被投資者與母公司之間的內部競爭信號。這種「競合」態勢本身,也映射出中國 AI 產業面對西方閉源巨頭時的集體生存策略——開源不只是技術決策,更是地緣政治棋局的一步。
核心技術深挖
Qwen 3.8 與 Kimi K3 的技術競爭,不只是參數量的比拼,而是三種底層機制同時運作的結果:架構設計的選擇、評測系統的侷限性,以及開放策略的商業邏輯。
機制 1:稀疏 MoE 讓兆級參數成為可部署現實
稀疏 MoE 架構使得 Qwen 3.8 得以在推論時只啟動總參數的一小部分,讓 2.4 兆的總規模在實際部署中成本可控。Kimi K3 的 2.8 兆架構遵循類似邏輯——這解釋了為何「兆級模型」能在短短幾個月內從概念躍升為可預覽產品,而非只停留在研究論文階段。
白話比喻
想像一間有 2,400 名專家的圖書館。每次你提問,圖書館只派出其中最相關的 200 人回答,而非全員出動。這樣既維持了龐大的知識儲備,又不必每次都負擔所有人的運作成本。
機制 2:Elo 評分 vs 標準化基準——兩種截然不同的驗證邏輯
Code Arena 的 Elo 系統仰賴大量人類投票,反映「開發者主觀偏好」;FrontierMath 則以客觀正確率衡量「邏輯推理能力」。Kimi K3 在兩者之間呈現天壤之別(前端 Elo 第一 vs 數學準確率 39%),揭示的不只是能力落差,更是訓練目標的高度針對性——該模型極可能針對人類偏好型任務做了大量最佳化,而犧牲了深度推理能力。
機制 3:自我宣稱基準的信號價值遞減
Qwen 3.8 的「僅次於 Fable 5」宣稱在零第三方驗證的狀態下發布,在當前 AI 軍備競賽中已成一種固定模式。每一次無法即時驗證的宣稱,都在消耗該品牌的社群信任額度。當完整開放權重版本公開後,社群實測將成為唯一有效的驗證機制,而非實驗室自述的基準分數。
白話比喻
這相當於一家餐廳在開門前宣稱「全城最好吃」,但拒絕讓任何人試吃。等外賣正式推出,口碑好壞自然見真章。
工程視角
環境需求
目前 Qwen 3.8 僅提供雲端預覽 API(Token Plan / Qoder / QoderWork) ,完整開放權重尚未釋出;Kimi K3 完整權重預計 2026-07-27 公開。本地部署需考量稀疏 MoE 架構的高記憶體需求,兆級模型對 GPU 集群仍有相當要求,建議至少 8×H100 80GB 以上配置進行初步評估。
最小 PoC
# 範例代碼,實際 endpoint 請參考官方文件
import openai
client = openai.OpenAI(
api_key="YOUR_API_TOKEN",
base_url="YOUR_QWEN_API_ENDPOINT" # 依官方文件替換
)
response = client.chat.completions.create(
model="qwen-3.8-preview",
messages=[{"role": "user", "content": "Write a React data table component"}]
)
print(response.choices[0].message.content)
驗測規劃
開放權重版本公開後,建議優先針對以下場景進行基準對比測試:
- 前端程式碼生成(對標 Kimi K3 的 Code Arena 強項,驗證 Elo 榜單的業務代表性)
- 多步驟數學推理(對標 FrontierMath 差距,確認應用邊界)
- 多模態文件解析(Qwen 3.8 宣稱核心能力,需自行採樣驗測)
常見陷阱
- MoE 架構在批次推論時記憶體需求不均,需預留足夠 GPU 顯存緩衝,避免 OOM 導致服務中斷
- 評測數據目前缺乏第三方驗證,不建議直接以宣稱指標作為選型或採購依據
- 開放權重版本與預覽 API 版本可能存在能力差異,上線前需重新進行端到端驗測
上線檢核清單
- 觀測:幻覺率、代碼可執行率、多模態輸出一致性
- 成本:實際 token 吞吐量、MoE 稀疏啟動節省的計算成本 vs 路由開銷
- 風險:第三方基準結果與自我宣稱指標的落差、特定市場的地緣政治合規風險
商業視角
競爭版圖
- 直接競品:Kimi K3(Moonshot AI,2.8 兆,前端程式碼 Elo 第一)、Llama 系列(Meta,開放權重生態主導者)
- 間接競品:GPT-5.6 Sol(OpenAI,Code Arena Elo 1,618)、Fable 5(Anthropic,Qwen 3.8 自宣稱對標)
護城河類型
- 工程護城河:稀疏 MoE 架構的規模化能力,以及多模態(文字/圖片/影片/文件)的整合深度
- 生態護城河:Alibaba Cloud 基礎設施綁定、Qoder/QoderWork 平台的開發者生態,以及開放權重帶來的社群自擴散效應
定價策略
Qwen 3.8 預覽版定價為標準售價的 10%,是明顯的市場心佔率搶奪策略。完整開放權重公開後,主要商業模式將轉向 Alibaba Cloud 推論服務與企業私有部署支援,而非模型本身授權費用。
企業導入阻力
- 缺乏第三方基準驗證,企業採購決策缺乏客觀依據
- 開放權重尚未公開,無法進行私有部署環境評估
- 中國原廠模型在部分市場面臨合規審查與地緣政治風險
第二序影響
- 中國 AI 開放策略加速 LLM 商品化,正在壓縮西方閉源模型的定價空間與差異化優勢
- Alibaba 同時持有 Moonshot AI 股份,形成「同一母公司旗下的競爭者」賽局,最終可能讓 Alibaba 生態整體受益,而非零和競爭
判決:商品化壓力加速(但驗證空窗期是最大風險)
Qwen 3.8 與 Kimi K3 共同代表中國 AI 實驗室在開放權重賽道的集體押注,正在重塑開發者選型生態。對企業而言,真正的決策時機是開放權重版本公開並通過社群驗測後,而非跟風宣稱的基準數字。
數據與對比
Kimi K3 Code Arena Frontend
Kimi K3 在 Code Arena Frontend 排名第一,Elo 分數 1,679,超越 Fable 5(1,631) 及 GPT-5.6 Sol(1,618) 。這是首個登頂該榜單的中國模型,驗證基礎為大量人類偏好投票,具相對透明的主觀驗證機制。
Kimi K3 FrontierMath Tier 4
Kimi K3 於 FrontierMath Tier 4 準確率約 39%,而 OpenAI 與 Anthropic 頂尖模型接近 90%,差距達 51 個百分點。此落差直接質疑「榜單冠軍等於全能模型」的邏輯。
Qwen 3.8
目前 Alibaba 尚未發布任何獨立基準測試數據,所有效能宣稱均為自我評估,完整開放權重版本公開後方可進行第三方驗證。
最佳 vs 最差場景
推薦用
- 前端程式碼生成與 UI 快速原型(Kimi K3 在 Code Arena Frontend 驗證的強項場景)
- 多模態文件處理與辦公室生產力任務(Qwen 3.8 宣稱核心能力,待第三方驗證)
- 成本敏感的開發環境與 A/B 評測實驗(開放權重後可本地部署,降低 API 依賴)
千萬別用
- 需要高精度數學或邏輯推理的科研、金融分析應用(Kimi K3 FrontierMath 39% 是明確警示)
- 已上線且依賴穩定 API 的生產環境(開放權重尚未完整公開,版本穩定性未驗證)
- 直接以官方宣稱基準作為採購決策依據(缺乏第三方驗證,尤其 Qwen 3.8 風險更高)
唱反調
Kimi K3 在 Code Arena Frontend 奪冠,但 Elo 評分高度依賴投票社群的偏好分佈,若評測群體本身偏向特定代碼風格,結果未必具普遍代表性,更難以外推至實際生產環境的表現。
中國 AI 的開放權重策略固然加速了 LLM 民主化,但若主要動機是商業圍堵而非技術分享,社群長期能從中獲得的實質利益——包括持續維護、安全更新與治理透明度——仍有待時間驗證。
社群風向
我記得 Sam Altman 兩年多前說幻覺問題內部已經「修好了」。顯然並沒有。
他們以為把最好的模型封閉起來可以驅動更多業務,但後來發現閉源發布除非真的超好,否則大多被忽略。
開放模型是行銷策略。
確實,他們之間的競爭是唯一阻止 OpenAI 與大型科技公司透過網路效應輕易獲得壟斷地位或監管俘獲的力量。
我一直在測試 Qwen 3.8 Max 預覽版。雖然它比 3.7 有所進步,但在實際使用感受上就是沒有 K3 好。Qwen 一貫在現實使用中的表現低於基準分數,這次似乎仍是如此。
炒作指數
行動建議
等待 Kimi K3 完整權重(預計 2026-07-27)公開後,在自有前端代碼生成任務上進行基準對比,驗證 Code Arena Elo 榜單在你的業務場景中是否具代表性。
若你的應用場景聚焦前端 UI 輔助,將 Kimi K3 與 Fable 5、GPT-5.6 Sol 整合進 A/B 評測管線,以實際使用者偏好驗收模型表現,而非依賴外部 Elo 排名。
追蹤 Qwen 3.8 完整開放權重的公開時間點與第三方基準結果,以及 Alibaba×Moonshot AI 的股份關係如何影響兩家後續發布節奏與開源承諾的兌現程度。