重點摘要
後訓練精煉,不改架構打出 60% 成本優勢
維持 284B/13B MoE 架構不變,透過重新後訓練讓 Agent 基準大幅提升,GDPval Elo 從 1,189 飛升至 1,559,完成相同工作少用 12% tokens
$0.14/$0.28 per 1M tokens,緩存折扣高達 98%(業界通常 90%),即使 GPT-5.6 Luna 降價 80% 後每任務成本仍低約 60%
MIT 開放權重已上 HuggingFace,Unsloth 4-bit 量化需 168GB RAM;舊版 API 名稱三個月內停用,生產系統需排定遷移計畫
前情提要
V4-Flash 的技術定位與 preview 階段演進
DeepSeek V4-Flash-0731 於 2026 年 7 月 31 日正式進入公開 Beta,透過 API 參數 deepseek-v4-flash 存取,官方更新日誌同步於 api-docs.deepseek.com/updates/ 公告。
與 Preview 版本相比,本次升級並非大版本重構,而是透過「重新後訓練」 (re-post-training) 在相同的 284B 總參數 / 13B 激活參數 MoE 架構上精煉,展示了後訓練階段能釋放的驚人潛力。
名詞解釋
MoE(Mixture of Experts) :混合專家架構,模型總參數量龐大,但每次推理只激活其中一小部分(本例為 13B),大幅降低每次推理的計算成本。
上下文視窗維持 1M tokens,MIT 授權開放權重,已上架 Hugging Face,任何開發者均可下載自行部署。本次升級僅更新 V4-Flash API;V4-Pro 及 APP/WEB 介面維持不變。
社群實測反饋與效能評估
Artificial Analysis Intelligence Index 評分 50,在 101 個開放權重模型中排名第 3(中位數 25),較 4 月版本提升 10 分,甚至超越 V4-Pro 的評分,與 OpenAI GPT-5.6 Luna 僅差 1 分。
名詞解釋
Artificial Analysis Intelligence Index:由 Artificial Analysis 機構發布的綜合智慧評分,整合多項基準測試結果,用於跨模型橫向比較能力與成本效益。
Agent 能力是本次升級最顯著的亮點:Terminal Bench 2.1 得分 82.7、NL2Repo 54.2、Cybergym 76.7,GDPval 代理任務 Elo 從 1,189 飛升至 1,559。完成相同工作比前版本少用 12% tokens,幻覺頻率同步降低。
社群實測則呈現更立體的圖像:部分開發者回報使用自動化工具兩個月僅花費 $19,形容為「no token anxiety」——不再焦慮 token 用量。但也有實測指出,完成同等工作量的 token 消耗約為 Gemini Flash 3.6 的 3.6 倍,對延遲敏感場景需審慎評估取捨。
開源模型競爭格局中的 DeepSeek 策略
V4-Flash 的定價具有攻擊性:輸入 $0.14/1M tokens,輸出 $0.28/1M tokens,緩存命中折扣高達 98%,業界通常為 90%。此差距在高緩存率工作負載下會累積為顯著的成本優勢。
OpenAI GPT-5.6 Luna 在 V4-Flash GA 同日宣布大降價 80%(輸入 $0.2/1M,輸出 $1.2/1M),市場普遍解讀為戰略性應對。但即使 Luna 降價後,V4-Flash 每任務成本仍低約 60%,DeepSeek 在性價比曲線上確立了清晰位置。
開源社群方面,Unsloth AI 宣布支援 4-bit 量化本地部署(需 168GB RAM),antirez 同步上傳 GGUF 量化版本。開發者也在探討將 K3 蒸餾進 DS4 Flash 的可行性,但社群評估認為模型容量差距過大,僅適合特定垂直領域的專家模型。
Preview 模型商用化的風險與機遇
Preview API 轉為正式版引發了社群討論:部分開發者因 preview 版行為改變而感到措手不及。理性的聲音直接指出,preview 命名本就預示不穩定性,在非 trivial 任務上依賴 preview 端點需要自行承擔版本漂移風險。
舊版 API 名稱 deepseek-chat、deepseek-reasoner 將於三個月內停用,企業客戶需儘快排定遷移計畫。Preview 轉 GA 的產品化邏輯清晰:以後訓練迭代替代大版本換代,降低遷移成本的同時,也為開發者提供更可預期的升級路徑,這或許將成為大型開源模型版本管理的新常態。
核心技術深挖
DeepSeek V4-Flash-0731 的核心升級依靠「重新後訓練」完成,不動架構、只磨後端——這是在既有投資上疊加效能的高效路徑,也讓本次更新成為後訓練價值的教科書示範。
機制 1:MoE 稀疏激活架構維持不變
模型保持 284B 總參數 / 13B 激活參數的 MoE 設計,每次推理只激活約 4.6% 的參數,顯著降低計算成本。
這使得 V4-Flash 能以遠低於同等能力 Dense 模型的推理費用提供服務,是定價激進化的底層技術支撐,也是 $0.14/1M tokens 得以實現的根本原因。
白話比喻
把 MoE 想像成一個大型顧問公司:公司有 284 位顧問(總參數),但每次只出動 13 位最相關的人處理你的問題(激活參數),帳單自然比派全員出動便宜得多。
機制 2:重新後訓練 (Re-Post-Training) 驅動效能躍升
官方稱本次透過重新後訓練完成升級,而非更換預訓練模型。後訓練階段包含 RLHF、指令微調、以及針對 Agent 任務的專項強化,讓同一個底層模型在代理推理、程式生成領域表現大幅提升。
名詞解釋
RLHF(Reinforcement Learning from Human Feedback) :人類回饋強化學習,透過人類評分訓練模型對齊人類偏好,是主流對話與指令模型的關鍵後訓練技術。
GDPval Elo 從 1,189 升至 1,559(+31%) ,Terminal Bench 2.1 達到 82.7,均為後訓練直接受益領域,且完成相同工作比前版本少用 12% tokens,說明後訓練同步改善了指令跟隨的精確度。
機制 3:98% 緩存折扣的成本乘數效應
DeepSeek 提供業界最高的 Prompt 緩存折扣——98%(業界通常 90%)。對於高重複前綴的工作負載(如 Agent 系統中反覆傳入相同 system prompt),此折扣意味著邊際 token 成本幾乎歸零。
這是社群開發者回報「兩個月僅花費 $19」的數學根源,也是即使 Luna 大幅降價後 V4-Flash 每任務成本仍低 60% 的關鍵機制——積極的緩存折扣策略在帳單層面放大了架構層的成本優勢。
工程視角
環境需求
API 存取透過 deepseek-v4-flash 參數呼叫,相容 OpenAI SDK 格式,支援 Responses API,可原生整合 Codex framework,無需修改框架層。本地部署:Q8 量化版本約需 151GB 磁碟空間;Unsloth 4-bit 版本需 168GB RAM,3-bit 版本需 110GB RAM。
最小 PoC
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "你是一個程式碼審查助理"},
{"role": "user", "content": "請審查這段 Python 函數"}
]
)
print(response.choices[0].message.content)
print("Cached tokens:", response.usage.prompt_tokens_details.cached_tokens)
驗測規劃
重點驗測 Agent 任務效果(模擬 Terminal Bench 類型場景),對比前版本 token 消耗(目標少用 ≥10%)。針對高緩存場景,檢驗 98% 折扣是否真實觸發——觀察 API 回應 usage.prompt_tokens_details.cached_tokens 數值,確認命中率 >80%。
常見陷阱
- 緩存未命中:system message 若被 Agent 框架在中間插入額外內容,會導致 prompt 前綴改變、緩存失效;建議使用自建 proxy 或調整 prompt 組裝順序,將固定指令集中在最前端
- 端點混用:舊版
deepseek-chat、deepseek-reasoner三個月後停用,新舊端點並存可能造成行為不一致,應統一遷移 - 延遲預估錯誤:token 吞吐量約為 Gemini Flash 3.6 的 1/3.6,若有硬性延遲 SLA 需先做壓測,而非直接從成本數字推算
上線檢核清單
- 觀測:監控 cached_tokens 命中率(目標 >80%)、p95 latency、幻覺樣本抽查率
- 成本:確認帳單中緩存折扣正確計算;計算實際 token 消耗是否低於替代方案預估
- 風險:完成
deepseek-chat→deepseek-v4-flash端點遷移並驗證輸出行為一致性;確認三個月停用時間表並設置告警
商業視角
競爭版圖
- 直接競品:OpenAI GPT-5.6 Luna(同日降價 80%,但每任務成本仍高 60%)、Google Gemini Flash 3.6(延遲更低,但定價較高且緩存折扣僅 90%)
- 間接競品:Anthropic Claude Haiku 系列、Mistral 輕量模型、Qwen 開源模型系列
護城河類型
- 工程護城河:MoE 架構推理成本優勢 + 98% 緩存折扣的激進定價策略,在同等智慧水準下形成系統性成本壁壘;後訓練迭代速度快,可持續壓縮與 frontier 模型的品質差距
- 生態護城河:MIT 開放授權吸引本地部署需求,HuggingFace 社群生態快速形成(Unsloth 整合、antirez GGUF 版本),降低廠商鎖定風險並擴大開發者基底
定價策略
DeepSeek 採用「成本破壞者」策略:以接近 frontier 模型的品質搭配 open-source 定價,$0.14/$0.28 per 1M tokens 加上 98% 緩存折扣,讓高緩存工作負載的邊際成本趨近於零,直接挑戰主流 API 廠商的傳統定價邏輯。
企業導入阻力
- 資料主權疑慮:中國背景廠商在歐美企業採購時面臨合規審查與 IT 安全政策限制
- Preview 穩定性歷史:本次 preview→GA 行為改變已讓部分開發者重新評估對 DeepSeek 端點的依賴深度
- 企業級支援不成熟:相較 OpenAI/Google,SLA 保證、私有部署服務、技術支援通道仍在建構中
第二序影響
- GPT-5.6 Luna 同日降價 80% 是直接反應,預示頂層 API 廠商將持續面臨定價下壓,長期利好開發者
- 開源社群量化版本的快速跟進(Unsloth、antirez),加速 V4-Flash 在私有部署場景的滲透率
- 後訓練驅動的版本迭代模式,若被主流廠商採用,將改變「大版本發布」主導的市場節奏,版本遷移成本降低
判決:性價比新標竿(企業採購仍需評估合規成本)
在 API 成本管控優先的場景,V4-Flash 目前是開放權重中最具競爭力的選擇。企業客戶需將資料主權與合規成本納入 TCO 計算;若條件允許,本地部署開放權重版本是繞過這些疑慮的有效路徑。
數據與對比
Agent 任務基準
- Terminal Bench 2.1:82.7
- NL2Repo:54.2
- Cybergym:76.7
- GDPval Elo:1,559(前版 1,189,+31%)
開發任務基準
- DSBench-FullStack:68.7
- DSBench-Hard:59.6
效率指標
- 完成同等工作比前版本少用 12% tokens
- 社群實測:同等工作量 token 消耗約為 Gemini Flash 3.6 的 3.6 倍(延遲敏感場景需注意)
Artificial Analysis 綜合評分
- Intelligence Index:50(前版 40,+10 分)
- 在 101 個開放權重模型中排名第 3(中位數 25)
- 與 GPT-5.6 Luna 差距 1 分,但每任務成本低約 60%
最佳 vs 最差場景
推薦用
- 高緩存率 Agent 系統(長 system prompt 反覆重用):98% 緩存折扣使邊際成本幾乎歸零,適合 Agentic workflow
- 程式生成與程式碼審查自動化:DSBench-Hard 59.6,Agent 推理能力顯著提升,適合 coding copilot 場景
- 需要長上下文的文件分析或多輪對話:1M tokens 視窗支援超長輸入,不需分段處理
- 對成本敏感的 SaaS 產品:以媲美 GPT-5.6 Luna 的智慧水準節省 60% API 帳單
- 企業私有化本地部署:MIT 授權 + 開放權重 + 社群 GGUF 量化版本已就緒,繞開資料出境疑慮
千萬別用
- 延遲極度敏感的即時互動場景:社群實測 token 消耗約為 Gemini Flash 3.6 的 3.6 倍,p95 延遲可能偏高
- 仍使用 deepseek-chat 或 deepseek-reasoner 端點的生產系統:三個月內停用,需儘快遷移以避免服務中斷
- 需嚴格 version pinning 的高合規場景:preview 轉正的歷史顯示模型行為可能改變,需評估穩定性保證需求
唱反調
後訓練提升的效能可能針對特定基準最佳化,與真實多樣化工作負載的相關性需要更多獨立驗測,官方公告基準不能作為唯一判斷依據
同日 Luna 降價 80% 顯示 OpenAI 仍有充足的定價彈性,DeepSeek 的成本優勢並非結構性護城河,競爭持續壓縮差距的機率相當高
98% 緩存折扣在實際場景中往往難以充分利用——任何 prompt 組裝方式的變動都會導致緩存失效,真實節省幅度可能遠低於理論值
社群風向
最令人印象深刻的是,DeepSeek 持續展示後訓練階段能帶來多大的效能提升——架構完全沒變。這是一個強烈的提醒:我們可能嚴重低估了預訓練之後仍有多少最佳化空間尚待開採。
這之前不是就標明了「preview」嗎?如果在 preview 模型上實作非 trivial 的任務,難道不應該預期它不是最終穩定版本?除非你的意思是他們應該在端點名稱額外加上「preview」後綴才算足夠明確?
將 K3 蒸餾進 DS4 Flash 可能只對專家模型有意義,模型容量差距否則太大了。我們之前成功把 GLM 5.2 蒸餾進 Qwen 27B 專家模型——關鍵是找到可以 pipeline 訓練的直接映射函數,例如英文到 SQL,相對容易定義訓練流程。
DeepSeek V4 Flash 0731 現在是所有模型中智慧能力與成本比最佳的選擇。它的智慧水準與 GLM 5.2 和 GPT Luna 相當,但價格便宜得多——輸入只要 $0.14/1M tokens,輸出 $0.28/1M tokens。這次發布太瘋狂了。
DeepSeek V4 Flash 0731 在 Artificial Analysis Intelligence Index 拿到 50 分,比 2026 年 4 月版本高出 10 分,超越 DeepSeek V4 Pro 達 6 分。架構與定價與舊版相同,落在我們「智慧能力 vs 任務成本」的 Pareto 前沿上。
炒作指數
行動建議
把現有 OpenAI API 呼叫的 model 參數替換為 `deepseek-v4-flash`,監控 7 天的 token 成本與輸出品質,直接比較帳單差異與緩存命中率
設計高緩存率的 Agent system prompt(將固定指令集中在 prompt 最前端),驗證 98% 緩存折扣的實際觸發率,以 `cached_tokens` 欄位追蹤,目標命中率 >80%
追蹤 `deepseek-chat`、`deepseek-reasoner` 的停用時間表(三個月內),以及 V4-Pro 是否跟進後訓練升級——若 Pro 也採用此路徑,性價比格局將再次重塑