DeepSeek-V4-Flash 正式上線:Agent 能力飆升 82.7%,支援 Codex 零設定切換

DeepSeek-V4-Flash 正式上線:Agent 能力飆升 82.7%,支援 Codex 零設定切換

DeepSeek-V4-Flash 正式上線:Agent 能力飆升 82.7%,支援 Codex 零設定切換

什麼是 DeepSeek-V4-Flash?

你可以把它想成 DeepSeek 的「輕量快打版」——反應快、價格低,專門處理需要 AI 動手做事的任務。這次 7/31 的正式版更新,直接把「Agent 能力」拉到新高度。

什麼是 Agent?簡單說就是AI 不再只是回你文字,而是真的會去執行:開終端機、查資料、跑程式、甚至自己修 bug。


這次更新強在哪?看數字說話

DeepSeek 官方丟出 9 個基準測試,直接對比之前的 V4-Pro-Preview:

測試項目分數這在測什麼
Terminal Bench 2.182.7AI 用終端機解決問題的能力
NL2Repo54.2把自然語言變成完整程式碼倉庫
Cybergym76.7網路安全任務的實戰表現
DeepSWE54.4軟體工程複雜問題處理
Toolathlon verified70.3多工具協作完成任務
Agent Last Exam25.2綜合 Agent 能力大考
Automation Bench25.1自動化流程建置
DSBench-FullStack68.7全端開發(DeepSeek 內部測試)
DSBench-Hard59.6高難度程式 Agent 任務

Terminal Bench 82.7 是什麼概念? 這代表你說「幫我架一個 Express 伺服器,要連 MongoDB,然後寫個 CRUD」,它真的會一步步開終端機、下指令、遇到錯誤自己查、自己修,最後把東西跑起來。


工程師最該注意:Responses API 原生支援

這次更新藏了一個大禮——V4-Flash 正式版原生支援 Responses API 格式

這是什麼意思?OpenAI 前陣子推的 Responses API,讓 AI 可以「思考→用工具→再思考→給結果」,整個流程一氣呵成。現在 DeepSeek 直接相容,還特別針對 Codex(OpenAI 的程式 Agent)調過參數。

對你的影響:

  • 原本用 Claude Code 或 GitHub Copilot Agent 模式?
  • 改個 model 參數成 deepseek-v4-flash
  • 其他程式幾乎不用動,價格可能還更便宜

架構沒變,但腦袋換過

DeepSeek 特別說明:V4-Flash-0731 跟之前的 Preview 版模型大小、架構完全一樣,只有做「re-post-trained」——白話就是同樣的腦袋,但重新訓練過怎麼用工具

這種做法的好處是:你不用擔心換模型後輸出格式大亂,但執行任務的能力明顯變強。


誰該馬上試?

這三種人現在就可以打開 API 文件:

1. 週末想 hack side project 的工程師

  • 以前要查文件、架環境、寫 boilerplate 兩小時
  • 現在描述需求,讓 AI 自己開終端機跑完

2. 用 Claude Code 但覺得有點貴的團隊

  • DeepSeek 的定價向來是 Claude 的 1/10 等級
  • 這次能力追上,CP 值直接爆表

3. 想導入 AI Agent 但怕改程式改到死的公司

  • Responses API 相容 = 現有 OpenAI 程式碼幾乎無痛遷移

注意:Pro 版還沒來,App/Web 也沒更新

官方特別標註這次只有 V4-Flash API 更新,兩件事還沒發生:

  • ❌ DeepSeek-V4-Pro 正式版(還在等)
  • ❌ 手機 App 或網頁版的模型(維持原狀)

所以如果你是免費版用戶,這波加強暫時吃不到。要體驗得走 API 路線。


現在就打開試試看吧

更新方式超簡單:

# 原本這樣
model="deepseek-v4-flash-preview"

# 改成這樣
model="deepseek-v4-flash"

就這樣。其他參數、呼叫方式、回傳格式全部不變。

如果你本來就在用 Codex 或 Claude Code 做程式開發,這週末值得花 30 分鐘把 DeepSeek-V4-Flash 接進去跑幾個任務——看看同樣的 prompt,誰跑得又快又準又便宜。

試完記得對照那個 Terminal Bench 82.7 的數字:當 AI 真的會自己開終端機解決問題,你寫程式的方式可能從此不一樣。