BlockBeats 消息,8 月 15 日,近日 AI 社群熱議 DeepSeek-V4-Pro 疑似存在多個版本。有使用者發現,同樣呼叫 deepseek-v4-pro 介面,在更換 IP 或重新建立會話後,模型會出現三種不同的「推理風格」:
一類頻繁以「Let me」開頭,接近此前 V4 Pro 預覽;一類常出現「The user wants me」,類似 V4 Flash;另一類大量使用「we」,被部分使用者稱為能力更強的「神版 V4 Pro」。
由於同一會話一旦進入某種模式後,後續表現通常保持穩定,社群一度猜測 DeepSeek 是否在 API 背後隱藏了多個模型,並通過路由機制分發。不過,進一步分析 DeepSeek Harness 原始碼後,出現了另一種解釋:差異可能並非來自不同模型權重,而是來自 Agent 運行環境。
社群發現,8 月 10 日,DeepSeek Harness 官方存儲庫更新了一條關鍵 commit:
「fix(preset): align minimal agent with RL composition」
該更新旨在讓 Minimal Agent 與強化學習(RL)訓練時使用的 Agent 環境保持一致。
官方文件顯示,Minimal preset 包含極簡 system prompt、persistent Bash 環境、指定編輯工具、RL 訓練使用的 compaction policy,並移除了額外身份提示、Web 提示及工具說明。
這意味著,DSH Minimal 可能並不是 Standard 版本的「閹割版」,而是在模擬模型訓練階段真實接觸的 Agent 環境。
社群測試也支持這一觀點。同一個 DeepSeek V4 Pro 在不同 Harness 環境下表現:
DSH Standard:91 分;
DSH PTC:92 分;
DSH Minimal:99/96 分。
隨後,測試者開發「Anchored Standard」 擴充功能:首次請求模擬 Minimal 環境,只開放 shell 和 read 工具,完成首次工具呼叫後再恢復 Standard 完整工具集,結果連續獲得 98/99 分。
測試者認為,決定 V4 Pro Agent 能力發揮的關鍵,可能並非最終擁有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent Scaffold。
因此,所謂「三個 DeepSeek 模型」可能實際上是兩層因素疊加:
一方面是 API 服務環境、部署配置或灰度實例差異;另一方面是模型是否進入接近 RL 訓練分佈的 Agent 環境。
不過,目前該說法尚未獲得 DeepSeek 官方確認。官方 API 文件顯示,deepseek-v4-pro 對應 DeepSeek-V4-Pro-0813 正式版本,並未公佈多模型自動路由機制。
目前來看,DeepSeek-V4-Pro 不同表現更可能是模型權重、推理環境和 Agent 框架共同作用的結果,而非簡單存在三個隱藏模型。