中國人工智慧公司 Deepseek 發表了 V4-Flash-Vision-Exp,這是一個實驗性的多模態模型,在其文字處理能力基礎上,新增了圖像理解功能。根據 Deepseek 自己的基準測試,這個模型在代理任務上的表現幾乎與 Opus 4.8 相當。

Deepseek 表示,Deepseek-V4-Flash-Vision-Exp 透過圖像處理擴展了 Deepseek-V4-Flash 的功能。同時,它保留了基礎模型在推理和世界知識方面的文字處理效能。在該公司內部的多模態代理基準測試中,這個視覺版本的分數接近 Opus 4.8。

Deepseek 將此模型定位於代理應用程式,特別是針對視覺代理工作流程。它旨在與不同的代理框架協同工作,並將視覺理解與工具使用結合。實際上,它能夠描述圖像、從螢幕截圖中提取文字,並分析圖表。根據 API 文件,該模型支援 JPEG、PNG、GIF 和 WebP 格式,並會根據實際檔案內容而非檔名或宣告的 MIME 類型來判斷格式。

新增視覺功能後,新的 Deepseek 模型在代理基準測試中,表現接近甚至有時超越 Opus 4.8。該模型可與 OpenAI 的 Chat Completions 和 Responses API 以及 Anthropic 的 Messages 端點配合使用。Deepseek 也發布了其 Harness 框架的 0.1.1 版本,該版本開箱即用支援此新模型。

開發者可以透過三種方式將圖像傳送給模型。他們可以直接使用 Base64 編碼嵌入圖像,指向公開可存取的 URL(最大 32 MiB),或者使用新的免費 Files API。Files API 允許開發者上傳一次檔案,然後在多個請求中透過 ID 引用,檔案大小限制為 64 MiB。

一個選用的「detail」欄位可將圖像縮小至 512 x 512 像素,在不需要精細視覺細節時節省 token。模型在處理前會根據長寬比自動將圖像正規化至約 800 x 800 像素。無論原始解析度如何,每張圖像最多花費 384 個 token,定價則遵循 V4-Flash 費率。

單一請求最多可包含 600 張圖像。最大邊長為每邊 8,192 像素,但如果請求包含 15 張或更多圖像,則會降至 4,096 像素。圖像只能放在使用者訊息中。