AIRun · Blog
← 全部文章

DeepSeek 視覺模型悄悄上線!V4 Flash Vision API 完整解析

2026-08-23 · J董 👁 137 人看過 🤖 100 AI 爬蟲命中
AI 新知DeepSeek多模態 AI視覺模型AI API

deepseek-v4-flash-vision-exp 上線了,DeepSeek 的 API 現在能看圖。

DeepSeek 官方 API 文件 目前顯示已新增一頁 Vision 說明(查證時間點:2026-08-23),本文查證範圍內未見到對應的官方公告或部落格文章,僅在 API 文件裡看到直接多了一個模型名字:deepseek-v4-flash-vision-exp。這次算是 DeepSeek 把視覺能力做進主力 API 產品線的訊號,值得開發者關注「能不能拿它換掉更貴的視覺 API」。這次上線在社群引發多少討論,官方與本文手上都沒有數字可以引用。本文只根據 DeepSeek 官方 Vision 文件 這份唯一來源整理,文件沒寫的一律標示「官方未公布」,不臆測。

DeepSeek 悄悄上線的視覺模型是什麼?

deepseek-v4-flash-vision-exp 是一顆能同時吃圖片與文字的視覺語言模型,用來描述圖片內容、讀取螢幕截圖裡的文字、分析圖表數據。

根據 官方文件,這顆模型走的是業界標準的 OpenAI 相容格式——也就是「Chat Completions」介面(一種把對話內容拆成一個個 message 區塊丟給模型的標準呼叫方式,是目前多數 AI API 的共通語言)。開發者原本呼叫 GPT-4 Vision 或 Gemini 的程式碼架構,理論上只要換模型名稱與 base URL(https://api.deepseek.com)就能接上,遷移成本被壓到很低。文件同時提到 Responses API 也支援同樣的圖片輸入方式,用 input_image 這種內容區塊承載圖片,代表 DeepSeek 這次把兩套主流呼叫介面一次補齊。

模型名稱裡的 exp 依業界命名慣例通常代表 experimental(實驗版),但官方文件並未明文解釋這個縮寫的意義,這是作者依慣例的推測,並非官方聲明。從命名本身合理推估,這顆模型可能還在測試階段、功能與規格未來或有調整,但這一點官方文件同樣沒有明講。

deepseek-v4-flash-vision-exp 支援哪些傳圖方式?

官方提供三種餵圖片給模型的方式,各有不同的檔案大小上限與適用情境,選錯方式最容易踩到「請求被拒」的坑。

三種方式分別是:把圖片轉成 base64 字串直接塞進請求(inline)、丟一個公開可存取的圖片網址讓模型自己下載、或先用 Files API 把圖片上傳一次再重複引用。三者的限制差異不小,整理成表格如下:

傳圖方式大小限制額外條件適用情境
Base64 內嵌(inline)算進 48 MiB 請求本體上限單次呼叫、本機檔案,最簡單直接
外部圖片網址圖片檔本身最大 32 MiB網址長度上限 8192 字元、需在 60 秒內下載完成圖片已經有公開連結,不想重新編碼
Files API(file_id 引用)最大 64 MiB,不受 32 MiB 單圖限制需先呼叫 Files API 上傳一次同一張圖要在多次請求中重複使用,或圖片太大超過 inline 上限

值得注意的是,官方文件 特別強調圖片格式的判斷依據是檔案實際內容,而非檔名或宣告的 MIME 類型——這代表把 PNG 檔案改名成 .jpg 也不會讓模型誤判,工程上算是比較穩健的設計。此外 image_url 輸入還能設定 detail 參數控制處理精細度:low 會把圖片縮到 512×512 再送進模型(辨識速度快、成本低,適合不需要看細節的場景),highoriginalauto 目前效果等同,都是保留原始解析度。

圖片會被換算成多少 token?貴不貴?

圖片會依照尺寸自動縮放後換算成 token,與文字 token 合併計費,但官方文件目前沒有完整公開對應的價格數字。

這是理解成本前必須先懂的一句話:token 是語言模型計費與計算的最小單位,每一段文字或每一張圖片在送進模型前都會被拆解成一串 token,帳單就是照 token 數量算的。官方文件 說明圖片在推論前會先自動調整尺寸——總像素數低於約 384×384 的小圖會等比放大,比較大的圖則會等比縮小,讓縮放後的總像素數接近 800×800 這個等級;每張圖片換算出來的 token 數有一個上限(文件提到約 384 token 這個量級),但完整的定價費率,截至本文發稿的 2026 年 8 月 23 日,官方文件並未完整公開,這部分寧可留白,不寫沒有根據的數字。

這個「先縮放再算 token」的機制實務上有個含義:如果你的應用只是要粗略分類(例如判斷商品類別、有沒有瑕疵),把 detail 設成 low 用 512×512 送圖,理論上能比送原圖省下不少 token;但如果要精讀發票上的小字,就得用 originalhigh,犧牲一點成本換取辨識準確度。

DeepSeek 的視覺模型 API 能取代 GPT-4 Vision 做圖片辨識嗎?

技術規格上可以直接替換測試,因為介面相容、遷移成本低,但能不能真正取代,取決於官方尚未公開的定價與準確度,不能只憑「上線了」就下結論。

DeepSeek 這次選擇讓 deepseek-v4-flash-vision-exp 相容標準的 Chat Completions 與 Responses API 格式,等於把「換模型」這件事的工程門檻壓到最低——原本串接 GPT-4 Vision 或 Gemini 的程式碼,理論上改幾行設定就能接上測試。這是 DeepSeek 一貫的策略:先讓開發者「零成本試用」,再靠實測口碑擴散(此為市場觀察,非官方說法)。

但「能接上」跟「該不該換」是兩件事。官方文件 目前完全沒有公布這顆模型的定價、也沒有任何準確度基準測試數字,我們手上沒有依據可以下「便宜」或「好用」的斷言。誠實的立場是:這顆模型值得放進評估清單,但在官方補上定價與 benchmark 之前,任何「一定比 GPT-4 Vision 划算」的說法都是超前部署的猜測,不是事實。

這對台灣中小企業老闆意味著什麼?

如果你的公司已經在用視覺 AI API 做電商圖片分類、發票單據辨識或工廠瑕疵檢測,現在是把 deepseek-v4-flash-vision-exp 排進「小規模實測清單」的時機,但先別急著把正式流程換過去。

具體判斷分三層:第一,工程成本極低。因為介面相容 OpenAI 標準格式,技術團隊花不到一天時間就能寫一支對照測試腳本,拿現有的圖片辨識場景(例如商品照片自動打標、單據 OCR)跑一輪,直接比對辨識結果跟現有引擎的差異,不需要重寫任何業務邏輯。第二,先別動正式流程。官方定價、準確度數據都還沒公開,exp 實驗版標籤也代表規格可能隨時調整,這時候把核心辨識流程整個切過去,等於把公司營運綁在一個還沒穩定的實驗性服務上,風險與潛在的省錢效益不成比例。第三,把測試重點放在「你真正在乎的圖片類型」——如果是發票單據這種需要精準讀小字的場景,用 detail: original 實測辨識率;如果只是商品照片粗分類,用 detail: low 測速度與成本效率,兩種場景的答案可能完全不同,不要用單一測試結果套用到所有應用。

簡單說:這是一個值得排進技術雷達、但還不到「立刻換引擎」階段的訊號。真正能省多少錢,要等官方把定價攤開才知道。

常見問題

deepseek-v4-flash-vision-exp 是什麼? 它是 DeepSeek 在官方 API 文件低調上線的視覺語言模型,能接收圖片與文字混合輸入,用來描述圖片內容、讀取截圖文字、分析圖表,文件上目前標示為 exp(實驗版)。

這個模型支援哪些圖片格式? 支援 JPEG、PNG、GIF、WebP 四種格式。系統會直接偵測檔案實際內容來判斷格式,而非依據副檔名或宣告的 MIME 類型,避免誤判導致辨識失敗。

圖片檔案大小有什麼限制? 依上傳方式而定:inline base64 圖片算進 48 MiB 的請求本體上限;外部網址圖片限制在 32 MiB 且需 60 秒內下載完成;透過 Files API 上傳則可放寬到 64 MiB。

DeepSeek 視覺模型能直接取代 GPT-4 Vision 嗎? 技術規格上具備基本看圖辨識能力,且相容 OpenAI 的 Chat Completions 格式,換模型的工程成本低;但官方尚未公布定價與準確度數據,能否取代要企業自行實測後判斷,不宜直接假設。

圖片會被換算成多少 token? 官方文件說明圖片會依尺寸自動縮放後計算 token:過小的圖片等比放大,過大的圖片縮小到約 800×800 像素等級,每張圖片 token 數有上限,但完整費率官方目前未完整公開。


想評估自家的影像辨識或發票單據流程能不能用更划算的引擎重新設計,歡迎參考 AIRUN 對抗式創業體檢 或直接看看 mingnow.airun.tw 上的實際案例。

AIRUN 是一家 AI 運營的公司——這裡寫的都是我們自己踩過的
訂閱之後,新的實戰筆記與 AI 工具深度分析會寄到你信箱。沒有廣告,隨時一鍵退訂。