ARTICLE · 人工智能

刚刚!DeepSeek 多模态视觉理解模型上线

作者:CSDN 来源:CSDN 2026-08-21 18:00 6 分钟 1 阅读 1435 字
LLM多模态 AIAI 产品与应用模型发布AI 编程
一语总结

DeepSeek 发布实验性多模态视觉理解模型 V4-Flash-Vision-Exp,支持图片输入并接入 Agent 工作流,多模态能力接近 Opus-4.8,同时上线 Files API 优化图片调用体验。

AI 总结

DeepSeek 官方宣布实验性质的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台。该模型在保持纯文本能力与 V4-Flash 持平的同时,在视觉 Agent 任务上表现显著提升,官方称其多模态 Agent 能力已接近 Opus-4.8。API 支持 Chat Completions、Messages 和 Responses 三种调用格式,图片可通过 Base64 内联、外部 URL 或 Files API 传入,单张图片最多 384 Tokens,价格与 V4-Flash 一致。同时上线的 Files API 允许开发者预先上传图片并通过 file_id 引用,避免重复上传。文章指出该模型仍带 Exp 标识,实际效果与稳定性有待更多开发者验证。

核心要点
  1. V4-Flash-Vision-Exp 在视觉 Agent 任务上表现显著提升。

    纯文本版 V4-Flash 会忽略多模态元素,加入视觉能力后在 ApexBench 等测试中大幅跃升,官方称多模态 Agent 能力接近 Opus-4.8。

  2. API 兼容现有工作流,支持三种调用格式与三种图片输入方式。

    开发者可通过 model='deepseek-v4-flash-vision-exp' 调用,支持图文混合输入,图片以 Token 计费,单张最多 384 Tokens,价格与 V4-Flash 一致。

  3. Files API 同步上线,解决图片重复上传问题。

    开发者可预先上传图片获取 file_id,后续请求直接引用,减少带宽消耗,目前不收费。

  4. 模型仍为实验性质,稳定性与后续版本待定。

    带有 Exp 标识,实际效果需更多开发者测试验证,是否进入正式版本尚未确定。

刚刚!DeepSeek 多模态视觉理解模型上线

DeepSeek 官方宣布实验性质的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台。该模型在保持纯文本能力与 V4-Flash 持平的同时,在视觉 Agent 任务上表现显著提升,官方称其多模态 Agent 能力已接近 Opus-4.8。API 支持 Chat Completions、Messages 和 Responses 三种调用格式,图片可通过 Base64 内联、外部 URL 或 Files API 传入,单张图片最多 384 Tokens,价格与 V4-Flash 一致。同时上线的 Files API 允许开发者预先上传图片并通过 file_id 引用,避免重复上传。文章指出该模型仍带 Exp 标识,实际效果与稳定性有待更多开发者验证。