快速了解本文
DeepSeek 上线实验性多模态视觉模型 V4-Flash-Vision-Exp。
该模型支持图片输入,兼容 JPEG、PNG、GIF、WebP 格式。
Files API 已开放且不收费,有助于节省请求带宽与成本。
本摘要由 AI 辅助整理,请以正文内容为准。
01模型上线与基本能力
数智朋克讯 8 月 21 日,深度求索宣布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 上线 DeepSeek API 平台,面向开发者开放调用。该模型为实验性质,支持在文本之外输入图片,可描述图片、识别截图中的文字、分析图表,兼容 JPEG、PNG、GIF、WebP 格式。
02API 调用与计费方式
开发者可通过设置 model='deepseek-v4-flash-vision-exp' 访问该模型。多模态 API 支持 Chat Completions、Messages、Responses 三种调用格式,图片传入支持 base64 内联、外部 URL、Files API 三种方式。其中 Files API 已开放且不收费,用户可先上传图片,再通过 file_id 引用,同一张图片在多个请求中无需重复上传,有助于节省请求带宽与重复上传成本。API 中图片会转换为 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。
03性能表现与应用场景
在纯文本能力(Agent、推理、世界知识等)方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平。在需要视觉理解的 Agent Benchmark 上,该模型相比 DeepSeek-V4-Flash 实现大幅跃升,多模态 Agent 能力接近 Opus-4.8。官方表示,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出较好的多模态适配能力,可支持借助多样化 Agent 工具解锁更多工作场景。







粤公网安备44030002001270号