【快讯】据第一财经报道,8 月 21 日下午,DeepSeek 官方 API 文档的模型详情页面上线新模型 DeepSeek-V4-Flash-Vision-Exp。
据悉,这是 V4 系列当中首款原生支持图片输入的视觉模型。该模型具备 100 万上下文窗口,最大输出长度 384K,支持 JSON 输出、工具调用、Responses API、Anthropic API 兼容以及对话前缀续写,图片将依据尺寸折算为 Token,和文本 Token 合并计费。
在纯文本能力方面,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
在定价层面,DeepSeek-V4-Flash-Vision-Exp 现阶段 API 资费与普通 V4-Flash 保持一致。缓存命中场景下,空闲时段 0.05 元 / 百万 Token,高峰时段 0.10 元 / 百万 Token;缓存未命中空闲时段 1.5 元 / 百万 Token、高峰时段 3 元 / 百万 Token;输出 Token 空闲 4.5 元 / 百万 Token,高峰 9 元 / 百万 Token。
距离 DeepSeek 开源 Agent Harness 框架刚过去一周,视觉能力便完成接入。以往相互独立的模型、图片、文件、工具、Agent 执行链路得以打通,DeepSeek 补齐了 Agent 体系重要的感知输入环节。