摘要
DeepSeek 在 Hugging Face 以 MIT 许可放出 DeepSeek-V4-Flash-Vision-Exp 权重:V4 家族首个实验性多模态模型,在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练。模型卡给出的对比基准(V4-Flash-0731 与 Opus-4.8):Terminal Bench 2.1 83.9(82.7 / 85.0)、DeepSWE 59.3(54.4 / 58.0),多模态 agent 基准明显跃升——ApexBench 36.5,而忽略多模态输入的文本版只有 26.2。API 早于 8/21 已在 DeepSeek 平台上线(model 设为 deepseek-v4-flash-vision-exp 即可);8/31 补齐了权重与最小化 PyTorch 参考实现。
为什么重要
这意味着中国开源权重浪潮正从纯文本 coding agent 延伸到多模态 agent:MIT 开放权重、保持接近前沿的文本 agent 成绩、补上视觉能力,而服务成本仍在 Flash 档。已经在自托管 V4-Flash 的团队可以不换模型家族就获得截图 / OCR / 图表类 agent 工作流的入口;但 -Exp 定位、仅厂商 benchmark、vLLM 生态尚需适配,意味着它更适合先评估再上线,而不是直接当默认模型。
技术细节
| 许可证 | MIT |
|---|---|
| 架构 | 基于 DeepSeek-V4-Flash;新增 vision encoder 与 aligner;仓库含 tokenizer、prompt 编码参考与最小化 PyTorch 推理实现(覆盖 vision encoder、aligner、DFlash 注意力、MoE、Hyper-Connections、DSpark 前向路径) |
| 文本 Agent 基准 | Terminal Bench 2.1:83.9(V4-Flash-0731 82.7,Opus-4.8 85.0);NL2Repo 57.7(54.2 / 69.7);CyberGym 75.3(76.7 / 78.3);DeepSWE 59.3(54.4 / 58.0);Toolathlon-Verified 75.9(70.3 / 76.2);DSBench-Hard 63.6(59.6 / 71.7);AutomationBench(公开集)25.7(25.1 / 27.2) |
| 多模态 Agent 基准 | ApexBench Pass@1:36.5(忽略多模态输入的 V4-Flash-0731 为 26.2,Opus-4.8 39.4);Agents' Last Exam 27.3(25.2 / 25.7);Chartography 64.3(Opus-4.8 65.0);ZeroBench Pass@5 35.0(Opus-4.8 34.0) |
| 评测设置 | 文本 agent 基准用 DeepSeek Harness minimal mode 作为 agent 框架、max 推理档、temperature 1.0、top_p 0.95 |
| API | 约 2026-08-21 起在 DeepSeek API 平台可用(官方 news260821);model 名 deepseek-v4-flash-vision-exp;输入为图像 + 文本 |
| 采用 | 截至 2026-09-02T00:07Z(权重落地约 1 天)17,893 下载 + 452 likes |
后续更新
2026-09-05 Adoption check @2026-09-05: 133,024 downloads (from ~17.9k at 8/31-9/1) + 595 likes — the steepest relative pull-rate of this window's open-weight cohort; independent runs and vLLM/transformers support status still to verify next cycle. Stays WATCH
标签
open-weightsmultimodalvisionagentmoemit-licensedeepseek