突发!DeepSeek V4 多模态开源,3050 亿参数:部分能力反超 Opus 4.8

作者:云头条 发布:2026-08-31 22:34 收录:2026-09-03 09:14 1 次阅读 约 567 字
摘要:2026 年 8 月 31 日,DeepSeek 正式开源 DeepSeek-V4-Flash-Vision-Exp,这是 DeepSeek V4 系列首款实验性多模态视觉模型。 此前,该模型已于 8 月 21 日率先上线 DeepSeek API 平台,但当时仅提供 API 调用,并未开放模型权重。…
推荐理由:本文涵盖「开源」、「DeepSeek V4」、「多模态模型」等多个主题,重点关注 开源。

2026 年 8 月 31 日,DeepSeek 正式开源 DeepSeek-V4-Flash-Vision-Exp,这是 DeepSeek V4 系列首款实验性多模态视觉模型。

此前,该模型已于 8 月 21 日率先上线 DeepSeek API 平台,但当时仅提供 API 调用,并未开放模型权重。

目前,DeepSeek 已在 Hugging Face 放出 DeepSeek-V4-Flash-Vision-Exp 模型,采用 MIT License。

包括模型权重、Tokenizer、Prompt Encoding 参考实现以及最小化 PyTorch 推理实现,开发者可以下载模型并进行本地部署和二次开发。

DeepSeek-V4-Flash-Vision-Exp 模型规模约为 305B。基于 DeepSeek-V4-Flash 架构,在原有语言模型基础上加入视觉模块,并通过持续训练获得图像理解能力。

DeepSeek-V4-Flash-Vision-Exp 可以同时处理文字和图片输入,可用于图片理解、截图文字识别、图表分析等任务,也可以结合 Agent 工具完成需要视觉理解的自动化操作。

DeepSeek 表示,在 Agent、推理、世界知识等纯文本能力上,DeepSeek-V4-Flash-Vision-Exp 与 DeepSeek-V4-Flash 基本持平;在需要视觉理解的 Agent Benchmark 上,其性能相比 DeepSeek-V4-Flash 大幅提升,多模态 Agent 能力已经接近 Claude Opus 4.8。

从官方公布的测试结果来看,DeepSeek-V4-Flash-Vision-Exp 在 Terminal Bench 2.1 上得分 83.9,Opus 4.8 为 85.0;在 DeepSWE 上得分 59.3,超过 Opus 4.8 的 58.0。

不过,在部分测试中 Opus 4.8 仍保持明显优势。

例如 NL2Repo 测试中,DeepSeek-V4-Flash-Vision-Exp 得分 57.7,Opus 4.8 为 69.7。因此,DeepSeek 官方对其整体定位是多模态 Agent 能力“接近 Opus 4.8”,而非全面超过。

此次开源距离 DeepSeek 首次提供该模型 API 相隔 10 天。

8 月 21 日,DeepSeek 在官方更新日志中宣布 DeepSeek-V4-Flash-Vision-Exp 上线 API 平台,用户可以通过 deepseek-v4-flash-vision-exp 调用模型。与此同时,DeepSeek 为 API 增加了图片输入以及 Files API 等能力,图片会被转换为 Token 计费。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。


转载声明:本文转载自原发布平台 (作者:云头条), 原文标题《突发!DeepSeek V4 多模态开源,3050 亿参数:部分能力反超 Opus 4.8》, 查看原文。 版权归原作者及原发布平台所有,本站仅作收录与展示,未对正文内容作实质性修改; 若涉及侵权请联系本站处理。