返回 7*24 快讯
来源MarsBit

DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2

火星财经消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-21 17:31

DeepSeek上线多模态视觉理解模型V4-Flash-Vision-Exp,并开放 API 服务

PANews 8月21日消息,据DeepSeek公众号,DeepSeek 已上线多模态模型 V4-Flash-Vision-Exp,并开放 API 服务。该模型在原有 V4-Flash 能力基础上,引入图像理解与视觉生成能力,支持文本、图片等多模态输入输出场景,面向开发者提供推理、生成等能力调用接口,标志其模型体系从单一文本模型向多模态产品矩阵延展。

08-20 15:47

DeepSeek-V4-Flash 持续免费开放,B.AI 一站式 AGI 基础设施赋能创新

ChainCatcher 消息,8 月 20 日,B.AI 平台 DeepSeek-V4-Flash 零门槛免费开放活动持续进行中。B.AI 秉持“普惠算力”愿景,致力于打造全球领先的一站式 AGI 基础设施,持续降低 AI 使用门槛,让开发者和 Web3 用户轻松体验、构建与部署 Agentic 应用。依托一站式 AGI 基础设施,B.AI 聚合全球前沿模型矩阵,内置智能路由优化成本与效率;稳定承载百万级长上下文、Agent 工作流等高吞吐场景;弹性 API 路由兼顾生产级高可用与极致性价比;Web2/Web3 双通道打通加密资产与法币结算。目前 DeepSeek-V4-Flash 在 Web 与 API 双端持续免费开放,$0 畅用顶尖模型能力。

08-19 19:34重要

DeepSeek-V4-Flash 上线 48 小时吞吐量达 2200 亿,B.AI 持续零门槛免费开放

ChainCatcher 消息,8 月 19 日,B.AI 平台重磅宣布 DeepSeek-V4-Flash 零门槛免费开放活动上线仅 48 小时,平台 Token 吞吐量突破 2200 亿大关。目前 B.AI 平台活动热度持续攀升,免费算力全线拉满,所有用户登录即可无限次调用 Coding 辅助、多 Agent 复杂调度、超长文本深度处理及高并发 API 工作流等全栈能力,算力成本由 B.AI 全额兜底,无需繁琐门槛,即登即用——现在就来 B.AI,解锁真正不限量的智能加速体验。

08-16 22:20重要

B.AI 宣布 DeepSeek-V4-Flash 将于 8 月 17 日全量免费开放

ChainCatcher 消息,距离 DeepSeek-V4-Flash 于 8 月 17 日在 B.AI 平台全量免费开放仅剩最后 1 天。届时 Web 端与 API 将同步上线,用户可免费畅享代码运行、复杂 Agent 任务及长文本处理等全场景体验。 为助力开发者无惧成本使用 DeepSeek,B.AI 同步推出三重福利:新用户通过 Binance Wallet、Bitget Wallet 或 imToken 钱包登录,即可领取 100 万免费 Credits;填写邀请码可再叠加 30 万,累计最高达 130 万;新老用户充值均可享受最高 100 美元的额外 Bonus Credits。 需注意,账户须保留少量 Credits 用于身份验证,请提前准备。具体开放时间将于近期公布,敬请锁定 B.AI 官方动态。

08-15 11:14

DeepSeek-V4-Pro被曝「一个API三个模型」?社区测试揭示背后或是Agent环境差异

BlockBeats 消息,8 月 15 日,近日 AI 社区热议 DeepSeek-V4-Pro 疑似存在多个版本。有用户发现,同样调用 deepseek-v4-pro 接口,在更换 IP 或重新创建会话后,模型会出现三种不同的「推理风格」: 一类频繁以「Let me」开头,接近此前 V4 Pro Preview;一类常出现「The user wants me」,类似 V4 Flash;另一类大量使用「we」,被部分用户称为能力更强的「神版 V4 Pro」。 由于同一会话一旦进入某种模式后,后续表现通常保持稳定,社区一度猜测 DeepSeek 是否在 API 背后隐藏了多个模型,并通过路由机制分发。不过,进一步分析 DeepSeek Harness 源码后,出现了另一种解释:差异可能并非来自不同模型权重,而是来自 Agent 运行环境。 社区发现,8 月 10 日,DeepSeek Harness 官方仓库更新了一条关键 commit: 「fix(preset): align minimal agent with RL composition」 该更新旨在让 Minimal Agent 与强化学习(RL)训练时使用的 Agent 环境保持一致。 官方文档显示,Minimal preset 包含极简 system prompt、persistent Bash 环境、指定编辑工具、RL 训练使用的 compaction policy,并移除了额外身份提示、Web 提示及工具说明。 这意味着,DSH Minimal 可能并不是 Standard 版本的「阉割版」,而是在模拟模型训练阶段真实接触的 Agent 环境。 社区测试也支持这一观点。同一个 DeepSeek V4 Pro 在不同 Harness 环境下表现: DSH Standard:91 分; DSH PTC:92 分; DSH Minimal:99/96 分。 随后,测试者开发「Anchored Standard」插件:首次请求模拟 Minimal 环境,只开放 shell 和 read 工具,完成首次工具调用后再恢复 Standard 完整工具集,结果连续获得 98/99 分。 测试者认为,决定 V4 Pro Agent 能力发挥的关键,可能并非最终拥有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent

08-13 20:52

DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装

据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。