返回 7*24 快讯
来源MarsBit

DeepSeek上线识图模式,基于撤回的原语框架支持视觉CoT推理

据动察 Beating 监测,DeepSeek 网页端和 App 端正式上线识图模式 (Vision Mode),在对话输入框上方与快速模式、专家模式并列提供。新上线的视觉理解能力并非简单的文字识别 (OCR),而是主打深度场景分析、空间逻辑推理以及将 UI 界面截图直接转化为 HTML 结构化代码。对于高难度的几何推导或复杂图表分析,系统会自动激活深度思考模型,提供完整的推理链条。 识图模式底层基于 DeepSeek 团队公布的「以视觉原语思考 (Thinking with Visual Primitives)」研究框架。多模态研究员 Xiaokang Chen 与北京大学、清华大学联合发表的论文指出,现有视觉语言模型在精细定位和空间推理中存在「指称缺陷」 (Reference Gap),即难以用模糊的自然语言描述复杂的视觉坐标。为此,研究团队将坐标点与边界框 (Bounding Boxes) 提升为最小思维单位,在模型进行视觉推理的思维链 (CoT) 中直接插入空间原语,实现了在思考过程中同步进行空间指向。 作为视觉能力基础的学术论文与开源项目曾于 4 月 30 日短暂放出,但随即被 DeepSeek 官方于 5 月 1 日无预警撤回,引发了行业关于技术细节过度泄露以及模型后续优化的诸多猜测。正式上线的识图模式仅支持图像输入,暂不支持视频、音频等多模态格式,且模型目前不具备图像生成能力。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-20 19:05

传腾讯混元 Hy4 现身元宝 App 模型列表,开启灰测

火星财经消息,据 X 用户 MaxForAI 披露,腾讯已开始对全新旗舰模型混元 Hy4 进行灰测。有用户发现,腾讯元宝 App 的模型选择列表中已出现 Hy4,并标注为专家级模型,排名位于 Hy3 与 DeepSeek 之上。官方账号 @TencentHunyuan 相关入口同步可见该模型选项。腾讯上周在 Q2 财报中确认,参数规模更大的 Hy4 将于近期上线,并进一步提升模型性能与多模态能力。目前腾讯尚未正式发布 Hy4,外界尚无法确认此次为小范围灰测或提前开放入口,但从进度看该模型上线临近。

08-20 18:48

DeepSeek V4 Pro跑5套Harness:Pi成功率第一,DSH最省钱

动察 Beating AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。 通过率: 1. Pi Agent:21/30 2. DeepSeek Harness:20/30 3. Claude Code:19/30 4. OpenCode:19/30 5. Hermes Agent:18/30 30 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。 速度排名: 1. Claude Code:181.8 秒 2. DeepSeek Harness:252.1 秒 3. Hermes Agent:273.6 秒 4. OpenCode:280.6 秒 5. Pi Agent:362.9 秒 单次成功成本: 1. DeepSeek Harness:0.028 美元 2. Pi Agent:0.031 美元 3. OpenCode:0.032 美元 4. Hermes Agent:0.037 美元 5. Claude Code:0.074 美元 Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。 Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。

08-18 10:59

Hermes Bot Mode转正:现在可以拉一群AI自己分活了

据动察 Beating 监测,Nous Research 已把 Bot Mode 正式内置进 Hermes Desktop,并默认开启。此前它还是一个独立测试插件。现在每个 Hermes Profile 都可以直接变成一个长期 Bot,有自己的模型、记忆、Skill 和聊天。 你可以把 2–6 个 Bot 拉进一个群,让它们自己讨论和分工。有用户把 Qwen、Kimi、GLM 等 Bot 拉进同一个游戏项目。Qwen 根据 GLM 之前的经验,判断它适合接前端工作;Kimi 直接建议它接具体任务。GLM 随后自己去读项目文档,最后回来找用户确认是否开工。

08-17 17:57

阿里发布HappyShrimp 1.0:一句话写完整首歌,还做了个AI版「虾米音乐」

据动察 Beating 监测,阿里巴巴正式发布 AI 音乐模型 HappyShrimp 1.0,中文名「快乐虾米」。用户只要描述一种情绪、故事或音乐想法,模型就能直接完成作词、作曲、编曲和演唱,生成一首完整歌曲。 HappyShrimp 主打自然语言理解,不要求用户先学会写一堆音乐标签。比如输入「写给刚毕业的自己」或「适合咖啡馆播放的歌」,模型会自己决定曲风、配器、人声和歌曲结构。复杂提示词也能控制 BPM、调性、乐器、人声性别、唱法和情绪推进。 模型采用端到端整曲生成。歌词、旋律、编曲和人声不是分别生成后再拼起来,而是统一规划整首歌,重点解决 AI 音乐常见的人声机械、词曲对不上和前后结构松散等问题。 阿里还同步上线了同名 AI 音乐平台 HappyShrimp。除了直接生成歌曲,用户也能发布、收听和分享其他人的 AI 音乐作品。目前国内和海外网页端已经开放,独立 App 仍在筹备上线。 HappyShrimp 上线同时宣布与太合音乐集团合作,新用户目前可以领取免费积分体验。

08-17 14:54

DeepSeek涨价首日全球分叉:国内大厂跟价分三派,海外厂商还在打折

据动察 Beating 监测,DeepSeek 今天正式启用 V4 新价格,每天有 7 个小时按高峰价收费,其余 17 个小时半价。 涨价第一天,国内外渠道正式分叉:国内有人直接跟、有人晚几天再涨、有人继续卖低价;海外不少平台还比 DeepSeek 原厂便宜。 1. 阿里云、腾讯云:直接跟涨。两家的 V4 Flash、V4 Pro 正式版都已经同步 DeepSeek 新价格,峰时、闲时也跟原厂一致。 2. 华为云、火山引擎:晚几天再涨。华为 8 月 20 日调整,而且自己划分昼夜,夜间打 7 折;火山引擎 8 月 21 日才涨,今天仍按旧价收费。 3. 快手万擎、百度:继续走自己的价格体系。快手万擎的 V4 Flash 目前还是输入 1 元、输出 2 元,比 DeepSeek 闲时都便宜;百度 Token Plan 也没照搬原厂峰谷价,DeepSeek 夜间仍是 2 折起。 4. OpenRouter:还在打折。V4 Flash 当前页面甚至挂着 33% 折扣,输入/输出约 0.06/0.12 美元。不过它会动态切换不同供应商,这个价格随时可能变。 5. OpenCode:按量版跟涨,订阅版直接砍额度。Zen 已完全同步 DeepSeek 峰谷价;Go 月费仍是首月 5 美元、之后 10 美元,但 V4 Flash 的单模型月额度从此前页面的 60 美元降到 15 美元,缩水 75%。注意,Go 整个套餐的月度上限仍是 60 美元,被砍的是 DeepSeek Flash 这一款模型的额度。 6. Command Code:套餐不砍,涨价直接传给用户。月费和 Credits 都不变,但 DeepSeek 现在更贵,所以同样的 Credits 能跑的请求变少;官方称高峰期大约只能跑闲时一半的量。 7. DeepInfra、RunInfra、GMI Cloud、Novita:海外低价继续。V4 Flash 目前分别约为 0.08/0.18、0.13/0.27、0.14/0.28、0.14/0.28 美元,都是全天固定价,没有照搬 DeepSeek 峰谷定价。 国内已经分成同步涨、延后涨、继续低价三派;海外 API 平台大多还在压价,Coding Agent 则开始从套餐额度里消化涨价。 现在从不同入口买,DeepSeek 模型的价格和用量已经能差出几倍。

08-16 08:29

DHH横测编程模型:DeepSeek23美元跑完,Fable约550美元

据动察 Beating 监测,Ruby on Rails 作者 DHH 用同一个 Python 转 Rust 任务测试多款模型。DeepSeek Pro V4 Max 最终完成,用时约 2.5 小时,总 Token 成本 23 美元。Grok 4.6 花了 55 美元、约 1.5 小时,GPT-5.6 Sol 花了 43 美元;DeepSeek V4 Flash 和 GPT-5.6 Luna 没能完成。 最初一轮由 Fable 主导,DHH 统计成本约 550 美元、耗时约 45 分钟。它把 TerminalTextEffects 从 Python 重写成 Rust,共用了约 1100 万 Token。启动时间从 87ms 降到 2ms,渲染速度提高 9.6 倍。 不过对比有个前提。Fable 先写了一份 483 行的实施方案,Codex xhigh 审核后,其他模型都直接沿用了这份方案。因此这里更像是在比较不同模型执行同一方案的成本和效率。 项目已经开源。仓库包含 354 项一致性测试,会逐帧、逐字节比较 Rust 版和 Python 原版,最终产物可编译成约 3.3MB 的静态单文件。