梁文锋署名DeepSeek发新论文,剑指大规模Agent训练
相关推荐
DeepSeek工程师刘胜与:会继续坚持写算子以及不断引入AI Agent写算子
火星财经消息 9月15日,DeepSeek机器学习系统(MLSys)工程师刘胜与发布对《我不得不把才华埋葬在昨天》的补充说明。“我写这篇文章本来的目的,并非要表达对失业的焦虑,更不是想强调DeepSeek的开放普惠与Anthropic的不讨喜,而是想和我过去手写算子的那段时光说句再见。”他表示,对于他未来能不能长久地把一件事情同时作为工作和爱好是悲观的,不过还是会继续坚持写算子、以及不断引入AI Agent写算子。此前,刘胜与在《我不得不把才华埋葬在昨天》一文中给出判断,等到AI写算子的水平高于他的那天,他不至于会“失业”,但必须要“转业”,需要放弃他深耕已久并充满热爱的算子设计、编写、优化领域,转而去做Agent的“机甲驾驶员”。(广角观察)
DeepSeek Harness补上Browser Use和Computer Use:现在能操作网页,也能接管本机App
动察 Beating AI 快讯,DeepSeek Harness 最新的 v0.1.6-alpha.1 同时新增实验性 Browser Use 和 Computer Use。模型现在既能直接操作网页,也能查看并控制本地桌面。 Browser Use 支持 Playwright MCP、Chrome DevTools MCP 和 Stagehand,可以直接操作网页。Computer Use 则接入 Cua Driver,可找到具体 App 和窗口、获取当前界面截图,再根据界面元素或坐标执行点击和输入。官方提供 MCP 和原生两种 Computer Use 接入方式。 两项能力目前都属于实验性功能,需要手动启用。Computer Use 还需要给实际运行它的应用授予屏幕读取和电脑操作权限。
DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化
动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。
DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2
火星财经消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。
OpenAI推出Agents API公测,支持全托管云端智能体及自选沙箱
PANews 9月11日消息,OpenAI宣布Agents API已向所有开发者开放公测,支持基于Codex智能体运行框架构建和运行云端智能体。OpenAI负责模型调用、工具使用、任务编排、长时间会话及上下文管理,开发者可自行定义智能体能力,并选择代码执行和文件处理环境。 开发者可接入自有沙箱或第三方服务,按需选择CPU、GPU、内存、文件及密钥存储配置,支持全托管环境或在自有VPC内部署。首批深度集成合作方包括Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop和Vercel。
DeepSeek V4.1 Flash模型正式发布
PANews 9月10日消息,DeepSeek正式发布DeepSeek V4.1 Flash模型。这是公司全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。据介绍,新一代模型大幅减少了KV Cache缓存的大小,与上一代模型相比,对HBM的需求减少到1/4,对SSD的需求减少到1/8。在Agent使用场景中,缓存命中的费用往往占比较高,对KV Cache的压缩大幅降低了Agent类任务的使用成本。