罗福莉:MiMo-V2.6的研发挑战已超过我参与过的DeepSeek R1
相关推荐
DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化
动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。
DeepSeek工程师刘胜与:会继续坚持写算子以及不断引入AI Agent写算子
火星财经消息 9月15日,DeepSeek机器学习系统(MLSys)工程师刘胜与发布对《我不得不把才华埋葬在昨天》的补充说明。“我写这篇文章本来的目的,并非要表达对失业的焦虑,更不是想强调DeepSeek的开放普惠与Anthropic的不讨喜,而是想和我过去手写算子的那段时光说句再见。”他表示,对于他未来能不能长久地把一件事情同时作为工作和爱好是悲观的,不过还是会继续坚持写算子、以及不断引入AI Agent写算子。此前,刘胜与在《我不得不把才华埋葬在昨天》一文中给出判断,等到AI写算子的水平高于他的那天,他不至于会“失业”,但必须要“转业”,需要放弃他深耕已久并充满热爱的算子设计、编写、优化领域,转而去做Agent的“机甲驾驶员”。(广角观察)
DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2
火星财经消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。
罗福莉憋了半年,小米把MiMo-V2.6强化学习直接直播了
动察 Beating AI 快讯,小米正在公开直播下一代 MiMo-V2.6 的强化学习训练。 负责人罗福莉称,团队沉默近半年,一直在研究强化学习到底还能扩展到多大规模。目前 V2.6 仍在训练,具体技术方案将在未来几周陆续开源。 这次一上来就把规模拉得很高。每一步使用 1568 个 prompt,每个生成 16 条 rollout,总计约 20 亿 Token,全程异步运行。代码、通用、视觉、网络安全和聊天等 Agent 任务,也被混在同一次训练里,并同时使用多套 harness。 外界可以实时看到每一步的任务组成、上下文长度、训练耗时等内部指标。UC Berkeley 博士生 Yichuan Wang 根据面板观察到,每一步约 1500 个任务,代码任务占约三分之二,同时活跃的沙箱超过 4 万个。
DeepSeek V4.1算子作者谈AI冲击:我不得不把才华埋葬在昨天
动察 Beating AI 快讯,DeepSeek 算子工程师刘胜与发文谈 AI 对自己工作的冲击。他称 DeepSeek V4.1 的主 Attention 算子由自己编写,但按照现在的进步速度,再过半年到一年,AI 写算子的水平大概率就会追上甚至超过自己。 一年前 AI 还只能帮他查文档、读代码、找 bug,现在已经能阅读 CUDA、PTX 和 SASS,分析每条指令的停顿时间,独立优化算子。他预计下一步,AI 还会自己设计调度方案、评估性能并完成实现。 他很清楚,自己把算子优化得越好,DeepSeek 模型的训练和推理就越快,AI 也会更快追上自己。但就算他现在停下来,其他公司的模型也不会停。所以他还是会继续把算子做到最好,只是这场竞争最后可能先革掉自己的命。 他判断自己大概率不会失业,但可能被迫「转业」,从亲手写算子变成操纵 Agent 的「机甲驾驶员」。他真正难以接受的不是饭碗消失,而是以后可能再也没有机会做自己喜欢的工作:「我不得不把才华埋葬在昨天。」 文章最后也谈到了他为什么留在 DeepSeek。他主张最前沿的 AI 应该开放、廉价地提供给所有人,并直言不相信 Anthropic 或 OpenAI 能做到这一点。他担心最强 AI 最终被少数公司掌握,让技术差距进一步变成权力和阶层差距。
字节ADrive即将独立上线:让Codex、豆包等Agent共用一套文件
动察 Beating AI 快讯,火山引擎智能网盘 ADrive 将在 9 月独立上线。目前 ADrive 已经开放试用,官方文档、产品条款和 CLI 均已上线,字节技术团队此前也多次公开介绍这款产品。 ADrive 给人和 Agent 提供同一个文件空间。Agent 生成的报告、代码、图片等文件可以直接存到云端,下次任务直接接着用,也可以换另一个 Agent 继续处理。 火山引擎此前已经演示过 Codex、豆包工作和 DeepSeek Harness 围绕同一个 ADrive 空间接力工作。官方 CLI 还支持 Agent 上传、下载、同步文件,并通过 MCP 调用网盘。 腾讯也预告了类似产品。腾讯网盘目前仍显示「Coming Soon」,尚未公开开放,但官网已经明确将支持 Agent 通过 CLI、MCP 调用文件,并与腾讯文档、WorkBuddy 等应用共享数据。