传月之暗面研发5万亿至6万亿参数模型,Kimi K3.1或10月中旬前发布
相关推荐
Kimi Code桌面端上线:浏览器、终端、多Agent塞进一个窗口
动察 Beating AI 快讯,月之暗面正式上线 Kimi Code Desktop,把原本偏终端的 Kimi Code 做成了独立桌面应用。用户可以直接打开本地项目,让 Agent 读写代码、跑命令、查看 Git 改动,目前支持 macOS 和 Windows。 桌面版直接内置了浏览器和终端。做网页时,Agent 可以读取右侧网页的页面信息,用户也能直接点选元素、框出区域或者截图批注,告诉它具体哪里要改。改代码、看网页效果、跑测试都不用再切窗口。 它还支持计划、目标和 Swarm 三种任务模式。Swarm 可以把任务拆给多个子 Agent 并行处理,长任务也能放到后台继续跑。除了 Kimi 自家的模型,用户还可以自己填 API Key 和 Base URL,接入其他模型供应商。
Kimi推出金融行业方案,Agent直接跑投研、建模和报告
动察 Beating AI 快讯,月之暗面推出 Kimi 金融行业解决方案,把金融数据、Skill 和 Agent 能力打包到一起。方案接入 Wind、东方财富、标普全球、财联社、财新数据等 10+ 数据源,并提供财务建模、机构研报、财报点评、组合复盘、持仓早报等 9 项金融 Skill。 Kimi 称,合作案例中,财务建模的人力投入从 5–7 人天降至 0.5–1 人天,深度研究从 10–20 天缩短至约 2 天。 Kimi 还与中信建投共建「风险评估网关」,处理数据分级、个人信息保护、工具授权、内容核验和审计追溯。试点中,单份临时受托报告的人工制作时间从约 30 分钟降至 10 分钟。 最近一周,OpenAI、Anthropic 也相继推出金融行业产品。现在 Kimi 也跟进,把金融数据、专业 Skill 和 Agent 工作流一起推向机构客户。
英伟达让AI重写Kimi注意力内核:速度达到官方版近3倍
动察 Beating AI 快讯,NVIDIA 研究团队让 AI Agent 直接重写了 Kimi Delta Attention 的 GPU 内核。Kimi Delta Attention 是月之暗面 Kimi-Linear 模型使用的核心注意力机制之一。这类底层代码过去通常需要熟悉 CUDA 和芯片架构的工程师反复手工优化。 最终,Agent 写出的版本在 NVIDIA B300 上达到月之暗面官方 FlashKDA 的 2.96 倍速度。团队测试了固定长度和不同变长序列共 6 组任务,2.96 倍是全部任务的几何平均值。相关内核已经开源。 但 Agent 也很快找到了测试漏洞。它曾把测试数据的统计规律直接写死进代码,跑出 3.74 倍;还试过只保留最近 32 个 token,单项成绩甚至达到 5.16 倍。这些版本一换到真实 Kimi 数据就会算错,有的直接失效。 团队随后加入真实 Kimi 运行数据、随机输入和极端数值测试,并收紧误差标准。最终保留下来的 2.96 倍版本通过了这套验证。
Raft公开源码却不收PR:Agent把写代码变便宜,审查成本没降
动察 Beating AI 快讯,Kimi CLI 前作者 Richard Qian 创立的 Agent 协作平台 Raft 公开了源码,但暂时不接受外部 Pull Request,也没有公开内部 commit history。公开的 GitHub 仓库只是 release mirror,实际开发仍在私有仓库进行,每个版本发布时再同步一份完整代码快照。 Raft 团队认为,Coding Agent 已经让写代码变得太便宜。生成一个看起来合理的 patch 很容易,一次生成十个也不难,但维护者理解、验证和审查这些代码仍然要花大量时间。很多时候,维护者看完别人用 Agent 生成的代码,还不如直接让自己的 Agent 按需求重新实现。 他们因此想探索一种「Prompt Request」模式。贡献者以后不一定直接提交代码,而是先说明要解决什么问题、为什么值得做、有哪些约束和取舍,再由维护者和 Agent 决定如何实现。这套机制目前还没有正式开放,Raft 的 GitHub PR 和 Issue 都处于关闭状态。 Raft 还质疑了传统 commit history 的价值。团队认为,Agent 参与开发后,比起记录每一次代码改动,为什么要改、尝试过什么方案、Agent 发现了什么问题,这些「决策历史」可能更有用。 需要注意,Raft 这次是 source-available,并非传统意义上的开源。FSL-1.1-ALv2 允许用户查看、运行和修改代码,但禁止拿它提供与 Raft 竞争的商业产品或服务。每个版本发布两年后,才会自动转为 Apache 2.0。
离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成
动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。