Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
相关推荐
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
腾讯T1专攻Agent长任务:连续操作300多轮,跑分涨20分
动察 Beating AI 快讯,腾讯把 Qwen3.5-122B-A10B 专门拿去练终端 Agent,做出了 T1。它主要处理 Linux 终端里的复杂任务,单个任务最多能连续调用工具 300 多轮。Terminal-Bench 2.1 得分从底模的 43.8% 升到 64.0%,涨了 20.2 分。 这 20.2 分里,大头来自强化学习。SFT 只把分数拉到 49.4%,后面的强化学习又涨了 14.6 分。团队准备了约 1.5 万个终端任务,每个任务都配有自动测试。Agent 没把整个任务做完,只要完成了其中一些要求,也能拿到相应奖励。 长任务还有一个麻烦。Agent 真正干活和之后拿这段经历训练时,同一句内容可能被重新切成不同 token,MoE 也可能换一批专家处理。T1 会把当时生成的 token 和选中的专家都记下来,训练时直接照着重放,把这种训推偏差压低了约三分之一。
阿里云:Token Plan个人版升级,新增12类Agent Harness工具
火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)
网络安全公司 Palo Alto Networks 斥资 5 亿美元收购 AI Agent 初创公司 Console
火星财经消息,据 Techcrunch 报道,网络安全巨头 Palo Alto Networks 宣布以 5 亿美元现金加股票方式收购 AI Agent 初创公司 Console。Console 成立于 2024 年,利用 AI Agent 自动执行密码重置、应用权限开通及日常 IT 故障排查等任务,客户包括 Ramp、Flock Safety 和 Scale AI。Palo Alto Networks 计划将 Console 整合至其 AI 驱动的安全平台 Cortex,使安全团队能够通过自然语言调查和处理安全警报,实现更加自动化的企业安全运营。据悉,本次也是 Palo Alto Networks 今年完成的第七笔收购,此前该公司还以 33.5 亿美元估值收购 Chronosphere,并以 4 亿美元收购网络安全初创公司 Koi。
离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成
动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。
蚂蚁百灵医疗模型Sante:仅51亿激活参数,诊断单项胜过GPT-5.6 Sol
动察 Beating AI 快讯,蚂蚁百灵推出医疗健康模型 Ling-3.0-flash-Sante。它基于 Ling-3.0-flash 强化医疗能力,采用 MoE 架构,总参数 1240 亿,但每个 token 只激活约 51 亿参数。重点能力包括医学推理、药物安全、循证检索和长流程医疗研究。 百灵公布的评测里,Sante 在 DiagnosisArena-MCQ 拿到 83.8 分,高于 GPT-5.6 Sol 的 81.9、Kimi K3 的 78.4 和 Gemini 3.6 Flash 的 76.2。MedXpertQA-Text 得分 53.9,也略高于 Kimi K3 的 53.5,但仍低于 GPT-5.6 Sol 的 60.2 和 Gemini 3.6 Flash 的 62.4。 它也没有只刷医学选择题。百灵还测试了 BrowseComp、DeepSearchQA 和 HLE with tools,重点强化「自己查资料再回答」的能力。医疗伦理和安全也单独做了测试,MedEthicAlign 得分 82.1,内部安全测试 AFUSAFE-MedSCE 得分 78.6。 Sante 已经接入 OpenRouter 和 Vercel,可免费调用。