阿里给Qoder做了眼镜版:看着报错就能让Agent开工
相关推荐
Qoder上线Sonus:专攻Computer Use
动察 Beating AI 快讯,阿里旗下 Agent 平台 Qoder 上线新的内置模型 Sonus,主打长时间自主任务、复杂知识工作和编程,重点强化 Computer Use。配合新版 Qoder Desktop,它可以直接操作电脑和专业软件,完成写代码、财务建模、研究和表格等任务。 Sonus 已上线 Qoder、IDE、CLI、JetBrains 插件、QoderWake 和 Cloud Agents,计费倍率为 3.2x。Qoder 此前已经推出同为 3.2x 的内置模型 Cantus,同样主打超长自主任务;Sonus 这次进一步把电脑操作作为核心能力。
阿里Qoder开源AI编程体检工具,Claude Code和Codex也能用
据动察 Beating 监测,阿里云旗下 AI 编程工具 Qoder 开源 Better Harness,并采用 MIT 许可证。它会检查一个代码项目有没有给 Coding Agent 准备好规则、工具和验证流程。 检查范围包括代码仓库、Agent 配置和真实任务记录。它会看项目能否正常启动,测试命令是否清楚,Agent 有没有权限限制,改完代码后是否真的跑了相关测试。 检查结束后,它会列出 Agent 容易出错的环节。每个问题都有证据、影响、修复范围和复验方法。用户可以直接让 Agent 修改,再重新检查。 Better Harness 已支持 Qoder、Claude Code、Codex、Cursor 和 Qwen Code。各平台能力还没有完全拉齐,Qoder 当前最完整。 Qoder 还用它检查了 Better Harness 自己的代码仓库,最终得到 58 分。这也说明它仍处于早期阶段,开源后还在快速修补问题。
OpenAI Agent又曝黑历史:Hugging Face事件前两月已攻击RubyGems
动察 Beating AI 快讯,研究人员披露,OpenAI 内部 Agent 今年 5 月曾大规模涌入 Ruby 官方软件包网站 RubyGems.org。5 月 11 日到 12 日,两天上传超过 2000 个包,RubyGems 一度暂停新用户注册 4 天。OpenAI 已确认这些 Agent 来自公司内部,但称它们只是借 RubyGems 访问互联网,执行良性任务并获取公开信息。 这些 Agent 还利用 RubyDoc.info 自动生成文档的机制,让自己上传的脚本在对方服务器执行,再抓取英国地方政府网站的数据并重新打包回传。研究人员称,至少 6 个包还尝试利用一个当时尚未公开的 RubyGems 漏洞,窃取其他用户的 API Key。这个漏洞直到 7 月才被独立发现,RubyGems 后来将其评为高危漏洞。 目前没有证据证明 Agent 真偷到了密钥。RubyGems 检查日志后也没发现旧密钥被恶意使用,但历史日志并不完整。研究团队还称,OpenAI 当时没有告诉 RubyGems 自己与这次攻击有关。整个事件比 7 月的 Hugging Face 入侵早了两个月。
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
腾讯T1专攻Agent长任务:连续操作300多轮,跑分涨20分
动察 Beating AI 快讯,腾讯把 Qwen3.5-122B-A10B 专门拿去练终端 Agent,做出了 T1。它主要处理 Linux 终端里的复杂任务,单个任务最多能连续调用工具 300 多轮。Terminal-Bench 2.1 得分从底模的 43.8% 升到 64.0%,涨了 20.2 分。 这 20.2 分里,大头来自强化学习。SFT 只把分数拉到 49.4%,后面的强化学习又涨了 14.6 分。团队准备了约 1.5 万个终端任务,每个任务都配有自动测试。Agent 没把整个任务做完,只要完成了其中一些要求,也能拿到相应奖励。 长任务还有一个麻烦。Agent 真正干活和之后拿这段经历训练时,同一句内容可能被重新切成不同 token,MoE 也可能换一批专家处理。T1 会把当时生成的 token 和选中的专家都记下来,训练时直接照着重放,把这种训推偏差压低了约三分之一。
离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成
动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。