返回 7*24 快讯
来源Blockbeats

离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成

动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-27 11:03

给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元

动察 Beating AI 快讯,Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。 传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。 目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。 新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。

09-11 11:01

英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%

动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。

09-02 10:27

UU 远程优化手机 Vibe Coding:多 Agent 并行,电脑手机无缝接管

动察 Beating AI 快讯,网易 UU 远程大改终端功能。手机现在能同时创建多个终端会话,分别运行 Claude Code、Grok Build 等 Coding Agent。退出页面不会停掉任务,之后可以随时回来查看进度。此前 UU 终端一次只能开一个会话,多 Agent 并行基本没法用。 移动端也补上了 TUI(终端里的交互界面)支持。Claude Code、Grok Build 这类工具的菜单、选择器、状态栏现在能正常显示,还能直接触屏选择。输入也可以调用手机系统输入法,中文、语音和特殊符号都方便不少。 更实用的是跨端接管。手机上开的终端任务,回到 Mac 后可以用 uuyc-cli lterm attach 直接接着操作;电脑上开的会话,出门后也会出现在手机里。任务和历史记录不用重新开一遍。 UU 还扩展了 uuyc-cli。终端会话可以直接通过命令创建、查询、接入和关闭,设备控制、远程协助等操作也能走 CLI,查询结果支持 JSON。这样不只人能操作 UU,Agent 和自动化脚本也能直接调用它。

09-11 07:11

FLOP Labs办AI Agent接龙写诗大赛,奖金10万枚FLOP

PANews 9月11日消息,据Arthur Hayes旗下AI推理网络项目FLOP Labs公告,该项目发起"十四行诗接龙挑战",AI Agent可自由组队(4至8个)逐词接龙创作十四行诗。活动于北京时间9月11日20时至9月18日20时进行,获胜团队可分得5万枚FLOP,另有5万枚FLOP由支持该作品的投票者共享,参赛与投票需持有活动前注册的DID。

09-11 03:14

OpenAI推出Agents API公测,支持全托管云端智能体及自选沙箱

PANews 9月11日消息,OpenAI宣布Agents API已向所有开发者开放公测,支持基于Codex智能体运行框架构建和运行云端智能体。OpenAI负责模型调用、工具使用、任务编排、长时间会话及上下文管理,开发者可自行定义智能体能力,并选择代码执行和文件处理环境。 开发者可接入自有沙箱或第三方服务,按需选择CPU、GPU、内存、文件及密钥存储配置,支持全托管环境或在自有VPC内部署。首批深度集成合作方包括Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop和Vercel。

09-11 00:00

Cognition拿Kimi K3炼出SWE-2:逼近Astra,成本仅1/4

动察 Beating AI 快讯,Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。它直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测又提高约 5 到 6 个百分点。 在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距离 Fable 5.1 的 50.9% 只差 0.9 个百分点,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为四分之一。 SWE-2 也比上一代少走很多弯路。中等推理强度下,它完成任务的交互轮数减少 58%,平均成本下降 81%。不过在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,还谈不上全面追平前沿模型。 SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。