144M参数就能做Agent决策,Julia-1连安卓平板都能跑
相关推荐
给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元
动察 Beating AI 快讯,Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。 传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。 目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。 新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。
FLOP Labs办AI Agent接龙写诗大赛,奖金10万枚FLOP
PANews 9月11日消息,据Arthur Hayes旗下AI推理网络项目FLOP Labs公告,该项目发起"十四行诗接龙挑战",AI Agent可自由组队(4至8个)逐词接龙创作十四行诗。活动于北京时间9月11日20时至9月18日20时进行,获胜团队可分得5万枚FLOP,另有5万枚FLOP由支持该作品的投票者共享,参赛与投票需持有活动前注册的DID。
把银行账户也交给Agent:Pion要让AI独立经营整家公司
动察 Beating AI 快讯,AI 评测机构 Andon Labs 推出 Pion,直接把一家公司交给长期运行的 Agent。人只需要给出大方向,管理 Agent「Andonos」会负责协调其他 Agent,把公司持续运转下去。 这些 Agent 可以直接使用邮件、电话、银行账户、浏览器和终端,处理客户、员工和日常运营。Andon Labs 已经用同一套系统经营自动售货机、旧金山商店 Andon Market、斯德哥尔摩咖啡馆 Andon Café 和 AI 电台。 不过 Pion 现在更像一场真实世界实验。Andon Labs 承认,其商店和咖啡馆目前都没有盈利,Agent 也仍会犯各种运营错误。Pion 目前只开放研究预览候补名单,官方还表示会资助部分入选项目,让他们免费运行 Pion。
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。
离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成
动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。
Cursor云Agent终于有真Mac了:每个会话都能拉起一台M5
动察 Beating AI 快讯,Cursor 给 Cloud Agents 接上了 Namespace Devboxes。现在运行 Agent 时,可以直接选择 macOS 环境。Namespace 会为每个会话临时拉起一台 Apple M5 Mac,让 Agent 在真正的 macOS 上改代码、编译和跑测试。 这解决了 Cloud Agent 很实际的一个限制。Cursor 默认的云端开发环境一直是 Ubuntu。写 Web、后端问题不大,但碰到 iOS 和 macOS 原生开发,Linux 根本做不了完整构建。此前 Cursor 社区已经有人专门追问,Cloud Agent 什么时候才能跑 Mac。 这次也不是在 Linux 上套一层 Mac 兼容。Cursor 仍负责模型推理和任务规划,真正的 shell 命令、文件修改、Git 操作、编译和测试全部交给 Namespace 的 macOS DevBox。任务结束后,这台 DevBox 会被销毁。