Instinct长期记忆被逆向:Git+Markdown,和Supermemory几乎同一路线
相关推荐
个人Agent也有实战榜了:Muse暂列第一,领先Instinct和Grok Bot
动察 Beating AI 快讯,独立评测项目 Assistant Benchmark 开始用真实任务横评个人 AI 助手。它直接让 Agent 订酒店、选餐厅、买东西、回邮件、连接第三方服务,再按实际完成情况打分。每个评分维度都有一个公开的固定任务,并要求有真实运行记录才给分。 目前 Muse 在已经完成的 7 个评分维度中平均 9.1 分,暂列第一;Instinct 测完 11 个维度,平均 8.4 分;Grok Bot 测完 7 个维度,平均 7.3 分。Muse 在购物、邮件和第三方应用连接上都拿到 10 分。 不过这更适合看成一份持续更新的真实体验榜。Muse 的 9.1 目前只是已测 7 个维度的平均分,并不是完整成绩。每个维度目前也只用一个固定任务测试,后续补测后分数和排名都可能变化。
给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元
动察 Beating AI 快讯,Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。 传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。 目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。 新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。
Kimi Code桌面端上线:浏览器、终端、多Agent塞进一个窗口
动察 Beating AI 快讯,月之暗面正式上线 Kimi Code Desktop,把原本偏终端的 Kimi Code 做成了独立桌面应用。用户可以直接打开本地项目,让 Agent 读写代码、跑命令、查看 Git 改动,目前支持 macOS 和 Windows。 桌面版直接内置了浏览器和终端。做网页时,Agent 可以读取右侧网页的页面信息,用户也能直接点选元素、框出区域或者截图批注,告诉它具体哪里要改。改代码、看网页效果、跑测试都不用再切窗口。 它还支持计划、目标和 Swarm 三种任务模式。Swarm 可以把任务拆给多个子 Agent 并行处理,长任务也能放到后台继续跑。除了 Kimi 自家的模型,用户还可以自己填 API Key 和 Base URL,接入其他模型供应商。
MiniMax Code突然宣布今晚开源,源码即将上GitHub
动察 Beating AI 快讯,MiniMax Code 突然宣布将在今晚开源。 MiniMax Code 是 MiniMax 的桌面 AI 编程 Agent,可以直接改项目文件、运行命令和审查代码,也支持多个 Agent 分工协作。用户还可以通过手机远程查看任务进度和批准操作。 MiniMax 早已建好 minimax-code GitHub 仓库,但此前主要用来收集 Bug 和功能建议。目前仓库里仍只有 README 和 Issue 模板,还没有客户端源码。
Zed给AI编程装上「行车记录仪」,直接关掉GitHub PR
动察 Beating AI 快讯,AI Agent 写代码越来越快,代码评审反而成了新的瓶颈。 过去,一个 Pull Request 通常对应开发者几小时甚至几天的工作。现在 Agent 可以一次改几十个文件,但评审者最后看到的,往往只有一份巨大的代码差异,很难知道这些修改是在什么要求下产生,又经过了哪些尝试。 Zed 新开放公测的 Delta,想把这部分过程重新补回来。它会把 Agent 对话、每一次代码修改和后续评论放进同一份历史里。看到一段有问题的代码,可以直接往前追,看看当时提了什么需求,Agent 又是怎么一步步改到这里。 评审也不再等到开发结束才开始。开发者可以随时另开一个线程,让人或另一个 Agent 检查当前代码,并在独立副本里继续修改。 Zed 已经先在自己身上试了。Delta 仓库关闭了 GitHub Pull Request,33 名成员已经通过 Delta 向主分支合入 570 次改动。 Git 仍然保留,commit、push 和构建流程都不受影响。Zed 真正想改的是代码评审这一层:当越来越多代码由 Agent 生成,只看最终 diff,可能已经不够了。 Delta 目前支持 macOS、Linux、Windows 和网页端,公测期间免费。MCP 和远程运行环境等功能还在开发。
Exa给AI搜索装上时光机:4000亿网页快照,防止Agent偷看未来
动察 Beating AI 快讯,Exa 上线 Snapshot,可以让搜索直接「回到过去」。它收录了超过 4000 亿份网页快照,跨度约 20 年。开发者指定一个时间,Exa 的搜索和网页读取 API 就会返回当时已经保存下来的网页版本。 最直接的用途是防止 AI 评测「偷看答案」。比如一道题 6 月设计、9 月才拿给 Agent 做,答案可能早已出现在论文、GitHub PR 或博客里。现在可以把搜索时间锁在 5 月,Agent 就看不到后来才公开的答案。金融团队也能用同样的方法做历史回测,只给模型看当时已经存在的信息。 不过这个「时光机」目前还有限制。它能保证你看到的是当时版本的网页,但搜索结果不一定和当年一模一样。普通付费用户目前也只能往前查最近 5 个月,想查更早的历史需要联系 Exa。