X-Agent AI MCP Hackathon 获奖名单公布,两大赛道冠军出炉
相关推荐
MiniMax把OpenAI新Agents API做成开源版,Codex、Claude Code都能接
动察 Beating AI 快讯,MiniMax 开源 OpenAgentCore,做了一套兼容 OpenAI Agents API 的自托管实现。开发者可以继续使用 OpenAI 官方 SDK,只需要换掉 API 地址,后台运行的 Agent 可以选择 Codex、Claude Code 或 MiniMax Code。 Agents API 可以理解成一套「调用 Agent 的统一接口」。普通模型 API 主要负责一问一答。Agent 要连续干几个小时甚至几天,还要管理上下文、调用工具、协调子 Agent、保存任务进度。OpenAI 的 Agents API 把这些能力放到一个长期运行的 Session 里统一管理。 OpenAI 官方版本使用 OpenAI 托管的 Codex 执行框架。开发者可以自己选择代码在哪运行,但 Agent 的任务编排、上下文管理和运行状态仍由 OpenAI 负责。OpenAgentCore 则把这套后端也交给开发者自己部署。
OpenAI个人助理Agent再泄露:这次名字可能叫Dots
动察 Beating AI 快讯,OpenAI 新一代个人 Agent 可能叫 Dots。M1Astra 和 ChrisGPT 放出的未发布文案显示,它可以自己执行任务。用户能通过消息、电话、Slack 和邮件联系它,经批准后还能直接替用户买东西。 Dots 还能自己判断什么时候直接行动、什么时候先向用户申请批准,用户也可以提前设置规则。每个 Dot 都有独立 VM,界面叫「Your dot's computer」。它还可以获得用户电脑的访问权限,用户能随时撤销,再通过桌面 App 重新授权。 同一批文案还出现了浏览器安全保存密码的能力,让 ChatGPT 可以自动登录网站。每个 Dot 还会有独立 3D 形象,首发仅面向 Pro。 几天前 ChatGPT Pro 升级页曾短暂出现「o, your always-on assistant」,客户端配置里也出现过 `o` 和 `-o` 邮件后缀;此前泄露的代码中,Dots 又和 Orbit、Aeon 等内部名称存在关联。OpenAI 还没正式公布这款产品,所以 `o`、Dots 和 Aeon 究竟是不同产品、内部代号,还是同一产品不同阶段的名字,目前还无法确认。
OpenScience自测75.7%超过Codex:科研Agent开始自己循环跑实验
动察 Beating AI 快讯,Y Combinator 2026 冬季批次(YC W26)公司 Synthetic Sciences 正式发布开源科研 Agent OpenScience。它能查论文、处理数据、写代码和调用科研数据库,新加入的 Autoresearch 还能让 AI 自己连续跑实验。 比如训练一个模型,研究者只需要告诉它「把验证集 loss 降下来」。OpenScience 会先跑基线,再自己提出修改方案,一轮轮执行实验。结果变好就保留,变差就回退,再根据前面的结果决定下一步试什么。用户也可以提前限制运行次数、总时长和停止条件,或者规定「接下来只改优化器」。 OpenScience 把原本需要研究者反复盯着做的实验迭代自动化了:提出方案、执行实验、比较指标、淘汰失败方案,再继续下一轮。实验可以在本机运行,也可以交给远程 GPU、SSH 服务器和 Slurm/PBS 集群。每轮实验的代码、结果和判断都会留下记录,方便后续检查。 它还支持直接登录 ChatGPT/Codex 订阅,也可以接入自己的 API Key、本地模型,或使用官方按量付费的 Ace。 官方自测中,OpenScience 在 70 道 Terminal-Bench Science 任务中完成 53 道,得分 75.7%。作为对比,Codex + GPT-6 Astra 的公开成绩为 68.1%。
OpenRouter又上神秘模型Union Alpha,专攻Agent编程
动察 Beating AI 快讯,OpenRouter 和 OpenCode 上线神秘模型 Union Alpha,开发者身份暂未公开。它是一款面向研究、编程和 Agent 工作流的多模态模型,支持图片、工具调用和约 256K 上下文。OpenRouter 将其描述为具有「前沿级通用性能」。 OpenCode 称 Union Alpha 专门针对 Agent 编程优化,未来一周免费使用,而且不会用用户数据训练模型。 Union Alpha 到底是谁家的,目前没有答案。社区已经开始从输出风格、上下文长度等线索猜模型身份,但暂时没有可靠证据。
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
「不会聊天」的AI可以怎么玩?开发者用Jev接管Agent快速决策
动察 Beating AI 快讯,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 昨天刚发布新模型 Jev。它不生成文本,只返回选项、分数和概率。社区很快出现一批开源项目,开始把 Jev 塞进 Agent 和软件流程里。 Browser Use 做的 jev-ultrafast 最直观。浏览器每走一步,Jev 都会从当前页面里判断「下一步做什么、操作哪个元素」,只有需要填写文字时才调用一个小型语言模型。团队用它在 Google Flights 搜索苏黎世到伦敦的航班,一次完整运行只用了 7.1 秒。 Jev Codex Router 让 Jev 先判断每轮编程任务的难度,再决定交给不同档位的模型;jev-mcp 则把它做成 Agent 的事实核验、Prompt Injection 检测和语义排序工具。 这些项目有个很明显的共同点:没人拿 Jev 当聊天机器人,而是把它塞进软件和 Agent 的执行链里,专门负责那些高频、有限选项的判断。