MiniMax把OpenAI新Agents API做成开源版,Codex、Claude Code都能接
相关推荐
OpenAI Codex产品负责人:明天将重新向新用户开放月费200美元的Pro订阅
火星财经消息 9月29日,OpenAI Codex产品负责人表示,明天将重新向新用户开放月费200美元的Pro订阅。但同时也将调整该订阅的用量计算方式。与原来的月费200美元Pro方案相比,新方案对应的API支出金额将只有原来的一半。明天还会为订阅增加更多不会计入用量的功能。暂时不会透露具体是什么。(广角观察)
传OpenAI下周发Codex Bot,直接对标Grok Bot
动察 Beating AI 快讯,AI 博主 Mark Kretschmann 爆料,OpenAI 正准备推出一款暂称 Codex Bot 的新产品,基于 OpenClaw 开发。原计划本周发布,目前已推迟到下周。 Sam Altman 今天刚表示,原定本周发布的「主要新东西」延至下周;而 OpenAI 今年 2 月招募 OpenClaw 创始人 Peter Steinberger 时,也称他将负责开发「下一代个人 Agent」。 Mark 称,Codex Bot 会比现有 ChatGPT Work 更像 Grok Bot。后者相当于一组长期在线的「AI 同事」,可以使用自己的工作环境,跨网站和 App 持续干活。
Codex Cloud升级,本地任务可以直接交给云端继续跑
动察 Beating AI 快讯,OpenAI 在 DevDay 给 Codex 做了一轮大更新。Codex Cloud 现在可以给项目保存一套可复用的云端开发环境,代码仓库、依赖、工具和权限配置一次,之后可以反复使用。 开发者可以直接在云端启动任务,也可以把本地 Codex 正在处理的工作交给 Cloud 接着跑。云端会使用自己的项目工作区继续改代码和跑测试,任务启动后不再依赖本地电脑。即使电脑休眠,也可以之后从桌面、网页或手机回来查看结果,再把改动同步回本地。 Codex CLI 还加入了语音控制和新的 /agents 页面,可以同时把工作分给多个 Agent。桌面端新增 Code Review,支持 GitHub PR 和 GitLab Merge Request,也能把第一轮代码审查交给云端完成。 Codex Security Cloud 也加强了自动安全检查,可以持续检查新的代码提交,或者定时扫描整个 GitHub 仓库,调查漏洞、去重并准备修复方案。Daybreak Blue 现在也直接包含在内,不需要再单独申请。
OpenAI Codex负责人:Codex 出现服务中断,团队正在进行修复
Odaily星球日报讯 OpenAI Codex 负责人 Tibo 在 X 上发文表示,目前已注意到 Codex 出现服务中断,团队正在努力恢复正常服务。
Claude Code自己给AI应用调优:改Prompt、换模型,变差就回滚
动察 Beating AI 快讯,Anthropic 给 Claude Code 的官方 claude-api Skill 加了一套自动调优工作流。build-eval 先从真实对话、Bug 或人工案例里做出测试集和评分方法,hillclimb 再让 Claude Code 反复修改系统 Prompt、工具说明、模型和推理强度。每次改完都重新跑测试,效果变好就保留,变差就回滚。 为了避免 Claude 只针对测试题优化,它不会拿所有样本一起调。部分案例用于找问题和改配置,另留一批案例检查修改能不能用在没见过的问题上。如果前面的分数涨了,留出的测试结果没有改善,这次修改就可能被判定为过拟合并撤回。 Anthropic 用 44 条客服工单演示了这套流程。Claude Code 先后清理 Prompt、补充业务规则、尝试不同模型并降低推理强度。最终找到一套 Sonnet 5 低 effort 配置。在 14 条没有参与调优的工单上,准确率从初始配置的 78.6% 提到 90.5%,成本降到约原来的五分之一。
OpenScience自测75.7%超过Codex:科研Agent开始自己循环跑实验
动察 Beating AI 快讯,Y Combinator 2026 冬季批次(YC W26)公司 Synthetic Sciences 正式发布开源科研 Agent OpenScience。它能查论文、处理数据、写代码和调用科研数据库,新加入的 Autoresearch 还能让 AI 自己连续跑实验。 比如训练一个模型,研究者只需要告诉它「把验证集 loss 降下来」。OpenScience 会先跑基线,再自己提出修改方案,一轮轮执行实验。结果变好就保留,变差就回退,再根据前面的结果决定下一步试什么。用户也可以提前限制运行次数、总时长和停止条件,或者规定「接下来只改优化器」。 OpenScience 把原本需要研究者反复盯着做的实验迭代自动化了:提出方案、执行实验、比较指标、淘汰失败方案,再继续下一轮。实验可以在本机运行,也可以交给远程 GPU、SSH 服务器和 Slurm/PBS 集群。每轮实验的代码、结果和判断都会留下记录,方便后续检查。 它还支持直接登录 ChatGPT/Codex 订阅,也可以接入自己的 API Key、本地模型,或使用官方按量付费的 Ace。 官方自测中,OpenScience 在 70 道 Terminal-Bench Science 任务中完成 53 道,得分 75.7%。作为对比,Codex + GPT-6 Astra 的公开成绩为 68.1%。