Laminar把Agent查错成本压到GPT-6-sol的1/23
相关推荐
OpenAI 28天冲刺首日:GPT-6 Astra和6.1 Sol提速约50%
动察 Beating AI 快讯,OpenAI 产品与平台主管 Thibault Sottiaux 公布 28 天产品冲刺的首日更新。GPT-6 Astra 和 GPT-6.1 Sol 的默认生成速度已经优化,官方称整体约提升 50%。 这次提速不仅覆盖 Codex 和 ChatGPT Work。通过「Sign in with ChatGPT」使用 ChatGPT 订阅额度的第三方产品也会同步生效,包括 OpenCode、Pi、Amp 和 Devin 等。用户不需要修改任何设置,更新会自动推送。 OpenAI 此前承诺,未来 28 天每天要么交付一项对多数 Codex / Work 用户有明确改善的更新,要么直接重置用户额度。这次提速就是 Day 1。
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
OpenAI 推出 GPT-6.1 Sol 模型,性能接近 Astra
ChainCatcher 消息,OpenAI 推出 GPT-6.1 Sol 模型,其性能接近 Astra,但标准词元价格仅为 Astra 的五分之一。
AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
动察 Beating AI 快讯,Artificial Analysis 推出独立的 Cyber Index,专门评测 AI Agent 做企业网络防御的能力。它不是从原来的通用 Intelligence Index 里抽几项测试,而是另外采用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项网络安全评测,分别测试漏洞审计与修补、漏洞发现,以及从发现漏洞到复现并修补的完整流程,三项各占三分之一。 首批榜单中,Grok 4.7(xhigh)和小米 MiMo-V2.6-Pro 同为 56 分,GPT-6 Luna(max)53 分,GLM-5.3-Flash 50 分。MiMo 平均每个任务成本只有 0.18 美元,Grok 4.7 要 11.67 美元;Luna 更低,只要 0.12 美元。 不过,这张榜不能简单理解成模型本身的网络安全能力排名。GPT-6 Sol、GPT-6 Astra 和 Claude Opus 5.5 都参加了测试,但在 CyberGym-E2E-AA 上几乎全部拒答,其中 Sol 和 Astra 拒绝全部任务,Opus 5.5 拒绝 98%。拒答直接记 0 分,Luna 反而愿意继续完成这些任务,所以综合成绩更高。Artificial Analysis 也表示,大量拒答让这些前沿模型的实际能力很难判断。 GLM-5.3 也出现了明显反常。完整版在 Artificial Analysis 的通用能力榜上高于 Flash,但这次 Cyber Index 只有 36 分,Flash 达到 50 分。主要差距来自 CyberGym-E2E-AA:Flash 得到 74%,完整版只有 29%。Artificial Analysis 暂未解释这一差距的原因。
Jevgrep让Coding Agent少自己找代码:SWE-bench主模型成本降29%
动察 Beating AI 快讯,开发者 David 基于 Jev 开源了一个专门给 Coding Agent 找代码的研究工具 Jevgrep。 用户只要问一句「登录校验写在哪里」,它就会用 TypeSafe 的决策模型 Jev 逐层搜索代码库,找出相关文件和源码片段,再交给 Claude Code、Codex 等 Agent 继续修改和测试。 它主要解决 Coding Agent 很费 token 的「找代码」环节。Jevgrep 不会先把整个仓库塞给模型,也不是只做一次语义搜索。它会先判断哪些目录值得继续找,再检查相关文件和代码声明,最后返回源码片段、行号和后续阅读线索。仓库还提供了 Skill,让 Agent 知道什么时候调用 `jg` 收集上下文。 最新 SWE-bench 实验用了 10 个 Python 任务。使用 Jevgrep 和不用 Jevgrep 都完成了 8 个,但 GPT-5.6 Sol 的总成本从 7.62 美元降到 5.44 美元,减少 28.63%。作者最初在 X 上写的是 40%,仓库随后更新实验结果,目前已经改成「约 30%」。 不过,这个数字只统计 Sol 的费用,没有把 Jev 算进去。实验日志中能够确认的 Jev 调用费用已经至少有 1.57 美元,部分调用缺少完整计费记录,实际总额未知。此外,这组实验只有 10 个任务,而且每题只跑了一次。