昨夜爆点信息合集!1分钟补齐信息差丨9/30
相关推荐
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
OpenAI 推出 GPT-6.1 Sol 模型,性能接近 Astra
ChainCatcher 消息,OpenAI 推出 GPT-6.1 Sol 模型,其性能接近 Astra,但标准词元价格仅为 Astra 的五分之一。
OpenAI修复GPT-6图像Bug,Luna视觉定位翻倍
动察 Beating AI 快讯,OpenAI 修复了 GPT-6 Sol 和 GPT-6 Luna 的一个图像编码 Bug。这个问题会降低模型对图片的理解能力,修复后 API 和 Codex 的视觉任务都会改善,包括让 Agent 看屏幕操作电脑的 Computer Use。 OpenAI 公布的测试中,GPT-6 Luna(Max)在 RefCOCOg 视觉定位评测上的平均 IoU 从 28.8% 升到 60.0%,提高 31.2 个百分点。这个测试主要看模型能不能根据一句描述,在图片里准确找到对应的物体或区域。 两款模型 9 月 22 日才正式上线 API,OpenAI 的更新日志在 9 月 25 日就记录了这次修复。官方没有公布 Sol 的具体提升,也没有说明 Bug 从什么时候开始、影响了多少图片请求。 OpenAI 还罕见地建议使用图片输入的开发者重新跑一遍评测,并重试此前受影响的工作流。
Jev爆火两周,OpenAI也做了个「只负责判断」的API
动察 Beating AI 快讯,OpenAI 在 DevDay 推出了 Decisions API。它不负责写长篇回答,专门解决程序里那些需要快速做选择的任务。 开发者先给它几个明确的选项,再丢进去文字或图片。底层的 GPT-6 Luna 会在几百毫秒内做出判断。比如判断一条消息该交给销售还是客服,或者让 Agent 决定下一步该调用哪个工具。 这类任务以前也能交给普通大模型,但往往要先生成一段文字,再让程序解析结果。Decisions API 直接把 Luna 限制在几个候选答案里,目标就是把这些高频的小判断做得更快。 它很容易让人想到最近爆火的 Jev。TypeSafe 也是把 AI 从「生成文字」改成「直接做选择」。不过两者并不完全一样,Jev 是专门训练的决策模型;OpenAI 目前是在 Luna 上做受限决策,而且额外支持图片输入。 Decisions API 目前还在限量预览,OpenAI 计划未来几天扩大开放。
本周大模型可能扎堆上新,GPT-6 Sol、Opus 5.5、Grok 4.7都在排队
动察 Beating AI 快讯,这一周可能迎来一轮密集的大模型更新,目前至少有 7 个模型出现发布或测试信号。 第一档:GPT-6 Sol、Claude Opus 5.5。 OpenAI 尚未确认 GPT-6 Sol,但 Sam Altman 此前称,原定上周发布的「主要东西」推迟到了本周;社区近期又持续出现 GPT-6 Sol 测试和灰度路由的爆料。 Anthropic 这边,博主 Lyra 称 Opus 5.5 正以 claude-wafer-eap 测试,计划周二发布。路透社上周也报道,Anthropic 正考虑近期推出一款新模型,但没有确认 Opus 5.5 这个名字。 第二档:Grok 4.7、Qwen4、Kimi K3.1。 马斯克原本说 Grok 4.7 大约 9 月 12 日上线,随后又称还要「几天」,至今仍未发布。 千问已经明确说,Qwen3.8-Flash-Next 是 Qwen4 架构的提前预览,而 9 月 22 日至 24 日正好是云栖大会,不过官方没有预告 Qwen4 会在大会发布。 Kimi 最近的 π 暗示已经预告 K3.1,但目前还没有发布日期、模型卡或 API。 第三档:Gemini 4 Pro、DeepSeek V4.1 Pro。 Gemini 4 Pro 最近被曝正在 Arena 以 Argon 等代号测试,但 Google 至今只确认 Gemini 4 正在训练,没有公布发布日期。 DeepSeek 则已经在官方文档中直接提到未来的 V4.1 Pro,但同样没有给出上线时间。
OpenAI推出法律版GPT-6 Astra,法律研究正确率提升40%
动察 Beating AI 快讯,OpenAI 推出 Astra for Law,把 GPT-6 Astra 做成专门面向法律工作的版本。它加入法律检索、分析和写作能力,可以帮律师查判例、分析案件、起草文件,也能接入律所现有的工作流。 OpenAI 还新建了一套法律搜索索引,可以查询美国判例、法规、法院规则等超过 2.3 亿个 URL,覆盖 99.9% 以上已公开的美国先例判决。 在 200 道美国法律研究题中,Astra for Law 的整体正确率达到 54.0%,普通 GPT-6 Astra 加网页搜索为 38.7%,相对提升约 40%。在判例题上,它找到的参考案例也多了 24%。 Astra for Law 会先向部分美国律所开放,在 ChatGPT 和 Codex 中显示为 GPT-6 Astra Law,随后开放 API。Harvey、Legora 等法律 AI 公司也可以把它接进自己的产品。OpenAI 还推出 26 个法律行业插件,可以调用 Thomson Reuters、Relativity、Clio 等专业法律数据和工具。