OpenAI定价页现身尚未公布的Rosalind新模型
相关推荐
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
OpenAI为GPT-6.1 Sol推出Ultrafast模式,速度最高提升8倍
PANews 10月9日消息,OpenAI Developers在X平台发帖称,GPT-6.1 Sol的Ultrafast模式今日起在API、Codex及ChatGPT Work中陆续上线,智能水平接近GPT-6 Astra,速度最高可达Sol标准模式的8倍。据OpenAI开发者社区公告,该模式API输入定价为每百万token收费12美元、输出为每百万token收费60美元,为Astra的1.2倍;在Codex及ChatGPT Work中仅向Pro 500、符合条件的按量计费企业版及按积分计费教育版用户开放。
Haiku 5.5独立评测43分:遥遥领先GPT-6 Luna,但最高档Token消耗超3倍
动察 Beating AI 快讯,第三方评测机构 Artificial Analysis 公布 Claude Haiku 5.5 的测试结果。新模型在综合智能指数中获得 43 分,比上一代的 17 分提高 26 分。它超过 GPT-6 Luna 的 38 分、GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。该指数综合了编程、专业工作、科学推理等 10 项测试。 不过,高分也伴随着大量 token 消耗。在最高推理强度下,Haiku 5.5 每项评测任务平均输出约 16.2 万 tokens,是 GPT-6 Luna 的 3.2 倍。两者基础 API 单价相同,但 Haiku 5.5 的预估单任务成本约为 0.21 美元,Luna 仅为 0.07 美元。Haiku 5.5 从次高档调至最高档,综合得分只增加 2 分,输出量却增加约 80%。 降低推理强度后,差距明显缩小。Haiku 5.5 在 high 档获得 38 分,平均每项任务输出约 5.5 万 tokens,与最高档 GPT-6 Luna 的 38 分和 5 万 tokens 接近。开发者可以通过调整推理强度,减少不必要的 token 消耗。 Haiku 5.5 也并非全面领先。在 AutomationBench-AA 自动化任务评测中,它仅得 35%,落后于 Luna 的 53%。不过,测试期间模型存在过度拒绝执行任务的问题。Anthropic 正在修复,Artificial Analysis 计划重新测试。此外,目前公布的 Haiku 5.5 任务成本尚未计入长上下文加价,实际费用可能更高。
OpenAI与新思科技合作开发芯片设计AI模型GPT-Synopsys
PANews 10月1日消息,据官方公告,OpenAI与芯片设计软件(EDA)巨头新思科技(Synopsys)宣布达成多年合作,共同开发面向半导体设计的专用AI模型GPT-Synopsys。该模型可调用Synopsys的EDA工具,由AI代理围绕功耗、性能和面积等目标执行芯片设计、解读结果并迭代优化,运行于OpenAI托管的基础设施,客户设计数据不会用于模型训练。双方将采用收入分成模式,具体金额未披露,目前已与部分头部半导体客户开展早期合作。
Jev爆火两周,OpenAI也做了个「只负责判断」的API
动察 Beating AI 快讯,OpenAI 在 DevDay 推出了 Decisions API。它不负责写长篇回答,专门解决程序里那些需要快速做选择的任务。 开发者先给它几个明确的选项,再丢进去文字或图片。底层的 GPT-6 Luna 会在几百毫秒内做出判断。比如判断一条消息该交给销售还是客服,或者让 Agent 决定下一步该调用哪个工具。 这类任务以前也能交给普通大模型,但往往要先生成一段文字,再让程序解析结果。Decisions API 直接把 Luna 限制在几个候选答案里,目标就是把这些高频的小判断做得更快。 它很容易让人想到最近爆火的 Jev。TypeSafe 也是把 AI 从「生成文字」改成「直接做选择」。不过两者并不完全一样,Jev 是专门训练的决策模型;OpenAI 目前是在 Luna 上做受限决策,而且额外支持图片输入。 Decisions API 目前还在限量预览,OpenAI 计划未来几天扩大开放。
OpenAI修复GPT-6图像Bug,Luna视觉定位翻倍
动察 Beating AI 快讯,OpenAI 修复了 GPT-6 Sol 和 GPT-6 Luna 的一个图像编码 Bug。这个问题会降低模型对图片的理解能力,修复后 API 和 Codex 的视觉任务都会改善,包括让 Agent 看屏幕操作电脑的 Computer Use。 OpenAI 公布的测试中,GPT-6 Luna(Max)在 RefCOCOg 视觉定位评测上的平均 IoU 从 28.8% 升到 60.0%,提高 31.2 个百分点。这个测试主要看模型能不能根据一句描述,在图片里准确找到对应的物体或区域。 两款模型 9 月 22 日才正式上线 API,OpenAI 的更新日志在 9 月 25 日就记录了这次修复。官方没有公布 Sol 的具体提升,也没有说明 Bug 从什么时候开始、影响了多少图片请求。 OpenAI 还罕见地建议使用图片输入的开发者重新跑一遍评测,并重试此前受影响的工作流。