高盛:Kimi K3 发布后智谱 MiniMax 暴跌,算力垄断时代面临终结
相关推荐
Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%
Odaily星球日报讯 Kimi 宣布开源多模态大模型视觉感知评测基准 PerceptionBench,旨在将视觉感知能力拆解为 10 项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 及幻觉识别等维度。该基准基于 42 个现有评测集中的模型失败案例构建,共包含 3000 道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。 评测结果显示,在 16 款前沿多模态大模型中,没有任何模型整体准确率超过 60%。GPT-5.6-Sol 以 59.7%的准确率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和 GPT-5.5(55.8%)位列前五。报告指出,视觉幻觉(Hallucination)仍是各模型表现最弱的能力,整体感知能力仍存在显著提升空间。
OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API
据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。
OpenAI教用户给Claude Code换上GPT模型,误封后两边员工现场互损
据动察 Beating 监测,OpenAI 产品负责人 Tibo 此前公开教用户给 Claude Code「换脑」:保留 Claude Code 的 harness,把底层模型换成 GPT。 开发者 Alex Getman 照着配置后,Claude 账号很快被封。他公开求助 Tibo 和 Anthropic,询问这套用法到底是否违规。 Tibo 随即开始阴阳:「我很想帮你,可惜我不在 Anthropic 工作。」他还补了一句,因为把 Claude Code harness 配其他模型就封号,「确实挺奇怪」,并问还有没有其他人中招。 Claude Code 负责人 Boris Cherny 很快下场。他明确表示,Anthropic 不会因为 harness 搭配其他模型就封号,这次几乎肯定是其他风控误触发。账号随后恢复。 Boris 还顺手回敬 Tibo:「如果你想来 Anthropic,我们正在招人。」Tibo 则表示自己很喜欢现在的团队,而且接下来几周还有不少新产品要发,暂时哪也不去。 事情解决后,Tibo 又发帖庆祝,称 GPT-5.6 Sol 几乎哪里都能用,包括 Claude Code harness。为了庆祝这件事和自己「不跳槽」,他还直接重置了 ChatGPT Work 和 Codex 所有付费用户的使用额度。
Claude Code之父:720次提示词注入攻击0成功,一年前想都不敢想
据动察 Beating 监测,Claude Code 负责人 Boris Cherny 称,Anthropic 已经「在实际使用中基本解决」提示词注入攻击。一年前,他自己都没想到能做到这个程度。 提示词注入攻击一直是 Agent 的大麻烦。恶意网页可以藏一段指令,诱导 Agent 偷密码、上传密钥,甚至执行用户根本没要求的操作。 Anthropic 现在靠三层防护来拦:Claude 本身先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前,Auto Mode 还会再审一次。 第三方测试用了 72 种此前没见过的攻击,重复 720 次。Sonnet 5、Fable 5 和 Opus 5 开启 Auto Mode 后,一次都没成功。 同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则达到 19.03%。 这也解释了 Anthropic 为什么敢把 Auto Mode 设成默认。它是 Claude Code 防提示词注入攻击的最后一道检查。
OpenAI:免费用户将获得无限文本聊天功能,并将更新GPT-5.6 Sol
BlockBeats 消息,8 月 7 日,OpenAI 表示,ChatGPT 将更新面向 Plus 和 Pro 用户的 GPT-5.6 Sol,使回答更加聚焦、事实可靠性更高,并减少不必要的格式和细节。同一模型将同时支持即时回答与深度推理,用户可通过新增滑块调节每次回答投入的思考程度。 OpenAI 表示,在针对金融、医疗和法律问题的内部评估中,与 GPT-5.5 Instant 相比,GPT-5.6 Luna 出现至少一项事实错误的回答减少约 62%,GPT-5.6 Sol 减少约 68%。 GPT-5.6 Luna 将于本周成为 Free 和 Go 用户的默认模型。自下周起,免费用户可进行无限文本聊天,并通过新增的 Think 按钮处理需要更深入推理的问题,但仍受防滥用机制约束,文件上传、图片及其他工具继续设有使用限制。 此次更新仅适用于 ChatGPT 的日常对话体验,Work 和 Codex 中使用的 GPT-5.6 Sol 不会随本次发布调整。
Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍
据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。