美国大公司开始集体用便宜AI:开源模型提及量同比涨6倍
相关推荐
前OpenAI研究员做了个「不会聊天」的AI:Jev只做判断,最高快200倍
动察 Beating AI 快讯,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 推出新模型 Jev。它有点像一个能读懂自然语言的超级分类器,不生成文本,只返回选项、分数和概率,专门给软件做判断。 普通大模型需要一个 token 一个 token 往外生成,Jev 则可以并行给出多个结果。TypeSafe 还用新的 RLCD 方法训练它的置信度,让模型在给出判断的同时,告诉程序自己有多大把握。 TypeSafe 用安全告警、Agent 审查、发票处理和客服做了 4 组自动化工作流测试。在这套自建评测里,Jev 最高比 Claude Sonnet 5 快约 193.6 倍,比 Claude Opus 5 便宜约 444.6 倍。 TypeSafe 把 Jev 称为首款「System One Model」(快速决策模型),名字来自卡尼曼《思考,快与慢》里的 System 1。它专门处理分类、打分、路由和下一步决策这类快速判断任务。
ZCode再补偿代码上传风波:付费用户送8张重置卡,全员再发1亿Token
动察 Beating AI 快讯,智谱继续处理 ZCode 代码上传争议。现有付费用户和近一个月回归的付费用户,将获得 4 张周重置卡和 4 张 5 小时重置卡,1 个月内有效。9 月 28 日至 10 月 7 日,ZCode 还将向全体用户发放 10 万份 1 亿 GLM-5.3-Flash Token 额度。 智谱称,仓库快照上传链路已经移除,涉事云端数据也已删除。ZCode 开源版本目前更新至 v3.14.3,后续代码不会在用户未主动发起的情况下上传云端。 这场争议源于 ZCode 早期默认开启的 Repo Wiki 功能。它在生成代码仓库知识库时,会把仓库内容上传到云端处理。智谱此前已经切断相关上传路径,并邀请第三方机构核查云端数据。
OpenAI修复GPT-6图像Bug,Luna视觉定位翻倍
动察 Beating AI 快讯,OpenAI 修复了 GPT-6 Sol 和 GPT-6 Luna 的一个图像编码 Bug。这个问题会降低模型对图片的理解能力,修复后 API 和 Codex 的视觉任务都会改善,包括让 Agent 看屏幕操作电脑的 Computer Use。 OpenAI 公布的测试中,GPT-6 Luna(Max)在 RefCOCOg 视觉定位评测上的平均 IoU 从 28.8% 升到 60.0%,提高 31.2 个百分点。这个测试主要看模型能不能根据一句描述,在图片里准确找到对应的物体或区域。 两款模型 9 月 22 日才正式上线 API,OpenAI 的更新日志在 9 月 25 日就记录了这次修复。官方没有公布 Sol 的具体提升,也没有说明 Bug 从什么时候开始、影响了多少图片请求。 OpenAI 还罕见地建议使用图片输入的开发者重新跑一遍评测,并重试此前受影响的工作流。
OpenAI疑似将推出新ChatGPT订阅方案,Pro档位已更名
动察 Beating AI 快讯,AI 博主 Max For AI 发文称,OpenAI 似乎即将公布新的 ChatGPT 订阅方案。目前,ChatGPT Pro 此前的「5x」和「20x」档位已分别更名为「Pro Standard」和「Pro More」,同时官方定价页面已删除此前关于「5x / 20x Plus」用量额度的描述。 相关调整或意味着 OpenAI 正在重新设计 ChatGPT Pro 订阅体系,但目前官方尚未公布具体的新方案及定价。
OpenAI版Grok Bot露出:名字只有一个字母「o」
动察 Beating AI 快讯,OpenAI 疑似正在准备一款名为「o」的常驻 AI 助手。用户 Jake Boggs 在 ChatGPT Pro 升级页看到一项尚未发布的权益:「o, your always-on assistant」。TestingCatalog 随后又在 ChatGPT 配置中发现显示名称「o」和 email_suffix: -o 等字段。 《The Information》称,OpenAI 正在开发直接对标 Grok Bot 的功能,还讨论过一款对标 Meta Muse 的个人 AI 助手。相关产品可能复用 ChatGPT 和 Codex 已有的 Agent 技术,把任务放到后台持续执行,甚至跨多天完成。 社区此前还从 Codex 中发现过 gpt-6-astra-aeon,以及把 Aeon 描述为「持久后台 Agent」的内部指令。因此有人猜测,Aeon 可能是内部代号,「o」才是面向用户的产品名。 OpenAI 已确认 DevDay 将于 9 月 29 日举行,Sam Altman 会做开场演讲。TestingCatalog 推测「o」可能届时亮相。
小米先公开MiMo-V3新架构:百万Token预填充计算量降80%
动察 Beating AI 快讯,小米 MiMo 团队公开下一代 MiMo-V3 将采用的 HySparse2 架构。它主要解决 Agent 越跑越贵的问题。Agent 每次只发出很短的指令,却可能从网页、终端和工具拿回大段内容。模型必须先把这些新内容读完;上下文越长,这一步越耗算力,KV Cache 也越占显存。 HySparse2 先把模型分成前后两段。前半段负责处理输入,后半段继续推理和生成。后半段需要的上下文信息,可以直接从前半段已经算好的结果生成,因此 prefill 不用再把后半段完整跑一遍。这个思路来自微软研究院 2024 年提出的 YOCO,名字就是「You Only Cache Once」,核心是让后半段共享前面算好的信息,少存缓存,也少做重复计算。 它同时重做了稀疏注意力。普通全注意力每次都要看完整上下文,HySparse2 只让少数层这么做。它们先从长上下文里挑出最相关的 1024 个 token,后面的层直接沿用这批结果,同时固定保留最近 128 个 token。上一代 HySparse 是每 64 个 token 打成一组再挑,只要一组里有重要信息,整组都要留下。现在改成逐个 token 挑,同样的计算量可以留给更多真正相关的内容。单独测试这一改动后,两项长文本检索成绩分别提高 6.57 分和 8.14 分。 论文用一款总参数 800 亿、每次激活约 30 亿参数的模型做对照。49 层模型在 prefill 阶段只需要跑前 25 层。输入达到 100 万 token 时,相比 MiMo-V2 系列采用的混合滑动窗口注意力,prefill 计算量降到约 1/5,KV Cache 从 12.09GB 降到 2.69GB。