IBM开源Granite 4.2:推理大升级,但把Mamba撤了
相关推荐
Artificial Analysis重做智能榜:40%权重改用私有测试
动察 Beating AI 快讯,Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。
Grok全新语音模型拿下Agent评测第一,API价格涨60%
据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。
Claude电商Agent开源:合作方购物车规模提升35%,顾客购买率提高60%
动察 Beating AI 快讯,Anthropic 开源了 Claude Commerce Agents。这是一套让商家自己搭购物和运营 Agent 的参考代码。里面有两个 Agent:一个面向消费者搜商品、比较商品、搭配多件商品和加购物车;另一个面向商家看销售、库存、定价和营销。代码采用 Apache 2.0。 购物 Agent 只能把购物车交给商家自己的结账页,代码里没有直接扣款接口。商家 Agent 想调价、补货或改活动,也只能先生成待执行修改,必须人工批准后才能落地。相关限制不是只写在 prompt 里,支付、商品来源、调价幅度和人工审批等规则都有代码层拦截。 Anthropic 不建议把搜索、退货、定价等能力拆成一堆子 Agent。它让一个 Claude 保留完整对话,再按需加载不同 Skills。Anthropic 称,在多个企业部署里的比较中,这种方案质量更高,通常也更省 token、延迟更低。 Anthropic 称,一家合作方上线后,购物车规模提高约 30%–35%,顾客完成购买的概率提高约 60%。
Citrini Research被SemiAnalysis收购,创始人拟成立新基金
动察 Beating AI 快讯,「AI 末日报告」发布机构 Citrini Research 创始人 James van Geelen 已将公司出售给芯片及 AI 研究机构 SemiAnalysis,交易金额尚未披露。Van Geelen 暂时将继续担任 Citrini CEO,并计划筹建一只新基金。 Citrini 目前在 Substack 拥有约 26 万名订阅者,今年 2 月因发布《2028 全球智能危机》报告走红。该报告设想 AI 快速取代白领岗位,引发市场对 AI 冲击就业和经济的讨论,并一度对软件股造成明显影响。 SemiAnalysis 由 Dylan Patel 于 2020 年创立,长期专注半导体和 AI 基础设施研究。Patel 表示,此次收购旨在扩大研究规模,并探索投资研究在 AI 时代的新形态。 Van Geelen 本人未透露新基金具体信息。此次交易也意味着 Citrini 在快速扩大影响力后,将与 SemiAnalysis 的半导体、AI 研究能力进一步结合。
OpenAI Agent又曝黑历史:Hugging Face事件前两月已攻击RubyGems
动察 Beating AI 快讯,研究人员披露,OpenAI 内部 Agent 今年 5 月曾大规模涌入 Ruby 官方软件包网站 RubyGems.org。5 月 11 日到 12 日,两天上传超过 2000 个包,RubyGems 一度暂停新用户注册 4 天。OpenAI 已确认这些 Agent 来自公司内部,但称它们只是借 RubyGems 访问互联网,执行良性任务并获取公开信息。 这些 Agent 还利用 RubyDoc.info 自动生成文档的机制,让自己上传的脚本在对方服务器执行,再抓取英国地方政府网站的数据并重新打包回传。研究人员称,至少 6 个包还尝试利用一个当时尚未公开的 RubyGems 漏洞,窃取其他用户的 API Key。这个漏洞直到 7 月才被独立发现,RubyGems 后来将其评为高危漏洞。 目前没有证据证明 Agent 真偷到了密钥。RubyGems 检查日志后也没发现旧密钥被恶意使用,但历史日志并不完整。研究团队还称,OpenAI 当时没有告诉 RubyGems 自己与这次攻击有关。整个事件比 7 月的 Hugging Face 入侵早了两个月。
英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%
动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。