被字节索赔800万的田柯宇公开创业计划:20万视觉符号,让视频成本降90%
相关推荐
Haiku 5.5独立评测43分:遥遥领先GPT-6 Luna,但最高档Token消耗超3倍
动察 Beating AI 快讯,第三方评测机构 Artificial Analysis 公布 Claude Haiku 5.5 的测试结果。新模型在综合智能指数中获得 43 分,比上一代的 17 分提高 26 分。它超过 GPT-6 Luna 的 38 分、GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。该指数综合了编程、专业工作、科学推理等 10 项测试。 不过,高分也伴随着大量 token 消耗。在最高推理强度下,Haiku 5.5 每项评测任务平均输出约 16.2 万 tokens,是 GPT-6 Luna 的 3.2 倍。两者基础 API 单价相同,但 Haiku 5.5 的预估单任务成本约为 0.21 美元,Luna 仅为 0.07 美元。Haiku 5.5 从次高档调至最高档,综合得分只增加 2 分,输出量却增加约 80%。 降低推理强度后,差距明显缩小。Haiku 5.5 在 high 档获得 38 分,平均每项任务输出约 5.5 万 tokens,与最高档 GPT-6 Luna 的 38 分和 5 万 tokens 接近。开发者可以通过调整推理强度,减少不必要的 token 消耗。 Haiku 5.5 也并非全面领先。在 AutomationBench-AA 自动化任务评测中,它仅得 35%,落后于 Luna 的 53%。不过,测试期间模型存在过度拒绝执行任务的问题。Anthropic 正在修复,Artificial Analysis 计划重新测试。此外,目前公布的 Haiku 5.5 任务成本尚未计入长上下文加价,实际费用可能更高。
微软要把Windows变成Agent工作台:AI能直接操作电脑,还能少花Token
动察 Beating AI 快讯,微软公布 Windows「混合智能」计划,准备让 AI Agent 直接在电脑上执行任务。获得授权后,Copilot 可以读取本地文件和近期活动,还能整理文件、排查故障、编写程序。微软演示中,它自动找齐报税材料,修改文件名、打包附件,并起草了发给会计师的邮件。 这套方案的关键,是让本地 AI 和云端 AI 配合工作。Copilot 负责接收任务,Windows 提供访问文件和执行操作的能力。部分任务可以交给电脑上的模型处理,减少云端 Token 消耗,也让敏感数据留在本地。需要更强推理能力时,再调用云端模型。 为了支撑本地运行,微软将 1370 亿参数的编程模型 MAI Code 1.1 Flash 压缩至 53GB,让它能在搭载 RTX Spark 的高性能电脑上运行。GitHub Copilot 也将通过 HydraFusion 自动选择本地或云端模型,让部分编程任务不再依赖付费的云端推理。 微软还推出 MXC 安全沙箱,限制 Agent 能访问的文件和网络,防止越权操作。目前 MXC 已正式开放。Copilot 读取本地文件、执行电脑操作等新能力,则将在未来几个月陆续登陆 Copilot+ PC。
Prime Intellect推理平台上线:内部每天已跑近1万亿Token
动察 Beating AI 快讯,Prime Intellect 发布开源模型推理服务 Prime Inference。 用户可以直接按需调用模型;如果任务需要长期稳定运行,也可以提前锁定一部分推理算力。接口兼容 OpenAI API,首个公开部署的模型是 GLM-5.3。 这套系统此前已经在 Prime Intellect 内部使用。官方称,它每天处理接近 1 万亿 tokens,用于强化学习、合成数据、模型评测和 Coding Agent。Prime Intellect 从今年 1 月起也一直在为客户运行大规模部署。 Prime Inference 重点优化 Agent 的长上下文负载。它把提示词处理和生成回复分到不同 GPU 上,测试中将 p90 token 间延迟降低近 40%。Prime Intellect 还压缩了 KV 缓存,相同显存下,每个解码器可缓存的 token 从 109 万增加到 163 万,提升约 50%。 Prime Intellect 此前已经提供强化学习、评测和沙箱等训练基础设施。加入推理服务后,它可以把模型训练和实际部署接到同一套平台里,实际运行产生的数据也可以继续用于后续训练。
Databricks用AI横扫英伟达Kernel榜:235项测试四个赛道第一,Token花费约7万美元
动察 Beating AI 快讯,Databricks 团队称,他们把 GPT-6 Astra 和 Opus 5 放进自动优化循环,让模型持续重写、测试和改进 GPU kernel,最终在 NVIDIA SOL-ExecBench 的四个赛道全部排到第一。这个基准包含 235 个 GPU kernel 任务,覆盖基础算子、复杂融合算子、低精度计算和真实大模型推理。团队称,整个过程的模型 Token 花费约 7 万美元。 这套系统建立在 KDA 和 Humanize 之上,让 AI 自己写 kernel、跑正确性和性能测试,再根据结果不断修改。KDA 团队近期还把类似方法用在 Kimi Delta Attention 上,在 NVIDIA B300 上做到月之暗面官方 FlashKDA 的 2.96 倍速度。 两项成果属于同一套 Agent 内核优化体系的不同应用。Kimi 展示的是一个高难度注意力内核能被 AI 重写;Databricks 这次则把这种方法扩展到了数百个不同 kernel。
ZCode再补偿代码上传风波:付费用户送8张重置卡,全员再发1亿Token
动察 Beating AI 快讯,智谱继续处理 ZCode 代码上传争议。现有付费用户和近一个月回归的付费用户,将获得 4 张周重置卡和 4 张 5 小时重置卡,1 个月内有效。9 月 28 日至 10 月 7 日,ZCode 还将向全体用户发放 10 万份 1 亿 GLM-5.3-Flash Token 额度。 智谱称,仓库快照上传链路已经移除,涉事云端数据也已删除。ZCode 开源版本目前更新至 v3.14.3,后续代码不会在用户未主动发起的情况下上传云端。 这场争议源于 ZCode 早期默认开启的 Repo Wiki 功能。它在生成代码仓库知识库时,会把仓库内容上传到云端处理。智谱此前已经切断相关上传路径,并邀请第三方机构核查云端数据。
小米先公开MiMo-V3新架构:百万Token预填充计算量降80%
动察 Beating AI 快讯,小米 MiMo 团队公开下一代 MiMo-V3 将采用的 HySparse2 架构。它主要解决 Agent 越跑越贵的问题。Agent 每次只发出很短的指令,却可能从网页、终端和工具拿回大段内容。模型必须先把这些新内容读完;上下文越长,这一步越耗算力,KV Cache 也越占显存。 HySparse2 先把模型分成前后两段。前半段负责处理输入,后半段继续推理和生成。后半段需要的上下文信息,可以直接从前半段已经算好的结果生成,因此 prefill 不用再把后半段完整跑一遍。这个思路来自微软研究院 2024 年提出的 YOCO,名字就是「You Only Cache Once」,核心是让后半段共享前面算好的信息,少存缓存,也少做重复计算。 它同时重做了稀疏注意力。普通全注意力每次都要看完整上下文,HySparse2 只让少数层这么做。它们先从长上下文里挑出最相关的 1024 个 token,后面的层直接沿用这批结果,同时固定保留最近 128 个 token。上一代 HySparse 是每 64 个 token 打成一组再挑,只要一组里有重要信息,整组都要留下。现在改成逐个 token 挑,同样的计算量可以留给更多真正相关的内容。单独测试这一改动后,两项长文本检索成绩分别提高 6.57 分和 8.14 分。 论文用一款总参数 800 亿、每次激活约 30 亿参数的模型做对照。49 层模型在 prefill 阶段只需要跑前 25 层。输入达到 100 万 token 时,相比 MiMo-V2 系列采用的混合滑动窗口注意力,prefill 计算量降到约 1/5,KV Cache 从 12.09GB 降到 2.69GB。