Liquid AI发布2.6B参数端侧模型,3项评测超过Qwen3.5-9B
相关推荐
3B小模型越级打8B:Liquid AI新视觉模型本地跑飞
据动察 Beating 监测,Liquid AI 发布视觉语言模型 LFM2.5-VL-3B,只有 31 亿参数,主打手机、电脑等本地设备。它能看懂网页和 App 界面、文档和多张图片,还新增了视觉工具调用能力。 官方在 28 项视觉评测中测得平均分 69.4。8B 参数的 Gemma-4-E4B 只有 59.7,5.1B 的 Gemma-4-E2B 为 52.0。它与 47 亿参数的 InternVL 3.5 4B 持平,只比 Qwen3.5-4B 低 0.7 分。 速度是它更突出的地方。4-bit 量化后,模型在 M5 Max 上每秒可生成 228 个 token,占用约 3.3GB 内存;Galaxy S26 Ultra 上也能达到每秒 20 个 token。单张 H100 高并发时,输出吞吐最高约每秒 1.1 万 token,约为部分 4B 级模型的两倍。 模型已经开放权重,可在 Hugging Face 下载,并支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX。它采用 LFM Open License v1.0,年营收低于 1000 万美元可免费商用,超过后需要另购商业授权。
OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API
据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。
Pi重构Agent执行层:长任务开始走向持久化运行
据动察 Beating 监测,Pi 正在重做 Agent Harness。最新 Harness v3 规范已经写完,正在做最终审计。它重做了任务执行和存储,让 Agent 即使跑到一半进程崩溃,甚至 Harness 自己升级,也能从中断处继续。 Pi 是 Mario Zechner 创建的开源 Agent Harness,最早因为 OpenClaw 使用它而出圈。项目今年被 Earendil 收购,Mario 也加入公司继续负责开发。现在 Pi 已有超过 6 万 GitHub Star,MiniMax 最新的 MiniMax Code 也明确基于 OpenCode 和 Pi 搭建 Harness。 v3 这次直接重做了底层架构。模型请求和工具调用前都会先保存执行状态,完成后再写入结果。重启后,Pi 能知道哪些已经做完、哪些可以重跑、哪些有副作用不能再执行一次。对话、运行状态和 Token 成本也改成分开保存,并加入跨版本状态迁移。 Claude Code、Codex 都在把 Agent 往更长的任务推。OpenAI 已经专门研究怎么让 Codex 持续完成长时间工作,Anthropic 也称 Claude Code 正越来越多地被用于长时间运行的 Agent 任务。Agent 能连续干几小时以后,前面几小时就不能因为一次崩溃全部白干。
蚂蚁开源Ling-3.0-tiny:79亿参数,M4Pro本地跑到90Token/s
据动察 Beating 监测,蚂蚁百灵正式开放 Ling-3.0-tiny 权重,提供 BF16、FP8 和 INT4 三个版本,Hugging Face 页面标注为 MIT 许可。模型共有 79 亿参数,每个 Token 只激活 13 亿,主要面向本地部署和 Agent 场景。 Ling-3.0-tiny 有 128 个路由专家,每个 Token 只选择其中 8 个,再加 1 个所有 Token 都会使用的共享专家。注意力部分采用 3:1 的 KDA 与 MLA 混合架构,也就是每 3 层 Kimi Delta Attention 后接 1 层 MLA。 官方称 FP8 版在 M4 Pro MacBook 上可达到约 86–90 Token/s;DGX Spark 上约为 100–105 Token/s。
Pokee发布1000万Token模型,上下文接近主流模型10倍
据动察 Beating 监测,AI Agent 创业公司 Pokee AI 发布 Pokee-Isaac 28B。模型参数总量只有 280 亿,上下文窗口却达到 1000 万 Token。目前主流模型的上限约为 100 万 Token,Isaac 接近它们的 10 倍。 Pokee 自测中,Isaac 在 RULER 长文本测试里,从 25.6 万到 400 万 Token 一直保持在 95 分上下。拉满 1000 万 Token 后,得分仍有 93.3。其余五款对照模型从 200 万 Token 起都没有返回可用结果。 Pokee 把超长上下文归因于自研的「非纯 Decoder-only 架构」,即没有完全沿用常见大模型的纯解码器结构。不过,技术报告没有公开具体架构、注意力机制和显存方案,外界暂时无法判断它究竟怎么做到的。 Pokee AI 成立于 2024 年,由前 Meta 应用强化学习负责人朱哲清创办。公司曾获得 Point72 Ventures 领投的 1200 万美元种子轮,高通创投和 Samsung NEXT 等参投。
Grok全新语音模型拿下Agent评测第一,API价格涨60%
据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。