Liquid AI开放两款小型决策模型权重:3B版8毫秒给答案
相关推荐
Jev首次被反超,Liquid AI发布决策模型d1
动察 Beating AI 快讯,前沿端侧 AI 研发公司 Liquid AI 发布首个自研决策模型 d1。它和 Jev 做的是同一类事,不生成长文本,而是直接做选择、判断和打分,可以给 Agent 选工具、做路由和审核。 Liquid 按 Hugging Face 的决策模型综合评测 Decision Index 0.2.1 重新跑了一遍评测。d1 综合得分 58.9,超过 Jev 1.13 的 57.9。5 个大类中,d1 在艺术判断、语言理解和检索分类上领先,工具调用略低于 Jev,知识推理则落后 8 分。Liquid 称,d1 是首个在这套评测中超过 Jev 的模型。 d1 兼容 Jev 的三种决策方式:Choice 从多个选项里挑一个,Noul 判断是非,Score 按标准打分。一次请求还能同时完成多项判断,直接返回概率和结构化结果,不需要先生成文字再解析。 目前 d1 已通过 Liquid API 开放,免费版本为 `d1:free`。模型权重和参数规模暂未公布,Liquid 还计划把它接入 OpenRouter。
微软要把Windows变成Agent工作台:AI能直接操作电脑,还能少花Token
动察 Beating AI 快讯,微软公布 Windows「混合智能」计划,准备让 AI Agent 直接在电脑上执行任务。获得授权后,Copilot 可以读取本地文件和近期活动,还能整理文件、排查故障、编写程序。微软演示中,它自动找齐报税材料,修改文件名、打包附件,并起草了发给会计师的邮件。 这套方案的关键,是让本地 AI 和云端 AI 配合工作。Copilot 负责接收任务,Windows 提供访问文件和执行操作的能力。部分任务可以交给电脑上的模型处理,减少云端 Token 消耗,也让敏感数据留在本地。需要更强推理能力时,再调用云端模型。 为了支撑本地运行,微软将 1370 亿参数的编程模型 MAI Code 1.1 Flash 压缩至 53GB,让它能在搭载 RTX Spark 的高性能电脑上运行。GitHub Copilot 也将通过 HydraFusion 自动选择本地或云端模型,让部分编程任务不再依赖付费的云端推理。 微软还推出 MXC 安全沙箱,限制 Agent 能访问的文件和网络,防止越权操作。目前 MXC 已正式开放。Copilot 读取本地文件、执行电脑操作等新能力,则将在未来几个月陆续登陆 Copilot+ PC。
Cua Driver给Agent补上「眼睛」:纯像素界面也能识别按钮和文字
动察 Beating AI 快讯,开源 Computer Use 工具 Cua 给 Cua Driver 加入可选的 Perception 视觉扩展。Driver 原本优先通过网页结构和系统无障碍树找按钮。遇到 Canvas、游戏、远程桌面或自绘应用时,这些结构可能为空。Perception 会直接读取截图,把画面拆成带文字、类型和位置的区域,供 Agent 继续操作。 首版用 OmniParser 识别图标和控件,用 PP-OCR 读取文字。整个解析过程在本机 CPU 完成,不需要 GPU,也不把截图发到网络。官方实测单张截图在 macOS 约需 2 至 2.5 秒,Linux 为 3.5 至 4 秒,Windows 为 8 至 9 秒。它主要在页面结构和无障碍树失效时兜底,不会默认每一步都跑视觉解析。 Cua 还限制了视觉操作对旧截图的复用。每次视觉识别都会绑定当前截图的 `capture_id`,随后点击必须来自同一张截图。截图超过 60 秒,或者已经执行过一次操作,Driver 就会拒绝继续使用,避免界面变化后还拿旧坐标误点。 Cua 过去其实已经能通过 `cua-som` 和 OmniParser 做视觉定位。现在这套能力被直接接进 Cua Driver,上层 Agent 可以通过统一接口拿到识别结果。即使模型本身不会看图,也可以根据这些文字和区域信息决定下一步操作。 Perception 不是默认组件,其中 OmniParser 检测器采用 AGPL-3.0;Cua Driver 仍保持 MIT 协议。
144M参数就能做Agent决策,Julia-1连安卓平板都能跑
动察 Beating AI 快讯,AI 实验室 Supersonic Labs 发布一款只有 1.443 亿参数的轻量决策模型 Julia-1。它不生成长文本,而是接收上下文、问题和 2 到 20 个候选答案,直接完成分类、打分和是非判断,可以给 Agent 选工具、做路由或决定下一步动作。 Julia-1 基于多语言编码模型 mmBERT-small 开发,模型权重约 550MB,主打低硬件门槛。官方已经在 Apple M4、Intel i5-1235U 和三星 Android 平板上完成测试。M4 单次决策中位延迟约 33ms;三星平板只用 CPU 运行时约 203ms,进程峰值内存约 393MB。 在官方公布的 4 组 Jev 对比测试中,Julia-1 赢了 3 组。Typed Decisions 为 73.15%,Jev 参考成绩为 72.70%;AG News 为 94% 对 91%;情绪分类为 86% 对 48%。但在包含 72 个类别的 Banking77 上,Julia-1 只有 64%,明显低于 Jev 的 87%。官方称,候选类别太多且彼此相似时,目前的分组筛选可能提前丢掉正确答案。 Julia-1 的云端 GPU 训练和实验总成本只有约 104 美元。模型权重、运行代码、完整评测和来源记录均已开放,采用 Apache 2.0 许可。官方还在开发 API,计划按每百万输入 token 0.025 美元收费;由于模型只做判断、不生成长文本,输出 token 不收费。
Ando融资2000万美元:重做Slack,让Agent直接当同事
动察 Beating AI 快讯,Ando 结束隐身并融资 2000 万美元,要从头做一个给人和 AI Agent 共用的「新 Slack」。本轮资金来自 Accel、Index Ventures 和 Emergence。 Ando 仍然有频道、私信、群聊和语音通话,但 Agent 有自己的身份、权限和收件箱。它们可以自己浏览和加入频道,不需要人类每次 @ 才工作,也可以主动找其他同事沟通。Codex、Claude、Grokbot、Devin 等不同 Agent 都能接入,没有现成 Agent 的团队也可以直接使用 Ando 托管的版本。 Ando 自己已经完全停用 Slack。比如有人在聊天里报 Bug 后,Agent 可以自己接单、把移动端任务转给另一个 Agent,再由第三个 Agent 审查代码;不同频道同时讨论同一个问题时,Agent 也能主动把相关人员拉到一起,并补齐上下文。 目前已有软件、房地产和金融等行业的团队在 15 个国家使用 Ando。
Firecrawl融资7500万美元:给AI Agent建一个「数据源总入口」
动察 Beating AI 快讯,Firecrawl 完成 7500 万美元 B 轮融资,由 Smash Capital 领投,同时推出 Alexandria。它把网页搜索、第三方数据源和 Firecrawl 自建索引接进同一套接口,让 AI Agent 不用再为每种数据单独接 API。 比如 Agent 查一家公司,可以先搜网页,再直接调用 Fiscal.ai 获取财务数据;查经济数据可以找 FRED 和 World Bank;写代码则能搜索 GitHub 和 Firecrawl 的 Developer Index。目前 Alexandria 还覆盖科研论文、政府数据、商品、房产、招聘等数据,可以通过 API、MCP 和 CLI 调用。 Firecrawl 称,同一模型和 prompt 在 845 个任务上测试后,使用 Alexandria 的回答质量比模型自带 Web 工具高 21%。 这轮融资还会用来购买和接入更多数据。Firecrawl 已经付费使用 Wikimedia Enterprise,接下来还准备让更多研究者、出版商和数据提供方把内容接进 Alexandria,并在 Agent 使用这些数据时获得收入。