Pokee发布1000万Token模型,上下文接近主流模型10倍
相关推荐
Meta给Muse上裂变拉新:邀1人送10亿Token,最多拿200亿
动察 Beating AI 快讯,Meta 的个人 AI Agent Muse 上线邀请码。Alexandr Wang 宣布,朋友注册时使用你的邀请码,双方各得 10 亿 Muse Token,最多可以邀请 20 人。拉满后,邀请者还能提前体验电话等新功能。 这个奖励相当大。Muse 免费版目前每周提供 1 亿 Token,成功邀请 1 人拿到的奖励,数量上等于 10 周免费额度;拉满 20 人就是 200 亿 Token,相当于 200 周的基础免费额度。 Muse 上周刚在美国上线,可以自己浏览网页、连接 App,并代用户发邮件、购物和订行程。上线后一直稳居美国 App Store 总榜前几名。Meta 现在直接用大额 Token 奖励,把首批用户变成拉新渠道。
微软要把Windows变成Agent工作台:AI能直接操作电脑,还能少花Token
动察 Beating AI 快讯,微软公布 Windows「混合智能」计划,准备让 AI Agent 直接在电脑上执行任务。获得授权后,Copilot 可以读取本地文件和近期活动,还能整理文件、排查故障、编写程序。微软演示中,它自动找齐报税材料,修改文件名、打包附件,并起草了发给会计师的邮件。 这套方案的关键,是让本地 AI 和云端 AI 配合工作。Copilot 负责接收任务,Windows 提供访问文件和执行操作的能力。部分任务可以交给电脑上的模型处理,减少云端 Token 消耗,也让敏感数据留在本地。需要更强推理能力时,再调用云端模型。 为了支撑本地运行,微软将 1370 亿参数的编程模型 MAI Code 1.1 Flash 压缩至 53GB,让它能在搭载 RTX Spark 的高性能电脑上运行。GitHub Copilot 也将通过 HydraFusion 自动选择本地或云端模型,让部分编程任务不再依赖付费的云端推理。 微软还推出 MXC 安全沙箱,限制 Agent 能访问的文件和网络,防止越权操作。目前 MXC 已正式开放。Copilot 读取本地文件、执行电脑操作等新能力,则将在未来几个月陆续登陆 Copilot+ PC。
Meta、Sierra给AI Agent做「通行证」,Walmart、Shopify等参与制定
动察 Beating AI 快讯,客服 Agent 公司 Sierra 联合 Meta 发起 Personal Agent Protocol(PAP),Walmart、Shopify、Stripe、Genesys、Instinct 等公司共同参与制定。PAP 面向个人 AI Agent,让企业确认 Agent 的身份、它代表哪个用户,以及用户授权它做什么。 现在很多个人 Agent 仍靠模拟真人操作网页。它们打开网站、点击按钮、填写表单,很容易被验证码和反机器人系统拦住。Amazon 此前就禁止 Meta Muse 访问其购物网站。即使是 Muse 的合作方 Walmart,也会弹出真人验证挡住 Agent。 PAP 希望把这套身份和授权关系直接标准化。用户让 Agent 查询订单时,可以只开放读取权限;需要改订单或下单,再单独授权。企业也可以规定 Agent 能做哪些操作,以及通过网页、API 还是企业自己的 Agent 接入。 MCP 主要解决 Agent 怎么调用外部工具和数据,PAP 则处理 Agent 的身份、用户授权和企业权限。PAP 目前仍处于预览阶段,首个 v0.1 规范计划本月晚些时候公布。 同一天,Sierra 的竞争对手 Decagon 也开源了类似的 PACT 协议,并宣布加入 PAP 工作组。PACT 同样处理 Agent 身份和用户授权,用 A2A 连接个人 Agent 和企业 Agent,再通过 OAuth 完成用户授权。
Meta把Muse接进AI眼镜:看到什么,直接让Agent去办
动察 Beating AI 快讯,Meta 宣布把个人 AI Agent Muse 接入旗下 AI 眼镜。用户以后可以直接对着眼镜叫 Muse,再把任务交给它。Muse 会在后台继续执行,完成后再回来告诉用户结果,不需要一直掏手机操作。 能做的事情已经不只是问问题。比如让 Muse 带着你完成个性化训练、记录一顿饭并分析营养,或者预约服务、查机票价格。看到想买的商品时,也可以直接让它帮忙购买;开车或做饭时,还能让它去网上找需要的零件。 Meta 的眼镜此前已经接入 Muse Spark,主要负责理解用户看到的东西、回答问题和提供建议。这次接进去的是完整的 Muse Agent。它可以连接日历、购物等服务,把眼镜里的一句语音继续变成后台任务。 Meta 同时大幅扩充 AI 眼镜产品线。年底前,Ray-Ban、Oakley 和 Meta Glasses 合计将提供超过 100 种款式。新发布的 Ray-Ban Meta Audio 甚至直接取消摄像头,只保留音频和 AI,单次续航最长 12 小时。眼镜正在变成 Meta 给 Muse 准备的全天候入口。
DFlash团队进军Mac,27B模型跑到144Token/s
动察 Beating AI 快讯,Inco AI 开源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 随即接入,0.4.25 版本已经可以直接使用。 Inco 此前做出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash 加速小模型。DFlash 会先让小模型并行猜出多个 Token,再交给大模型批量验证,减少逐 Token 生成的计算。 Splash 把这种优化扩到了整个本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每个模型都单独配了 GPU kernel、内存方案和 DFlash 2 小模型。覆盖的模型少,但换来了更激进的性能优化。 144 Token/s 是 M5 Max 上的最高演示值。换到 Inco 用来做横向测试的 48GB M5 Pro,Qwen3.8-27B 单路短上下文达到 74 Token/s;4 路并发时总吞吐达到 170 Token/s,是第二名的 3.9 倍。这也是 Splash 更适合 Agent 场景的地方。一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。 Splash 本身开源,不绑定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 统一内存。
Laminar把Agent查错成本压到GPT-6-sol的1/23
动察 Beating AI 快讯,AI Agent 可观测性平台 Laminar 发布专门检查 Agent 执行轨迹的模型 flow-1。它会读取模型调用、工具调用和返回结果,找出 Agent 在哪一步出错、为什么出错。 flow-1 运行在 Laminar 的 Signals agent 中。模型可以搜索整条 trace(Agent 的完整执行记录),再按需查看具体步骤。训练时,Laminar 先用合成调查数据做监督微调,再通过强化学习训练工具调用和复杂 trace 分析。 在 Laminar 自建的 523 条困难 trace 测试中,flow-1 的错误检测 F1 为 0.835,GPT-6-sol 为 0.816。sol 召回率更高,能找到更多真实错误;flow-1 精确率更高,误报更少。 对于不足 10 万 LLM tokens 的 trace,flow-1 平均每条分析约 0.0011 美元,GPT-6-sol 约 0.026 美元。按 Laminar 测算,1 美元分别能分析约 888 条和 38 条 trace,相差约 23 倍。flow-1 的成本也比 GPT-6-luna 低约 25%。 目前这些成绩都来自 Laminar 自建 benchmark,暂无第三方复测。flow-1 的训练数据主要来自合成工作流,其中约 48% 是软件工程任务。社区已经有人质疑,它面对真实生产环境里没有预先设计过的新型故障时能否保持同样表现。