阿里千问创作平台小范围测试多 Agent 协同功能
相关推荐
Cursor上线Projects:一个Agent当项目经理,下面管数千个Agent
动察 Beating AI 快讯,Cursor 上线 Projects,把一个 Agent 干活升级成了「Agent 管 Agent」。每个项目都有一个协调 Agent,它自己不写代码,只负责拆任务、制定计划,再把活分给数千个子 Agent 并行完成。 Project 会长期保存代码库、研究结果和用户偏好,几个月后也能接着干。任务默认跑在云端,电脑关掉也不会停;需要本机测试时,再自动拉起本地 Agent。它还能盯着 Slack 和 PR,自动修 CI,有新任务就自己开工,不用等人再发 prompt。 这其实是 Cursor 此前多 Agent 实验的正式产品化。今年 1 月,它已经展示过数百个 Agent 同时协作,甚至从零写出一个超过 100 万行代码的浏览器。现在 Projects 已进入 beta,正逐步向所有用户开放。
Grok视频Agent升到1.5:接入Image 2.0,多镜头连续性升级
动察 Beating AI 快讯,Grok Imagine 的视频创作 Agent 升级到 1.5 版。 这次容易和 6 月发布的 Grok Imagine Video 1.5 搞混。当时更新的是底层视频模型,现在更新的是 Agent 层。Grok Imagine Video 1.5 已于 6 月正式上线。 新版接入最新的 Image 2.0,重点提升生成质量、叙事和多镜头连续性。Grok 称,它更擅长把多个镜头连起来,让前后画面更连贯。目前已经上线 Grok 网页、iOS 和 Android。 Arena 的 Text-to-Video 榜单里,grok-imagine-video-1.5-agent 暂列第 5,得分 1491,高于 Seedance 2.5、Seedance 2.0 和 MiniMax H3。不过目前成绩仍是 Preliminary,排名还可能变化。
Qwen27B改成扩散Agent:速度拉到500+Token/s,厂商自测单项超Sol
动察 Beating AI 快讯,专攻超高速大模型的 Celeris 发布一款基于 Qwen3.8-27B 改出来的混合扩散 Agent 模型 Celeris-1 Magnus,官方称在不少场景能跑到 500+ Token/s。 在 τ³-Banking 的 97 个银行客服任务上,Magnus 开启 low reasoning 后完成率达到 41.2%,中位耗时 55 秒。同场的 GPT-5.6 Sol 是 38.1%、79 秒。 传统模型基本一个 Token 一个 Token 往后写,Magnus 能一次生成多个 Token,再反复修正。需要严格按顺序生成的内容再串行处理,因此一次计算可以往前推进更多 Token。
钉钉推出 AI 办公 App QwenNote,硬件 QwenNote A2 曝光
火星财经消息,据《读佳》报道,钉钉正推进全新 AI 办公应用 QwenNote(千问听记)。该应用定位为 AI 随身助理,通过软硬结合将实时语音转写、总结与翻译融为一体,并与 AI Agent 深度结合,把 Agent 能力嵌入语音输入,推动从单纯记录转向自动化执行。应用支持实时转写与中英双语识别及语种切换,可生成结构化会议纪要、大纲与待办,并内置基于听记素材的 AI 问答与快捷指令。QwenNote 提供语音备忘功能,需扫码连接录音设备,长按设备背面按钮即可记录灵感,录音完成后自动归档、生成标题与简要总结并标注时间。产品还设有无痕保护模式,开启后原始音频将被物理删除、仅保留转写文本,以适应涉密场景。应用内已亮相配套硬件 QwenNote A2,同属千问听记硬件生态,生态中还包括 DingTalk A1、DingTalk A1 Pro、Cleer H1 等,用户可扫码完成绑定。报道称,钉钉希望借软硬一体补齐线下语音采集入口,形成现场收音、实时双语转写、AI 纪要问答与钉钉组织协同的闭环,听记素材可同步至钉钉 AI 听记并支持个人私有隔离。软件侧其持续将大模型嵌入文档、会议与 IM 等场景,硬件侧则扩展千问听记产品线。相关硬件尚未大范围公开检索到更多正式发布信息。
腾讯T1专攻Agent长任务:连续操作300多轮,跑分涨20分
动察 Beating AI 快讯,腾讯把 Qwen3.5-122B-A10B 专门拿去练终端 Agent,做出了 T1。它主要处理 Linux 终端里的复杂任务,单个任务最多能连续调用工具 300 多轮。Terminal-Bench 2.1 得分从底模的 43.8% 升到 64.0%,涨了 20.2 分。 这 20.2 分里,大头来自强化学习。SFT 只把分数拉到 49.4%,后面的强化学习又涨了 14.6 分。团队准备了约 1.5 万个终端任务,每个任务都配有自动测试。Agent 没把整个任务做完,只要完成了其中一些要求,也能拿到相应奖励。 长任务还有一个麻烦。Agent 真正干活和之后拿这段经历训练时,同一句内容可能被重新切成不同 token,MoE 也可能换一批专家处理。T1 会把当时生成的 token 和选中的专家都记下来,训练时直接照着重放,把这种训推偏差压低了约三分之一。
阿里云:Token Plan个人版升级,新增12类Agent Harness工具
火星财经消息 9月11日,阿里云Token Plan个人版升级。据介绍,原有价格及Credit额度保持不变,Standard和Pro套餐新增Agent Harness工具权益与用量,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发常用能力。(广角观察)