iPhone版豆包手机助手出现了?开发者演示用Opus 5.5操作iPhone
相关推荐
马斯克给Grok Bot接Claude Opus 5.5:以后谁好用就用谁
动察 Beating AI 快讯,马斯克宣布,Grok Bot 接下来会按任务选择最合适的后端模型或 API。他直接点名 Claude Opus 5.5、Midjourney 和 Suno,还会使用其他主流 AI 模型和 API。用他的话说,哪个最可能给出最好的结果,就用哪个。 Grok Bot 是 SpaceXAI 推出的常驻 AI Agent。每个 Bot 都有自己的云电脑,可以登录网页和应用,持续处理邮件、表格、客服和编程等任务。SpaceXAI 此前还专门让 Grok 4.7 学会理解 Grok Bot 的运行框架。 现在马斯克明确把这套 Agent 推向多模型路线。Grok Bot 可以根据任务调用 Claude Opus 5.5、Midjourney、Suno 等外部模型和 API。它更像负责拆任务、调模型和执行工作的上层 Agent,底下不再只依赖 Grok。
Hermes模型榜上线,Opus 5.5第一,Astra第二却最贵
动察 Beating AI 快讯,Nous Research 给 Hermes Agent 上线模型排行榜 Hermes Index,主要用来比较不同模型在 Hermes 里的表现。所有模型都使用同一套 Hermes Agent 运行框架,支持调节推理强度的统一设为 high。榜单取 Hermes Bench、Terminal-Bench 4、Terminal-Bench Science 和 SkillsBench 四项测试的平均分,同时统计平均每任务成本。 其中 Hermes Bench 是 Nous Research 自己新做的测试,共有 150 个任务、25 类场景,覆盖 Skills、研究、图表与创作、记忆、工具调用和安全。Agent 会直接处理工作区和真实文件,最后根据生成的文件、任务状态和工具使用记录评分。 首版共测试 14 个模型。Claude Opus 5.5 以 63.31 分排第一,GPT 6 Astra 以 56.25 分第二,Claude Sonnet 5.5 以 53.14 分第三。Astra 平均每个任务花费 11.61 美元,是全榜最高。Opus 5.5 为 4.99 美元,Sonnet 5.5 为 2.82 美元,两者部分数据仍被官方标为暂定。 低价模型中,DeepSeek V4.1 Flash 得到 36.91 分,平均每任务花费 0.259 美元;GPT 6 Luna 为 33.89 分,每任务 0.141 美元。两者都进入成本与性能的 Pareto 前沿,也就是不存在价格更低、同时分数更高的模型。
一夜两条路线:Opus5.5冲到第一,GPT-6把同档成本砍半
动察 Beating AI 快讯,Artificial Analysis 完成对昨夜几款新模型的第三方实测。Claude Opus 5.5 max 在 Intelligence Index v4.3 拿到 58 分,目前排名第一。GPT-6 Astra 和 Fable 5.1 都是 53 分,Opus 5 为 51 分。Opus 5.5 在 10 项评测里拿下 6 项最高分。 但这个最高分也用了更多 token。Opus 5.5 max 每项任务平均输出约 11.9 万 tokens,比 Opus 5 的 7.3 万多约 60%。靠 API 降价 20% 和缓存读取降价 60%,单任务成本最终为 5.98 美元,和 Opus 5 的 5.86 美元基本持平。更实用的 medium 档拿到 51 分,已经追平 Opus 5 max,单任务成本只有 1.34 美元。 OpenAI 走的则是另一条路。GPT-6 Sol 和 Luna 的 Intelligence Index 表现与 GPT-5.6 前代接近,但价格明显下降。Sol max 每项任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元。编码 Agent 评测里,Sol 从 55 分升到 57 分,成本也下降约一半;Luna 从 43 分降到 41 分,但单任务成本低约 60%。 两家的路线已经开始出现分化:Opus 5.5 用更多推理把能力上限推到新高,GPT-6 Sol 和 Luna 则主要把原有能力做得更便宜。 在 Artificial Analysis 的性能/成本图上,两家的新模型都占据了新的 Pareto 前沿。
GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%
动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。
Gemini3.8 Flash正式上线:价格不变,多项评测胜过Opus5
动察 Beating AI 快讯,Google 正式上线 Gemini 3.8 Flash。新模型继续主打长时间软件工程和自主 Agent。上下文约 100 万 Token,最高输出 6.5 万 Token。Google 的托管 Antigravity Agent 也已经默认换成 3.8 Flash。 Google 自家对比表里,3.8 Flash 在 14 组分数中拿下 8 组第一。DeepSWE v1.1 从 65.3% 升到 71.0%,接近 Opus 5 的 74.0%。Terminal-bench 2.1 则达到 89.4%,略高于 Opus 5 的 89.1% 和 GPT-5.6 Sol 的 88.8%。金融 Agent、法律 Agent、复杂图表推理和长视频理解也拿到最高分。 不过它没有全面超过旗舰。Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%。OSWorld-2.0 也以 59.0% 落后于 Opus 5 的 75.4%。 3.8 Flash 当前输入 0.75 美元、输出 3.75 美元/百万 Token,和 3.7 Flash 一样。两项单价都只有 Opus 5 的 15%。优惠到 12 月 31 日,2027 年 1 月 1 日起翻倍。
AI Agent也有通讯录了,Photon让它们在iMessage里拉群办事
动察 Beating AI 快讯,AI Agent 现在可以自己找其他 Agent 帮忙了。消息基础设施公司 Photon 宣布,将 A2A(Agent 之间的通信与协作)引入 iMessage 群聊。用户只需交代任务,个人 Agent 就能寻找其他 Agent,获取电话号码,并把它们拉进同一个群聊。 例如,用户想组织一次团队出游。个人 Agent 可以寻找负责住宿、打车和餐厅预订的 Agent,让它们在群里共同安排行程。用户可以随时查看对话,参与讨论。Photon 将这种模式称为「Agent-to-Agent-to-Person」,即多个 Agent 与真人一起协作。 技术上,新功能基于 A2A 协议及其 Agent 发现机制。该协议最初由谷歌提出。Photon 此前已经支持 AI Agent 通过 iMessage 收发消息,这次新增了主动寻找其他 Agent 并建立群聊的能力。 Photon 最近完成了 450 万美元种子轮融资。创始人 Daniel Tian 希望每家企业都能提供自己的 Agent,供其他 Agent 直接联系。