Premiere和AE开始被Agent拆掉,Mirage发布Tesseract
相关推荐
GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%
动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。
GPT-6 Astra即将发布:OpenAI官方仓库已出现GPT-6
动察 Beating AI 快讯,OpenAI 官方的 GitHub 仓库里,已经直接出现了 GPT-6。一名 OpenAI 开发者向 Computer Use 示例项目提交 PR,新增 gpt6-js-image 和 gpt6-py-image 两套环境,分支名也直接叫 codex/gpt6-computer-use-images。 这两套环境分别面向 JavaScript 和 Python。前者装好 Playwright 和 Chromium,后者则用 PyAutoGUI、Chromium 和 Linux 桌面环境,让 Agent 可以看屏幕、操作浏览器和桌面。PR 目前还没有合并,而且里面没有 GPT-6 的 API 调用,只是在准备 Computer Use 的运行环境。 Sam Altman 最近在采访中称,过去的模型操作电脑一直太慢或者不好用,但 Astra 让他第一次感觉「已经达到和人类差不多的水平」。他现在会直接让模型去不同应用里找消息,而不是自己一个个打开搜索。
GPT-6 Astra解决刘维尔版哥德巴赫,Lean独立复核通过
动察 Beating AI 快讯,匿名数学社区账号 Captain Sude 公布了 GPT-6 Astra 找到的一份新证明,解决了刘维尔版哥德巴赫问题。 这个问题把经典哥德巴赫猜想里的「两个质数」,放宽成「两个质因子总数为奇数的整数」。此前杜伦大学数学家 Alexander P. Mangerel 只能在广义黎曼猜想成立、且偶数足够大时证明。 Astra 现在去掉了这两个限制,证明所有大于 2 的偶数都成立。核心思路是先假设某个偶数无法这样拆分,再一步步推出互相矛盾的结果。 完整证明已经写进 Lean 4。项目可以正常编译,独立审计仓库也成功复现,没有发现 `sorry` 或额外数学公理。 经典哥德巴赫猜想本身仍未解决,因为这里的两个加数依然可以是合数。
85年没解开的德军恩尼格玛密电,GPT-6 Astra用10小时破了
动察 Beating AI 快讯,彭博一名产品开发人员 Carter Leffen 用 GPT-6 Astra,破解了一条 1941 年的德军恩尼格玛密电。他本人并不是密码学家。 这条密文只有 82 个字母,此前一直被密码史料网站 CryptoCellar 列为尚未破解。Astra Extra High 大约花了 10 小时找到答案。 关键线索来自当天另一封已经破译的电报。Astra 发现里面连续出现两次地名「ROSENOW」,随后猜测这个词也藏在目标密文里。它接着写恩尼格玛模拟器和搜索程序,并行测试不同密钥,再用原始电报头和剩余文字验证。 最终还原出的内容很简单:「请告知行军路线。我在 Rosenow。请立即通过无线电回复。」 不过这次也不是完全只靠 Astra。Leffen 负责提出目标和推进调查,Astra 则完成了大量查资料、写代码、跑搜索和验证工作。
OpenAI推出法律版GPT-6 Astra,法律研究正确率提升40%
动察 Beating AI 快讯,OpenAI 推出 Astra for Law,把 GPT-6 Astra 做成专门面向法律工作的版本。它加入法律检索、分析和写作能力,可以帮律师查判例、分析案件、起草文件,也能接入律所现有的工作流。 OpenAI 还新建了一套法律搜索索引,可以查询美国判例、法规、法院规则等超过 2.3 亿个 URL,覆盖 99.9% 以上已公开的美国先例判决。 在 200 道美国法律研究题中,Astra for Law 的整体正确率达到 54.0%,普通 GPT-6 Astra 加网页搜索为 38.7%,相对提升约 40%。在判例题上,它找到的参考案例也多了 24%。 Astra for Law 会先向部分美国律所开放,在 ChatGPT 和 Codex 中显示为 GPT-6 Astra Law,随后开放 API。Harvey、Legora 等法律 AI 公司也可以把它接进自己的产品。OpenAI 还推出 26 个法律行业插件,可以调用 Thomson Reuters、Relativity、Clio 等专业法律数据和工具。
GPT-6 Astra直接接管机器人「大脑」,模拟成绩超过专用VLA
动察 Beating AI 快讯,由香港大学 MMLab 牵头的机器人操作评测项目团队 RoboDojo 做了个反常规实验。他们没有给 GPT-6 Astra 再配一个训练好的机器人策略,而是让这个通用多模态模型直接看相机、读取机器人状态、理解任务,再自己决定下一步怎么动。中间只有一套固定控制工具,把 Astra 给出的目标位置转成机械臂动作。 在 42 项模拟任务里,Astra 拿到 28.97 分、22.48% 平均成功率,超过原公开榜首 DM0.5 的 24.90 分、19.34%。同一套控制方式换成 GPT-5.5,只有 1.13 分、0.88%。 RoboDojo 公开榜过去主要是 VLA、WAM 这类专门训练的机器人策略。现在,原本需要专用模型完成的一部分动作决策,通用大模型已经可以直接接手,而且整体成绩还超过了原榜首。机器人是否还需要单独训练一颗「大脑」,这个问题第一次变得很具体。 但 Astra 还替不了机器人的「小脑」。插入、倒液体、精细接触这些依赖真实物理控制的任务,它明显更弱。真机测试还因为多次出现危险动作并损坏硬件,被团队提前叫停。 随着通用模型能力变强,机器人模型的分工可能会被重新划分:大模型负责看懂环境、判断和规划,专用 VLA 与传统控制器负责把动作做准、做稳。