Anthropic 发布 Claude Sonnet 5.5,编程成绩超过 Opus 5.5
相关推荐
数据:Polymarket 预测 Anthropic 下一代 Claude Opus 发布概率升至 90%
火星财经消息,PPP 预测市场工具监测显示,Polymarket “Anthropic 下一代 Claude Opus 将在 9 月 27 日前发布” 概率升至 90%,24 小时上涨 13%;在 9 月 30 日前发布的概率升至 94%,24 小时上涨 7%。根据结算规则,如果 Anthropic 的下一款 Claude Opus 模型在指定日期(美国东部时间 ET)之前向公众开放使用,该预测市场将结算为 “Yes”;否则结算为 “No”。Claude Opus 是指由 Anthropic 明确以 “Opus” 命名的模型,以其他名称发布的模型,例如 Sonnet、Haiku、Fable 或 Mythos,均不符合条件。此外,符合条件的模型必须已经正式推出并向公众开放访问,包括开放测试或面向公众开放的滚动候补名单注册。封闭测试或任何形式的私人访问均不符合结算条件。
Anthropic Claude Opus 5.5现已在所有平台上线
动察 Beating AI 快讯,Anthropic Claude Opus 5.5 现已在所有平台上线,包括亚马逊云服务 (AWS)、谷歌云和微软 Azure。
Anthropic成立生命科学研究团队,Claude发现具有CRISPR样特征的新型酶系统
当地时间9月23日,Anthropic宣布成立生命科学研究团队及实验室,并公布Claude参与生物学研究取得的早期成果。研究人员称,Claude在分析超过20万个逆转录酶(RT)序列后,发现一种此前未被描述的酶系统,并将其命名为“阵列相关逆转录酶”(ART)。Anthropic称,Claude约950个智能体在21小时内使用约2.1亿个Token,筛选出3500个候选系统并进一步缩小至20个。ART主要存在于感染细菌的噬菌体中,由逆转录酶、邻近的辅助基因以及一组排列规律的DNA重复序列组成,后者与CRISPR重复序列具有相似特征。初步实验显示,这些重复序列也会被转录为多个短RNA,但其具体功能仍有待进一步研究。(界面)
xAI发布Grok 4.7:参数规模增至2.1万亿,基准测试仍落后Claude
动察 Beating AI 快讯,xAI 周一正式发布 Grok 4.7,官方称其在同等价格和速度下较 Grok 4.6 有「显著提升」。Grok 4.7 此前至少经历 5 次延期,目前已上线 Grok 应用、Cursor、Grok Build 及 xAI API。 Grok 4.7 参数规模达到 2.1 万亿,较 Grok 4.6 的 1.5 万亿增加 40%,输入和输出价格分别为每百万 Token 2 美元和 6 美元。xAI 还引入 SpaceX 补充训练数据,包括 Starlink 卫星遥测数据、制造记录和工程故障日志,旨在提升模型对硬件及物理系统的推理能力。 基准测试方面,Grok 4.7 在 GDPval 和 AA-Briefcase 中均排名第二,得分分别为 1695 和 1657,均落后 Claude Fable 5.1 的 1735 和 1678;在电气工程基准测试 EEBench 中则排名第二,仅次于 GPT-6 Astra。CursorBench 4.0 显示,Grok 4.7 的任务成本高于 GPT-6 Astra 和 Claude Sonnet 5,同时整体表现仍落后 Fable 5.1。 马斯克此前曾表示,Grok 4.7 的水平大致相当于 Claude Opus 5.0,但尚未达到更新版本 Opus 5.1 的水平,并透露 Grok 4.8、4.9 及 Grok 5 正在开发中。
Anthropic称Kimi曾拿Claude代答:10天近30万条请求
动察 Beating AI 快讯,Anthropic 发布最新 AI 滥用调查报告,称月之暗面曾把部分 Kimi 用户请求直接转给 Claude,再把 Claude 的回答展示给用户。Anthropic 称,在一个 10 天窗口内,近 30 万条用户请求被这样转发,绝大多数进入 Opus。月之暗面为此使用了 5,380 个违规账号。这些用户当时以为自己仍在使用 Kimi。 Anthropic 还称,月之暗面会保存部分交互,并通过「跨会话重放」提取 Claude 的完整推理过程,用来训练自家模型。5 月至 7 月,相关蒸馏交互超过 2300 万次。 部分真实用户请求里还带着企业内部代码和有效凭证,也一起被转给了 Claude。Anthropic 表示,它不知道这些用户是否被告知数据会流向第三方。 这些说法目前主要来自 Anthropic 单方调查,尚未得到独立验证。针对美国三家机构此前提出的类似蒸馏指控,中国商务部回应称相关说法「于事无凭,于法无据」,并称蒸馏是业内通行技术。
Anthropic发布对Claude网络入侵事件的对齐评估:揭示模型“偏置推理”和“鲁莽”问题
PANews 9月10日消息,Anthropic在对约4.81亿条模型交互记录审查中,确认4起Claude模型在网络安全评估中误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7及一款内部研究模型。事故源于第三方评测环境误配置导致出网,且评测中未启用正式产品的网络安全防护。Anthropic将核心对齐风险总结为模型在任务驱动下表现出的“偏置推理”和“鲁莽”行为,其中Claude Mythos 5曾在认为处于“模拟环境”前提下向PyPI上传恶意包、利用泄露凭证访问安全厂商真实数据库。