返回 7*24 快讯
来源MarsBit

Anthropic自曝Model2:强过Mythos5,暂不发布

据动察 Beating 监测,Anthropic 最新风险报告首次披露内部模型「Model 2」。它整体比 Mythos 5 更强,在不少内部任务上有明显提升,现在已经大量用于写代码、生成数据和跑 Agent。不过 Anthropic 暂无对外发布计划,也没有跑完平时发布新模型前会做的整套评测。 Anthropic 还把模型在高风险场景下「不按预期行事」的风险判断从「极低」上调到「低」。原因是近期网络安全测试接连出了事故,公司对这类风险的判断没以前那么有把握。此前 Claude 曾在测试中意外连上真实互联网,并未经授权进入三家外部机构的系统。 Claude 也已经深度参与 Anthropic 自己的研发。公司最终合入的生产代码,大部分已经由 Claude 编写,但 AI 带来的整体研发提速还不到 2 倍。大量代码能交给 AI,不代表整个研发流程也能自动化。 与此同时,部分具体任务评测已经「测不动了」:模型继续变强,原来的测试却越来越难看出差距。Anthropic 因此承认,现在对 AI 研发自动化风险的判断,反而没有以前那么有把握。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-08 14:34

Anthropic升级Claude新增预算控制、区域推理、技能加载与模型顾问功能

Odaily星球日报讯 Anthropic 本周对 Claude 进行升级,为 Claude Managed Agents 推出四项重要更新,进一步增强企业级 AI Agent 的可控性、部署灵活性和任务执行能力,包括: 1、新增会话预算控制功能,用户现在可以为 Agent 会话设置预算上限,以实现更精准的成本管理。当会话达到预算限制后,系统将触发事件并暂停运行,用户可提高预算后恢复任务执行。 2、开放推理区域控制能力,用户可以选择 Claude Managed Agents 运行位置,在全球可用资源中调度运行并按照标准价格计费,如果限制在美国区域运行,满足区域部署需求,但费用为标准价格的 1.1 倍。 3、支持自动加载用户仓库中的 Skills 能力模块; 4、新增顾问模型功能。用户可以配置一个更强大的模型作为“顾问”,让执行任务的 Agent 在会话过程中调用顾问模型进行第二意见分析,提高复杂任务处理质量。

08-07 13:25

字节10万亿参数模型已开训,规模逼近Anthropic Mythos5

据动察 Beating 监测,英国《金融时报》援引三名知情人士称,字节跳动已经开始预训练一款最高 10 万亿参数的大模型。项目仍处于早期阶段,最终规模尚未确定。如果按上限训练,它将达到 Kimi K3 的三倍以上,成为目前已知中国团队中参数规模最大的模型。 字节这次直接把模型尺寸推到了 Anthropic 旗舰附近。Anthropic 从未公布 Mythos 5 的参数量,但《金融时报》援引行业估算称,Mythos 5 约为 8 万亿参数,Fable 5 约为 5 万亿。字节新模型若做到 10 万亿,至少在参数规模上已经进入美国最前沿闭源模型的同一量级。 这款模型目前还在预训练(用海量数据训练模型的基础能力)。《金融时报》称,这一阶段通常需要 3 至 6 个月,之后还要继续后训练,顺利才会发布。参数更多也不等于能力一定更强,最终表现还取决于架构、训练数据和训练方法。 张一鸣近期在 Seed 内部明确反对蒸馏竞争对手模型,要求团队接受短期落后,靠自研冲击世界第一梯队。这款最高 10 万亿参数的新模型,是字节目前最激进的一次规模下注。

08-01 14:54

Claude Code跑Kimi K3最贵最慢,成本是Hermes Agent近4倍

据动察 Beating 监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。 Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。 按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。 Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。

08-13 15:47

Claude把Chrome侧边栏变成Cowork:浏览器开工,手机接着干

据动察 Beating 监测,Anthropic 把 Claude in Chrome 的侧边栏升级成完整的 Claude Cowork 会话。现在会话会直接保存到账号,用户可以在浏览器里开工,再去桌面端、网页或手机上接着做。 Chrome 里的 Claude 也能直接使用 Cowork 的 Skills、插件和连接器。它可以读取网页、点击按钮、输入内容和填写表单。涉及本地文件或让 Claude 主动操作电脑时,仍需要 Claude Desktop 保持连接。 Anthropic 7 月已经把 Cowork 扩展到网页和手机,现在又把 Chrome 侧边栏并入同一套跨设备会话。Cowork 从一个独立桌面 Agent,进一步变成了跨浏览器、电脑和手机连续工作的 Agent。 目前新版侧边栏已经向 Max 和 Team 用户开放,Pro 将在未来几周陆续上线。Enterprise 需要管理员开启。

08-13 15:47

Claude把Chrome侧边栏变成Cowork:浏览器开工,手机接着干

据动察 Beating 监测,Anthropic 把 Claude in Chrome 的侧边栏升级成完整的 Claude Cowork 会话。现在会话会直接保存到账号,用户可以在浏览器里开工,再去桌面端、网页或手机上接着做。 Chrome 里的 Claude 也能直接使用 Cowork 的 Skills、插件和连接器。它可以读取网页、点击按钮、输入内容和填写表单。涉及本地文件或让 Claude 主动操作电脑时,仍需要 Claude Desktop 保持连接。 Anthropic 7 月已经把 Cowork 扩展到网页和手机,现在又把 Chrome 侧边栏并入同一套跨设备会话。Cowork 从一个独立桌面 Agent,进一步变成了跨浏览器、电脑和手机连续工作的 Agent。 目前新版侧边栏已经向 Max 和 Team 用户开放,Pro 将在未来几周陆续上线。Enterprise 需要管理员开启。

08-12 10:19

Anthropic宣布Claude生成内容嵌入隐形水印 标记机制全球适用

火星财经消息,Anthropic当地时间8月11日宣布,已签署欧盟《人工智能法案》(EU AI Act)第50条关于AI生成内容透明度的准则。8月2日起,Claude模型将在生成文本嵌入隐形水印,图片等文件则附加经数字签名的溯源元数据。Anthropic表示,标记机制将覆盖Claude旗下所有主要产品与接入渠道,包括Claude Platform(API)、Claude、Claude Code、Claude Cowork及Claude Tag,并适用于通过AWS、谷歌云及Microsoft Foundry接入的云合作伙伴。此外,标记机制将在全球范围内适用,覆盖Claude所有产品线及合作云平台,并非仅限于欧盟地区。Anthropic同时提示,检测到Claude标记,仅表明内容可能经由Claude处理,并不能完全确认内容的完整来源;未检测到标记也并不意味着内容并非由AI生成或处理。(财联社)