买6TB模型中转站数据就能拿到密钥?研究员称可攻入华为、小米等19家企业
相关推荐
20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。
Claude Fable 5.1 正式登陆 B.AI API,专为高难度推理与 Agent 工作流打造
ChainCatcher 消息,B.AI 平台宣布 Anthropic 最新 Mythos 级通用模型 Claude Fable 5.1 现已正式接入 API。 该模型与 Claude Mythos 5.1 采用相同底层模型,专为高强度代码编写、长期 Agent 工作流与复杂知识任务深度优化,在 CursorBench 3.2.0 测试中以最高运算强度取得 73.4% 的优异表现。 API 接入现已开放,开发者可享专属优惠——官方渠道低至 8.5 折,自选服务商低至 6 折。B.AI 持续引入全球顶尖模型,为开发者提供更强大、更具性价比的 AI 能力选择。
Claude:已确定Mythos 5、Fable 5等模型错误率升高的原因,正努力修复
火星财经消息 8月24日,Anthropic旗下AI模型Claude当地时间24日发布情况更新称,已确定Claude Mythos 5、Claude Fable 5、Claude Opus 5等模型错误率升高的原因,正努力修复,将尽快提供最新进展。(广角观察)
接连指控中国模型蒸馏后,Anthropic藏起Fable 5思考摘要
据动察 Beating 监测,Fable 5 已不再在网页端、桌面端和移动端展示思考摘要。模型仍在后台推理,用户只能看到最终答案。Anthropic 尚未解释原因,但这很可能是反蒸馏的最新措施。 今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 使用约 2.4 万个虚假账号,与 Claude 交互超过 1600 万次。月之暗面被指专门提取并重建 Claude 的推理轨迹。 6 月,Anthropic 又指控阿里及千问关联操作者通过近 2.5 万个虚假账号,与 Claude 交互超过 2880 万次。7 月,Anthropic 国家安全负责人 Tarun Chhabra 首次点名智谱,称 GLM-5.2 蒸馏了 Claude 和 OpenAI 模型。Kimi K3 发布后,白宫科技政策办公室主任 Michael Kratsios 又指控月之暗面用 Fable 开发 K3。 Fable 5 已内置「推理提取」分类器,专门拦截套取思考摘要的请求。现在 Anthropic 又把聊天界面的思考摘要直接隐藏,外界只能拿到最终答案,更难批量收集模型的解题过程用于蒸馏。代价是普通用户也看不到模型正在做什么,长任务走偏时更难发现,也更难及时纠正或叫停。
Claude上线内容检测器:最会写文章,偏偏查不了文章
动察 Beating AI 快讯,Anthropic 上线了一个免费的 Claude Content Checker,可以检查图片、视频和音频文件里有没有 Claude 留下的内容凭证。 比较搞笑的是,Claude 目前最主要的生成内容明明是文字,而且本身也没有传统意义上的生图、视频生成模型。结果这个公开检测器偏偏还查不了文字。 Claude Fable 5.1 和 Mythos 5.1 已经开始给生成文字加入不可见水印,但对应的检测 API 目前还在私测,只开放给部分媒体、研究机构和监管机构。
GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%
动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。