返回 7*24 快讯
来源Blockbeats

买6TB模型中转站数据就能拿到密钥?研究员称可攻入华为、小米等19家企业

动察 Beating AI 快讯,安全研究员寿超璠表示,他刚从一家中国头部大模型中转站买到约 6TB 的 Fable 模型调用数据。里面出现了 SSH 密钥、VPN 配置、阿里云密钥、GitLab 令牌等敏感凭证。 他称,这批数据里的密钥足以让他进入 19 家中国头部企业,以及 7 个中国和独联体政府相关机构的服务器或内部系统,包括华为、小米、蔚来和 MiniMax。 大模型中转站夹在用户和 Claude 等模型之间,请求和回复都会先经过它,因此能看到完整明文。开发者一旦把 SSH Key、API Key、VPN 配置等塞进 Agent 上下文,中转站如果保存甚至出售这些记录,公司的系统密钥也会一起流出去。 这并非寿超璠第一次警告中转站风险。他参与的 4 月论文测试了 428 个 LLM 中转站,发现 9 个会主动注入恶意代码,17 个在看到研究人员故意放入的 AWS 测试密钥后,真的拿这些密钥调用了 AWS,还有 1 个直接转走了测试钱包里的 ETH。 寿超璠是区块链安全公司 Fuzzland 联合创始人,长期做漏洞和供应链安全研究。3 月底,他还率先发现 Claude Code 2.1.88 发布包里的 source map 意外暴露约 50 万行 TypeScript 源码。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-03 11:11

20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。

09-03 11:54

Claude Fable 5.1 正式登陆 B.AI API,专为高难度推理与 Agent 工作流打造

ChainCatcher 消息,B.AI 平台宣布 Anthropic 最新 Mythos 级通用模型 Claude Fable 5.1 现已正式接入 API。 该模型与 Claude Mythos 5.1 采用相同底层模型,专为高强度代码编写、长期 Agent 工作流与复杂知识任务深度优化,在 CursorBench 3.2.0 测试中以最高运算强度取得 73.4% 的优异表现。 API 接入现已开放,开发者可享专属优惠——官方渠道低至 8.5 折,自选服务商低至 6 折。B.AI 持续引入全球顶尖模型,为开发者提供更强大、更具性价比的 AI 能力选择。

08-24 05:46

Claude:已确定Mythos 5、Fable 5等模型错误率升高的原因,正努力修复

火星财经消息 8月24日,Anthropic旗下AI模型Claude当地时间24日发布情况更新称,已确定Claude Mythos 5、Claude Fable 5、Claude Opus 5等模型错误率升高的原因,正努力修复,将尽快提供最新进展。(广角观察)

07-24 08:14

接连指控中国模型蒸馏后,Anthropic藏起Fable 5思考摘要

据动察 Beating 监测,Fable 5 已不再在网页端、桌面端和移动端展示思考摘要。模型仍在后台推理,用户只能看到最终答案。Anthropic 尚未解释原因,但这很可能是反蒸馏的最新措施。 今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 使用约 2.4 万个虚假账号,与 Claude 交互超过 1600 万次。月之暗面被指专门提取并重建 Claude 的推理轨迹。 6 月,Anthropic 又指控阿里及千问关联操作者通过近 2.5 万个虚假账号,与 Claude 交互超过 2880 万次。7 月,Anthropic 国家安全负责人 Tarun Chhabra 首次点名智谱,称 GLM-5.2 蒸馏了 Claude 和 OpenAI 模型。Kimi K3 发布后,白宫科技政策办公室主任 Michael Kratsios 又指控月之暗面用 Fable 开发 K3。 Fable 5 已内置「推理提取」分类器,专门拦截套取思考摘要的请求。现在 Anthropic 又把聊天界面的思考摘要直接隐藏,外界只能拿到最终答案,更难批量收集模型的解题过程用于蒸馏。代价是普通用户也看不到模型正在做什么,长任务走偏时更难发现,也更难及时纠正或叫停。

09-04 10:22

Claude上线内容检测器:最会写文章,偏偏查不了文章

动察 Beating AI 快讯,Anthropic 上线了一个免费的 Claude Content Checker,可以检查图片、视频和音频文件里有没有 Claude 留下的内容凭证。 比较搞笑的是,Claude 目前最主要的生成内容明明是文字,而且本身也没有传统意义上的生图、视频生成模型。结果这个公开检测器偏偏还查不了文字。 Claude Fable 5.1 和 Mythos 5.1 已经开始给生成文字加入不可见水印,但对应的检测 API 目前还在私测,只开放给部分媒体、研究机构和监管机构。

09-04 07:36

GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%

动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。