接连指控中国模型蒸馏后,Anthropic藏起Fable 5思考摘要
相关推荐
Anthropic放宽Fable5生物限制,日常健康问题终于能正常答
据动察 Beating 监测,Anthropic 调整了 Claude Fable 5 的生物安全限制。此前生物问题一旦触发安全分类器,就会自动切到能力较弱的 Opus 5。新版分类器上线后,测试中的生物相关回退减少约 85%。化验结果解读、症状理解、生物学学习等普通问题,现在更容易直接用上 Fable 5。
网传DeepSeek Harness本周开启内测,对标Claude Code
BlockBeats 消息,7 月 28 日,据 Max For AI 爆料,名为「Harness」的 DeepSeek 版 Claude Code 即将开始内测。社群疯传的内测招募截图显示,DeepSeek Harness 计划于本周晚些时候开启内测,首批用户将从小范围群聊中筛选。入选者需要提交个人资料、签署《保密承诺函》,并获得产品访问权限。 更值得注意的是,图里还明确提醒:一旦泄密,不仅会被取消资格,还会影响之后 DeepSeek 各类模型、产品内测以及合作机会的入选。如果消息属实,V4 正式版和 Harness 将很快公布。 动察 Beating 稍早前报道,DeepSeek V4 正式版(V4 GA)可能推迟到 8 月中旬发布。Harness 封闭测试结束后约 1 至 2 周会开放 V4,发布时间可能在 8 月 10 日至 20 日之间。如果消息属实,DeepSeek V4 上线时可能会面对更强竞争。届时 GPT-6、Claude Fable 5.1、GLM-5.5 等下一代模型可能已经进入市场。 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。
DeepSeek版Claude Code即将上线,Harness将与V4正式版同步发布
据动察 Beating 监测,网友提供的群聊截图显示,DeepSeek Harness 团队计划把首款 Harness 产品与 V4 正式版一同发布。它是一款代码智能体产品,内部对标 Claude Code,负责让模型读写文件、调用工具、执行命令,并持续完成工程任务。 DeepSeek 此前宣布,V4 正式版计划于 7 月中旬上线,并同步启用峰谷定价。现在已是 7 月 20 日,原定时间窗口已经过去。如果计划没有再次调整,V4 和 Harness 都已进入发布倒计时。 DeepSeek 过去主要让开发者把 V4 接入 Claude Code、OpenCode 等第三方工具,这次终于要自己下场抢代码 Agent 的产品入口。
Anthropic宣布Claude生成内容嵌入隐形水印 标记机制全球适用
火星财经消息,Anthropic当地时间8月11日宣布,已签署欧盟《人工智能法案》(EU AI Act)第50条关于AI生成内容透明度的准则。8月2日起,Claude模型将在生成文本嵌入隐形水印,图片等文件则附加经数字签名的溯源元数据。Anthropic表示,标记机制将覆盖Claude旗下所有主要产品与接入渠道,包括Claude Platform(API)、Claude、Claude Code、Claude Cowork及Claude Tag,并适用于通过AWS、谷歌云及Microsoft Foundry接入的云合作伙伴。此外,标记机制将在全球范围内适用,覆盖Claude所有产品线及合作云平台,并非仅限于欧盟地区。Anthropic同时提示,检测到Claude标记,仅表明内容可能经由Claude处理,并不能完全确认内容的完整来源;未检测到标记也并不意味着内容并非由AI生成或处理。(财联社)
DeepSeek版Claude Code越来越近,Harness团队开通官方公众号
据动察 Beating 监测,DeepSeek Harness 团队已经开通独立微信公众号,并获得企业认证。此前这个团队主要通过招聘信息和成员个人账号对外露面。 Harness 是模型外的 Agent 执行层,负责上下文、工具调用和任务执行。DeepSeek 7 月 31 日发布 V4-Flash 正式版时,已经用 DeepSeek Harness 极简模式跑公开 Code Agent 基准,并标注「即将发布」。 团队近期也开始公开招募 Harness 内测用户,申请者需要有相关开源项目经历,并提交 GitHub ID 和代表作。
Claude Code之父:720次提示词注入攻击0成功,一年前想都不敢想
据动察 Beating 监测,Claude Code 负责人 Boris Cherny 称,Anthropic 已经「在实际使用中基本解决」提示词注入攻击。一年前,他自己都没想到能做到这个程度。 提示词注入攻击一直是 Agent 的大麻烦。恶意网页可以藏一段指令,诱导 Agent 偷密码、上传密钥,甚至执行用户根本没要求的操作。 Anthropic 现在靠三层防护来拦:Claude 本身先抵抗恶意指令,外部内容进入上下文前再检测一次,真正执行操作前,Auto Mode 还会再审一次。 第三方测试用了 72 种此前没见过的攻击,重复 720 次。Sonnet 5、Fable 5 和 Opus 5 开启 Auto Mode 后,一次都没成功。 同一测试中,GPT-5.6 Sol 使用 Codex Auto-review 的攻击成功率为 5.83%,Full Access 则达到 19.03%。 这也解释了 Anthropic 为什么敢把 Auto Mode 设成默认。它是 Claude Code 防提示词注入攻击的最后一道检查。