网传DeepSeek Harness本周开启内测,对标Claude Code
相关推荐
阶跃星辰开源Step Code:自测追平DeepSeek Harness,token更省
动察 Beating AI 快讯,阶跃星辰开源 AI 编程工具 Step Code v0.1.0,采用 MIT 许可证。它直接跑在终端里,可以读写代码、跑测试和执行开发任务,还支持 MCP、Agent Skills 和 Claude Code 插件。内置的 StepPage 可以一条命令把本地静态网站发布到线上。 Step Code 主打少用 token。在阶跃自己的 Terminal-Bench 2.1 横评中,它完成 72/89 个任务,得分 80.9%,与 DeepSeek Harness 并列最高,但 token 用量更低。 阶跃自建的 Multi-Frame 长任务测试共有 150 道题,Step Code 完成 110 道,得分 73.3%,平均每题消耗 509 万 token,在对比的 6 款 harness 中同时拿到最高通过率和最低 token 用量。 不过阶跃没有公布这轮横评具体用了哪个底层模型,也没有拆解这些 token 是怎么省下来的。官方只提到 Step Code 与 Step 系列模型一起针对 token 消耗做过调优。 源码里也能看到不少「节流」设计:文件读取和命令输出会限长,搜索尽量缩小返回范围,长对话默认会压缩上下文,system prompt 也要求能直接调用工具就不要额外开 Agent。 还有一套更激进的 contextProjection,可以裁掉旧工具输出、重复结果和历史 reasoning,不过默认关闭。 综合来看,它的 token 优势来自模型和 harness 多处优化叠加。
MiniMax把OpenAI新Agents API做成开源版,Codex、Claude Code都能接
动察 Beating AI 快讯,MiniMax 开源 OpenAgentCore,做了一套兼容 OpenAI Agents API 的自托管实现。开发者可以继续使用 OpenAI 官方 SDK,只需要换掉 API 地址,后台运行的 Agent 可以选择 Codex、Claude Code 或 MiniMax Code。 Agents API 可以理解成一套「调用 Agent 的统一接口」。普通模型 API 主要负责一问一答。Agent 要连续干几个小时甚至几天,还要管理上下文、调用工具、协调子 Agent、保存任务进度。OpenAI 的 Agents API 把这些能力放到一个长期运行的 Session 里统一管理。 OpenAI 官方版本使用 OpenAI 托管的 Codex 执行框架。开发者可以自己选择代码在哪运行,但 Agent 的任务编排、上下文管理和运行状态仍由 OpenAI 负责。OpenAgentCore 则把这套后端也交给开发者自己部署。
Anthropic给Claude Code用户送云端额度:Pro100美元,Max250美元
动察 Beating AI 快讯,Anthropic 宣布 Claude Code Cloud Sessions 从研究预览转为正式可用。它会把 Claude Code 跑在 Anthropic 的云端环境里,电脑关掉后任务也能继续。用户可以从网页、手机、桌面端或 CLI 启动。 现有 Pro 和 Max 用户还能领取一次性专用额度,Pro 为 100 美元,Max 为 250 美元。这笔额度只用于 Cloud Sessions,与平时的订阅使用上限分开。即使本地 Claude Code 已经触发使用限制,云端任务仍能继续跑,直到这笔额度用完。领取截止到 10 月 7 日,额度在 11 月 4 日过期。 这不是把原来的云端功能改成单独收费。Anthropic 当前文档明确写着,Cloud Sessions 平时仍与 Claude 和 Claude Code 共享订阅使用限额,也没有额外的云端 VM 费用。赠送额度用完后,就重新按正常订阅限额使用。
韩国多家金融机构疑遭AI攻击,黑客在Claude Code留下身份线索
动察 Beating AI 快讯,9 月底至 10 月初,韩国至少 7 家金融机构接连发生数据泄露,包括新韩银行、国民银行、韩亚银行等。其中,新韩银行约 2.5 万名客户、Yegaram 储蓄银行约 4 万名客户受影响。泄露的信息包括姓名、电话、年收入和贷款额度等,目前尚未发现资金被盗。 攻击主要针对银行的外围业务系统,包括供贷款中介使用的贷款查询服务,以及员工移动办公系统。多起攻击涉及重合的 IP 地址,韩国监管部门怀疑是同一攻击者所为。10 月 6 日,韩国总统李在明表示,这些攻击可能使用了 AI。 10 月 7 日,网络安全公司 CrowdStrike 公布了更具体的证据。调查人员发现,攻击者使用两台服务器,一台位于香港,用于控制攻击活动;另一台运行开源 AI 渗透测试系统 ARTEX。由于部分服务器目录对外开放,调查人员获取了 ARTEX 配置文件、Claude Code 聊天记录和 AI 记忆文件。 ARTEX 可以连接不同的大模型,自动寻找漏洞、规划测试步骤并调用安全工具。配置文件显示,攻击者主要使用 DeepSeek v4.1-flash 驱动 ARTEX。此外,攻击者还使用 Claude Code,并在其他会话中调用过 GLM-5.3 和 Grok 4.6。 Claude Code 的聊天记录还暴露了攻击者的其他活动。他曾询问韩国泄露数据通常在哪里出售,以及如何寻找相关 Telegram 交易群组。他还让 AI 帮忙写一份安全研究员简历,要求把使用 ARTEX 进行渗透测试的成果写进去。 在写简历的提示词中,攻击者留下了 26 岁、广东茂名、华南理工大学、电话号码和 Telegram 账号等信息,但填写的出生日期与年龄不符。CrowdStrike 判断,攻击者可能使用中文,并以牟利为目的,但尚未确认真实身份。 10 月 8 日,韩国《京乡新闻》联系到上述 Telegram 账号的使用者。对方自称在河南一家便利店工作,称有人故意冒用他的资料嫁祸。不过,记者发现该账号还出现在两个与 DDoS 攻击有关的 Telegram 社区管理员名单中。其说法尚未得到证实,韩国警方仍在调查。
Claude杀入国产低价模型腹地:智谱、MiniMax盘中大跌
动察 Beating AI 快讯,Anthropic 新发布的 Claude Haiku 5.5,正在对国产低价模型形成「斩杀线」一般的竞争压力。10 月 8 日,港股大模型公司集体走弱,MiniMax 跌超 9%,智谱跌超 6%。同期恒生科技指数跌约 1%。 Haiku 5.5 的基础 API 输入价格为每百万 tokens 0.1 美元,输出为 0.5 美元。相比之下,DeepSeek V4.1 Flash 高峰时段分别收费 0.3 和 1.2 美元,闲时降至 0.15 和 0.6 美元。智谱 GLM-5.3 Flash 的标准价格为 0.15 和 0.5 美元。Haiku 5.5 在输入不超过 10 万 tokens 时,已经具备明显的单价竞争力。 Artificial Analysis 给 Haiku 5.5 的综合智能指数打出 43 分,超过 GLM-5.3 Flash 的 42 分、DeepSeek V4.1 Flash 的 39 分,以及小米 MiMo-V2.6-Flash 的 38 分。在 Terminal-Bench 4.0 编程评测中,Haiku 5.5 和 GLM-5.3 Flash 同为 33%,高于 DeepSeek 的 27% 和 MiMo 的 23%。 不过,Haiku 5.5 的优势主要体现在基础单价和最高推理强度下的成绩。它的 token 消耗较高,长上下文还会触发五倍定价。
AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
动察 Beating AI 快讯,Artificial Analysis 推出独立的 Cyber Index,专门评测 AI Agent 做企业网络防御的能力。它不是从原来的通用 Intelligence Index 里抽几项测试,而是另外采用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项网络安全评测,分别测试漏洞审计与修补、漏洞发现,以及从发现漏洞到复现并修补的完整流程,三项各占三分之一。 首批榜单中,Grok 4.7(xhigh)和小米 MiMo-V2.6-Pro 同为 56 分,GPT-6 Luna(max)53 分,GLM-5.3-Flash 50 分。MiMo 平均每个任务成本只有 0.18 美元,Grok 4.7 要 11.67 美元;Luna 更低,只要 0.12 美元。 不过,这张榜不能简单理解成模型本身的网络安全能力排名。GPT-6 Sol、GPT-6 Astra 和 Claude Opus 5.5 都参加了测试,但在 CyberGym-E2E-AA 上几乎全部拒答,其中 Sol 和 Astra 拒绝全部任务,Opus 5.5 拒绝 98%。拒答直接记 0 分,Luna 反而愿意继续完成这些任务,所以综合成绩更高。Artificial Analysis 也表示,大量拒答让这些前沿模型的实际能力很难判断。 GLM-5.3 也出现了明显反常。完整版在 Artificial Analysis 的通用能力榜上高于 Flash,但这次 Cyber Index 只有 36 分,Flash 达到 50 分。主要差距来自 CyberGym-E2E-AA:Flash 得到 74%,完整版只有 29%。Artificial Analysis 暂未解释这一差距的原因。