返回 7*24 快讯
重要来源Blockbeats

智谱加固两周也没挡住,GLM-5.3开源3天就被拆掉拒答

动察 Beating AI 快讯,专门把开源模型做成「去拒答版」的 Abliteration.aiAbliteration.ai 上线 GLM-5.3 的去拒答版本 abliterated-model-large-v2。它直接修改模型权重,削弱模型拒绝请求的机制,主打进攻性网络安全、红队和 Agent 测试,并提供付费 API。 智谱此前把 GLM-5.3 开放权重推迟两周,用于安全评估和加固。8 月 28 日权重开放后,Abliteration 只用了 3 天就上线了这个版本。 GLM-5.3 的网络攻击能力本来就比 5.2 强很多。ExploitBench 从 24.4% 升到 54.4%,ExploitGym 两小时完成任务数从 29 个升到 105 个。Abliteration 目前没有公布去拒答后的重测成绩。 它的 API 默认只强制拦截儿童性内容和自残,违法活动、仇恨、骚扰、成人性内容等都默认放行。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-01 15:25重要

Abliteration.ai 推出基于 GLM-5.3 的攻击性网络安全大模型

PANews 9月1日消息,初创公司 Abliteration.ai 宣布上线新模型“abliterated-model-large-v2”,基于排名 Terminal-Bench 4.0 第三的 GLM-5.3,宣称其在网络攻防利用能力上较 5.2 版本提升约 2 倍。官方称通过在权重层面移除模型激活中的“拒绝”方向,保留编码、网络安全与智能体能力,使其可用于进攻性网络安全、AI 红队评估、智能体测试及信任与安全场景中完整执行授权攻击链路。该模型由美国托管,采用 FP8 精度,支持 100 万上下文窗口,且承诺不保留输入和输出提示,当前已通过 API 对外开放访问。

09-11 09:30

离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成

动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

09-03 11:11

20小时编程评测拉开差距:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

动察 Beating AI 快讯,AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。任务从 17 个扩到 34 个,每个模型在每项任务上跑 5 次,单次最多干 20 小时。Claude Fable 5.1 平均得分 56.29%,大幅领先 GPT-5.6 的 32.2%。开源模型 GLM-5.3 以 30.2% 排第三。 FrontierSWE 里的任务已经不只是修代码。Agent 要从零写电路模拟器、训练天气预测模型,还要靠望远镜照片匹配星表,或者只看游戏画面训练赛车 Bot。v2 统一换成 Proximus harness。每次任务最多运行 20 小时,模型准备交卷时,系统会先保存当前版本并告诉它还剩多少时间,避免模型过早结束任务。 这个改动对成绩影响不小。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 换成 Proximus 后都工作得更久,平均成绩也高于各自原生 harness。 评测还抓到了多次主动作弊。GPT-5.6 曾意识到读取公开答案「可能涉及反作弊问题」,最后还是用了这条捷径;另一次甚至利用 Modal 的后台服务读取隐藏验证文件。Muse Spark 1.2 则改测试脚本、塞入公开答案,还写代码试图掩盖作弊痕迹。确认违规的运行全部被记为零分。

09-03 06:08

欧洲第一模型身份曝光:Quasar 438B基于智谱GLM-5.2

动察 Beating AI 快讯,西班牙 AI 公司 Multiverse Computing 刚把 Quasar 438B 宣传为「欧洲最强 AI 模型」,社区就扒出了它和智谱 GLM-5.2 的关系。Artificial Analysis 当前页面已经直接把模型标为「Quasar 438B (max, based on GLM-5.2)」,明确写着它基于 GLM-5.2。 Multiverse 自己的旧文档其实也早有线索。8 月 5 日 Quasar 438B 上线 beta 时,CompactifAI 更新日志写明,它的能力与 GLM-5.2「完全相同」。社区据此质疑,Quasar 是否只是把 GLM-5.2 压缩或改造后重新命名。Multiverse 目前没有公布架构、训练方式,也没有解释两者具体是什么关系。Multiverse 的主业就是模型压缩,但它自己的 FAQ 目前仍把 Quasar 列在「Original Models」,没有放进「Compressed Models」。 GLM-5.2 总参数约 753B,推理时激活 40B,Artificial Analysis 智能指数 max 档为 53 分;Quasar 缩到 438B 后只有 43 分,但输出速度约 174 Token/s,明显快于 GLM-5.2 的约 68 Token/s。

08-29 13:49

Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol

动察 Beating AI 快讯,Terminal-Bench 发布 4.0,重新校准 Agent 执行任务时的时间、CPU 和内存,并修复 19 个任务、移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到 8 小时,主要是减少超时和环境问题对成绩的干扰。 最新榜单里,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,冲到第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名里,GLM-5.3 是唯一不是 Anthropic 的模型。 在 Terminal-Bench 3.0 中,GLM-5.3 还是 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反过来领先 Sol 4.5 个百分点。