Abliteration.ai 推出基于 GLM-5.3 的攻击性网络安全大模型
相关推荐
Terminal-Bench 4.0:GLM-5.3冲到第三,超过GPT-5.6 Sol
动察 Beating AI 快讯,Terminal-Bench 发布 4.0,重新校准 Agent 执行任务时的时间、CPU 和内存,并修复 19 个任务、移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一到 8 小时,主要是减少超时和环境问题对成绩的干扰。 最新榜单里,Opus 5 + Claude Code 以 51.8% 排第一,Fable 5 以 44.5% 第二。GLM-5.3 + Claude Code 拿到 41.8%,冲到第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名里,GLM-5.3 是唯一不是 Anthropic 的模型。 在 Terminal-Bench 3.0 中,GLM-5.3 还是 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到了 4.0,GLM-5.3 升到第三,反过来领先 Sol 4.5 个百分点。
智谱加固两周也没挡住,GLM-5.3开源3天就被拆掉拒答
动察 Beating AI 快讯,专门把开源模型做成「去拒答版」的 Abliteration.aiAbliteration.ai 上线 GLM-5.3 的去拒答版本 abliterated-model-large-v2。它直接修改模型权重,削弱模型拒绝请求的机制,主打进攻性网络安全、红队和 Agent 测试,并提供付费 API。 智谱此前把 GLM-5.3 开放权重推迟两周,用于安全评估和加固。8 月 28 日权重开放后,Abliteration 只用了 3 天就上线了这个版本。 GLM-5.3 的网络攻击能力本来就比 5.2 强很多。ExploitBench 从 24.4% 升到 54.4%,ExploitGym 两小时完成任务数从 29 个升到 105 个。Abliteration 目前没有公布去拒答后的重测成绩。 它的 API 默认只强制拦截儿童性内容和自残,违法活动、仇恨、骚扰、成人性内容等都默认放行。
小红书AI团队开源dots3-note,Terminal-Bench 2.1得分75.1
PANews 8月15日消息,小红书AI实验室dots.studio宣布开源dots3-note preview。该模型采用2800亿参数MoE架构,激活参数160亿,提供51.2万上下文窗口,并支持文本、视觉和音频多模态理解;其引入TEMPO强化学习方法,用于长时程智能体训练。模型权重已上线Hugging Face,API已接入OpenRouter。SemiAnalysis分享的图表显示,dots3-note在Terminal-Bench 2.1中得分75.1,较图中表现最好的美国开放权重模型高4.9分。
智谱正式发布GLM-5.3 拥有更强编程能力
火星财经消息,智谱8月14日正式发布GLM-5.3。据介绍,与GLM-5.2相比,GLM-5.3基座模型未变,但通过极致的后训练Scaling大大提高了模型的智能上界。GLM-5.3拥有更强的编程能力,在内部自建体感评测中较GLM-5.2提升50%,在包括TerminalBench3.0、Agents'LastExam(CLI)在内的公开基准测试中取得开源第一。智谱还表示,将在发布两周后开放模型权重。(财联社)
Token Terminal:链上代币化资产规模达3461亿美元,其中股票规模约为24亿美元
PANews 9月12日消息,据 Token Terminal 数据,链上代币化资产市场规模达 3461 亿美元,其中美元稳定币规模约为 2,985 亿美元,占比 86.2%;美国国债、收益策略、信贷基金和黄金分别为 150 亿美元、105 亿美元、64 亿美元和 51 亿美元,占比分别为 4.3%、3.0%、1.8% 和 1.5%。此外,代币化股票规模约为 24 亿美元,占比 0.7%。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。