Microsoft AI推出全新自主研发的网络安全模型
相关推荐
微软MAI-Image-2.6-Flash卷性价比:快2.8倍,千张不到20美元
动察 Beating AI 快讯,Microsoft AI 推出 MAI-Image-2.6-Flash,并在 Microsoft Foundry 开放公共预览。它是旗舰模型 MAI-Image-2.6 的加速版,同样支持文生图、图片编辑、多图参考、联网获取最新信息和自动选择画面比例,重点是把生成延迟和成本继续压低。 速度是这次最大的卖点。MAI-Image-2.6-Flash 的生图速度是 GPT-Image-2 Medium 的 2.8 倍,GPU 使用效率高 72%。 但也不是纯靠牺牲画质换速度。Artificial Analysis 当前图片编辑榜里,MAI-Image-2.6-Flash 以 1311 Elo 排第三,略高于 GPT Image 2 high 的 1309;文生图则以 1297 Elo 排第八。旗舰 MAI-Image-2.6 的表现更强,目前分别排图片编辑第一、文生图第二。 微软 Foundry 上 MAI-Image-2.6-Flash 的图片输出价格为每百万 token 19 美元,旗舰 2.6 为 38 美元。Artificial Analysis 按代表性图片折算后,Flash 约为 19.5 美元/千张,而 GPT Image 2 high 约为 211 美元/千张。
微软Win11将整合MAI Code 1.1 Flash:130B参数、上下文窗口256K
火星财经消息 10月8日,在美国旧金山举办的活动中,微软表示正计划将MAI Code 1.1 Flash模型引入Windows 11设备。该模型是6月版MAI-Code-1-Flash的升级版,参数量为1300亿,采用3-bit量化后体积缩小约80%,上下文窗口256K,定位在Copilot里高频、低成本、低延迟地完成编码任务。相比6 月版本,MAI Code 1.1 Flash模型在GitHub Copilot CLI的Terminal-Bench 2.1上提升约22%,在.NET任务上提升约15%;同时输出token流速度提升约25%,完成任务所需token减少约25%。多模态方面,新增“看图写代码 / 理解图”的能力,可直接读取截图、架构图、UI 草图等图像输入,而6月版本只支持纯文本输入。(广角观察)
AI网络安全榜爆冷:GPT-6、Claude旗舰因安全拒答掉队,小米MiMo追平Grok登顶
动察 Beating AI 快讯,Artificial Analysis 推出独立的 Cyber Index,专门评测 AI Agent 做企业网络防御的能力。它不是从原来的通用 Intelligence Index 里抽几项测试,而是另外采用 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项网络安全评测,分别测试漏洞审计与修补、漏洞发现,以及从发现漏洞到复现并修补的完整流程,三项各占三分之一。 首批榜单中,Grok 4.7(xhigh)和小米 MiMo-V2.6-Pro 同为 56 分,GPT-6 Luna(max)53 分,GLM-5.3-Flash 50 分。MiMo 平均每个任务成本只有 0.18 美元,Grok 4.7 要 11.67 美元;Luna 更低,只要 0.12 美元。 不过,这张榜不能简单理解成模型本身的网络安全能力排名。GPT-6 Sol、GPT-6 Astra 和 Claude Opus 5.5 都参加了测试,但在 CyberGym-E2E-AA 上几乎全部拒答,其中 Sol 和 Astra 拒绝全部任务,Opus 5.5 拒绝 98%。拒答直接记 0 分,Luna 反而愿意继续完成这些任务,所以综合成绩更高。Artificial Analysis 也表示,大量拒答让这些前沿模型的实际能力很难判断。 GLM-5.3 也出现了明显反常。完整版在 Artificial Analysis 的通用能力榜上高于 Flash,但这次 Cyber Index 只有 36 分,Flash 达到 50 分。主要差距来自 CyberGym-E2E-AA:Flash 得到 74%,完整版只有 29%。Artificial Analysis 暂未解释这一差距的原因。
中国首个,阿里巴巴“小强模型”登顶CyberGym模型榜
日前,阿里巴巴伏渊息壤大模型(XekRung-27B)以88.9%的成功率登上CyberGym榜首,成为该榜单历史上第一个来自中国的冠军模型。伏渊息壤在获得最高成功率的同时,还实现了“既小又强”的突破,27B的参数量仅为其他上榜模型的1/27~1/370,这意味着该“小强模型”极大降低了智能排查安全漏洞的算力成本。
蚂蚁集团AI安全实验室登顶CyberGym榜单,漏洞验证成功率达98.5%
火星财经消息,9月11日,AI安全能力评测基准CyberGym更新榜单。蚂蚁集团AI安全实验室研发的天工Cyber模型与天工Harness以98.5%的漏洞验证成功率位列全球第一。据了解,天工Harness融合了自研天工Cyber模型以及DeepSeek V4 Pro、Qwen 3.8 Max等国产大模型的能力,可完成漏洞分析、PoC构造和结果验证,覆盖复杂软件漏洞验证的端到端流程。
微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元
动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。