路透:中国 AI 智能体出现欺骗与规避行为
相关推荐
kKimi K2.8 Preview 正式登陆 B.AI,API 与 Web Chat 双端同步开放
ChainCatcher 消息,B.AI 平台宣布 Moonshot AI 最新预览模型 Kimi K2.8 Preview 正式上线,面向开发者同步开放 API 与 Web Chat 双端体验。 该模型专为编程与 Agent 工作流打造,支持 1M(1,048,576 Token)超长上下文及文本、图片、视频多模态输入,综合性能直逼旗舰 Kimi K3,较 K2.7 Code 在思考效率与代码能力上进一步提升,并支持 Low/High/Max 三档灵活可调推理强度。 即日起,开发者可通过 B.AI 平台直接调用 Kimi K2.8 Preview。
阿里更新旗舰模型Qwen3.8-Max
火星财经消息,9月2日,阿里更新旗舰模型Qwen3.8-Max,性能较旧版本显著提升。在针对编程(Coding)和专业办公(Cowork)进行专项后训练后,Qwen3.8-Max新版本整体性能增强。在聚焦前端编程能力(WebDev)的全球权威三方榜单CodeArena中,提升22分至1691分,领先Claude Opus5、Kimi K3等一众模型,位居总榜第一。同时,CodeArena更新的模型性价比榜单(帕累托前沿)显示,Qwen3.8-Max新版本每百万Tokens综合平均仅5美元,直接“斩杀”所有价格大于5美元的其他模型。据了解,Qwen3.8-Max是阿里千问迄今最强大的大语言模型,总参数达2.4万亿,支持100万上下文Tokens;更新后的Qwen3.8-Max涌现出更强的智能体编程能力,更适合企业真实复杂任务、科研、长周期任务等。(财联社)
DeepSeek-V4-Flash-Vision-Exp 登陆 B.AI,全量免费开放
ChainCatcher 消息,B.AI 平台上线 DeepSeek 全新多模态实验旗舰模型 DeepSeek-V4-Flash-Vision-Exp,目前 API 官方组已率先完成全量接入并面向所有用户免费开放。 该模型在延续 V4-Flash 顶尖纯文本与代码 Agent 能力的基础上,正式解锁原生图像理解能力,多模态 Agent 综合表现已接近 Claude Opus-4.8 旗舰水平。 新模型支持图文混合输入与 1M 超长上下文,可轻松驾驭多模态 PPT 生成、复杂 UI 重构及前端特效等硬核场景,图片输入按 token 计费,单张图片最高仅 384 tokens。现所有用户登录 B.AI 平台即可零门槛免费调用这一最新多模态模型能力,让顶尖算力为创意与生产力加速落地。
MiniMax 推出新一代极速文本模型 M3.1-Flash-Preview
PANews 9月27日消息,MiniMax 公布其最新文本模型 M3.1-Flash-Preview,已在 MiniMax Code 正式上线。该模型定位为日常开发场景,官方称其在代码开发中可用于快速修复 bug 与实现完整功能,强调响应速度与稳定性。MiniMax 同时在 MiniMax Code 推出限时活动:自 9 月 28 日至 10 月 7 日(UTC+8),用户每日签到可获得 2 倍积分,适用于包括 M3.1-Flash-Preview 在内的代码模型,以及用于生成视频的 H3 模型。
Kimi K2.8 Preview全量上线:性能逼近K3,支持1M上下文
动察 Beating AI 快讯,月之暗面开始向 Kimi Code CLI 全量推送 Kimi K2.8 Preview。用户不用切换 Model ID,原来的 kimi-for-coding 会直接指向新模型。 Kimi 称,K2.8 Preview 综合性能已经接近 K3,但 thinking 效率更高。它还支持和 K3 一样的思考强度调节,并把上下文扩到 1M token。 上一代 K2.7 Code 只有 256K 上下文,而且只能开启 thinking。K2.8 这次基本把 K3 上的两项核心能力下放到了默认代码模型。
DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一
动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。