返回 7*24 快讯
来源MarsBit

信通院MCP专项测试:StartLux-27B综合第二,超越284B DeepSeek V4 Flash

火星财经消息 8月31日,中国信通院人工智能研究所公布的可信AI大模型基准测试MCP专项测试显示,上海原点星辉研发的StartLux-V1.0-27B-Preview以27B参数量取得综合性能排名第二,得分39.25%,高于第三名284B的DeepSeek-V4-Flash-0731(38.24%),并以1个百分点之差紧追1.6T的DeepSeek-V4-Pro。测试于8月3日启动,经三轮完整测试取均值,覆盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理及3D设计6类专项共7项检验。 同等参数规模下,StartLux-27B较Qwen-3.6-27B高出5.34个百分点;位置导航任务排名第一,浏览器自动化、金融分析与DeepSeek-V4-Pro并列第一。该模型以Qwen3.6-27B为基座,采用"AI训练AI"方法后训练,是国内首个以此方法进行后训练的本地Agent模型,可在消费级个人电脑运行,团队计划年内推出第一代本地智能解决方案。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-10 06:43

DeepSeek开始模型和Agent一起训:V4.1 Flash为Harness专项优化

动察 Beating AI 快讯,DeepSeek Harness v0.1.5 发布。V4.1 Flash 在训练阶段就针对 Harness 做了专项训练和优化,覆盖标准、PTC 和极简三种模式。Harness 已经直接进入模型训练环节,不再只是模型发布后再接一个 Agent 外壳。 新版还加入实验性的 Agent Teams。父子 Agent 可以双向通信,主 Agent 能给不同子 Agent 指定模型和推理强度;多个 Agent 还能共享任务、互相发消息,最后由主 Agent 汇总。 V4.1 Flash 还有一个很特别的长任务优化:Agent 跑到一半修改系统提示词,也可以尽量保留已有 KV Cache。长任务不用因为前面的规则改了一点,就把后面大段上下文重新计算。 Web 端也加入文件上传和预览,支持 PDF、图片、代码等格式。插件可以往左右 Sidebar 和内容区接入自己的 UI,长会话的加载、恢复和内存占用也一起做了优化。

09-09 07:23

DeepSeek V4.1 Flash即将上线,官方称全面超过V4 Pro

动察 Beating AI 快讯,DeepSeek 计划在 9 月 10 日前后正式发布 V4.1 Flash。官方称,经过内部和外部测试,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro。 V4.1 Flash 上线后,在 V4.1 Pro 发布之前,所有发往 V4 Pro 的请求都会自动切到 V4.1 Flash,并按更便宜的 Flash 价格计费。用户不需要修改原来的 V4 Pro 调用方式。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

09-08 07:24

小米新一代模型MiMo-X首次亮相:Pro、Flash两款模型开启内测

动察 Beating AI 快讯,小米首次公布新一代 MiMo-X 系列,首批包括 MiMo-X-Pro-Preview 和 MiMo-X-Flash-Preview 两款模型。目前公开的体验入口是新推出的 Xiaomi MiMo Desktop,获邀用户可限时、限量、免费使用。官方暂未公布两款模型的参数、上下文长度、基准成绩和 API 开放时间。 MiMo-X 面向复杂推理、多 Agent 协作、大型编程项目、Office、网页与交互设计、视频剪辑、3D 生成、音乐生成和电脑操控等专业工作场景。MiMo Desktop 可以直接读取文档、表格、图片、视频等素材,自动拆任务、调用工具和浏览器,并交付可继续编辑的 PPT、网页、App 等成果;大型任务还能拆给多个 Agent 协作。 小米三周前就在财报会上预告,首个 MiMo 桌面应用和新模型即将推出。这次两者一起进入预览测试。

09-03 09:31

DeepSeek-V4-Flash折扣优惠正式生效,B.AI同步峰谷定价再打5折

Odaily星球日报讯 9 月 3 日,B.AI 平台 DeepSeek-V4-Flash 与 DeepSeek-V4-Flash-Vision-Exp 折扣优惠正式生效,平台在 DeepSeek 官方峰谷定价机制基础上全线叠加 5 折优惠——高峰时段仅需官方原价 5 折,空闲时段低至官方高峰价 2.5 折,单次调用最高立省 75%,无论是高并发任务、Agent 工作流还是规模化 API 调用,B.AI 始终是开发者使用 DeepSeek-V4-Flash 最划算的选择。同时,GLM-5.3-Flash、Qwen3.8-Flash、Hy3 与 MiMo V2.5 四款热门模型依然 100% 免费开放,覆盖推理、多模态与中文场景等多元需求。

09-11 11:41

DeepSeek V4 Pro API调用服务将不会下架

PANews 9月11日消息,据科创板日报报道,为响应广大用户的需求,DeepSeek决定在2026年9月14日之后继续提供DeepSeek V4 Pro的API调用服务,计费方式保持不变。此前,DeepSeek计划于北京时间2026年9月14日12:00下线V4 Pro服务,届时DeepSeek V4 Pro将会路由到V4.1 Flash并按V4.1 Flash计费。