海光信息完成阶跃星辰Step 3.7 Flash适配
相关推荐
阶跃 Step 3.7 Flash 位列 Artificial Analysis 输出速度榜主流第一
火星财经消息,大模型评测平台Artificial Analysis最新Output Speed榜单显示,阶跃星辰(StepFun)最新开源基座模型Step 3.7 Flash以409 tokens/s的输出速度位列主流模型第一,同时在端到端响应时长(End-to-End Response Time)、智能效率(Intelligence vs. Output Speed)与速度价格比(Output Speed vs. Price)等关键指标上均处于领先位置。
阶跃发布Step Edge,端侧Agent工具调用低至0.1秒
据动察 Beating 监测,阶跃星辰发布端侧模型家族 Step Edge,包含基础模型、Audio、GUI 和 Gen,面向手机、汽车等终端。它能在本地处理文字、图像和语音,完成屏幕理解、语音识别、界面操作及图像生成。端侧工具调用延迟最低 0.1 秒。 简单、高频或弱网任务可在本地完成,复杂推理再交给云端。敏感数据不用上传,也能减少对网络和云端算力的依赖。 阶跃还推出自研 Step Inference NPU 推理引擎,针对终端芯片降低延迟。官方称,Step Edge 系列在 29 项核心评测指标中取得第一。
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。
「韩模之光」Solar Pro4智能指数冲到42分,但还是打不过DeepSeek V4Flash
据动察 Beating 监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。 其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。 但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。 价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。 至少按这套综合评测和 API 性价比,「韩模之光」还没追上 DeepSeek。
蚂蚁Ling-3.0-flash正式开源,FP8版仅128GB
据动察 Beating 监测,蚂蚁百灵(inclusionAI)正式开放 Ling-3.0-flash 权重,同时提供 BF16 原版和 FP8 量化版。两版均采用 MIT 许可证,已上线 Hugging Face 和 ModelScope,可用 SGLang 或 vLLM 自行部署。 BF16 版权重约 255GB,FP8 版约 128GB,体积接近减半。FP8 用更低精度保存参数,可以降低存储和显存门槛。官方列出的 4 项测试中,FP8 与 BF16 的最大分差为 1.57 分。 Ling-3.0-flash 总参数 1240 亿,每次生成只激活 51 亿。模型支持 25.6 万 Token 上下文,主要面向编程、搜索、深度研究和工具调用等 Agent 任务。官方评测显示,它在多数基准上达到或超过万亿参数的前代模型 Ring-2.6-1T。
DeepSeek没把新版能力锁在API,V4-Flash正式版权重开源
据动察 Beating 监测,DeepSeek 已在 Hugging Face 放出 V4-Flash-0731 正式版权重,并继续采用 MIT 许可证。开发者可以自行部署、微调和商用,不必只能通过 DeepSeek 官方 API 使用。 这次开放的是刚完成后训练升级的正式版。它在多项 Agent 测试中超过 V4-Pro-Preview,相关能力现在也能由第三方独立部署和复测。