“千问办公”首发上线GLM-5.3、DeepSeek V4 Pro两款模型
相关推荐
DeepSeek-V4-Pro被曝「一个API三个模型」?社区测试揭示背后或是Agent环境差异
BlockBeats 消息,8 月 15 日,近日 AI 社区热议 DeepSeek-V4-Pro 疑似存在多个版本。有用户发现,同样调用 deepseek-v4-pro 接口,在更换 IP 或重新创建会话后,模型会出现三种不同的「推理风格」: 一类频繁以「Let me」开头,接近此前 V4 Pro Preview;一类常出现「The user wants me」,类似 V4 Flash;另一类大量使用「we」,被部分用户称为能力更强的「神版 V4 Pro」。 由于同一会话一旦进入某种模式后,后续表现通常保持稳定,社区一度猜测 DeepSeek 是否在 API 背后隐藏了多个模型,并通过路由机制分发。不过,进一步分析 DeepSeek Harness 源码后,出现了另一种解释:差异可能并非来自不同模型权重,而是来自 Agent 运行环境。 社区发现,8 月 10 日,DeepSeek Harness 官方仓库更新了一条关键 commit: 「fix(preset): align minimal agent with RL composition」 该更新旨在让 Minimal Agent 与强化学习(RL)训练时使用的 Agent 环境保持一致。 官方文档显示,Minimal preset 包含极简 system prompt、persistent Bash 环境、指定编辑工具、RL 训练使用的 compaction policy,并移除了额外身份提示、Web 提示及工具说明。 这意味着,DSH Minimal 可能并不是 Standard 版本的「阉割版」,而是在模拟模型训练阶段真实接触的 Agent 环境。 社区测试也支持这一观点。同一个 DeepSeek V4 Pro 在不同 Harness 环境下表现: DSH Standard:91 分; DSH PTC:92 分; DSH Minimal:99/96 分。 随后,测试者开发「Anchored Standard」插件:首次请求模拟 Minimal 环境,只开放 shell 和 read 工具,完成首次工具调用后再恢复 Standard 完整工具集,结果连续获得 98/99 分。 测试者认为,决定 V4 Pro Agent 能力发挥的关键,可能并非最终拥有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent
值得买科技OpenHubs首批上线Qwen3.8-Max
火星财经消息 8月3日,阿里云正式发布Qwen3.8-Max大模型,值得买科技一站式大模型服务平台OpenHubs同步上线Qwen3.8-Max。OpenHubs平台通过统一账号体系、标准化API接口和集中化管理能力,实现主流大模型的统一接入、调用、监控、统计与账单管理。据了解,此前OpenHubs已率先上线月之暗面最新旗舰模型Kimi K3,并已汇聚Qwen、Kimi、DeepSeek、智谱GLM、MiniMax、豆包Seed等主流大模型。(广角观察)
「韩模之光」Solar Pro4智能指数冲到42分,但还是打不过DeepSeek V4Flash
据动察 Beating 监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。 其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。 但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。 价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。 至少按这套综合评测和 API 性价比,「韩模之光」还没追上 DeepSeek。
AI支付基础设施Kite推出面向长时运行AI Agent的自适应推理基础设施Marathon
BlockBeats 消息,7 月 22 日,AI 支付基础设施 Kite 生态推出面向长时运行 AI Agent 的自适应推理基础设施 Marathon。用户可为每个请求选择完成窗口(now / soon / later / anytime 四档),等待时间越长价格越低;最深档位较实时价格至多可节省约 65%(折扣为预估值,随实时容量浮动)。该服务 API 与 OpenAI 兼容,并为 Claude Code 与 Codex 提供一行命令安装的插件。首发支持 Kimi K3、GLM 5.2、DeepSeek V4 Pro、Qwen3.6-35B-A3B、Nemotron 3 Ultra 五款头部开放权重模型,全部适用统一定价规则。详情见官网 marathon.build。 据悉,Kite 此前完成由 PayPal Ventures 与 General Catalyst 领投的总额 3300 万美元融资。本次推出 Marathon,是其从 Agent 身份与支付网络向 Agent 经济底层算力基础设施延伸的关键落子,旨在打通 Agent「自主调用、自主付费」的完整闭环。
DeepSeek V4 Pro正式版+Harness上线国家超算互联网
火星财经消息,8月14日,国家超算互联网宣布上线 DeepSeek V4 Pro正式版,以及智能体框架DeepSeek Harness,并依托全国首个十万卡级超智融合算力资源池,为科研院所、科创企业及开发者提供大模型全生命周期算力支撑。目前超算互联网AI社区已汇聚1700余款开源大模型,用户可一站式完成模型部署、微调训练与适配优化等全流程AI开发工作。
DeepSeek Harness正式上线:首款Agent产品,整个Agent可实现自行组装
据 动察 Beating 监测,DeepSeek 正式上线首款 Agent 产品 DeepSeek Harness,软件包已经发布至 npm。此前 V4-Flash 的公开 Code Agent 评测,用的就是 Harness 内置的极简模式。 它不只是一款类似 Codex 的 Coding Agent。Harness 支持管理项目、长任务、多 Agent、Skill、联网搜索和上下文管理,还允许用户创建不同的「Agent 预设」。写代码、研究、写作等任务,可以配置不同的工具、提示词和工作方式。 更特别的是插件系统。DeepSeek 把「Everything is a plugin」作为核心设计,模型、工具、提示词、存储、上下文甚至界面都能通过插件替换或组合。内测用户已经做出了长期记忆、界面修改等插件。 简单说,Codex 更像一个做好的 Agent,DeepSeek Harness 更像一套组装 Agent 的运行时。用户不只是在选模型,也可以自己决定 Agent 用什么工具、遵守什么规则、怎么工作。