小米MiMo 系列模型正式登陆 B.AI API
相关推荐
DeepSeek-V4-Pro被曝「一个API三个模型」?社区测试揭示背后或是Agent环境差异
BlockBeats 消息,8 月 15 日,近日 AI 社区热议 DeepSeek-V4-Pro 疑似存在多个版本。有用户发现,同样调用 deepseek-v4-pro 接口,在更换 IP 或重新创建会话后,模型会出现三种不同的「推理风格」: 一类频繁以「Let me」开头,接近此前 V4 Pro Preview;一类常出现「The user wants me」,类似 V4 Flash;另一类大量使用「we」,被部分用户称为能力更强的「神版 V4 Pro」。 由于同一会话一旦进入某种模式后,后续表现通常保持稳定,社区一度猜测 DeepSeek 是否在 API 背后隐藏了多个模型,并通过路由机制分发。不过,进一步分析 DeepSeek Harness 源码后,出现了另一种解释:差异可能并非来自不同模型权重,而是来自 Agent 运行环境。 社区发现,8 月 10 日,DeepSeek Harness 官方仓库更新了一条关键 commit: 「fix(preset): align minimal agent with RL composition」 该更新旨在让 Minimal Agent 与强化学习(RL)训练时使用的 Agent 环境保持一致。 官方文档显示,Minimal preset 包含极简 system prompt、persistent Bash 环境、指定编辑工具、RL 训练使用的 compaction policy,并移除了额外身份提示、Web 提示及工具说明。 这意味着,DSH Minimal 可能并不是 Standard 版本的「阉割版」,而是在模拟模型训练阶段真实接触的 Agent 环境。 社区测试也支持这一观点。同一个 DeepSeek V4 Pro 在不同 Harness 环境下表现: DSH Standard:91 分; DSH PTC:92 分; DSH Minimal:99/96 分。 随后,测试者开发「Anchored Standard」插件:首次请求模拟 Minimal 环境,只开放 shell 和 read 工具,完成首次工具调用后再恢复 Standard 完整工具集,结果连续获得 98/99 分。 测试者认为,决定 V4 Pro Agent 能力发挥的关键,可能并非最终拥有多少工具,而是模型首次看到的:System Prompt + Tool Schema + Agent
「韩模之光」Solar Pro4智能指数冲到42分,但还是打不过DeepSeek V4Flash
据动察 Beating 监测,韩国 AI 公司 Upstage 发布旗舰推理模型 Solar Pro 4。Artificial Analysis 最新评测中,它的智能指数从上一代 Solar Pro 3 的 14 分冲到 42 分,主要提升来自 Agent 和长上下文能力。 其中 Terminal-Bench v2.1 从 12% 升到 57%,长上下文推理从 31 升到 71。GDPval-AA v2 也从 498 Elo 升到 1277,超过 1000 的人类基线。Solar Pro 4 已经是韩国模型冲击全球前列的一张代表牌。 但放到 DeepSeek V4 Flash 0731 面前,还是不够看。同一套 Artificial Analysis 智能指数里,DeepSeek 拿到 52 分,比 Solar Pro 4 高 10 分。DeepSeek 每秒输出约 122 个 Token,Solar Pro 4 约 65 个,前者接近快一倍。 价格差距更大。Solar Pro 4 每百万 Token 输入、输出分别要 0.30 和 1.20 美元,DeepSeek 只要 0.14 和 0.28 美元。Solar 的输出价格超过 DeepSeek 的 4 倍。 至少按这套综合评测和 API 性价比,「韩模之光」还没追上 DeepSeek。
电商营运垫资RWA平台Dow Protocol完成1050万美元Seed轮融资,MH Ventures、Mapleblock Capital、Animoca Brands参投
BlockBeats 消息,8 月 7 日,据官方消息,电商营运垫资 RWA 平台 Dow Protocol 宣布完成 1050 万美元 Seed 轮融资,由 MH Ventures 与 Mapleblock Capital 共同领投,Animoca Brands、Arcane Group、Hashkey Chain、Essentia Partners、Quartet Group 参投。 Dow Protocol 面向全球头部电商平台的商户,基于其销售应收账款与真实运营数据提供营运资金垫资。其底层资产服务方系统嵌入主流电商平台,可直接获取商户的原始经营数据用于授信与风控;同时通过与平台的合作,回款从平台端直接划扣、不经过商户账户,从源头上控制了回款风险,构建了行业内领先的收账机制。 在资金端,Dow Protocol 利用稳定币的即时结算能力,将传统借贷中冗长的放款流程压缩至最快当日到账。对现金流敏感的营运资金市场而言,放款速度本身即是价值,因此愿意为这一效率支付溢价。同时,Dow Protocol 推动营运垫资在链上原生生成的新逻辑,让垫资条款以高颗粒度的可编程方式执行,重构供应链金融的底层运作逻辑。 Dow Protocol 定位为通用的泛电商 PayFi RWA 垫资协议,其框架可扩展至电商、餐饮、支付、游戏、AI 算力等多类场景的供应链金融垫资需求。
DeepSeek:DeepSeek-V4-Flash正式版API上线公测,DeepSeek-V4-Pro正式版将会尽快发布
PANews 7月31日消息,DeepSeek发布更新日志,DeepSeek-V4-Flash 正式版 API 上线公测。DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。DeepSeek-V4-Pro 正式版将会尽快发布。
Grok全新语音模型拿下Agent评测第一,API价格涨60%
据动察 Beating 监测,SpaceXAI 发布 Grok Voice Think Fast 2.0。这是一款面向客服、销售和电话场景的语音 Agent 模型,可听懂用户、生成语音回答并调用工具。新版本重点提升了推理、转写和对话能力。 Artificial Analysis 的独立评测显示,它的语音综合指数为 82.9%,排名第二,仅次于通义 Qwen Audio 3.0 Realtime Plus 的 84.1%。在测试语音 Agent 完成客服任务的 τ-Voice 基准中,它以 56.5% 排名第一,高于 Qwen 的 54.6% 和 GPT-Realtime-2.1 High 的 45.7%。首次出声只需 0.70 秒。 性能提升同时伴随涨价。API 价格从每分钟 0.05 美元升至 0.08 美元,涨幅 60%,每小时音频成本为 4.80 美元。
DeepSeek 视觉模型多模态 Agent 能力逼近 Opus 4.8,4 项打成 2:2
火星财经消息,DeepSeek 公布 V4-Flash-Vision-Exp 首批 Agent 跑分。在 4 项多模态 Agent 评测中与 Opus 4.8 打成 2 胜 2 负:Agents' Last Exam 27.3 对 25.7,ZeroBench 35.0 对 34.0;ApexBench 36.5 对 39.4,Chartography 64.3 对 65.0。相比纯文本版 V4-Flash-0731,视觉版在 ApexBench 从 26.2 升至 36.5,Agents' Last Exam 从 25.2 升至 27.3。官方注明纯文本版会忽略多模态内容,故主要体现补上视觉输入后的能力。加上视觉后文本 Agent 能力未明显缩水,7 项文本评测中 6 项高于 V4-Flash-0731,如 DeepSWE 从 54.4 升至 59.3(超 Opus 4.8 的 58.0),Toolathlon 75.9 几乎追平 Opus 4.8 的 76.2。该结果来自 DeepSeek 官方自测,非第三方独立榜单;公开 Code Agent 文本任务使用 DeepSeek Harness 极简模式,推理档位为 max。