返回 7*24 快讯
来源MarsBit

模型太多不会选?OpenRouter推出Ori Eval替AI应用挑模型

据动察 Beating 监测,OpenRouter 推出 Ori Eval,帮开发者判断自己的 AI 应用该用哪个模型。它会扫描代码库,找到调用模型的位置,再用项目里的真实任务跑遍多个候选模型。 开发者可以指定更看重效果、速度还是成本。评测期间,Ori Eval 会锁定测试框架、模型配置和推理强度,最后直接给出排名,避免不同模型因为测试条件不同而无法比较。 它除了判断回答好不好,还会检查 Agent 是否调用了正确工具、避开不该执行的操作。开发者用自然语言描述一个 Bug,它就能生成一条复现问题的测试。修复后接入 GitHub Actions,后续换模型、改 prompt 或改代码,都能自动检查问题是否再次出现。 公开榜单只能比较模型的通用能力,无法直接回答客服、搜索或编程产品该选哪一款。Ori Eval 把逐个手动试模型,变成一套基于真实业务的自动选型流程。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-11 18:16

Pi重构Agent执行层:长任务开始走向持久化运行

据动察 Beating 监测,Pi 正在重做 Agent Harness。最新 Harness v3 规范已经写完,正在做最终审计。它重做了任务执行和存储,让 Agent 即使跑到一半进程崩溃,甚至 Harness 自己升级,也能从中断处继续。 Pi 是 Mario Zechner 创建的开源 Agent Harness,最早因为 OpenClaw 使用它而出圈。项目今年被 Earendil 收购,Mario 也加入公司继续负责开发。现在 Pi 已有超过 6 万 GitHub Star,MiniMax 最新的 MiniMax Code 也明确基于 OpenCode 和 Pi 搭建 Harness。 v3 这次直接重做了底层架构。模型请求和工具调用前都会先保存执行状态,完成后再写入结果。重启后,Pi 能知道哪些已经做完、哪些可以重跑、哪些有副作用不能再执行一次。对话、运行状态和 Token 成本也改成分开保存,并加入跨版本状态迁移。 Claude Code、Codex 都在把 Agent 往更长的任务推。OpenAI 已经专门研究怎么让 Codex 持续完成长时间工作,Anthropic 也称 Claude Code 正越来越多地被用于长时间运行的 Agent 任务。Agent 能连续干几小时以后,前面几小时就不能因为一次崩溃全部白干。

08-05 10:12

DeepSeek把谷歌挤下榜首,拿下OpenRouter本周调用量第一

据动察 Beating 监测,模型聚合平台 OpenRouter 数据显示,DeepSeek 文本请求量本周已达到 2.99 亿次,占平台总量的 27.1%,超过此前长期领先的谷歌。谷歌同期为 2.77 亿次、25.0%,OpenAI 以 1.85 亿次、16.8% 排名第三。 这个榜单按模型厂商合并统计文本 API 请求次数。DeepSeek V4 Flash、V4 Pro 等模型产生的调用,都会记入 DeepSeek 名下。 DeepSeek 的增长主要由 V4 系列推动。OpenRouter 此前披露,V4 发布后,DeepSeek 的 Token 份额半年内大致翻倍,增长主要来自 Agent 任务。V4 Flash 上线一个月后,已占 DeepSeek Agent Token 用量的 70%。Agent 完成一次任务往往会连续调用模型多次,也更容易推高请求量。

07-13 19:30重要

智谱害怕成为下一个MiniMax?内部信淡化Coding,全面押注AGI与Agent

BlockBeats 消息,7 月 13 日,智谱创始人唐杰发布内部信《巨浪已来》,提出未来将聚焦 Long Horizon Task(长周期任务)、Autonomous Agent(自主智能体)、Self-Evolving(自我演进)及 AGI 等方向,并启动未来两年的「Touch High(摸高)」计划,明确表示不追求短期应用变现。 报道称,尽管 AI Coding 业务曾推动智谱商业化快速增长和估值提升,但唐杰在内部信中几乎未提及 Coding,而是将公司定位进一步转向 AGI 基础设施与自主智能体路线。分析认为,此举意在避免市场以传统 SaaS 或 AI 应用公司的收入、ARR 等指标对智谱进行估值,而是继续维持 AGI 技术公司的长期成长叙事。 市场观点认为,在 MiniMax 解禁后股价大幅回调、AI 公司估值逻辑逐渐从「技术预期」转向「商业兑现」的背景下,智谱正试图提前完成资本市场叙事切换,以技术突破和 AGI 愿景作为新的估值锚点。 --------------------------------- 点击下方原文链接,加入动察 Beating · 飞书 AI 新闻渠道,7×24 小时不间断监测全球 AI 热点与新闻。

07-10 11:04

Meta新模型连夺三榜第一,法律Agent反超Grok 4.5

据动察 Beating 监测,AI 评测机构 Vals AI 公布 Muse Spark 1.1 成绩。模型在医疗文书、税务问答和法律 Agent 三项评测中排名第一,得分分别为 88.89%、79.72% 和 20.00%。 在税务评测 TaxEval v2 中,它超过 Fable 5、Opus 4.8 和 GPT-5.5。该评测包含超过 1200 道未公开测试题,既检查答案,也检查推理过程。头部模型差距较小,前十名相差不到 3 个百分点。 法律 Agent 评测中,Muse Spark 1.1 得分 20.00%,超过 Grok 4.5 的 12.92% 和 Fable 5 的 11.25%。测试要求模型使用文档、表格和文件工具完成真实法律工作。 它在网页应用编程评测中得分 72.16%,超过 GPT-5.5、Grok 4.5 和 GPT-5.4,但仍落后于 Fable 5 和多款 Claude 模型。

06-23 18:16

谷歌Gemini启用Interactions API:重构智能体,终结「幽灵账单」

据 动察 Beating 监测,谷歌正式在 Gemini API 和 Google AI Studio 中将 Interactions API 设为默认接口,原有接口 generateContent 进入维护期。新接口会将多轮对话、模型思考、工具调用和执行结果统一打包,并在服务器端存为 Interaction 资源。 最直接的好处是省钱省力。由于服务器端会自动保存对话状态,多轮聊天时客户端只需发送上一步的交互 ID,谷歌就能自动复用并提高缓存命中率,大幅削减 Token 费用。对于代码沙盒运行或深度搜索等耗时任务,开发者可以开启后台模式,让工作在后台异步跑完。另外,模型思考、工具调用等中间步骤完全可视,便于实时排查智能体运行中的 Bug。 底层的重构直接解决了 6 月初爆出的计费危机。当时,手动删除缓存后由于云端同步延迟,已注销的资源仍在后台空转,导致部分账户在 12 小时内被异常扣除近 2.7 万元人民币。另外,模型在联网检索时容易陷入思维死循环,在没有任何回答的「零输出」状态下,依然按 6.4 万个 Token 满额计费。Interactions API 改用服务器托管的「隐式缓存」取代手动删除,并允许开发者监控并中止 thought 步骤,提供了更安全的计费防御。 由于谷歌未来的前沿模型和智能体功能(例如 Deep Research)都将仅支持 Interactions API,官方建议开发者尽早完成适配。

08-14 12:50

Hermes Agent跟进Grok Bot:把多Agent做成普通人也能用的AI团队

据动察 Beating 监测,Nous Research 开始公测 Hermes Agent 的 Bot Mode。目前先以独立插件提供,收集反馈后计划整合进 Hermes Desktop。 Hermes 原本就支持多个独立 Profile,也能通过 Kanban 让不同 Agent 分工协作。Bot Mode 这次没有重做底层,主要是把这些能力重新做成一个更直观的产品界面。官方直接写明,一个 Bot 本质上就是一个 Hermes Profile。 现在每个 Profile 都会显示成一个有名字、头像和身份的 Bot。它们各自保留模型、Skill、记忆和聊天记录。用户可以直接 @ 另一个 Bot 派活,Bot 之间也有固定收件箱,可以互相发消息。每个 Bot 还能单独设置定时任务。 这套产品形态明显在跟进刚上线的 Grok Bot。社区有人直接问,这是不是补上了 Hermes 相比 Grok Bot 缺少的功能,Hermes 联合创始人 Teknium 回答「Yep」。