美团LongCat-2.5预览版上线:原生多模态,主攻长程Agent
相关推荐
OpenAI 发布 GPT-6 Sol 与 Luna,API 价格下调 50%
ChainCatcher 消息,OpenAI 于 9 月 22 日发布 GPT-6 Sol 与 GPT-6 Luna 两款新模型,发布时间距 Anthropic 推出 Claude Opus 5.5 仅数分钟。两款模型定位低于 GPT-6 Astra,是面向日常工作的更便宜、更快速选项。OpenAI 同时将两款模型的 API 价格较 GPT-5.6 促销价下调 50%,Sol 输入与输出价格分别为每百万 token 2 美元与 10 美元,Luna 则降至 0.1 美元与 0.5 美元。性能方面,OpenAI 援引 Zapier 的 AutomationBench 基准称,GPT-6 Sol 在最高推理设置下得分为 33.2%,每任务成本 0.27 美元,而 Claude Opus 5 最高设置为 26.9%,每任务成本高出逾 11 倍。在 Agents' Last Exam 测试中,GPT-6 Sol 最高得分 56.4%。在 OSWorld 2 计算机使用测试中,GPT-6 Sol 以 60.5% 对 60.3% 几乎追平 Claude Opus 5 的中等努力得分,成本低约 80%。
kKimi K2.8 Preview 正式登陆 B.AI,API 与 Web Chat 双端同步开放
ChainCatcher 消息,B.AI 平台宣布 Moonshot AI 最新预览模型 Kimi K2.8 Preview 正式上线,面向开发者同步开放 API 与 Web Chat 双端体验。 该模型专为编程与 Agent 工作流打造,支持 1M(1,048,576 Token)超长上下文及文本、图片、视频多模态输入,综合性能直逼旗舰 Kimi K3,较 K2.7 Code 在思考效率与代码能力上进一步提升,并支持 Low/High/Max 三档灵活可调推理强度。 即日起,开发者可通过 B.AI 平台直接调用 Kimi K2.8 Preview。
TypeSafe AI 决策模型 Jev 正式登陆 B.AI API,输入低至 $0.042/百万 Token
ChainCatcher 消息,B.AI 平台宣布 TypeSafe AI 推出的首款 System One 模型 Jev 正式上线 API。 Jev 专为软件内的高速结构化决策打造,不生成任何文本:开发者输入应用状态与类型化问题后,模型直接返回带概率与置信度的决策结果,无需 JSON Prompt,也无需解析输出。模型支持 Choice / Score / Noul 三类原语并行评估,端到端延迟约 70–500ms,输入仅 $0.042/百万 Token,输出免费,适用于工单路由、内容审核、风险评分及 Agent 分支判断等场景。 目前 Jev 已在 B.AI API 的“官方”→“全量接入”列表中开放,可通过 Jev-1.13.0 或 Jev-Latest 调用。
OpenAI:正与Anthropic和谷歌合作开展人工智能安全工作
动察 Beating AI 快讯,OpenAI 正与 Anthropic 和谷歌合作开展人工智能安全工作。(金十)
144M参数就能做Agent决策,Julia-1连安卓平板都能跑
动察 Beating AI 快讯,AI 实验室 Supersonic Labs 发布一款只有 1.443 亿参数的轻量决策模型 Julia-1。它不生成长文本,而是接收上下文、问题和 2 到 20 个候选答案,直接完成分类、打分和是非判断,可以给 Agent 选工具、做路由或决定下一步动作。 Julia-1 基于多语言编码模型 mmBERT-small 开发,模型权重约 550MB,主打低硬件门槛。官方已经在 Apple M4、Intel i5-1235U 和三星 Android 平板上完成测试。M4 单次决策中位延迟约 33ms;三星平板只用 CPU 运行时约 203ms,进程峰值内存约 393MB。 在官方公布的 4 组 Jev 对比测试中,Julia-1 赢了 3 组。Typed Decisions 为 73.15%,Jev 参考成绩为 72.70%;AG News 为 94% 对 91%;情绪分类为 86% 对 48%。但在包含 72 个类别的 Banking77 上,Julia-1 只有 64%,明显低于 Jev 的 87%。官方称,候选类别太多且彼此相似时,目前的分组筛选可能提前丢掉正确答案。 Julia-1 的云端 GPU 训练和实验总成本只有约 104 美元。模型权重、运行代码、完整评测和来源记录均已开放,采用 Apache 2.0 许可。官方还在开发 API,计划按每百万输入 token 0.025 美元收费;由于模型只做判断、不生成长文本,输出 token 不收费。
OpenAI与Anthropic正在调查数万起AI相关安全事件
BlockBeats 消息,9 月 27 日,OpenAI 和 Anthropic 以及安全研究人员正在调查数万起事件,在这些事件中,他们的前沿模型采取了一些外部评估人员认为有问题的行动。近几个月来,内部测试和现实世界中发生的事件数量之多表明,这个问题比公众所知的要复杂得多。 消息人士称,这些事件包括绕过防护措施、创建留言板、逃离沙盒、网站劫持、自我提示或试图绕过监控。据悉,这些安全漏洞在内部测试和实际应用中均有发生,由于安全研究人员仍在调查,许多漏洞尚未公开。部分测试类似于「红队演练」(red-teaming),公司试图让模型出现故障,以确保其安全性。 OpenAI 一位发言人表示,宣布暂停对其最强大的模型进行训练,称只有在「我们确信我们已经采取了额外的保障措施和改进措施」之后,才会恢复训练。(Axios)