加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源Blockbeats

信息一改再改,大模型就乱了:表现最好的GPT-5.5也只能答对59.3%

动察 Beating AI 快讯,腾讯混元等团队发布 EvolveScaler,专门测试大模型能不能跟上不断变化的信息。它会在长文本里不断加入修改、撤回、补录和作废的信息,再让模型根据最新状态回答问题。 比如先给模型看 40 天游戏记录,再问:「如果第 7 天没打那个小 Boss,最后还能不能打赢?」这会连带改变后面的装备、血量和战斗结果。模型得从第 7 天开始,把后面几十天重新推一遍,原文里没有现成答案。 团队设计了 117 类任务、159 种问题,最长约 1200 个事件。14 个模型配置包括 GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2 和 Qwen3.5 Plus。最难档里,成绩中位数只有 11.3%;表现最好的 GPT-5.5-xhigh 也只有 59.3%。 这套数据也能拿来训练模型。一个内部 A3B 模型加入 6000 条这类数据后,在 8 个外部测试上全部提升,平均提高 5.25 分。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-15 08:32

ChatGPT也开始卖礼品卡:Plus、Pro都能充,但只限美国

动察 Beating AI 快讯,OpenAI 已在美国上线官方 ChatGPT 礼品卡。它本质上是一张美元储值卡,目前通过部分授权零售商销售数字版。兑换后,钱会直接进入 ChatGPT 账户余额。礼品卡通常可购买 15–250 美元。 这笔钱可以在 ChatGPT 网页端购买、升级或续费 Go、Plus、Pro,也能购买额外 credits。它不能给 OpenAI API 充值,也不能支付通过 App Store 或 Google Play 订阅的账单。 限制也很严。礼品卡目前只能在美国购买和兑换,兑换时用户必须人在美国,账号也要按美元结算。

09-15 03:43

Muse上线一周,稳居美国免费榜第二:只输ChatGPT,超过Gemini和Claude

动察 Beating AI 快讯,Meta 的个人 AI Agent 产品 Muse 上线一周,目前仍排在美国 App Store 免费 App 总榜第二,仅次于 ChatGPT,高于 Google Gemini 和 Claude。 Muse 是一个可以长期工作的个人 Agent,能连接邮箱、日历等服务,自己浏览网页、拆解任务,并在用户关闭 App 后继续后台执行。

09-09 07:23

DeepSeek V4.1 Flash即将上线,官方称全面超过V4 Pro

动察 Beating AI 快讯,DeepSeek 计划在 9 月 10 日前后正式发布 V4.1 Flash。官方称,经过内部和外部测试,新模型在性能、费用、速度和总用时等指标上已经全面超过 V4 Pro。 V4.1 Flash 上线后,在 V4.1 Pro 发布之前,所有发往 V4 Pro 的请求都会自动切到 V4.1 Flash,并按更便宜的 Flash 价格计费。用户不需要修改原来的 V4 Pro 调用方式。

09-11 11:41

DeepSeek V4 Pro API调用服务将不会下架

PANews 9月11日消息,据科创板日报报道,为响应广大用户的需求,DeepSeek决定在2026年9月14日之后继续提供DeepSeek V4 Pro的API调用服务,计费方式保持不变。此前,DeepSeek计划于北京时间2026年9月14日12:00下线V4 Pro服务,届时DeepSeek V4 Pro将会路由到V4.1 Flash并按V4.1 Flash计费。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

09-04 09:54

微软新ASR模型比GPT-Transcribe快10倍,每小时只要0.1美元

动察 Beating AI 快讯,Microsoft AI 发布 MAI-Transcribe-2,并在 Microsoft Foundry 开放公共预览。新模型支持 60 种语言,新增说话人区分、逐词时间戳和专业词汇偏置。开发者可以提前塞入人名、药名或行业术语,减少冷门词被听错。 这次提升最明显的是速度。Artificial Analysis 的非实时转写测试里,MAI-Transcribe-2 达到约 410.7 倍实时速度,也就是 1 小时录音理论上约 9 秒处理完。GPT-Transcribe 约为 40 倍,前者快约 10 倍;Gemini 3.5 Transcribe 约为 89.8 倍。 准确率也在第一梯队。它在 FLEURS 的 60 种语言测试中平均 WER(词错误率,越低越好)为 5.2%,排名第一;在 Artificial Analysis 的另一套非实时英文测试中 WER 为 2.0%,排第二,仅低于阿里 Fun-Realtime-ASR-preview 的 1.7%。 价格目前只有每小时 0.10 美元,上一代 MAI-Transcribe-1.5 是 0.36 美元。不过这是限时价格,只持续到 2026 年 12 月 31 日,之后正式价格还没有公布。