加密货币价格波动剧烈,本站内容仅供参考,不构成投资建议。投资有风险,可能导致全部损失。

查看完整免责声明
返回 7*24 快讯
来源Blockbeats

AI写的网页到底能不能用?腾讯做了个会自己点网页的评测

动察 Beating AI 快讯,腾讯混元联合清华、北大推出 IWC-Bench,专门评测 AI 生成的网页实际用起来怎么样。 不少网页生成评测主要看代码或截图。页面可能看起来很漂亮,代码里也确实写了功能,但按钮点不开、表单交不了、切个页面就报错,这些问题很难靠静态检查发现。 IWC-Bench 更像真人验收。它让一个 Agent 真正打开网页,点击按钮、输入内容、切换页面,再检查哪些功能实际跑过。最后分别评价三件事:页面好不好看、操作顺不顺、用户要求的功能有没有做出来。 基准收录 369 条真实用户需求和 5088 条验收标准,17 个模型一共生成了 6273 个网页应用。在另外 197 组人工复核的对比中,IWC-Bench 有 168 组和人类选择一致,一致率达到 85.3%。 结果也说明,网页「看起来不错」和「真的好用」不是一回事。GPT-5.6-Sol 的页面美观度最高,但易用性只排第六;具体到单个网页,好看基本不能说明它好不好用,两项相关系数只有 0.36。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-16 02:58

OpenAI或周四推出GPT-6 Sol:主打更快、更省

动察 Beating AI 快讯,OpenAI 可能会在本周四发布 GPT-6 Sol。AI 顶流博主 Mark Kretschmann 直接给出了这个日期,并称它相比 Astra 会更便宜、更快,但能力稍弱。 OpenAI 目前还没官宣。Sam Altman 只确认本周有一次「大发布」,Tibo Sottiaux 则称,本周的发布规模接近一届 DevDay。 Astra 目前是 GPT-6 的最高能力型号,Sol 如果本周上线,更可能成为速度和成本更友好的日常主力。

09-13 11:40

Amp取消平台门票:自带ChatGPT和电脑就能免费跑Coding Agent

动察 Beating AI 快讯,Amp 推出免费 Hobby 档。Amp 是从 Sourcegraph 拆出来的 Coding Agent 公司,产品和 Claude Code、Codex 属于一类,可以让 AI 自己读代码、改代码、跑命令和测试。现在只要用自己的电脑,再接自己的 ChatGPT 订阅或模型 API Key,就能免费使用 Amp,不再额外交月费和 BYOK Token 费。 今年 7 月 Amp 推出订阅制后,想把自己的 ChatGPT 订阅接进 Amp,至少要开每月 20 美元的 Megawatt。BYOK 即便用的是自己的模型 Key,Amp 也会收额外 Token 费用并设限制。现在这两层都取消了。ChatGPT 订阅费或 API 本身的模型费用,还是用户自己承担。 Amp 还有一个叫 Orb 的远程云电脑产品,可以给每个任务开一套独立环境。代码和开发工具都放在里面,关掉自己的电脑后 Agent 还能继续干活,也方便同时跑多个任务。Orb 依然按使用量收费;不想付这笔钱,也可以让 Amp 直接跑在自己的电脑上。 另外,Amp 还在扩大 BYOK 范围。付费用户已经可以接 OpenRouter、Amazon Bedrock、Azure Foundry、Ollama Cloud 和自定义模型接口等,之后会开放给所有用户。

09-05 06:35

蚂蚁百灵医疗模型Sante:仅51亿激活参数,诊断单项胜过GPT-5.6 Sol

动察 Beating AI 快讯,蚂蚁百灵推出医疗健康模型 Ling-3.0-flash-Sante。它基于 Ling-3.0-flash 强化医疗能力,采用 MoE 架构,总参数 1240 亿,但每个 token 只激活约 51 亿参数。重点能力包括医学推理、药物安全、循证检索和长流程医疗研究。 百灵公布的评测里,Sante 在 DiagnosisArena-MCQ 拿到 83.8 分,高于 GPT-5.6 Sol 的 81.9、Kimi K3 的 78.4 和 Gemini 3.6 Flash 的 76.2。MedXpertQA-Text 得分 53.9,也略高于 Kimi K3 的 53.5,但仍低于 GPT-5.6 Sol 的 60.2 和 Gemini 3.6 Flash 的 62.4。 它也没有只刷医学选择题。百灵还测试了 BrowseComp、DeepSearchQA 和 HLE with tools,重点强化「自己查资料再回答」的能力。医疗伦理和安全也单独做了测试,MedEthicAlign 得分 82.1,内部安全测试 AFUSAFE-MedSCE 得分 78.6。 Sante 已经接入 OpenRouter 和 Vercel,可免费调用。

09-11 11:01

英伟达给Pi加外挂:Agent自己研究找出4种优化,Token最高省64%

动察 Beating AI 快讯,英伟达 NVLabs 开源 SoL-Pi,给 Coding Agent Harness「Pi」加了一层效率优化。研究团队搭了一套自动研究流程,让多个 Agent 分析 Pi 的运行轨迹、提出优化方案、改代码并自动验证。最初有 152 个候选方向,最后只留下 4 个。 这 4 个优化都在减少重复开销。比如改完代码后直接接着跑测试,少一次模型调用;读过的大文件和长输出先存到本地,需要时再取;子任务结束后判断要不要压缩上下文;超长日志先交给便宜模型筛重点,再核对内容确实来自原日志。 在 EdgeBench 上,SoL-Pi 相比原版 Pi 少用 45%–49% Token,成本低约三分之一;相比 Codex、Claude Code 的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。 不过省钱会损失一点能力,SoL-Pi 保留了 Pi 约 94% 的平均得分;在 Terminal-Bench 4 的 63 个 CPU 任务里,它解出 15 个,Codex 和 Pi 都是 18 个。

09-11 09:30

离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成

动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。

09-10 00:45

ChatGPT Voice现可调用GPT-5.6 Sol和GPT-6 Astra

PANews 9月10日消息,OpenAI产品团队成员Atty Eleti发文称,ChatGPT Voice现可调用GPT-5.6 Sol和GPT-6 Astra。用户可自行选择模型及推理强度;Pro用户可选择上述模型,语音模式会在需要搜索或推理时调用所选模型。该功能基于GPT-Live运行,并将搜索及推理任务委派给前沿模型;语音调用底层文本模型回答时,会计入相应模型的消息额度。