返回 7*24 快讯
来源Blockbeats

Cognition拿Kimi K3炼出SWE-2:逼近Astra,成本仅1/4

动察 Beating AI 快讯,Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。它直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测又提高约 5 到 6 个百分点。 在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。它距离 Fable 5.1 的 50.9% 只差 0.9 个百分点,但成本低 64%。GPT-6 Astra 得分 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为四分之一。 SWE-2 也比上一代少走很多弯路。中等推理强度下,它完成任务的交互轮数减少 58%,平均成本下降 81%。不过在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,还谈不上全面追平前沿模型。 SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

09-11 09:30

离真正替程序员还远:Agent进企业私有代码,最高通过率也只有四成

动察 Beating AI 快讯,YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门拿真实公司的私有代码测试 Coding Agent。任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。代码和答案都没公开在网上,Agent 得自己摸清公司的业务规则和代码结构。 结果 Fable 5.1 排第一,通过率也只有 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。当前公开的 10 个任务里,有 6 个整体通过率低于 15%,还有一个任务所有模型全部失败。 最让人意外的是 GLM 5.3。Real-SWE 更考验 Agent 在陌生项目里持续读代码、找规则和完成多步改动的能力。智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜上表现突出。

08-28 06:07

Devin年化收入9亿美元,Cognition今年可能烧掉8亿

动察 Beating AI 快讯,AI 编程 Agent Devin 背后的 Cognition,年化收入已经达到约 9 亿美元。按现在每月约 7500 万美元的收入计算,比今年年初增长超过 3 倍。公司还在进行新一轮融资,估值可能达到约 450 亿美元。 增长速度还在加快。今年 5 月融资时,Cognition 公布的年化收入还是 4.92 亿美元,估值 260 亿美元。短短三个月,年化收入又涨了约 83%。 但 Cognition 也非常烧钱。《The Information》称,公司今年可能消耗约 8 亿美元现金,光第二季度就烧掉约 2 亿美元。很大一部分钱花在算力上。Cognition 租了大规模英伟达服务器,一边运行 Devin,一边训练自己的模型,这套服务器每年就要花数亿美元。 目前 Cognition 的企业业务毛利率接近 50%。如果不算自研模型的训练投入,公司已经接近不再烧钱。管理层预计,今年底年化收入会超过 15 亿美元,明年达到 40 亿至 50 亿美元。

09-04 07:36

GPT-6 Astra拿下Perplexity研究Agent榜首:比Fable 5.1高13.5%,还便宜6.1%

动察 Beating AI 快讯,Perplexity 用自家的 Agent 基准 WANDR 测了 GPT-6 Astra,得分 0.682,是目前测过的模型里最高。平均每个任务成本 11.98 美元。相比 Claude Fable 5.1,分数高 13.5%,成本反而低 6.1%;相比 Opus 5,分数高 27%,成本只高 3.3%。 WANDR 专门测「又广又深」的研究任务。它有 500 个真实研究任务,要求 Agent 不只是找到几个答案,而是尽量找全符合条件的对象,再逐个查资料、核身份,并给每条结果配上可验证的来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。 此前 Fable 5.1 以 0.601、每任务 12.76 美元排第一,Opus 5 为 0.537、11.60 美元。Astra 这次把分数明显往上推了一截,而且不是用更高成本硬堆出来的。

09-02 10:27

UU 远程优化手机 Vibe Coding:多 Agent 并行,电脑手机无缝接管

动察 Beating AI 快讯,网易 UU 远程大改终端功能。手机现在能同时创建多个终端会话,分别运行 Claude Code、Grok Build 等 Coding Agent。退出页面不会停掉任务,之后可以随时回来查看进度。此前 UU 终端一次只能开一个会话,多 Agent 并行基本没法用。 移动端也补上了 TUI(终端里的交互界面)支持。Claude Code、Grok Build 这类工具的菜单、选择器、状态栏现在能正常显示,还能直接触屏选择。输入也可以调用手机系统输入法,中文、语音和特殊符号都方便不少。 更实用的是跨端接管。手机上开的终端任务,回到 Mac 后可以用 uuyc-cli lterm attach 直接接着操作;电脑上开的会话,出门后也会出现在手机里。任务和历史记录不用重新开一遍。 UU 还扩展了 uuyc-cli。终端会话可以直接通过命令创建、查询、接入和关闭,设备控制、远程协助等操作也能走 CLI,查询结果支持 JSON。这样不只人能操作 UU,Agent 和自动化脚本也能直接调用它。

09-11 05:14

DeepSeek V4.1 Flash第三方实测:没夺回国模第一,但成本只有Kimi、GLM七分之一

动察 Beating AI 快讯,Artificial Analysis 完成 DeepSeek V4.1 Flash 独立测试,综合智能指数拿到 40 分。它已经超过自家 V4 Pro 0813 的 36 分,但仍低于 Kimi K3 的 44 分和 GLM-5.3 的 45 分。按这套第三方榜单,DeepSeek 还没夺回国产模型第一。 但价格差距非常夸张。V4.1 Flash 跑完一个 Intelligence Index 任务平均只花 0.27 美元,Kimi K3 和 GLM-5.3 都在 2 美元左右,相差约 7 倍。输出速度达到 197 Token/s,也远高于 Kimi K3 的约 36 Token/s 和 GLM-5.3 的约 58 Token/s。 Agent 依然是它最强的部分。AutomationBench-AA 上,V4.1 Flash 拿到 69%,追平 GPT-6 Astra,并超过 GLM-5.3 的 62%;长上下文测试 AA-LCR 也拿到 84%。缺点是它特别能说,AA 测试中单任务平均输出约 8.9 万 Token,比 V4 Pro 多 62%,吃掉了一部分价格优势。

09-03 09:11

DeepSWE一夜两换榜首:Gemini刚上去,Meta又报75.4%

动察 Beating AI 快讯,Gemini 3.8 Flash 刚发布时,Google 在 DeepSWE v1.1 上跑出 73.7%。DeepSWE 官方榜目前将它显示为 74%±1%,排在 Claude Opus 5 和 GPT-5.6 Sol 前面。几个小时后,Meta 又公布 Muse Spark 1.3,自己在同一套 DeepSWE 上跑到 75.4%,把公开成绩再往上推了 1.7 个百分点。 这项测试让 Agent 独立处理 113 个真实代码库里的长周期软件工程任务。Google 和 Meta 都使用 mini-swe-agent,Google 跑的是 high 推理档,Meta 跑的是 max。Meta 上一代 Spark 1.2 只有 55.0%,这次直接涨了 20.4 个百分点。不过 Meta 的 75.4% 目前还没进入 DeepSWE 官方榜。 在 Artificial Analysis 的 Coding Agent Index 中,限量预览的 Spark 1.3 max 得到 68 分,仅次于 Claude Opus 5;目前公开可用的 xhigh 版本则是 64 分。