杨立坤4年前的构想交卷:H-JEPA迷宫成功率从18%升至73%
相关推荐
杨立昆:AI失控事件可通过工程改进预防,AMI Labs将于近期推出首款产品
PANews 10月1日消息,据《财富》报道,图灵奖得主、AMI Labs创始人杨立昆(Yann LeCun)在采访中表示,他认为近期AI智能体失控事件主要源于人为监督及沙箱设计不足,可通过工程改进预防。他还透露,AMI Labs目前约有60名员工,正基于JEPA架构开发面向工业应用的世界模型,首款产品将于“近期”推出。
Laminar把Agent查错成本压到GPT-6-sol的1/23
动察 Beating AI 快讯,AI Agent 可观测性平台 Laminar 发布专门检查 Agent 执行轨迹的模型 flow-1。它会读取模型调用、工具调用和返回结果,找出 Agent 在哪一步出错、为什么出错。 flow-1 运行在 Laminar 的 Signals agent 中。模型可以搜索整条 trace(Agent 的完整执行记录),再按需查看具体步骤。训练时,Laminar 先用合成调查数据做监督微调,再通过强化学习训练工具调用和复杂 trace 分析。 在 Laminar 自建的 523 条困难 trace 测试中,flow-1 的错误检测 F1 为 0.835,GPT-6-sol 为 0.816。sol 召回率更高,能找到更多真实错误;flow-1 精确率更高,误报更少。 对于不足 10 万 LLM tokens 的 trace,flow-1 平均每条分析约 0.0011 美元,GPT-6-sol 约 0.026 美元。按 Laminar 测算,1 美元分别能分析约 888 条和 38 条 trace,相差约 23 倍。flow-1 的成本也比 GPT-6-luna 低约 25%。 目前这些成绩都来自 Laminar 自建 benchmark,暂无第三方复测。flow-1 的训练数据主要来自合成工作流,其中约 48% 是软件工程任务。社区已经有人质疑,它面对真实生产环境里没有预先设计过的新型故障时能否保持同样表现。
ElevenLabs v4登顶TTS榜,超过Gemini和Qwen
动察 Beating AI 快讯,ElevenLabs 发布新一代语音模型 Eleven v4 和实时版 Eleven v4 Turbo。v4 主打更自然的情绪和声音控制,Turbo 面向实时语音 Agent,中位推理延迟约 100ms。 在 Artificial Analysis 最新 TTS 盲测榜中,Eleven v4 目前以 1315 Elo 排第一。Cartesia Sonic 3.6 为 1275,Gemini 3.8 Flash TTS 为 1267,Qwen-Audio-3.0-TTS-Plus 为 1258。上一代 Eleven v3 目前只有 1169,排第 17。 v3 已经支持笑声、耳语等音频标签,v4 主要把这套控制做得更准。用户可以直接指定语气、节奏、情绪和音效,也可以用自然语言描述一句话该怎么说。模型还把语言覆盖从 70 多种扩到 90 多种,Instant Voice Clone 只需要约 10 秒音频,并增强了长文本和多人对话中的声音一致性。 Turbo 则专门解决实时对话的速度问题。官方文档显示,v3 Conversational 的中位推理延迟约为 280ms,v4 Turbo 降到约 100ms。
Kamino 在 Solana 上线 sUSDai 抵押市场,最高可按 80% LTV 借入 USDC
ChainCatcher 消息,Solana 生态借贷协议 Kamino 上线 sUSDai 抵押市场。该市场由 Allez Labs 策划运营,sUSDai 为与 GPU 贷款挂钩的资产。在该市场中,sUSDai 持有者可抵押资产借入 USDC,最高贷款价值比为 80%,当抵押率升至 85% 时将启动清算。
ElevenLabs Music v2.5上线:免费版也给商用权,每天5首无损下载
动察 Beating AI 快讯,ElevenLabs 上线 Music v2.5,并把它设为 ElevenMusic 默认模型。新版本重点提升旋律、编曲层次和乐器真实感。官方让 v2 和 v2.5 用相同提示词各生成一版,做了 47,885 组盲测,v2.5 在多数对比中获胜。R&B、灵魂乐、嘻哈、摇滚、金属、管弦和电影配乐的差距最大。 而且现在授权也放宽了。Free 用户每天能下载 5 首无损歌曲,生成内容可以商用,但必须标注「Made with ElevenMusic」;Pro 每月有 400 次无损下载,不需要标注,还能把歌曲发行到流媒体平台。作品创建时拿到的权限以后不会因为降级或退订改变。基于其他艺人歌曲做改编的作品则不能下载或对外发行。 ElevenLabs 还明确表示 Music v2 不会下线。Suno 最近上线 v6,同时退役此前所有旧模型,引发不少老用户不满。HN 有用户实测后认为,v2.5 音质更好,但音乐性还是更喜欢 Suno v5。
给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元
动察 Beating AI 快讯,Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。 传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。 目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。 新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。