FLUX 3 Image上线,先框位置再生图,最高4K、支持10张参考图
相关推荐
Mysten Labs联创兼CTO Sam Blackshear将离职并加入Anthropic
PANews 8月6日消息,Mysten Labs联合创始人兼首席技术官Sam Blackshear在X平台发文称,其将离开Mysten Labs并加入Anthropic从事防御性安全研究工作。Blackshear表示当前攻防力量平衡正在转变,投身安全领域让他充满动力。他将继续担任Mysten和Sui生态的顾问,并参与正在筹备中的Move基金会。Mysten Labs的技术工作将由@EvanWeb3接任。
给 Agent 克隆 Slack 和 GitHub,Arga Labs 融资 1000 万美元
动察 Beating AI 快讯,Arga Labs 完成 1000 万美元种子轮融资,由 General Catalyst 领投,BoxGroup、Emergence、Gradient 和 SV Angel 等参投。这家只有 4 人的 YC 创业公司,专门给 AI Agent 搭测试沙盒(与真实系统隔开的测试环境)。它会复制 Slack、GitHub、Salesforce、Stripe 等软件,让 Agent 上线前先在里面反复操作。 传统测试通常只是伪造几个 API 返回结果,很多意外情况覆盖不到。Arga 则会连软件里的数据状态、账号权限、Webhook 和报错情况一起复制。比如销售 Agent 可以同时操作测试版 Salesforce 和 HubSpot,看它会不会认出两个联系人来自同一家公司,避免重复发邮件。 目前 Arga 已支持 30 多种软件。官方称,现在最快不到 12 小时就能复制一个 SaaS 的后端行为。过去 16 周,客户已经启动超过 10 万个测试环境,Slash、Monaco、Y Combinator 等团队都在使用。 新融资会继续砸在自动造环境上。Arga 正在开发新的生成系统,想把复制一个 SaaS 的时间从几小时压到几分钟。最终它希望做到,Agent 自己发现一个新 API 后,系统就能自动生成对应的测试环境,让 Agent 先在里面反复试错,再真正接触生产系统。
ElevenLabs v4登顶TTS榜,超过Gemini和Qwen
动察 Beating AI 快讯,ElevenLabs 发布新一代语音模型 Eleven v4 和实时版 Eleven v4 Turbo。v4 主打更自然的情绪和声音控制,Turbo 面向实时语音 Agent,中位推理延迟约 100ms。 在 Artificial Analysis 最新 TTS 盲测榜中,Eleven v4 目前以 1315 Elo 排第一。Cartesia Sonic 3.6 为 1275,Gemini 3.8 Flash TTS 为 1267,Qwen-Audio-3.0-TTS-Plus 为 1258。上一代 Eleven v3 目前只有 1169,排第 17。 v3 已经支持笑声、耳语等音频标签,v4 主要把这套控制做得更准。用户可以直接指定语气、节奏、情绪和音效,也可以用自然语言描述一句话该怎么说。模型还把语言覆盖从 70 多种扩到 90 多种,Instant Voice Clone 只需要约 10 秒音频,并增强了长文本和多人对话中的声音一致性。 Turbo 则专门解决实时对话的速度问题。官方文档显示,v3 Conversational 的中位推理延迟约为 280ms,v4 Turbo 降到约 100ms。
腾讯混元Hy Image3.5 preview上线:最多20张参考图、4K直出
动察 Beating AI 快讯,腾讯混元推出 Hy Image3.5 preview。相比 Hy Image3.0,新版参考图上限从 3 张提高到 20 张,还支持多轮连续编辑,最高可直接生成 4096×4096 的 4K 图片。 Hy Image3.5 preview 已在设计 Agent Miora 上线,9 月 22 日至 10 月 7 日限时免费。Miora 称,新版整体能力较上一代提升约 30%。
ElevenLabs Music v2.5上线:免费版也给商用权,每天5首无损下载
动察 Beating AI 快讯,ElevenLabs 上线 Music v2.5,并把它设为 ElevenMusic 默认模型。新版本重点提升旋律、编曲层次和乐器真实感。官方让 v2 和 v2.5 用相同提示词各生成一版,做了 47,885 组盲测,v2.5 在多数对比中获胜。R&B、灵魂乐、嘻哈、摇滚、金属、管弦和电影配乐的差距最大。 而且现在授权也放宽了。Free 用户每天能下载 5 首无损歌曲,生成内容可以商用,但必须标注「Made with ElevenMusic」;Pro 每月有 400 次无损下载,不需要标注,还能把歌曲发行到流媒体平台。作品创建时拿到的权限以后不会因为降级或退订改变。基于其他艺人歌曲做改编的作品则不能下载或对外发行。 ElevenLabs 还明确表示 Music v2 不会下线。Suno 最近上线 v6,同时退役此前所有旧模型,引发不少老用户不满。HN 有用户实测后认为,v2.5 音质更好,但音乐性还是更喜欢 Suno v5。
ChatGPT Images 2.5上线:生图快50%,改图终于能指哪改哪
动察 Beating AI 快讯,OpenAI 正式发布 ChatGPT Images 2.5,重点升级了生成速度、人物还原和改图体验。相比 Images 2.0,新版本生成图片的延迟最高可降 50%。拿照片做参考时,它也更能保住人物、宠物等主体的长相和细节。 这次最实用的变化,是改图终于更「听话」了。用户可以直接在图片上圈出要改的位置,再写一句怎么改,比如只换一片花瓣、只改一个物体的颜色,不用反复用文字描述具体在哪。连续改多轮时,模型也更不容易把没要求改的地方一起改掉。 ChatGPT 现在还支持直接画草图来控制构图,也加了海报、周边商品等常用图片模板。Images 2.5 已开始向 ChatGPT、ChatGPT Work 和 Codex 用户开放。 API 同时上线 GPT-Image-2.5 Flare 和 Sunburst。Arena 最新评测中,Sunburst 排第一、Flare 排第二,两款模型同时包揽文生图、单图编辑和多图编辑三个榜单前两名。