中科闻歌发布科研决策平台
相关推荐
AI 原生 SaaS 创业工作室 IAIG 完成 600 万美元 Pre-Seed 融资,Aleph 领投
ChainCatcher 消息,AI 原生创业工作室 Inevitable AI Group(IAIG)宣布完成 600 万美元 Pre-Seed 轮融资,本轮由 Aleph 领投。IAIG 计划利用人工智能重塑软件开发模式,打造并推出数十家 AI 原生 SaaS 企业。IAIG 由科技创业者 Nimrod Lehavi 和 Ofer Bar-Or 创立,公司核心理念是:随着 AI 技术快速发展,小团队也能够以更低成本、更高效率完成软件产品的开发、上线和规模化增长。自今年 1 月成立以来,IAIG 已孵化并推出 5 家公司,并计划在今年年底前推出数十个 AI 原生软件项目。公司重点关注已经验证市场需求的软件领域,通过 AI 提升产品效率、可访问性和定价竞争力。
Grok 4.5登顶SaaS工作流评测,成本约为Claude四分之一
据动察 Beating 监测,独立评测机构 Artificial Analysis 更新 AutomationBench-AA 榜单。SpaceXAI 的 Grok 4.5 以 51.4% 得分登顶,超过 Claude Fable 5 的 48.6% 和 Claude Opus 4.8 的 48.5%。 AutomationBench-AA 基于 Zapier 的 AutomationBench,测试 AI agent 能否按企业规则完成真实 SaaS 工作流。测试集包含 657 个多步骤任务,覆盖 40 个模拟应用环境,包括 Gmail、Google Sheets、Slack、Salesforce 和 HubSpot。 评分规则很严。模型不只要把任务做完,还不能碰企业预设红线。只要某个任务触发违规,这个任务就按 0 分处理。 Grok 4.5 的原始目标完成率接近 80%,高于 Claude Fable 5 和 Claude Opus 4.8。即便被红线扣分后,它仍以 51.4% 排在第一,也是当前首个得分超过 50% 的模型。 它的成本优势更明显。Grok 4.5 每个任务成本为 0.34 美元,低于 Claude Fable 5 的 1.35 美元、Claude Opus 4.8 的 1.46 美元,以及 GPT-5.5 xhigh 的 1.28 美元。 但 Grok 4.5 不是最稳的模型。它平均每个任务触发 0.63 次违规,高于 Claude Opus 4.8 的 0.55 次和 Gemini 3.5 Flash 的 0.46 次。