溜溜梅简写LLM引发AI概念炒作,上市首日暴涨186.6%
相关推荐
Anthropic自曝Model2:强过Mythos5,暂不发布
据动察 Beating 监测,Anthropic 最新风险报告首次披露内部模型「Model 2」。它整体比 Mythos 5 更强,在不少内部任务上有明显提升,现在已经大量用于写代码、生成数据和跑 Agent。不过 Anthropic 暂无对外发布计划,也没有跑完平时发布新模型前会做的整套评测。 Anthropic 还把模型在高风险场景下「不按预期行事」的风险判断从「极低」上调到「低」。原因是近期网络安全测试接连出了事故,公司对这类风险的判断没以前那么有把握。此前 Claude 曾在测试中意外连上真实互联网,并未经授权进入三家外部机构的系统。 Claude 也已经深度参与 Anthropic 自己的研发。公司最终合入的生产代码,大部分已经由 Claude 编写,但 AI 带来的整体研发提速还不到 2 倍。大量代码能交给 AI,不代表整个研发流程也能自动化。 与此同时,部分具体任务评测已经「测不动了」:模型继续变强,原来的测试却越来越难看出差距。Anthropic 因此承认,现在对 AI 研发自动化风险的判断,反而没有以前那么有把握。
朝鲜黑客组织构建本地LLM环境,AI攻击能力全面升级
BlockBeats 消息,8 月 10 日,网络安全企业 Genians 于 8 月 10 日披露,朝鲜侦察总局下属黑客组织金速基(Kimsuky)已在生成型 AI 应用上实现重大升级——不仅将 AI 用于钓鱼诱饵制作,更进一步构建了独立运行的本地大型语言模型(LLM)环境及检索增强生成(RAG)体系,具体工具涵盖 Ollama、GPT4All、Msty 等本地 LLM 管理工具及 AI 代码编辑器 Cursor,意图实现情报提取与攻击流程自动化。(韩联社)
Vitalik:无法确定 LLM 是否能覆盖全部人类能力,支持 AI 适度减速
Foresight News 消息,Vitalik Buterin 在 Farcaster 发文,系统阐述了其对 AI 能力增长的判断框架。他将人类历史上的机器进步分为三波:工业革命带来的大规模制造能力、计算机带来的可以用精确逻辑规则定义的脑力任务,以及大语言模型(LLM)带来的可通过海量样本定义的任务能力。他认为当前最关键的问题在于,LLM 加上后续改进是否能最终覆盖所有人类能力,这一点目前无法确定。他将 AGI 定义为「若上传至机器人体内、人类突然消失后仍能独立延续文明的 AI」,并认为一旦达到这一节点,人类作为地球主宰将只是历史偶然,而非根本性优势。 Vitalik 表示,其理想的未来是:全球政治与经济多元格局得以保留、人类与机器深度融合而非被取代,以及为不愿改变生活方式的人保留可选择的空间。他同时警告,这条通向理想未来的路极为狭窄,可能被多种风险打断。包括 AI 自主性过强、单一国家或企业取得决定性优势并将其锁定,以及人机融合本身未能保留足够的人类本质。他表示支持 AI 减速或暂停提案,希望以较慢的速度穿越这段高风险时期,并认为若开源模型权重能够抑制前沿模型的资本投入,将是无需强硬政治手段即可实现减速的理想路径。
奇富科技正式开源自动建模Agent ModelEvo
火星财经消息 7月14日消息,奇富科技近日正式开源面向业务场景的自动建模Agent ModelEvo。这一工具既是为了将分散的专家经验沉淀为标准化、可复用的建模能力,提升内部研发效率,同时也希望将经过真实业务验证的方法论开放给行业,参与到AI建模基础设施的共建中。用户只需从业务目标出发,ModelEvo 即可通过 Agent 编排标准化建模 Skills,协助完成需求澄清、数据检查、存量模型评估、样本构建、特征分析、模型训练、自动调优、效果评估和报告生成。首个版本支持分类预测与 Uplift 增益建模两类典型任务。
Meta发布Muse Spark 1.1模型,推出Meta Model API
Odaily星球日报讯 Meta 首席执行官 Mark Zuckerberg 在 X 上宣布发布 Muse Spark 1.1 模型,并同步推出 Meta Model API。据介绍,Muse Spark 1.1 主打 Agent 能力、工具调用及计算机操作能力,支持 100 万 Token 上下文窗口,可将任务分配给多个子 Agent 并行执行,并支持操作桌面、移动端及浏览器界面。其表示,该模型已上线 Meta AI 和 Meta Model API,公司将专注于以低成本提供高性能 Agent 与多模态模型。
DGrid AI 发布最新研究论文 PoQ-Judge,以多架构评估框架完成去中心化 LLM 质量评估闭环
ChainCatcher 消息,去中心化 AI 基础设施网络 DGrid AI 今日发布最新研究论文 “PoQ-Judge”,提出一套无需参考答案的多架构质量评估框架。这意味着在真实部署环境中,往往没有标准答案可供比对,协议依然能够对模型回答的质量做出可靠评分,并据此分配激励。这是 DGrid 去中心化 LLM 推理质量评估体系长期缺失的一块关键拼图。 PoQ(Proof of Quality,质量证明)是 DGrid 自研的共识机制,用于在协议层防止模型提供方投放劣质模型、伪造数据或隐藏计算费用,从而保障服务质量与定价透明。DGrid 团队围绕 PoQ 持续深耕,已陆续发表四篇研究论文。本次发布的 PoQ-Judge,训练了三款覆盖不同质量与成本场景的评估模型,在留存测试集上与人工评分的相关性最高达 0.747,显著优于此前所有基于参考答案的评估器,同时通过级联评估与在线权重校准将评估成本降低超 72%。 随着 PoQ-Judge 落地,从质量评估 → 评分 → 激励分配的完整流程已全部摆脱对参考答案的依赖,去中心化 LLM 推理的质量闭环就此打通。 DGrid AI 是一个去中心化的 AI 智能网络,致力于构建开放、透明、由社区驱动的 AI 基础设施。围绕模型调用与应用体验,DGrid 已推出多款核心产品:统一聚合全球主流大模型的 AI Gateway、AI 智能体一键部署平台 DClaw、匿名模型竞技平台 AI Arena,以及智能模型推荐助手 Dori,为开发者与用户提供一站式服务。据悉,DGrid AI 半年营收已突破 2000 万美元。