PlanB:比特币站上50周均线上看8.9万美元,已确认熊市结束
相关推荐
PlanB:比特币价格已低于挖矿成本,后市行情取决于难度能否回升
火星财经消息,9 月 17 日,知名分析师 PlanB 发布全网挖矿难度与价格对照图称,当前应等待比特币挖矿难度重新上行。图表显示,截至 9 月 16 日全网挖矿难度约 127T,比特币价格明显运行在生产成本带下方,而在 2024 年至 2025 年期间,两者大体同步上行,2026 年难度转为横盘并一度回落,价格则率先下行。 PlanB 认为,现阶段难度较 S2F、幂律等模型更能刻画市场价格,因其近似矿工算力与 BTC 生产成本。PlanB 同时强调,这并非即时买入信号,而是观察矿工产能周期,若挖矿难度再度上调,或意味着矿工重新加码、底部更趋确认,若难度继续下修,则市场仍处于去杠杆阶段。
GLM-5.3开始优化自己的系统,智谱唐杰:RSI最小闭环已经出现
动察 Beating AI 快讯,智谱披露,GLM-5.3 驱动的 Infra Agent 已经参与优化 GLM-5.3-Flash 的推理系统。从首次跑通到承接全部生产流量不到两周,端到端吞吐提升到最初的 3.2 倍。 联合创始人兼首席科学家唐杰在复盘中提到,Agent 现在最容易卡住的地方,往往不是不会写代码,而是不知道问题出在哪。比如一次修改让吞吐下降 20%,它知道自己改坏了,却不知道是哪一层出了问题,下一步该查什么。 于是智谱把资深工程师平时的排查方法做成一套 Agent 可以直接使用的工具。Agent 改完代码后,可以自己检查结果对不对、时间耗在哪里、哪种方案更快,再根据结果继续修改。 靠这套方法,Agent 找出了长上下文计算误差、KV 传输阻塞和解码 kernel 重复计算等问题。其中一个 kernel 重写后提速 1.71 倍。 唐杰判断,工程师的角色会越来越像「设计反馈的人」。人负责定目标、设边界和审核高风险修改,Agent 自己提假设、改代码、跑实验。离完整的 RSI 还很远,但「模型优化系统,系统再服务模型」这个最小闭环已经出现。
智谱GLM公开国内大模型首个RSI实践:AI在十万卡国产集群上自建推理系统
火星财经消息,今日,智谱GLM 团队披露其在递归自我改进(Recursive Self-Improvement,RSI)方向的首个工程化实践:由GLM-5.3驱动的Infra Agent完成了GLM-5.3-Flash推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。这是国内大模型厂商首次公开跑进生产环境的RSI案例。据官方博客,Infra Agent在超10万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的3倍,硬件利用效率与单Token成本达到主流NVIDIA GPU相当水平。 (科创板日报记者 李明明)(财联社)
又一条RSI路线出现:模型参数不动,Agent靠Memory持续进化
动察 Beating AI 快讯,UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源 RSIAgent。 这是一套不训练模型的递归自我改进框架。底层模型参数全程固定,Agent 会自己寻找值得练习的任务、实际操作、检查结果,再把成功方法和失败教训写进长期 Memory。下一轮继续利用这些经验,逐步补上能力短板。 系统由三个 Agent 配合。Curriculum Agent 决定接下来练什么,Actor Agent 真正操作软件,Verifier Agent 独立检查结果。探索分成两步:先广泛尝试不同任务,再针对失败、隐藏限制和边界情况继续深挖。最后 Memory 会被冻结,直接拿去执行正式任务。 在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升到 78.98%;Agents’ Last Exam 从 83.75% 提升到 84.82%。不过这不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际用了 RSI 后的新结果,其余任务继续沿用原成绩。 它和 Prime Agent 这类 Harness 自我改进思路属于同一个大方向:模型权重不变,持续更新模型外面的东西。 RSIAgent 的特点是把改进重点放在 Memory,再用自主出题和独立验证,让这份外部经验库不断积累。
会改自己代码也不算真正自我进化:上海交大等给RSI划了5级
动察 Beating AI 快讯,上海交大联合清华、字节跳动、小红书、上海 AI Lab 等团队发布综述《The Last AI Built by Humans》,梳理 491 篇相关研究,试图给越来越泛的「AI 自我进化」划一条更严格的线。 论文把递归自我改进(RSI)分成 5 级。L1 只是执行人类规定好的改进流程;L2 可以自己决定怎么改;L3 连下一轮该学什么也能自己决定;L4 会根据实际运行中的反馈,持续修改记忆、技能、代码或 harness,让这些改动影响之后的任务;到了 L5,连负责产生下一轮改进的搜索方法、评估器和研究策略本身,也可以被修改,并交给下一轮继续使用。 所以单纯「会改自己代码」还不够。比如一个 Coding Agent 能重写自己的源码,但如果下一代怎么选、按什么标准打分、什么修改能留下来,仍由人写死,它只能证明自己会自我修改,还没有掌握完整的递归自我改进。 论文还把最高的 L5 拆成两层。第一层是「形式上递归」:AI 已经能修改负责后续改进的机制,并让下一轮继续沿用。第二层是「真的越改越强」:修改后的机制还得在相近资源和独立评测下,确实产生更强的下一代。 491 篇论文里,43.8% 被归为 L1,31.6% 在 L2,L5 只有 29 篇,占 5.9%。大量研究其实还集中在执行人类设计好的改进、自动寻找改法;真正把「如何改进」这套机制本身交给 AI 的工作很少。即使摸到 L5,长期稳定累积优势也还没有证明。 这篇论文主要是在给 RSI 领域立一套分类框架。L1 到 L5 是作者提出的标准,也还不是行业公认的统一分级。论文同时纳入了学术论文、技术报告、官方博客和开源系统,因为不少前沿 RSI 实践还没有进入正式论文。
OpenAI联创:RSI 仍存重大技术不确定性,RL 与持续学习成关键战场
PANews 9月13日消息,据Dwarkesh Patel频道访谈整理报道,多位AI研究员包括OpenAI联合创始人John Schulman、Charlie O’Neill与Beren Millidge在讨论中指出,递归自我改进(RSI)未必会带来短期内的“智能爆炸”,当前“Transformer+强化学习”范式可能在泛化、持续学习和样本效率上遭遇渐近瓶颈。嘉宾认为,大模型进步正从单纯算力扩展转向数据效率与稀疏/模块化架构,蒸馏与基于真实部署数据的持续学习,将成为中小实验室对抗头部实验室模型垄断的重要路径。