返回 7*24 快讯
来源MarsBit

Opus 5写5500行代码造出《指环王》世界,Karpathy称AI造游戏时代即将来临

据动察 Beating 监测,Andrej Karpathy 把《指环王》开头一段交给 Opus 5,给出 100 万 Token、约 10 美元的预算,让它用 Three.js 做成一个 3D 世界。 模型运行约 2 小时,写出 5500 行代码。它需要安排各种多边形素材在三维坐标中的位置,再写代码让整个场景动起来。成品有些粗糙,但确实把文字变成了可以播放的 3D 场景。 这类内容过去很少有人愿意专门制作,成本和时间都不划算。LLM 却可以一直做下去,让高度定制的世界变成随手生成的内容。Karpathy 畅想,未来用户可以进入这种临时生成的世界,成为故事角色、旁观者或 NPC,像是一个按需出现的《GTA》。 游戏也暴露了当前 LLM 的短板。Opus 5 不能高效、原生地观看视频,也不能进入游戏试玩,只能在不同节点缓慢截图检查。过程中还多次出错,留下不少粗糙和故障内容。 它已经能造出一个世界,却还不能顺畅地检查和体验自己造出的世界。
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

06-14 12:41

谷歌发布OKF规范,标准化Andrej Karpathy的「LLM-Wiki」模式

据动察 Beating 监测,大模型落地企业最大的障碍是缺乏内部背景知识(如表结构、工作流或 API 说明)。由于知识散落在不同系统、代码注释或员工脑中,开发人员不得不针对不同 AI 工具重复搭建检索管线。 为此,谷歌发布开放知识格式(OKF)v0.1 规范,正式将 Andrej Karpathy 提出的「LLM-Wiki」模式标准化。规范无需新软件或开发套件,主张将所有内部知识写成直观的 Markdown 文本文件,并随源码一同托管在代码仓库中。 在技术结构上,OKF 知识包由 Markdown 目录树构成。每个文件顶部使用文本标签声明类型、描述和日期,文件间通过超链接建立引用关系;同时配备用于快速预览架构的 index.md 和记录更新历史的 log.md。 Andrej Karpathy 指出,人类讨厌更新 Wiki 是因为手动维护目录和跨文件链接极其枯燥。而 AI 不会遗忘更新交叉引用,并能单次处理编辑多达 15 个文件,非常适合扮演「文档管理员」接管日常维护。 此外,规范采用了宽容的解析模型。即便 AI 在自主生成文件时遗漏了字段、写错类型或留下了死链接,系统也不会报错崩溃,确保了极高的容错性。

05-19 23:22

OpenAI创始成员Andrej Karpathy加入大模型公司Anthropic

PANews 5月19日消息,OpenAI创始成员、特斯拉前AI负责人 Andrej Karpathy 发文称已加入大模型公司 Anthropic,计划在未来数年专注于前沿大语言模型(LLM)研究与开发,并表示对此次回归 R&D 感到兴奋。

06-26 09:52重要

马斯克回复Andrej Karpathy对X现状的批评:我们需要对算法进行彻底的改革

PANews 6月26日消息,AI领域知名研究者、特斯拉自动驾驶技术核心贡献者及OpenAI创始成员Andrej Karpathy近日在X平台发文表达对Claude AI助手的兴奋之情,称其“像真正的队友一样工作”,却遭到大量陌生用户攻击,被指责为“推广者”。Karpathy随后回应称,在X平台20年来从未见过如此充满戾气的环境,算法主动推送愤怒、侮辱和围攻内容以获取互动,导致他自己也减少了发帖和访问频率。马斯克对此回应称“我们需要对算法进行彻底的改革”。

07-25 09:26

Opus 5以微弱优势登顶智能榜,单任务成本比Fable 5低26%

据动察 Beating 监测,第三方评测机构 Artificial Analysis 公布 Claude Opus 5 成绩。它在综合 9 项测试的智能指数中得 61 分,窄幅领先 Fable 5 的 60 分。GPT-5.6 Sol 得 59 分,Kimi K3 得 57 分。 Opus 5 每项任务平均成本为 2.03 美元,比 Fable 5 的 2.75 美元低 26%。它在 GDPval-AA v2 和 AA-Briefcase 两项知识工作评测中登顶,搭配 Claude Code 后也并列拿下编程 Agent 指数第一。Terminal-Bench v2.1 得分为 89%,大致追平 GPT-5.6 Sol。 模型提供 5 档推理强度。从 low 到 max,输出 Token 相差约 8 倍,GDPval-AA v2 成绩相差 407 Elo。用户可以用更多 Token 换取更强性能,也可以主动压低成本。 短板同样明显。Opus 5 的事实知识仍落后 Fable 5。在 AA-Omniscience 测试中,它的幻觉率升至 50%,比 Opus 4.8 高 14 个百分点。低推理档位的性价比也仍略逊于 GPT-5.6 系列。

07-22 15:20

写Prompt太慢?Karpathy建议先跟AI胡侃10分钟

据动察 Beating 监测,OpenAI 联合创始人、现 Anthropic 预训练团队成员 Andrej Karpathy 分享了一种「长篇口述 Prompt」工作法。面对复杂任务,他会打开语音输入,连续讲约 10 分钟。内容可以跳跃、混乱,也不必先整理成完整指令。 Karpathy 认为,大模型擅长从这些碎片中还原真实目标。它还能把纠缠的思路整理得更清楚。必要时,他会让模型追问几轮,把口述变成一场小型访谈。前期多交代背景,后面需要纠正的地方反而更少。

07-09 09:45

Cognition发布每秒1000 Token的编程大模型SWE-1.7

据动察 Beating 监测,Cognition 发布了全新 AI 编程大模型 SWE-1.7,目前已在 Devin 中上线。SWE-1.7 基于月之暗面的 Kimi K2.7 Code 研发。在多项智能体编程测试中,它接近 GPT-5.5 与 Claude Opus 4.8 的水平,但生成成本大幅降低。通过接入 Cerebras 推理芯片,SWE-1.7 的运行速度达到每秒 1000 Token。 为了应对超长任务,模型学会在上下文临界点自动总结当前状态,并从摘要中继续运行。这使单次任务的持续时间可以达到 6 小时。团队在训练中引入了交替长度惩罚机制,在特定阶段惩罚冗余输出,促使模型对简单任务精简推理,而将长推理留给难题。为打破单一集群算力限制,团队还构建了跨越三大洲的多集群分布式训练架构,通过仅同步权重变化量,在数分钟内即可完成全球节点的参数更新。