返回 7*24 快讯
来源MarsBit

Cerebras发布CS-4 AI加速器,称推理速度最高达GPU方案30倍

当地时间8月18日,Cerebras发布新一代AI加速器CS-4,称其推理速度最高可达基于GPU方案的30倍。CS-4采用三颗新型WSE-3 Turbo晶圆级引擎,AI算力达750PFLOPS,内存带宽达129.6PB/s。Cerebras表示,在GPT-OSS-120B测试中,CS-4每用户每秒生成超过440个Token,最高达到GPU方案的30倍;其每瓦吞吐量最高为CS-3的10倍,并可支持超过50万亿参数的模型。CS-4预计将于今年第三季度开始出货。(界面)
免责声明:以上内容仅为作者观点,不代表 711BTC 的任何立场,不构成与 711BTC 相关的任何投资建议。

相关推荐

08-14 08:58

OpenAI把GPT-5.6 Sol提速14倍:750 token/s先上API

据动察 Beating 监测,OpenAI 开始预览 GPT-5.6 Sol 的 Ultrafast 模式。它由 Cerebras 提供算力,最高输出速度达到 750 token/s,最高是 Standard 模式的 14 倍。目前只向少量 API 客户开放。 OpenAI 已在故障排查、研究、客服、金融分析和开发 Agent 等场景中测试 Ultrafast。对于需要连续多次调用模型的 Agent,单次响应提速也能直接缩短整个任务的执行时间。 这比 OpenAI 7 月底推出的 Fast 模式又快了一档。Fast 模式最高是 Standard 的 2.5 倍,Ultrafast 则把上限推到 14 倍。OpenAI 暂未公布 Ultrafast 的价格,也没有宣布何时进入 ChatGPT。

07-24 18:05

OpenAI最会省Token:GPT-5.6 Sol用一半Token逼近Fable 5

据动察 Beating 监测,Artificial Analysis 公布最新 Token 效率对比。本月已有 5 家以上实验室密集发新模型,OpenAI 仍占据大部分帕累托前沿。 所谓帕累托前沿,就是同等智能下,没有别的模型能用更少 Token。GPT-5.6 Sol max 得 59 分,每项任务平均消耗约 1.5 万输出 Token。Claude Fable 5 得 60 分,消耗约 3.3 万 Token。 GPT-5.6 Sol 的输出单价为每百万 Token 30 美元,并不便宜。但在这套测试中,每项任务成本仍只有 1.04 美元,约为 Fable 5 的三分之一。OpenAI 自家的 Terra 和 Luna 没有进入这条效率前沿。

07-30 14:10

GPT-5.6上线后给自己降本,运行成本降20%

据动察 Beating 监测,OpenAI 披露,GPT-5.6 Sol 上线后已经开始参与改进承载自己的生产系统。它通过 Codex 分析真实流量、调整请求分配,并自主重写 GPU kernel(控制芯片计算的底层代码)。相关优化让模型端到端运行成本下降 20%。 GPT-5.6 Sol 还改进了配套的草稿模型。它自行设计并运行数百次架构实验,启动和监控训练。遇到硬件故障或训练不稳定时,它也会介入处理。最终,推测解码(小模型先预测,主模型批量验证)的 Token 生成效率提高超过 15%。 OpenAI 将这套流程描述为持续反馈循环:观察生产环境、找出瓶颈、修改系统,再验证整体效果。GPT-5.6 已经参与了其中多个环节。

07-09 09:45

Cognition发布每秒1000 Token的编程大模型SWE-1.7

据动察 Beating 监测,Cognition 发布了全新 AI 编程大模型 SWE-1.7,目前已在 Devin 中上线。SWE-1.7 基于月之暗面的 Kimi K2.7 Code 研发。在多项智能体编程测试中,它接近 GPT-5.5 与 Claude Opus 4.8 的水平,但生成成本大幅降低。通过接入 Cerebras 推理芯片,SWE-1.7 的运行速度达到每秒 1000 Token。 为了应对超长任务,模型学会在上下文临界点自动总结当前状态,并从摘要中继续运行。这使单次任务的持续时间可以达到 6 小时。团队在训练中引入了交替长度惩罚机制,在特定阶段惩罚冗余输出,促使模型对简单任务精简推理,而将长推理留给难题。为打破单一集群算力限制,团队还构建了跨越三大洲的多集群分布式训练架构,通过仅同步权重变化量,在数分钟内即可完成全球节点的参数更新。

08-18 20:50

机构:OpenAI宣布针对OpenRouter和Vercel的AI Gateway平台上的GPT-5.6 Sol模型降价50% 很可能是一次巧妙的营销策略

火星财经消息,研究机构SemiAnalysis发文称,OpenAI刚刚宣布,针对OpenRouter 和Vercel的AI Gateway平台上的GPT-5.6 Sol模型,降价 50%。这很可能是一次巧妙的营销策略。尽管OpenRouter和Vercel在OpenAI总token用量中的占比很小,但它们的影响力却不成比例地大——因为这两个平台正是外界用来估算各大 AI 实验室/模型市场份额的核心数据来源之一。如果此次降价能在未来一个月内让5.6 Sol的token用量翻倍以上,许多投资者很可能就会简单地将此视为OpenAI对阵Anthropic的一场重大胜利。(财联社)

08-14 10:08

ChatGPT不再靠截屏记住你:电脑记忆改成记录操作轨迹

据动察 Beating 监测,OpenAI 上线 Computer History,正式替代此前的 Chronicle。旧版靠截屏了解你最近在电脑上做什么,新版彻底取消截屏,改为记录点击、输入、快捷键和 App 切换等操作。 这些记录会被整理成时间线和本地记忆。以后你问「我刚才改了哪个文件」「昨天在忙什么」,ChatGPT 和 Codex 都可以先从历史里定位。OpenAI 称,相比 Chronicle,新方案消耗的 token 更少。 它还能发现你反复做的操作,并建议直接做成 Skill 或 Automation。以前只是记住「你干过什么」,现在开始记「你平时怎么干活」。 目前 Computer History 仅在 macOS 上向 Pro、Business 和 Enterprise 用户开放,默认关闭,也可以单独排除某些 App 和网站。