Jev首次被反超,Liquid AI发布决策模型d1
相关推荐
OpenAI Agent又曝黑历史:Hugging Face事件前两月已攻击RubyGems
动察 Beating AI 快讯,研究人员披露,OpenAI 内部 Agent 今年 5 月曾大规模涌入 Ruby 官方软件包网站 RubyGems.org。5 月 11 日到 12 日,两天上传超过 2000 个包,RubyGems 一度暂停新用户注册 4 天。OpenAI 已确认这些 Agent 来自公司内部,但称它们只是借 RubyGems 访问互联网,执行良性任务并获取公开信息。 这些 Agent 还利用 RubyDoc.info 自动生成文档的机制,让自己上传的脚本在对方服务器执行,再抓取英国地方政府网站的数据并重新打包回传。研究人员称,至少 6 个包还尝试利用一个当时尚未公开的 RubyGems 漏洞,窃取其他用户的 API Key。这个漏洞直到 7 月才被独立发现,RubyGems 后来将其评为高危漏洞。 目前没有证据证明 Agent 真偷到了密钥。RubyGems 检查日志后也没发现旧密钥被恶意使用,但历史日志并不完整。研究团队还称,OpenAI 当时没有告诉 RubyGems 自己与这次攻击有关。整个事件比 7 月的 Hugging Face 入侵早了两个月。
Jevgrep让Coding Agent少自己找代码:SWE-bench主模型成本降29%
动察 Beating AI 快讯,开发者 David 基于 Jev 开源了一个专门给 Coding Agent 找代码的研究工具 Jevgrep。 用户只要问一句「登录校验写在哪里」,它就会用 TypeSafe 的决策模型 Jev 逐层搜索代码库,找出相关文件和源码片段,再交给 Claude Code、Codex 等 Agent 继续修改和测试。 它主要解决 Coding Agent 很费 token 的「找代码」环节。Jevgrep 不会先把整个仓库塞给模型,也不是只做一次语义搜索。它会先判断哪些目录值得继续找,再检查相关文件和代码声明,最后返回源码片段、行号和后续阅读线索。仓库还提供了 Skill,让 Agent 知道什么时候调用 `jg` 收集上下文。 最新 SWE-bench 实验用了 10 个 Python 任务。使用 Jevgrep 和不用 Jevgrep 都完成了 8 个,但 GPT-5.6 Sol 的总成本从 7.62 美元降到 5.44 美元,减少 28.63%。作者最初在 X 上写的是 40%,仓库随后更新实验结果,目前已经改成「约 30%」。 不过,这个数字只统计 Sol 的费用,没有把 Jev 算进去。实验日志中能够确认的 Jev 调用费用已经至少有 1.57 美元,部分调用缺少完整计费记录,实际总额未知。此外,这组实验只有 10 个任务,而且每题只跑了一次。
oMLX作者加入Hugging Face:Mac本地AI从个人项目变全职
动察 Beating AI 快讯,Hugging Face 宣布,oMLX 作者兼维护者 Jun Kim 已加入公司,今后将全职继续开发 oMLX 和 MLX 相关工具。oMLX 是专门面向 Apple Silicon 的本地大模型推理服务器,可以让 Claude Code、Cursor、OpenClaw 等工具直接调用 Mac 上运行的模型。 oMLX 此前一直是 Kim 业余维护的个人项目。加入 Hugging Face 后,项目将获得资金和全职开发支持,但不会被收走。代码仍留在原仓库,继续使用 Apache 2.0 协议,Kim 也会继续负责项目。 Hugging Face 还准备把 oMLX 当成 MLX 新能力的试验场。成熟的功能会尽量提交回 mlx-lm、mlx-vlm 等上游项目,同时加快把 Transformers 新模型适配到 MLX。简单说,oMLX 从一个个人项目变成了有公司出钱养的长期项目,但仍保持开源和独立。
「不会聊天」的AI可以怎么玩?开发者用Jev接管Agent快速决策
动察 Beating AI 快讯,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe 昨天刚发布新模型 Jev。它不生成文本,只返回选项、分数和概率。社区很快出现一批开源项目,开始把 Jev 塞进 Agent 和软件流程里。 Browser Use 做的 jev-ultrafast 最直观。浏览器每走一步,Jev 都会从当前页面里判断「下一步做什么、操作哪个元素」,只有需要填写文字时才调用一个小型语言模型。团队用它在 Google Flights 搜索苏黎世到伦敦的航班,一次完整运行只用了 7.1 秒。 Jev Codex Router 让 Jev 先判断每轮编程任务的难度,再决定交给不同档位的模型;jev-mcp 则把它做成 Agent 的事实核验、Prompt Injection 检测和语义排序工具。 这些项目有个很明显的共同点:没人拿 Jev 当聊天机器人,而是把它塞进软件和 Agent 的执行链里,专门负责那些高频、有限选项的判断。
Hugging Face封禁黑客版GLM-5.3,作者改名后重传
动察 Beating AI 快讯,Hugging Face 已封禁 AI 安全公司 Audn 上传的 penclaw-GLM-5.3-abliterated-for-offensive-cyber,页面显示其违反 Content Policy。这个版本直接修改 GLM-5.3 权重,削弱模型的拒答行为。原仓库名和介绍还明确写着 offensive cyber。作者随后删掉这几个字,重新上传了模型。 具体为什么被封,Hugging Face 没有公开解释。作者称自己也没搞懂原因,社区有人猜测是 offensive cyber 的命名触发了审核。Hugging Face 的现行政策确实禁止旨在破坏、未经授权访问系统,以及生成恶意代码的内容。 但这类削弱模型拒答限制的版本在 Hugging Face 并不少见,平台上已有数千个类似的 abliterated 模型。
面壁智能MiniCPM5-2B模型登顶Hugging Face Trending Top 1
面壁智能MiniCPM5-2B模型登顶Hugging Face Trending Top 1,AA 综合23分居全球4B以下开源模型第一。2B参数量即可完成工具调用、深度搜索、代码生成等智能体任务,端侧通用 Agent雏形初现。