Perplexity开源新检索模型:0.6B小模型能直接查9B建立的索引
相关推荐
Perplexity开源新Embedding模型:整篇一起读,切块也能带着上下文
动察 Beating AI 快讯,Perplexity 开源新的上下文 embedding 模型 pplx-embed-v2-context-9b-preview,主要用于 RAG 检索。普通 embedding 通常把长文档切成小块后分别理解,新模型会把这些块一起编码,让每一块生成向量时都能参考整篇文档的上下文。模型已在 Hugging Face 开放,采用 MIT 许可证。 比如一段文字只写「它增长了 20%」,单独拿出来很难知道「它」是谁。新模型可以结合文档其他部分理解这句话。训练时,它还专门学习同时找回答案和支撑答案的其他段落,让后续 AI 不只拿到答案,还能拿到验证答案所需的证据。 在 turbopuffer 设计的 context-bench 盲测中,新模型的 Answer@10 达到 45.5%,比 Voyage Context 4 高 14.4 个百分点;Evidence Recall@10 为 40.6%,高 5 个百分点。测试包含 38,894 篇长文档和 2,099 个查询,题目不公开,可以降低测试集被训练数据污染的风险。 模型目前还是 Preview 版本。Perplexity 提醒,后续权重、接口和生成的 embedding 都可能变化,所以现在生成的向量不一定能直接和未来版本混用。
740M跑手机,谷歌EmbeddingGemma 2一次搜遍文字、图片和音视频
动察 Beating AI 快讯,Google DeepMind 开源 EmbeddingGemma 2。模型只有 7.4 亿参数,可以直接处理文本、代码、图片、视频和音频,并把它们放进同一个向量空间做搜索和 RAG。上一代 EmbeddingGemma 只能处理文本。 模型也可以只加载需要的部分。只处理文本和代码时有 2.7 亿参数,加上视觉后为 4.4 亿,全部加载则是 7.4 亿。Google 在 Pixel 11 Pro 上测试,量化后文本版本最低占用约 191MB 活跃内存,完整版本约 567MB。上下文从上一代 2K 提高到 8K,一次最多可以处理约 5.5 分钟音频、29 张图片或 58 帧视频。 代码检索提升最明显。MTEB Code 得分从上一代的 68.76 提高到 78.68,多语言文本则基本持平,从 61.15 升到 61.36。模型还支持把默认 768 维向量压到 512、256 或 128 维,最低可以把向量存储空间缩到六分之一。 许可证也放宽了。上一代 EmbeddingGemma 使用 Google 自己的 Gemma 条款,EmbeddingGemma 2 改成 Apache 2.0。Google 今年发布的 Gemma 4 同样采用 Apache 2.0,最近几款开放模型对商业使用和二次开发明显更友好。
腾讯替千问先做了Qwen3.5 Embedding:2B打过Qwen3-VL 8B
动察 Beating AI 快讯,腾讯微信视觉团队开源 WeMM-Embedding,一口气放出 2B、4B、9B 三个多模态 Embedding 模型。它们基于 Qwen3.5,可以把文字、图片、视频、视觉文档统一转成向量,用于搜索、推荐和内容匹配。模型全部采用 Apache 2.0 许可开源。 有意思的是,千问自己目前还没推出 Qwen3.5-Embedding。官方现有的还是 Qwen3-Embedding 和 Qwen3-VL-Embedding,腾讯反而先拿 Qwen3.5 做出了新一代 Embedding。 成绩也挺夸张。WeMM-Embedding 2B 在 MMEB-v2 上拿到 77.9 分,已经略高于 Qwen3-VL-Embedding 8B 的 77.8 分。9B 版进一步做到 80.6 分。两者都能做文字搜视频、图片搜文字等跨模态检索,但 WeMM 换上 Qwen3.5 底座后,用更小模型做到了更高成绩。 这套模型也已经在微信内部实际使用。腾讯称,它已用于微信公众号、视频号、电商推荐和微信搜索,搜索范围还包括朋友圈。
Perplexity发布Portable Computer:跑本地模型,订阅费照收
动察 Beating AI 快讯,Perplexity 发布 Portable Computer,把整个 Computer Agent 搬到本地运行。模型、规划、工具调用、任务队列和文件搜索都在自己的电脑上完成,本地任务不再消耗 Perplexity credits。 首发支持 NVIDIA DGX Spark,可跑 Qwen 3.8 27B 和 Perplexity 后训练的 PPLX 27B。需要联网搜索、浏览器操作或更强推理时,再经用户同意调用云端 15+ 个前沿模型。 即使模型和算力都是用户自己的,Portable Computer 仍然只对 Pro 和 Max 订阅用户开放。社区已经有人吐槽:自己买机器跑本地模型,为什么还要给 Perplexity 交月费?
Haiku 5.5独立评测43分:遥遥领先GPT-6 Luna,但最高档Token消耗超3倍
动察 Beating AI 快讯,第三方评测机构 Artificial Analysis 公布 Claude Haiku 5.5 的测试结果。新模型在综合智能指数中获得 43 分,比上一代的 17 分提高 26 分。它超过 GPT-6 Luna 的 38 分、GLM-5.3 Flash 的 42 分,接近 Kimi K3 的 44 分。该指数综合了编程、专业工作、科学推理等 10 项测试。 不过,高分也伴随着大量 token 消耗。在最高推理强度下,Haiku 5.5 每项评测任务平均输出约 16.2 万 tokens,是 GPT-6 Luna 的 3.2 倍。两者基础 API 单价相同,但 Haiku 5.5 的预估单任务成本约为 0.21 美元,Luna 仅为 0.07 美元。Haiku 5.5 从次高档调至最高档,综合得分只增加 2 分,输出量却增加约 80%。 降低推理强度后,差距明显缩小。Haiku 5.5 在 high 档获得 38 分,平均每项任务输出约 5.5 万 tokens,与最高档 GPT-6 Luna 的 38 分和 5 万 tokens 接近。开发者可以通过调整推理强度,减少不必要的 token 消耗。 Haiku 5.5 也并非全面领先。在 AutomationBench-AA 自动化任务评测中,它仅得 35%,落后于 Luna 的 53%。不过,测试期间模型存在过度拒绝执行任务的问题。Anthropic 正在修复,Artificial Analysis 计划重新测试。此外,目前公布的 Haiku 5.5 任务成本尚未计入长上下文加价,实际费用可能更高。
微软要把Windows变成Agent工作台:AI能直接操作电脑,还能少花Token
动察 Beating AI 快讯,微软公布 Windows「混合智能」计划,准备让 AI Agent 直接在电脑上执行任务。获得授权后,Copilot 可以读取本地文件和近期活动,还能整理文件、排查故障、编写程序。微软演示中,它自动找齐报税材料,修改文件名、打包附件,并起草了发给会计师的邮件。 这套方案的关键,是让本地 AI 和云端 AI 配合工作。Copilot 负责接收任务,Windows 提供访问文件和执行操作的能力。部分任务可以交给电脑上的模型处理,减少云端 Token 消耗,也让敏感数据留在本地。需要更强推理能力时,再调用云端模型。 为了支撑本地运行,微软将 1370 亿参数的编程模型 MAI Code 1.1 Flash 压缩至 53GB,让它能在搭载 RTX Spark 的高性能电脑上运行。GitHub Copilot 也将通过 HydraFusion 自动选择本地或云端模型,让部分编程任务不再依赖付费的云端推理。 微软还推出 MXC 安全沙箱,限制 Agent 能访问的文件和网络,防止越权操作。目前 MXC 已正式开放。Copilot 读取本地文件、执行电脑操作等新能力,则将在未来几个月陆续登陆 Copilot+ PC。