PuppyIP 资源中心
AI 工具动态 5 分钟 发布于 2026-10-08

Perplexity 新嵌入模型:0.6B也能检索9B的PDF索引?

可以:用9B模型为文档建库,再用0.6B处理实时查询,是这次发布支持的组合。PDF页面还能以图像参与检索,省去先做OCR的路径;真正要重新考虑的是多向量索引和服务成本。

Perplexity pplx-embed-v2-late 多模态检索 PDF 嵌入模型

服务对象与地域限制

PuppyIP 仅面向海外合规企业及其授权人员提供服务,不面向中国大陆地区开放或提供代理服务。本服务仅限用于中国大陆境外的合法业务活动,严禁在中国大陆境内使用本服务。

代理 IP 或服务器位于境外,不改变上述限制。不得通过中转、转接、共享或转售向中国大陆境内的最终使用者提供本服务。使用前请阅读用户服务协议。

本文要点

  • Perplexity 已公开 pplx-embed-v2-late 的0.6B与9B权重,官方模型卡标注MIT许可。
  • 两个模型共享表示空间,可让0.6B查询9B索引;这不代表任意旧嵌入模型或单向量库直接兼容。
  • 支持文本、图片与视觉文档检索;PDF需先渲染为页面图像,无OCR不等于省去全部预处理。
  • 多向量保留更多细节,也增加存储和候选评分成本;API支持仍属逐步开放计划,当前价格与入口未核实。

大模型建库,小模型查询,这次能分开选了

Perplexity 官方账号在2026年10月7日发布 pplx-embed-v2-late,并关联官方研究说明。当前博客标题区和文末引用日期都写10月7日;这是此次公开消息的日期,模型文件创建日不等于发布日期。

新模型有0.6B和9B两档。嵌入模型的工作是把内容变成可比较的表示,用来找到相关资料;它本身不是负责写最终答案的聊天模型。两档既可各自使用,也能跨模型搭配。

最直接的变化是:文档在离线阶段由9B建立索引,实时提问由0.6B编码,再搜索同一索引。建库可以集中计算,查询却往往需要低延迟,团队现在能分别选择两侧的成本。

PDF不用OCR,仍然要把页面变成图像

传统流程常先用OCR把扫描页转成文字,再做检索。OCR就是从图片识别文本;识别错误或版面丢失,会影响表格、图表和文字之间关系的保留。新模型支持用文本问题直接检索渲染后的页面图像。

这条路径绕过先提取文字的步骤,但不是直接把任意PDF文件交给聊天框。仍需完成页面渲染、输入处理、文档编码、建索引和检索;找到了页面之后,若要生成答案,还需要后续读取与回答环节。

以下是未执行的假设场景:你有一组含图表和表格的产品说明书,希望找出某个规格对应的页面。可将页面图像建立索引,再用文字问题搜索,并返回原页供核对;它不保证每张低清扫描页都能准确命中。

为什么不能直接塞进原来的单向量库?

单向量检索把一段内容压成一个向量。pplx-embed-v2-late 则保留多个 token 对应的128维向量,再使用 MaxSim 评分:问题的每个部分寻找文档中最接近的部分,最后汇总匹配程度。

这种 late interaction 方式让不同细节能分别参与匹配,也意味着存储和评分方式不同。官方明确提醒,多向量随文档长度增长,会增加索引存储与候选评分成本;参数小不等于整个检索系统一定省内存。

共享空间指这里发布的0.6B和9B模型之间兼容,不是所有模型通用。已有单向量ANN索引不能仅更换模型名就假定继续工作,应先确认多向量支持、评分流程和重建方式,再决定迁移范围。

怎样选择0.6B、9B,或大小模型搭配?

希望全部在本地处理,可先考虑文档与查询都使用0.6B;有更充足的查询计算资源,则可比较两侧都用9B。需要控制实时查询开销时,9B建库、0.6B查询是官方支持的第三种组合。

官方评测报告中,大小模型搭配优于两侧都用0.6B,但两侧都用9B仍有质量优势。这是发布方在其数据集和流程下的结果,不是你自己的召回率、延迟或费用保证;选择取决于资料类型和实际约束。

可以先用有权处理的一小组文本、扫描页和图片,列出预期命中的页面。比较三种组合的命中、误检、索引体积和查询耗时,再估算完整资料库,而不是只看参数量或排行榜。

模型卡没有给出所有设备通用的最低显存或硬件要求。0.6B适合较轻查询部署的设计目标,不等于任何手机都能顺畅运行;本文没有下载权重或进行设备实测。

权重已经公开,API却还不能当成现成入口

两份官方Hugging Face模型卡已公开可读,权重项目非私有、非gated,许可标注MIT。使用前仍应核对模型与相关依赖的许可;公开权重和免费获得算力、托管服务,是不同的事。

当前官方兼容说明要求 sentence-transformers 至少6.0.0、transformers 至少5.4.0。模型卡提供文本与图像编码示例,但不支持将文本和图片混成同一个输入;应按对应输入路径分别处理。

官方博客把 Perplexity API Platform 的 late-interaction、dense和contextual嵌入支持写成逐步推出计划。本文没有核实到这两档模型当前可调用的正式API地址、价格和账户资格,不能把其他Search API的费用套到它们身上。

准备接入的下一步可以先看文末两份模型卡,明确采用本地权重还是等待托管API。若走本地路径,让负责检索系统的开发者确认索引和运行环境;若等API,则以实际开放文档和账单规则为准。

资料来源

常见问题

这个模型会自己生成PDF答案吗?

它主要提供检索表示,帮助找到相关内容。生成答案通常还有另一个模型和证据读取流程;检索到了页面,不等于答案已经正确或有完整引用。

选择本地模型,资料就一定不会离开设备吗?

是否上传取决于整个部署:编码、索引、检索与后续回答分别在哪里运行。官方支持本地方案,也讨论本地与云端组合;选择0.6B不能自动证明所有数据处理都在本地。

有些问题同时包含图片和文字怎么办?

当前模型卡不支持混合文本加图像作为同一个输入。先明确分别编码和检索的产品流程,不把另一模型的交错多模态能力当成本模型已支持;后续能力以新官方文档为准。