返回探索
资讯VibeFix 编辑部更新于 2026年10月8日

文档解析也有自己的「OpenRouter」了:LlamaIndex OpenDocRouter 把 10 个模型塞进一个 API

LlamaIndex 10 月 7 日发布 OpenDocRouter:一个 POST /v1/parse 接口后面挂着 10 个文档解析模型,5 个前沿闭源加 5 个开源,任意切换。配套的 ParseBench 基准显示:Claude Opus 5.5 总分 84.20,每千页 48.82 美元;GPT-6 Luna 71.34 分,每千页只要 0.80 美元——60 倍价差,14 分差距。文档解析第一次有了公开透明的质量—成本菜单。

手绘风格示意图:放大镜扫过布满 OCR 识别框的文档,箭头指向表格结构化结果

2026 年 10 月 7 日,LlamaIndex 在 LinkedIn 上公布了一个新产品:OpenDocRouter。第一眼看名字,你可能以为这又是某个解析器的升级款,但它干的事完全不一样——把 10 个文档解析模型塞进同一个 POST /v1/parse 接口后面,开发者用一个 API key,就能在 10 个模型之间任意切换。

这个玩法你肯定眼熟:OpenRouter 对大语言模型做的事,OpenDocRouter 正在对文档解析做。过去一年,RAG 应用最大的痛点不是检索算法,而是第一步——把 PDF、扫描件、财报表格变成干净文本。这一步又脏又贵,而且每个解析服务商的接口都不一样,换一家等于重写一遍接入代码。LlamaIndex 这次等于宣布:解析模型也可以像 LLM 一样,被当成可替换的商品来路由。

这不是解析器,是解析界的 OpenRouter

先把产品形态说清楚。OpenDocRouter 不是第 11 个解析模型,而是一个统一路由层:请求打到 POST /v1/parse,你在参数里指定用哪个模型,后面真正干活的可以是 10 个模型中的任意一个。

10 个模型的名单值得逐个看。前沿模型 5 个:Claude Opus 5.5、Gemini 3 Flash、Gemini 3.8 Flash、GPT-5.6 Terra、GPT-6 Luna。开源模型 5 个:Infinity-Parser2-Flash、MinerU2.5-Pro、TeleOCR、dots.mocr、PaddleOCR-VL-1.6。这个组合很有讲究——一边是最贵的闭源旗舰,一边是社区里口碑最好的开源解析器,中间还夹着几个轻量 Flash 级别模型。换句话说,从「不计成本要最好」到「能省则省」,光谱的两端都被覆盖了。

它解决的是一个真实存在的切换成本问题。此前你要对比两个解析服务的效果,得分别注册、分别接 SDK、分别处理返回格式的差异,最后多半因为懒而停在第一个试用的上面。统一接口之后,对比变成改一个参数的事,AB 测试的成本趋近于零。这对独立开发者和小团队尤其友好——你终于可以用和大厂一样的姿势做选型:先全量跑一遍,看效果和账单,再决定。

60 倍价差、14 分差距:ParseBench 把成本谈判摆上台面

和产品一起发布的还有 ParseBench,一个解析基准测试:约 2000 页经过人工校验的企业真实文档,16.9 万条校验规则。企业文档这个定语很关键——它测的不是干净的学术论文,而是财报、合同、发票这种版式混乱、表格嵌套的真家伙。

分数出来之后,最有意思的不是谁第一,而是价格和分数的对照表。Claude Opus 5.5 总分 84.20,表格项 93.53,断层领先,但价格是每千页 48.82 美元。GPT-6 Luna 总分 71.34,每千页只要 0.80 美元。开源的 MinerU2.5-Pro 总分 70.05,每千页 0.86 美元。算一下:60 倍的价差,换来的分数差距是 14 分。

这个数字值得每个做 RAG 的人停下来想一想。你的场景真的需要那 14 分吗?如果是财报关键数字的抽取,表格项 93.53 对 70 出头可能是天壤之别,48 美元花得值。但如果是把 10 万页内部 wiki 灌进向量库做语义检索,70 分和 84 分的下游差距可能根本测不出来,而账单差了 60 倍。OpenDocRouter 的真正价值不在路由本身,而在它第一次把「质量—成本」这张菜单公开透明地摆了出来:你不用再靠销售话术和博客 benchmark 猜,官方直接把价格和分数钉在一起。

一个务实的分层策略已经呼之欲出:大批量、低敏感的文档走 MinerU2.5-Pro 或 GPT-6 Luna 这类便宜模型;表格密集、数字敏感的财报合同,单独路由给 Claude Opus 5.5。按文档类型分流,而不是一刀切选一个模型——这才是路由层该有的用法。

计费和隐私:按 token 收、前沿模型不加价、失败免费

计费设计有几个细节能看出 LlamaIndex 在讨好开发者。第一,按 token 计费,而不是简单粗暴的按页打包价——解析结果的 token 量和你实际拿到的内容挂钩,账算得更细。第二,前沿模型 at-cost,不加价:Claude、GPT 这些闭源模型的调用成本是多少就收多少,LlamaIndex 不在中间抽成。第三,充值只收 5% 手续费。第四,失败的、缓存命中的、空白页,全部免费。

最后一条很容易被忽略,但它恰恰是解析场景里最实在的省钱项。真实世界的文档集合里,空白页、重复上传、解析失败重试是家常便饭,按页计费的模式下这些全是冤枉钱。失败免费加上按页独立计费的重试机制,等于把「重试」这个动作的成本打到了零——你终于可以放心地对解析失败的页面重试三次,而不是在心里默算账单。

隐私侧的承诺同样直接:文档默认不留存。解析用的缓存只保留 24 小时、加密存储、随时可删。对处理合同、病历、财务数据的团队来说,「默认不留存」四个字比任何合规徽章都管用——数据不落盘,就没有泄露面。当然,缓存 24 小时意味着重复解析同一文档可以命中缓存免费,这和上面的失败免费是一套逻辑:为真实工作流省钱。

自研 grounding 引擎:layout:true 让每段文字都有坐标

除了路由,OpenDocRouter 还塞了一个自研的 grounding 引擎:请求里加上 layout: true,返回结果里每段文字都会带上 bounding box(坐标框),外加 17 类版式标签描述的文档结构——标题、表格、页眉页脚、列表、图片说明,各归其位。

为什么这事重要?因为 RAG 的引用体验,差就差在 grounding 上。「答案来自第 5 页」和「答案来自第 5 页这个红框里」,对用户是两种信任等级。前者你还得自己翻,后者直接高亮定位。版式标签的价值在表格和嵌套结构上最明显:解析器知道这是一张表格、那是表格的表头,下游做结构化抽取时就不用再猜。

说句判断:路由层谁都能抄——无非是统一接口加模型列表。但把 bounding box 级别的 grounding 做进解析输出,并且和 10 个模型的输出格式对齐,这才是 OpenDocRouter 真正的护城河。模型会换代、价格会波动,一个稳定、高精度的版式理解层才是长期资产。

和 LlamaParse 的分工:一个管快,一个管精

很多人第一个问题是:那 LlamaParse 怎么办?LlamaIndex 给出的分工很清晰:OpenDocRouter 负责快速接入和自由路由,LlamaParse 继续做企业级调优和 schema 抽取。

翻译一下:你要快速验证想法、对比模型效果、不想被锁定,用 OpenDocRouter;你的生产系统需要针对特定版式微调、需要把解析结果直接抽成严格 schema(比如发票字段、合同条款),那是 LlamaParse 的活。这不是左右手互搏,而是把「实验层」和「生产层」拆成了两个产品。对 LlamaIndex 来说,OpenDocRouter 是获客漏斗的入口——先用路由把你圈进来,重度用户自然会沉淀到 LlamaParse。

工程上的约束也一并给了出来:单次请求 50MB、500 页上限;50 页以内同步返回,超过走异步;按页独立计费和重试。这些数字说明它从第一天就是按生产 workload 设计的,不是 demo 玩具。

竞争格局也值得看一眼。文档解析赛道这两年其实不缺玩家:Azure Document Intelligence、AWS Textract 这些云大厂方案胜在生态绑定;Unstructured、Reducto 等创业公司靠特定场景的精度吃饭。OpenDocRouter 的打法和它们都不一样——它不跟你拼某一个模型的精度,而是把「选择权」本身产品化。当 10 个模型的价格和分数都被摆上台面,竞争就从「谁解析得更准」变成了「谁的路由更聪明、账单更透明」。这个维度上,先把菜单做出来的人,天然就占了定义权。

我们的判断:RAG 里最脏最贵的活,第一次有了公开菜单

回到开头那个观点:RAG 整条链路里,文档解析是最脏、最贵、也最被低估的一环。脏在版式千奇百怪,贵在好模型按页收费不眨眼,被低估在大家总把精力花在检索算法上,却没想到第一步丢掉的信息后面再也找不回来。

OpenDocRouter 的意义不在技术,而在市场结构。它把解析从「选一家供应商、签一年合同」的重决策,变成了「改个参数、按页付费」的轻决策。60 倍价差只差 14 分这件事被公开钉在基准测试里之后,任何解析服务商都很难再靠信息差赚钱——这对买方是纯利好。

给开发者的实操建议就三条。第一,现在就把解析层抽象在路由接口后面写,别把某个具体服务的 SDK 写进业务代码——不管你用不用 OpenDocRouter,可替换性本身就是资产。第二,上线前用 ParseBench 这类基准在自己的文档上实测,别信通用的分数,你的版式才是你的真相。第三,建立按文档类型分流的习惯:便宜模型处理大头,贵模型只处理值得的 5%。解析的成本优化,未来会和 LLM 的路由优化一样,成为 RAG 工程的标准动作。

Unite.AI 在 10 月 7 日的报道中也交叉确认了这次发布的核心信息。对出海团队来说,按 token 计费和文档默认不留存这两条,也直接降低了合规审计的解释成本。对 LlamaIndex 来说,这一步走得不意外——从 LlamaParse 到 OpenDocRouter,它正在把自己从「一个解析工具」变成「文档智能的基础设施层」。RAG 的军备竞赛,下半场拼的可能不是谁的模型更大,而是谁的管线更便宜、更透明、更好换。

原始来源

浏览项目广场发布你的项目

相关文章

笔记本电脑屏幕上显示着浏览器中的网站注册页面
资讯
ChatGPT Sites 冲上 HN 热榜:提示词建站,到底是玩具还是生产力?

10 月 3 日,Sites in ChatGPT 以约 209 点赞、218 评论冲上 HN 前页。这不是发布,而是一场清算:提示词直达 URL,到底是玩具、原型托管,还是生产力?四个争论焦点、文档实锤的技术事实(D1/R2、登录、自定义域名),以及给 vibe coder 的三个判断。

AI 编程实践产品发布独立开发
Google 开发者文档变成结构化 API,向 AI 编程 Agent 输送最新知识
资讯
别再让 Agent 背过期文档写代码:Google 把官方文档变成 API,gcloud 一行查、Skill 一行装

2026 年 10 月 7 日,Google Developers 发布 Developer Knowledge API 生态:Google Cloud、Firebase、Android 等官方文档变成程序化事实来源,配 gcloud CLI 入口、官方 Agent Skill(一行安装)、MCP server 和多语言客户端库。为什么「文档 API 化」能连根拔掉 vibe coding「模型记错 API」的经典翻车。

AI 编程实践开发工作流产品发布