文档解析这块最脏最累的活,LlamaIndex 打算用一个接口收掉。新发布的 OpenDocRouter 允许你把 PDF、PNG、JPEG,甚至一个 URL 直接丢进去,吐出来就是 markdown。它没有自己去训解析模型,而是搭了一层路由——请求按规则分发给不同的解析引擎。
接入的后端一共十个。前沿模型这边有 Claude Opus 5.5、Gemini 3 Flash、GPT-6 Luna 等 5 个,开源这边是 MinerU2.5-Pro、PaddleOCR-VL-1.6 等 5 个。同一个 API 调用,返回格式统一。这个设计的价值不在于支持了多少模型,而在于版面复杂的扫描件和排版干净的电子文档,本来就不该用同样的成本去处理。
真正被戳中的痛点在 RAG 流水线的上游。解析错一步,后面检索和生成全跟着错,还特别难排查。把这一层抽出来之后,团队可以按精度、速度和单页成本动态切换后端,顺带做横向评测。至于路由策略够不够聪明、某个模型版本抖动时输出稳不稳定,答案还得看真实文档跑出来的数据。

