很多 PDF 明明自带文字层,却还在傻傻跑 OCR,不仅慢,还白烧 Token 和算力。
Firecrawl 开源了一个很实用的工具 pdf-inspector,专门在 PDF 进入 AI 工作流之前先做一次“体检”。
它会在本地快速判断 PDF 哪些内容能直接提取、哪些页面或区域真的需要 OCR。能读的直接转 Markdown,缺失文本的部分才交给 OCR,避免整份文档重复识别。
按照项目公布的数据,约 54% 的 PDF 根本不需要 OCR。对于做 RAG、AI 知识库、文档问答和批量 PDF 处理的人来说,能省下不少时间和成本。
GitHub:
https://github.com/firecrawl/pdf-inspector

互联网充电优质资源
优质内容内幕消息
 
 
Back to Top