Firecrawl 开源了一个很实用的工具 pdf-inspector,专门在 PDF 进入 AI 工作流之前先做一次“体检”。
它会在本地快速判断 PDF 哪些内容能直接提取、哪些页面或区域真的需要 OCR。能读的直接转 Markdown,缺失文本的部分才交给 OCR,避免整份文档重复识别。
按照项目公布的数据,约 54% 的 PDF 根本不需要 OCR。对于做 RAG、AI 知识库、文档问答和批量 PDF 处理的人来说,能省下不少时间和成本。
GitHub:
https://github.com/firecrawl/pdf-inspector
互联网充电|优质资源
优质内容|内幕消息