很多 PDF 本身就带文字层,再跑一遍 OCR 其实是重复处理。
Firecrawl 开源的 pdf-inspector 会先在本地检查 PDF 类型,几十毫秒判断哪些能直接提取,哪些页面或区域才需要 OCR。能读的转 Markdown,缺文本的再识别。
👉
他们自己的数据里,约 54% 的 PDF 不需要 OCR。
适合拿来给 AI 知识库、文档问答做 PDF 预检。
@https1024
 
 
Back to Top