互联网从业者充电站
3 小时前
厂商技术手册这类几百页的数字原生 PDF 结构复杂、图文混排,常规转换工具难以稳定输出可进 RAG 流程的 Markdown,该工具在不依赖 OCR 和模型的前提下完成结构还原。
https://github.com/crunz-ai/nativePDF-structurer
这是一个纯 Python 写的数字原生 PDF 结构化工具,盯的场景是设备操作手册、维修手册、选型手册这类长文档。它用 PyMuPDF 读出文字、字体、坐标、图片对象和矢量路径,然后重建阅读顺序、章节层级、表格和视觉区域,OCR、GPU、VLM 一概不需要。
互联网充电
|
优质资源
优质内容
|
内幕消息
Home
Powered by
BroadcastChannel
&
Sepia