PDF 提取这事,很多人第一步就跑偏了。
拿到一个 PDF,习惯性先上 OCR。遇到扫描件当然得这么干,但互联网上流转的 PDF,一大半是文字版——论文、报告、电子书导出页,文字本来就是嵌在里头的。你拿 OCR 再跑一遍,等于把已经写好的字又拍张照再认一次,平白多花时间,还容易引入识别错误。
Firecrawl 团队最近开源的 pdf-inspector,解决的就是这个前置判断问题。
它拿到 PDF 以后先做一件事:判断是文字版还是扫描版。文字版直接提取,最快 200 毫秒出 Markdown。扫描版你再走 OCR 流程,不耽误。
提取质量也不错。表格能检测,多栏排版能识别,标题层级能还原,输出的 Markdown 结构干净,不用再花功夫清理。
接口给了四套:Python、Node.js、Rust,还有浏览器端通过 WebAssembly 跑的版本。最后这个有意思,前端直接处理 PDF,不需要搭后端服务。
做文档处理或 AI 数据管线的朋友,可以拿来做 PDF 前置分类器,比统一走 OCR 靠谱得多。
项目地址:-inspector
