核心场景:
给大模型做高质量口粮(RAG): 直接把排版乱七八糟的 PDF 扒成极其干净的 Markdown 或带坐标框的 JSON,源码出处精准定位,丢进知识库或者自动化工作流里体验极度舒适。
死磕变态排版: 遇到跨页表格、无边框表格、LaTeX 数学公式,甚至是 300 DPI 的渣画质扫描件,它都能硬啃下来并还原结构。
零成本撸无障碍文档: 把没标签的“死文档”批量自动打标,输出符合屏幕阅读器标准的 Tagged PDF(这活儿以前找人工做,一份要大几十美金)。
环境有小门槛: 机器上必须提前配好 Java 11+ 和 Python 3.10+。如果你的服务器没装 JDK,跑的时候会直接报错卡壳。