数据截至 (上游 commit 4fe4bde114a2)
MinerU 是什么 + 全景 + 阅读地图
30 秒导读: MinerU 是一个文档解析引擎——把 PDF、DOCX/PPTX/XLSX、图片这些"人看得懂、机器读不整齐"的文件,转成干净的 Markdown / 结构化 JSON,专供 LLM、RAG、Agent 消费。它的核心设计:无论用哪种解析方法,中间都收敛到同一份中间表示
middle_json,再由同一个渲染出口吐出多种格式。方法本身可插拔——传统流水线、视觉大模型、二者混合,加上 Office 文件的直接解析,四条路各司其职。
1. 这是什么(零基础也能懂)
一句话定义: MinerU 把各种文档"翻译"成 LLM 能吃的结构化文本(Markdown / JSON)。
解决什么问题 / 给谁用。 假设你在做一个 RAG 知识库,手里有一堆 PDF——有的是扫描件、有的是双栏排版、有的满页公式和表格。直接把 PDF 的字节丢给大模型是没用的:公式变乱码、表格错位、页眉页脚混进正文、阅读顺序全乱。MinerU 就是站在你和大模型之间的那一层:它先把文档读懂(版面、阅读顺序、公式、表格、图),再输出成排好序、去掉页眉页脚、公式转 LaTeX、表格转 HTML 的 Markdown。