数据截至 (上游 commit 4a030776a31a)
摄取管线与树状节点模型:文件如何变成可检索的 artifact
30 秒导读: 这一章讲 PrivateGPT 的写入侧——你上传的一份 PDF / Word / Markdown, 经过「解析 → 转成一棵节点树 → 拍平 → 嵌入 → 落库」这条流水线,最终变成向量库里一堆 可被检索的片段。理解写入侧,是理解下一章检索的前提: 检索能「取回一个片段还能顺藤摸到它的上下文」,靠的正是这里种下的树结构。
本章只讲入库;一次查询怎么把片段取回来、怎么沿树展开上下文,是 02 章的事。想先看全局请回 总览。
1. 这是什么(零基础也能懂)
一句话定义: 摄取(ingestion)就是把「一份人类可读的文件」翻译成「机器可检索的向量 + 带结构的节点」,存进数据库。