数据截至 (上游 commit c412a093a820)
双通道检索与精读:VideoRAG 的价值核心
本章讲
videorag_query(_op.py:580)——提问进来后,怎么从两套索引里召回片段、怎么过滤、怎么「精读」、怎么生成带时间戳的答案。这是整个框架最有含金量的一段。
3.1 为什么要「双通道」
它要解决的小问题: 一个问题里既有「语义/实体」成分(「老师讲了哪个算法」),也有「视觉/场景」成分(「画面里出现了什么动物」)。单一检索通道照顾不全。
思路: 同一个问题,改写成两种检索句,分别走两条通道:
| 通道 | 改写成什么 | 拿什么去检索 | 召回什么 |
|---|---|---|---|
| 实体(图谱)通道 | 陈述句 | 实体向量库 → 图谱反查 | 文字相关的视频段 |
| 视觉通道 | 场景描述句 | ImageBind 片段向量库 | 画面相似的视频段 |
| naive 通道 | 原问题 | 文字 chunk 向量库 | 直接当上下文的文字块 |
两通道召回的片段取