Skip to content
所有標籤

#multi-vector

1 篇文章
ai deep-dive RAG 技法大全

ColPali:跳過 OCR,直接用圖片做文件檢索

ColPali 把 PDF 每頁渲染成圖片,用 vision-language model 產生 patch-level multi-vector embedding,用 MaxSim 做 late interaction 檢索。表格密集的金融 PDF 上 recall 從 62% 跳到 84%,完全跳過 OCR 和 chunking。代價是儲存量 ~100 倍、需要 GPU、BM25 不可用。