RAG 怎么处理 Word 和扫描 PDF:版面还原和表格通道
扫描件和 Word 为什么是另一条流水线
数字 PDF / DOCX 有文本层,可以直接抽;扫描件只有像素。混用同一套 splitter,表格会碎成乱码,页眉页脚会污染每一个 chunk。
推荐路径
- 版面还原:IBM Docling 或 Marker 转到 Markdown,保留标题层级和阅读顺序。
- 需要更稳的复杂表时,可用 LlamaParse 一类解析器做第二通道。
- 表格不要当纯文本:转 HTML 或 JSON 再入库,检索时按表通道召回。
- 低质量扫描先做倾斜校正和 OCR;置信度低的页标记「需人工」,不要静默进索引。
解析质量要用「表能不能被问出来」验收,而不是只看字符准确率。分块策略仍按系列里的 Chunking 一文,解析只负责把结构交给它。
RAG 怎么处理 Word 和扫描 PDF:版面还原和表格通道
https://lautung.com/archives/rag-word-pdf
评论