扫描件和 Word 为什么是另一条流水线

数字 PDF / DOCX 有文本层,可以直接抽;扫描件只有像素。混用同一套 splitter,表格会碎成乱码,页眉页脚会污染每一个 chunk。

推荐路径

  1. 版面还原:IBM Docling 或 Marker 转到 Markdown,保留标题层级和阅读顺序。
  2. 需要更稳的复杂表时,可用 LlamaParse 一类解析器做第二通道。
  3. 表格不要当纯文本:转 HTML 或 JSON 再入库,检索时按表通道召回。
  4. 低质量扫描先做倾斜校正和 OCR;置信度低的页标记「需人工」,不要静默进索引。

解析质量要用「表能不能被问出来」验收,而不是只看字符准确率。分块策略仍按系列里的 Chunking 一文,解析只负责把结构交给它。