多模态多模态文档解析RAG速答 · 约 5 分钟更新 2026-09-19

表格、公式、扫描件这类复杂文档,怎么喂给大模型

一句话结论

先解析再喂:电子版抽文本层,扫描件让视觉模型直读页面图,统一整理成带结构的 Markdown 和 LaTeX,再按语义切块,不要整份原样塞进上下文。

先这样答

核心思路是先解析、再喂模型,不要把原始文件原样塞进上下文。电子版 PDF 有文本层可以直接抽取;扫描件没有文本层,要把页面渲染成图片,用多模态模型直读。两条来源最后统一整理成带结构的中间表示,比如 Markdown 正文加 LaTeX 公式,再按语义切块送进后续流程。

复杂文档的难点集中在三处。版面恢复:多栏排版要先确定阅读顺序,否则内容会拼接错乱。表格还原:模型要从二维网格恢复行列关系,合并单元格和跨页表格容易出错,产出后必须抽查核对。公式:让模型输出 LaTeX 源码而不是裁图,后续才能检索和复用。图片和图表单独提取出来,各配一句文字说明。

收尾一句话:解析质量决定上限,一份干净的结构化文本,比十倍的原始页数更有用。

面试官会怎么追问

  • 「为什么不直接抽 PDF 文本层?」 扫描件没有文本层可抽;电子版抽出来的也只是字符流,版面信息丢了,多栏和表格的阅读顺序会乱。所以解析这一步省不掉,区别只是用工具还是用视觉模型。
  • 「表格还原怎么验证对不对?」 让模型同时给出表格的行列结构描述,和内容互相印证;关键表格用第二遍独立读数核对,不一致的行标记出来人工看。逐格全检成本太高,抽检加核对是现实的折中。
  • 「解析结果怎么接 RAG?」 按语义切块,每块带上标题路径和页码这类定位信息,检索命中的片段才带得上文。表格和正文分开存放,各自用合适的切块粒度,不要混在一起切。

回答的坑

  • 整份 PDF 直接塞上下文。又贵又容易丢中段信息,先解析成结构化文本再按需取,是标准做法。
  • 忽略阅读顺序。多栏文档按错顺序读,内容会拼接错乱而且错误很隐蔽,抽查时专挑多栏页和跨页表格看。
—— 本题完 ——