先这样答
核心思路是先解析、再喂模型,不要把原始文件原样塞进上下文。电子版 PDF 有文本层可以直接抽取;扫描件没有文本层,要把页面渲染成图片,用多模态模型直读。两条来源最后统一整理成带结构的中间表示,比如 Markdown 正文加 LaTeX 公式,再按语义切块送进后续流程。
复杂文档的难点集中在三处。版面恢复:多栏排版要先确定阅读顺序,否则内容会拼接错乱。表格还原:模型要从二维网格恢复行列关系,合并单元格和跨页表格容易出错,产出后必须抽查核对。公式:让模型输出 LaTeX 源码而不是裁图,后续才能检索和复用。图片和图表单独提取出来,各配一句文字说明。
收尾一句话:解析质量决定上限,一份干净的结构化文本,比十倍的原始页数更有用。
面试官会怎么追问
- 「为什么不直接抽 PDF 文本层?」 扫描件没有文本层可抽;电子版抽出来的也只是字符流,版面信息丢了,多栏和表格的阅读顺序会乱。所以解析这一步省不掉,区别只是用工具还是用视觉模型。
- 「表格还原怎么验证对不对?」 让模型同时给出表格的行列结构描述,和内容互相印证;关键表格用第二遍独立读数核对,不一致的行标记出来人工看。逐格全检成本太高,抽检加核对是现实的折中。
- 「解析结果怎么接 RAG?」 按语义切块,每块带上标题路径和页码这类定位信息,检索命中的片段才带得上文。表格和正文分开存放,各自用合适的切块粒度,不要混在一起切。
回答的坑
- 整份 PDF 直接塞上下文。又贵又容易丢中段信息,先解析成结构化文本再按需取,是标准做法。
- 忽略阅读顺序。多栏文档按错顺序读,内容会拼接错乱而且错误很隐蔽,抽查时专挑多栏页和跨页表格看。
同系列的题
—— 本题完 ——