先这样答
按需求选,不按新旧选。传统 OCR 是「检测加识别」的两步流水线:先在图上找到文字区域,再逐个区域认字,输出带坐标的文本,特点是快、便宜、结果确定。多模态大模型是端到端读图,能理解版面、输出结构化结果、回答和内容相关的问题,代价是更贵、更慢,而且偶尔会认错得「看起来很通顺」。
分场景看:大批量、版式固定、要精确坐标的处理,比如票据和表单流水线,传统 OCR 仍然更稳;复杂文档、手写体、弯曲文本、表格公式混排,或者目标不是认字而是理解和提取,多模态模型优势明显。实践里两者经常组合:OCR 负责定位和原始文本,模型负责理解、纠错和结构化。
收尾一句话:识别是流水线的强项,理解是模型的强项,选型先问要的是文字本身,还是文字背后的结构。
面试官会怎么追问
- 「多模态模型会认错字吗?」 会,而且错得隐蔽:它按语义补全,模糊区域可能输出一个通顺但不存在的词。传统 OCR 的错误更像碎片,容易检测;高风险场景要加校验或双通道核对。
- 「什么情况下传统 OCR 不可替代?」 要求结果可复现、延迟低、单张成本低的大规模处理,以及必须输出精确坐标的场景。模型输出有随机性,成本和延迟通常也更高。
- 「两者怎么结合?」 常见有两种:OCR 先出文本和坐标,模型在上面做理解和结构化;或者模型直出结构化结果,再用 OCR 的坐标做交叉核对,两边不一致的触发人工复查。
回答的坑
- 说「大模型全面取代 OCR」。批量、低成本、要坐标的场景,传统流水线更稳更便宜,选型看需求不看新旧。
- 只拿准确率比。成本、延迟、确定性、部署条件都是选型变量,只聊准确率说明没做过实际工程决策。
同系列的题
—— 本题完 ——