五厂面经真题集商汤科技面经高频商汤考点模型选型视觉架构速答 · 约 5 分钟更新 2026-09-30

视觉大模型和专用小模型(检测/分割/OCR)在视觉 Agent 里怎么分工?

一句话结论

分工原则是理解归大模型、硬指标归专用模型:大模型负责语义理解和跨模态推理,检测分割 OCR 这类精度敏感、吞吐敏感的环节用专用模型,两层用结构化中间表示衔接。

视觉大模型和专用小模型(检测/分割/OCR)在视觉 Agent 里怎么分工?

先这样答

分工的判断标准是任务对「理解」和「硬指标」的侧重。语义理解、指令关联、推理规划交给视觉大模型:用户说「帮我把这张图里最贵的那个商品找出来买掉」,需要的是价格文字识别加商品语义比较加购物流程规划,这是大模型的主场。精度和吞吐敏感的环节用专用模型:目标检测要毫秒级响应和稳定的框精度,工业质检要可复现的分割边界,海量文档要做每秒几十页的 OCR,专用小模型在这些指标上又快又稳又便宜。

两层之间的衔接靠结构化中间表示:专用模型输出 JSON 化的检测结果(类别、坐标、置信度),大模型基于这些结构化事实做推理,而不是从原始像素重新理解一遍。反过来,大模型的语义判断也可以触发专用模型的定向调用,比如大模型决定「先找到所有输入框」,由检测模型去执行。

这个架构的工程收益是明确的。专用模型可以独立迭代、独立扩容,大模型换版本不影响检测精度。成本上,专用模型处理一次调用以毫秒和分钱计,把大模型的算力留给真正需要推理的步骤。

面试官会怎么追问

  • 「为什么不端到端全用大模型?」 三个代价:延迟,大模型单次推理秒级,流水线里串多个视觉环节延迟叠到不可用;成本,高频调用下大模型成本高出几个数量级;稳定性,大模型输出的坐标和类别缺少硬保证,关键环节不敢托付。
  • 「中间表示为什么要 JSON 化?」 大模型消费结构化数据的可靠性远高于消费自由文本,字段明确、类型固定,出错了容易校验。专用模型的输出直接是张量和框,转成 JSON 才能进大模型的上下文。
  • 「大模型判断错了触发错检测怎么办?」 给专用模型的调用参数加合法性校验(类别在白名单内、区域在图内),检测结果回传后大模型做一次闭环确认。把两层的错误都拦在流水线内部,不流到用户面前。

回答的坑

  • 把分工说成「大模型万能、小模型淘汰」。说出各自的不可替代指标,才是真理解选型。
  • 不讲中间表示和错误闭环。分层架构的价值恰恰在衔接层的工程设计上。
—— 本题完 ——