Q25: 如果要做电商agent,你会选择哪些模态的信息作为输入?比如文本评论、图像、视频、购买记录?**
P1 · agent_architecture
🏷 标签:multimodal, e-commerce, fusion, recommendation, agent
1️⃣ 考察意图
面试官想看你能否从“Agent 系统设计”而非“单模型调参”的视角,权衡多模态输入的实用性与成本。考察类型是系统设计 + 工程取舍。刁钻点在于:不是让你罗列模态,而是让你在有限算力、数据可得性和隐私约束下,为电商 Agent 设计一个可落地的多模态融合方案。答好了能展示你对多模态融合(早期/晚期/跨模态注意力)的工程理解、对电商业务指标(CTR、转化率、GMV)的敏感度,以及处理脏数据(如评论噪声、图片水印)的实战经验。
2️⃣ 标准答
我会从模态选择、融合策略、工程落地三个层面展开。
一、模态选择与信号提取
电商 Agent 的核心目标是辅助决策(推荐、搜索、问答),所以输入模态必须能捕捉用户意图和商品属性。我选以下四种,按优先级排序:
- 购买记录(最高优先级):这是最直接的强信号。包含用户历史购买类目、复购频率、价格区间。坑:购买记录需严格脱敏(如差分隐私),且不能直接用于冷启动用户。解法:对历史序列做 session-based 编码(如 GRU4Rec),只输出行为 embedding,不暴露原始 ID。
- 文本评论:提供情感倾向和细粒度属性(如“面料柔软但掉色”)。用 BERT 或 RoBERTa 提取评论 embedding,但注意评论噪声(刷单、无意义短评)。解法:用 TF-IDF 过滤高频无意义词,再对长评论做 chunking 后取平均池化。
- 商品图像:展示外观、颜色、款式。用 CLIP 或 SigLIP 提取视觉 embedding。取舍:CLIP 的 ViT-L 模型参数量大(~300M),对实时推理不友好。实际落地用轻量版(如 MobileCLIP)或对图像做预处理(统一 224x224,去水印)。
- 视频(可选):动态展示使用场景(如穿搭效果)。但视频数据量大、标注成本高。工程取舍:只在高客单价商品(如电子产品、家具)启用视频模态,用 I3D 或 VideoMAE 提取关键帧 embedding,而非全视频流处理。
二、融合策略:按场景选型
不是所有场景都适合复杂融合。我分三种情况:
- 早期融合(Early Fusion):适合特征维度一致、输入对齐的场景。例如,将文本评论 embedding 和图像 embedding 直接拼接,输入一个 MLP 做分类。优点:简单、训练快。缺点:模态间交互弱,容易过拟合到强模态(如购买记录)。
- 晚期融合(Late Fusion):各模态独立编码后,加权投票或门控网络融合。例如,购买记录用 GRU,文本用 BERT,图像用 CLIP,各自输出 logits,再用一个可学习的权重层(如 softmax 门控)加权求和。优点:模块化,可单独替换/升级模态模型。缺点:忽略模态间细粒度交互(如“评论中提到的颜色”与“图像中的颜色”是否一致)。
- 跨模态注意力(Cross-Attention):用 Transformer 的交叉注意力层让模态间互相“看”对方。例如,将图像 patch embedding 作为 query,文本 token embedding 作为 key/value,输出融合特征。优点:捕捉细粒度对齐(如“红色连衣裙”匹配图像中的红色区域)。缺点:计算量 O(N²),对长文本/高分辨率图像不友好。实际落地:只在 rerank 阶段用,粗排阶段用晚期融合。
三、实际落地的坑与解法
- 数据对齐问题:同一商品在不同平台(淘宝、Amazon)的评论、图片、视频可能 ID 不统一。解法:用商品标题 embedding 做模糊匹配,建立统一商品 ID 映射表。
- 模态缺失:新商品可能只有图片没有评论。解法:训练时用 mask 策略(随机丢弃某模态),推理时用模态缺失 embedding(可学习向量)填充。
- 计算成本:全模态推理延迟可能 >500ms,无法满足实时推荐。解法:离线预计算所有模态 embedding,存入向量数据库(如 Milvus),在线只做 embedding 检索和轻量融合(如晚期融合的加权求和)。
总结:电商 Agent 的模态选择不是越多越好,而是根据业务场景(冷启动/热启动、高客单价/低客单价)动态调整。核心原则是:用最少的计算成本,捕获最有效的信号。
3️⃣ 答题模板(30 秒电梯版)
“这个问题我从模态选择、融合策略、工程落地三个层面回答。模态上,我优先选购买记录(强信号),其次文本评论(细粒度属性)和图像(外观),视频只在高客单价场景启用。融合策略上,粗排用晚期融合(模块化、易替换),精排用跨模态注意力(捕捉细粒度对齐)。工程落地关键是处理模态缺失、数据对齐和计算成本,比如离线预计算 embedding 存入向量库,在线只做检索+轻量融合。总结一句:电商 Agent 的模态设计要遵循‘信号强度优先、计算成本可控、业务场景适配’原则。”
4️⃣ 高频追问 & 应对
追问 1:如果用户只有购买记录,没有评论和图片,你怎么做推荐?
这是冷启动场景。解法:用购买记录做序列推荐(如 SASRec),提取用户行为 embedding。同时,利用商品标题的文本 embedding(用 Sentence-BERT 预计算)作为商品侧特征。如果连标题都没有,就用商品类目 ID 做 one-hot 编码,配合协同过滤(ItemCF)。核心取舍:冷启动时放弃多模态,专注行为序列,因为行为数据比内容数据更可靠。
追问 2:你怎么评估多模态融合比单模态好?具体指标是什么?
离线指标:CTR(点击率)、CVR(转化率)、AUC(ROC 曲线下面积)。多模态模型相比单模态(仅购买记录)通常能提升 CTR 2-5%(Amazon 数据集上的公开结果)。在线指标:GMV(商品交易总额)、用户停留时长。注意:多模态模型可能引入噪声(如图片水印干扰),所以需要做 A/B 测试,观察 7 天内的用户留存率,避免短期 CTR 提升但长期用户疲劳。
追问 3:视频模态计算成本高,你怎么决定是否启用?
用 ROI 公式:视频模态带来的 GMV 提升 / 视频处理的额外计算成本。如果提升 < 成本,就不启用。具体做法:先在小流量(5%)上做 A/B 测试,对比有/无视频模态的 CVR 和延迟。如果 CVR 提升 > 1% 且延迟增加 < 200ms,才全量上线。另外,视频模态只对高客单价商品(>500 元)启用,因为这类商品用户更愿意花时间看视频。
5️⃣ 避坑 · 常见错误答法
- ❌ “我会把所有模态都输入模型,用 Transformer 做端到端融合,效果肯定最好。” → ✅ “模态不是越多越好,要考虑数据可得性和计算成本。我会按信号强度排序,优先用购买记录,视频只在高客单价场景启用,并做离线预计算降低在线延迟。”
- ❌ “多模态融合就是拼接特征,没什么技术含量。” → ✅ “融合策略有早期、晚期、跨模态注意力三种,各有 trade-off。粗排用晚期融合(模块化),精排用跨模态注意力(细粒度对齐),不能一概而论。”
- ❌ “用户隐私不重要,直接用原始购买记录训练模型。” → ✅ “购买记录必须脱敏,用差分隐私或 session-based 编码,只输出行为 embedding,不暴露原始 ID。这是合规红线。”
6️⃣ 简历呼应
- 如果你有电商推荐项目:从“多模态融合在商品推荐中的实际效果”切入,强调你如何用 CLIP + BERT 做特征提取,并在 Amazon 数据集上对比了早期/晚期融合的 CTR 提升(比如 3%)。可以提到你处理过模态缺失问题(如新商品无评论)。
- 如果你只做过传统 NLP:用“文本评论情感分析”类比多模态融合。比如,你做过 BERT 做情感分类,现在扩展到图像+文本,核心思路类似:先提取特征(文本 embedding + 图像 embedding),再融合(拼接或注意力)。可以强调你理解 embedding 对齐(如 CLIP 的对比学习)。
- 如果你是校招无项目:聚焦论文复现 demo。比如,你复现了 CLIP 的零样本分类,并尝试在电商图片上做迁移学习。可以提到你了解跨模态注意力的计算复杂度 O(N²),并思考过如何用稀疏注意力优化。
7️⃣ 延伸阅读
- 《CLIP: Learning Transferable Visual Models From Natural Language Supervision》
- 《SigLIP: Sigmoid Loss for Language Image Pre-Training》
- 《SASRec: Self-Attentive Sequential Recommendation》
- 《VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training》
- Milvus 向量数据库官方文档:多模态 embedding 检索最佳实践