目录
AgentAlpha
· 面试间
← 返回主站
目录
开始
面试间首页
模拟面试 · 抽题自测
简历体检
系统学习
LLM 基础概念
209
RAG 检索增强
609
Agent 架构
275
工具调用
106
多智能体
94
记忆系统
7
评测与可观测
107
项目实战与企业级
797
训练与微调
334
推理与部署
23
多模态
68
提示工程
8
安全与合规
8
五厂面经真题集
217
题库与工具
速答题库
术语表
五厂真题集
学习路线
Agent 应用开发
RAG 工程师
LLM 应用开发
AI Infra
按公司刷
百度
76
美团
70
字节跳动
64
腾讯
62
阿里巴巴
51
拼多多
14
小红书
7
滴滴
5
快手
5
DeepSeek
4
蚂蚁集团
3
小米
3
项目面试包
企业知识库 RAG 助手
Text2SQL 数据查询 Agent
数据分析 Agent(ChatBI)
题目来自公开面经与社区真实面经
持续更新 ·
agentalpha.top
首页
/
面试间
/
大厂真题库
/
多模态算法
岗位方向 · TRACK
多模态算法面试题
视觉语言模型与多模态:融合架构、CLIP 系、VLM 评估与训练。
6 道题 · 题目口径为公开面经与岗位 JD 的高频归纳
Q · 多模态融合有哪几种方式?各是什么思路?
多模态融合分为早期、中期和晚期三种。早期在特征层合并,保留信息多但对齐难;中期在中间层注意力交互,是当前主流;晚期在决策级合并,实现简单但易丢失交互信息。
查看答案 →
Q · CLIP 的原理是什么?对齐损失怎么工作的?
CLIP 采用双塔架构,分别用图像和文本编码器提取特征,通过对比学习拉近正样本对、推开负样本对。对齐损失使用对称的 InfoNCE,计算双向交叉熵。
查看答案 →
Q · ViT 和 CNN 的区别?各自优劣?
CNN 依赖局部感受野与权重共享,归纳偏置强,对小数据友好。ViT 将图像切块作 token 序列,用全局注意力,大数据下上限更高。工程上 ViT 与大模型架构统一,多模态融合更顺畅。
查看答案 →
Q · BLIP、BLIP-2 和 Flamingo 的区别是什么?
核心区别在于冻结策略与连接方式。Flamingo 冻结视觉编码器并插入交叉注意力;BLIP 采用双头架构与噪声过滤;BLIP-2 用 Q-Former 连接冻结的图像编码器与 LLM。
查看答案 →
Q · 多模态检索的评估指标 Recall@K 和 mAP 是什么?
Recall@K 衡量真实匹配项是否进入前 K 名,是检索主指标。mAP 即平均精度均值,反映整体排序质量。多模态需双向分别计算。
查看答案 →
Q · 多模态了解吗?说说主流架构。
主流多模态架构可从表征、融合、生成三层理解:CLIP做图文对齐,BLIP-2和Flamingo做跨模态融合,LLaVA类路线把视觉信息接入LLM完成生成。
查看答案 →
其他岗位方向
Agent 开发 · 104 题
Agent 应用与平台工程:工具调用、上下文工程、记忆系统、多 Agent 编排、上线与稳定性。
进入 →
Agent 算法 · 27 题
Agentic RL 与后训练:SFT/RLHF/DPO/GRPO、奖励设计、轨迹数据、评测对齐。
进入 →
AI 算法应用 · 37 题
大模型应用算法:RAG 全链路、检索排序、微调选型、业务效果优化。
进入 →
AI Infra · 11 题
推理与训练系统:vLLM、量化、并行策略、显存与吞吐优化、服务化。
进入 →
通用算法基础 · 31 题
各岗通用底座:Transformer、注意力、采样参数、正则化等基础原理。
进入 →