LLM 基础概念NLP基础面试策略模型演进速答 · 约 6 分钟更新 2026-09-28

分词、Word2Vec、CNN/RNN 这些传统 NLP 基础还在考吗?和大模型什么关系?

一句话结论

还在考,但现在的考法是把传统技术作为大模型演进的对照系。核心要讲清旧技术的局限,并说明大模型的底层设计是如何解决这些历史遗留问题的。

先这样答

传统 NLP 基础依然是面试常客,但考察角色变了。面试官不再重点要求默写底层的统计算法,而是把它们作为「大模型之前的世界」的对照系,考察你是否理解范式变迁的原因。回答这类问题,核心框架是对比。你需要讲清每个旧技术的核心局限,并说明大模型的设计正是对这些局限的回应。

在分词层面,传统分词技术如 jieba 依赖预设词典与隐马尔可夫等统计标注模型,这种方式在面对开放文本时容易遇到未登录词的阻碍。大模型转向了 BPE 等子词分词方式,通过统计字符对的频率合并子词,让固定的词表能够组合覆盖无限的开放文本。在词表示层面,Word2Vec 的本质是静态词向量,一词一向量的机制导致它无法区分多义词在不同句子中的含义。大模型引入的是动态上下文向量,词的表示由它和周围词的交互决定,理解静态与动态的差异是理解 Embedding 演进的钥匙。

在模型架构层面,RNN 和 CNN 都有其结构性局限。RNN 依赖时间步串行处理数据,这种机制不仅无法进行大规模并行训练,还会导致长程依赖在传递中不断衰减。CNN 虽然具备并行计算能力,但受限于局部感受野,难以直接建立全局的语义联系。Transformer 架构取代它们的原因在于,自注意力机制实现了全并行的特征提取,并且允许序列中任意两个位置进行直连计算,避开了串行传递带来的信息损耗。

面试时可以这样收束:理解传统 NLP 技术是看懂大模型架构的必经之路,大模型当前的底层设计,正是为了跨越旧技术在并行效率、上下文感知和开放语义覆盖上的物理边界。

面试官会怎么追问

  • 「既然 Word2Vec 是静态的,现在检索场景还能用它吗?」 可以用但效果受限。因为文本检索需要理解具体语境,Word2Vec 无法区分同一个词在不同句子中的多义表现。改用提取动态上下文向量的模型,才能保证语义准确度。
  • 「RNN 的长程依赖衰减是怎么发生的,Transformer 怎么避开的?」 RNN 处理序列前面的信息需要经过每一步的隐状态传递,计算链条过长会导致信息丢失。Transformer 的自注意力机制让序列中任意两个位置直接进行内积计算,距离恒定,避开了串行传递带来的衰减。
  • 「现在训练领域模型,分词需要像传统分词那样加词典吗?」 不需要像传统分词那样维护统计词典。大模型通过扩充 BPE 子词表并基于领域语料重新统计合并频率,就能让专有词汇成为独立子词。这保留了子词化覆盖开放文本的优势。

回答的坑

  • 认为传统技术已经被彻底淘汰而表现出轻视,正确的方向是客观说明它们在特定资源受限场景下仍有价值,并强调它们是演进的基础。
  • 陷入传统算法复杂的数学推导中,正确的方向是跳出公式,从架构设计、并行计算效率和语义表示能力的宏观维度去对比。
—— 本题完 ——