LLM 基础LLM基础概念更新 2026-09-28

大语言模型(LLM)Large Language Model

一句话定义

大语言模型是以 Transformer 为骨架、在海量文本上通过自回归预测下一个词来训练的神经网络。其通用能力来自预训练,并通过后训练对齐指令与人类偏好。

是什么

大语言模型是参数规模在数十亿到数千亿之间、以 Transformer 为骨架的神经网络。它通过预测下一个词的任务在超大规模语料上训练,参数中压缩了语料的模式与知识。模型规模通常用 7B 或 70B 等参数量衡量,能力、显存开销与推理成本随规模同步上升。

训练分为两个阶段。预训练让模型学习语言规律与世界知识;后训练包括指令微调与偏好对齐,使其能听从指令并符合人类偏好。

此外,模型具备上下文学习能力,在输入中提供示例,不更新自身参数即可适应新任务。

解决什么问题

大语言模型将为每个任务单独写程序的方式,转变为用一个通用模型完成多种语言任务,把问答、翻译、摘要和代码统一在同一模型中。

其能力存在边界。模型的知识有截止时间,生成过程会产生幻觉,且单次处理的上下文长度有限。这三个限制分别需要通过检索增强生成、对齐训练和长上下文技术来弥补。

面试怎么考

面试常要求讲清预训练、指令微调与偏好对齐各在做什么,并问为什么预训练完不能直接用。答题重点是预训练仅赋予文本补全能力,必须通过后训练将其规范到听从指令。

参数规模差异也是考点,需回答 7B 与 70B 的差别。高频追问通常涉及生成机制,要求解释自回归生成的过程,或提问温度参数如何影响输出。

又称:LLM · 大模型 · 大语言模型

—— 本条完 ——