术语速查 · GLOSSARY

AI Agent 术语表

31 个面试绕不开的术语,每个给一句话定义、机制展开和常见考法。题目里第一次出现的术语都链到这里,答名词解释题直接照结构说。

去题库刷题术语 + 真题搭配用

LLM 基础

6 个术语
  • 大语言模型(LLM)

    大语言模型是以 Transformer 为骨架、在海量文本上通过自回归预测下一个词来训练的神经网络。其通用能力来自预训练,并通过后训练对齐指令与人类偏好。

    又称:LLM · 大模型 · 大语言模型

  • 幻觉

    幻觉是模型输出流畅但与事实不符的内容,根源是按语言概率生成而非查证事实。缓解需通过检索增强提供依据、设定引用约束与拒答机制,并配合评测集持续治理。

    又称:幻觉 · Hallucination · 编造

  • 上下文窗口

    上下文窗口是模型一次前向能处理的 token 总量上限,包含系统提示、对话历史、检索片段与工具返回;标称长度不等于有效利用长度,长上下文中的中间信息可能难以被充分使用。

    又称:上下文窗口 · Context Window · 上下文长度

  • Temperature 与采样参数

    Temperature 与采样参数控制模型生成的随机性。模型每步输出词表概率分布,Temperature 缩放 logits 调整分布,Top-p 在累积概率覆盖 p 的候选里采样;参数越低越确定,越高越发散。

    又称:Temperature · 温度 · Top-p · 采样参数

  • Token(词元)

    Token(词元)是模型处理文本的最小单位,分词器将连续文本切成子词片段并映射为词表编号,计费与上下文长度均按 token 数计算。

    又称:Token · 词元 · 分词

  • Transformer 与注意力机制

    Transformer 与注意力机制是大模型的标准骨架。它用自注意力让每个位置的表示直接聚合全序列信息,配合多层堆叠与前馈网络运作,注意力计算量随序列长度呈平方增长。

    又称:Transformer · 注意力 · Attention · 自注意力

RAG 与检索

7 个术语
  • 混合检索

    混合检索是结合向量检索与字面检索的召回机制。向量检索捕捉语义相似度,字面检索负责关键词匹配,两路结果通过融合算法合并,互补解决纯向量检索漏专名、纯字面检索漏同义改写的问题。

    又称:混合检索 · Hybrid Search · 向量加字面检索

  • 文档切分(Chunking)

    文档切分是把长文档切成检索与生成均可处理片段的过程。切得太碎会导致语义不完整,太大则造成向量语义稀释与上下文浪费;重叠窗口、按文档结构切分与父子索引是常用策略。

    又称:Chunking · 切分 · 文档切片 · 分块

  • 向量数据库

    向量数据库是专门存储高维向量并支持近似最近邻检索的系统,利用 HNSW 与 IVF 等索引将大规模向量的检索降至毫秒级。FAISS、PGVector 和 Milvus 是常见选型。

    又称:向量数据库 · Vector Database · Milvus · FAISS · PGVector

  • 重排序(Rerank)

    重排序(Rerank)是用 Cross-Encoder 将查询与候选文档拼接后联合编码打分的阶段。它精度高于双塔检索,因无法预计算常接在召回之后,用于将最相关的文档排到最前。

    又称:Rerank · 重排序 · 重排 · Cross-Encoder 重排

  • Embedding(向量化)

    Embedding(向量化)是将文本映射为固定维度的稠密向量,使语义相近的文本在空间内距离近。检索时计算查询与文档的向量相似度进行召回,模型通过对比学习训练实现语义对齐。

    又称:Embedding · 向量化 · 向量表示 · 语义向量

  • GraphRAG

    GraphRAG是先从语料抽取实体与关系构建知识图谱,再聚类生成社区摘要,并在检索时利用图结构与社区摘要回答跨文档全局归纳问题的检索增强技术,其建图与更新成本远高于普通RAG。

    又称:GraphRAG · 图检索增强 · 知识图谱 RAG

  • RAG(检索增强生成)

    RAG 是先从外部知识库检索相关片段,再将片段放进提示词让模型生成答案的架构,它用可更新的外部知识弥补模型参数知识的截止与缺失,并给答案提供引用依据。

    又称:RAG · 检索增强生成

Agent 与工具

7 个术语
  • 多智能体系统

    多智能体系统是将任务拆分给多个各有分工的 Agent 协作完成的架构,常见编排为主从模式与流水线。其收益是上下文隔离与并行执行,成本在于通信开销与不确定性叠加。

    又称:Multi-Agent · 多智能体 · 多 Agent · MAS

  • A2A(Agent 间通信协议)

    A2A(Agent 间通信协议)是开放社区治理的互操作协议,用于不同框架的 Agent 互相发现能力、交换任务与消息。它与连接工具的 MCP 互补,专注连接 Agent。

    又称:A2A · Agent2Agent · Agent 间协议

  • Agent 记忆

    Agent 记忆是按生命周期分层的信息存储机制,分为当前对话上下文的短期记忆,与跨会话持久化的长期记忆。长期记忆的设计核心在于解决信息的抽取写入、多维度检索排序,以及动态更新与遗忘机制。

    又称:Agent Memory · Agent 记忆 · 长期记忆 · 短期记忆

  • AI Agent(智能体)

    AI Agent(智能体)是以大模型为决策核心,能感知输入、自主规划并调用工具改变环境状态的系统。其与一次性问答的区别在于具备观察、思考、行动的循环以及外部动作能力。

    又称:Agent · 智能体 · AI Agent · 自主智能体

  • Function Calling(函数调用)

    Function Calling(函数调用)是开发者向模型声明工具名称、参数 Schema 与描述,模型按用户意图输出结构化调用请求的机制。模型仅负责决策,由应用层执行真实函数并回传结果。

    又称:Function Calling · 函数调用 · Tool Use · 工具调用

  • MCP(模型上下文协议)

    MCP(模型上下文协议)是一种开源的开放协议,将工具、资源和提示词封装成标准化的服务端,宿主应用通过客户端与之连接,从而解决每个应用接入每个工具都需要单独开发的问题。

    又称:MCP · Model Context Protocol · 模型上下文协议

  • ReAct 模式

    ReAct 模式是让模型交替输出思考与行动的 Agent 范式。模型每步先输出推理再发起工具调用,工具结果作为观察喂回,循环直至给出最终答案。它适用于简单任务,长任务易发散。

    又称:ReAct · 推理+行动 · Reasoning and Acting

推理与部署

4 个术语
  • 模型量化

    模型量化是将模型权重或激活从 FP16 压缩至 INT8 或 INT4 等低位宽表示的技术。显存与带宽需求随位宽成比例下降,代价是精度损失,需通过校准或量化感知训练控制误差。

    又称:量化 · Quantization · INT8 · INT4 · GPTQ · AWQ

  • 投机解码

    投机解码是一种加速机制,由小模型起草若干候选 token,大模型一次并行验证,接受通过的前缀并从分歧点重算。它保证输出分布与直接用大模型等价,在草稿接受率高的任务上提速明显。

    又称:投机解码 · Speculative Decoding · 推测解码 · 草稿模型

  • KV Cache

    KV Cache 是大模型自回归解码时,缓存已生成序列每层 Key 和 Value 矩阵的机制。它避免每步重算全部历史注意力,代价是显存随序列长度线性增长,是推理优化的核心变量。

    又称:KV Cache · KV 缓存 · 键值缓存

  • PagedAttention 与 vLLM

    vLLM通过PagedAttention机制将KV Cache切分为固定大小的物理块,利用页表映射按需分配显存。它消除了预留整段显存带来的碎片浪费,配合连续批处理技术提高了吞吐量。

    又称:PagedAttention · vLLM · 分页注意力

训练与微调

4 个术语
  • DPO

    DPO是一种跳过奖励模型与强化学习采样循环的偏好对齐方法。它直接用偏好对计算偏好损失来优化策略模型,训练稳定,但依赖离线数据且探索较弱,效果受制于数据质量。

    又称:DPO · Direct Preference Optimization · 直接偏好优化

  • GRPO

    GRPO 是 PPO 的无价值网络变体。它对同一提示采样一组输出,用组内奖励减去均值除以标准差的结果作为优势估计。该方法省去 Critic 网络,降低显存开销,常用于推理训练。

    又称:GRPO · Group Relative Policy Optimization · 组相对策略优化

  • LoRA

    LoRA 是一种冻结原模型权重,在旁路并接一对低秩矩阵只训练增量的微调方法。其可训练参数仅占原模型小几个百分点,显存与存储开销大幅下降,效果接近全参微调。

    又称:LoRA · 低秩适配 · Low-Rank Adaptation · QLoRA

  • RLHF

    RLHF 是用人类偏好数据训练奖励模型,并以此作为环境信号对模型做强化学习的对齐方法。预训练模型具备语言能力但不一定符合意图,RLHF 让输出向人类偏好靠拢。

    又称:RLHF · 人类反馈强化学习 · 基于人类反馈的强化学习

评估

2 个术语
  • Agent 评估

    Agent 评估是衡量 Agent 运行质量的工程机制。以任务成功率为主指标,同时考察工具选择、执行步数、是否死循环等轨迹质量,以及成本延迟等资源消耗。该机制依赖离线固定题集与线上监控协同运作。

    又称:Agent 评估 · Agent 评测 · Agent Evaluation

  • LLM-as-a-Judge

    LLM-as-a-Judge 是用强模型按标准给输出打分或做成对比较的评测方法,能覆盖人工无法达到的规模。其风险有位置偏差、长度偏好与自我偏好,需通过锚定样例与一致性校验来稳定。

    又称:LLM-as-a-Judge · 模型评模型 · 大模型评分

安全

1 个术语
  • 提示注入

    提示注入是在模型输入中夹带指令以劫持其行为的攻击。分为混在用户消息里的直接注入,和藏在网页、文档或工具返回中的间接注入。Agent 有工具权限后,危害从说错话升级为做错事。

    又称:提示注入 · Prompt Injection · 间接提示注入 · 越狱