AI参数解析:温度、词元、Top-P及更多(2026术语表)
Guides

AI参数解析:温度、词元、Top-P及更多(2026术语表)

如果你接触过AI工具——尤其是API层面——大概已经碰到过温度(temperature)top-p词元(tokens)上下文窗口(context window)RLHF等各种术语。大多数文档在解释时默认你已经半懂了。这份术语表是我刚入门时最希望拥有的那种:用大白话定义每个概念、说清楚它为什么重要、以及你在什么场景下才会真正用到它。

内容分为五个模块——按需跳转,或从头到尾读完作为入门导引。

1. 词元与上下文

在了解任何参数设置之前,你需要先弄清楚模型究竟在消费和产出什么。

文本被切分为彩色词元块的可视化示意图

词元(Token)

语言模型读写的基本单位。一个词元通常是几个字符的组合——有时是一个完整的短词(如"cat"),有时是词的片段(如"ing"、"tion"),有时是单个字符甚至一个字节。以英文为参考,1个词元 ≈ 4个字符 ≈ 3/4个单词,因此1000个词元大约对应750个英文单词。计费方式几乎都以词元为单位(输入和输出分别计算)。

分词器(Tokenizer)

在文本送入模型之前,将其转换为词元的函数。不同模型系列使用不同的分词器,这也是为什么同一段话在不同平台上消耗的词元数量可能略有差异。

上下文窗口(Context window,又称上下文长度)

模型在同一时刻能"记住"的最大词元数量——包括你的提示词、系统指令、历史对话,以及正在生成的回复。现代前沿模型提供20万至100万词元的上下文窗口;较旧或更经济的模型则提供8K至32K。一旦超出限制,最早的内容会被丢弃,或者请求直接报错。

输入词元与输出词元

输入词元是你发送的内容(提示词、系统消息、历史记录、附带的文档)。输出词元是模型生成的回复。输出词元的价格通常是输入词元的3至5倍,因为生成比阅读更耗算力。

最大词元数(max_output_tokens)

对单次请求中模型允许生成的词元数量设置上限。可用于控制成本和响应延迟。很多API默认值为几千个词元;如需更长的输出可调高,若希望回复简短则调低。

2. 采样参数

模型在选择下一个词元时,实际上面对的是一个覆盖所有可能词元的概率分布。采样参数决定了如何从这个分布中做出最终选择。这些是大多数人通过API最常调整的旋钮。

概率分布图,展示温度、top-p和top-k如何分别影响模型选择下一个词元

温度(Temperature)

控制整体随机性。低温度(0至0.3)让模型几乎每次都选择概率最高的下一个词元——结果更确定、更重复、更"安全"。高温度(1.0以上)会拉平概率分布,使低概率词元也有机会被选中——更有创意、更出人意料,但也更容易出错。大多数聊天场景的推荐默认值是0.7。处理代码、数学或事实提取时,建议降至0.0至0.2;进行创意写作或头脑风暴时,可推高至1.0以上。

Top-P(核采样)

Top-P不考虑所有词元,而是限定范围:"只从累计概率达到P的最小词元集合中采样。"比如top-p = 0.9时,模型从合计覆盖90%概率质量的词元中采样,忽略长尾部分。相比top-k,这是一种更智能、更动态的替代方案。常见默认值为0.9或1.0(关闭)。

Top-K

只考虑概率最高的K个词元,在其中进行采样。top-k = 1即贪婪解码(始终选择概率最高的那个词元);top-k = 40则保留前40个候选项。现代API(OpenAI、Anthropic)通常不直接暴露top-k参数,因为top-p通常表现更好,但在开源模型中这是标准配置。

频率惩罚(Frequency penalty)

根据词元在已生成回复中出现的频率,对其施加惩罚。用于减少字面重复。取值范围通常为-2.0至+2.0,默认值为0。

存在惩罚(Presence penalty)

类似频率惩罚,但采用二值化方式:只要某个词元出现过,无论出现多少次都施加惩罚。能促使模型引入新话题或新词汇。取值范围和默认值相同。

停止序列(Stop sequences)

当模型生成指定字符串时,强制停止生成。适用于结构化输出("生成###时停止"),或将回复限制在特定格式内。

随机种子(Seed)

一个用于固定随机数生成器的整数。相同的提示词 + 相同的种子 + 相同的模型版本,通常会产生相同的输出,这对于可复现性、评估和调试至关重要。注意:大多数服务商将此描述为"尽力而为"——跨基础设施的完美确定性无法保证。

快速对比:温度 vs top-p vs top-k

三个采样参数并排对比

参数作用典型范围调高效果调低效果
温度(Temperature)拉平或收窄整体概率曲线0.0 – 2.0(默认约0.7)更有创意,更随机更确定,更重复
Top-P仅保留累计概率达P%的词元0.0 – 1.0(默认0.9 – 1.0)词语选择更多样输出更紧凑、更安全
Top-K仅保留概率最高的K个词元1 – ∞(现代API中通常关闭)更多样更紧凑;K=1即贪婪解码

常见误区:同时调整三个参数。建议只选一个——通常用温度控制创意度,或用top-p调节多样性——其他保持默认。在低温度基础上叠加惩罚参数,是大多数"输出异常"问题的根源。

3. 模型如何思考

你不需要成为机器学习工程师才能使用AI工具,但以下几个架构术语在产品对比中频繁出现。

参数(Parameters)

模型内部在训练过程中被调整的数值。"70B模型"意味着拥有700亿个参数。参数越多通常越智能、越昂贵,但随着架构的进步,这种线性关系已经不那么绝对——经过良好训练的小模型完全可以超越更大但更老旧的模型。

嵌入(Embedding)

用一个向量(一组数字)来表示一段文本在高维空间中的语义。语义相似的文本在空间中彼此靠近。嵌入广泛应用于语义搜索、RAG、去重、分类和推荐。与聊天模型不同——嵌入模型体积更小,且高度专用化。

注意力机制(Attention)

让模型在生成每个新词元时,决定"重点关注"哪些历史词元的机制。这是Transformer的核心创新。你很少会直接接触到它,但它是上下文窗口如此重要的根本原因。

Transformer

自2017年以来,几乎所有现代大型语言模型背后的神经网络架构。当有人说"一个LLM"时,几乎总是指Transformer架构。

专家混合(Mixture of Experts,MoE)

一种将模型拆分为多个"专家"子网络的架构,每次只有其中一部分被激活。这意味着一个模型可以拥有4000亿个总参数,但每个词元只使用300亿——以小模型的速度获取大模型的知识。多个前沿模型在底层采用了MoE架构。

推理模型(Reasoning model)

经过专项训练、能在给出最终答案前花费额外算力"思考"的模型——即生成内部推理步骤。这种方式在数学、编程和复杂推理任务上能显著提升表现,但会增加延迟和词元成本。推理模型是2026年前沿级别的主流类别。

思维链(Chain-of-thought,CoT)

一种提示技术("请一步步思考")或推理模型的内置行为——模型在给出最终答案前先生成中间推理步骤。推理步骤有时对用户隐藏;使用推理模型时,无论是否可见,你通常都需要为这些步骤支付输出词元的费用。

量化(Quantization)

降低模型参数的数值精度(例如从16位浮点数降至4位整数),以压缩模型体积并提升速度,通常带来少量质量损耗。在开源领域十分普遍;使用闭源API时则不太可见。

4. 训练与对齐

一堆海量文本,是如何变成一个能礼貌回答你问题的模型的。

预训练(Pretraining)

训练的第一阶段,也是成本最高的阶段。模型通过在海量文本上预测下一个词元来学习通用语言和世界知识。模型大部分的"智能"正是在这一阶段形成的。

微调(Fine-tuning)

在预训练之后,使用规模小得多的数据集,将模型适配到更细分的任务或风格的第二阶段训练。用于领域专业化(医疗、法律、编程)或将语气和行为调整为特定品牌风格。

RLHF(基于人类反馈的强化学习)

将原始语言模型变成实用助手的对齐技术。人类对模型输出进行评分,奖励模型根据这些评分进行训练,然后再用强化学习对语言模型进行微调,使其产出奖励模型偏好的输出。RLHF正是让ChatGPT和Claude拒绝有害请求、礼貌遵循指令、保持话题聚焦的根本原因。RLAIF(基于AI反馈)是目前大规模应用的相关技术。

系统提示(System prompt)

为整个对话设定模型角色、语气、约束和人格的顶层指令。大多数服务商将其优先级置于用户消息之上。这里是你在指定任何具体任务之前,告诉模型它是谁的地方。

幻觉(Hallucination)

模型给出听起来很自信、实则事实有误或凭空捏造的答案。成因包括:训练数据的缺口、模型倾向于生成听起来合理的文本而非进行核实,以及过于自信的措辞方式。应对方法:降低温度、使用RAG(提供真实来源)、明确指示"不知道就说不知道",并对重要内容进行人工核实。

提示工程(Prompt engineering)

撰写能稳定产出预期结果的提示词的实践。包括角色设定("你是一个……")、少样本示例、思维链触发语和结构化输出指令等技巧。随着模型遵循指令能力的提升,提示工程已从玄学技巧逐渐演变为清晰写作的技艺。

5. 模型落地应用

在产品和工程讨论中高频出现的术语,而非训练层面的概念。

推理(Inference)

运行已训练模型的过程——即针对给定输入生成输出。与训练是两个不同的概念。推理成本是API定价的依据,推理延迟是用户直接感知到的体验。

RAG(检索增强生成)

在回答问题前,先从独立知识库(通常通过嵌入相似度搜索)检索相关文档,并将其填入提示词作为上下文。RAG让小型或通用模型能够准确回答关于私有文档、最新事件或训练数据之外内容的问题。这是"让AI了解我的私有信息"的主流方案。

工具调用/函数调用(Tool use / function calling)

允许模型在生成回复的过程中调用外部函数或API——例如"查询天气"、"检索数据库"、"发送邮件"。模型发出结构化请求,你的代码执行它,再将结果反馈给模型。这正是让LLM从"只会说"变成"能行动"的关键所在。

智能体(Agent)

一个让模型使用工具、自主决策、多步骤完成目标的循环——例如浏览网页、编辑文件或执行多步骤工作流。现代智能体本质上是"推理模型 + 工具 + 迭代循环"。这个词含义宽泛,从客服机器人到自主编程助手都可以叫智能体。

多模态(Multimodal)

能处理文本之外内容的模型——最常见的是图文结合(视觉),越来越多的也支持音频和视频。"多模态"通常指单个模型原生理解多种模态,而非多个独立模型组成的流水线。

视觉(或VLM——视觉语言模型)

多模态的一个具体形态:模型能将图像与文本一同作为输入。用于OCR、图表理解、截图调试、文档分析,以及所有"图胜于文"的场景。

流式输出(Streaming)

模型在生成过程中逐词元发送回复,而非等待完整答案生成完毕再返回。对聊天体验至关重要——用户能看到回复逐渐展开,而不是盯着加载动画等待。在大多数API中以服务器推送事件(server-sent events)的形式实现。

首词元耗时(Time to first token,TTFT)

从发送请求到收到第一个响应词元所需的时间。这是用户实际感知到的延迟。推理模型因为要先"思考"再开口,TTFT较高;非推理模型通常能在几分之一秒内流出第一个词元。

每秒词元数(Tokens per second)

生成开始后的吞吐量。现代快速模型每秒可生成80至200个以上词元;推理模型通常运行较慢,因为它们需要生成(并为之付费)隐藏的推理词元。

最精简速查表

如果你只记得这些:

  • 词元(Token) = 约3/4个英文单词。按词元计费。
  • 上下文窗口(Context window) = 模型一次能看到多少文本。
  • 温度(Temperature) = 创意旋钮。事实/代码调低,头脑风暴调高。
  • Top-P = 比top-k更智能的现代替代方案。无特殊原因保持默认即可。
  • 系统提示(System prompt) = 整个对话的人格设定和规则。
  • RAG = 让模型了解你私有信息的方法。
  • 推理模型(Reasoning model) = 更慢、更贵,但在复杂问题上聪明得多。
  • 幻觉(Hallucination) = 自信的错误答案。务必核实。

以上涵盖了日常工作中的大多数场景。这份术语表的其余内容,是为了当某个词出现在文档、博文或模型介绍页面时,你能随时找到快速锚点。

Alek Blom

Alek Blom is a developer and entrepreneur building web apps, games, and AI tools. He is the founder of Generor, D1rectory, and a portfolio of products spanning AI, finance, and gaming.

Claude Opus 4.7

Claude Opus 4.7 is an AI model by Anthropic. Articles by Opus are AI-generated, editorially reviewed, and published under human oversight by the Generor team.