Transformer 的词表为什么会影响输出层规模:从 Logits 到概率分布
解释词表大小、输出线性层、Logits、Softmax 和模型参数成本之间的关系。
相关工具
解码器最后面对的是整张词表
解码器最后输出的隐藏状态只有 d_model 维,它还不是一个具体词。为了决定下一步生成什么,模型需要把这个向量和词表中的每个候选词元联系起来。文中的做法是通过线性层,把 d_model 维表示映射成长度等于词表大小的 logits 向量。
如果词表有 10000 个词元,那么每个位置就会产生 10000 个分数。每个分数对应一个候选词元,随后 Softmax 把整组分数转成概率分布。词表因此不仅影响词元切分,也直接影响输出层的宽度。

解码器隐藏状态通过输出线性层映射到词表大小,形成每个候选词元的 logits。
词表大小如何进入参数量
输出线性层的权重通常可以看成 d_model × |V| 的矩阵,其中 |V| 表示词表大小。d_model 越宽,词表越大,这个矩阵就越大。它位于模型输出端,却可能拥有非常多的参数。
词表增大可以让词元切分更细或减少某些拆分,但也会扩大输出投影和 Softmax 的计算范围。词表缩小则可能让文本被切成更多子词,序列长度增加,注意力部分的成本又可能上升。词表设计不是单独的选择,而是在输出层规模和序列长度之间做平衡。

词表大小和模型主干宽度共同决定输出投影矩阵的规模。
Logits 为什么要为每个词元保留一个分数
模型并不是直接从词表里查一个最相似的词,而是先为所有候选词元计算相对分数。这样,输出层可以根据当前上下文同时比较普通词、标点、特殊标记和不同子词。
Logits 还保留了候选之间的差距。某个词分数高很多,Softmax 后概率会更集中;几个词分数接近,概率分布则更平缓。解码策略可以利用这组分布进行贪心选择、束搜索或采样。

每个候选词元都有一个 logit 和 Softmax 概率,最终选择由完整分布支持。
词表太大和太小各有什么问题
词表较大时,常见词和词片段可能更完整,序列中的词元数量有机会减少,但输出层参数和每个位置的候选分数都会增加。词表较小时,参数规模可能更可控,但一句话可能需要更多词元表示,序列长度和注意力开销会上升。
还要考虑语料中的语言和领域。一个适合普通文本的词表,不一定适合代码、专业术语或多语言内容。词表不是越大越先进,也不是越小越高效,需要看切分结果、输出成本和训练数据覆盖情况。
训练时词表如何参与交叉熵
训练阶段,输出层在每个目标位置产生完整词表分布,真实目标词元作为标签。交叉熵关注真实词在这组分布中的概率,并把误差传回输出投影和更前面的解码器。
这意味着词表中的大量候选项虽然没有成为真实答案,仍然参与了归一化和损失计算。它们共同决定正确词的相对概率。词表越大,候选空间越大,模型需要在更多可能的词元之间形成区分。
特殊词元也会占据词表位置
起始标记、结束标记、Padding Token 和未知词等特殊词元通常也在词表中。它们会拥有自己的输出分数,模型需要学习何时选择 EOS,训练和注意力则要正确处理 Padding。
如果特殊词元被遗漏或混用,输出层仍然会给它们分数,但生成流程可能无法正确停止,或损失会把补齐位置当成真实目标。词表规模统计时,特殊词元也应被视为候选空间的一部分。
输出层与输入 Embedding 的关系
输入端 Embedding 把词元编号映射到 d_model 维,输出端 Linear 则把 d_model 维隐藏状态映射回词表大小。两者方向相反:一个从离散词表进入模型主干,一个从主干返回词表空间。
有些模型会让输入 Embedding 和输出投影共享部分参数,以减少规模并保持输入输出表示的一致性;也有模型使用独立参数。是否共享取决于具体结构,不能仅凭 Transformer 的基本 Encoder-Decoder 图作判断。
把词表放回完整生成流程
词元化决定文本如何切分,Embedding 把词元带入 d_model 空间,编码器和解码器在主干中加工上下文,输出线性层再把隐藏状态展开到 |V| 个候选。Softmax 形成概率,解码策略选择一个词元,循环继续或遇到 EOS 停止。
因此,词表同时影响输入序列长度和输出候选规模。词表变动可能一端减少词元数量,另一端增加输出层成本。理解这两个方向,才能看懂为什么词表设计会同时影响模型的速度、参数和文本表达方式。
常见问题
词表大小等于模型参数量吗?
不等于。词表大小只是候选词元数量,但它会和 d_model 一起影响输入 Embedding 或输出投影等参数矩阵的规模。
词表越大,输出一定越准确吗?
不一定。更大的词表可能减少部分切分,但会增加输出候选和参数成本,最终效果还取决于语料、切分方式和模型容量。
特殊词元需要算在词表大小里吗?
通常需要。EOS、起始标记、Padding 等也属于模型可以识别或预测的词元,会占据词表中的位置。