模型 · 深度词条

Token(词元)

模型读写信息时使用的基本单位,可能是一个汉字、单词的一部分、标点,也可能是图像块或音频片段。

深度词条核对 2026-09-072 条来源

四层解释

通俗

模型读写信息时使用的基本单位,可能是一个汉字、单词的一部分、标点,也可能是图像块或音频片段。

专业

Tokenizer 将原始输入编码为离散 Token ID,模型在词表上的概率分布中预测输出;不同模型的切分规则和词表不同。

机制

子词算法在字符和整词之间折中,让常见片段用较少 Token 表示,同时仍能组合罕见词。

工程

上下文上限、延迟和 API 费用经常按 Token 计算;字符数不能直接等价为 Token 数。

全链路位置

INPUT原始文本或其他模态
PROCESSTokenizer 编码为离散 ID
OUTPUT供模型处理的 Token 序列

常见用途

  • 模型输入编码
  • 生成与采样
  • 上下文和成本估算

专业边界

  • 同一句话在不同模型中 Token 数不同
  • Token 不是稳定的自然语言词

常见误解

  • 一个汉字永远等于一个 Token
  • Token 只用于计费

关联概念

来源与核对记录

S1
Machine Learning GlossaryGoogle for Developers · 官方技术文档 · 查阅 2026-09-07
S2
Neural Machine Translation of Rare Words with Subword UnitsSennrich et al. · 原始论文 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。