模型 · 深度词条

Transformer(注意力模型架构)

让序列中的各个位置直接比较彼此的重要性,因此能并行处理文本并建立远距离联系。

深度词条核对 2026-09-072 条来源

四层解释

通俗

让序列中的各个位置直接比较彼此的重要性,因此能并行处理文本并建立远距离联系。

专业

Transformer 是以多头注意力和前馈网络为核心的序列建模架构,原始形式包含编码器与解码器并使用残差连接和归一化。

机制

每个 Token 生成 Query、Key、Value;Query 与 Key 的相似度形成权重,再对 Value 加权汇总,多头机制并行学习不同关系。

工程

实际系统还依赖 Tokenizer、位置表示、缓存、并行训练、推理内核和上下文管理,不能把注意力层等同于完整大模型。

全链路位置

INPUTToken 序列及位置表示
PROCESSAttention、前馈层与残差堆叠
OUTPUT上下文化表示或下一个 Token 分布

常见用途

  • 语言建模与翻译
  • 视觉和多模态模型
  • 语音、代码和生物序列

专业边界

  • 标准注意力计算随序列长度呈平方增长
  • 架构本身不保证事实性或安全

常见误解

  • Transformer 只有 Attention
  • 所有现代模型都使用完全相同的 Transformer

关联概念

来源与核对记录

S1
Attention Is All You NeedVaswani et al. · 原始论文 · 查阅 2026-09-07
S2
Machine Learning GlossaryGoogle for Developers · 官方技术文档 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。