模型 · 深度词条
Transformer(注意力模型架构)
让序列中的各个位置直接比较彼此的重要性,因此能并行处理文本并建立远距离联系。
四层解释
通俗
让序列中的各个位置直接比较彼此的重要性,因此能并行处理文本并建立远距离联系。
专业
Transformer 是以多头注意力和前馈网络为核心的序列建模架构,原始形式包含编码器与解码器并使用残差连接和归一化。
机制
每个 Token 生成 Query、Key、Value;Query 与 Key 的相似度形成权重,再对 Value 加权汇总,多头机制并行学习不同关系。
工程
实际系统还依赖 Tokenizer、位置表示、缓存、并行训练、推理内核和上下文管理,不能把注意力层等同于完整大模型。
全链路位置
INPUTToken 序列及位置表示
→PROCESSAttention、前馈层与残差堆叠
→OUTPUT上下文化表示或下一个 Token 分布
常见用途
- 语言建模与翻译
- 视觉和多模态模型
- 语音、代码和生物序列
专业边界
- 标准注意力计算随序列长度呈平方增长
- 架构本身不保证事实性或安全
常见误解
- Transformer 只有 Attention
- 所有现代模型都使用完全相同的 Transformer
关联概念
来源与核对记录
S1Attention Is All You NeedVaswani et al. · 原始论文 · 查阅 2026-09-07
↗S2Machine Learning GlossaryGoogle for Developers · 官方技术文档 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。