模型 · 深度词条

Attention(注意力机制)

模型在处理当前信息时,动态决定输入中哪些部分更值得参考。

深度词条核对 2026-09-072 条来源

四层解释

通俗

模型在处理当前信息时,动态决定输入中哪些部分更值得参考。

专业

Attention 根据 Query 与 Key 的兼容度计算归一化权重,再对 Value 做加权聚合;Self-attention 的三者来自同一序列。

机制

Scaled dot-product attention 常写作 softmax(QKᵀ/√d)V。缩放项控制数值范围,Softmax 把相关性变为权重。

工程

长上下文成本、掩码、位置编码、KV Cache 和注意力实现都会影响速度、显存和可用长度。

全链路位置

INPUTQuery、Key、Value 表示
PROCESS相似度、归一化和加权求和
OUTPUT融合上下文的新表示

常见用途

  • 序列关系建模
  • 跨模态对齐
  • 生成时读取历史上下文

专业边界

  • 注意力权重不天然等于人类可解释性
  • 更长上下文不保证模型利用所有信息

常见误解

  • 权重最高的 Token 就是唯一原因
  • Attention 与 Transformer 完全同义

关联概念

来源与核对记录

S1
Attention Is All You NeedVaswani et al. · 原始论文 · 查阅 2026-09-07
S2
Machine Learning GlossaryGoogle for Developers · 官方技术文档 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。