模型 · 深度词条
Attention(注意力机制)
模型在处理当前信息时,动态决定输入中哪些部分更值得参考。
四层解释
通俗
模型在处理当前信息时,动态决定输入中哪些部分更值得参考。
专业
Attention 根据 Query 与 Key 的兼容度计算归一化权重,再对 Value 做加权聚合;Self-attention 的三者来自同一序列。
机制
Scaled dot-product attention 常写作 softmax(QKᵀ/√d)V。缩放项控制数值范围,Softmax 把相关性变为权重。
工程
长上下文成本、掩码、位置编码、KV Cache 和注意力实现都会影响速度、显存和可用长度。
全链路位置
INPUTQuery、Key、Value 表示
→PROCESS相似度、归一化和加权求和
→OUTPUT融合上下文的新表示
常见用途
- 序列关系建模
- 跨模态对齐
- 生成时读取历史上下文
专业边界
- 注意力权重不天然等于人类可解释性
- 更长上下文不保证模型利用所有信息
常见误解
- 权重最高的 Token 就是唯一原因
- Attention 与 Transformer 完全同义
关联概念
来源与核对记录
S1Attention Is All You NeedVaswani et al. · 原始论文 · 查阅 2026-09-07
↗S2Machine Learning GlossaryGoogle for Developers · 官方技术文档 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。