工程 · 深度词条

Inference(推理)

模型训练完成后,接收一个新输入并计算预测或生成结果的运行过程。

深度词条核对 2026-09-072 条来源

四层解释

通俗

模型训练完成后,接收一个新输入并计算预测或生成结果的运行过程。

专业

Inference 使用固定模型参数执行前向计算;生成式模型通常自回归地产生 Token,并受采样、缓存和停止条件控制。

机制

输入先编码,模型计算首个输出;之后重复读取已有上下文和 KV Cache 生成新 Token,直到满足终止条件。

工程

核心指标包括首 Token 延迟、输出速度、吞吐、显存、并发、单位成本和失败率,需要按真实流量压测。

全链路位置

INPUT模型权重、请求与上下文
PROCESS前向计算、缓存和采样
OUTPUT预测、向量或生成序列

常见用途

  • 在线 API 服务
  • 离线批处理
  • 端侧模型运行

专业边界

  • 推理不等于人类推理过程
  • 增加推理计算也不能保证答案正确

常见误解

  • 模型每次回答都在重新训练
  • 只看每秒 Token 就能判断体验

关联概念

来源与核对记录

S1
Introduction to Large Language ModelsGoogle for Developers · 官方技术课程 · 查阅 2026-09-07
S2
Attention Is All You NeedVaswani et al. · 原始论文 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。