工程 · 深度词条
Inference(推理)
模型训练完成后,接收一个新输入并计算预测或生成结果的运行过程。
四层解释
通俗
模型训练完成后,接收一个新输入并计算预测或生成结果的运行过程。
专业
Inference 使用固定模型参数执行前向计算;生成式模型通常自回归地产生 Token,并受采样、缓存和停止条件控制。
机制
输入先编码,模型计算首个输出;之后重复读取已有上下文和 KV Cache 生成新 Token,直到满足终止条件。
工程
核心指标包括首 Token 延迟、输出速度、吞吐、显存、并发、单位成本和失败率,需要按真实流量压测。
全链路位置
INPUT模型权重、请求与上下文
→PROCESS前向计算、缓存和采样
→OUTPUT预测、向量或生成序列
常见用途
- 在线 API 服务
- 离线批处理
- 端侧模型运行
专业边界
- 推理不等于人类推理过程
- 增加推理计算也不能保证答案正确
常见误解
- 模型每次回答都在重新训练
- 只看每秒 Token 就能判断体验
关联概念
来源与核对记录
S1Introduction to Large Language ModelsGoogle for Developers · 官方技术课程 · 查阅 2026-09-07
↗S2Attention Is All You NeedVaswani et al. · 原始论文 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。