训练 · 深度词条

Pre-training(预训练)

先让模型在大规模通用数据上学习语言、图像或代码中的模式,得到可以继续适配的底座。

深度词条核对 2026-09-072 条来源

四层解释

通俗

先让模型在大规模通用数据上学习语言、图像或代码中的模式,得到可以继续适配的底座。

专业

预训练以自监督或弱监督目标优化大规模模型,使其获得通用表示、生成和迁移能力。

机制

语言模型常预测被遮挡或后续 Token,视觉模型可做分类、对比学习或重建;训练误差通过反向传播更新参数。

工程

数据治理、去重、混合比例、训练稳定性、并行策略和评测决定预训练是否可复现和可用。

全链路位置

INPUT大规模清洗后的通用数据
PROCESS自监督目标与分布式优化
OUTPUT尚未针对具体助手行为适配的基础模型

常见用途

  • 训练通用语言底座
  • 视觉与多模态表示
  • 向下游任务迁移

专业边界

  • 预训练知识受数据截止时间和分布限制
  • 训练损失下降不等于安全可用

常见误解

  • 模型逐条记住了全部训练数据
  • 预训练结束就能直接成为可靠产品

关联概念

来源与核对记录

S1
Language Models are Few-Shot LearnersBrown et al. · 原始论文 · 查阅 2026-09-07
S2
On the Opportunities and Risks of Foundation ModelsStanford CRFM · 研究报告 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。