训练 · 深度词条
Pre-training(预训练)
先让模型在大规模通用数据上学习语言、图像或代码中的模式,得到可以继续适配的底座。
四层解释
通俗
先让模型在大规模通用数据上学习语言、图像或代码中的模式,得到可以继续适配的底座。
专业
预训练以自监督或弱监督目标优化大规模模型,使其获得通用表示、生成和迁移能力。
机制
语言模型常预测被遮挡或后续 Token,视觉模型可做分类、对比学习或重建;训练误差通过反向传播更新参数。
工程
数据治理、去重、混合比例、训练稳定性、并行策略和评测决定预训练是否可复现和可用。
全链路位置
INPUT大规模清洗后的通用数据
→PROCESS自监督目标与分布式优化
→OUTPUT尚未针对具体助手行为适配的基础模型
常见用途
- 训练通用语言底座
- 视觉与多模态表示
- 向下游任务迁移
专业边界
- 预训练知识受数据截止时间和分布限制
- 训练损失下降不等于安全可用
常见误解
- 模型逐条记住了全部训练数据
- 预训练结束就能直接成为可靠产品
关联概念
来源与核对记录
S1Language Models are Few-Shot LearnersBrown et al. · 原始论文 · 查阅 2026-09-07
↗S2On the Opportunities and Risks of Foundation ModelsStanford CRFM · 研究报告 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。