Chapter 03
LLM 技术全链路
沿 Data、Training、Post-training、Evaluation 与 Inference 追踪大模型怎样形成能力。
本章核心判断
模型能力来自完整系统,权重只是结果之一;数据、目标、反馈、推理预算和工程约束共同决定表现。
本章结构
- 01Token 与 Embedding
- 02Transformer 与 Attention
- 03Pre-training 与 Post-training
- 04Inference、RAG 与工具调用
关联深度词条
模型Token(词元)
模型读写信息时使用的基本单位,可能是一个汉字、单词的一部分、标点,也可能是图像块或音频片段。
模型Embedding(向量嵌入)把文字、图片或商品变成一串数字,让含义或用途相近的对象在向量空间里更靠近。
模型Transformer(注意力模型架构)让序列中的各个位置直接比较彼此的重要性,因此能并行处理文本并建立远距离联系。
训练Pre-training(预训练)先让模型在大规模通用数据上学习语言、图像或代码中的模式,得到可以继续适配的底座。
训练Post-training(后训练)在预训练之后继续教模型遵循指令、偏好、安全规则和工具格式,让它更像一个可用助手。
工程Inference(推理)模型训练完成后,接收一个新输入并计算预测或生成结果的运行过程。