Table of contents
十章形成一条完整因果链
先回答 AI 从哪里来,再解释模型为什么有效、产品如何落地、行业怎样变化,最后讨论治理边界和个人职业选择。
Course Architecture
先有世界地图,再进入技术细节
AI 不是某个聊天机器人,也不是模型参数竞赛。完整系统由理论、数据、算力、模型、训练、产品、安全、组织与社会共同组成。
历史与三条思想主线
符号主义、连接主义、统计学习如何竞争、融合并推动产业。
学完能:按阶段讲清 AI 为什么兴起、遇冷和再次爆发。
基础原理与模型分类
从 Supervised Learning(监督学习)到 Self-supervised Learning(自监督学习),从 Neural Network(神经网络)到 Transformer 与 Diffusion Model(扩散模型)。
学完能:解释主流模型解决什么问题、为什么有效。
LLM 技术全链路
Data(数据)、Pre-training(预训练)、Post-training(后训练)、Evaluation(评测)、Inference(推理)、RAG、Tool Calling(工具调用)和 AI Agent(智能体)。
学完能:看懂模型发布、技术文章和常见架构图。
AI 产品从 0 到 1
场景选择、PRD、原型、模型选择、评测、上线、成本与监控。
学完能:设计一个有指标、有边界、能落地的 AI 产品。
主流平台案例
OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen 与多模态生态。
学完能:从路线、产品和商业模式比较平台,而非只看榜单。
行业应用案例
金融、医疗、法律、教育、制造、零售、研发、营销等真实流程。
学完能:判断哪些任务适合 AI,哪些必须人工把关。
术语与阅读能力
把数学、模型、训练、工程、产品、安全和岗位术语串成体系。
学完能:阅读 AI 新闻、产品文档和方案时不再被名词淹没。
趋势、组织与人文
模型商品化、AI Agent(智能体)、On-device AI(端侧 AI)、劳动力变化、教育和认知影响。
学完能:区分已发生的结构变化和仍有争议的预测。
Safety、Compliance 与 Governance
Hallucination(幻觉)、Bias(偏见)、Privacy(隐私)、Prompt Injection(提示注入)、权限、Red Teaming(红队测试)、审计和责任机制。
学完能:为不同风险等级设计对应控制措施。
岗位与职业规划
产品、应用、模型、数据、安全、设计六条路线和作品集方法。
学完能:把自己的背景映射成明确岗位和可证明的能力。
先框架,后热点
先用任务、数据、模型、评测、产品和治理六个维度组织信息,再看每日新闻。
用产品倒推技术
从一个可见功能出发,倒推模型、上下文、检索、工具、权限和成本。
能力与限制并看
任何模型能力都要同时问:在哪些数据、评测和条件下成立,失败代价是什么。
用作品验证学习
真正掌握不是记住术语,而是能解释、比较、评测并做出一个可运行的小系统。
Chapter 01 · History
AI 的前世今生:不是直线,而是周期
每次热潮都由思想突破、算力、数据和商业需求共同推动;每次降温都来自承诺超过能力、成本或可靠性。
符号主义
把智能理解为逻辑、规则和知识操作。优势是清晰可解释,短板是开放世界规则难以穷举。
连接主义
把智能理解为神经元连接权重的学习。数据和算力增长后,深度学习成为主导路线。
统计与概率路线
把学习视为从数据估计规律和不确定性,支撑搜索、推荐、语音、风控与现代机器学习。
人工神经元的数学模型
McCulloch 与 Pitts 用简化神经元描述逻辑计算,连接主义的思想种子出现。
留下的主线:复杂智能能否由大量简单单元连接产生?
图灵提出“机器能思考吗”
图灵把抽象哲学问题转成可观察的对话行为测试,并讨论学习机器的可能性。
留下的主线:我们到底用行为、能力、意识还是社会影响定义智能?
达特茅斯会议与 AI 命名
“Artificial Intelligence”成为研究旗帜。早期研究者乐观地相信,推理与学习可以被精确描述并由机器模拟。
产业规律:统一名称能聚集人才和资金,也容易放大短期预期。
感知机、搜索与早期语言系统
感知机、逻辑理论机、通用问题求解器、ELIZA 与早期机器人相继出现。
现实约束:演示环境简单,真实世界的组合爆炸、常识和歧义远超预期。
第一次 AI 寒冬
机器翻译和通用推理未兑现宏大承诺,资金收缩;神经网络也因理论与算力限制降温。
寒冬原因:能力不可泛化、硬件不足、数据稀缺、评测与承诺脱节。
专家系统商业化
企业把专家经验编码为 if-then 规则,用于诊断、配置和金融决策,AI 首次形成规模化商业价值。
成功边界:规则稳定、范围明确、专家知识可表达的任务最适合。
第二次 AI 寒冬
知识获取和维护成本过高,专用硬件市场衰退,专家系统难以应对开放变化。
范式转折:行业逐渐从“人写规则”转向“机器从数据学习”。
统计机器学习成为产业底座
支持向量机、贝叶斯网络、HMM、决策树和集成学习支撑搜索、广告、推荐、语音和风控。1997 年 Deep Blue 战胜卡斯帕罗夫。
关键变化:互联网带来数据,问题被拆成可测量的预测任务。
深度学习重新积累
更好的初始化、训练方法、数据集、GPU 和开源软件逐渐成熟,神经网络从边缘回到主流。
重要启示:技术突破往往是多年工程条件累积后的临界点。
AlexNet 引爆视觉革命
深层卷积网络结合 GPU 与 ImageNet 大幅提升图像分类效果,产业开始全面采用深度学习。
成功公式:算法 + 大数据 + 通用算力 + 标准评测。
生成、语音、翻译与 AlphaGo
GAN、序列到序列、注意力机制快速发展。2016 年 AlphaGo 展示深度网络、搜索与强化学习的组合力量。
组合创新:重大系统往往不是单一算法,而是多个技术模块协同。
Transformer 与 Pre-training(预训练)范式
Transformer 提升并行训练和长距离建模效率;BERT、GPT、T5 等证明先大规模 Pre-training,再适配任务的价值。
范式变化:从“一任务一模型”转向“一个 Foundation Model(基础模型)服务多任务”。
Scaling、LLM 与 Multimodal AI
模型、数据与计算规模继续增长,Few-shot(少样本)能力、代码生成、文本到图像和 Foundation Model(基础模型)概念进入主流。
新问题:能力增长同时放大成本、Bias(偏见)、版权、安全与集中化风险。
Generative AI(生成式人工智能)大众化
对话式产品把 LLM(大语言模型)变成大众界面;Multimodal AI、RAG、Tool Calling 与企业助手快速进入真实 Workflow(工作流)。
产品突破:自然语言成为软件的新入口,但可靠性仍需工程系统兜底。
Reasoning、AI Agent 与企业工程
竞争从“会生成”扩展到长任务、Tool Use(工具使用)、软件开发、多模态行动和企业集成。头部模型能力趋于密集,成本、可靠性、领域数据和 Governance(治理)成为差异点。
当前主战场:Context Engineering(上下文工程)、Evaluation(评测)、权限、Tool Orchestration(工具编排)、Observability(可观测性)与组织流程。
Chapter 02 · Foundations
从 AI 到大模型:概念之间是什么关系
最常见的认知混乱,是把 AI、Machine Learning(机器学习)、Deep Learning(深度学习)、Generative AI(生成式人工智能)与 LLM(大语言模型)当成同义词。它们其实是不同层级与不同用途的集合。
最大集合:任何让机器完成感知、推理、学习、生成、规划或决策的系统。既包括规则系统,也包括 Machine Learning。
AI 的重要子集:模型从数据中学习规律。核心类型包括 Supervised Learning、Unsupervised Learning、Self-supervised Learning 和 Reinforcement Learning。
Machine Learning 的子集:使用多层 Neural Network(神经网络)学习表示。CNN、RNN、Transformer、Diffusion Model 都在这条线上。
在大规模数据上训练的通用底座,可通过 Prompt、Retrieval、Fine-tuning 和 Tool Calling 适配多类任务。LLM 是处理语言与代码的重要类型,Multimodal Model 进一步覆盖图像、音频与视频。
Learning
模型到底在“学”什么
训练不是把书原封不动塞进数据库,而是调整参数,使模型能根据输入预测目标。它会学到语言模式、概念关系和部分可迁移能力,也可能记住具体片段。
Generation
模型到底如何“写”答案
语言模型先用 Tokenizer(词元切分器)把输入切成 Token(词元),根据 Context(上下文)计算下一个 Token 的概率,再逐步生成。复杂能力来自大规模 Training、模型架构、Post-training 和 Inference-time Compute(推理时计算)的共同作用。
Understanding
模型是否真的“理解”
“理解”取决于定义。模型能完成许多需要语义和推理的任务,但它的机制、经验和人类意识不同。产品判断应落到可观测能力与失败边界。
Model Families
不同模型,解决不同问题
不要问“哪个模型最好”,要问“任务是什么、数据是什么、风险和成本是什么”。
| 模型家族 | 主要输入/输出 | 典型任务 | 优势 | 主要限制 |
|---|---|---|---|---|
| Traditional ML(传统机器学习) | 结构化特征 → 类别/数值 | 风控、流失预测、销量预测 | 成本低、可解释、适合表格数据 | 依赖 Feature Engineering(特征工程),通用生成能力弱 |
| CNN / 视觉模型 | 图像/视频 → 标签/区域 | 质检、医学影像、目标检测 | 视觉任务成熟、部署选择多 | 跨任务迁移和开放问答有限 |
| LLM(大语言模型) | 文本/代码 → 文本/结构 | 写作、问答、代码、分析 | 通用、自然语言交互、Few-shot | Hallucination、成本、知识与权限边界 |
| Multimodal Model(多模态模型) | 文图音视频 → 多种输出 | 文档解析、看图问答、实时助手 | 接近真实世界的信息形态 | Evaluation 复杂,细节识别可能不稳 |
| Diffusion / Media Generation(扩散与媒体生成) | 文本/图像 → 图像/视频/音频 | 设计、广告、影视、素材生成 | 质量高、风格与编辑能力强 | 一致性、版权、身份与真实性风险 |
| RL & World Model(强化学习与世界模型) | 状态/行动 → 策略 | 机器人、游戏、控制、规划 | 能优化长期目标并与环境互动 | Reward Design、样本效率与安全难 |
Chapter 03 · Technology
大模型是怎样被做出来的
一个成熟 AI 系统并不是“模型 + 聊天框”。从数据授权到线上监控,每层都可能决定产品成败。
Inference Journey
一次问题到一次回答,中间发生了什么
点击步骤查看实际产品判断。最危险的误解,是把模型生成结果直接当成系统执行结果。
1. 接收输入
应用先接收用户文本、图片、文件或语音,并识别任务类型。
实践判断:例:用户上传合同并要求找出付款、违约和自动续约条款。
Pre-training(预训练)解决“会不会”
让模型获得语言、知识、模式和一定通用能力。成本高、周期长,通常由 Foundation Model 公司完成。
Post-training(后训练)解决“好不好用”
让模型理解 Instruction、Preference、Safety Policy、Tool Schema 与复杂 Reasoning 任务。
产品工程解决“能不能负责”
用证据、权限、评测、监控、人工复核和失败恢复把概率模型变成业务系统。
Chapter 04 · Product Engineering
从 0 到 1 做一个 AI 产品
以下链路适用于知识助手、客服、分析、内容、代码、销售和内部自动化。每一步都应有明确产物。
选择高价值任务
判断:频率高、耗时长、输入输出数字化、可验证、错误可恢复。
产物:任务地图与机会评分。
定义用户与痛点
判断:谁在什么时刻遇到什么问题,现在如何完成。
产物:用户旅程与现状基线。
定义成功与禁区
判断:质量、时长、成本、采纳率和不可接受风险。
产物:指标树与风险等级。
设计人机分工
判断:AI 建议、AI 执行还是人最终确认;异常由谁接管。
产物:工作流和权限图。
准备数据与知识
判断:来源、授权、时效、格式、权限、缺口与更新责任。
产物:数据清单和知识治理方案。
选择模型与架构
判断:效果、速度、成本、上下文、多模态、私有化与供应商风险。
产物:模型短名单与架构图。
建立评测集
判断:覆盖常见、困难、边界和攻击场景,并定义评分者。
产物:黄金集与评测基线。
做最小可用原型
判断:先验证最危险假设,不提前堆功能。
产物:可运行 Demo 与失败样本。
加检索、工具与护栏
判断:哪里需要实时事实、真实操作、结构约束和人工确认。
产物:RAG/Agent 流程。
灰度上线
判断:小流量、可回滚、可降级,关键操作需要确认。
产物:发布计划与应急预案。
监控质量与成本
判断:任务成功、错误类型、延迟、token、人工接管和投诉。
产物:运营看板与告警。
迭代与治理
判断:把真实失败加入评测集,记录模型和提示版本。
产物:回归机制与责任制度。
Decision Framework
何时用 Prompt、RAG、Fine-tuning 或 AI Agent
它们不是互斥选项,而是解决不同问题的工具。先从成本最低、最可控的方案开始。
| 问题 | 优先方案 | 何时适合 | 不解决什么 |
|---|---|---|---|
| 任务说明不清、格式不稳 | Prompt + 示例 + 结构化输出 | 知识已在模型或输入中 | 不会自动补充私有或实时知识 |
| 需要企业资料、最新事实和引用 | RAG | 知识频繁变化、可检索、需溯源 | 无法保证检索到的资料本身正确 |
| 需要稳定风格、领域行为或小模型适配 | Fine-tuning(微调) | 有高质量数据和持续 Evaluation | 不适合频繁更新事实知识 |
| 需要执行多步任务和调用系统 | Workflow / AI Agent(工作流 / 智能体) | 步骤可观察、工具可控、失败可恢复 | 不会天然获得安全权限和可靠计划 |
| 高风险且结果不可逆 | 规则 + AI 建议 + 人工确认 | 医疗、法律、金融、生产控制等 | 不能用“模型更强”替代责任机制 |
产品指标
任务成功率、首次解决率、采纳率、完成时长、人工接管率、复用率、投诉率。
模型指标
正确性、有据性、指令遵循、工具调用准确率、安全通过率、延迟与稳定性。
商业指标
每任务成本、节省工时、转化提升、风险损失、维护成本和供应商切换成本。
Chapter 05 · Platform Cases
主流平台不是同一种公司
比较平台要看研究路线、产品入口、开发生态、部署方式和商业位置。模型榜单只是其中一层。
Case 01
OpenAI:模型、产品与开发平台一体化
OpenAI 的代表性不只来自模型能力,还来自 ChatGPT 把自然语言变成大众产品入口,并通过 API、工具、语音、视觉、代码与智能体把模型扩展成平台。
公开边界:具体训练数据与内部系统未完全公开Case 02
Anthropic:安全研究、长任务与开发者工作流
Claude 路线强调有帮助、诚实与无害的模型行为,公开系统卡与安全研究,并在长文档、编码、工具调用和持续任务上形成产品识别度。2026 年产品线已进入 Claude 5 系列。
代表概念:Constitutional AI、系统卡、Claude CodeCase 03
Google:原生多模态、搜索与全栈生态
Google 同时拥有基础研究、TPU、云平台、搜索、Android、Workspace、YouTube 与海量消费者入口。Gemini 的价值在于模型与完整生态的连接。
版本变化快:具体型号、评测与限制以 Google DeepMind 官方模型卡为准Case 04
开放权重生态:控制权、可定制与工程责任
Meta Llama、Google Gemma、Mistral 等推动开放权重模型。企业可以私有部署、微调和优化,但也要承担基础设施、安全、许可与持续升级责任。
开放权重不必然等于完全开源Case 05
DeepSeek 与 Qwen:效率、开放研究与中文生态
DeepSeek 以 MoE、MLA、训练和推理效率研究形成影响力;Qwen 建立覆盖语言、视觉、音频、代码和智能体工具的广泛生态。两者推动中国模型在全球开源社区中的存在感。
选择时仍需按具体版本、许可和任务独立评测Case 06
图像、视频与音频:生成媒体成为生产流程
从 Stable Diffusion、Midjourney 到 Sora、Veo、Imagen 和音乐/语音模型,竞争已从“生成一张图”扩展到编辑、一致性、控制、音画同步和商业工作流。
技术主线:扩散、Transformer、多模态条件控制Case 07
NVIDIA 与算力栈:AI 为什么也是基础设施产业
GPU 只是入口。CUDA 软件生态、高速互联、训练库、推理引擎、服务器和云服务共同构成算力护城河。
从芯片到软件再到系统的全栈协同Case 08
企业 AI 平台:真正难的是组织与系统集成
Microsoft、Google Cloud、AWS、Salesforce、ServiceNow 等企业平台把模型嵌入办公、CRM、开发、数据和流程系统。竞争点是身份、权限、数据连接和治理。
企业购买的是可管理的能力,不只是模型Platform Matrix
平台选择的六个维度
模型名会变,选择维度相对稳定。每个项目都应该用自己的评测集重新比较。
| 维度 | 闭源 API | 开放权重 / 私有部署 | 企业套件 |
|---|---|---|---|
| 启动速度 | 快,申请后即可集成 | 需要部署与运维 | 已有平台内通常较快 |
| 前沿能力 | 通常最先获得新能力 | 依具体模型和优化团队 | 受平台版本和地区影响 |
| 数据控制 | 依供应商条款与部署选项 | 控制程度高,但责任也高 | 可继承企业身份与治理 |
| 成本 | 按量,低启动成本 | 固定基础设施和运维成本 | 订阅、席位与平台用量 |
| 定制 | Prompt、RAG、微调和工具 | 可深入优化权重与推理 | 适合标准办公和业务流程 |
| 主要风险 | 供应商依赖、价格和数据边界 | 许可、安全、升级和人才 | 平台锁定、权限配置和影子 AI |
Chapter 06 · Industry Cases
AI 的价值发生在具体流程里
以下案例不把“能生成”当成成功。每个场景都同时列出价值、需要的数据和必须控制的风险。
Finance
金融
场景:研报摘要、客服辅助、反欺诈、授信材料整理、合规监测。
数据:交易、客户、规则、研究和实时市场信息。
价值:缩短分析与服务时间,扩大风险覆盖。
风险:错误建议、歧视、市场信息时效、可解释与审计。
Healthcare
医疗
场景:病历结构化、影像辅助、医学检索、随访、药物研发。
数据:病历、影像、指南、实验和生物数据。
价值:减少文书负担,辅助发现与科研。
风险:生命安全、隐私、偏差、临床验证和专业责任。
Legal
法律
场景:合同审查、案例检索、尽调、证据整理、初稿生成。
数据:法规、判例、合同模板和客户材料。
价值:提升检索和初审效率。
风险:虚构案例、法域时效、保密、律师最终责任。
Education
教育
场景:个性化辅导、备课、反馈、题目生成、语言练习。
数据:课程、能力图谱、作业和学习行为。
价值:更及时的反馈和差异化学习。
风险:依赖、作弊、未成年人隐私、内容质量与教育公平。
Manufacturing
制造
场景:视觉质检、预测维护、工艺助手、排产、机器人。
数据:传感器、图像、维修、工艺和供应链。
价值:减少停机和缺陷,沉淀经验。
风险:物理安全、边缘延迟、环境漂移和系统集成。
Retail
零售与电商
场景:推荐、客服、商品内容、需求预测、智能导购。
数据:商品、库存、交易、用户行为与反馈。
价值:提升转化、周转与服务覆盖。
风险:隐私、价格歧视、虚假描述和过度个性化。
Software
软件研发
场景:代码补全、重构、测试、迁移、文档、故障分析。
数据:代码库、Issue、文档、日志和构建系统。
价值:缩短反馈周期,降低重复劳动。
风险:漏洞、许可证、错误修改、凭证泄露和评审弱化。
Marketing
营销与内容
场景:洞察、创意、文案、素材变体、本地化、投放分析。
数据:品牌、受众、历史素材、渠道和转化。
价值:加速实验与多渠道适配。
风险:同质化、版权、品牌偏离、虚假宣传和内容泛滥。
HR
人力资源
场景:JD、人才检索、培训、员工问答和能力分析。
数据:岗位、技能、政策和员工材料。
价值:降低行政负担,支持内部流动。
风险:招聘歧视、监控、隐私和自动化不透明。
Public Sector
公共服务
场景:政策检索、材料辅助、热线、城市运营和公共数据分析。
数据:法规、办事指南、公开数据和内部流程。
价值:扩大服务覆盖,缩短办理时间。
风险:公平、申诉、透明、数字鸿沟和公共责任。
适合 AI
高频、文本/图像密集、可验证、有反馈、错误可恢复。
谨慎使用
数据稀缺、目标含糊、价值难量化、流程本身混乱。
必须人审
生命、自由、重大财产、法律权利和不可逆生产控制。
不该自动化
缺乏合法数据来源、责任无人承担、无法申诉或失败代价不可控。
Chapter 07 · Glossary
AI 专业术语全景词典
按基础、数学、模型、训练、工程、产品、安全和职业八类组织。30 个核心概念已完成深度词条,其余条目标明为基础释义;中文、英文和缩写均可检索。
正在加载术语……
Chapter 08 · Future
未来趋势:已确定的变化与仍未知的答案
预测不是事实。更好的方法是用公开数据识别结构性趋势,再为不同情景准备能力和治理。
模型进入“足够好 + 可组合”阶段
头部模型差距阶段性变化,企业更多通过路由、上下文、数据和工具组合能力。
确定性较高AI Agent(智能体)从个人工具进入受控流程
先在软件、研究、客服、运营等可观察环境中扩张,高风险自动化保持 HITL(人工确认)。
确定性较高端侧与小模型扩大
手机、PC、汽车、工业设备将更多使用本地模型,强调隐私、低延迟和离线能力。
确定性中高软件界面从菜单转向生成与行动
自然语言、视觉和语音成为统一入口,界面会按任务动态生成,但可控性仍是核心。
确定性中等AGI 时间表仍高度不确定
能力、定义、测量、经济影响和社会接受度都没有统一答案,不应把单一预测当作规划事实。
不确定性高Enterprise Change
企业真正会被重构的五个层面
采购几个账号不是 AI 转型。转型意味着流程、岗位、数据、软件和治理同时变化。
任务层
写、查、比、总结、生成、分析和执行被重新分配。
流程层
从人找系统变成 AI 调系统,人处理目标、审批和例外。
岗位层
初级重复任务收缩,复合型、审核型和系统型能力上升。
组织层
中心平台提供模型、安全和评测,业务团队负责场景与结果。
商业层
软件从席位费扩展到按任务、结果、算力和智能体产出计价。
Human Impact
人文影响:效率之外的六个问题
AI 不只改变生产率,也改变知识、创造、权力、身份和人际关系。
认知外包
AI 可以降低信息整理负担,也可能削弱独立推理。关键是让它提供证据、比较和反驳,而非替你结束思考。
创作与作者性
创作者更像导演、编辑和策展人;社会需要重新讨论训练来源、署名、风格模仿和收益分配。
教育与能力分化
获得个性化辅导的门槛降低,但会提问、核验、实践和自我管理的人受益更多。
信息真实性
低成本生成扩大诈骗和虚假内容,来源证明、媒体素养和可信渠道更加重要。
权力与集中
数据、算力和模型集中可能强化平台权力,开放生态与监管将持续形成张力。
尊严与责任
医疗、司法、招聘和公共服务中的自动化必须保留解释、申诉、人工决定和责任主体。
Chapter 09 · Governance
安全治理不是最后加一层过滤器
NIST AI 风险管理框架把核心活动概括为 Govern、Map、Measure、Manage。治理应贯穿设计、采购、开发、上线和退出全过程。
输入风险
敏感数据、恶意提示、越权请求、污染文档。控制:分类、脱敏、认证、隔离和提示注入检测。
模型与工具风险
Hallucination(幻觉)、Bias(偏见)、错误计划、危险 Tool Calling。控制:Least Privilege、Sandbox、Schema Validation、预算和 HITL。
输出与运营风险
错误传播、版权、诈骗、漂移和责任不清。控制:引用、审核、标识、监控、事故流程和版本记录。
为什么“模型很强”仍然不能跳过治理?
通用评测无法覆盖你的数据、用户、流程和错误代价;工具权限与组织责任也不属于模型能力。越强的模型能完成更多事,也可能在越权时造成更大影响。
企业最小治理清单是什么?
场景台账、风险分级、数据和供应商清单、责任人、评测集、权限矩阵、上线审批、监控、事故响应、定期复核和退出方案。
怎样看待 AI 监管?
监管因国家、行业和时间不同而变化。项目应让法务或合规人员基于具体地区、数据和用途确认要求;本课程提供治理框架,不替代法律意见。
Chapter 10 · Career
职业规划:从“想进 AI”到可证明的岗位能力
最稳妥的定位公式是:原有能力 + AI 工具链 + 行业场景。新人不必从训练基础模型开始。
180-Day Roadmap
六个月,从知识地图到求职作品
每个月都要有可展示产物。学习时间可以压缩或延长,但产物顺序不应颠倒。
第 1 月|建立地图
学习:历史、术语、模型家族。
实践:对比 3 个主流产品完成同一任务。
产物:一页 AI 世界地图与对比报告。
第 2 月|掌握链路
学习:Prompt、API、RAG、Tool Calling、Evaluation。
实践:做一个带 Citation(引用)的知识问答。
产物:Architecture Diagram、Evaluation Set 和成本记录。
第 3 月|选择行业
学习:一个行业的流程、数据和风险。
实践:访谈 3-5 位真实用户。
产物:任务地图、现状基线与机会排序。
第 4 月|完成产品
学习:权限、监控、人工审核与失败恢复。
实践:做端到端 Demo。
产物:可运行应用、演示视频和技术说明。
第 5 月|形成证据
学习:离线与在线指标、A/B、回归。
实践:用 50-100 条任务评测。
产物:质量、成本、风险和迭代报告。
第 6 月|求职表达
学习:岗位 JD、系统设计和案例面试。
实践:模拟面试与公开讲解。
产物:定向简历、作品集和 5 分钟演示。
作品集项目 A:企业知识助手
必须包含:权限、混合检索、引用、拒答、评测集、失败样本、成本与更新机制。
作品集项目 B:行业工作流 Agent
必须包含:任务拆解、工具 schema、最小权限、确认节点、异常退出、日志和回滚。
作品集项目 C:AI 评测与治理
必须包含:风险分级、测试集、评分标准、红队样本、结果分析和改进优先级。
简历表达公式
问题:原流程每周处理 2,000 条工单,平均首响 4 小时。
行动:设计 RAG + 工具工作流,建立 120 条评测集与人工确认。
结果:首响缩短至 20 分钟,自动草稿采纳率 68%,错误引用率从 14% 降到 3%。
边界:高风险退款和账户操作保留人工审批。
面试必须讲清的五件事
- 为什么选择这个任务,而不是先选模型。
- 数据从哪里来,如何授权、更新和分权。
- 评测集如何覆盖常见、困难与风险场景。
- 系统失败时怎样降级、回滚和人工接管。
- 业务价值是否覆盖模型、运维与审核成本。
完整学习检查表
进度保存在当前浏览器。每一项都以“能讲清、能比较、能做出”为完成标准。
Optional Appendix · Knowledge Check
附录:完成全书后的框架自检
这是可选附录,不属于主阅读链路。读完整书后,可以用 12 个判断题检查哪些章节需要回看。
Sources & Maintenance
参考来源与更新规则
历史与基础原理相对稳定;模型版本、平台能力、价格、监管和就业数据需要定期复核。本页最后核对时间:2026-09-07。
稳定知识
历史、基本数学、经典架构和产品方法按年度复核。
快速变化
模型版本、价格、上下文、API、平台功能按季度复核。
高风险信息
法律、医疗、金融与合规要求必须结合地区和具体用途咨询专业人士。