历史与三条思想主线
符号主义、连接主义、统计学习如何竞争、融合并推动产业。
学完能:按阶段讲清 AI 为什么兴起、遇冷和再次爆发。
Course Architecture
AI 不是某个聊天机器人,也不是模型参数竞赛。完整系统由理论、数据、算力、模型、训练、产品、安全、组织与社会共同组成。
符号主义、连接主义、统计学习如何竞争、融合并推动产业。
学完能:按阶段讲清 AI 为什么兴起、遇冷和再次爆发。
从监督学习到自监督学习,从神经网络到 Transformer 与扩散模型。
学完能:解释主流模型解决什么问题、为什么有效。
数据、预训练、后训练、评测、推理、RAG、工具调用和智能体。
学完能:看懂模型发布、技术文章和常见架构图。
场景选择、PRD、原型、模型选择、评测、上线、成本与监控。
学完能:设计一个有指标、有边界、能落地的 AI 产品。
OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen 与多模态生态。
学完能:从路线、产品和商业模式比较平台,而非只看榜单。
金融、医疗、法律、教育、制造、零售、研发、营销等真实流程。
学完能:判断哪些任务适合 AI,哪些必须人工把关。
把数学、模型、训练、工程、产品、安全和岗位术语串成体系。
学完能:阅读 AI 新闻、产品文档和方案时不再被名词淹没。
模型商品化、智能体、端侧 AI、劳动力变化、教育和认知影响。
学完能:区分已发生的结构变化和仍有争议的预测。
幻觉、偏见、隐私、提示注入、权限、红队、审计和责任机制。
学完能:为不同风险等级设计对应控制措施。
产品、应用、模型、数据、安全、设计六条路线和作品集方法。
学完能:把自己的背景映射成明确岗位和可证明的能力。
先用任务、数据、模型、评测、产品和治理六个维度组织信息,再看每日新闻。
从一个可见功能出发,倒推模型、上下文、检索、工具、权限和成本。
任何模型能力都要同时问:在哪些数据、评测和条件下成立,失败代价是什么。
真正掌握不是记住术语,而是能解释、比较、评测并做出一个可运行的小系统。
Chapter 01 · History
每次热潮都由思想突破、算力、数据和商业需求共同推动;每次降温都来自承诺超过能力、成本或可靠性。
把智能理解为逻辑、规则和知识操作。优势是清晰可解释,短板是开放世界规则难以穷举。
把智能理解为神经元连接权重的学习。数据和算力增长后,深度学习成为主导路线。
把学习视为从数据估计规律和不确定性,支撑搜索、推荐、语音、风控与现代机器学习。
McCulloch 与 Pitts 用简化神经元描述逻辑计算,连接主义的思想种子出现。
留下的主线:复杂智能能否由大量简单单元连接产生?
图灵把抽象哲学问题转成可观察的对话行为测试,并讨论学习机器的可能性。
留下的主线:我们到底用行为、能力、意识还是社会影响定义智能?
“Artificial Intelligence”成为研究旗帜。早期研究者乐观地相信,推理与学习可以被精确描述并由机器模拟。
产业规律:统一名称能聚集人才和资金,也容易放大短期预期。
感知机、逻辑理论机、通用问题求解器、ELIZA 与早期机器人相继出现。
现实约束:演示环境简单,真实世界的组合爆炸、常识和歧义远超预期。
机器翻译和通用推理未兑现宏大承诺,资金收缩;神经网络也因理论与算力限制降温。
寒冬原因:能力不可泛化、硬件不足、数据稀缺、评测与承诺脱节。
企业把专家经验编码为 if-then 规则,用于诊断、配置和金融决策,AI 首次形成规模化商业价值。
成功边界:规则稳定、范围明确、专家知识可表达的任务最适合。
知识获取和维护成本过高,专用硬件市场衰退,专家系统难以应对开放变化。
范式转折:行业逐渐从“人写规则”转向“机器从数据学习”。
支持向量机、贝叶斯网络、HMM、决策树和集成学习支撑搜索、广告、推荐、语音和风控。1997 年 Deep Blue 战胜卡斯帕罗夫。
关键变化:互联网带来数据,问题被拆成可测量的预测任务。
更好的初始化、训练方法、数据集、GPU 和开源软件逐渐成熟,神经网络从边缘回到主流。
重要启示:技术突破往往是多年工程条件累积后的临界点。
深层卷积网络结合 GPU 与 ImageNet 大幅提升图像分类效果,产业开始全面采用深度学习。
成功公式:算法 + 大数据 + 通用算力 + 标准评测。
GAN、序列到序列、注意力机制快速发展。2016 年 AlphaGo 展示深度网络、搜索与强化学习的组合力量。
组合创新:重大系统往往不是单一算法,而是多个技术模块协同。
Transformer 提升并行训练和长距离建模效率;BERT、GPT、T5 等证明先大规模预训练、再适配任务的价值。
范式变化:从“一任务一模型”转向“一个基础模型服务多任务”。
模型、数据与计算规模继续增长,少样本能力、代码生成、文本到图像和基础模型概念进入主流。
新问题:能力增长同时放大成本、偏见、版权、安全与集中化风险。
对话式产品把大模型变成大众界面;多模态、RAG、工具调用与企业助手快速进入真实工作流。
产品突破:自然语言成为软件的新入口,但可靠性仍需工程系统兜底。
竞争从“会生成”扩展到长任务、工具使用、软件开发、多模态行动和企业集成。头部模型能力趋于密集,成本、可靠性、领域数据和治理成为差异点。
当前主战场:上下文工程、评测、权限、工具编排、可观测性与组织流程。
Chapter 02 · Foundations
最常见的认知混乱,是把 AI、机器学习、深度学习、生成式 AI 与大模型当成同义词。它们其实是不同层级与不同用途的集合。
最大集合:任何让机器完成感知、推理、学习、生成、规划或决策的系统。既包括规则系统,也包括机器学习。
AI 的重要子集:模型从数据中学习规律。核心类型包括监督学习、无监督学习、自监督学习和强化学习。
机器学习的子集:使用多层神经网络学习表示。CNN、RNN、Transformer、扩散模型都在这条线上。
在大规模数据上训练的通用底座,可通过提示、检索、微调和工具适配多类任务。LLM 是处理语言与代码的重要类型,多模态模型进一步覆盖图像、音频与视频。
Learning
训练不是把书原封不动塞进数据库,而是调整参数,使模型能根据输入预测目标。它会学到语言模式、概念关系和部分可迁移能力,也可能记住具体片段。
Generation
语言模型把输入切成 token,根据上下文计算下一个 token 的概率,再逐步生成。复杂能力来自大规模训练、模型结构、后训练和推理时计算的共同作用。
Understanding
“理解”取决于定义。模型能完成许多需要语义和推理的任务,但它的机制、经验和人类意识不同。产品判断应落到可观测能力与失败边界。
Model Families
不要问“哪个模型最好”,要问“任务是什么、数据是什么、风险和成本是什么”。
| 模型家族 | 主要输入/输出 | 典型任务 | 优势 | 主要限制 |
|---|---|---|---|---|
| 传统机器学习 | 结构化特征 → 类别/数值 | 风控、流失预测、销量预测 | 成本低、可解释、适合表格数据 | 依赖特征工程,通用生成能力弱 |
| CNN / 视觉模型 | 图像/视频 → 标签/区域 | 质检、医学影像、目标检测 | 视觉任务成熟、部署选择多 | 跨任务迁移和开放问答有限 |
| 大语言模型 | 文本/代码 → 文本/结构 | 写作、问答、代码、分析 | 通用、自然语言交互、少样本 | 幻觉、成本、知识与权限边界 |
| 多模态模型 | 文图音视频 → 多种输出 | 文档解析、看图问答、实时助手 | 接近真实世界的信息形态 | 评测复杂,细节识别可能不稳 |
| 扩散/媒体生成 | 文本/图像 → 图像/视频/音频 | 设计、广告、影视、素材生成 | 质量高、风格与编辑能力强 | 一致性、版权、身份与真实性风险 |
| 强化学习与世界模型 | 状态/行动 → 策略 | 机器人、游戏、控制、规划 | 能优化长期目标并与环境互动 | 奖励设计、样本效率与安全难 |
Chapter 03 · Technology
一个成熟 AI 系统并不是“模型 + 聊天框”。从数据授权到线上监控,每层都可能决定产品成败。
Inference Journey
点击步骤查看实际产品判断。最危险的误解,是把模型生成结果直接当成系统执行结果。
应用先接收用户文本、图片、文件或语音,并识别任务类型。
实践判断:例:用户上传合同并要求找出付款、违约和自动续约条款。
让模型获得语言、知识、模式和一定通用能力。成本高、周期长,通常由基础模型公司完成。
让模型理解指令、偏好、安全规则、工具格式与复杂推理任务。
用证据、权限、评测、监控、人工复核和失败恢复把概率模型变成业务系统。
Chapter 04 · Product Engineering
以下链路适用于知识助手、客服、分析、内容、代码、销售和内部自动化。每一步都应有明确产物。
判断:频率高、耗时长、输入输出数字化、可验证、错误可恢复。
产物:任务地图与机会评分。
判断:谁在什么时刻遇到什么问题,现在如何完成。
产物:用户旅程与现状基线。
判断:质量、时长、成本、采纳率和不可接受风险。
产物:指标树与风险等级。
判断:AI 建议、AI 执行还是人最终确认;异常由谁接管。
产物:工作流和权限图。
判断:来源、授权、时效、格式、权限、缺口与更新责任。
产物:数据清单和知识治理方案。
判断:效果、速度、成本、上下文、多模态、私有化与供应商风险。
产物:模型短名单与架构图。
判断:覆盖常见、困难、边界和攻击场景,并定义评分者。
产物:黄金集与评测基线。
判断:先验证最危险假设,不提前堆功能。
产物:可运行 Demo 与失败样本。
判断:哪里需要实时事实、真实操作、结构约束和人工确认。
产物:RAG/Agent 流程。
判断:小流量、可回滚、可降级,关键操作需要确认。
产物:发布计划与应急预案。
判断:任务成功、错误类型、延迟、token、人工接管和投诉。
产物:运营看板与告警。
判断:把真实失败加入评测集,记录模型和提示版本。
产物:回归机制与责任制度。
Decision Framework
它们不是互斥选项,而是解决不同问题的工具。先从成本最低、最可控的方案开始。
| 问题 | 优先方案 | 何时适合 | 不解决什么 |
|---|---|---|---|
| 任务说明不清、格式不稳 | Prompt + 示例 + 结构化输出 | 知识已在模型或输入中 | 不会自动补充私有或实时知识 |
| 需要企业资料、最新事实和引用 | RAG | 知识频繁变化、可检索、需溯源 | 无法保证检索到的资料本身正确 |
| 需要稳定风格、领域行为或小模型适配 | 微调 | 有高质量数据和持续评测 | 不适合频繁更新事实知识 |
| 需要执行多步任务和调用系统 | 工作流 / Agent | 步骤可观察、工具可控、失败可恢复 | 不会天然获得安全权限和可靠计划 |
| 高风险且结果不可逆 | 规则 + AI 建议 + 人工确认 | 医疗、法律、金融、生产控制等 | 不能用“模型更强”替代责任机制 |
任务成功率、首次解决率、采纳率、完成时长、人工接管率、复用率、投诉率。
正确性、有据性、指令遵循、工具调用准确率、安全通过率、延迟与稳定性。
每任务成本、节省工时、转化提升、风险损失、维护成本和供应商切换成本。
Chapter 05 · Platform Cases
比较平台要看研究路线、产品入口、开发生态、部署方式和商业位置。模型榜单只是其中一层。
Case 01
OpenAI 的代表性不只来自模型能力,还来自 ChatGPT 把自然语言变成大众产品入口,并通过 API、工具、语音、视觉、代码与智能体把模型扩展成平台。
公开边界:具体训练数据与内部系统未完全公开Case 02
Claude 路线强调有帮助、诚实与无害的模型行为,公开系统卡与安全研究,并在长文档、编码、工具调用和持续任务上形成产品识别度。2026 年产品线已进入 Claude 5 系列。
代表概念:Constitutional AI、系统卡、Claude CodeCase 03
Google 同时拥有基础研究、TPU、云平台、搜索、Android、Workspace、YouTube 与海量消费者入口。Gemini 的价值在于模型与完整生态的连接。
当前官方主线包含 Gemini 3.5、Gemini Omni、Gemma、Veo、Imagen、Gemini RoboticsCase 04
Meta Llama、Google Gemma、Mistral 等推动开放权重模型。企业可以私有部署、微调和优化,但也要承担基础设施、安全、许可与持续升级责任。
开放权重不必然等于完全开源Case 05
DeepSeek 以 MoE、MLA、训练和推理效率研究形成影响力;Qwen 建立覆盖语言、视觉、音频、代码和智能体工具的广泛生态。两者推动中国模型在全球开源社区中的存在感。
选择时仍需按具体版本、许可和任务独立评测Case 06
从 Stable Diffusion、Midjourney 到 Sora、Veo、Imagen 和音乐/语音模型,竞争已从“生成一张图”扩展到编辑、一致性、控制、音画同步和商业工作流。
技术主线:扩散、Transformer、多模态条件控制Case 07
GPU 只是入口。CUDA 软件生态、高速互联、训练库、推理引擎、服务器和云服务共同构成算力护城河。
从芯片到软件再到系统的全栈协同Case 08
Microsoft、Google Cloud、AWS、Salesforce、ServiceNow 等企业平台把模型嵌入办公、CRM、开发、数据和流程系统。竞争点是身份、权限、数据连接和治理。
企业购买的是可管理的能力,不只是模型Platform Matrix
模型名会变,选择维度相对稳定。每个项目都应该用自己的评测集重新比较。
| 维度 | 闭源 API | 开放权重 / 私有部署 | 企业套件 |
|---|---|---|---|
| 启动速度 | 快,申请后即可集成 | 需要部署与运维 | 已有平台内通常较快 |
| 前沿能力 | 通常最先获得新能力 | 依具体模型和优化团队 | 受平台版本和地区影响 |
| 数据控制 | 依供应商条款与部署选项 | 控制程度高,但责任也高 | 可继承企业身份与治理 |
| 成本 | 按量,低启动成本 | 固定基础设施和运维成本 | 订阅、席位与平台用量 |
| 定制 | Prompt、RAG、微调和工具 | 可深入优化权重与推理 | 适合标准办公和业务流程 |
| 主要风险 | 供应商依赖、价格和数据边界 | 许可、安全、升级和人才 | 平台锁定、权限配置和影子 AI |
Chapter 06 · Industry Cases
以下案例不把“能生成”当成成功。每个场景都同时列出价值、需要的数据和必须控制的风险。
Finance
场景:研报摘要、客服辅助、反欺诈、授信材料整理、合规监测。
数据:交易、客户、规则、研究和实时市场信息。
价值:缩短分析与服务时间,扩大风险覆盖。
风险:错误建议、歧视、市场信息时效、可解释与审计。
Healthcare
场景:病历结构化、影像辅助、医学检索、随访、药物研发。
数据:病历、影像、指南、实验和生物数据。
价值:减少文书负担,辅助发现与科研。
风险:生命安全、隐私、偏差、临床验证和专业责任。
Legal
场景:合同审查、案例检索、尽调、证据整理、初稿生成。
数据:法规、判例、合同模板和客户材料。
价值:提升检索和初审效率。
风险:虚构案例、法域时效、保密、律师最终责任。
Education
场景:个性化辅导、备课、反馈、题目生成、语言练习。
数据:课程、能力图谱、作业和学习行为。
价值:更及时的反馈和差异化学习。
风险:依赖、作弊、未成年人隐私、内容质量与教育公平。
Manufacturing
场景:视觉质检、预测维护、工艺助手、排产、机器人。
数据:传感器、图像、维修、工艺和供应链。
价值:减少停机和缺陷,沉淀经验。
风险:物理安全、边缘延迟、环境漂移和系统集成。
Retail
场景:推荐、客服、商品内容、需求预测、智能导购。
数据:商品、库存、交易、用户行为与反馈。
价值:提升转化、周转与服务覆盖。
风险:隐私、价格歧视、虚假描述和过度个性化。
Software
场景:代码补全、重构、测试、迁移、文档、故障分析。
数据:代码库、Issue、文档、日志和构建系统。
价值:缩短反馈周期,降低重复劳动。
风险:漏洞、许可证、错误修改、凭证泄露和评审弱化。
Marketing
场景:洞察、创意、文案、素材变体、本地化、投放分析。
数据:品牌、受众、历史素材、渠道和转化。
价值:加速实验与多渠道适配。
风险:同质化、版权、品牌偏离、虚假宣传和内容泛滥。
HR
场景:JD、人才检索、培训、员工问答和能力分析。
数据:岗位、技能、政策和员工材料。
价值:降低行政负担,支持内部流动。
风险:招聘歧视、监控、隐私和自动化不透明。
Public Sector
场景:政策检索、材料辅助、热线、城市运营和公共数据分析。
数据:法规、办事指南、公开数据和内部流程。
价值:扩大服务覆盖,缩短办理时间。
风险:公平、申诉、透明、数字鸿沟和公共责任。
高频、文本/图像密集、可验证、有反馈、错误可恢复。
数据稀缺、目标含糊、价值难量化、流程本身混乱。
生命、自由、重大财产、法律权利和不可逆生产控制。
缺乏合法数据来源、责任无人承担、无法申诉或失败代价不可控。
Chapter 07 · Glossary
按基础、数学、模型、训练、工程、产品、安全和职业八类组织。输入中文或英文即可检索。
正在加载术语……
Chapter 08 · Future
预测不是事实。更好的方法是用公开数据识别结构性趋势,再为不同情景准备能力和治理。
头部模型差距阶段性变化,企业更多通过路由、上下文、数据和工具组合能力。
确定性较高先在软件、研究、客服、运营等可观察环境中扩张,高风险自动化保持人工确认。
确定性较高手机、PC、汽车、工业设备将更多使用本地模型,强调隐私、低延迟和离线能力。
确定性中高自然语言、视觉和语音成为统一入口,界面会按任务动态生成,但可控性仍是核心。
确定性中等能力、定义、测量、经济影响和社会接受度都没有统一答案,不应把单一预测当作规划事实。
不确定性高Enterprise Change
采购几个账号不是 AI 转型。转型意味着流程、岗位、数据、软件和治理同时变化。
写、查、比、总结、生成、分析和执行被重新分配。
从人找系统变成 AI 调系统,人处理目标、审批和例外。
初级重复任务收缩,复合型、审核型和系统型能力上升。
中心平台提供模型、安全和评测,业务团队负责场景与结果。
软件从席位费扩展到按任务、结果、算力和智能体产出计价。
Human Impact
AI 不只改变生产率,也改变知识、创造、权力、身份和人际关系。
AI 可以降低信息整理负担,也可能削弱独立推理。关键是让它提供证据、比较和反驳,而非替你结束思考。
创作者更像导演、编辑和策展人;社会需要重新讨论训练来源、署名、风格模仿和收益分配。
获得个性化辅导的门槛降低,但会提问、核验、实践和自我管理的人受益更多。
低成本生成扩大诈骗和虚假内容,来源证明、媒体素养和可信渠道更加重要。
数据、算力和模型集中可能强化平台权力,开放生态与监管将持续形成张力。
医疗、司法、招聘和公共服务中的自动化必须保留解释、申诉、人工决定和责任主体。
Chapter 09 · Governance
NIST AI 风险管理框架把核心活动概括为 Govern、Map、Measure、Manage。治理应贯穿设计、采购、开发、上线和退出全过程。
敏感数据、恶意提示、越权请求、污染文档。控制:分类、脱敏、认证、隔离和提示注入检测。
幻觉、偏见、错误计划、危险工具调用。控制:最小权限、沙箱、结构校验、预算和人工确认。
错误传播、版权、诈骗、漂移和责任不清。控制:引用、审核、标识、监控、事故流程和版本记录。
通用评测无法覆盖你的数据、用户、流程和错误代价;工具权限与组织责任也不属于模型能力。越强的模型能完成更多事,也可能在越权时造成更大影响。
场景台账、风险分级、数据和供应商清单、责任人、评测集、权限矩阵、上线审批、监控、事故响应、定期复核和退出方案。
监管因国家、行业和时间不同而变化。项目应让法务或合规人员基于具体地区、数据和用途确认要求;本课程提供治理框架,不替代法律意见。
Chapter 10 · Career
最稳妥的定位公式是:原有能力 + AI 工具链 + 行业场景。新人不必从训练基础模型开始。
180-Day Roadmap
每个月都要有可展示产物。学习时间可以压缩或延长,但产物顺序不应颠倒。
学习:历史、术语、模型家族。
实践:对比 3 个主流产品完成同一任务。
产物:一页 AI 世界地图与对比报告。
学习:Prompt、API、RAG、工具调用、评测。
实践:做一个带引用的知识问答。
产物:架构图、评测集和成本记录。
学习:一个行业的流程、数据和风险。
实践:访谈 3-5 位真实用户。
产物:任务地图、现状基线与机会排序。
学习:权限、监控、人工审核与失败恢复。
实践:做端到端 Demo。
产物:可运行应用、演示视频和技术说明。
学习:离线与在线指标、A/B、回归。
实践:用 50-100 条任务评测。
产物:质量、成本、风险和迭代报告。
学习:岗位 JD、系统设计和案例面试。
实践:模拟面试与公开讲解。
产物:定向简历、作品集和 5 分钟演示。
必须包含:权限、混合检索、引用、拒答、评测集、失败样本、成本与更新机制。
必须包含:任务拆解、工具 schema、最小权限、确认节点、异常退出、日志和回滚。
必须包含:风险分级、测试集、评分标准、红队样本、结果分析和改进优先级。
问题:原流程每周处理 2,000 条工单,平均首响 4 小时。
行动:设计 RAG + 工具工作流,建立 120 条评测集与人工确认。
结果:首响缩短至 20 分钟,自动草稿采纳率 68%,错误引用率从 14% 降到 3%。
边界:高风险退款和账户操作保留人工审批。
进度保存在当前浏览器。每一项都以“能讲清、能比较、能做出”为完成标准。
Knowledge Check
测验不是记模型版本,而是检查你能否做出正确判断。提交后会显示答案与解释。
Sources & Maintenance
历史与基础原理相对稳定;模型版本、平台能力、价格、监管和就业数据需要定期复核。本页最后核对时间:2026-07-13。
历史、基本数学、经典架构和产品方法按年度复核。
模型版本、价格、上下文、API、平台功能按季度复核。
法律、医疗、金融与合规要求必须结合地区和具体用途咨询专业人士。