17 个阶段、6 个篇章:从计算机组成 · 数据结构 · 网络的硬底座,一路走到 RL 后训练 · 推理模型 · 世界模型 · Agent 工程 · Evals 与部署,全程由一个真实项目串起来 —— 学完即交付。
2026 年,AI 工程师的核心工作已经从“怎么问模型”转向“怎么设计模型的运行环境”。单纯会写 Prompt、会调 API 已经不够;决定成败的是上下文工程(Context Engineering)、驾驭工程(Harness Engineering)、评估与可观测、以及后训练与推理算力的调配。
为什么用「一个项目串到底」而不是每阶段一个小 demo:真实的工程能力体现在接口设计、性能取舍、失败恢复与长期维护上,而这些只有在一个持续演进的代码库里才会暴露。每阶段独立的小作业永远练不到「三个月后你还要回来改它」这件事。
| 里程碑 | 所属阶段 | 要交付什么 | 验收标准 |
|---|---|---|---|
| M1 | 阶段 01 · 编程与工程基础 | 仓库骨架与并发数据管线 | 在干净机器上 `git clone && docker compose up` 能跑通;CI 全绿;并发管线跑 1 万条样本不丢不重、中断后可续跑。 |
| M2 | 阶段 02 · 计算机组成原理 | 性能剖析与容量模型 | 能对任意一个慢算子给出「为什么慢」的定量解释(受限于什么资源、理论上限是多少、还差几倍),并给出至少一项已验证的优化。 |
| M3 | 阶段 03 · 数据结构与算法 | 从零实现检索索引 | 在 100 万条向量上达到 Recall@10 ≥ 0.95 且 QPS ≥ 暴力检索的 20 倍;复杂度分析(时间/空间/期望)能口头推导。 |
| M4 | 阶段 04 · 计算机网络 | 服务协议与流式网关 | 能画出一张完整的请求时序图(含握手、多路复用、流式分帧、超时与重试);在 10% 丢包 / 200ms 延迟的弱网模拟下,流式体验不中断且能自动重连。 |
| M5 | 阶段 05 · 数学与优化基础 | 从零反向传播与优化器 | 手写实现能在 MNIST 子集上训练到 >95% 测试准确率;能把一个失败训练案例归因到具体数学原因(如 LayerNorm 放错位置、初始化方差过大)。 |
| M6 | 阶段 06 · 机器学习基础 | 检索排序基线与指标体系 | 离线指标可复现(同一命令同一数字);能解释每一个指标「在什么场景下会误导你」;基线数字被冻结为后续所有改动的对照。 |
| M7 | 阶段 07 · 深度学习基础 | PyTorch 训练管线与实验追踪 | 训练中断后能从 checkpoint 精确续训(loss 曲线连续);任意一次实验都能凭记录还原出数据版本、配置与代码 commit。 |
| M8 | 阶段 08 · Transformer 与现代大模型架构 | 从零实现 GPT 并对齐开源权重 | 自研实现的输出与参考实现数值一致;能白板画出数据流并算清参数量、FLOPs 与 KV Cache 显存;对「为什么用 RoPE 而不是绝对位置编码」能给定量解释。 |
| M9 | 阶段 09 · 预训练、后训练与强化学习 | 领域微调与对齐 | 领域问答准确率相对基座提升 ≥ 15 个百分点且通用能力不显著退化;能解释 DPO 与 GRPO 的适用边界,并指出你这次为什么选它。 |
| M10 | 阶段 10 · 推理模型与测试时计算 | 推理链与验证器 | 在数学/多跳问答子集上,准确率相对单次生成提升 ≥ 10 个百分点;能画出「准确率-成本」曲线并说明你的预算策略在曲线的哪个位置、为什么。 |
| M11 | 阶段 11 · 多模态与生成模型 | 多模态理解与检索 | 在含图表的技术文档问答上,多模态 RAG 相对纯文本 RAG 的准确率显著提升;能算清一张图片在不同分辨率下折算多少 token、成本增加多少。 |
| M12 | 阶段 12 · 世界模型与具身智能 | 仿真环境中的决策 Agent(进阶) | 在仿真任务中成功率超过随机基线 3 倍以上;能定量说明长程任务里误差累积的机制与你的缓解手段。 |
| M13 | 阶段 13 · Context Engineering 与大模型应用开发 | 混合检索 RAG 管线 | 在自建评测集上端到端准确率显著优于朴素 RAG;有完整的消融表能说清每个组件的边际贡献;引用可核验率 ≥ 95%。 |
| M14 | 阶段 14 · Agent 工程 | MCP 工具生态与多 Agent 编排 | 能在 10 步以上的真实任务上稳定成功(成功率 > 70%);服务重启后能恢复未完成任务;所有危险工具调用都有审批记录。 |
| M15 | 阶段 15 · Evals、可观测性与 AI 安全 | 评测体系、护栏与可观测 | CI 能在指标退化时真的拦住合并;任意一次线上 badcase 都能凭 trace ID 复现并定位到具体环节;红队用例中高危项全部有缓解措施与回归测试。 |
| M16 | 阶段 16 · 推理优化与工程部署 | 推理优化、部署与压测 | 压测给出明确的容量结论(单卡支撑多少并发、P99 多少毫秒、每千次请求成本多少);灰度发布与回滚演练成功一次;有可视化的监控面板。 |
| M17 | 阶段 17 · 项目实战与求职准备 | 收口:整合、演示、复盘与求职 | 陌生人读完 README 能复现部署;你能在 5 分钟内讲清最难的三个技术决策及取舍,并回答「如果重做你会改什么」。 |
数学 → 深度学习 → Transformer → 预训练与 RL 后训练 → 推理模型 → 多模态。目标是能读懂并复现前沿论文、能主导模型训练与后训练实验。
工程基础 → 机器学习 → Transformer 原理 → Context Engineering → Agent 工程 → Evals → 部署与成本。目标是能独立交付可信赖的生产级 AI 系统。
深度学习 → Transformer → 多模态与生成(DiT / VLM)→ 世界模型 → 具身智能 VLA。目标是进入视频生成、机器人、自动驾驶等物理世界方向。
计算机组成 → 数据结构 → 网络 → 分布式训练 → 推理优化 → 服务化 → MLOps / LLMOps → 安全合规。目标是成为支撑别人训模型、跑模型的那个人。
| 阶段 | 主题 | 核心目标 | 周期 | 难度 | 里程碑 |
|---|---|---|---|---|---|
| 01 | 编程与工程基础 | 写出可维护、可并发、可部署的 AI 工程代码,并搭起贯穿全程的项目仓库 | 4–6 周(有后端经验可压到 2 周) | 入门 | M1 |
| 02 | 计算机组成原理 | 建立「程序在硬件上到底怎么跑」的性能直觉,能定量解释任何一个算子为什么慢 | 6–8 周 | 入门–进阶 | M2 |
| 03 | 数据结构与算法 | 既能在 40 分钟内干净解出中等面试题,也能亲手实现 RAG 与推理服务真正依赖的索引、缓存与调度结构 | 6–8 周 | 入门–进阶 | M3 |
| 04 | 计算机网络 | 能说清一个请求从点下按钮到拿到 token 的完整旅程,并为 AI 服务设计出正确的超时、重试、流式与背压策略 | 5–7 周 | 入门–进阶 | M4 |
| 05 | 数学与优化基础 | 看懂论文里的矩阵、梯度与概率推导 | 3–4 周 | 入门 | M5 |
| 06 | 机器学习基础 | 掌握全流程方法论与经典算法,建立评估直觉,并具备检索排序基线与指标体系能力 | 3–4 周 | 入门 → 进阶 | M6 |
| 07 | 深度学习基础 | 精通 PyTorch 训练流,理解网络为什么能学到东西,并具备训练管线与实验追踪能力 | 4–6 周 | 进阶 | M7 |
| 08 | Transformer 与现代大模型架构 | 讲透注意力,看懂 2026 年所有主流架构选择 | 5–6 周 | 进阶 · 重中之重 | M8 |
| 09 | 预训练、后训练与强化学习 | 掌握从原始语料到对齐模型的完整训练链路 | 6–8 周(优先级最高) | 高级 · 核心壁垒 | M9 |
| 10 | 推理模型与测试时计算 | 理解长思维链、验证器与推理算力的调配 | 4–5 周 | 高级 · 2026 新前沿 | M10 |
| 11 | 多模态与生成模型 | 掌握视觉语言模型与生成式建模的原理与落地 | 4–6 周 | 进阶 · 方向性 | M11 |
| 12 | 世界模型与具身智能 | 理解 AI 如何预测行动后果并在物理世界行动 | 4–6 周 | 进阶 · 前沿方向 | M12 |
| 13 | Context Engineering 与大模型应用开发 | 设计模型每轮看到的一切,交付可信的知识系统 | 5–6 周 | 核心 · 就业主力 | M13 |
| 14 | Agent 工程 | 交付可靠、可观测、可审批的生产级智能体 | 5–6 周 | 核心 · 就业主力 | M14 |
| 15 | Evals、可观测性与 AI 安全 | 让 AI 系统可测量、可回放、可审计、可信任 | 4–5 周 | 高级 · 最被低估 | M15 |
| 16 | 推理优化与工程部署 | 把模型跑得又快又省,并稳定服务线上流量 | 4–5 周 | 高级 · 工程壁垒 | M16 |
| 17 | 项目实战与求职准备 | 把能力变成作品,把作品变成机会 | 持续(与前面阶段并行) | 综合 | M17 |
先把「机器是怎么跑起来的」和「代码怎么交付」这两件事打穿。计算机组成原理给你性能直觉,数据结构与算法给你复杂度直觉,计算机网络给你分布式直觉,工程基础给你交付能力。这四门是后面所有内容的物理底座——不懂组成原理,你调不动 GPU;不懂网络,你做不好流式推理与 RPC。
把线性代数、概率、优化重新捡起来,并且是「为了看懂模型」而不是「为了考试」。然后从经典机器学习过渡到深度学习,建立「假设空间—损失—优化—泛化」这条主线,它是后面理解一切大模型训练技巧的坐标系。
本计划的重心。从 Transformer 架构的实现细节,到预训练 / SFT / RLHF / GRPO 的完整后训练链路,再到 2026 年成为标配的推理模型与测试时计算。学完这一篇,你具备「自己训练并改造一个模型」的能力。
多模态与生成模型、世界模型与具身智能。这两个方向决定了未来 3–5 年的岗位增量,也是「只会调文本模型」与「能做新产品形态」的分水岭。
把模型变成产品:上下文工程与 RAG、Agent 工程与 MCP 协议、评估与安全护栏、推理优化与部署。这一篇的产出直接决定你能不能独立交付一个线上 AI 系统。
把所有里程碑合并成一个可演示、可压测、可讲清楚的完整项目,并把它翻译成简历语言与面试话术。