AI 算法工程师学习计划 2026 前沿版

17 个阶段、6 个篇章:从计算机组成 · 数据结构 · 网络的硬底座,一路走到 RL 后训练 · 推理模型 · 世界模型 · Agent 工程 · Evals 与部署,全程由一个真实项目串起来 —— 学完即交付。

17阶段
6篇章
74–106建议周期(周)
90+前沿更新点
2026-09-29最后更新
Capstone · 贯穿全程
Hamauls Orion — 私有化多模态推理 Agent 平台
不是 17 个互不相干的小练习,而是同一个项目:一个能理解你的文档与图片、能多步推理、能调工具、能接受评测、能上线扛压的企业级知识 Agent 平台。每个阶段结束,你都在这个仓库里多交付一块真实组件;第 17 阶段结束时,它已经是一个可以演示、可以压测、可以写进简历的完整系统。
Python 3.12 + uvPyTorch 2.xvLLM / SGLangFastAPI + gRPCRust(索引热路径,可选)Postgres + pgvectorRedisDocker + K8sOpenTelemetryReact + TypeScript

这份计划为什么不同

2026 年,AI 工程师的核心工作已经从“怎么问模型”转向“怎么设计模型的运行环境”。单纯会写 Prompt、会调 API 已经不够;决定成败的是上下文工程(Context Engineering)、驾驭工程(Harness Engineering)、评估与可观测、以及后训练与推理算力的调配。

补上硬底座
新增计算机组成原理、数据结构与算法、计算机网络三个独立阶段(第 2–4 阶段)。它们不是“科班补课”,而是 GPU 性能分析、向量索引实现、流式 RPC 设计的直接前置知识。
一个项目串到底
第 1–17 阶段共 17 个里程碑 M1–M17,全部落在同一个仓库 Hamauls Orion 上。阶段验收 = 里程碑验收,不存在“学完不知道干什么”。
内容写深不写薄
每个阶段都写到可动手的程度:机制解释 + 代码骨架 + 数字/公式 + 选型对比表 + 面试问答 + 常见误区。
ℹ
使用方式:先看下方四条路线判断自己该走哪条;再按总览表定位起点;然后逐阶段打开详情页。每个阶段页都很长,建议一次只推进一个阶段,把「学习目标」与「里程碑验收标准」当成双重清单。

贯穿项目:Hamauls Orion 的 17 个里程碑

为什么用「一个项目串到底」而不是每阶段一个小 demo:真实的工程能力体现在接口设计、性能取舍、失败恢复与长期维护上,而这些只有在一个持续演进的代码库里才会暴露。每阶段独立的小作业永远练不到「三个月后你还要回来改它」这件事。

里程碑所属阶段要交付什么验收标准
M1 阶段 01 · 编程与工程基础 仓库骨架与并发数据管线 在干净机器上 `git clone && docker compose up` 能跑通;CI 全绿;并发管线跑 1 万条样本不丢不重、中断后可续跑。
M2 阶段 02 · 计算机组成原理 性能剖析与容量模型 能对任意一个慢算子给出「为什么慢」的定量解释(受限于什么资源、理论上限是多少、还差几倍),并给出至少一项已验证的优化。
M3 阶段 03 · 数据结构与算法 从零实现检索索引 在 100 万条向量上达到 Recall@10 ≥ 0.95 且 QPS ≥ 暴力检索的 20 倍;复杂度分析(时间/空间/期望)能口头推导。
M4 阶段 04 · 计算机网络 服务协议与流式网关 能画出一张完整的请求时序图(含握手、多路复用、流式分帧、超时与重试);在 10% 丢包 / 200ms 延迟的弱网模拟下,流式体验不中断且能自动重连。
M5 阶段 05 · 数学与优化基础 从零反向传播与优化器 手写实现能在 MNIST 子集上训练到 >95% 测试准确率;能把一个失败训练案例归因到具体数学原因(如 LayerNorm 放错位置、初始化方差过大)。
M6 阶段 06 · 机器学习基础 检索排序基线与指标体系 离线指标可复现(同一命令同一数字);能解释每一个指标「在什么场景下会误导你」;基线数字被冻结为后续所有改动的对照。
M7 阶段 07 · 深度学习基础 PyTorch 训练管线与实验追踪 训练中断后能从 checkpoint 精确续训(loss 曲线连续);任意一次实验都能凭记录还原出数据版本、配置与代码 commit。
M8 阶段 08 · Transformer 与现代大模型架构 从零实现 GPT 并对齐开源权重 自研实现的输出与参考实现数值一致;能白板画出数据流并算清参数量、FLOPs 与 KV Cache 显存;对「为什么用 RoPE 而不是绝对位置编码」能给定量解释。
M9 阶段 09 · 预训练、后训练与强化学习 领域微调与对齐 领域问答准确率相对基座提升 ≥ 15 个百分点且通用能力不显著退化;能解释 DPO 与 GRPO 的适用边界,并指出你这次为什么选它。
M10 阶段 10 · 推理模型与测试时计算 推理链与验证器 在数学/多跳问答子集上,准确率相对单次生成提升 ≥ 10 个百分点;能画出「准确率-成本」曲线并说明你的预算策略在曲线的哪个位置、为什么。
M11 阶段 11 · 多模态与生成模型 多模态理解与检索 在含图表的技术文档问答上,多模态 RAG 相对纯文本 RAG 的准确率显著提升;能算清一张图片在不同分辨率下折算多少 token、成本增加多少。
M12 阶段 12 · 世界模型与具身智能 仿真环境中的决策 Agent(进阶) 在仿真任务中成功率超过随机基线 3 倍以上;能定量说明长程任务里误差累积的机制与你的缓解手段。
M13 阶段 13 · Context Engineering 与大模型应用开发 混合检索 RAG 管线 在自建评测集上端到端准确率显著优于朴素 RAG;有完整的消融表能说清每个组件的边际贡献;引用可核验率 ≥ 95%。
M14 阶段 14 · Agent 工程 MCP 工具生态与多 Agent 编排 能在 10 步以上的真实任务上稳定成功(成功率 > 70%);服务重启后能恢复未完成任务;所有危险工具调用都有审批记录。
M15 阶段 15 · Evals、可观测性与 AI 安全 评测体系、护栏与可观测 CI 能在指标退化时真的拦住合并;任意一次线上 badcase 都能凭 trace ID 复现并定位到具体环节;红队用例中高危项全部有缓解措施与回归测试。
M16 阶段 16 · 推理优化与工程部署 推理优化、部署与压测 压测给出明确的容量结论(单卡支撑多少并发、P99 多少毫秒、每千次请求成本多少);灰度发布与回滚演练成功一次;有可视化的监控面板。
M17 阶段 17 · 项目实战与求职准备 收口:整合、演示、复盘与求职 陌生人读完 README 能复现部署;你能在 5 分钟内讲清最难的三个技术决策及取舍,并回答「如果重做你会改什么」。

→ 查看完整项目说明书(架构、目录、接口、验收清单)

四条路线,按目标选

① 算法 / 研究路线

数学 → 深度学习 → Transformer → 预训练与 RL 后训练 → 推理模型 → 多模态。目标是能读懂并复现前沿论文、能主导模型训练与后训练实验。

适合:想做预训练 / 后训练 / 推理方向,或准备读研、投论文。

② 应用 / 工程路线(推荐给有工程背景的人)

工程基础 → 机器学习 → Transformer 原理 → Context Engineering → Agent 工程 → Evals → 部署与成本。目标是能独立交付可信赖的生产级 AI 系统。

适合:10 年 Java / 后端 / 全栈背景,想最快把经验变现。

③ 多模态与具身路线

深度学习 → Transformer → 多模态与生成(DiT / VLM)→ 世界模型 → 具身智能 VLA。目标是进入视频生成、机器人、自动驾驶等物理世界方向。

适合:对 CV、机器人、仿真、自动驾驶有兴趣。

④ 平台 / 基础设施路线

计算机组成 → 数据结构 → 网络 → 分布式训练 → 推理优化 → 服务化 → MLOps / LLMOps → 安全合规。目标是成为支撑别人训模型、跑模型的那个人。

适合:偏系统、运维、性能优化,喜欢 CUDA / 集群 / 高并发。

2026 必须补齐的前沿模块

NEW 01
计算机组成原理(新阶段)
流水线、缓存层级、内存墙、SIMT 与 GPU 存储层次、roofline 分析。让你能回答「这个算子为什么慢」而不是「换个库试试」。
NEW 02
数据结构与算法(新阶段)
不只刷题:手写 HNSW 向量索引、倒排索引与 BM25、LRU/LFU 缓存、优先队列调度器——这些就是 RAG 与推理服务的核心数据结构。
NEW 03
计算机网络(新阶段)
TCP/TLS 握手、HTTP/2 多路复用、SSE 与流式、gRPC、连接池与背压、超时与重试语义。直接对应你后面要写的流式推理网关。
NEW 04
RL 后训练与可验证奖励
RLVR、GRPO 家族(DAPO / GSPO / GMPO / CISPO)、Agentic RL(ARPO / Tree-GRPO)。这是 2026 年拉开模型差距的主战场。
NEW 05
推理模型与测试时计算
长思维链、推理预算控制、过程奖励模型 PRM、自我验证与搜索。把「思考时间」当成一种可调配的算力。
NEW 06
Context / Harness Engineering
上下文压缩、记忆分层、Token 预算、工具编排、失败恢复。模型能力之外的胜负手。
NEW 07
MCP / A2A 协议与长程 Agent
MCP 做工具、A2A 做协作。长程任务的状态管理、检查点与人工审批是生产门槛。
NEW 08
Evals / 可观测 / 红队
黄金数据集、LLM-as-Judge、回归门禁、Tracing、提示注入防御、EU AI Act 合规。大量团队只做了可观测却没做 Evals —— 差距就是机会。
NEW 09
世界模型与具身智能
VLA 端到端架构、世界模型从「预测下一帧」走向「预测动作后状态」、双系统(慢思考 + 快控制)。
NEW 10
统一多模态与长上下文
原生多模态取代拼接式架构;1M–10M 上下文、线性 / 混合注意力、MoE + Muon 优化器。
NEW 11
推理基建与成本
vLLM / SGLang、量化与投机解码、模型路由与缓存。Agent 的默认行为是遗忘和跑偏,基建决定它能不能连续跑一个月。
NEW 12
安全对齐与监管
RLHF→DPO→宪法 AI,多轮 / 多语言 / 多模态攻击面,Agent 工具通道的对齐盲区。

学习路线总览

阶段主题核心目标周期难度里程碑
01编程与工程基础 写出可维护、可并发、可部署的 AI 工程代码,并搭起贯穿全程的项目仓库4–6 周(有后端经验可压到 2 周)入门 M1
02计算机组成原理 建立「程序在硬件上到底怎么跑」的性能直觉,能定量解释任何一个算子为什么慢6–8 周入门–进阶 M2
03数据结构与算法 既能在 40 分钟内干净解出中等面试题,也能亲手实现 RAG 与推理服务真正依赖的索引、缓存与调度结构6–8 周入门–进阶 M3
04计算机网络 能说清一个请求从点下按钮到拿到 token 的完整旅程,并为 AI 服务设计出正确的超时、重试、流式与背压策略5–7 周入门–进阶 M4
05数学与优化基础 看懂论文里的矩阵、梯度与概率推导3–4 周入门 M5
06机器学习基础 掌握全流程方法论与经典算法,建立评估直觉,并具备检索排序基线与指标体系能力3–4 周入门 → 进阶 M6
07深度学习基础 精通 PyTorch 训练流,理解网络为什么能学到东西,并具备训练管线与实验追踪能力4–6 周进阶 M7
08Transformer 与现代大模型架构 讲透注意力,看懂 2026 年所有主流架构选择5–6 周进阶 · 重中之重 M8
09预训练、后训练与强化学习 掌握从原始语料到对齐模型的完整训练链路6–8 周(优先级最高)高级 · 核心壁垒 M9
10推理模型与测试时计算 理解长思维链、验证器与推理算力的调配4–5 周高级 · 2026 新前沿 M10
11多模态与生成模型 掌握视觉语言模型与生成式建模的原理与落地4–6 周进阶 · 方向性 M11
12世界模型与具身智能 理解 AI 如何预测行动后果并在物理世界行动4–6 周进阶 · 前沿方向 M12
13Context Engineering 与大模型应用开发 设计模型每轮看到的一切,交付可信的知识系统5–6 周核心 · 就业主力 M13
14Agent 工程 交付可靠、可观测、可审批的生产级智能体5–6 周核心 · 就业主力 M14
15Evals、可观测性与 AI 安全 让 AI 系统可测量、可回放、可审计、可信任4–5 周高级 · 最被低估 M15
16推理优化与工程部署 把模型跑得又快又省,并稳定服务线上流量4–5 周高级 · 工程壁垒 M16
17项目实战与求职准备 把能力变成作品,把作品变成机会持续(与前面阶段并行)综合 M17
Part 1 计算机与工程基础 4 个阶段 · 14–22 周

先把「机器是怎么跑起来的」和「代码怎么交付」这两件事打穿。计算机组成原理给你性能直觉,数据结构与算法给你复杂度直觉,计算机网络给你分布式直觉,工程基础给你交付能力。这四门是后面所有内容的物理底座——不懂组成原理,你调不动 GPU;不懂网络,你做不好流式推理与 RPC。

01
编程与工程基础 M1
现代 Python(类型标注 / Pydantic / 日志 / 异常分层)、asyncio 并发与限流重试、工程化与测试可复现、性能剖析、TypeScript 与流式 UI、SQL 进阶与数据质量、Git / Linux / Docker / CI。
PythonasyncioPydanticpytestTypeScript
4–6 周(有后端经验可压到 2 周)
02
计算机组成原理 M2
数据表示与浮点精度、指令流水线与乱序执行、存储层次与 Cache、内存墙与 roofline 模型、SIMD 与多核、GPU 的 SIMT 架构与存储层次、性能剖析与容量规划。
IEEE 754bf16/fp8Cache流水线内存墙
6–8 周
03
数据结构与算法 M3
复杂度分析与均摊、数组/链表/跳表/哈希表、树/堆/Trie、图与 DAG 调度、倒排索引与 BM25、HNSW 向量检索、LRU/LFU 缓存、布隆过滤器、BPE 分词、动态规划与序列对齐、面试算法收敛。
复杂度哈希表跳表堆Trie
6–8 周
04
计算机网络 M4
分层模型与延迟构成、IP 与数据中心网络、TCP 可靠传输与拥塞控制、TLS 1.3 与 mTLS、HTTP/1.1→2→3、SSE / WebSocket / gRPC 流式选型、超时预算与重试语义、熔断限流背压、抓包诊断、分布式训练的集合通信。
TCP拥塞控制BBRTLSHTTP/2
5–7 周
Part 2 数学与机器学习 3 个阶段 · 14–18 周

把线性代数、概率、优化重新捡起来,并且是「为了看懂模型」而不是「为了考试」。然后从经典机器学习过渡到深度学习,建立「假设空间—损失—优化—泛化」这条主线,它是后面理解一切大模型训练技巧的坐标系。

05
数学与优化基础 M5
线性代数(矩阵 / 特征值 / SVD / 低秩分解 / 谱与条件数)、概率统计(贝叶斯 / MLE / 信息论 / 采样解码)、微积分与最优化(反向传播 / AdamW / Muon / 学习率与缩放律)、强化学习数学基础(策略梯度 / GAE / PPO clip)。
线性代数概率论最优化信息论反向传播
3–4 周
06
机器学习基础 M6
学习范式与偏差-方差、正则化、树模型与 GBDT、特征工程与数据泄漏、评估指标与概率校准、交叉验证与切分、类别不平衡、检索与排序指标体系,以及 2026 年经典 ML 的真实定位。
SklearnXGBoostLightGBMCatBoost特征工程
3–4 周
07
深度学习基础 M7
从线性到 MLP(万能逼近与深度优势)、初始化、激活函数(含 SwiGLU)、归一化(RMSNorm / Pre-LN)、卷积归纳偏置、训练工程(BF16/FP8、梯度累积、梯度检查点、分布式 FSDP/ZeRO)、显存估算、训练调试清单、PyTorch 工程实践与实验追踪。
PyTorch反向传播RMSNormSwiGLU混合精度
4–6 周
Part 3 大模型核心 3 个阶段 · 16–22 周

本计划的重心。从 Transformer 架构的实现细节,到预训练 / SFT / RLHF / GRPO 的完整后训练链路,再到 2026 年成为标配的推理模型与测试时计算。学完这一篇,你具备「自己训练并改造一个模型」的能力。

08
Transformer 与现代大模型架构 M8
Attention 本质与复杂度、RoPE 与位置外推、RMSNorm / SwiGLU、MoE、MHA→GQA、FlashAttention、线性与混合注意力、Mamba、长上下文、Muon 优化器、主流模型架构横评。
TransformerAttentionRoPEMoEGQA
5–6 周
09
预训练、后训练与强化学习 M9
数据管线与配比、Scaling Law 与算力预算、冷启动 SFT、偏好对齐(RLHF / DPO / KTO)、可验证奖励 RL(RLVR / GRPO / DAPO / GSPO)、Agentic RL、蒸馏与合成数据、分布式训练基建。
PretrainingSFTRLHFDPOGRPO
6–8 周(优先级最高)
10
推理模型与测试时计算 M10
长思维链与思考预算、推理能力的 RL 训练、自我验证与过程奖励模型(PRM)、Best-of-N / 自洽性 / 树搜索、推理效率与成本控制、推理基准与污染问题。
ReasoningLong CoTPRMTest-Time ScalingSelf-Verification
4–5 周
Part 4 前沿方向 2 个阶段 · 8–12 周

多模态与生成模型、世界模型与具身智能。这两个方向决定了未来 3–5 年的岗位增量,也是「只会调文本模型」与「能做新产品形态」的分水岭。

11
多模态与生成模型 M11
视觉语言模型(ViT + 投影 + LLM)、原生多模态架构、扩散模型与 DiT / Flow Matching、图像与视频生成、语音与全模态、多模态数据与评测、部署成本。
VLMDiffusionDiTFlow Matching视频生成
4–6 周
12
世界模型与具身智能 M12
世界模型的三大架构家族与能力分级、VLA 端到端视觉语言动作模型、双系统(慢思考 + 快控制)、机器人数据与仿真、模仿学习与 RL、评测基准与落地场景。
World ModelVLA具身智能RoboticsFlow Matching
4–6 周
Part 5 应用工程与上线 4 个阶段 · 16–22 周

把模型变成产品:上下文工程与 RAG、Agent 工程与 MCP 协议、评估与安全护栏、推理优化与部署。这一篇的产出直接决定你能不能独立交付一个线上 AI 系统。

13
Context Engineering 与大模型应用开发 M13
上下文工程全要素、RAG 全流程与进阶(混合检索 / 重排 / Agentic RAG / GraphRAG)、记忆系统分层、Harness Engineering、结构化输出与工具调用、模型路由与成本控制。
Context EngineeringRAG向量数据库MemoryHarness
5–6 周
14
Agent 工程 M14
Agent 循环与设计模式、工具调用与 MCP 协议、A2A 与多 Agent 协作、长程任务状态管理、Computer Use / GUI Agent、生产化(可观测 / 评估 / 安全 / 成本)。
AgentMCPA2ALangGraphLong-horizon
5–6 周
15
Evals、可观测性与 AI 安全 M15
Evals 体系与黄金数据集、LLM-as-Judge 的偏见与校准、全链路 tracing、回归门禁、红队与对抗测试四大攻击面、对齐技术、EU AI Act 与 NIST 合规、纵深防御。
EvalsObservability红队红队测试对齐
4–5 周
16
推理优化与工程部署 M16
推理性能第一性原理(prefill/decode / 显存带宽)、vLLM 与 SGLang、量化(GPTQ / AWQ / FP8 / KV 量化)、连续批处理与投机解码、PD 分离、多卡部署、服务化、容量规划与成本核算。
vLLMSGLang量化KV CacheTP/PP/EP
4–5 周
Part 6 综合实战与求职 1 个阶段 · 6–10 周

把所有里程碑合并成一个可演示、可压测、可讲清楚的完整项目,并把它翻译成简历语言与面试话术。

17
项目实战与求职准备 M17
三个作品集项目、让仓库「可被验证」的 README 六段结构、简历六模块与量化写法、面试四轮考什么、系统设计六步框架与容量估算算例、高频原理题速查表、12 周求职时间线与三年职业路径。
作品集README简历面试系统设计
持续(与前面阶段并行)