基于 AI 算法工程师 17 阶段学习计划(2026 前沿版)的完整环境配置指南
你的 MacBook Pro M1 24GB 是一台相当不错的AI学习设备。关键在于理解它的统一内存架构:CPU和GPU共享同一块24GB内存,没有独立显卡的"显存墙"问题,模型加载容量直接取决于内存大小[1]。
M1 24GB 可以覆盖阶段 1–8 与阶段 13–15 的全部实践(工程基础、计算机组成、数据结构、网络、数学、ML、DL、Transformer、上下文工程、Agent、评估)。从阶段 9(预训练与后训练,含 LoRA/QLoRA 微调)开始,部分任务需要云 GPU 辅助;阶段 11–12(多模态生成、世界模型)与阶段 16(vLLM 部署)同样建议按需上云。
针对你的学习计划,我设计了三层环境架构,让你在不同阶段无缝切换:
flowchart TB
subgraph L1["第一层:Mac本地环境(阶段1-8、13-15主力)"]
A1["Python / Miniforge
编程基础 + 算法练习"]
A2["PyTorch MPS
深度学习训练(GPU加速)"]
A3["MLX Framework
Apple原生AI框架"]
A4["Ollama
本地LLM推理(7B模型)"]
end
subgraph L2["第二层:Linux/Docker环境(阶段1,4,16)"]
B1["OrbStack
Docker容器 + Linux VM"]
B2["Ubuntu ARM64
Linux命令/Shell/部署练习"]
B3["Docker实践
容器化、镜像构建、CI/CD"]
end
subgraph L3["第三层:云GPU环境(阶段9-12、16按需)"]
C1["AutoDL
RTX 4090 / A100 按小时租"]
C2["Google Colab
免费T4 GPU(学习用)"]
C3["vLLM部署实践
需CUDA环境"]
end
L1 -->|"阶段9、11-12需大显存"| L3
L1 -->|"阶段1,4,16需Linux"| L2
L2 -->|"阶段16部署实践"| L3
# 安装 Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
# 验证
brew --version
在Apple Silicon上,强烈推荐Miniforge而非Anaconda。Miniforge默认使用conda-forge频道,对ARM架构支持最好[2]。
# 下载 Apple Silicon 版本
brew install miniforge
# 初始化
conda init zsh
source ~/.zshrc
# 创建AI学习专用环境
conda create -n ai-learning python=3.11
conda activate ai-learning
# 验证 ARM 架构
python -c "import platform; print(platform.machine())"
# 输出 arm64 才正确
必须确认Python运行在 arm64 架构下,否则PyTorch的MPS后端不可用。如果输出 x86_64,说明装了Intel版本,需重新安装ARM版本[2]。
# 安装
brew install --cask visual-studio-code
# 推荐扩展
code --install-extension ms-python.python
code --install-extension ms-toolsai.jupyter
code --install-extension github.copilot
code --install-extension ms-azuretools.vscode-docker
code --install-extension redhat.vscode-yaml
# macOS自带Git,升级到最新版
brew install git
# 配置
git config --global user.name "你的名字"
git config --global user.email "你的邮箱"
git config --global init.defaultBranch main
| 工具 | 安装命令 | 用途 |
|---|---|---|
| Warp | brew install --cask warp | 现代化终端(推荐替代Terminal) |
| Raycast | brew install --cask raycast | 效率工具(替代Spotlight) |
| Rectangle | brew install --cask rectangle | 窗口管理 |
| Maccy | brew install --cask maccy | 剪贴板历史 |
在M1 Mac上,OrbStack是Docker Desktop的最佳替代品。它专为Apple Silicon深度优化,资源占用极低[3][4]。
| 指标 | Docker Desktop | OrbStack | 优势 |
|---|---|---|---|
| 启动时间 | 8-15秒 | 0.5-2秒 | 5-10x更快 |
| 内存占用 | 4-10GB | 0.5-2GB | 5x更省 |
| CPU效率 | 85-90% | 97-99% | 原生ARM |
| 网络带宽 | 8.4Gbps | 9.8Gbps | 零拷贝网络栈 |
| Linux VM | 仅容器后端 | 完整Linux VM | 可直接SSH进入 |
| 授权 | 大企业收费 | 个人免费 | 无商业限制 |
# 安装 OrbStack
brew install orbstack
# 启动后直接使用 Docker 命令(完全兼容)
docker --version
docker run -d -p 8080:80 --name mynginx nginx
# 创建 Linux VM(额外功能)
orb create ubuntu:24.04 my-linux
orb enter my-linux # 进入Linux环境
# 在Linux VM中,你可以像真实Linux服务器一样操作
apt update && apt install -y python3 python3-pip vim git
OrbStack同时提供Docker容器和Linux虚拟机能力。阶段1的Docker练习、Linux命令、Shell脚本全部在一套工具内完成,无需额外安装UTM或Parallels[3]。
如果需要更完整的Linux桌面环境(如练习GUI工具),可以用UTM创建ARM版Ubuntu虚拟机[5]。
# 安装 UTM
brew install --cask utm
# 下载 Ubuntu 24.04 ARM64 ISO
# https://cdimage.ubuntu.com/releases/24.04/release/ubuntu-24.04-desktop-arm64.iso
# UTM中新建虚拟机:
# - 类型:Virtualize(原生ARM虚拟化,性能好)
# - 系统:ARM64 (aarch64)
# - 内存:分配 8GB
# - CPU:4核
# - 磁盘:40GB
| 方案 | 适用场景 | 资源占用 | 推荐度 |
|---|---|---|---|
| OrbStack | Docker练习 + Linux命令 + 部署模拟 | 极低(0.5-2GB) | 首选 |
| UTM | 需要完整Linux桌面环境 | 中等(2-4GB) | 备选 |
| Parallels | 需要最佳性能和集成度 | 中等(2-3GB) | 付费 |
| Docker Desktop | 不推荐 | 高(4-10GB) | 不推荐 |
Docker Desktop在M1上存在内存泄漏问题,长期运行后内存占用可达8-15GB,严重影响系统流畅度[4]。OrbStack是明确的更优选择。
PyTorch从v1.12开始原生支持Apple Silicon的MPS(Metal Performance Shaders)后端,可调用M1的GPU进行加速训练[6][7]。你可以把MPS理解为"苹果版的CUDA"。
# 在 ai-learning 环境中安装
conda activate ai-learning
pip install torch torchvision torchaudio
# 验证 MPS 是否可用
python -c "
import torch
print(f'PyTorch版本: {torch.__version__}')
print(f'MPS可用: {torch.backends.mps.is_available()}')
print(f'MPS已构建: {torch.backends.mps.is_built()}')
"
# 在代码中使用 MPS(和CUDA写法几乎一样)
import torch
device = torch.device("mps" if torch.backends.mps.is_available() else "cpu")
print(f"使用设备: {device}")
# 模型搬到GPU
model = MyModel().to(device)
# 数据搬到GPU
data, target = data.to(device), target.to(device)
# 正常训练
output = model(data)
loss = criterion(output, target)
loss.backward()
optimizer.step()
M1的MPS后端训练速度约为CPU的3-5倍,但相比NVIDIA GPU(如RTX 4090)仍有较大差距。对于学习阶段的中小模型(MLP、CNN、RNN、小型Transformer),MPS完全够用[7]。统一内存架构让你无需担心"爆显存"问题,24GB可以训练比16GB显存显卡更大的batch size。
MLX是Apple专门为Apple Silicon设计的机器学习框架,支持LLM推理和微调[8][9]。在M1 Mac上,MLX可以完成QLoRA微调7B模型,这是你阶段9的重要工具。
# 安装 MLX
pip install mlx
pip install mlx-lm # LLM训练和推理
# 本地运行 7B 模型
python -c "
from mlx_lm import load, generate
model, tokenizer = load("mlx-community/Qwen2.5-7B-Instruct-4bit")
response = generate(model, tokenizer, prompt="解释Transformer架构", max_tokens=500)
print(response)"
# MLX LoRA 微调(阶段9实践)
# 使用 mlx-lm 的 LoRA 训练
python -m mlx_lm.lora \
--model mlx-community/Qwen2.5-7B-Instruct-4bit \
--data ./data/ \
--iters 500 \
--batch-size 2 \
--lora-layers 16
阶段7-8(DL/Transformer 学习):用 PyTorch + MPS,因为教程和课程代码都是 PyTorch。
阶段9(后训练与微调):小模型 QLoRA 可用 MLX 本地跑,大模型用云 GPU + PEFT/TRL。
阶段13-14(上下文工程/Agent 开发):用 Ollama 做本地 LLM 推理,MLX 作为备选。
Ollama让你像Docker拉取镜像一样简单地在本地运行大模型[10][11]。在M1 24GB上,7B量化模型运行流畅。
# 安装
brew install ollama
# 启动服务
ollama serve
# 拉取并运行模型(第一次会自动下载)
ollama run qwen2.5:7b # 通义千问7B(推荐,中文好)
ollama run llama3.2:3b # Llama 3.2 3B(更轻量)
ollama run nomic-embed-text # Embedding模型(RAG用)
# 查看已安装模型
ollama list
# 通过API调用(阶段13-14开发用)
curl http://localhost:11434/api/chat -d '{
"model": "qwen2.5:7b",
"messages": [{"role": "user", "content": "什么是RAG?"}]
}'
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:main
访问 http://localhost:3000 即可获得类ChatGPT界面
# 安装
pip install jupyter jupyterlab notebook
# 启动
jupyter lab
# 或在 VS Code 中直接使用 .ipynb 文件(推荐)
# 激活环境
conda activate ai-learning
# 核心AI库
pip install torch torchvision torchaudio # PyTorch + MPS
pip install mlx mlx-lm # Apple MLX
pip install transformers datasets accelerate # HuggingFace生态
pip install langchain langchain-community # LLM应用开发
pip install langgraph # Agent开发
pip install chromadb # 向量数据库
pip install fastapi uvicorn # API服务
pip install jupyter jupyterlab # 交互式notebook
pip install numpy pandas matplotlib seaborn # 数据科学
pip install scikit-learn # 机器学习
pip install peft trl # 微调工具(阶段9)
M1 Mac 不支持 CUDA,而阶段 9(后训练/微调)的全参训练、阶段 11–12(多模态/世界模型)的大规模训练,以及阶段 16(部署)的 vLLM 推理都需要 NVIDIA GPU。这时需要按需租用云GPU[12][13]。
| 平台 | RTX 4090 (24GB) | A100 (80GB) | 特点 | 推荐场景 |
|---|---|---|---|---|
| AutoDL | ~1.6元/时 | ~8-12元/时 | 镜像丰富、社区活跃、按分钟计费 | 首选 |
| 恒源云 | ~1.3元/时 | ~8-10元/时 | 价格低、学生优惠 | 备选 |
| Google Colab | 免费T4 | 付费 | 免费、但有限时和断连 | 学习 |
| 阿里云PAI | 较贵 | ~15-25元/时 | 稳定、资质全 | 企业 |
# 1. 注册:访问 autodl.com,充值50元即可开始
# 2. 选择实例
# - QLoRA微调7B -> RTX 4090(约2.5元/时)
# - 全参微调7B -> 4xA100 80GB(约40元/时)
# - vLLM部署 -> RTX 4090 或 A100
# 3. 环境配置(AutoDL预装PyTorch镜像)
pip install llama-factory flash-attn
pip install vllm # 阶段16部署用
# 4. 数据传输
scp -P 端口号 ./data/ root@region.autodl.com:/root/data/
# 5. 省钱技巧
# - 凌晨训练更便宜
# - 训练完立即关机
# - 无卡模式调试(0.1元/时)
# - CPU实例做数据预处理
阶段9微调:QLoRA 微调 7B 模型,约需 2-3 小时 RTX 4090,成本约5-8元[13]。整个阶段9、16云GPU总预算100-200元足够。用 无卡模式(0.1元/时)调试代码,确认无误后再开GPU跑训练。
| 任务 | 本地M1 | 云GPU | 说明 |
|---|---|---|---|
| 编程/算法练习 | 用 | 不需要 | 纯CPU任务 |
| DL训练(小模型) | 用MPS | 不需要 | MLP/CNN/RNN,MPS够用 |
| Transformer学习 | 用MPS | 不需要 | 手写Attention等 |
| 本地LLM推理 | 用Ollama | 不需要 | 7B量化模型流畅 |
| RAG/Agent开发 | 用Ollama | 不需要 | 本地推理+向量库 |
| QLoRA微调7B | MLX可跑 | 推荐 | MLX本地可跑,云GPU更快 |
| 全参微调7B | 不行 | 必须 | 需~80GB显存 |
| vLLM部署 | 不行 | 必须 | vLLM仅支持CUDA |
| K8s GPU调度 | 不行 | 必须 | 需NVIDIA k8s-device-plugin |
以下是 17 个学习阶段与环境的完整映射关系(2026 前沿版 v4.0):
| 阶段 | 内容 | 主要环境 | 关键工具 | 云GPU |
|---|---|---|---|---|
| 阶段1 编程与工程基础 |
Python/并发/工程化/Docker/CI | Mac本地 + OrbStack | Miniforge, VS Code, OrbStack(Docker), uv | 不需要 |
| 阶段2 计算机组成原理 |
数据表示/Cache/内存墙/Roofline/GPU 架构 | Mac本地 | py-spy, perf, PyTorch profiler, ncu(云) | 不需要 |
| 阶段3 数据结构与算法 |
复杂度/树图/倒排索引/HNSW/缓存 | Mac本地 | Python, NumPy, hnswlib(对照), pytest-benchmark | 不需要 |
| 阶段4 计算机网络 |
TCP/TLS/HTTP2-3/SSE/gRPC/可靠性 | Mac本地 + OrbStack(Linux) | OrbStack, tcpdump/Wireshark, tc netem, curl | 不需要 |
| 阶段5 数学与优化 |
线性代数/概率统计/微积分/凸优化 | Mac本地 | Jupyter, NumPy, SymPy, Matplotlib | 不需要 |
| 阶段6 机器学习 |
监督学习/树模型/特征工程/评估 | Mac本地 | scikit-learn, Pandas, LightGBM | 不需要 |
| 阶段7 深度学习 |
CNN/RNN/训练循环/PyTorch | Mac本地(MPS) | PyTorch + MPS, Jupyter | 不需要 |
| 阶段8 Transformer 与 LLM 架构 |
Attention/RoPE/权重对齐/KV Cache | Mac本地(MPS) | PyTorch + MPS, Transformers, Ollama | 可选 |
| 阶段9 预训练与后训练(RL) |
预训练/LoRA·QLoRA/DPO/GRPO/RLHF | Mac(MLX) + 云GPU | MLX 本地 QLoRA / AutoDL + PEFT + TRL | 需要 |
| 阶段10 推理模型与测试时计算 |
CoT/长思考/自一致性/PRM/搜索 | Mac本地 + 云GPU | Transformers, vLLM(小模型), 云 GPU API | 可选 |
| 阶段11 多模态与生成模型 |
扩散/视频生成/VLM/统一架构 | Mac本地 + 云GPU | Diffusers, MLX-VLM, 云 GPU 训练 | 按需 |
| 阶段12 世界模型与具身智能 |
世界模型/VLA/仿真/机器人 | 云GPU | 仿真环境(MuJoCo/Isaac), 云 GPU 训练推理 | 按需 |
| 阶段13 上下文工程与应用 |
RAG/Prompt/向量库/工具调用 | Mac本地 | Ollama, LangChain, pgvector/Chroma, FastAPI | 不需要 |
| 阶段14 Agent 工程 |
ReAct/多Agent/MCP·A2A/记忆 | Mac本地 | Ollama, LangGraph, MCP SDK | 不需要 |
| 阶段15 评估·可观测·安全 |
Evals/红队/对齐/护栏/追踪 | Mac本地 | Ragas, promptfoo, OpenTelemetry | 不需要 |
| 阶段16 推理优化与部署 |
vLLM/量化/FastAPI/Docker/K8s | OrbStack + 云GPU | AutoDL(vLLM), OrbStack(Docker), k6/Locust | 需要 |
| 阶段17 综合项目与求职 |
贯穿项目收口/压测/文档/面试 | 全环境 | 按项目需求灵活组合 | 按需 |
#!/bin/bash
# === M1 Mac AI学习环境一键配置脚本 ===
# 1. 安装 Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
# 2. 安装核心工具
brew install miniforge git wget
brew install --cask visual-studio-code warp orbstack ollama
# 3. 配置 Python 环境
conda init zsh
source ~/.zshrc
conda create -n ai-learning python=3.11 -y
conda activate ai-learning
# 4. 安装 AI 库
pip install torch torchvision torchaudio
pip install mlx mlx-lm
pip install transformers datasets accelerate
pip install langchain langchain-community langgraph
pip install chromadb fastapi uvicorn
pip install jupyter jupyterlab
pip install numpy pandas matplotlib seaborn scikit-learn
# 5. 验证
echo "=== 环境验证 ==="
python -c "import platform; print(f'架构: {platform.machine()}')"
python -c "import torch; print(f'PyTorch: {torch.__version__}, MPS: {torch.backends.mps.is_available()}')"
python -c "import mlx; print(f'MLX已安装')"
ollama --version
docker --version
echo "=== 配置完成 ==="
echo "下一步: ollama run qwen2.5:7b # 下载并运行7B模型"
# 日常启动流程
conda activate ai-learning # 激活Python环境
ollama serve & # 后台启动Ollama(如果没启动)
code . # 打开VS Code
# 如果需要Docker/Linux
open -a OrbStack # 启动OrbStack
# 如果需要Jupyter
jupyter lab # 或在VS Code中直接打开.ipynb
# === AutoDL 使用流程 ===
# 1. 在 autodl.com 租用 RTX 4090 实例
# 2. 选择 PyTorch 镜像(预装CUDA + PyTorch)
# 3. SSH连接
ssh -p 端口号 root@region.autodl.com
# 4. 安装额外依赖
pip install llama-factory flash-attn peft trl
pip install vllm # 阶段16用
# 5. 从ModelScope下载模型(国内速度快)
pip install modelscope
modelscope download --model Qwen/Qwen2.5-7B-Instruct
# 6. 训练/推理
# ...(按学习计划执行)
# 7. 关机省钱
# 在AutoDL控制台点击"关机"(无卡模式0.1元/时)
本地优先,按需上云。M1 24GB是优秀的学习设备,80%的实践在本地完成。只在阶段9(后训练/微调)、阶段11-12(多模态/世界模型)和阶段16(vLLM 部署)需要云 GPU,总云费用预计 100-200 元。
Docker/Linux/CI-CD 是你的舒适区,OrbStack 环境让你阶段1的工程部分与阶段4 的网络实验快速通过。阶段16的部署部分(FastAPI + Docker + K8s)也可以压缩,只需在云 GPU 上学习 vLLM 和量化等 AI 特有知识。省下的时间集中攻克数学和DL原理。