学习路线图
从零到面试的完整学习路径,建议 14-18 周
总体路线
Week 1-2: 入门篇 ────────── 了解 FDE,建立认知
Week 3-4: Transformer ─── 理解模型架构
Week 5-6: 推理引擎 ────── vLLM / TRT-LLM / SGLang
Week 7: 量化 + GPU ──── 量化方案、显存模型
Week 8: 分布式 ──────── TP / PP / DP
Week 9: 部署架构 ────── K8s、弹性、可观测性
Week 10: AI 工程 ────── Prompt / RAG / Agent / 评测
Week 11: 成本 + 前沿 ─── 成本优化、前沿跟踪
Week 12-14: 面试 + 管理 ── 答题框架、培养体系
Week 15: AI 商业工作流 ─ 业务流程编排、企业集成、业务指标
Week 16: 合规与安全 ─── 数据隐私、审计追溯、Prompt 安全
Week 17-18: 变更管理 ──── 灰度上线、ROI 度量、组织采纳
五维能力成长目标
完成学习后,你应该能够:
- 清晰解释 Transformer 架构和 Attention 机制
- 对比不同推理引擎的优劣和适用场景
- 选择合适的量化方案并解释 trade-off
- 理解 GPU 显存模型和性能瓶颈
- 设计多 GPU/多节点的推理部署架构
- 计算推理服务的成本并给出优化建议
- 设计 AI 商业工作流(Human-in-the-Loop、状态机、企业集成)
- 建立业务指标体系(技术指标到业务价值的映射)
- 设计数据隐私和合规方案(PII 处理、审计日志、Prompt 安全)
- 制定 AI 灰度上线和 ROI 度量计划
- 跟踪最新模型和技术动态
- 用结构化框架回答面试问题
- 展现 FDE 团队建设的体系思维
AI FDE 的"技能护城河"
顶尖 AI 岗位已经过了"会调 API 就能拿高薪"的阶段。2025-2026 年,企业真正稀缺的是具备复合能力的人才:
三层技能护城河:
第一层:技术深度(别人不会的你会)
- 不只是"会用 vLLM",而是理解 PagedAttention 的底层机制
- 不只是"做了量化",而是能对比 INT8/FP8/INT4 的精度-速度 trade-off
- 不只是"跑了模型",而是能做 kernel-level profiling 和调优
- 红队测试/AI 安全评估能力(Anthropic 等公司特别看重)
第二层:全栈工程能力(别人做不出来的你能)
- 能把一个模糊的 AI 想法变成生产级应用
- 包含:权限控制、仪表盘、容错机制、监控告警、弹性伸缩
- 不只是"模型能跑",而是"系统能稳定运行"
第三层:商业嗅觉(别人说不清的价值你能说清)
- 能用商业语言解释 AI 价值:提升了多少 CSAT、节省了多少成本
- 不只是堆砌技术指标(P99、QPS),而是讲业务影响
- 能判断"这个 AI 方案到底值不值得做"
学习方式建议
- 按顺序学习 — 每个阶段是下一个阶段的基础
- 结合实际经验 — 把你已有的工程经验(后端开发、运维、算法等)和新知识对照
- 做练习题 — 每个模块末尾有练习题和面试模拟题
- 整理项目故事 — 边学边整理你的真实项目,形成 STAR 故事
下一步:进入 进阶篇 — 模型架构