这份工作描述(JD)指向的是目前大模型领域非常核心且高薪的岗位:大模型推理优化工程师(LLM Inference Optimization),从背景描述来看,很可能是百度千帆大模型平台的岗位。
这个岗位要求候选人既要懂深度学习算法(Transformer 结构、量化、投机解码),又要具备极强的底层系统工程能力(C++/Python、CUDA、显存管理)。结合这种“算法+工程”双修的要求,以下是一份分为四个阶段的可行学习计划:
第一阶段:夯实大模型底层基础 (1-2周)
这个阶段的目标是彻底吃透 Transformer 的推理过程,这是后续所有优化的基石。对于早期的代码学习和小型模型原理验证,直接在 MacBook 上搭建 Python/PyTorch 本地环境就可以快速迭代,后续深入后再迁移到云端 GPU 服务器。
- 深入理解 Transformer 架构: 不要停留在理论层面,要能手写一个精简版的 Transformer。
- 拆解推理生命周期:
- Prefill(预填充阶段): 了解如何并行计算 prompt 的 Attention。
- Decode(解码阶段): 了解自回归生成时为什么是 Memory-bound(显存带宽瓶颈)。
- KV Cache: 这是推理优化的绝对核心。搞清楚 KV Cache 的显存占用计算公式,以及它为什么会限制 Batch Size。
第二阶段:掌握主流推理框架与系统工程 (3-4周)
线上大模型推理服务本质上是一个庞大的系统工程。在优化 vLLM 等框架时,排查服务器性能瓶颈、优化网络和并发调度的系统管理经验,会直接转化为提升吞吐量(Throughput)和降低首字延迟(TTFT)的利器。
- 精读 vLLM 源码与原理:
- 重点研究 PagedAttention 技术,理解它是如何利用操作系统的虚拟内存分页思想来解决 KV Cache 碎片的。
- 部署 vLLM 并进行压力测试,观察并发量上来时的显存和 GPU 利用率变化。
- 拓宽框架视野:
- 了解 SGLang(特别是其 RadixAttention 对 Prompt 缓存的优化)。
- 了解 TensorRT-LLM 的基础架构及其在工程落地上的优势。
第三阶段:攻克核心降本增效技术——量化与剪枝 (3-4周)
这是该岗位“工作职责”中明确要求的前沿技术落地部分。
- 模型量化 (Quantization):
- PTQ (训练后量化): 学习主流算法如 GPTQ、AWQ、SmoothQuant 的原理,并在开源模型(如 Llama 3 或 Qwen)上跑通 INT8/INT4 的量化流程。
- QAT (量化感知训练): 了解如何在训练阶段引入伪量化节点,这是该岗位明确提到的“加分项”。
- 前沿数据格式: 了解 FP8 的优势及其在 Hopper 架构 GPU 上的硬件支持。
- 结构化剪枝与稀疏化: 了解如何通过剪除模型中不重要的权重来压缩模型体积并加速推理。
第四阶段:进阶与前沿创新——投机解码 (Speculative Decoding) (持续进行)
投机解码是目前打破大模型自回归生成速度瓶颈的最热门方向,也是 JD 中反复提及的核心(MTP / Eagle / DFlash / Medusa)。这部分需要发挥学术研究中阅读文献和分析架构的能力。
- 基础概念: 理解“小模型草拟 (Draft) + 大模型验证 (Verify)”的核心思想。
- 重点论文阅读与复现:
- 精读 Medusa(通过增加额外的解码头来预测后续多个 token)。
- 精读 Eagle / Eagle 3(特征级别的自回归草拟)。
- 熟悉 MTP (Multi-Token Prediction) 在训练和推理协同优化中的实现。
- 训练-推理协同优化: 思考如何将投机解码的 Draft 模型与主模型的训练过程结合起来。
建议的行动路径:
- 准备环境: 租用一台带有一张或多张 24GB 显存显卡(如 RTX 3090/4090)的云服务器作为主力开发机。
- 开源实战: 不要只看论文,去 GitHub 上 Fork
vLLM或SGLang的仓库,挑一些简单的good first issue尝试提交 PR。 - 技术输出: 将你在量化或投机解码上的实验数据写成技术博客或报告,这能直接对应 JD 中“有技术报告发表”的加分项。