做大模型推理部署经常遇到难题:KV‑Cache显存暴涨、TTFT首词延迟高、吞吐量上不去;看不懂TTFT、TPOT等性能指标,不会做业务基准压测;网上知识点零散,分不清AWQ/GPTQ、GQA/MQA、FlashAttention各类技术的适用边界;面对低延迟对话、高吞吐批处理不同业务场景,没有一套完整的瓶颈分析与方案选型思路。
崔皓,大模型工程化实战讲师,深耕LLM部署、性能调优领域。课程源于真实线上项目复盘,剥离冗余理论,兼顾底层原理与工程落地,适配自学人群。
全链路闭环体系:从推理底层机制、性能指标评测,到模型压缩算法、运行时系统加速,完整覆盖推理优化全流程,告别碎片化网络教程。
重原理更重选型:拆解各类主流优化技术的收益与取舍,不堆砌概念,教你结合显存、精度、业务SLO做方案判断,直接对接真实线上场景。
自学友好教学设计:由底层原理到工程实践循序渐进,关键概念、技术对比重点标注,可自由调节学习进度,学完即可用于服务调优。
多岗位适配,开发、运维、测试、架构人员都适用,既适合做技术能力提升,也可作为方案评估参考资料。
吃透LLM推理底层机制,理解预填充、解码阶段差异与KV‑Cache显存膨胀根源,看懂GPU硬件存储约束,能够定位推理服务的显存、延迟、吞吐量瓶颈。
掌握完整推理性能评估体系,读懂TTFT、TPOT、端到端延迟、TPS核心指标,熟练使用开源基准测试工具,依据业务SLO找到服务最佳工作点。
精通模型压缩优化方案,理解AWQ、GPTQ量化、剪枝、知识蒸馏原理与取舍,可结合业务精度、显存约束,完成模型压缩方案选型。
掌握运行时系统加速全套技术,理解MHA/MQA/GQA、FlashAttention、PagedAttention、持续批处理逻辑,具备业务场景下推理架构选型、线上服务综合调优的工程能力。
大模型算法、AI开发工程师:已掌握基础部署,受TTFT高、吞吐量不足、KV‑Cache显存爆炸困扰,需要系统学习推理优化手段
AI平台、后端运维工程师:负责线上推理落地,需要性能评测能力,解决显存、并发、延迟等工程难题
AI技术研究者、技术爱好者:熟悉大模型基础,希望吃透KV‑Cache,系统学习各类主流推理优化技术
大模型测试、性能调优工程师:需要做基准压测,读懂性能指标,基于业务SLO做瓶颈定位与方案对比
企业AI项目实施/架构人员:需要设计推理架构,缺少从瓶颈分析、评测到压缩加速的完整决策方法论
底层拆解:LLM推理机制与性能瓶颈分析|理解预填充、解码、KV‑Cache机制,看懂GPU硬件约束,学会定位推理各类性能问题
指标评测:推理性能体系与基准压测实战|吃透TTFT/TPOT/TPS指标,掌握开源评测工具,结合业务SLO定位服务最佳运行点
算法优化:模型压缩策略原理与方案选型|系统学习AWQ、GPTQ量化、模型剪枝、知识蒸馏,掌握不同压缩技术的取舍与适用场景
系统加速:运行时优化与推理架构落地|掌握MQA/GQA、FlashAttention、PagedAttention、持续批处理,完成业务推理架构选型与综合调优
Q:需要什么前置基础?
A:掌握Linux基础,有大模型基础部署经验,学习效果更佳。
Q:学完之后可以做到什么?
A:能够分析推理服务性能瓶颈,完成指标评测,结合业务场景选择压缩与加速方案,开展线上推理服务调优。
立即获取这套超值知识资产,自由安排学习节奏,开启高效自学,掌握LLM推理优化部署核心技能!
课程有效期:
自购买课程之日起 365 天,部分参与营销活动产品以活动规则为准,请同学在有效期内学习、观看课程。
上课模式:
课程采取录播模式,请注意自学课无班级微信群、班主任带班及助教批改服务。
注:自学课不支持退款,确保你是真的需要再进行报名,报完名之后还请认真学习。