LLM 推理优化与部署实战

LLM 推理优化与部署实战

吃透性能评估体系,掌握压缩与加速完整部署方案

¥199.9
本课程包括
  • 4小时28分钟的视频随时观看
  • 可在APP随时观看
  • 结业证书
你将收获
  • 学员能透彻理解 LLM 推理底层机制,搞懂预填充、解码两阶段差异与 KV‑Cache 显存膨胀根源,读懂 GPU 存储层级硬件约束,能够从底层定位大模型推理服务的延迟、显存、吞吐量瓶颈。
  • 学生可以掌握 LLM 推理完整性能评估体系,理解 TTFT、TPOT、端到端延迟、TPS 等核心指标,学会使用开源基准测试工具,结合业务 SLO 完成压测,定位服务最优运行工作点。
  • 学生能掌握系统运行时全套加速技术,理解 MHA/MQA/GQA、FlashAttention、PagedAttention、持续批处理的核心逻辑,具备结合业务场景选型推理架构、综合调优线上推理服务的工程实战能力。
浏览相关主题
课程介绍

做大模型推理部署经常遇到难题:KV‑Cache显存暴涨、TTFT首词延迟高、吞吐量上不去;看不懂TTFT、TPOT等性能指标,不会做业务基准压测;网上知识点零散,分不清AWQ/GPTQ、GQA/MQA、FlashAttention各类技术的适用边界;面对低延迟对话、高吞吐批处理不同业务场景,没有一套完整的瓶颈分析与方案选型思路。

👨‍🏫权威讲师

崔皓,大模型工程化实战讲师,深耕LLM部署、性能调优领域。课程源于真实线上项目复盘,剥离冗余理论,兼顾底层原理与工程落地,适配自学人群。

✨核心内容

  1. 全链路闭环体系:从推理底层机制、性能指标评测,到模型压缩算法、运行时系统加速,完整覆盖推理优化全流程,告别碎片化网络教程。

  2. 重原理更重选型:拆解各类主流优化技术的收益与取舍,不堆砌概念,教你结合显存、精度、业务SLO做方案判断,直接对接真实线上场景。

  3. 自学友好教学设计:由底层原理到工程实践循序渐进,关键概念、技术对比重点标注,可自由调节学习进度,学完即可用于服务调优。

  4. 多岗位适配,开发、运维、测试、架构人员都适用,既适合做技术能力提升,也可作为方案评估参考资料。

🎯学员收益

  1. 吃透LLM推理底层机制,理解预填充、解码阶段差异与KV‑Cache显存膨胀根源,看懂GPU硬件存储约束,能够定位推理服务的显存、延迟、吞吐量瓶颈。

  2. 掌握完整推理性能评估体系,读懂TTFT、TPOT、端到端延迟、TPS核心指标,熟练使用开源基准测试工具,依据业务SLO找到服务最佳工作点。

  3. 精通模型压缩优化方案,理解AWQ、GPTQ量化、剪枝、知识蒸馏原理与取舍,可结合业务精度、显存约束,完成模型压缩方案选型。

  4. 掌握运行时系统加速全套技术,理解MHA/MQA/GQA、FlashAttention、PagedAttention、持续批处理逻辑,具备业务场景下推理架构选型、线上服务综合调优的工程能力。

👥目标人群

  • 大模型算法、AI开发工程师:已掌握基础部署,受TTFT高、吞吐量不足、KV‑Cache显存爆炸困扰,需要系统学习推理优化手段

  • AI平台、后端运维工程师:负责线上推理落地,需要性能评测能力,解决显存、并发、延迟等工程难题

  • AI技术研究者、技术爱好者:熟悉大模型基础,希望吃透KV‑Cache,系统学习各类主流推理优化技术

  • 大模型测试、性能调优工程师:需要做基准压测,读懂性能指标,基于业务SLO做瓶颈定位与方案对比

  • 企业AI项目实施/架构人员:需要设计推理架构,缺少从瓶颈分析、评测到压缩加速的完整决策方法论

📑课程大纲

  1. 底层拆解:LLM推理机制与性能瓶颈分析|理解预填充、解码、KV‑Cache机制,看懂GPU硬件约束,学会定位推理各类性能问题

  2. 指标评测:推理性能体系与基准压测实战|吃透TTFT/TPOT/TPS指标,掌握开源评测工具,结合业务SLO定位服务最佳运行点

  3. 算法优化:模型压缩策略原理与方案选型|系统学习AWQ、GPTQ量化、模型剪枝、知识蒸馏,掌握不同压缩技术的取舍与适用场景

  4. 系统加速:运行时优化与推理架构落地|掌握MQA/GQA、FlashAttention、PagedAttention、持续批处理,完成业务推理架构选型与综合调优

❓FAQ(自学疑虑解答)

Q:需要什么前置基础?

A:掌握Linux基础,有大模型基础部署经验,学习效果更佳。

Q:学完之后可以做到什么?

A:能够分析推理服务性能瓶颈,完成指标评测,结合业务场景选择压缩与加速方案,开展线上推理服务调优。

立即获取这套超值知识资产,自由安排学习节奏,开启高效自学,掌握LLM推理优化部署核心技能!

适合人群
  • 后端运维工程师
  • AI 技术研究者
  • 企业 AI 项目实施 / 架构人员
讲师介绍
AI系统架构师
擅长领域:
  • DeepSeek
● 一句话定位: AI 讲师、大模型架构师 ● 核心背书: a. 著作:《大模型定制开发》《LangChain 实战:大模型应用开发实例 》《分布式架构原理与实践》 b. 教学战绩: AI 讲师、全网学员 20w+ c. 专业领域:AI 应用开发与架构设计、智能体集成与应用
课程大纲
共0节 时长0分钟 全部收起
课程内容介绍
2分钟
第一章 LLM推理基础与瓶颈分析
共9节 | 1小时14分钟
  • 第一节 预填充与解码阶段
    12分钟
  • 第二节 推理阶段与KVCache的关系
    6分钟
  • 第三节 LLM推理基础-生成KVCache过程推演
    12分钟
  • 第四节 为何需要对KVCache优化
    6分钟
  • 第五节 如何估算模型占用内存
    8分钟
  • 第六节 GPU内部运算原理与推理机制的关系
    13分钟
  • 第七节 列举LLM存储介质以及如何搬运参数
    5分钟
  • 第八节 优化思路-参数量化-运行时加速-IO优化
    4分钟
  • 章节总结
    7分钟
第二章 LLM 推理性能指标与评估
共8节 | 38分钟
  • 第一节 内容介绍
    2分钟
  • 第二节 推理评估指标全景图
    5分钟
  • 第三节 首词生成时间
    3分钟
  • 第四节 每词生成时间
    2分钟
  • 第五节 端到端的请求时间
    7分钟
  • 第六节 业务指标SLO
    6分钟
  • 第七节 评测过程与评测工具
    8分钟
  • 章节总结
    5分钟
第三章 算法优化:模型压缩策略
共9节 | 1小时12分钟
  • 第一节 内容介绍
    6分钟
  • 第二节 压缩策略-量化-剪枝-蒸馏
    9分钟
  • 第三节 模型量化前后使用的方法awq与gptq
    5分钟
  • 第四节 AWQ针对PPL的实验结果
    5分钟
  • 第五节 AWQ量化过程与实现
    11分钟
  • 第六节 GPTQ量化过程以及优化IO策略
    14分钟
  • 第七节 剪枝分类和过程详解
    8分钟
  • 第八节 模型蒸馏分类和应用场景
    8分钟
  • 章节总结
    7分钟
第四章 LLM系统优化:运行时加速方案
共10节 | 1小时15分钟
  • 第一节 内容介绍
    5分钟
  • 第二节 多头注意力机制原理与弊端
    7分钟
  • 第三节 多头注意力计算过程与分析
    5分钟
  • 第四节 MQA与GQA机制以及性能比较
    8分钟
  • 第五节 GPU运算与数据传输分析
    9分钟
  • 第六节 FlashAttention切块和算子融合
    8分钟
  • 第七节 PagedAttention原理解析
    13分钟
  • 第八节 持续批处理原理解析
    8分钟
  • 第九节 核心推理框架选型
    6分钟
  • 章节总结
    6分钟
第五章 LLM推理部署实战指导与总结
6分钟
购课须知

课程有效期:

自购买课程之日起 365 天,部分参与营销活动产品以活动规则为准,请同学在有效期内学习、观看课程。

上课模式:

课程采取录播模式,请注意自学课无班级微信群、班主任带班及助教批改服务。

注:自学课不支持退款,确保你是真的需要再进行报名,报完名之后还请认真学习。