企业级大模型落地二:基于K8s、VLLM、LiteLLM、vGPU落地高可用AI网关和大模型

企业级大模型落地二:基于K8s、VLLM、LiteLLM、vGPU落地高可用AI网关和大模型

大模型云原生落地实战

¥99.9
本课程包括
  • 2小时11分钟的视频随时观看
  • 可在APP随时观看
  • 结业证书
你将收获
  • 1.掌握 K8s 管理 GPU 资源的整套技术架构,能够独立完成 GPU 环境准备、集群部署与 GPU Operator 安装配置。
  • 2.学会基于 VLLM、LiteLLM 搭建企业高可用 AI 网关,掌握限流、缓存等生产级大模型服务的调优与测试方法。
  • 3.理解 vGPU 虚拟化原理,可在 K8s 中实现显存调度、显卡类型指定调度,完成 VLLM+vGPU 大模型部署落地。
浏览相关主题
课程介绍

本课程聚焦企业级大模型落地实战,围绕 K8s、VLLM、LiteLLM、vGPU 等核心技术,手把手讲解在容器集群中搭建高可用 AI 网关与大模型服务的完整流程,帮助技术人员打通从 GPU 资源管理到大模型上线的全链路工程化能力。

课程从基础原理入手,先讲解 K8s 管理 GPU 与大模型的技术架构,介绍 GPU Operator 组件,带领学员完成 GPU 环境准备、驱动安装、K8s 集群部署等基础实操。随后依次讲解动态存储 Longhorn、VLLM 模型部署方式、模型文件预下载等核心环节,落地大模型基础服务。

课程重点讲解高可用架构搭建,包含 LiteLLM 网关部署、Redis 哨兵、Postgres 高可用集群配置,同时演示 LiteLLM 的服务测试、RPM/TPM 限流、缓存功能等生产环境必备能力。课程后半段深入 GPU 虚拟化技术,讲解 HAMi 平台,实操 K8s 下 vGPU 虚拟化、显存调度、显卡类型指定调度,最终完成 VLLM 结合 vGPU 的大模型项目落地。

课程偏向工程实战,所有章节配套实操演示,适合有容器基础、计划在企业内部落地大模型平台的技术人员。通过学习,学员能够独立完成 K8s 集群 GPU 资源调度,搭建带限流、缓存能力的高可用 AI 网关,掌握 vGPU 虚拟化技术,具备企业大模型生产环境部署与运维能力,解决企业大模型落地过程中资源隔离、服务稳定性、流量管控等核心难题。

(课程介绍为 AI 配音)

适合人群
  • 1.云原生 / 容器平台运维工程师
  • 2.AI 工程与模型部署工程师
  • 3.企业 IT 架构师、技术负责人
讲师介绍
某上市集团云原生架构师
擅长领域:
  • 运维安全
K8s金牌讲师,专注于K8s架构师、服务网格、Serverless、CKA/CKS 认证培训等; 目前在上市公司主要负责 K8s 集群架构设计、K8s 多集群资源管理平台开发、前沿技术调研及推进等。主导过大规模 K8s 多集群方案制定及落地,协助企业项目上云,实现无运维自动灾难恢复、自动扩容缩容等。
课程大纲
共0节 时长0分钟 全部收起
课程介绍(AI配音)
8分钟
1. 为什么要使用K8s管理GPU和大模型
9分钟
2. K8s管理GPU资源技术架构
5分钟
3. K8s GPU Operator介绍
3分钟
4.1 GPU环境准备
5分钟
4.2 GPU驱动安装
4分钟
4.3 K8s集群部署
8分钟
5. K8s GPU Operator部署
6分钟
6. K8s部署动态存储Longhorn
6分钟
7. K8s VLLM部署模型方式
6分钟
8. K8s模型文件预下载
4分钟
9. K8s通过VLLM部署大模型
6分钟
10.1 高可用LiteLLM部署架构
5分钟
10.2 K8s部署高可用Redis哨兵模式
7分钟
11. K8s部署高可用postgres
4分钟
12. K8s部署高可用AI网关Litellm
6分钟
13. Litellm测试
3分钟
14.1 Litellm RPM TPM限流(1)
5分钟
14.2 Litellm RPM TPM限流(2)
5分钟
15. Litellm缓存功能测试
1分钟
16.1 K8s GPU虚拟化调度平台HAMi介绍
9分钟
16.2 K8s实现GPU虚拟化
5分钟
17. K8s GPU虚拟化调度测试
2分钟
18. K8s GPU虚拟化指定显存调度
2分钟
19. K8s指定显卡类型调度GPU
3分钟
20. K8s使用VLLM+vGPU部署模型
4分钟
购课须知

课程有效期:

自购买课程之日起 365 天,部分参与营销活动产品以活动规则为准,请同学在有效期内学习、观看课程。

上课模式:

课程采取录播模式,请注意自学课无班级微信群、班主任带班及助教批改服务。

注:自学课不支持退款,确保你是真的需要再进行报名,报完名之后还请认真学习。