本课程聚焦企业级大模型落地实战,围绕 K8s、VLLM、LiteLLM、vGPU 等核心技术,手把手讲解在容器集群中搭建高可用 AI 网关与大模型服务的完整流程,帮助技术人员打通从 GPU 资源管理到大模型上线的全链路工程化能力。
课程从基础原理入手,先讲解 K8s 管理 GPU 与大模型的技术架构,介绍 GPU Operator 组件,带领学员完成 GPU 环境准备、驱动安装、K8s 集群部署等基础实操。随后依次讲解动态存储 Longhorn、VLLM 模型部署方式、模型文件预下载等核心环节,落地大模型基础服务。
课程重点讲解高可用架构搭建,包含 LiteLLM 网关部署、Redis 哨兵、Postgres 高可用集群配置,同时演示 LiteLLM 的服务测试、RPM/TPM 限流、缓存功能等生产环境必备能力。课程后半段深入 GPU 虚拟化技术,讲解 HAMi 平台,实操 K8s 下 vGPU 虚拟化、显存调度、显卡类型指定调度,最终完成 VLLM 结合 vGPU 的大模型项目落地。
课程偏向工程实战,所有章节配套实操演示,适合有容器基础、计划在企业内部落地大模型平台的技术人员。通过学习,学员能够独立完成 K8s 集群 GPU 资源调度,搭建带限流、缓存能力的高可用 AI 网关,掌握 vGPU 虚拟化技术,具备企业大模型生产环境部署与运维能力,解决企业大模型落地过程中资源隔离、服务稳定性、流量管控等核心难题。
(课程介绍为 AI 配音)
课程有效期:
自购买课程之日起 365 天,部分参与营销活动产品以活动规则为准,请同学在有效期内学习、观看课程。
上课模式:
课程采取录播模式,请注意自学课无班级微信群、班主任带班及助教批改服务。
注:自学课不支持退款,确保你是真的需要再进行报名,报完名之后还请认真学习。