大模型后训练技术(Post-Training):从入门到精通

大模型后训练技术(Post-Training):从入门到精通

提升AI模型性能与应用效率,助力职业成长

¥69
本课程包括
  • 1小时53分钟的视频随时观看
  • 可在APP随时观看
  • 结业证书
你将收获
  • 体系化掌握后训练框架:理解大模型后训练全流程与前沿趋势,建立从基础到进阶的完整技术认知,打通理论与实践逻辑
  • 精通核心微调与对齐技术:熟练运用 SFT、PEFT、RLHF、DPO、GRPO 等关键方法,实现模型效率优化、行为对齐与强化学习升级
  • 落地垂直领域工程化能力:掌握测试时扩展、推理增强与 Agentic RL,独立完成行业大模型后训练、部署与业务落地
浏览相关主题
课程介绍

适合人群
  • 大模型算法工程师、AI 研发人员,需要系统学习模型微调与对齐技术的从业者
  • 人工智能产品、算法研究人员,希望理解大模型后训练原理并落地业务的技术人员
  • 想进入大模型赛道、提升核心竞争力,学习从微调到部署全流程的学习者
讲师介绍
500强企业算法专家、中国科学院大学博士
擅长领域:
  • DeepSeek
  • AIGC办公提效
  • 大语言模型
  • AIGC行业应用
  • 数字化战略
苏嘉昊,中国科学院大学博士,高级职称资深研究员,中国计算机学会高级会员。现任世界500强企业高级算法专家,兼任清华、北大、国科大等高校讲座导师。 深耕人工智能领域14年,长期专注于大语言模型、深度学习、推荐系统等核心方向,兼具前沿技术研究能力与复杂业务场景落地经验。曾主导多项重大AI产品与项目从0到1、从技术验证到业务落地,累计创造经济效益超10亿元。 长期为世界500强及政府机构提供AI培训与技术咨询,授课理论实战结合、深入浅出,广受学员认可,能够帮助学员快速建立系统认知并提升实战能力。
课程大纲
共0节 时长0分钟 全部收起
第一章 大模型后训练基础与前沿趋势
17分钟
第二章 监督微调(SFT)与数据工程核心
15分钟
第三章 参数高效微调(PEFT)与效率优化
13分钟
第四章 模型对齐(Alignment):从RLHF到DPO
15分钟
第五章 强化学习的新突破:GRPO与强化微调
14分钟
第六章 测试时扩展(Test-Time Scaling) 与推理增强
13分钟
第七章 Agentic RL:让大模型成为自治智能体
13分钟
第八章 垂直领域后训练实战与工程化落地
13分钟
购课须知

课程有效期:

自购买课程之日起 365 天,部分参与营销活动产品以活动规则为准,请同学在有效期内学习、观看课程。

上课模式:

课程采取录播模式,请注意自学课无班级微信群、班主任带班及助教批改服务。

注:自学课不支持退款,确保你是真的需要再进行报名,报完名之后还请认真学习。