Azure自定义视觉与NLP语言智能实战

Azure自定义视觉与NLP语言智能实战

从图像分类训练到文本分析,构建多模态AI应用能力

¥149.9
本课程包括
  • 4小时44分钟的视频随时观看
  • 可在APP随时观看
  • 结业证书
你将收获
  • 独立完成自定义计算机视觉模型的训练、评估与发布,具备为业务场景构建专属图像识别应用的能力。
  • 掌握Azure AI Video Indexer的视频分析能力,能够对企业视频资产进行自动内容理解、人物识别和语音提取。
  • 建立NLP文本分析的实战能力,包括情感分析、关键信息提取等,并能与视觉能力融合完成多模态应用开发。
  • 系统掌握TTS语音合成、STT语音识别、自定义语音模型和CLU语言理解模型,构建完整的语音交互与意图理解能力。
  • 通过Custom Vision与文本分析的融合实验,获得多模态AI应用的设计思路和可复用模板,能够独立规划和交付企业级多模态智能方案。
浏览相关主题
课程介绍

课程简介

AI正在从单一模态走向多模态融合,但大多数课程只教你做图像识别或只教你做文本分析——真正的企业级AI应用,需要同时看得懂图片、读得懂文字、听得懂语音。《Azure自定义视觉与NLP语言智能实战》就是一门帮你打通这三大能力、构建多模态AI应用实战能力的系统课程。

课程从计算机视觉切入,不只讲理论,而是带你完整走完自定义视觉模型的训练、评估与发布全流程。你将学会如何为业务场景(如质检、安防、零售识别)训练专属的图像分类和物体检测模型,并掌握模型上线前的关键评估指标和发布策略。

紧接着进入视频智能分析,通过Azure AI Video Indexer实现对视频内容的自动标注、人物识别、语音转写和情感分析,让海量的企业视频资产从"存着占空间"变成"可被检索、可被分析"的结构化知识。

课程的中间枢纽是NLP文本分析多模态融合实验——从文本分析入门到Custom Vision与文本分析的动手实验,你将亲眼看到图像识别与文本理解如何协同工作,解决单一模态无法应对的复杂业务场景。

最后课程进入语音智能深水区:从TTS语音合成和STT语音识别的基础能力,到自定义语音模型与意图识别的进阶应用,再到CLU语言理解模型的系统掌握,你将构建起从"听得见"到"听得懂"、从"说得出"到"说得准"的完整语音交互能力。

课程架构

本课程采用"视觉智能 → 视频分析 → 文本智能 → 多模态融合 → 语音交互"的五层递进架构:

第一层:视觉智能层(第1–2节)——聚焦自定义计算机视觉模型的全生命周期管理,从数据标注、模型训练到评估发布,掌握企业级图像识别应用的构建方法。

第二层:视频分析层(第3节)——引入Azure AI Video Indexer,将视觉能力延伸至动态视频场景,实现内容自动理解、人物追踪和语音提取,激活企业视频资产价值。

第三层:文本智能层(第4节)——进入NLP领域,掌握文本分析的基础能力,包括情感分析、关键短语提取和语言检测,建立自然语言理解的工程化认知。

第四层:多模态融合层(第5节)——以动手实验形式完成Custom Vision与文本分析的融合实战,体验图像+文本双模态协同解决复杂问题的完整流程,这是课程最具差异化的环节。

第五层:语音交互层(第6–8节)——系统覆盖TTS、STT、自定义语音、意图识别和CLU语言理解模型,构建从语音输入到语义理解的完整交互闭环。

核心特色

本课程最大的价值在于"多模态、全链路、强实战"——不局限于单一AI能力,而是串联视觉、文本、语音三大模态;每个模块都配有Azure平台的真实操作演示;最终通过融合实验和语音交互模块,产出可直接复用的多模态AI应用方案,学完就能推动企业智能化升级。

适合人群
  • 需要为企业构建图像识别、质量检测、安防监控等计算机视觉应用,希望系统掌握Azure Custom Vision全流程的开发者与工程师。
  • 负责处理企业海量视频资产(培训视频、会议录像、监控影像),希望实现视频内容智能分析和自动检索的技术人员。
  • 正在探索或落地NLP文本分析、智能客服、语音交互等自然语言处理应用,需要了解Azure AI全栈能力的AI工程师。
  • 希望掌握多模态AI融合思路,能够同时调用视觉、文本、语音能力解决复杂业务场景的架构师和技术负责人。
  • 负责企业AI项目选型与落地,需要了解Azure AI平台能力边界、评估多模态方案可行性的管理者和决策者。
讲师介绍
教育界的爱马仕,为你提供专业定制学习计划
擅长领域:
  • AIGC办公提效
  • 大语言模型
  • 元宇宙
  • 数字化营销战略
  • 数字化战略
  • AIGC行业应用
世达教育专业致力于国际IT认证培训及考试业务,致力于培养专业化技术技能人才,提供咨询、培训、认证考试、服务指导一条龙服务,授课范围包含但不限于红帽、思科、甲骨文、AWS、谷歌云、微软、阿里云等全球各大知名厂商的主流技术体系。 为企业员工提供专业化企业定制培训,包含但不限于人工智能、机器学习、供应链、数字化转型战略、Unity实战、云上相关实战课程等 世达在多云技术领域全国领先。作为专业的企业内训供应商,在不断提升培训质量和效率的同时,凭借专业的服务团队,雄厚的师资力量,为各位学子提供更优质的服务与课程体验。
课程大纲
共0节 时长0分钟 全部收起
第一节 自定义计算机视觉模型
45分钟
第二节 自定义视觉模型评估与发布
38分钟
第三节 视频分析:Azure AI Video Indexer
24分钟
第四节 NLP-文本分析入门
45分钟
第五节 动手实验:Custom Vision+文本分析
2分钟
第六节 语音处理-TTS&STT
48分钟
第七节 自定义语音&意图识别
39分钟
第八节 语言理解模型(CLU)
42分钟
购课须知

课程有效期:

自购买课程之日起 365 天,部分参与营销活动产品以活动规则为准,请同学在有效期内学习、观看课程。

上课模式:

课程采取录播模式,请注意自学课无班级微信群、班主任带班及助教批改服务。

注:自学课不支持退款,确保你是真的需要再进行报名,报完名之后还请认真学习。