价格: 49 学币

分类: AIGC

发布时间: 2026-07-25 15:02:48

最近更新: 2026-08-28 17:31:56

资源类型: SVIP

优惠: 开通钻石SVIP免费获取此资源

慕课 AI大模型微调,从原理剖析到企业级落地实战

课程介绍

大模型微调能力已成为高薪AI工程师的核心竞争力,本课程聚焦高效微调(LoRA/QLoRA)、强化学习微调(PPO/RLHF/DPO/GRPO)、数据工程(SFT/COT/偏好数据集)、模型蒸馏、Embedding微调(RAG优化)等全栈技术,并以金融大模型SFT到奖励模型再到GRPO全链路落地为实战核心,手把手带你提升从模型选型、数据构建、多机分布式训练、效果评估到部署的工程实战力,助你成为“懂业务、会微调、能落地”的高阶AI人才。

资源目录

.
├── 第1章 模型高效微调原理剖析/
│   ├── [ 56M]  1-1课程介绍
│   ├── [ 48M]  1-2高效微调原理之什么场景需要微调?
│   ├── [ 36M]  1-3高效微调原理之什么场景需要RAG?
│   ├── [ 80M]  1-4高效微调原理之微调和全量微调的区别
│   ├── [108M]  1-5高效微调原理之预训练的流程
│   ├── [ 70M]  1-6高效微调原理之预训练的两个挑战
│   ├── [ 45M]  1-7高效微调原理之预训练之网络通信
│   ├── [ 71M]  1-8高效微调原理之预训练之数据并行
│   ├── [ 61M]  1-9高效微调原理之预训练之模型并行
│   ├── [ 54M]  1-10高效微调原理之预训练之3D并行
│   ├── [ 60M]  1-11高效微调原理之微调步骤
│   ├── [209M]  1-12高效微调原理之LoRA原理
│   └── [ 90M]  1-13高效微调原理之QLoRA原理
├── 第2章 大模型强化学习原理剖析/
│   ├── [ 70M]  2-1强化学习微调之什么是强化学习?
│   ├── [ 48M]  2-2强化学习微调之什么是PPO?
│   ├── [ 24M]  2-3强化学习微调之什么是RLHF?
│   ├── [ 59M]  2-4强化学习微调之什么是DPO?
│   └── [ 46M]  2-5强化学习微调之什么是GRPO?
├── 第3章 大模型训练数据工程/
│   ├── [ 70M]  3-1大模型微调数据的重要性
│   ├── [ 64M]  3-2大模型微调数据格式划分
│   ├── [ 69M]  3-3大模型微调预训练数据集
│   ├── [ 42M]  3-4大模型微调SFT数据集
│   ├── [ 28M]  3-5大模型微调偏好数据集
│   ├── [ 86M]  3-6大模型微调COT数据集
│   ├── [ 50M]  3-7大模型微调数据集生成实战
│   ├── [ 47M]  3-8大模型微调数据集工具部署
│   ├── [ 51M]  3-9大模型微调数据集构建实操-构建COT数据集
│   ├── [ 71M]  3-10大模型微调数据集构建实操-构建SFT数据集
│   └── [ 41M]  3-11大模型微调数据集构建实操-构建偏好数据集
├── 第4章 Llama-Factory 微调实战/
│   ├── [ 88M]  4-1Llama-Factory微调之项目介绍
│   ├── [112M]  4-2Llama-Factory微调之项目安装
│   ├── [154M]  4-3Llama-Factory微调之模型和数据准备
│   ├── [ 88M]  4-4Llama-Factory微调之LoRa微调实战
│   ├── [ 35M]  4-5Llama-Factory微调之模型效果验证
│   ├── [ 80M]  4-6Llama-Factory微调之核心参数剖析
│   ├── [161M]  4-7Llama-Factory微调之接入Tensorboard监控
│   ├── [ 63M]  4-8Text2SQL模型微调之数据集格式说明
│   ├── [ 55M]  4-9Text2SQL模型微调之数据集准备
│   ├── [106M]  4-10Text2SQL模型微调之数据处理
│   ├── [ 52M]  4-11Text2SQL模型微调之数据集注册
│   ├── [ 41M]  4-12Text2SQL模型微调之微调实战
│   ├── [ 32M]  4-13Text2SQL模型微调之模型效果校验
│   ├── [ 93M]  4-14Text2SQL模型微调之什么是DeepSpeed?
│   └── [101M]  4-15Text2SQL模型微调之基于DeepSpeed实战
├── 第5章 微调医疗场景 Embedding 模型/
│   ├── [ 82M]  5-1Embedding模型微调之RAG痛点分析
│   ├── [ 36M]  5-2Embedding模型微调之适用场景剖析
│   ├── [ 32M]  5-3Embedding模型微调之基础模型选型
│   ├── [ 88M]  5-4Embedding模型微调之数据集准备
│   ├── [151M]  5-5Embedding模型微调之技术方案选型
│   ├── [141M]  5-6Embedding模型微调之环境准备
│   ├── [ 50M]  5-7Embedding模型微调之基础模型校验
│   ├── [ 79M]  5-8Embedding模型微调之数据集校验
│   ├── [ 35M]  5-9Embedding模型微调之数据集清洗
│   ├── [ 86M]  5-10Embedding模型微调之微调流程演示
│   ├── [154M]  5-11Embedding模型微调之微调数据准备核心逻辑
│   ├── [ 80M]  5-12Embedding模型微调之微调核心代码
│   └── [ 63M]  5-13Embedding模型微调之微调效果检验
├── 第6章 蒸馏专属大模型/
│   ├── [112M]  6-1模型蒸馏之蒸馏和微调的本质区别
│   ├── [ 85M]  6-2模型蒸馏之微调和全量微调的本质区别
│   ├── [ 83M]  6-3模型蒸馏之为什么蒸馏方案突然火了起来?
│   ├── [ 29M]  6-4模型蒸馏之模型推理能力的重要性
│   ├── [ 50M]  6-5模型蒸馏之蒸馏流程剖析
│   ├── [ 54M]  6-6模型蒸馏之全量微调工具推荐
│   ├── [ 59M]  6-7模型蒸馏之资源评估和服务器租赁
│   ├── [ 70M]  6-8模型蒸馏之基础模型下载
│   ├── [ 70M]  6-9模型蒸馏之全量微调工具安装部署
│   ├── [ 53M]  6-10模型蒸馏之蒸馏数据格式说明
│   ├── [ 36M]  6-11模型蒸馏之基础模型效果测试
│   ├── [162M]  6-12模型蒸馏之蒸馏数据集准备
│   ├── [229M]  6-13模型蒸馏之基于Llama-Factory进行全量微调
│   └── [ 34M]  6-14模型蒸馏之模型蒸馏前后效果对比
└── 第7章 企业金融大模型微调项目—SFT 方案设计与落地/
    ├── [ 73M]  7-1整体项目之项目背景
    ├── [ 34M]  7-2整体项目之项目需求
    ├── [ 38M]  7-3整体项目之技术方案
    ├── [ 37M]  7-4SFT微调之微调技术流程
    ├── [ 67M]  7-5SFT微调之数据集选择
    ├── [ 62M]  7-6SFT微调之模型选型
    ├── [ 89M]  7-7SFT微调之微调方案选型
    ├── [151M]  7-8SFT微调之数据集构建-数据集解析
    ├── [ 39M]  7-9SFT微调之数据集构建-数据构建策略
    ├── [140M]  7-10SFT微调之数据集构建-单轮数据集构建
    ├── [ 97M]  7-11SFT微调之数据集构建-多轮数据集构建
    ├── [127M]  7-12SFT微调之LoRa微调-微调技术方案选型
    ├── [130M]  7-13SFT微调之LoRa微调-微调技术方案设计思考
    ├── [ 50M]  7-14SFT微调之LoRa微调-微调环境构建
    ├── [ 39M]  7-15SFT微调之LoRa微调-微调基座模型下载
    ├── [106M]  7-16SFT微调之LoRa微调-数据样本初始化
    ├── [ 82M]  7-17SFT微调之LoRa微调-数据处理
    ├── [115M]  7-18SFT微调之LoRa微调-LoRA参数配置
    ├── [106M]  7-19SFT微调之LoRa微调-SFT微调参数配置
    ├── [ 46M]  7-20SFT微调之LoRa微调-创建数据整理器
    ├── [ 94M]  7-21SFT微调之LoRa微调-基础模型加载
    ├── [ 34M]  7-22SFT微调之LoRa微调-模型评估内存优化回调函数
    ├── [ 76M]  7-23SFT微调之LoRa微调-最佳模型保存函数
    ├── [ 58M]  7-24SFT微调之LoRa微调-最后模型保存函数
    ├── [ 32M]  7-25SFT微调之LoRa微调-模型微调的早停机制
    ├── [ 21M]  7-26SFT微调之LoRa微调-微调的checkpoints机制设置
    ├── [ 74M]  7-27SFT微调之LoRa微调-DeepSeed分布式参数配置
    ├── [ 77M]  7-28SFT微调之LoRa微调-TensorBoard可视化监控
    ├── [128M]  7-29SFT微调之LoRa微调-核心监控指标之train_loss分析
    ├── [ 35M]  7-30SFT微调之LoRa微调-核心监控指标之eval_loss分析
    ├── [ 67M]  7-31SFT微调之LoRa微调-核心监控指标之learning_rate分析
    ├── [ 66M]  7-32SFT微调之LoRa微调-核心监控指标之grad_norm分析
    ├── [100M]  7-33SFT微调之LoRa微调-多轮对话微调数据处理
    ├── [ 54M]  7-34SFT微调之LoRa微调-微调效果评估之ROUGE指标
    ├── [ 25M]  7-35SFT微调之LoRa微调-微调效果评估之Perplexity指标
    ├── [ 42M]  7-36SFT微调之LoRa微调-微调效果评估之评估效果说明
    └── [111M]  7-37SFT微调之LoRa微调-微调效果评估之SFT模型部署
├── 第8章 企业金融大模型微调项目—奖励模型方案设计与落地/
│   ├── [ 28M]  8-1奖励模型之需求背景分
│   ├── [ 67M]  8-2奖励模型之为什么选GRPO?
│   ├── [ 66M]  8-3奖励模型之为什么GRPO必须微调奖励模型?
│   ├── [ 25M]  8-4奖励模型之整体流程设计
│   ├── [109M]  8-5奖励模型之微调数据集构建方案思考
│   ├── [109M]  8-6奖励模型之微调数据集构建策略
│   ├── [105M]  8-7奖励模型之微调数据集构建脚本执行
│   ├── [ 67M]  8-8奖励模型之奖励模型训练路径分析
│   ├── [ 82M]  8-9奖励模型之基于RewardBench排行榜选型
│   ├── [184M]  8-10奖励模型之奖励模型选型
│   ├── [ 76M]  8-11奖励模型之微调方案技术选型
│   ├── [ 26M]  8-12多机多卡环境之方案设计
│   ├── [ 75M]  8-13多机多卡环境之分布式推理部署方案设计
│   ├── [ 60M]  8-14多机多卡环境之主机规划
│   ├── [ 50M]  8-15多机多卡环境之多机免密
│   ├── [ 37M]  8-16多机多卡环境之conda环境安装
│   ├── [ 50M]  8-17多机多卡环境之开源模型下载
│   ├── [ 31M]  8-18多机多卡环境之同步虚拟环境
│   ├── [ 46M]  8-19多机多卡环境之创建共享目录
│   ├── [ 34M]  8-20多机多卡环境之pdsh工具安装
│   ├── [ 24M]  8-21多机多卡环境之设置hosts地址
│   ├── [ 18M]  8-22多机多卡环境之Ray集群启动
│   ├── [ 67M]  8-23多机多卡环境之模型分布式推理测试
│   ├── [ 37M]  8-24多机多卡环境之分布式微调环境构建
│   ├── [ 91M]  8-25奖励模型之项目脚本设计
│   ├── [ 53M]  8-26奖励模型之奖励模型微调思路
│   ├── [114M]  8-27奖励模型之全流程代码设计
│   ├── [ 34M]  8-28奖励模型之开源奖励模型安装部署
│   ├── [ 90M]  8-29奖励模型之多机多卡分布式微调演练
│   ├── [ 72M]  8-30奖励模型之分布式环境启动
│   ├── [ 52M]  8-31奖励模型之效果校验脚本开发
│   └── [ 26M]  8-32奖励模型之微调效果校验
└── 第9章 企业金融大模型微调项目—GRPO 方案设计与落/
    ├── [ 87M]  9-1强化学习之为什么需要GRPO?
    ├── [ 27M]  9-2强化学习之GRPO落地的方案选型
    ├── [109M]  9-3强化学习之GRPO数据准备
    ├── [ 49M]  9-4强化学习之GRPO环境准备
    ├── [185M]  9-5强化学习之GRPO代码设计
    ├── [ 92M]  9-6强化学习之GRPO流程演示
    └── [ 23M]  9-7项目总结
└── 资料代码/