资源截图
MP4 |视频:H.264,1920×1080 |音频:AAC,44.1 KHz,2 Ch
语言:英语 |时长:3小时40米
你将学到什么
- 掌握奖励模型的核心原则。
- 了解邻近策略优化 (PPO) 的架构和权衡。
- 了解直接偏好优化 (DPO) 的基础知识。
- 深入了解对齐漂移和 AI 安全。
要求
- 无需具备编码经验。
- 对人工智能、算法或计算机科学有基本兴趣。
- 无需安装软件或开发环境。
描述
本课程包含人工智能的使用。
无需编写代码即可了解人类反馈强化学习 (RLHF) 背后的理论。本课程解释现代人工智能系统如何通过数学直觉、系统设计和架构概念与人类偏好保持一致。
它专为 AI 工程师、研究人员、产品经理和技术爱好者而设计,让您清楚地了解 ChatGPT 式 AI 对齐背后的技术。
您将学到什么
- 为强化学习、优化和概率奠定基础。
- 了解为什么 AI 对齐对于大型语言模型至关重要。
- 了解人类反馈如何转变为训练信号。
- 探索奖励建模和偏好学习。
- 了解 PPO 和直接偏好优化 (DPO)。
- 研究联盟漂移、奖励黑客和分配变化。
- 分析可扩展性、内存和计算权衡。
- 了解 AI 治理、可解释性、公平性和审计。
课程内容
模块 1:数学基础
- 线性代数
- 概率与统计数据
- 优化基础知识
- 基于梯度的学习
- 强化学习数学
模块 2:强化学习基础知识
- 马尔可夫决策过程
- 政策与政策价值函数
- 奖励和奖励返回
- 探索与利用
- 政策优化
模块 3:AI 协调的基础
- 为什么 AI 协调很重要
- 人类偏好学习
- 调整目标
- 安全挑战
- 对齐管道
模块 4:奖励建模
- 偏好集合
- 配对排名
- 奖励功能
- 数据集构建
- 评估
模块 5:近端策略优化 (PPO)
- PPO 基础知识
- 政策更新
- 目标被裁剪
- 稳定优化
- RLHF 培训
模块 6:直接偏好优化 (DPO)
- DPO 基础知识
- 偏好学习
- 数学概念
- PPO 与 DPO
- 现代路线
模块 7:协调挑战
- 对齐漂移
- 分布变化
- 奖励黑客
- 稳健性
- 长期行为
模块 8:架构与架构系统权衡
- 计算与性能
- 内存使用情况
- 延迟优化
- 可扩展性
- 生产系统
模块 9:可解释性和可解释性人工智能治理
- 可解释的人工智能 (XAI)
- 模型审核
- 公平与公正偏差
- 负责任的人工智能
- 治理框架
模块 10:人工智能联盟的未来
- 宪法人工智能
- 偏好优化
- 人机协作
- 新兴研究
- 未来方向
为什么学习本课程?
- 无需编程经验。
- 专注于数学直觉和理论。
- 涵盖完整的 RLHF 流程。
- 了解 ChatGPT 式对齐背后的概念。
- 非常适合人工智能专业人士、研究人员和技术领导者。
- 积累有关 AI 协调原则的持久知识。
本课程适合谁
机器学习工程师、产品经理、AI 安全研究人员、AI 爱好者以及任何有兴趣了解现代 AI 一致性背后理论的人。


评分及评论
暂无评分
来评个分数吧