MP4 |视频:h264,1920×1080 |音频:AAC、44.1 KHz、2 Ch
级别:所有级别 |类型: 电子学习 |语言: 英语 |时长:64 个讲座 (34m)
你将学到什么
- 使用 Pandas 和 Polars 加载、检查和导出 CSV、Parquet 和 JSON 格式的数据。
- 处理缺失数据、清理脏数据集、使用 groupby、数据透视表和交叉表聚合数据。
- 应用惰性求值和流式传输来处理大于 RAM 的数据集并编写方法链式管道
- 连接多个数据集(内连接、左连接、外连接、交叉连接、反连接、半连接)。
- 使用窗口函数、滚动计算和基于时间的重采样。
- 使用 matplotlib 和 seaborn 可视化结果。
- 构建从提取到导出的完整 ETL 管道。
要求
- Python 基础知识(变量、循环、函数、列表、字典)
- 熟悉命令行(使用 pip 安装软件包)
- 无需具备使用 Pandas 或 Polars 的经验 – 我们从零开始
描述
本课程涉及人工智能的使用。
这是一门 100% 实践课程,通过直接并排比较 Pandas 和 Polars(当今两个最重要的 Python DataFrame 库)来教您实际的数据操作。
每个练习都会为您提供在两个库中解决的相同任务,因此您可以立即看到 API 设计、性能和惯用风格方面的差异。
没有很长的讲座。没有幻灯片。只需明确的任务、简洁的解决方案以及可在工作中使用的参考材料即可。
课程分为 5 个渐进模块
<强>1。基础知识:
加载 CSV、选择列、过滤行、数据类型、字符串操作、日期/时间处理、空值管理以及导出为多种格式。
<强>2。聚合与连接:
GroupBy 操作、pivot/melt、所有类型的连接、窗口函数、滚动聚合、重采样和排名。
<强>3。高级模式:
惰性求值、方法链接、用户定义函数、嵌套/结构数据、多格式互操作和性能优化。
<强>4。附加功能:
分类类型和类型内存优化、大文件流、使用 matplotlib 和 seaborn 进行数据可视化、多文件摄取(glob 模式、分区数据集)和数据验证管道
<强>5。现实世界的项目:
- 数据清理和标准化
- 销售仪表板报告
- ETL 管道(多源)
- 客户流失和客户流失群组分析
- 财务风险与风险投资组合优化
- 机器学习特征工程管道
- 实时流媒体仪表板(200 万行以上)
每个项目都包含 Pandas 和 Polars 解决方案,因此您对同一问题始终有两种观点。
本课程适合谁
- 任何想要这两个库的实用、严肃参考的人
- 想要将数据操作添加到其技能组合中的 Python 开发人员
- 数据分析师从 Excel/SQL 过渡到基于 Python 的工作流程
- 了解 Pandas 但想了解 Polars(反之亦然)的数据科学家
- 准备数据工程面试的学生和自学者


评分及评论
暂无评分
来评个分数吧