江苏开放大学机器学习060729线下实训一
项目目的理解数据预处理在机器学习中的核心作用,掌握缺失值处理、离群值检测、数据标准化、特征编码 / 离散化的基本原理。熟练使用 Python(NumPy、Pandas)及 Scikit-learn 库实现各类数据预处理操作。能够针对不同类型的数据集选择合适的预处理方法,并分析预处理结果的合理性。培养数据处理的实践能力和问题分析能力,为后续机器学习建模奠定基础。项目内容第一课时:实验准备与缺失值处理
文档介绍
注意:因为学习平台题目是随机,选择题选项也是随机,一定注意答案对应的选项,同学们在本页按“Ctrl+F”快捷搜索题目中“关键字”就可以快速定位题目!!!
同专业其他作业点击右侧标签查看
项目目的
理解数据预处理在机器学习中的核心作用,掌握缺失值处理、离群值检测、数据标准化、特征编码 / 离散化的基本原理。
熟练使用 Python(NumPy、Pandas)及 Scikit-learn 库实现各类数据预处理操作。
能够针对不同类型的数据集选择合适的预处理方法,并分析预处理结果的合理性。
培养数据处理的实践能力和问题分析能力,为后续机器学习建模奠定基础。
项目内容
第一课时:实验准备与缺失值处理
第二课时:离群值检测
第三课时:数据标准化
第四课时:特征编码与离散化
项目步骤
第一课时:实验准备与缺失值处理
(1)环境检查
(2)数据集说明
介绍实验所用两个数据集:
+ “teenager_sns”包含30000个样本的美国高中生社交网络信息数据集。每个样本包含40个变量,其中 gradyear, gender, age和friends四个变量代表高中生的毕业年份、性别、年龄和好友数等基本信息。 其余36个变量代表36个词语,代表高中生的5大兴趣。
+ “accord_sedan_testing”是一个二手汽车数据集,包含二手汽车的价格、已行驶英里、上市年份、档次、引擎缸数、换挡方式等
2. 缺失值处理原理讲解
缺失值的常见类型:随机缺失、非随机缺失、完全随机缺失。
缺失值处理的常用方法:删除法、均值 / 中位数 / 众数填充法、插值法、模型预测填充法。
本次实验重点:使用 Scikit-learn 的Imputer实现均值填充。
3. 缺失值处理实操
第二课时:离群值检测
1.离群值检测原理
2. 离群值检测实操
第三课时:数据标准化
1. 数据标准化原理讲解
2. 数据标准化实操
第四课时:特征编码与离散化
1. 特征编码与离散化原理讲解
2. 特征编码与离散化实操
项目要求
补全所有待补全代码,运行并输出正确结果。
分析不同预处理方法对teenager_sns数据集中friends列分布的影响(绘制直方图对比)。
针对accord_sedan_testing数据集的离群值,提出两种处理方案(删除 / 缩尾)并实现。
©软件著作权归作者所有。本站所有软件均来源于网络,仅供学习使用,请支持正版!
转载请注明出处: 形易网 » 江苏开放大学机器学习060729线下实训一

发表评论 取消回复