1. 获取数据集

sklearn.dataset、下载现有、爬取网络资源、自行生成


2. 读入数据集、探查数据

numpy + pandas : 读写、行列操作、获取统计信息


3. 数据预处理

主要用到 sklearn.preprcessing

详见sklearn中文社区 sklearn.preprcessing


4. 特征工程

主要用到 sklearn.feature_selection

详见sklearn中文社区 sklearn.feature_selection


5. 划分数据集

主要用到sklearn.model_selection.train_test_split

详见sklearn中文社区 sklearn.model_selection


6. 模型|算法选择

其中,knn - 算法评价的基准,如果一个算法还不如knn,那么肯定不能选他。


7. 创建算法模型实例对象(给出一些超参数)


8. 训练模型

分类/回归 = (训练集(训练特征集 + 训练标签集))
聚类 = (训练集(训练特征集))


9. 模型评估

sklearn.metrics

详见sklearn中文社区 sklearn.metrics


10. 模型的序列化(保存模型)

推荐用joblib库


11. 使用模型进行预测

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐