2.2.2第一个示例——流化共享单车数据集

第一个示例是使用共享单车数据集。此数据集包含两个CSV文件,其中收集了2011~2012年间在美国华盛顿特区共享单车系统中每小时和每天所出租的自行车数。这些数据显示了与租车日对应的天气和季节信息。我们的第一个目标是使用前面定义的打包器函数将数据集保存到本地硬盘:

81add8a236ca204f492eadd736cbf0dc.png

如果成功运行,代码会提示CSV文件的保存目录,并打印两个解压缩文件的名称。此时,用物理设备保存信息后,应编写脚本,以构建非核心学习系统的核心,从而提供来自文件的数据流。首先使用CSV库,有两个选择:将数据恢复为列表或Python字典。我们首先恢复为列表:

8f900fe95a306b3f764f987f5092f452.png

4f368e9763cc45d7663b8a5a37ee75a4.png

输出信息将显示已读取的行数、标题的内容(即CSV文件第一行,存储在列表中时)和行内容(为方便起见仅打印最后一页)。csv.reader函数创建一个迭代器,利用for循环逐个读取文件的每一行。注意,代码段内专门有两处注释,指出应将整章中其他代码放置在何处来进行数据预处理和机器学习。

这种情况下,必须使用位置方法来处理特征,即对表头中的标签位置进行索引。如果大量频繁操作特征可能会有点麻烦。一种解决方案是使用csv.DictReader生成Python字典作为输出(无序,但利用标签很容易识别特征)。

8eeb6122f62dbd35014a885b9f41fe26.png

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐