对于YOLO模型的数据集划分,常见的训练集、验证集、测试集比例通常为 70-80% : 10-15% : 10-15%。一个典型的做法是按 70:15:15 或 70:20:10 的比例进行划分

数据划分比例 (训练:验证:测试) 来源 / 背景说明
7:1.5:1.5 (即 70:15:15) 在YOLOv4上进行的一项实验研究表明,此比例能获得最优的检测性能。
8:1:1 (即 80:10:10) 学术研究中采用的划分比例。
7:2:1 (即 70:20:10) 第三方数据转换工具的默认划分比例。
7:1.5:1.5 (即 70:15:15) 一个YOLOv5实例分割教程中使用的比例。
7:3:0 (训练集与验证集合并划分) 在某些研究中,将大部分数据用于训练和验证,并单独留出部分图片作为测试集。

比例选择的核心考量

这些常见的比例背后,主要有以下几点考量:

  • 训练集:占比最大(通常70%-80%),目的是让模型学习到足够多的数据特征和变化。

  • 验证集:占比约10%-20%,用于在训练过程中评估模型性能、调整超参数、进行早停以防止模型在训练集上过拟合。

  • 测试集:占比约10%-15%,用于在训练完全结束后对模型性能进行最终的无偏评估,反映模型的泛化能力。

如何根据实际情况调整

固定比例并非绝对,你可以根据自身项目的以下特点进行调整:

  1. 数据集规模:如果你的数据总量非常大(例如数十万张),验证集和测试集的比例可以适当降低(如5%),因为它们包含的绝对数量已经足够用于评估。

  2. 任务难度与数据多样性:对于场景复杂、目标多变的任务,确保验证集和测试集能充分覆盖这些多样性更为关键。

  3. 类别平衡:无论按何种比例划分,都要确保每个子集中各个类别的分布比例与整体数据集大致相同,避免因划分偏差导致评估失真。

  4. 严格分离:必须确保验证集和测试集的图像绝对不会出现在训练集中,否则会严重高估模型性能

实用的操作建议

一个稳妥的实践流程是:

  • 初次训练:可以从 8:1:1 或 7:1.5:1.5 这样的常用比例开始。

  • 分析结果:训练后,如果发现验证集性能与训练集差距过大(可能是过拟合),可以考虑增加训练数据或适当增大验证集比例以进行更严格的监控。

  • 最终评估:确保使用从未参与过任何训练和调参过程的测试集进行最终模型性能报告。

小数据量的比例选择方法:

K折交叉验证(推荐用于模型开发)

当数据极少时,这是更可靠、更充分利用数据的评估方法。

  • 基本操作:将全部数据随机分成K份(例如5份)。依次将其中1份作为验证集,其余K-1份作为训练集,进行K次训练和评估。最终性能是K次结果的平均值。

  • 为何适合小数据:每张图片既用于训练也用于验证,评估结果更稳定,能更好地反映模型在有限数据下的真实潜力,避免因一次划分的偶然性导致结论偏差。

  • 注意事项:这种方法更常用于模型选择、调参和原型验证阶段。确定最终模型后,仍建议用全部数据重新训练一个用于部署的模型。

调整传统划分比例

如果你仍希望保留一个独立的测试集用于最终评估,可以调整比例如下:

  • 增大验证/测试集比例:例如采用 70:15:15。这样虽然训练数据变少,但能保证验证集和测试集有足够的样本(几十张)来反映模型性能,评估结果更具统计意义。

  • 保证绝对数量:一个经验法则是,验证集和测试集每个类别至少应有15-25个样本,才能进行有意义的评估。你可以根据类别数量倒推所需比例。

  • 合并验证集与测试集:在数据极端有限时(如少于300张),可考虑只划分训练集验证集(如80:20)。用验证集同时承担调参和最终评估的任务,但需明确说明,并知道这可能高估最终性能。

核心原则

无论选择哪种方法

  1. 严格的分离:确保任何用于评估的图片都从未在训练阶段以任何形式出现过(包括数据增强)。

  2. 类别平衡:在划分时,确保每个子集中各类别的比例与整体一致。对于小数据集,这点更为关键,可以使用分层抽样。

  3. 数据增强是必需品:几百张数据下,必须使用强力的数据增强(如Mosaic、MixUp、随机旋转裁剪、色彩扰动等)来扩充训练集,这是提升小样本性能的关键。

总结与行动建议

对于几百张图片的情况,一个具体的行动路线可以是:

  1. 项目初期,快速验证想法:使用 5折交叉验证 来评估不同模型或参数的效果,这是最稳健的方式。

  2. 确定模型后,准备最终模型:如果你需要一个独立测试集来报告最终性能,可以按 70:15:15 划分。用85%的数据(训练+验证)进行训练和调参,用15%的数据做最终测试。

  3. 最终交付前:可以考虑用100%的数据重新训练最终交付的模型,使其学习到所有信息。

另外,数据标注的质量在小数据集中至关重要。请确保标注绝对精确,因为每一个错误都会被放大。

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐