TPAMI 2025 | 港大团队再突破!UniMatch V2重构半监督语义分割基准,ADE20KCOCO等复杂数据集表现惊艳
点击上方“小白学视觉”,选择加"星标"或“置顶”
重磅干货,第一时间送达
在计算机视觉领域,语义分割一直是个"吃数据"的任务——想要模型精准识别图像中每个像素的类别,往往需要海量人工标注的图像。但标注成本高得惊人,比如Cityscapes数据集中一张图的标注就要1.5小时!半监督语义分割(SSS)技术因此应运而生,它能通过少量标注数据+大量未标注数据训练模型,大幅降低标注成本。
最近,来自清华大学等机构的团队提出了UniMatch V2框架,直接将半监督语义分割的性能提升到新高度。更重要的是,他们用事实证明:换个强大的编码器,比盲目堆砌复杂模块更有效!
论文信息
题目:UniMatch V2: Pushing the Limit of Semi-Supervised Semantic Segmentation
UniMatch V2:突破半监督语义分割的极限
作者:Lihe Yang, Zhen Zhao, and Hengshuang Zhao
为什么要升级编码器?传统方法陷入瓶颈
过去几年,半监督语义分割研究陷入了一个怪圈:大家都在基于ResNet编码器做改进,新方法性能提升往往只有0.5%左右。但与此同时,计算机视觉领域早已涌现出DINOv2等基于视觉Transformer(ViT)的强大预训练模型——这些模型在海量数据上训练,特征提取能力远超传统ResNet。
UniMatch V2团队做了个简单对比:用参数少2倍的DINOv2-S替代ResNet-101,居然在Pascal数据集上性能提升3%,Cityscapes上提升4%!这说明传统SSS研究固守过时编码器,已经严重制约了技术发展。

UniMatch V2框架:简化设计却更强效
基于"强大编码器+优化框架"的思路,团队提出了UniMatch V2。它继承了V1版本"从弱到强一致性正则化"的核心思想,但做了两大关键升级:
1. 单流统一增强:效率更高
V1版本有三个训练流(一个生成伪标签,两个分别做图像级和特征级增强),计算成本高。而V2发现:在DINOv2这样的强编码器下,单独的特征级增强作用不大。于是将图像级增强(如颜色抖动、CutMix)和特征级增强(如Dropout)合并到单个流中,既保持了增强效果,又减少了1/3的计算量。
2. 互补Dropout:让双流学习更有效
V2设计了一种"互补通道Dropout"技术:将特征图的通道随机分成两组,一组保留纹理信息,一组保留结构信息,形成两个互补的特征视图。这种方式比V1中随机生成两个增强图像的做法更有效,能让模型学习到更鲁棒的特征表示。
左:FixMatch框架 中:UniMatch V1 右:UniMatch V2
训练流程一目了然
UniMatch V2的训练逻辑非常清晰:
对未标注图像做弱增强(裁剪、翻转等),用教师模型生成高质量伪标签
对同一张图做两次强增强(颜色、CutMix等),得到两个版本的图像
用互补Dropout处理这两个图像的特征,得到两个互补特征集
用伪标签监督这两个特征集的预测结果,让模型在强干扰下仍能保持预测一致
特征级增强损失远小于图像级,证明合并的合理性
横扫四大数据集,性能提升令人惊叹
团队在Pascal、Cityscapes、ADE20K和COCO四个主流数据集上做了测试,结果堪称"降维打击":
Pascal数据集:在1/8标注数据设置下,比基于ResNet-101的最佳方法高6.9%(85.5% vs 78.6%),用更少参数实现了大幅超越
Cityscapes数据集:1/16标注数据下,DINOv2-B版本达到83.6%,比CLIP-based方法高5.7%
ADE20K数据集:这个包含150类的复杂数据集上,比SemiVL方法平均高10%,1/8标注数据就达到49.8%
COCO数据集:1/128标注数据下,从V1的44.4%提升到53.2%,展现了在超大类别场景下的优势


特别值得注意的是,在Cityscapes上,用一半标注数据训练的半监督模型(85.1%)性能几乎追平全监督模型(85.2%),这意味着可以用一半的标注成本达到接近全量标注的效果!
对未来研究的三大启示
UniMatch V2的成功不仅是技术上的突破,更给半监督语义分割研究指明了新方向:
编码器升级优先于模块堆砌:与其在过时编码器上做小修小补,不如拥抱DINOv2等现代预训练模型,基础性能提升更显著
挑战更复杂的基准:Pascal和Cityscapes性能已趋饱和,建议未来多关注ADE20K和COCO等更具挑战性的数据集
简洁设计更有生命力:V2通过简化架构反而提升性能,证明好的方法应该是高效且易于复现的


代码实现很简单
团队还提供了简洁的PyTorch风格伪代码,核心逻辑清晰易懂:

总之,UniMatch V2用"换编码器+简化框架"的思路,给半监督语义分割领域带来了新思路。随着DINOv2等基础模型的不断发展,我们有理由相信,半监督学习在降低标注成本、提升模型泛化能力方面还将有更大突破!
下载1:OpenCV-Contrib扩展模块中文版教程
在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。
下载2:Python视觉实战项目52讲
在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。
下载3:人工智能0基础学习攻略手册
在「小白学视觉」公众号后台回复:攻略手册,即可获取《从 0 入门人工智能学习攻略手册》文档,包含视频课件、习题、电子书、代码、数据等人工智能学习相关资源,可以下载离线学习。
交流群
欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~
魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)