语义分割到底是什么?10张图讲透
分类告诉你“图里有什么”,语义分割则进一步回答“每个像素属于什么”。
它输入一张图片,输出同尺寸的类别掩膜:道路、天空、建筑等区域都会获得自己的标签。同类目标共享同一类别,因此它不负责区分每一个独立实例。
完整流程通常有4步:
1. 编码器提取多尺度特征
2. 上下文模块结合局部与全局信息
3. 解码器恢复空间分辨率和边界
4. 对每个像素输出类别概率
常见模型有U-Net、DeepLab和SegFormer;损失函数常用Cross Entropy、Dice或Focal Loss。评估别只看Pixel Accuracy,背景很多时它可能虚高,更应关注IoU、mIoU、Dice和每类结果。
数据环节尤其关键:图像与掩膜必须同步裁剪、翻转和缩放;掩膜通常用最近邻插值,避免产生不存在的类别ID。同主体或相邻视频帧也要分组划分,防止数据泄漏。
你想继续看目标检测,还是实例分割?
语义分割 计算机视觉 深度学习 图像处理









