深度学习视觉的三大核心任务——分类、目标检测、语义分割——在工业质检中各有明确的适用场景。分类回答“是什么”目标检测回答“在哪里、是什么”语义分割回答“每个像素属于谁”。分类给整张图或区域打标签分类是最基础的任务。输入一张图或一个 ROI输出一个类别标签。工业场景零件良品/不良品判别、产品型号识别、颜色分选、纹理等级判定。典型网络ResNet、EfficientNet、MobileNet。Halcon 的pretrained_dl_classifier系列就是分类网络支持在自定义数据集上微调。关键约束分类假设目标已经居中且充满整个输入区域。如果目标在图中位置不固定、大小变化大分类效果会急剧下降。所以工业上分类通常配合传统定位使用——先找到目标裁剪 ROI再送入分类网络。优点训练数据需求相对少推理速度快模型小。缺点只知道“是什么”不知道“在哪里”无法处理多目标和像素级任务。目标检测定位 分类目标检测同时回答“在哪里”和“是什么”。输出一组边界框Bounding Box每个框带类别标签和置信度。工业场景缺陷定位与分类划痕、脏污、凹坑分别在哪、多零件计数与识别、装配完整性检查。两大流派两阶段检测器Faster R-CNN先提候选区域再分类。精度高速度慢。单阶段检测器YOLO、SSD直接回归边界框和类别。速度快精度稍低。工业现场最常用的是YOLO 系列。YOLOv5-Halcon 在巧克力包装缺陷检测案例中640×640 ROI 内检测 30 类缺陷单张推理仅28ms满足产线节拍。关键约束边界框是矩形无法精确描述不规则形状的缺陷。如果缺陷是细长划痕或弯曲裂纹矩形框会包含大量背景导致定位精度不足。语义分割像素级分类语义分割给每个像素分配一个类别标签。输出是一张与输入同尺寸的掩码图每个像素值代表它属于哪一类。工业场景精确缺陷区域提取不规则划痕、异形脏污、表面区域划分焊接区、母材区、装配区域确认。典型网络U-Net、DeepLab、SegNet。U-Net 在工业缺陷分割中应用最广因为它的编码器-解码器结构能同时捕捉全局上下文和局部细节适合小样本训练。关键约束标注成本极高。目标检测只需要画矩形框语义分割需要逐像素标注。一张 2000×2000 的图逐像素标注可能需要 30 分钟以上。工业上通常先用传统算法或目标检测做粗筛再对候选区域做精细分割。三者在工业质检中的分工任务回答的问题输出标注成本典型场景分类是什么类别标签低良品/不良品判别目标检测在哪、是什么边界框类别中缺陷定位分类语义分割每个像素属于谁像素掩码高不规则缺陷提取选型逻辑能分类就不检测能检测就不分割。分类最便宜分割最贵。如果只需要判断“这张图有没有缺陷”分类就够了。如果需要知道“缺陷在哪、是什么类型”用目标检测。如果需要精确提取缺陷的不规则轮廓用于面积测量才用语义分割。传统算法与深度学习的分工定位用传统算法形状匹配分类/检测用深度学习尺寸测量用传统算法边缘提取拟合。这个“传统-深度-传统”的流水线是工业视觉最务实的融合架构。一句话总结分类是**“贴标签”目标检测是“贴标签画框”语义分割是“给每个像素贴标签”**。工业质检中标注成本从低到高、输出信息从粗到细。选择哪种任务取决于你需要多细的信息以及愿意付出多少标注代价。
阅读完成 · 觉得有帮助?