首页 / 资讯中心 / 文章详情

YOLO26改进 - 注意力机制 | CoTAttention (Contextual Transformer Attention) 上下文转换器注意力:动静态上下文融合增强特征表征,优化多尺度目标检

YOLO26改进 - 注意力机制 | CoTAttention (Contextual Transformer Attention) 上下文转换器注意力:动静态上下文融合增强特征表征,优化多尺度目标检 ★ FEATURED ARTICLE
前言本文介绍了Contextual Transformer(CoT)块及其在YOLO26中的结合应用。大多数现有Transformer风格架构设计未充分利用邻近键之间的上下文信息,而CoT块通过3×3卷积对输入键进行上下文编码得到静态表示,将编码后的键与输入查询连接,经两个连续的1×1卷积学习动态多头注意力矩阵,与输入值相乘得到动态表示,最终融合二者作为输出。基于此块构建的CoTNet可替换ResNet架构中的3×3卷积。我们将CoTAttention集成进YOLO26,大量实验验证了CoTNet作为骨干网络的优越性。文章目录: YOLO26改进大全:卷积层、轻量化、注意力机制、损失函数、Backbone、SPPF、Neck、检测头全方位优化汇总专栏链接: YOLO26改进专栏文章目录前言介绍摘要文章链接基本原理核心代码YOLO26引入代码tasks注册步骤1:步骤2配置yolo26-CoTAttention.yaml实验脚本结果介绍摘要Transformer自注意力机制已在自然语言处理领域引发革命性变革,并近期推动了Transformer风格架构在多种计算机视觉任务中取得竞争性成果。然而,现有方法大多直接在二维特征图上应用自注意力机制,基于各空间位置的孤立查询-键对计算注意力矩阵,未能充分利用邻近键值间的丰富上下文信息。针对此局限性,本研究设计了一种新颖的Transformer风格模块——上下文Transformer(Contextual Transformer, CoT)块,用于视觉识别任务。该设计充分挖掘输入键值间的上下文信息,引导动态注意力矩阵的学习过程,从而显著增强视觉表征能力。在技术实现上,CoT块首先通过3×3卷积对输入键进行上下文编码,生成静态上下文表示;随后将编码后的键与输入查询连接,经由两个连续的1×1卷积学习动态多头注意力矩阵;所得注意力矩阵与输入值相乘后产生动态上下文表示;最终融合静态与动态上下文表示作为模块输出。所提出的CoT模块具备高度实用性,可便捷替换ResNet架构中的3×3卷积层,构建出名为Contextual Transformer Networks(CoTNet)的Transformer风格骨干网络。通过在大规模图像识别、目标检测及实例分割等应用场景中的系统实验,验证了CoTNet作为更强骨干网络的优越性能。相关源代码已公开于https://github.com/JDAI-CV/C
阅读完成 · 觉得有帮助?
咨询建站