yolov5的anchor详解

2023年5月26日上午3:36 • 人工智能 • 阅读 89

以yolov5s v3为例：

*anchor长啥样及怎么得到的？

以下是yolov5 v3.0中的anchor

anchors:
 1. [10,13, 16,30, 33,23]
 2. [30,61, 62,45, 59,119]
 3. [116,90, 156,198, 373,326]

为啥anchor一共是3行呢？
答：这里指的是在三个不同分辨率的特征图上的anchor，能够分别对大、中、小目标进行计算。
第一行在最大的特征图上 —-小数值检测大的目标
第二行在第二大的特征图上
第三行在最小的特征图上—-大数值检测小的目标

为啥anchor一行是六个数呢，xywh个数也不对啊？
这里就要说一下anchor是怎么生成的了。

对于输出层（Prediction），经过前面的一系列特征提取和计算操作后，会生成三个特定大小的特征，大小分别为608/8=76，608/16=38，608/32=19，可能这也是输入图像大小要求是 32的倍数的原因。
下面是v5代码中采用kmeans计算anchor的过程。 path代表数据yaml路径，n代表聚类数，img_size代表模型输入图片的大小，thr代表长宽比的阈值（将长宽比限定在一定的范围内, 这个可以自己统计一下数据集），gen代表kmeans迭代次数。

def kmean_anchors(path='./data/coco128.yaml', n=9, img_size=640, thr=4.0, gen=1000, verbose=True):
    """ Creates kmeans-evolved anchors from training dataset

        Arguments:
            path: path to dataset *.yaml, or a loaded dataset
            n: number of anchors
            img_size: image size used for training
            thr: anchor-label wh ratio threshold hyperparameter hyp['anchor_t'] used for training, default=4.0
            gen: generations to evolve anchors using genetic algorithm

        Return:
            k: kmeans evolved anchors

        Usage:
            from utils.general import *; _ = kmean_anchors()
"""
    thr = 1. / thr

    def metric(k, wh):
        r = wh[:, None] / k[None]
        x = torch.min(r, 1. / r).min(2)[0]

        return x, x.max(1)[0]

    def fitness(k):
        _, best = metric(torch.tensor(k, dtype=torch.float32), wh)
        return (best * (best > thr).float()).mean()

    def print_results(k):
        k = k[np.argsort(k.prod(1))]
        x, best = metric(k, wh0)
        bpr, aat = (best > thr).float().mean(), (x > thr).float().mean() * n
        print('thr=%.2f: %.4f best possible recall, %.2f anchors past thr' % (thr, bpr, aat))
        print('n=%g, img_size=%s, metric_all=%.3f/%.3f-mean/best, past_thr=%.3f-mean: ' %
              (n, img_size, x.mean(), best.mean(), x[x > thr].mean()), end='')
        for i, x in enumerate(k):
            print('%i,%i' % (round(x[0]), round(x[1])), end=',  ' if i < len(k) - 1 else '\n')
        return k

    if isinstance(path, str):
        with open(path) as f:
            data_dict = yaml.load(f, Loader=yaml.FullLoader)
        from utils.datasets import LoadImagesAndLabels
        dataset = LoadImagesAndLabels(data_dict['train'], augment=True, rect=True)
    else:
        dataset = path

    shapes = img_size * dataset.shapes / dataset.shapes.max(1, keepdims=True)
    wh0 = np.concatenate([l[:, 3:5] * s for s, l in zip(shapes, dataset.labels)])

    i = (wh0 < 3.0).any(1).sum()
    if i:
        print('WARNING: Extremely small objects found. '
              '%g of %g labels are < 3 pixels in width or height.' % (i, len(wh0)))
    wh = wh0[(wh0 >= 2.0).any(1)]

    print('Running kmeans for %g anchors on %g points...' % (n, len(wh)))
    s = wh.std(0)
    k, dist = kmeans(wh / s, n, iter=30)
    k *= s
    wh = torch.tensor(wh, dtype=torch.float32)
    wh0 = torch.tensor(wh0, dtype=torch.float32)
    k = print_results(k)

    npr = np.random
    f, sh, mp, s = fitness(k), k.shape, 0.9, 0.1
    pbar = tqdm(range(gen), desc='Evolving anchors with Genetic Algorithm')
    for _ in pbar:
        v = np.ones(sh)
        while (v == 1).all():
            v = ((npr.random(sh) < mp) * npr.random() * npr.randn(*sh) * s + 1).clip(0.3, 3.0)
        kg = (k.copy() * v).clip(min=2.0)
        fg = fitness(kg)
        if fg > f:
            f, k = fg, kg.copy()
            pbar.desc = 'Evolving anchors with Genetic Algorithm: fitness = %.4f' % f
            if verbose:
                print_results(k)

    return print_results(k)

上面的计算过程相当于将我画的长宽比先转化到resize640大小的长宽比下，再进行聚类，得到9个聚类中心，每个聚类中心包含（x，y）坐标就是我们需要的anchor如下：

134,38,  172,35,  135,48,  175,43,  209,38,  174,62,  254,69,  314,82,  373,95

将其放入list


 1. [134,38,135,48,172,35]
 2. [174,62,175,43,209,38]
 3. [254,69,314,82,373,95]

这里的thr其实是和hyp.scratch.yaml文件中的anchor_t一样，代表了anchor放大的scale，我的标注框长宽比最大在8左右，因此设置为8。
检测模块

接下来就是anchor在模型中的应用了。这就涉及到了yolo系列目标框回归的过程了。

yolov5中的detect模块沿用了v3检测方式，这里就用这种方式来阐述了。

1.检测到的不是框，是偏移量。

   tx,ty&#x6307;&#x7684;&#x662F;&#x9488;&#x5BF9;&#x6240;&#x5728;grid&#x7684;&#x5DE6;&#x4E0A;&#x89D2;&#x5750;&#x6807;&#x7684;&#x504F;&#x79FB;&#x91CF;
   tw,th&#x6307;&#x7684;&#x662F;&#x76F8;&#x5BF9;&#x4E8E;anchor&#x7684;&#x5BBD;&#x9AD8;&#x7684;&#x504F;&#x79FB;&#x91CF;

通过如下图的计算方式，得到bx,by,bw,bh就是最终的检测结果。

2. 前面经过backbone，neck, head是panet的三个分支，可见特征图size不同，每个特征图分了13个网格，同一尺度的特征图对应了3个anchor，检测了[c,x,y,w,h]和num_class个的one-hot类别标签。3个尺度的特征图，总共就有9个anchor。
yolov5的anchor详解

用多个anchor去负责一个GT。方法是：对于 GT-j 来说，只要
IoU (anchor-i, GT-j) > threshold ，就让 anchor-i 去负责 GT-j 。
ioul loss 这里采用的是GIOU loss。
加了nonautoanchor参数，可以控制要不要重新算anchor，还是用默认的就好。

代码中的具体方法，loss函数的具体过程待补充。。。

Original: https://blog.csdn.net/anny_jra/article/details/122976375
Author: anny_jra
Title: yolov5的anchor详解

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/517920/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

使用ElasticSearch 和 BERT进行NLP文本分析

文章大纲 es 8.0 新特性 * wsl2 下使用 docker 搞一下es – 拉取 Elasticsearch Docker image 启动单个 ES 节点使…

人工智能 2023年5月27日
0081
一文讲通谱域图神经网络：从图信号处理GSP到图卷积网络GCN

一文讲通谱域图神经网络：从图信号处理GSP到图卷积网络GCN 文章目录一文讲通谱域图神经网络：从图信号处理GSP到图卷积网络GCN * 图信号处理 – 拉普拉斯矩阵 …

人工智能 2023年6月10日
0091
OpenCV：img[:]、img[:, :]、img[:, 0]、img[:, 1]、img[:, 2]、img[:, :, 0]、img[:, :, 1]、img[:, :, 2]等的理解

一、print(img)、print(img[:])、print(img[:, :]) 结果一样，打印图像数组二、img[:, 0] 和 img[:, :, 0]、img[:, …

人工智能 2023年6月19日
0070
PyTorch数据归一化处理：transforms.Normalize及计算图像数据集的均值和方差

PyTorch数据归一化处理：transforms.Normalize及计算图像数据集的均值和方差 1.数据归一化处理：transforms.Normalize * 1.1 理解t…

人工智能 2023年7月27日
0052
基于Java+SpringBoot+vue+element实现校园疫情防控系统详细设计和实现

🍅 作者简介： CSDN特邀作者✌、博客专家✌、java领域优质创作者💪🍅 关注公众号【java李阳勇】简历模板、学习资料、面试题库等都给你 💪🍅 文末获取源码联系🍅🍅新星计划·…

人工智能 2023年7月30日
0067
目标检测FCOS的初步理解

FCOS FCOS是一阶段anchor free目标检测算法，其主要的卖点为无锚。通过回归特征图上每个位置距离目标框的上下左右距离来实现目标检测。如果一个位置落在了多个目标框内，文…

人工智能 2023年6月17日
0074
使用vscode编写、运行Python程序

最近准备推出一系列Python入门、Pytorch深度学习框架入门的文章，主要面向计算机视觉小白。为了给非计算机专业的读者、或者刚入门计算机视觉的读者打好基础，前几天特意写了一篇…

人工智能 2023年6月15日
00128
豆瓣电影评论情感分析（含代码+数据）

文章目录 * – + 目的 + 效果 + * – 云图 – 直方图 + 全代码+数据地址 + 核心代码片断 + * data_analysis….

人工智能 2023年7月15日
0057
数据库技术基础：常见基本模型介绍笔记

1、层次模型层次模型采用树型结构表示数据与数据间的联系。层次模型中每个节点表示一个实体，实体之间的联系用节点之间的连线表示，并且除了根节点以外，其他节点有且仅有一个双亲节点。层…

人工智能 2023年6月10日
0080
生成专题2 | 图像生成评价指标FID

文章转自微信公众号：机器学习炼丹术作者：陈亦新（欢迎交流共同进步）联系方式：微信cyx645016617 2.1 感性理解 FID是Fréchet Inception Dist…

人工智能 2023年7月14日
0074
带你进入 OpenAI 的世界

2021年11月的 Microsoft Ignite ，微软带来了全新的 Azure OpenAI Service，通过新的 Azure 认知服务能够访问 OpenAI 强大的 …

人工智能 2023年5月27日
0075
【笔记】PyTorch快速入门：基础部分合集

Tensors Tensors贯穿PyTorch始终和多维数组很相似，一个特点是可以硬件加速有很多方式直接给值 data = [[1,2],[3,4]] x_data = t…

人工智能 2023年6月4日
0089
RNA-seq Review：RNA-seq数据分析

文献：RNA-seq数据分析最佳实践调查 Genome Biology 2016 ReviewA survey of best practices for RNA-seq data…

人工智能 2023年7月16日
0068
ROS2报错：SetuptoolsDeprecationWarning: setup.py install is deprecated. Use build and pip and other…

因为一直用c++，所以对ROS+python的调试相对较少，今天碰到一个用python玩的项目，发现报错， SetuptoolsDeprecationWarning: setup….

人工智能 2023年7月4日
0067
【知识图谱可视化】实体抽取结果预处理，Neo4j数据导入（学习记录）

本篇内容：实体抽取内容的初步数据处理（之后会发关于导入neo4j数据库的相关内容）初始数据：进行实体抽取之后的结果数据↓（这里方便举例，只拿出了小部分数据。这里解释一下数据含…

人工智能 2023年6月1日
0092
一文讲懂图像处理中的低通、高通、带阻和带通滤波器

点击上方” 小白学视觉“，选择加” 星标“或” 置顶“ 空间域和频域滤波器通常分为四种类型的滤波器——低通、…

人工智能 2023年6月18日
00115

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31

yolov5的anchor详解

大家都在看