【语音算法】wav2vec系列原理和使用

2023年7月27日上午12:27 • 人工智能 • 阅读 100

文章目录

前言
1. wav2vec
2. vq-wav2vec
3. wav2vec2.0
*
3.1 encoder
3.2 context
3.3 wav2vec2.0的使用（transformers库）
参考文献

前言

wav2vec系列工作由facebook AI Research团队提出，包括wav2vec、vq-wav2vec、wav2vec2.0，效仿nlp上的word2vec，是语音的一种通用特征提取器。本文重点讲解wav2vec2.0模型及其使用方法。

wav2vec

论文：wav2vec: Unsupervised Pre-training for Speech Recognition

本文提出一种无监督的语音预训练模型 wav2vec，可迁移到语音下游任务。模型结构如下图，分为将原始音频x编码为潜在空间z的 encoder network（5层卷积），和将z转换为contextualized representation的 context network（9层卷积），最终特征维度为512x帧数。目标是在特征层面使用当前帧预测未来帧。

; 2. vq-wav2vec

论文：vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations

本文基于wav2vec，将连续特征z通过提出的量化模块，变成离散特征z’，实现特征空间从无限的连续到有限的离散的转换过程。文中提出了两种量化方法，Gumbel softmax和K-Means，如下图。其中，左右两个部分中的 e1 … ev，就是码本（记录特征集，可以理解为 BERT 中的词表），Gumbel通过逻辑值最大化（回传时使用Gumbel softmax来保证可导）找对应码本条，K-Means通过计算与码本距离来找最小距离的码本条。

; 3. wav2vec2.0

论文：wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

本文基于wav2vec，结合了vq-wav2vec的量化模块和Transformer，提出了wav2vec2.0，如下图。其中，encoder network基于CNN，而context network基于Transformer，任务是在特征层面恢复被mask的量化的帧。

模型的整体结构如下图，以下具体讲解结构。
【语音算法】wav2vec系列原理和使用

; 3.1 encoder

feature extractor 使用了7层的一维CNN，步长为(5,2,2,2,2,2,2)，卷积核宽度为(10,3,3,3,3,2,2)。
对于x=16000的输入语音，各卷积层输出的时间维度为：
cnn0 (16000-10)/5+1 = 3199
cnn1 (3199-3)/2+1 = 1599
cnn2 (1599-3)/2+1 = 799
cnn3 (799-3)/2+1 = 399
cnn4 (399-3)/2+1 = 199
cnn5 (199-2)/2+1 = 99 (除法有小数，向下取整)
cnn6 (99-2)/2+1 = 49 (除法有小数，向下取整)
因此，对于16k采样率的1s的语音对应矩阵(1,16000)，channels大小为512，对应的输出为 (512,49)，时间维度上约相当于每20ms产生一个512维的特征向量，但实际上每一帧都经过多层卷积，可见到的时间不止20ms。
另外，在cnn0使用了GroupNorm，在cnn1-6的输出使用了GELU。

  (feature_extractor): Wav2Vec2FeatureEncoder(
    (conv_layers): ModuleList(
      (0): Wav2Vec2GroupNormConvLayer(
        (conv): Conv1d(1, 512, kernel_size=(10,), stride=(5,), bias=False)
        (activation): GELUActivation()
        (layer_norm): GroupNorm(512, 512, eps=1e-05, affine=True)
      )
      (1): Wav2Vec2NoLayerNormConvLayer(
        (conv): Conv1d(512, 512, kernel_size=(3,), stride=(2,), bias=False)
        (activation): GELUActivation()
      )
      (2): Wav2Vec2NoLayerNormConvLayer(
        (conv): Conv1d(512, 512, kernel_size=(3,), stride=(2,), bias=False)
        (activation): GELUActivation()
      )
      (3): Wav2Vec2NoLayerNormConvLayer(
        (conv): Conv1d(512, 512, kernel_size=(3,), stride=(2,), bias=False)
        (activation): GELUActivation()
      )
      (4): Wav2Vec2NoLayerNormConvLayer(
        (conv): Conv1d(512, 512, kernel_size=(3,), stride=(2,), bias=False)
        (activation): GELUActivation()
      )
      (5): Wav2Vec2NoLayerNormConvLayer(
        (conv): Conv1d(512, 512, kernel_size=(2,), stride=(2,), bias=False)
        (activation): GELUActivation()
      )
      (6): Wav2Vec2NoLayerNormConvLayer(
        (conv): Conv1d(512, 512, kernel_size=(2,), stride=(2,), bias=False)
        (activation): GELUActivation()
      )
    )
  )

3.2 context

整体结构图中的context包括左右两部分，左边负责将z转换成c（对应wav2vec2特征），右边负责将z离散化以计算损失。

左边部分中，对于输入512×50的z，有：
post_extract_proj: 768×50
apply_mask->pos_conv->LN: 768×50
Transformer*12: 768×50
choose_masking: 768xM，M为mask的帧数
final_proj: 256xM

右边部分中，对于输入512×50的z，有：
choose_masking: 512xM
quantizer: 256xM
project_q: 256xM

其中，量化的参数有：码本个数G=2，每个码本的条目个数V=320，条目的维度d/G=256/2=128。参数含义：G=latent_groups，V=latent_vars，d=vq_dim。
具体的quantizer流程如下图所示，前向的时候直接找出来最大值对应的码本中的条目，相当于是一个离散的操作，但是这个步骤不可导，无法进行反向传播，为了解决这个问题，采用了gumbel softmax操作。

; 3.3 wav2vec2.0的使用（transformers库）

import soundfile as sf
import torch
from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor

processor = Wav2Vec2Processor.from_pretrained("facebook/wav2vec2-base-960h")
model = Wav2Vec2ForCTC.from_pretrained("facebook/wav2vec2-base-960h")

audio_input, sample_rate = sf.read(path_audio)
input_values = processor(audio_input, sampling_rate=sample_rate, return_tensors="pt").input_values

logits = model(input_values).logits
predicted_ids = torch.argmax(logits, dim=-1)

transcription = processor.decode(predicted_ids[0])

from transformers import Wav2Vec2Model
model = Wav2Vec2Model.from_pretrained("facebook/wav2vec2-base-960h")
wav2vec2 = model(input_values)['last_hidden_state']

参考文献

https://blog.csdn.net/xmdxcsj/article/details/115787729

Original: https://blog.csdn.net/tobefans/article/details/125434796
Author: weiquan fan
Title: 【语音算法】wav2vec系列原理和使用

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/717593/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

KingbaseES 全文检索功能介绍

KingbaseES 内置的缺省的分词解析器采用空格分词，因为中文的词语之间没有空格分割，所以这种方法并不适用于中文。要支持中文的全文检索需要额外的中文分词插件：zhparser …

人工智能 2023年5月31日
0066
【教学】图像分类算法中的召回率recall、精准率precision和f1score得分等计算。

首先我们来介绍一下这些名称的含义。 TP: 预测为1(Positive)，实际也为1(Truth-预测对了) TN: 预测为0(Negative)，实际也为0(Truth-预测对了…

人工智能 2023年7月3日
0044
PaddleSpeech 音频和视频惊艳众人的准确率

1、关于视频抽取固定采样率音频：ffmpeg -i test2.mp4 -f wav -ar 16000 test3.wav -i .[迅雷下载xunbo.cc]爱情公寓第二季EP…

人工智能 2023年5月27日
0062
mmdetection3D RuntimeError: Error compiling objects for extension

最近在配置open-mmlab的mmdetection3d项目，其中大部分的步骤都可以很方便的完成，但是在CUDA版本和torch版本上会有一定的问题，详细记录下：前面的几个步骤…

人工智能 2023年6月10日
0066
Jetson nano (4GB B01) 系统安装，官方Demo测试（目标检测、手势识别）

Jetson nano (4GB B01) 系统安装，官方Demo测试（目标检测、手势识别）此文确保你可以正确搭建jetson nano环境，并跑通官方”hello…

人工智能 2023年7月27日
0047
【论文翻译】TNT: Target-driveN Trajectory Prediction

文章目录 1. 前言 2. 相关工作 3. 公式 4. 目标驱动轨迹预测 * 4.1 场景背景编码 4.2 目标预测 4.3 目标条件运动估计 4.4 轨迹评分和选择 4.5 训练…

人工智能 2023年6月10日
0069
解决No module named numpy问题

目录前沿解决解决方法1：方法2：（强行安装更新更高的版本）前沿最近开始学习python了，由于要简单处理一下图片，奈何能C++力太差，openCV上手有点难，想学习一下…

人工智能 2023年5月26日
0052
Collaborative算法是如何实现用户之间的信息共享和合作的

详细解决问题：Collaborative算法如何实现用户之间的信息共享和合作在推荐系统中，Collaborative Filtering（协同过滤）是一种常用的算法，用于给用户推…

人工智能 2024年1月4日
0029
Pandas介绍

Pandas Pandas 是 Python 语言的一个扩展程序库，用于数据分析。 Pandas 是一个开放源码、BSD 许可的库，提供高性能、易于使用的数据结构和数据分析工具。 …

人工智能 2023年6月29日
0050
YOLOV7训练自己的yolo数据集

YOLOv7源码：https://github.com/WongKinYiu/yolov7 文章目录一、配置YOLOv7环境二、使用自己的数据集训练 * 修改yolov7配置 …

人工智能 2023年6月17日
0082
【OpenCV】“帧差法”实现移动物体的检测（车辆识别）

目录一、帧差法 1、概念 2、为什么帧差法可以检测运动的物体？二、使用OpenCV配合帧差法实现车辆识别 1、加载视频 2、灰度处理+帧差计算 3、二值化 4、腐蚀 5、膨胀 …

人工智能 2023年7月19日
0037
第14章：傅里叶变换

第14章：傅里叶变换 * – 一、理论基础： – 二、Numpy实现傅里叶变换： – + 1. 实现傅里叶变换： + 2. 逆傅里叶变换： + …

人工智能 2023年6月20日
0053
Negative Margin Matters: Understanding Margin in Few-Shot Classification（理解小样本分类的边缘）

Abstract. 本文引入了一个基于度量学习的小样本学习的负边缘损失，负边缘损失显著优于softmax损失，在三个标准的小样本分类基准上实现了最好效果的accuracy。这些结果…

人工智能 2023年7月2日
0070
【opencv】YUV各种色彩、YUV420sp2RGB

对于 YUV 所表示的图像，Y 和 UV 分量是分离的。如果只有 Y 分量而没有 UV 分离，那么图像表示的就是黑白图像。彩色电视机采用的就是 YUV 图像，解决与和黑白电视机的兼…

人工智能 2023年6月20日
0099
CUDA安装及开发环境的配置

CUDA安装以及开发环境配置最近要使用CUDA进行C++和DL的学习，主要是用到cuda对C++代码进行优化加速，和pytorch通过cuda使用GPU进行加速。配环境的过程中遇…

人工智能 2023年7月23日
0045
深度学习实战篇之 ( 十七) — TensorFlow之DenseNet

科普知识 ACM 国际多媒体会议（ACM International Conference on Multimedia）是计算机科学领域中多媒体领域的首要国际会议。多媒体研究的重点…

人工智能 2023年5月24日
0074

2024 年 4 月
一	二	三	四	五	六	日
1	2	3	4	5	6	7
8	9	10	11	12	13	14
15	16	17	18	19	20	21
22	23	24	25	26	27	28
29	30

【语音算法】wav2vec系列原理和使用

文章目录

; 3.1 encoder

3.2 context

; 3.3 wav2vec2.0的使用（transformers库）

大家都在看