kaldi工具搭建语音识别系统——数据处理

2023年6月4日下午12:02 • 人工智能 • 阅读 64

Kaldi（http://kaldi-asr.org/doc/）是一个语音识别工具。使用 C++ 开发，基于 Apache 许可证。目的是为语音识别研究者提供。
Kaldi 的目标和受众范围与 HTK 相似。目标是用 C++ 编写的现代灵活的代码，易于修改和扩展。重要功能包括：

与有限状态传感器（FST）的代码级集成
根据 OpenFst 工具包进行编译（将其用作库）。
广泛的线性代数支持
包括一个矩阵库，它封装了标准的 BLAS 和 LAPACK 例程。
可扩展设计。

kaldi是一个对新手极其不友好的工具，首先表现在它的官方文档很硬核，全英文。网上关于它的使用资料很少，对学习者是一个很大的挑战；其次，kaldi是用C++编写，在windows下支持的不是很全面，所以需要在linux机器上使用它，这就要求学习者对linux系统及其shell命令比较熟悉。综合两方面，该工具使用需要一定的门槛，为了方便学习Kaldi工具，特此记录，欢迎学习kaldi工具的小伙伴，关注我的公众号”每日猿码”，一起学习~

Kaldi搭建语音识别系统实践——数据准备

本文以AISHELL数据为例，做实践演示

获取源码

git clone https://github.com/kaldi-asr/kaldi.git

编译源码

该部分参见我的另外一篇文章，关于centos下编译Kaldi。

创建工程

kaldi的实例都放在kaldi/egs的目录下，我们来看yesno实例的工程目录结构，为了保持与kaldi一致，我们需要创建类似kaldi/name/version模板的工程，文件列表如下图所示。

data : 存放相关数据的文件夹,比如训练集,测试集,语言模型,发音字典等文件。
steps: kaldi官方工具, 封装了am训练/解码等脚本。
utils: kaldi 官方工具, 封装了数据处理, lm处理等常用脚本。
local: 用户自定义的一些处理脚本一般放在这, 比如计算词错率脚本啥的。
conf: 存放配置文件的目录, 这里面一般有提取特征/解码需要的配置。
cmd.sh: 该文件定义了训练/构图/解码需要的硬件支持配置。
path.sh: 该文件需要声明kaldi根目录所在位置, 这样可以可以使用kaldi一些二进制命令

下载数据集

aishell-1(http://www.aishelltech.com/kysjcp)提供了178小时的中文含标注的语音数据（aishell-1开源中文语音数据库），下载该完数据集后，解压会得到如下图所示两个文件夹

其中data_aishell/wav存放wav的压缩文件，解压后会得到 train,dev,test 数据用于训练/开发/测试:

另外的文件夹存放说话人信息及汉字与音素的对应关系。

标准的kaldi数据格式

text文件

该文件表示语音与说话内容的关系，如下图所示

scp文件

该文件表示语音与存放路径的对应关系，如下图所示

utt2spk

该文件表示语音与说书人的对应关系，如下图所示

spk2utt

该文件表示说话人与语音的对应关系，如下图所示

数据处理

该代码为kaldi中源码自带数据处理脚本,全为shell，若有不懂,可私聊小编

#!/usr/bin/env bash

Copyright 2017 Xingyu Na
Apache 2.0

. ./path.sh || exit 1;

if [ $# != 2 ]; then
  echo "Usage: $0 <audio-path> <text-path>"
  echo " $0 /export/a05/xna/data/data_aishell/wav /export/a05/xna/data/data_aishell/transcript"
  exit 1;
fi

aishell_audio_dir=$1
aishell_text=$2/aishell_transcript_v0.8.txt

train_dir=data/local/train
dev_dir=data/local/dev
test_dir=data/local/test
tmp_dir=data/local/tmp

mkdir -p $train_dir
mkdir -p $dev_dir
mkdir -p $test_dir
mkdir -p $tmp_dir

data directory check
if [ ! -d $aishell_audio_dir ] || [ ! -f $aishell_text ]; then
  echo "Error: $0 requires two directory arguments"
  exit 1;
fi

find wav audio file for train, dev and test resp.

find $aishell_audio_dir -iname "*.wav" > $tmp_dir/wav.flist
n=cat $tmp_dir/wav.flist | wc -l
[ $n -ne 141925 ] && \
  echo Warning: expected 141925 data data files, found $n

grep -i "wav/train" $tmp_dir/wav.flist > $train_dir/wav.flist || exit 1;
grep -i "wav/dev" $tmp_dir/wav.flist > $dev_dir/wav.flist || exit 1;
grep -i "wav/test" $tmp_dir/wav.flist > $test_dir/wav.flist || exit 1;

rm -r $tmp_dir

Transcriptions preparation
for dir in $train_dir $dev_dir $test_dir; do
  echo Preparing $dir transcriptions
  sed -e 's/\.wav//' $dir/wav.flist | awk -F '/' '{print $NF}' > $dir/utt.list
  sed -e 's/\.wav//' $dir/wav.flist | awk -F '/' '{i=NF-1;printf("%s %s\n",$NF,$i)}' > $dir/utt2spk_all
  paste -d' ' $dir/utt.list $dir/wav.flist > $dir/wav.scp_all
  utils/filter_scp.pl -f 1 $dir/utt.list $aishell_text > $dir/transcripts.txt
  awk '{print $1}' $dir/transcripts.txt > $dir/utt.list
  utils/filter_scp.pl -f 1 $dir/utt.list $dir/utt2spk_all | sort -u > $dir/utt2spk
  utils/filter_scp.pl -f 1 $dir/utt.list $dir/wav.scp_all | sort -u > $dir/wav.scp
  sort -u $dir/transcripts.txt > $dir/text
  utils/utt2spk_to_spk2utt.pl $dir/utt2spk > $dir/spk2utt
done

mkdir -p data/train data/dev data/test

for f in spk2utt utt2spk wav.scp text; do
  cp $train_dir/$f data/train/$f || exit 1;
  cp $dev_dir/$f data/dev/$f || exit 1;
  cp $test_dir/$f data/test/$f || exit 1;
done

echo "$0: AISHELL data preparation succeeded"
exit 0;
</text-path></audio-path>

总结

今天的数据处理就讲到这里，大家有什么不懂的地方，可关注公众号”每日猿码”，私聊小编，保证知无不言~

Original: https://www.cnblogs.com/saltape/p/16205194.html
Author: 牙牙学语的猿
Title: kaldi工具搭建语音识别系统——数据处理

原创文章受到原创版权保护。转载请注明出处：https://www.johngo689.com/567617/

转载文章受原作者版权保护。转载请注明原作者出处！

人工智能

【自取】最近整理的，有需要可以领取学习：

Linux核心资料大放送~

全栈面试题汇总（持续更新&可下载）

一个提高学习100%效率的工具！

【超详细】深度学习面试题目！

LeetCode Python刷题答案下载！

LeetCode Java版刷题答案下载！

LeetCode C++ 版本，抓紧保存！

LeetCode GO语言刷题答案下载！

【ABAQUS】模态分析

introduce 模态分析是研究结构动力特性的一种方法。模态是指机械结构的固有振动特性，一阶模态都对应特定的固有频率、阻尼比和振型。得到这些模态参数的过程就是模态分析。如果是利…

人工智能 2023年6月15日
0074
SLAM 06.视觉里程计-3-直接法

1、特征法和直接法比较 1.1、特征法的缺点特征点法有如下几个缺点：特征点法需要提取多个特征点以及描述子，并且要进行多个特征点之间的匹配，运算量很大，难于满足实时要求。SIFT…

人工智能 2023年6月16日
0086
预后建模绕不开的lasso cox回归

欢迎关注”生信修炼手册”! 回归我们并不陌生，线性回归和最小二乘法，逻辑回归和最大似然法，这些都是我们耳熟能详的事物，在生物信息学中的应用也比较广泛, 回归…

人工智能 2023年6月16日
0078
MXNe

MXNet介绍 MXNet是一种深度学习框架，由深度学习组织DMLC于2014年发起开发，后来得到了亚马逊、英伟达、微软等公司的支持和贡献，成为Apache孵化项目。MXNet支持…

人工智能 2023年12月31日
0041
什么是过拟合

什么是过拟合？过拟合（Overfitting）是指机器学习模型在训练数据上的表现非常好，但在新的、未见过的数据上表现较差的现象。简单来说，过拟合就是模型在训练集上“死记硬背”了所…

人工智能 2023年12月31日
0034
DLA模型(分类模型+改进版分割模型) + 可变形卷积

Deep Layer Aggregation (DLA) 是一种网络特征融合方法，发表于CVPR 2018。相比传统串联的卷积网络，其典型特点是实现了不同层级的深度融合，相比目标检…

人工智能 2023年7月29日
0052
Unity场景优化工具：Mesh Baker 基础教程（贴图篇）

目录前言一、Mash Baker是什么？二、使用步骤 1.打开场景 2.将Texture Baker添加到场景中 3.使用Texture Baker生成贴图集 4.烘焙新的模…

人工智能 2023年7月31日
0076
深度学习记录配置篇————服务器python虚拟环境配置+pycharm远程连接

环境下 pytorch可以按照如下步骤进行： 1. 打开anaconda，创建一个新的环境，例如命名为”pytorch_env”。 2. 在命令行中使用c…

人工智能 2023年5月25日
0058
如何判断超参数调优的效果？有哪些常用的评估指标

如何判断超参数调优的效果在机器学习中，超参数是指在模型训练之前需要设置的参数，而不是通过训练得出的参数。超参数的选择对模型的准确性和性能有着重要影响，因此超参数调优是机器学习领域…

人工智能 2024年1月6日
0055
Ubuntu18.04安装opencv和opencv_contrib

Ubuntu18.04安装opencv和opencv_contrib 由于最近要在OpenCV3中使用SIFT和SURF特征提取，而自从OpenCV2升级到OpenCV3版本后，S…

人工智能 2023年7月18日
0056
【自然语言处理】【ChatGPT系列】InstructGPT：遵循人类反馈指令来训练语言模型

啊哦~你想找的内容离你而去了哦内容不存在，可能为如下原因导致： ① 内容还在审核中 ② 内容以前存在，但是由于不符合新的规定而被删除 ③ 内容地址错误 ④ 作者删除了内容。可…

人工智能 2023年7月31日
0055
【ESP32 Arduino平衡小车制作】（一）霍尔编码器解码

在接下来的时间里，我将记录ESP32 Arduino平衡小车制作的全部过程。 esp32 arduino平衡小车制作（一） * – 一、编码器介绍 – + …

人工智能 2023年6月1日
00168
opencv[c++] findContours()轮廓特征分析大全(求面积、周长、几何矩、质心、凸包、最小外接矩形、最小外接三角形、最小外接椭圆等)—后续完善总结版本

目录一，轮廓的发现与绘制二，轮廓分析（二值图像分析) 🧡计算轮廓面积 : 💛计算轮廓周长： 💚计算几何矩与中心距: moments(） 💙轮廓的外接矩形： 💜最小外接圆/拟合圆…

人工智能 2023年6月20日
0068
吴恩达机器学习课后作业Python实现(三)：多类分类与前馈神经网络

目录多类分类数据集数据可视化正则化逻辑回归正则化代价函数正则化梯度 One-vs-all分类 One-vs-all预测前馈神经网络模型表示模型搭建前馈传播与预测…

人工智能 2023年7月14日
0062
【Python零基础快速入门系列 | 01】人工智能序章：开发环境搭建Anaconda+VsCode+JupyterNotebook(零基础启动)

这是机器未来的第5篇文章原文首发地址：https://blog.csdn.net/RobotFutures/article/details/124896539 《Python零基…

人工智能 2023年7月29日
0082
一篇比较明白的共现矩阵解读

文章目录前言一、词向量是什么？ * 1.1离散表示（one-hot representation） 1.2分布式表示（distribution representation） …

人工智能 2023年5月27日
0073

2024 年 5 月
一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31