值得留意的是,CTC 损掉函数中的字符级缺点与平日被用于惯例语音辨认模型的莱文斯坦错词距离。对于字符生成 RNN 来说,字符和单词缺点距离在表音文字(phonetic language)中是雷同的(如世界语、克罗地亚语),这些说话的不合发音对应不合字符。与之相反的是,字符与单词缺点距离在其他拼音文字中(如英语)有着明显不合。
如不雅你欲望懂得 CTC 的更多内容和百度对它最新的研究,以下是一些链接:
- http://suo.im/tkh2e
- http://suo.im/3WuVwV
- https://arxiv.org/abs/1703.00096
为了优化算法,构建传统/深度语音辨认模型,SVDS 的团队开辟了语音辨认平台:

三、数据的重要性
毫无疑问,练习一个将语沂紫嗉为文字的体系须要数字语音文件和这些灌音的转录文本。因为模型终将被用于解释新的语音,所以越多的练习意味着跃?锬表示。SVDS 的研究人员应用了大年夜量带有转录的英文语音对模型进行练习;个中的一些数据包含 LibriSpeech(1000 小时)、TED-LIUM(118 小时)和 VoxForge(130 小时)。下图展示了这些数据集的信息,包含时长,采样率和注释。
- LibriSpeech:http://www.openslr.org/12/
- TED-LIUM:http://www.openslr.org/7/
- VoxForge:http://www.voxforge.org/

四、特点表示
为了让机械辨认音频数据,数据必须先大年夜时域转换为频域。有几种用于创建音频数据机械进修特点的办法,包含随便率性频率的 binning(如 100Hz),或中听可以或许感知的频率的 binning。这种典范的语音数据转换须要计算 13 位或 26 位不合倒谱特点的梅尔倒频谱系数(MFCC)。在转换之后,数据被存储为时光(列)和频率系数(行)的矩阵。

因为天然说话的语音不是自力的,它们与字母也不是一一对应的关系,我们可以经由过程练习神经统??声音数据上的重叠窗口(前后 10 毫秒)来捕获协同发音的效不雅(一个音节的发音影响了另一个)。以下代码展示了若何获取 MFCC 特点,以及若何创建一个音频数据的窗口。

- Load wav files
- fs, audio = wav.read(audio_filename)
- # Get mfcc coefficients
- orig_inputs = mfcc(audio, samplerate=fs, numcepnumcep=numcep)
- # For each time slice of the training set, we need to copy the context this makes
- train_inputs = np.array([], np.float32)
- train_inputs.resize((orig_inputs.shape[0], numcep + 2 * numcep * numcontext))
- for time_slice
推荐阅读
7月底,黑客大年夜HBO那盗走了《权力的游戏》资本,并在本月初放出泄漏片段。收集安然公司Proofpoint宣布了一份申报,称有人应用泄漏的《权力的游戏》资本来引导用户下载恶意软件,内含RA>>>详细阅读
本文标题:如何使用TensorFlow构建、训练和改进循环神经网络
地址:http://www.17bianji.com/lsqh/37006.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示