对于这个 RNN 例子来说,我们在每个窗口应用前后各 9 个时光点——共 19 个时光点。有 26 个倒谱系数,在 25 毫秒的时光里共 494 个数据点。根据数据采样率,我们建议在 16,000 Hz 上有 26 个倒谱特点,在 8,000 Hz 上有 13 个倒谱特点。以下是一个 8,000 Hz 数据的加载窗口:

为了让模型更易获取数据,我们将所稀有据存储为同一格局。每条数据由一个.wav 文件和一个.txt 文件构成。例如:Librispeech 的『211-122425-0059』 在 Github 中对应着 211-122425-0059.wav 与 211-122425-0059.txt。这些数据的文件应用数据集对象类被加载到 TensorFlow 图中,如许可以让 TensorFlow 在加载、预处理和载入单批数据时效力更高,节俭 CPU 和 GPU 内存负载。数据集对象中数据字段的示例如下所示:
如不雅你欲望懂得更多有关转换数字音频用于 RNN 语音识其余办法,可以看看 Adam Geitgey 的介绍:http://suo.im/Wkp8B
五、对语音的序列本质建模
长短期记忆(LSTM)是轮回神经收集(RNN)的一种,它实用于对依附经久次序的数据进行建模。它对于时光序列数据的建模异常重要,因为这种办法可以在当前时光点保持以前信息的记忆,大年夜而改良输出结不雅,所以,这种特点对于语音辨认异常有效。如不雅你想懂得在 TensorFlow 中若何实例化 LSTM 单位,以下是受 DeepSpeech 启发的双向轮回神经收集(BiRNN)的 LSTM 层示例代码:
- with tf.name_scope('lstm'):
- # Forward direction cell:
- lstm_fw_cell = tf.contrib.rnn.BasicLSTMCell(n_cell_dim, forget_bias=1.0, state_is_tuple=True)
- # Backward direction cell:
- lstm_bw_cell = tf.contrib.rnn.BasicLSTMCell(n_cell_dim, forget_bias=1.0, state_is_tuple=True)
- # Now we feed `layer_3` into the LSTM BRNN cell and obtain the LSTM BRNN output.
- outputs, output_states = tf.nn.bidirectional_dynamic_rnn(
- cell_fw=lstm_fw_cell,
- cell_bw=lstm_bw_cell,
推荐阅读
7月底,黑客大年夜HBO那盗走了《权力的游戏》资本,并在本月初放出泄漏片段。收集安然公司Proofpoint宣布了一份申报,称有人应用泄漏的《权力的游戏》资本来引导用户下载恶意软件,内含RA>>>详细阅读
本文标题:如何使用TensorFlow构建、训练和改进循环神经网络
地址:http://www.17bianji.com/lsqh/37006.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示