
来自 Silicon Valley Data Science 公司的研究人员为我们展示了轮回神经收集(RNN)摸索时光序列和开辟语音辨认模型的才能。今朝有很多人工智能应用都依附于轮回深度神经收集,在谷歌(语音搜刮)、百度(DeepSpeech)和亚马逊的产品中都能看到RNN的身影。
然而,当我们开端着手构建本身的 RNN 模型时,我们发明在应用神经收集处理语音辨认如许的义务上,几乎没有简单直接的先例可以遵守。一些可以找到的例子功能异常强大年夜,但异常复杂,如 Mozilla 的 DeepSpeech(基于百度的研究,应用 TensorFlow);抑或极其简单抽象,无法应用于实际数据。
在本教程的 Github 里,作者供给了一些介绍以赞助读者在 TensorFlow 中应用 RNN 和 CTC 损掉函数练习端到端语音辨认体系。大年夜部分事例数据来自 LibriVox。数据被分别存放于以下文件夹中:
- Train: train-clean-100-wav (5 examples)
- Test: test-clean-wav (2 examples)
- Dev: dev-clean-wav (2 examples)
本文将供给一个有关若何应用 RNN 练习语音辨认体系的简短教程,个中包含代码片段。本教程的灵感来自于各类开源项目。
本项目 GitHub 地址:https://github.com/silicon-valley-data-science/RNN-Tutorial
起首,在开端浏览本文以前,如不雅你对 RNN 还不懂得,可以浏览 Christopher Olah 的 RNN 长短期记忆收集综述:
http://colah.github.io/posts/2015-08-Understanding-LSTMs/
一、语音辨认:声音和转录
直到 2010 年时,最优良的语音辨认模型仍是基于语音学(Phonetics)的办法,它们平日包含拼写、声学和说话模型等零丁组件。不论是以前照样如今,语音辨认技巧都依附于应用傅里叶变换将声波分化为频率和幅度,产生如下所示的频谱图:

在练习语音模型时,应用隐马尔科夫模型(Hidden Markov Models,HMM)须要语音+文本数据,同时还须要单词与音素的词典。HMM 用于次序数据的生成概率模型,平日应用莱文斯坦距朗攀来评估(Levenshtein 距离,是编辑距离的一种。指两个字串之间,由一个转成另一个所需的起码编辑操作次数。可以进行的编辑操作包含将一个字符调换成另一个字符,插入一个字符,删除一个字符)。
这些模许可以被简化或经由过程音素接洽关系数据的练习变得更精确,但那是一些乏味的手工义务。因为这个原因,音素级其余语沂紫嗉在大年夜数据集的前提下比拟悼?炊其余转录更难以实现。有关语音辨认对象和模型的更多内容可以参考这篇博客:
二、连接时光分类(CTC)损掉函数
- class DataSet:
- def __init__(self, txt_files, thread_count, batch_size, numcep, numcontext):
- # ...
- def from_directory(self, dirpath, start_idx=0, limit=0, sort=None):
- return txt_filenames(dirpath, start_idxstart_idx=start_idx, limitlimit=limit, sortsort=sort)
- def next_batch(self, batch_size=None):
- idx_list = range(_start_idx, end_idx)
- txt_files = [_txt_files[i] for i in idx_list]
- wav_files = [x.WordStr('.txt', '.wav') for x in txt_files]
- # Load audio and text into
推荐阅读
7月底,黑客大年夜HBO那盗走了《权力的游戏》资本,并在本月初放出泄漏片段。收集安然公司Proofpoint宣布了一份申报,称有人应用泄漏的《权力的游戏》资本来引导用户下载恶意软件,内含RA>>>详细阅读
本文标题:如何使用TensorFlow构建、训练和改进循环神经网络
地址:http://www.17bianji.com/lsqh/37006.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示