语音如何变成文字？这是一篇你能读懂的科普

2016-06-24 17:12　来源：极客公园 0

　　作者：黑板报值日生

　　编辑注：本文为知乎用户张俊博原创，极客公园已获作者转载许可，原文链接：https://www.zhihu.com/question/20398418/answer/18080841。

　　简要给大家介绍一下语音怎么变文字的吧。希望这个介绍能让所有同学看懂。

　　首先，我们知道声音实际上是一种波。常见的 mp3、wmv 等格式都是压缩格式，必须转成非压缩的纯波形文件来处理，比如 Windows PCM 文件，也就是俗称的 wav 文件。wav 文件里存储的除了一个文件头以外，就是声音波形的一个个点了。下图是一个波形的示例。

　　在开始语音识别之前，有时需要把首尾端的静音切除，降低对后续步骤造成的干扰。这个静音切除的操作一般称为 VAD，需要用到信号处理的一些技术。

　　要对声音进行分析，需要对声音分帧，也就是把声音切开成一小段一小段，每小段称为一帧。分帧操作一般不是简单的切开，而是使用移动窗函数来实现，这里不详述。帧与帧之间一般是有交叠的，就像下图这样：

　　图中，每帧的长度为 25 毫秒，每两帧之间有 25-10=15 毫秒的交叠。我们称为以帧长 25 ms、帧移 10 ms 分帧。图中，每帧的长度为 25 毫秒，每两帧之间有 25-10=15 毫秒的交叠。我们称为以帧长 25 ms、帧移 10 ms 分帧。

　　分帧后，语音就变成了很多小段。但波形在时域上几乎没有描述能力，因此必须将波形作变换。常见的一种变换方法是提取 MFCC 特征，根据人耳的生理特性，把每一帧波形变成一个多维向量，可以简单地理解为这个向量包含了这帧语音的内容信息。这个过程叫做声学特征提取。实际应用中，这一步有很多细节，声学特征也不止有 MFCC 这一种，具体这里不讲。

余下全部

语音如何变成文字？这是一篇你能读懂的科普

新闻推荐