利用Python打造一款语音识别的程序！学会外包项目基本随便接了

▌语言识别工作原理概述

▌选择 Python 语音识别包

PyPI中有一些现成的语音识别软件包。其中包括：

•apiai

•google-cloud-speech

•pocketsphinx

•SpeechRcognition

•watson-developer-cloud

•wit

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

▌安装 SpeechRecognation

SpeechRecognition 兼容 Python2.6 , 2.7 和 3.3+，但若在 Python 2 中使用还需要一些额外的安装步骤。本教程中所有开发版本默认 Python 3.3+。

读者可使用 pip 命令从终端安装 SpeechRecognition：

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

小编准备了一份Python学习资料，给那些正在学习Python的同学，或者准备学习Python的同学，关注，转发，私信小编“01”即可免费获取！

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

▌识别器类

SpeechRecognition 的核心就是识别器类。

Recognizer API 主要目是识别语音，每个 API 都有多种设置和功能来识别音频源的语音，分别是：

recognize_bing(): Microsoft Bing Speech

recognize_google(): Google Web Speech API

recognize_google_cloud(): Google Cloud Speech - requires installation of the google-cloud-speech package

recognize_houndify(): Houndify by SoundHound

recognize_ibm(): IBM Speech to Text

recognize_sphinx(): CMU Sphinx - requires installing PocketSphinx

recognize_wit(): Wit.ai

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

相信你已经猜到了结果，怎么可能从空文件中识别出数据呢？

这 7 个 recognize_*() 识别器类都需要输入 audio_data 参数，且每种识别器的 audio_data 都必须是 SpeechRecognition 的 AudioData 类的实例。

AudioData 实例的创建有两种路径：音频文件或由麦克风录制的音频，先从比较容易上手的音频文件开始。

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

若是使用 Linux 系统下的 x-86 ，macOS 或者是 Windows 系统，需要支持 FLAC文件。若在其它系统下运行，需要安装 FLAC 编码器并确保可以访问 flac 命令。

使用 record() 从文件中获取数据

在解释器会话框键入以下命令来处理 “harvard.wav” 文件的内容：

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

利用偏移量和持续时间获取音频片段

若只想捕捉文件中部分演讲内容该怎么办？record() 命令中有一个 duration 关键字参数，可使得该命令在指定的秒数后停止记录。

例如，以下内容仅获取文件前四秒内的语音：

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

在事先知道文件中语音结构的情况下，offset 和 duration 关键字参数对于分割音频文件非常有用。但使用不准确会导致转录不佳。

利用Python打造一款语音识别的程序！学会外包项目基本随便接了

噪声对语音识别的影响

噪声在现实世界中确实存在，所有录音都有一定程度的噪声，而未经处理的噪音可能会破坏语音识别应用程序的准确性。

要了解噪声如何影响语音识别，请下载 “jackhammer.wav” （https://github.com/realpython/python-speech-recognition/tree/master/audio_files）文件，并确保将其保存到解释器会话的工作目录中。文件中短语 “the stale smell of old beer lingers” 在是很大钻墙声的背景音中被念出来。

利用Python打造一款语音识别的程序！学会外包项目基本随便接了