import speech_recognition as sr

def transcribe_audio(audio_file):
    recognizer = sr.Recognizer()

    with sr.AudioFile(audio_file) as source:
        audio_data = recognizer.record(source)

    try:
        text = recognizer.recognize_sphinx(audio_data, language='zh-CN')  # 使用Sphinx进行本地语音识别
        print("Transcript: {}".format(text))
    except sr.UnknownValueError:
        print("Sphinx could not understand audio")
    except sr.RequestError as e:
        print("Sphinx error; {0}".format(e))

# Replace 'path/to/your/audio.wav' with the path to your PCM format WAV file
transcribe_audio('xxx.wav')

只需要 

pip speech_recognition
pip3 install pocketsphinx

下载模型:

 

CMU Sphinx - Browse /Acoustic and Language Models at SourceForge.net 

然后找到Lib\site-packages\目录下的speech_recognition,再把下载的模型复制进去,命名如下:

最后运行发现 效果十分不给力。。。。。

语音格式应为WAV格式,我再里面说的内容是机器人,居然识别为金融了。。。。

参考:

CMU Sphinx:语音识别开源利器 | 快速上手语音识别 | 机器语音 - 知乎 (zhihu.com)

window下使用CMUSphinx实现中文识别_安装 sphinx zh-cn 普通话识别 配置-CSDN博客

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐