识别率很低的本地语音转文字程序
·
import speech_recognition as sr
def transcribe_audio(audio_file):
recognizer = sr.Recognizer()
with sr.AudioFile(audio_file) as source:
audio_data = recognizer.record(source)
try:
text = recognizer.recognize_sphinx(audio_data, language='zh-CN') # 使用Sphinx进行本地语音识别
print("Transcript: {}".format(text))
except sr.UnknownValueError:
print("Sphinx could not understand audio")
except sr.RequestError as e:
print("Sphinx error; {0}".format(e))
# Replace 'path/to/your/audio.wav' with the path to your PCM format WAV file
transcribe_audio('xxx.wav')
只需要
pip speech_recognition
pip3 install pocketsphinx
下载模型:
CMU Sphinx - Browse /Acoustic and Language Models at SourceForge.net
然后找到Lib\site-packages\目录下的speech_recognition,再把下载的模型复制进去,命名如下:


最后运行发现 效果十分不给力。。。。。
语音格式应为WAV格式,我再里面说的内容是机器人,居然识别为金融了。。。。

参考:
魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。
更多推荐


所有评论(0)