当前位置：首页 > news >正文

极智项目 | 基于PyQT+Whisper实现的语音识别软件设计

news 2025/8/13 5:37:04

这是一个基于OpenAI的Whisper模型的语音识别应用程序，使用PyQt5构建了简洁直观的用户界面。该应用支持多语言识别，特别优化了中文识别体验。

项目下载：链接

功能特点

简洁现代的深色主题界面
支持多语言识别（中文、英语、日语等）
中文繁简转换功能，自动将繁体中文转为简体
内置音频播放功能
异步识别过程，避免界面卡顿
实时显示识别进度和状态信息

系统要求

Ubuntu 18.04 或更高版本
Python 3.8 或更高版本
至少 4GB RAM（使用base模型）

依赖安装 (Ubuntu)

1. 系统依赖

首先安装必要的系统依赖：

# 更新包索引
sudo apt update# 安装基础依赖
sudo apt install -y python3-pip python3-dev python3-venv# 安装ffmpeg (Whisper音频处理必需)
sudo apt install -y ffmpeg# 安装mpv播放器 (用于音频播放功能)
sudo apt install -y mpv# 安装Qt依赖
sudo apt install -y libqt5widgets5 libqt5gui5 libqt5core5a

2. 创建虚拟环境 (推荐)

# 创建虚拟环境
python3 -m venv whisper_env# 激活环境
source whisper_env/bin/activate

3. 安装Python依赖

# 更新pip
pip install --upgrade pip# 安装必要的Python包
pip install openai-whisper==20230314  # Whisper语音识别模型
pip install torch==2.0.1              # PyTorch (Whisper依赖)
pip install PyQt5==5.15.9             # 图形界面框架
pip install zhconv==1.4.3             # 中文繁简转换
pip install numpy==1.24.3             # 数值计算库 (Whisper依赖)
pip install tqdm==4.65.0              # 进度条显示

运行应用

下载项目
激活虚拟环境（如果你使用了虚拟环境）：

source whisper_env/bin/activate

启动应用程序：

python main.py

使用指南

选择语言：从下拉菜单中选择输出语言（可选，默认自动检测）
选择音频文件：点击"选择文件"按钮，选择要识别的音频文件
开始识别：点击"开始识别"按钮开始处理
播放音频：可以使用"播放音频"按钮来回放选择的音频文件
查看结果：识别完成后，结果将显示在底部的文本区域、

支持的音频格式

MP3 (.mp3)
WAV (.wav)
FLAC (.flac)
M4A (.m4a)
OGG (.ogg)

常见问题

首次使用较慢：首次运行时，应用会自动下载Whisper模型文件，根据网络速度可能需要几分钟到几十分钟不等。
中文识别：应用支持中文识别，并自动将繁体中文转换为简体中文。
内存使用：默认使用的"base"模型大小适中，内存消耗约为1GB。

关于Whisper模型

Whisper是OpenAI开发的通用语音识别模型，它在大量多样化的音频数据上进行训练，并能够执行多语种语音识别、语音翻译、语言识别和语音活动检测等任务。

更多信息请参考Whisper GitHub仓库。

http://www.lqws.cn/news/94267.html

相关文章：

从一堆数字里长出一棵树：中序 + 后序构建二叉树的递归密码

懒猫微服进阶心得（五）：使用懒猫微服做Ventoy启动盘

Nginx 的配置文件

OpenCV 滑动条调整图像亮度

[yolov11改进系列]基于yolov11使用FasterNet替换backbone用于轻量化网络的python源码+训练源码

谷歌地图苹果版v6.138.2 - 前端工具导航

DrissionPage 性能优化实战指南：让网页自动化效率飞升

MySQL 8 完整安装指南（Ubuntu 22.04）

【R语言编程绘图-mlbench】

实验设计与分析（第6版，Montgomery著，傅珏生译) 第9章三水平和混合水平析因设计与分式析因设计9.5节思考题9.1 R语言解题

实验设计与分析（第6版，Montgomery著，傅珏生译) 第10章拟合回归模型10.9节思考题10.1 R语言解题

R语言使用随机过采样（Random Oversampling）平衡数据集

RagFlow优化代码解析

【Ragflow】25.Ragflow-plus开发日志：excel文件解析新思路/公式解析适配

Ubuntu 挂载新盘

《对象创建的秘密：Java 内存布局、逃逸分析与 TLAB 优化详解》

TDengine 高级功能——流计算

mac环境下的python、pycharm和pip安装使用

JavaScript 数据处理 - 数值转不同进制的字符串（数值转十进制字符串、数值转二进制字符串、数值转八进制字符串、数值转十六进制字符串）

ForkJoinTask深度解析：Java并行计算利器

前端限流如何实现，如何防止服务器过载

SpringCloud 分布式锁Redisson锁的重入性高并发获取锁

WAF绕过，网络层面后门分析，Windows/linux/数据库提权实验

【Spring AI】调用 DeepSeek 实现问答聊天

使用Process Explorer、System Informer（Process Hacker）和Windbg工具排查软件高CPU占用问题

4-C#的不同窗口传值

Linux下使用nmcli连接网络