基于WhisperX与Ollama+Qwen的本地会议工具,实现高精度语音转文字、说话人分离、AI智能纪要生成,支持多模板与在线编辑。附带转录矫正工具,可音视频同步校对。全程离线运行,无需联网,保障数据隐私。
📝 全本地化智能会议纪要助手 (Whisper + Ollama + Qwen)
核心优势:完全本地化运行,无需联网,保护隐私。采用 Whisper Large V3 进行高精度语音识别,结合 Ollama 部署的 Qwen2.5-7B/14B(注:Qwen3尚未正式广泛发布,此处以主流高性能本地模型为例,或指代最新Qwen系列)进行智能纪要生成。解决了 HuggingFace 权限配置难题,实现开箱即用。
🚀 快速开始指南
请确保您的系统已安装 Python 3.11 或更高版本。
1. 环境准备
打开命令行终端(CMD 或 PowerShell),进入项目源码目录,依次执行以下命令:
# 创建虚拟环境
python -m venv .venv# 激活虚拟环境# Windows:
.venv\Scripts\activate
# macOS/Linux:
source .venv/bin/activate
# 安装依赖包
pip install -r requirements.txt
2. 启动服务
双击运行根目录下的 启动会议纪要助手网页端.bat 文件。
- 会议纪要助手 将运行在端口
9000 - 转录矫正工具 将运行在端口
9001
🛠️ 功能模块详解
本项目包含两个独立的 Web 服务工具,分别满足不同的会议处理需求。
一、会议纪要助手 (Web 服务 - 端口 9000)
基于 WhisperX (large-v3) 与 FastAPI 构建,支持 GPU 加速,提供从录音到结构化纪要的一站式解决方案。
✨ 核心功能
- 高精度语音转文字
- 支持格式:
mp3,wav,m4a,mp4等主流音频/视频格式。 - 自动识别并转换为文本,利用 WhisperX 实现时间戳对齐。
- 支持格式:
- 说话人分离 (Diarization)
- 自动区分不同发言者,并在转录结果中标注(如:发言人A、发言人B)。
- AI 智能纪要生成
- 调用本地大语言模型(LLM),根据转录内容自动生成结构化纪要。
- 内置多种模板:
- 📋 标准纪要:涵盖会议主题、核心讨论、决策项、待办事项 (Action Items)。
- 👥 人员阶段性总结:按发言人归纳观点与贡献。
- 🧠 智能模式:自动分析会议风格,动态选择最佳纪要格式。
- 📌 小议题与讨论:适用于多议题穿插的复杂会议。
- 🎓 讲座纪要:专为培训、讲座类单向输出内容优化。
- 在线编辑与导出
- 支持对生成的纪要进行二次编辑、修正。
- 一键导出为
.txt或.md文件。
- 多文件并行管理
- 支持上传和处理多个录音文件,队列式任务管理。
- 自定义关键词字典
- 导入行业术语或专有名词字典,显著提升特定词汇的识别准确率。
💻 技术栈
- 核心引擎:WhisperX, PyTorch, CUDA
- 后端框架:FastAPI, Uvicorn
- 自然语言处理:NLTK, Transformers (Ollama/Qwen)
二、转录矫正工具 (Web 服务 - 端口 9001)
专注于人工校对环节,提供音视频同步播放与文本即时修正功能。
✨ 核心功能
- 转录结果加载
- 自动扫描并加载指定目录下的已有转录文件。
- 音视频同步播放
- 点击即跳:点击文本段落,音频自动跳转至对应时间点播放,便于核对。
- 在线实时矫正
- 直接在网页界面修改识别错误的文本,所见即所得。
- 结果导出
- 将矫正后的高精度文本保存导出。
💻 技术栈
- 后端:FastAPI, Uvicorn
- 前端:原生 HTML5/JS (轻量级,无额外框架依赖)
📂 项目目录结构
项目根目录/
├── 会议纪要助手/
│ ├── 源码/ # Python 源代码,需自行配置环境运行
│ └── 成品/ # 已打包为 .exe,Windows 下双击即用
├── 转录矫正工具/
│ ├── 源码/ # Python 源代码,需自行配置环境运行
│ └── 成品/ # 已打包为 .exe,Windows 下双击即用
├── 启动会议纪要助手网页端.bat # 一键启动脚本
├── requirements.txt # Python 依赖列表
├── 安装说明.txt
└── 功能介绍.txt
💻 运行环境要求
✅ 成品版 (.exe) - 推荐普通用户使用
- 操作系统:Windows 10 / 11 (64位)
- 内存:8GB 及以上(建议 16GB,因需加载大型 AI 模型)
- 显卡:NVIDIA 显卡,显存 6GB+ (支持 CUDA 加速)
- 注:若无独显,可使用 CPU 运行,但转录速度会显著降低。
🛠️ 源码版 - 推荐开发者使用
- Python 版本:3.11 或更高
- 依赖管理:通过
pip install -r requirements.txt安装 - 加速支持:建议安装 CUDA Toolkit 以启用 NVIDIA 显卡加速
💡 常见问题提示
- 关于模型权限:本方案采用全本地化部署,无需申请 HuggingFace 特殊权限,避免网络连通性问题。
- 关于显存不足:若遇到 OOM (Out Of Memory) 错误,请尝试关闭其他占用显存的程序,或使用 CPU 模式运行(修改配置文件中的 device 参数)。
- 关于 Qwen 模型:确保 Ollama 服务已正确安装并拉取了指定的 Qwen 模型(如
ollama pull qwen2.5:7b),否则纪要生成功能无法调用。


