相信很多人已经用过豆包、千问的语音转文本功能了,但是某些人可能因为公司规定等无法使用在线服务解决这类问题。
Owl Meeting 是一款识别、存储等各项功能均运行在本地的语音转文本应用。
主要功能
- 支持普通话,中文方言,英语,日语、韩语以及25种欧洲语言。
- 边录边识别,支持同时录制麦克风和系统声音。
- 识别各类音视频文件。内置工具可处理声道、音频提取等问题。
- 无需GPU,CPU模式下,处理30min音频仅需1min(i5-11400H)
- 说话人分离,支持为同段音频中的每个人指定不同模型进行识别,以提高准确率。
- 强大的文本编辑功能。
- 自定义词典。根据词典内容自动对识别文本进行处理。
- 支持批量删除、替换,并可同步更新词典。
- 点击识别的文本自动播放对应音频,边听边改。
- 内置ollama接口,只需几步,即可调用ollama进行文本纠错、翻译、提取摘要等任务。
- 支持全局搜索。可以用它来管理音频文件。
- 拥有丰富的设置参数,满足各种场景需求。
功能演示
1、我有一段长音频,但是不知道选择哪个模型、使用哪个分段参数进行处理能达到我想要的效果
软件提供测试功能,点击测试按钮会随机截取大约三分钟的音频按设置参数进行处理。如果对识别结果或分段不满意,可以调整参数后再进行识别。

2、我的音频或视频格式无法直接处理
内置了多声道转单声道和视频提取音频等功能。

3、有一个领导口音很重,识别速度快的模型识别不准。
如果启用了说话人分离功能,可以为同段音频中的每个人指定不同的模型进行识别。既要速度又要准确率。

4、我们领导只会说粤语,但是我粤语不好,识别结果不是普通话,我看不懂。
以下是使用ollama安装腾讯开源的HY-MT1.5-1.8B模型,对粤语进行纠正的结果。
模型2对于北方各地方言有很好的识别效果,不需要使用ollama进行转换。对于广普、川普等带口音的普通话,也不需要进行二次转换,只需要在词典中添加部分词语即可。以下功能只针对纯方言。

5、我识别的音频片段很多,怎么快速找到我想找的音频?
提供多种筛选方式,可按识别时间、类型、时长、说话人 对历史记录进行筛选。
提供全局搜索,只需要记得只言片语就能找到想要的音频。


6、我电脑配置比较好,我想充分利用本地大模型的能力解决我的问题
内置了ollama接口,提供一键连接ollama、模型管理功能。
内置多种模板,并支持自定义提示词完成各项任务。
对于qwen3:0.6b 或 deepseek-r1:1.5b 这类小模型,是无法完成会议摘要这类具有很长上下文的任务的。小模型仅限对单条文本进行简单处理,比如:翻译、纠错等。


7、我电脑配置很低能用吗?
我用十年前的笔记本神舟K650D做过测试,30min的音频转录完成只需要两分四十五秒(使用模型1,基于时间间隔进行分段)。
下载地址
windows 版本已测试完成上架微软商店,并进行了几轮更新。
Mac 版本还要做一些适配才能发布。
问题反馈
软件右上角有问题反馈按钮,使用过程中有任何问题可联系。
