利益相关声明:作者与文中产品有直接的利益相关(开发者、自家产品等)

相信很多人已经用过豆包、千问的语音转文本功能了,但是某些人可能因为公司规定等无法使用在线服务解决这类问题。

Owl Meeting 是一款识别、存储等各项功能均运行在本地的语音转文本应用。

主要功能

  1. 支持普通话,中文方言,英语,日语、韩语以及25种欧洲语言。
  2. 边录边识别,支持同时录制麦克风和系统声音。
  3. 识别各类音视频文件。内置工具可处理声道、音频提取等问题。
  4. 无需GPU,CPU模式下,处理30min音频仅需1min(i5-11400H)
  5. 说话人分离,支持为同段音频中的每个人指定不同模型进行识别,以提高准确率。
  6. 强大的文本编辑功能。
    1. 自定义词典。根据词典内容自动对识别文本进行处理。
    2. 支持批量删除、替换,并可同步更新词典。
    3. 点击识别的文本自动播放对应音频,边听边改。
  7. 内置ollama接口,只需几步,即可调用ollama进行文本纠错、翻译、提取摘要等任务。
  8. 支持全局搜索。可以用它来管理音频文件。
  9. 拥有丰富的设置参数,满足各种场景需求。

功能演示

1、我有一段长音频,但是不知道选择哪个模型、使用哪个分段参数进行处理能达到我想要的效果

软件提供测试功能,点击测试按钮会随机截取大约三分钟的音频按设置参数进行处理。如果对识别结果或分段不满意,可以调整参数后再进行识别。

内置测试功能

2、我的音频或视频格式无法直接处理

内置了多声道转单声道和视频提取音频等功能。

音视频工具页面

3、有一个领导口音很重,识别速度快的模型识别不准。

如果启用了说话人分离功能,可以为同段音频中的每个人指定不同的模型进行识别。既要速度又要准确率。

说话人管理界面指定识别模型

4、我们领导只会说粤语,但是我粤语不好,识别结果不是普通话,我看不懂。

以下是使用ollama安装腾讯开源的HY-MT1.5-1.8B模型,对粤语进行纠正的结果。

模型2对于北方各地方言有很好的识别效果,不需要使用ollama进行转换。对于广普、川普等带口音的普通话,也不需要进行二次转换,只需要在词典中添加部分词语即可。以下功能只针对纯方言。

5、我识别的音频片段很多,怎么快速找到我想找的音频?

提供多种筛选方式,可按识别时间、类型、时长、说话人 对历史记录进行筛选。

提供全局搜索,只需要记得只言片语就能找到想要的音频。

历史页面筛选功能
全局搜索功能

6、我电脑配置比较好,我想充分利用本地大模型的能力解决我的问题

内置了ollama接口,提供一键连接ollama、模型管理功能。

内置多种模板,并支持自定义提示词完成各项任务。

对于qwen3:0.6b 或 deepseek-r1:1.5b 这类小模型,是无法完成会议摘要这类具有很长上下文的任务的。小模型仅限对单条文本进行简单处理,比如:翻译、纠错等。

ollama配置和模型管理页面
新建模板界面,可以使用内置模板或自定义prompt

7、我电脑配置很低能用吗?

我用十年前的笔记本神舟K650D做过测试,30min的音频转录完成只需要两分四十五秒(使用模型1,基于时间间隔进行分段)。

下载地址

windows 版本已测试完成上架微软商店,并进行了几轮更新。

Mac 版本还要做一些适配才能发布。

 

问题反馈

软件右上角有问题反馈按钮,使用过程中有任何问题可联系。