利益相关声明:作者与文中产品有直接的利益相关(开发者、自家产品等)

做这个App的起因很简单,我不喜欢看书,但特别喜欢在得到、喜马拉雅、小宇宙这些音频平台听各种各样的节目,通勤的时候听,打游戏的时候听,锻炼的时候听,入睡的时候也听。

但渐渐地,我感觉能听的节目越来越少了,很多喜欢的节目都停更了。

不过最近几个月,我发现ai生成的内容,其实质量也可以非常高,比如我之前做过一个“每天听本书”Skill,用它写出来的文稿,质量和得到上那些老师解读的听书节目差不了多少,此外我还经常让ai去给我做一些ai日报、或者ai播客类节目。

但很快我就发现了一个很大痛点,就是ai生成的都是长篇文字,我没办法很方便的收听这些内容,即便有朗读按钮,也往往只能临时朗读一次,很不方便,我期望的是一个像喜马拉雅、得到这样的音频节目App,但里面的音频内容,都是我自己粘贴进来,自己文本转语音生成的。

于是,从这个思路出发,我做了“自听”这个App。

核心功能非常简单,就是把你在其他ai上面,生成的文字,直接粘贴进来,就能给你制作成一期音频节目。

本地文本转语音的模型我测试了很多个,要能同时满足可在手机上运行、说话声音要自然,没有机器味、生成速度还不能太慢,这几项还挺难的,花了不少时间测试和优化。

目前我感觉说话声音的质感和很多云服务厂商提供的语音差不多了,挺自然的。生成 1 分半钟的音频大约需要 1 分钟(iPhone16上测试的),也就是完全能做到一边生成一边听,还有不少的冗余。

生成完成后,也可以一键导出,保存到电脑上,或者发给朋友啥的。

————

不过也还是有一些问题没有解决,因为毕竟是手机上的本地模型,参数都不会特别大,如果粘贴的文字里面夹杂了一些符号或者过多的英文,生成的速度就会慢很多,个别地方的语音也会不太自然。我也还在努力优化中。

以前都是在别人的平台,去收听别人制作的节目,我希望“自听”能够做到自己收听自己生产的节目,真正做到想听啥,就听啥!