AI声明:本文结构设计和核心内容均为人工手写,绝大多数内容依赖专业认知心理学教材和专著。部分专业细节(如剪辑爆声原理)借用了AI查证并绘制了示意图。
今年年初,我和相识多年的书友一起做了一档播客,正式加入播客大军。
内容准备和录制并不算难,真正让我们这些小白头疼的是后期剪辑。为什么剪辑时会时常出现爆音?为什么有些地方剪辑后意思接得上,听起来却觉得别扭?为什么有些地方稍微动一下就会不自然?这些困惑让我在阅读认知心理学书籍时,格外关注听觉、语音、言语知觉等主题。我发现,很多播客剪辑遇到的问题,其实都能在大脑的知觉机制中找到解释。
当然,想把音频剪好,实践始终是第一位的。这篇文章不是一份剪辑攻略,和之前关于专注、阅读、成瘾等文章一样,我尝试从认知心理学和神经科学的角度,聊一聊「我们如何听懂别人说话」这件再日常不过的事情。介绍原理的过程中,我还会把这些知识放回剪辑场景里,帮大家理解人耳和大脑是怎样处理语音的。下次当我们再剪辑的时候,更清楚自己究竟在剪什么、如何剪才能避免常见的误区。
Part 1 关于人声的基本知识
大家都知道,你我之所以能听到别人说的话,是因为有声音传导到耳朵里。
然而,物理层面的「听见」只是「听懂」的第一步。实际上,传入我们耳中只是一些连续、多变的声学信号,这和我们的直观感受有很大的区别。
1.说话声音是连续的
我们先来把声音和文字做一个简单对比。
阅读时,书面文字的边界是相对清晰的。英文单词之间有明确的空格,中文虽然没有词间空格,但作为母语者,我们很容易对句子进行分词处理。比如,当你看到「我今天想吃汉堡包」这句话时,会自动处理成:
我|今天|想|吃|汉堡包
如果分词出了错,就会出现理解偏差,或是闹出笑话。比如,南京市长江大桥这个经典段子,就是把南京市(的)长江大桥,错误切分成了:
南京|市长|江大桥
比起书面文字,语音的切分就要复杂且模糊一些了。
直觉上,我们会觉得别人说话是一个一个词蹦出来的。然而研究发现,日常说话中,人们很少会对每个词进行清晰的发音切分。专业的声谱图显示,声学信号通常是连续的。词与词之间,很难明确划分出一道清晰、稳定的物理边界。
以英文「What are you doing」为例。如果是写出来,分隔一目了然:
What are you doing?
然而,如果不是刻意一字一顿发音,母语者在生活中说这句话时,听起来更像是:
Whad'ayadoin?
声音中间是没有空隙的。下图就是一字一顿发音(图a)和日常发音(图b)的声谱图,它们之间的差异清晰可见:日常说出「Whad'ayadoin」时,不但词语和词语之间的停顿很少,相邻语音还会发生连读、弱化甚至省略的情况:What和are连成whad'a,you简化成ya,诸如此类。

在剪辑播客时,我们也会观察到类似的现象:除了有意的停顿、句末等较长的气口外,大多数音频的声波图是相对连续的。哪怕是声音波谷的地方,很多也是发音的必要组成部分,不是真正的停顿。如果在这些地方贸然剪断的话,就有可能会出现不自然的爆点,或是明显的节奏变化。
2.相邻的声音彼此渗透
如果说声音的连续性造成了剪辑的困难,更麻烦的是:每一处发声甚至不是彼此独立、边界清晰的。
我们在说话时,像舌头、牙齿、嘴唇等发音器官是不断运动的。因此,前后相邻的发音动作往往会发生重叠,一个音还没有完全结束,发音器官已经开始为下一个音做准备了。这种现象有一个专业词汇,叫协同发音(coarticulation)。
如果这样说不好理解,我们不妨用一个相反的例子说明。
假如说完全不使用协同发音的话,我们发出的每个音都应该个个分明、有清晰的语音边界。比如,当我说“我想吃汉堡包”时,应该先发第一个音(wo),嘴巴恢复原位,然后发第二个音(xiang),再恢复原位,接着发第三个音(chi)……生理意义上,你完全可以这么说话,但这么做既不自然,效率又低,现实中很少有人这么发音。
真实场景下,为了快速流畅地说话,大脑会提前组织接下来的动作。在发前一个音的时候,发音器官往往已经开始为后一个音做准备;同样,前一个音的发音动作,也可能延续到后一个音中。

这样做会导致一个结果。在说同一个辅音时,当它后面接的是不同的元音,我们实际上会以不太相同的方式发最初这个音。你可以试着发一下 /ba/ 和 /bu/ 这两个音,关注一下自己的口型。虽然这两个音都以辅音 /b/ 开头,但你起始的口型是不太一样的。尤其当你发 /bu/ 这个音时,嘴唇在 /b/ 这个音还没有结束时,就已经开始变圆了。这就是协同发音导致的。
3.声音是千差万别的
协同发音还带来另一个结果:同一个音,同一的人在不同场合说,未必会产生完全相同的声学信号。事实上,前后的音不同、在句中的位置不同、语速不同,它在声谱图上的样子都有可能发生变化。
剪辑软件里的波形图信息相对简略,但如果你有意识地对比同一个词语在不同地方的发音,就会发现它们的波形也有可能存在很大的差异。

此外,发音的个体差异也非常明显。有些人声音高亢,有些人低声浑厚;人们口音不同、发音习惯各不相同。调查表明,英语定冠词「the」在生活中有50种不同的发音方式(Waldrop, 1988),这说明作为一种听觉信号的人声,本质上是千差万别的,根本没有一个统一的「声音指纹」或「听觉模板」,我们更没法直接从波形图上一眼辨别出来。
小结
结合以上几点,可以得出结论:虽然大家习惯把一句话看作一个个独立的音节或词语,但这种划分更多是语言分析和知觉加工的结果。在物理参数上,声波是相对连续的。词与词、甚至句子与句子之间,往往不存在一个特别明确的分界线。
这也是为什么在音频软件的波形图里找一个词「真正开始」或「真正结束」的位置,没有想象中那么简单。如果不借助AI或自动化工具,我们通常要凭借听觉找出合适的位置,剪完还要靠听觉去检验,这样才能比较好地把握住剪辑点。
Part 2 大脑如何从声音中听出意思
如果说人声在物理层面是连续、彼此渗透且复杂多变的,为什么在日常生活中,我们很少会产生困惑,绝大多数场景下都能轻松听懂别人说的话呢?
这就要归功于我们的大脑了。实际上,为了把声音转化成清晰准确、含义明确的词语和句子,大脑做了大量的工作。它会综合各种有效信息,对声学信号进行主动的加工和预测。经过了这一步,我们才能从物理层面的「听见」变成语义层面的「听懂」。
1. 声波如何转化为特定的音节
我们都知道,大自然中的蓝色有成千上万种。晴天的蓝、海水的蓝、拖鞋的蓝各有差异,但这不影响我们会把它们共同归到「蓝色」这个颜色类别下。
同样的道理,虽然声音在物理层面是连续多变的,但我们的听觉并不会对每一个细微变化都建立一个新的类别,而是会把它们归入一些相对稳定的类别。这就是认知心理学中核心概念,叫类别知觉(categorical perception)。
语音学者发现,/b/ 和 /p/ 这两个音在发音上有一个核心差别,叫 VOT(voice onset time,声带振动起始时间)。这个概念不用深究,简单来说,就是辅音发出来,到你的声带真正开始振动之间,会有一个时间间隔。如果这个间隔特别短,比如只有 10 ms,我们就倾向于把这个音听成 /b/;如果间隔较长,比如达到 80 ms,则更倾向于听成 /p/。

有一个经典实验,验证了我们的大脑是如何处理语音的。一种假设是,由于VOT是连续的,我们对于语音的感知可能也是连续的:有的声音像 /b/ ,有的声音像 /p/ ,有的声音介于 /b/ 和 /p/ 之间。为此,研究者利用电脑制作出了一系列人工声音,让这些声音的VOT从极短的时间一点点变得越来越长。
从物理层面看,这些声音是连续变化的,从图上我们可以看到:从-100ms一直到150ms,研究者制作了大量的声音。但被试听到的,不是说这个音像 /b/ ,下一个比前一个更接近 /p/,再下一个又更像 /p/ 一些。真实情况是:随着VOT的不断增加,我们逐渐从稳定的/b/、/b/、/b/,突然有一刹那就过渡到了 /p/、/p/、/p/。(Lisker & Abramson, 1970)
这说明,虽说存在一些个体差异(图中红线和蓝线交叉的附近位置,有人会听成 /b/ 而有人会听成 /p/),但整体规律是一致的:尽管声音的物理刺激是连续的,但我们的知觉会把它们加工成离散的、稳定的声音类别。在一定区间内,大家都会觉得听到的是 /b/ ,这时候VOT轻微变化,我们就直接把它听成了 /p/ ,这个中间几乎没有中间态。这就很像光谱,虽然它是连续变化的,但我们的视觉会把它们归入到不同颜色类别中一样。

类别知觉是理解语音知觉的一个重要现象。
剪辑过程中,它也有实际的用途。有时候我们会发现,在波形上剪掉了挺长一段,但听起来还是原来的音;有时候只是改变了很短的一段,却有可能一下子变成了另一个音。现在我们明白了,问题不在声音本身改动了多少,而在于我们的大脑在剪辑前后,把这个声音归入了不同的类别。这也解释了为什么剪辑时「看起来改动不大」和「听起来改动不大」不能完全等同。所以,剪辑音频时最好不要切得太精细,保留一些发音冗余是更保险的做法。
2.连续的声音如何划分为词语
类别知觉解释了我们如何把变化丰富的声音听成相对稳定的语音类别。但问题还没有结束。前面说过,即使我们听出了一个个音,但这些声音仍是连续出现的。接下来,我们又是怎么知道一个词在哪里结束,下一个词又从哪里开始呢?
想象一下,你正在听一门完全陌生的语言。很大概率,这个语言就像是一长串连在一起、此起彼伏的声音,你很难判断哪里是一个个词的分界。但当你熟悉这门语言之后,尤其是在听自己的母语时,词的边界仿佛就自己出现了。这个过程叫语音分割(speech segmentation)。
实际上,词与词的边界不是凭空出现的,大脑利用了很多有效线索。
首先,我们会根据掌握的语言知识、生活常识和上下文,对词语进行切分。作为母语者,我们知道哪些音节组合常见,哪些音节代表哪个高频词,哪些词容易跟哪些词连在一起。
上下文也很重要,想象一下,当一个人跟你说:
pīng pāng qiú pāi mài wán le
如果你在一家体育用品店,你大概率会把这句话理解成「乒乓球拍|卖完了」。但如果你正在和朋友聊前两天的一场体育品拍卖,你也有可能把它理解成「乒乓球|拍卖|完了」。声音本身并没有告诉你词与词的边界在哪里,是语境帮你完成了切分。实际上,预测是大脑核心的功能之一,它会根据已有的经验,帮你合理推测哪里更有可能是一个词的开始和结束。
其二,仅凭声音出现的统计规律,大脑也能下意识地进行分词,这个机制叫作统计学习。
哪怕是一门完全陌生的语言,只要多听几次,大脑就更有可能把高频连续出现的音节当作一个整体(词)。把一些出现概率较低的音节组合,理解成这里可能存在一个词语边界。
事实上,关于这个结论有一项非常经典的婴儿实验。研究者给 8 个月的婴儿听一种人工设计、毫无意义的语言。这种语言里只包含 tupiro、golabu、bidaku、padoti四个「三音节词」。实验人员把这组词随机首尾相连,合并成为一段没有停顿、没有重音提示的连续语流,比如tupiropadotigolabugolabubidaku……让婴儿反复听。

研究发现,婴儿只听了大约 2 分钟,就能一定程度上区分这些词和跨越词边界的音节组合。听起来非常神奇,实际上这几个音节组合有一定的规律可循,比如 tu 后面总是接 pi,pi 后面总是接 ro,而词与词的交界处,比如 ro 后面可能接 go,也可能接bi、pa、tu等其他音节,连接概率就会明显降低。虽然我们在学语言时,很少刻意归纳这个规律,但哪怕是8个月的小婴儿,也具有一定的统计学习本能,仅凭音节的统计规律,就能从连续语音中提取出潜在的词语边界。(Saffran, Aslin, & Newport, 1996)
3.缺失的信息大脑自动补足
大脑的预测功能不仅体现在分词上,有时候声音不清晰,或是出现一些缺失,我们仍会觉得自己听到了完整的语音。
这个大家都有体会。生活中我们听别人说话,不需要听完整每一个音才能理解。比如,早上妈妈和你说:「今天下雨,出门记得带……」,即使最后一个词你没听清,也能轻松推断出妈妈想让你带的是「伞」,而不是别的东西。
认知心理学上有不少实验证实了这个现象。
研究者先录制了一句完整的英语句子,然后把其中某个音节删掉,再用同样时长的咳嗽声占据这个位置。结果,很多听者不仅没有察觉到这个音的消失,还会主观上觉得自己听到了完整的单词。研究者让他们指出咳嗽声出现在句子的什么位置,他们也很难正确指出(Warren, 1970)。
更有意思的是,大脑还可以根据后面出现的词,反过来推断前面缺失的音节是什么。另一个经典实验中,研究者给听者播放了一个句子:
The *eel was on the ( ).
其中 * 位置的辅音被噪声遮住了,完全听不到。当前半句出现时,*eel 本身是有歧义的。但括号里如果读的是 shoe,听者会倾向于听成 heel;如果是 orange,就会听成 peel;如果是 table,更容易听成 meal。也就是说,大脑可以利用后面补充的语境反过来补足知觉信息。(Warren & Sherman, 1974)
关于这一点,学过德语或日语的朋友一定会想起深恶痛绝的句尾动词或否定词。作为外语学习者,我们会觉得动词这样的关键信息迟迟不出现,很影响对句子含义的理解。然而在母语者看来,他们早就习惯了这样的表达方式,很少觉得困扰,甚至还会利用语调、语气、前后语境提前进行判断。
4.整合多重感官信息
我们理解语言时利用的不止是知识、经验和上下文。「听别人说话」看似是个听觉任务,实际上,视觉和其他感官也会参与其中。
日常生活中,当我们和别人面对面交谈时,会不自觉地观察对方的嘴型、表情和动作。哪怕在嘈杂环境里,如果能看清说话人的脸,就能更容易理解对方的话。与之相反,如果对方戴了口罩,说话声音又很小,我们就不太能够判断对方到底在说些什么。
关于这一点,有一个经典效应,叫麦格克效应(McGurk effect)。
心理学家McGurk 和同事做过一个有意思的实验。他们给被试看一段人物说话的视频,音频实际放的是 /ba/,但画面中的嘴型和播放的声音不一致,嘴型显示的是 /ga/。结果,不少被试说,自己听到的既不是 /ba/,也不是 /ga/,而是一个新的声音 /da/。如果这时候被试闭上眼睛,只听声音,又能够正确听出 /ba/。(McGurk & MacDonald, 1976)

这个实验告诉我们,视觉信息会直接参与语音知觉,甚至会改变我们主观上究竟听到了什么。这一点给剪辑带来的启示是:剪视频的时候,声音自然还不够,嘴型和声音也要尽量保持一致。一个纯音频里尚可接受的剪辑点,但放到视频里,如果出现嘴型和声音明显错位,可能立刻就会暴露出来或让观众感到歧义。
小结
这个板块从不同侧面表明,大脑并不是一个被动读取声音的机器。面对连续、多变而且并不完美的语音信号,它会主动进行分类、切分、预测、补全和多感官整合。其中,利用语言知识、经验和上下文进行预测和补全,就是认知心理学中典型的自上而下加工(top-down processing)。
我们听到的内容,是声学信号和大脑加工共同作用的结果:耳朵提供一部分证据,大脑再结合语境、经验、知识和其他感官信息,推断出最有可能的内容。
事实上,有一些脑区中风或萎缩的病人,虽然听觉功能是正常的,但因为大脑不能有效处理声音信息,会出现「能听见音但无法理解意思」的脑部疾病,这更是从侧面说明了大脑加工对听觉理解的重要性。
Part 3 剪辑过程中常见的问题分析
关于言语听觉的知识,前面两个部分已经讲得差不多了。这一部分,我们用刚才讲到的知识,进一步理解播客剪辑中经常遇到的一些问题。
1.为什么剪辑点会出现「啪」的一声?
有剪辑经验的朋友会发现,剪辑位置如果处理不好,会出现「啪」「嗒」的爆音。专业概念中,这个声音叫点击声或爆音,英语叫click或pop,它和语音学里的爆破音/p/、/b/、/t/、/k/ 等是完全两码事。
剪辑产生的爆音,通常是由于剪辑点左右两边,出现了瞬间的不连续。这里用图示展现:
原本在接近0振幅的位置剪开,前后衔接比较平滑。
~~~~~0~~~~~
但如果第一段结束时振幅波形还位于中线以上,比如+0.6,下一段却突然从下方开始,比如-0.4,相当于让扬声器振膜在一瞬间发生了突然跃迁,人耳就会听到「啪」的一声。
~~~~ ↑ │ ↓~~~~
前面说到,真实语音在时间上是连续变化的。剪辑实际上是在人为地把一条连续的曲线切断,再把两个原本不相邻的位置拼到一起。如果拼接点两侧的波形差异过大,就会制造出原始声音中不存在的瞬时变化。
出现这种问题,应该如何剪辑呢?我平时用的是剪映,这类剪辑软件不像专业音频软件一样,能够精确找到「零交叉点」,也就是波形恰好穿过中线、瞬时振幅接近 0 的位置。但有几个实用的办法,尽量减少爆音的出现。
首先,尽量不要把剪辑点放在声音剧烈变化的位置。
剪辑前,我们可以把时间线放大,观察一下波形。相比于振幅很大的位置,优先选择波形比较细、比较接近中线的位置剪辑。尤其要避免直接切在一个辅音刚刚爆发、元音正在发声的位置。当然,前面说过,不是说看到波谷的位置就一定能剪。很多波谷本身也是发音的一部分。更好的做法是:先靠耳朵找到自然的气口或相对安静的位置,再利用波形做辅助判断。
第二,前后挪动几帧就能解决问题。
有时候,在某一点剪辑会出现爆音。但向前或向后挪一点,声音马上就自然了。这是因为,哪怕在间隔很短的地方,剪辑点两侧的瞬时振幅也可能会有很大差异。
剪辑时不存在唯一正确的剪辑点。遇到问题时,可以在附近来回移动几次,找到一个相对合适的位置,这是一个相对稳妥的解决方案。
第三,在剪辑点前后加一个短暂的淡入和淡出。
如果不想改动剪辑点,当音频拼接处出现轻微的「啪」声,也可以尝试在前一段末尾加入极短的淡出,在后一段开头加入极短的淡入。这样做的原理是,能给原本突然发生的波形变化增加一个过渡状态,说不定就能有效消除爆音。
请注意,淡入淡出时间不要很长。如果时间太长,会把字头、辅音或说话的节奏一起削弱,听起来也会让人觉得不自然。
最后,剪完以后一定要从剪辑点之前开始听。
有些剪辑点单听起来,没有明显的「啪」声,但前后连起来之后就会出现音量、音色或节奏上的突然变化,让人觉得不自然。
剪完之后,最好从剪辑点前半秒甚至一秒开始播放,让大脑听到完整的前后变化,这样才能更好地察觉到问题。
2.为什么文字能拼起来,声音却拼不起来?
播客剪辑里还有一种很常见的情况:两个片段单独听都没有问题,文字内容也完全接得上,但把它们拼在一起之后,就是会觉得哪里有点奇怪。比如,一个人原本说的是:
我其实觉得……这件事,还是挺有意思的。
如果原音频中的「这件事」说错了,我们从别处找一个「这件事」替换进去,或是补录一句。从文字上看完全正确,但听起来就能明显感觉到「这件事」是后贴上去的。
为什么会这样呢?
我们说话时,传递的不只有词义本身。声音中还包含音高、重音、语速、停顿、时长、气息等大量信息。这些变化共同构成了语言的韵律,也就是说一句话说出来的方式。
同样一句「真的吗」,可以表示惊讶、怀疑,也可以只是普通确认。文字是完全一样,但只要音高、重音和节奏不同,听起来就可能是完全不同的意思。
再比如,一个词位于句子结尾,那么说话人的音高有可能已经下降,语速也会自然放慢;如果它处于句子开头,声音可能更有气势,还带着继续说下去的感觉。这时把一个句尾的词硬生生地挪到句子中间,就很容易出现一种奇怪的听感:前半句话明明还没说完,声音却像已经准备收尾了。反之亦然。
除了韵律,前面提到的协同发音也会进一步强化这个问题。
一个词的发音不是孤立存在的。它前后接什么音,会影响嘴唇、舌头和下颌的运动方式,也会改变实际产生的声学信号。所以,即使是同一个词,在不同上下文里,也很难做到声学上完全一样。这也是为什么有些剪辑从字幕上看毫无问题,但耳朵一下就能听出不自然。
遇到这种情况,一个很实用的原则是:
如果一定要替换错误,不要只替换一个词,最好把前后一整句话连起来替换掉。
当你怎么调整都不自然时,说明问题不在剪辑点上,而在于这两个片段原本就不属于同一个韵律环境。这时候,与其继续把剪辑点修得越来越细,不如换一个更长的替换片段。这样保留下来的韵律和协同发音信息更多,一般来说也会自然得多。
另外一个原则是:
如果原始音频能用,哪怕有些小瑕疵,也尽量不要从别处移花接木或重新补录。
原始语句虽然有口误、停顿或杂音,但它的语速、音高、气息和前后发音通常是自然、连续的。相比之下,从别处挪来的同一个词,或者事后重新录制的一小段声音,即使文字完全一致,也很难复制当时的韵律、口型状态、距离麦克风的位置,以及说话时的情绪。
所以,剪辑也要避免完美主义。很多时候,留一点不影响理解的小瑕疵,反而比追求文字层面的绝对干净听起来更自然。
3.为什么口癖、停顿和呼吸不能全删?
我刚开始剪播客时,经常犯强迫症:会把「嗯」「啊」「然后」「就是」之类的口头禅全部删掉,再把过长的停顿和明显的呼吸声一起清理掉。
这样做似乎能让音频更紧凑、干净。但实际剪下来,经常会出现另一个问题:文字意思是很顺,但声音却时常让人感觉不自然,节奏也明显过于紧凑。
原因很简单。我们在真实交流中,不是在连续不断、毫无停顿地输出文字。我们会花时间思考,需要停下来组织语言,还会在重要内容前稍微放慢速度,会通过拉长、重音和停顿来突出重点,也会在一段较长的话之前自然吸气。这些信息都是口语表达很重要的一部分。
比如呼吸。一句比较长的话开始之前,人通常会自然吸气;一段话说完之后,也可能会有一个轻微的呼气。听者并不会有意识地分析这些声音,但它们会参与构成说话的节奏。如果把所有呼吸都剪掉,声音虽然会显得更「干净」,却可能产生一种奇怪的紧迫感:说话人仿佛完全不需要换气,一句话接着一句话不停往外冒。
此外,「嗯」「啊」这类口癖也不一定要全部删干净。有时候适当保留下来一些,不会让听者感觉奇怪,反倒是处处都剪,容易制造爆音不说,还会让人觉得语气和停顿不自然。关于这一点,用过AI一键清除口癖功能的朋友应该都有直观上的感觉。
所以,判断一个口癖、一个停顿,一些呼吸要不要删除,不能只看它们有没有明确的字面意义,还要看它在整段对话中承担了什么功能,剪掉之后会不会让表达更加自然。如果答案不确定,宁可少删一点。很多时候,保留少量真实说话留下的痕迹,比把声音修得过于干净,是一个既节约精力,又能提升效果的更优解。

以上就是我在剪辑和阅读认知心理学书籍过程中的一些收获。如前面所讲,我并非剪辑高手,这也不是一篇剪辑攻略。但我想,无论你是不是有剪辑经验,一定会从中对声音(尤其是人声)这件再熟悉不过的事情有新的感悟。
这篇文章仍是认知心理学系列的一篇,大家如果有什么感兴趣的话题也欢迎评论区留言。
