说话也有恐怖谷效应吗?聊聊那些“像人但又不是人”的语音瞬间

字号

最近刷知乎,看到一个挺有意思的问题:说话也有恐怖谷效应吗? 这个提问在站内拿下了114万热度,链接我放这儿:https://www.zhihu.com/question/449596775。底下回答五花八门,有人讲AI客服,有人讲配音演员,还有人聊起了自己遇到过的“语调怪人”。今天咱们就顺着这个话题,把“恐怖谷”从视觉领域拽到听觉领域,好好掰扯掰扯。

先简单回顾:什么是恐怖谷效应

恐怖谷理论最早是森政弘提的,说的是当非人物体(比如机器人、人偶)在外形上越来越像人,但还没完全像人的时候,人类会对它产生强烈的反感、恐惧甚至恶心。可一旦它跨过那个“几乎完全像人”的临界点,好感度又会回升。

关键点在于:“像”和“是”之间那条缝隙,才是最瘆人的地方。

那问题来了——视觉有恐怖谷,听觉有没有?

说话这件事,确实存在“恐怖谷”

我的观点很明确:有,而且比视觉恐怖谷更隐蔽、更日常。

你想想,我们判断一个人说话“怪不怪”,其实不光是听内容,还在听语调、节奏、呼吸、停顿、情绪颗粒度。当这些元素组合起来“像人,但又不完全像人”的时候,大脑就会拉响警报。

举几个你大概率遇到过的场景:

这些例子的共同点就是:它们都踩在了“像人”和“不是人”的中间地带。

为什么说话也会触发恐怖谷?

我查了一些认知科学和语音感知的资料,大概能归纳出三个原因:

第一,语音是带有生物信号的。 真人说话时,呼吸、心跳、肌肉微颤都会混进声音里。AI或者过度处理过的语音,把这些“生物噪音”抹掉了,听起来就“太干净了”,干净到不像活物。

第二,韵律期待被打破。 人类对话有来有回,有抢话、有沉默、有“嗯”“啊”这种填充词。当一段语音的韵律完美到没有一丝犹豫,大脑就会觉得不对劲——太流畅反而假。

第三,情绪和语义的错位。 比如用欢快的语调说“您的账户已被冻结”,或者用平静的语气说“我好难过”。这种错位在真人身上很少见,但在合成语音里很常见,听多了就会产生类似恐怖谷的不适感。

一个容易被忽略的增量信息

很多人以为恐怖谷只跟“像不像人”有关,但其实说话恐怖谷还跟“意图感知”挂钩。

简单说:当你听到一个声音,大脑会下意识判断“它想对我做什么”。如果这个声音听起来像人,但又让你觉得“它没有真实意图”,你就会产生警惕。这跟看一个仿真机器人时的感觉是一样的——你知道它没有灵魂,但它又装得有灵魂。

所以,AI语音越进化,这个问题反而越突出。因为早期的机械音你一听就知道是机器,反而不恐怖。现在的一些大模型语音,已经能模仿叹气、笑声、甚至哽咽,但偶尔又会冒出一点“非人感”,那个瞬间才是最让人后背发凉的。

怎么应对这种“说话恐怖谷”?

说实话,完全避免很难,但可以留意几点:

最后说两句

说话也有恐怖谷效应吗? 我的答案是:有,而且它正在从科幻概念变成日常体验。114万人关注这个问题,说明大家已经隐约感觉到了那种“像人又不是人”的语音不适感。

下次你再听到一段让你莫名不舒服的语音,别急着怪自己挑剔——可能是你的大脑,正在帮你识别那个“恐怖谷”。

标签 知乎热榜 说话恐怖谷 AI语音 恐怖谷效应 语音感知 AI配音 人机交互
手机扫码阅读

微信或手机浏览器扫一扫,随时随地随心阅读与分享

收藏 0