一项新研究揭示了AI动物语言翻译的盲区

用幼儿发声检验AI的“翻译”能力

近年来,利用人工智能破译蝙蝠、鲸鱼、鸟类等动物交流的尝试层出不穷,相关研究常常伴随着“AI正在解码动物语言”的乐观叙事。

然而,特拉维夫大学团队发表在《Current Biology》上的一项新研究,给这类宣称泼了一盆冷水。研究指出,AI可以识别动物声音中的模式,但这与理解这些声音的含义之间,存在一道尚未跨越的鸿沟。

研究的核心设计颇为巧妙:团队没有直接使用动物叫声,而是记录了尚未学会说话的幼儿在三种日常情境下的发声——表达不适、呼唤父母、索要食物。

选择幼儿发声的原因在于,与大多数动物叫声不同,幼儿的交流场景可以被研究者独立观察和验证,从而为“声音是否传达了正确含义”提供了一个可靠的判断基准。

模型能听出“像不像”,但听不出“什么意思”

在实验中,研究人员将传统的声学分析方法与在动物声音和成人语音上训练过的神经网络进行了对比。结果显示,这些系统能够识别声音在产生方式上的相似性——比如音高、节奏、频谱特征——但这与追踪声音的交流功能是两回事。

具体来说,模型有时会把含义完全不同的叫声归为一类,仅仅因为它们听起来相似;反过来,一些服务于相同目的的叫声,却因为声学特征有差异而被模型分到了不同组别。这意味着,AI识别出的“模式”,与声音在实际交流中承担的“意义”,并不总是一一对应。

论文作者之一、特拉维夫大学神经科学学院教授Yossi Yovel此前在接受采访时曾指出,动物“并不像人类那样说话”,真正的对话——以人类语言的意义而言——超出了它们的能力范围,尽管它们的交流中确实隐藏着大量信息。

这项新研究进一步表明,仅仅依靠AI分析声音的物理特征,并不足以提取这些信息中的意义。

声学聚类不等于翻译

这项研究的意义,在于它直接挑战了动物交流AI研究中一个被广泛默认的假设:将声音按声学相似性分组,就等于理解了它们的含义。

论文在学术层面的表述是,理解动物交流需要识别信号如何映射到接收者感知空间中的意义,而目前大多数研究依赖于按物理相似性对信号进行聚类。研究结果清晰地显示,声学相似性并不必然与接收者的感知空间相关联。

对于正在快速扩张的动物语言AI领域而言,这一发现指向一个更严格的证据标准。研究者提出,声学分析需要与行为观察、回放实验以及对特定物种感知能力的研究结合起来,一个系统的输出才能被用来支撑关于“意义”的宣称。换言之,AI可以成为发现声音模式的强大工具,但发现模式不等于完成翻译。

这一区分在当下尤为关键。随着AI工具被越来越多地用于分析鸟类、鲸鱼、蝙蝠等动物的大量发声录音,如何界定AI分析结果的解释边界,正在成为该领域无法回避的方法论问题。

研究背景与学术脉络

这项研究于2026年9月23日发表在《Current Biology》上,由特拉维夫大学团队主导,合作者包括来自德国的研究人员。研究关注的并非机器能否在声音中找到模式——答案显然是肯定的——而是“按声学属性分组是否足以还原听者所理解的含义”这一更根本的问题。

值得注意的是,特拉维夫大学在动物交流研究领域有着长期的学术投入。该校与Jeremy Coller基金会共同设立的Coller Dolittle奖,每年提供10万美元奖金,用于支持面向双向跨物种交流的算法研究。

2026年的奖项授予了Julie Elie博士,表彰其将十余年的行为观察与机器学习相结合,证明斑胸草雀能够按含义而非单纯的声音特征对叫声进行分类。

Yovel本人也参与了该奖项的相关工作。这些研究共同构成了一个正在成形的学术共识:动物交流的解读,不能脱离行为语境和物种特异的感知方式。

(素材来自:特拉维夫大学 智算芯能前沿网综合)

本文由智算芯能前沿网编辑整理,转载请注明出处。