网易首页 > 网易号 > 正文 申请入驻

猫在说什么,AI知道吗?

0
分享至



每个宠物主人的梦想,可能都是知道自己的宠物在说什么。

猫在凌晨对着卧室门叫,是饿了、无聊,还是单纯希望所有人都醒着?狗听见门外的声音突然吠叫,究竟是在害怕、警告,还是认出了熟悉的脚步?人类和宠物共同生活了上万年,仍然经常只能依靠经验、表情和一点自信过头的直觉作答。

近几年,一些结合了 AI 的应用开始尝试替主人给出一个更明确的答案。

例如猫语翻译应用 MeowTalk 会录下猫叫,将其归入“开心”“生气”“疼痛”“捕猎”或“需要关注”等 11 类意图,再把结果改写成人类能够理解的句子。公司称,这款应用下载量已经超过 2,000 万,用户上传了超过 2.8 亿次猫叫,建立了 800 多万个猫档案。


图丨MeowTalk(来源:YouTube)

几秒钟的等待后,一声喵可能变成“陪陪我”。

这种体验很容易让人产生一种感觉:似乎横在两个物种之间的墙终于裂开了一条缝。可问题是,屏幕上的答案究竟是猫的心声,还是来自人类预先写好的选项?

MeowTalk 允许主人纠正翻译,再从列表中选择一个更符合当时情境的说法。模型由此逐渐熟悉某一只猫。可如果答案最初由主人提供,机器学到的也可能只是主人对猫的理解。人类相信猫在撒娇,于是把这声叫标成“想要关爱”;模型以后再听见相似声音,便更有把握地告诉人类:猫在撒娇,一个循环就这样形成了。

问题是,这到底算不算翻译?抛开宠物 App 的界面,AI 理解动物的声音,目前究竟做到了什么程度?

动物在跟谁说话

人类语言翻译拥有一个巨大的便利:同一句话通常能够在另一种语言中找到对应表达。模型可以阅读双语文本,学习“苹果”与“apple”之间的关系,再从数以亿计的例子中理解词语在不同句子里的位置。

但动物的声音没有这样的平行语料。一段鸟鸣或者一串蝙蝠的尖叫出现时,不会同时附带一行字幕。研究人员连一句可靠的译文都没有,更不用说用几百万组成对的句子训练模型。

于是,动物语言研究首先要完成一件看起来不太像语言研究的工作:记录谁发出了声音,当时面对谁,周围发生了什么,以及声音结束后,其他动物做了什么。

2016 年,特拉维夫大学的研究团队连续 75 天监控埃及果蝠,把录音与视频逐一对应。他们最终得到近 1.5 万段能够确认发声者、接收者和行为背景的叫声。对人耳来说,这些声音大多只是挤在一起的蝙蝠争吵;机器学习模型却能以 61% 的准确率判断争吵与食物、交配、睡觉位置还是栖息空间有关,随机猜测的准确率只有 25%。


图丨埃及果蝠的不同类型叫声。(来源:Scientific Reports)

辨认争吵发生在什么情境,只是第一步。研究人员还想知道,动物是否会用不同的声音指向特定同伴。

2024 年,研究人员分析了狨猴在看不见彼此时进行的 53,993 次呼叫。他们发现,模型可以根据声音判断一只狨猴在呼唤哪个同伴;同一家族的狨猴,对同一个体使用的声音标签也更相似。随后进行的回放实验显示,当狨猴听到原本就是对自己发出的呼叫时,回应概率高于听到面向其他同伴的呼叫。

野生非洲象的研究采用了相似的路径。研究者先整理 469 次能够确定发声者和接收者的低频隆隆声,让机器学习模型寻找与特定接收者相关的声学结构;再到野外播放录音。大象听见原本对自己发出的声音时,回应得更快,叫得也更多。

这些发现常被简单地说成动物也会“叫名字”。目前能够确认的是,某些叫声包含了接收者的个体信息。但研究者尚未指出大象名字位于叫声的哪个部分,也不知道狨猴是否像人类一样,把一个稳定的词与某个个体联系起来。声音标签还可能同时包含亲疏关系、紧张程度和说话者当时的状态。

这些研究真正建立起来的是一条验证链:先记录声音和行为,让 AI 发现人耳忽略的模式,再提出假设,最后把声音播放给动物,看它是否作出符合预期的反应。而 AI 位于这条链的中间,要判断它有没有听懂,仍要依据链条另一端的动物来验证。

鲸的字母表

如果放在海里,这条验证的链路会变得格外漫长。

抹香鲸大部分时间生活在人类难以观察的深水中。它们用一组组被称为“尾声点击”(coda)的声音进行交流,声音听起来像有人在水下有节奏地敲击木块。研究人员能够录下点击声,却很难同时看清是哪一头鲸在发声、它面对谁,以及几百米外正在发生什么。

Project CETI 为此把动物语言研究做成了一项海洋工程。水听器负责持续录音,吸附在鲸身上的传感器记录运动和潜水状态,无人机从空中观察鲸群关系,海上机器人寻找发声的个体。AI 需要的训练数据,最终来自这些设备与研究人员多年跟踪的结合。

2024 年,CETI 和麻省理工学院的研究人员分析了东加勒比抹香鲸群的 8719 组尾声点击。他们发现,鲸会组合使用节奏、速度、轻微的时序伸缩和额外点击。过去被归为同一类型的声音,内部可能还有大量稳定变化。论文把这套组合结构称为抹香鲸的“语音字母表”,可区分的声音形式比此前的估计多了近一个数量级。

“字母表”这个说法很容易让人误认为实现了语言上的破译,但它实际回答的是声音由哪些部分组成,以及这些部分怎样组合。研究者仍不知道其中大多数形式表达什么。

2025 年,CETI 又推出了鲸声模型 WhAM。研究团队先使用音乐训练声音模型,再用约 1 万段抹香鲸尾声点击进行调整。WhAM 可以补全被遮住的点击,也能把人声、音乐或其他声音转换成结构逼真的抹香鲸式点击。

这类能力在技术上很接近语言模型的“续写”:给模型一段序列,它预测接下来最可能出现的部分。WhAM 能够生成听起来像鲸的声音,也能保留鲸声中的节奏特征。它没有因此获得“食物”“幼崽”或“船”的概念。

声音形式与含义之间,缺少的仍是现实世界。同一组点击可能随着发声者、关系和情境发生变化。母鲸与幼鲸的对话、下潜前的协调、鲸群重逢时的交流,也许会使用相似的声学材料。研究人员必须把模型找到的结构重新放回鲸的生活中,观察它在什么情况下出现,又引发什么反应。

这也是动物语言基础模型面临的局限。Earth Species Project 训练的 NatureLM-audio 已经可以识别物种、叫声类型和生命阶段,也能在部分任务上处理训练时没有见过的动物。然而其官方使用说明仍明确写着:模型目前不能判断动物的情绪,也不能翻译动物在说什么。

与其翻译,不如先学会回话

理解含义还有另一条路径:先发出声音,再观察动物如何回答。

传统的动物叫声回放实验通常很短。研究人员播放一段预先录好的声音,记录动物接近、离开、回叫还是毫无反应。声音本身不会根据动物的回答发生变化,因而更像广播,很难模拟真正的交流。

2026 年,Earth Species Project 与麦吉尔大学等机构的研究人员公布了一项斑胸草雀实验。他们分析了超过 1,000 小时、150 万次雌性斑胸草雀叫声,训练了一个可以实时检测、预测并生成叫声的模型 ZF-AIM。当鸟发出声音时,模型会决定何时回答,并生成相应的鸟叫;鸟也会调整自己的回应时机和声音结构。部分互动呈现出真实鸟类交流中的轮流发声和声学适应。

这项研究尚未经过同行评议,也没有告诉人类斑胸草雀在谈什么。它证明了一件稍有不同的事:AI 可以掌握一段交流的节奏,让动物把机器发出的声音纳入自己的互动。

Google 与 Wild Dolphin Project 开发的 DolphinGemma,则试图把这种互动带进海里。这个约 4 亿参数的声音模型用数十年积累的大西洋斑点海豚录音训练,可以分析一段海豚声音,并预测接下来可能出现的声音。


图丨 DolphinGemma(来源:Google)

与模型配套的 CHAT 水下设备没有直接翻译天然海豚叫声。研究人员先为海草、围巾等海豚感兴趣的物体设计全新的合成哨声,希望海豚学会模仿某个哨声来索取相应物品。如果海豚发出表示“海草”的声音,设备识别后会提醒潜水员递出海草,从而强化声音与物体的联系。

某种程度上来说,这项研究可以称得上是双方共同创造了一套简易词汇。人类暂时不必猜测海豚原本的声音是什么意思,双方从一个可以验证的关系开始:发出某种声音,得到某件物品。

第一批可靠的跨物种对话,可能因此显得相当朴素。它不会让海豚讲述昨夜的梦,也不会让鲸评论经过的货轮。它可能只有几个请求、警告或回应,每一个信号都必须经过反复实验,确认动物确实理解并愿意使用。

这套小词汇的价值,反而来自它不那么像人类语言。

宠物翻译器出售的是确定感

科学研究可以花几年确认一个声音标签,但宠物主人们显然等不了那么久,例如笔者现在就想知道,我家的小猫为什么大清早就在门口叫个不停。

在这种迫切的需求下,近两年也的确出现了一批宠物 AI 公司,开始尝试各种方式来破解宠物的语言,比如用更多信息弥补单一叫声的不足。Traini 开发的模型同时分析狗的声音、面部、身体动作、活动状态和环境信息。公司称,其数据覆盖超过 200 万只狗和 120 多个品种,并在 2026 年开放了宠物情绪识别 API,计划把模型装入智能项圈和手机。

多模态方向符合动物行为研究的基本常识。狗的叫声需要结合尾巴、耳朵、身体姿势、主人动作和周围环境理解。但信息多了,模型也可能不看狗、只看背景。

2025 年,一项研究让 GPT、Gemini 和 LLaVA 等视觉语言模型识别狗的情绪。面对来自互联网、带有普通用户标签的照片时,部分模型表现尚可;换成实验环境中拍摄、裁去大部分背景的拉布拉多犬面部图像后,模型表现降到接近随机水平。给同一只狗换上草地、沙发、雨天或诊所背景,也会改变模型对“开心”“放松”或“悲伤”的判断。

模型看见的“悲伤”,有时来自阴雨背景;所谓开心,也可能只是草地和阳光。

因此,就目前的技术水平下,相比给宠物配上一整句台词,任务更窄的产品可能更容易得到验证。例如,加拿大公司 Sylvester.ai 就通过让用户拍摄猫的正面照片,模型根据耳朵、眼睛、胡须、口鼻和头部姿势,来判断猫是否可能处于疼痛或不适状态。它采用兽医学中的猫科疼痛表情量表,只提供舒适度提示,也明确说明结果不能替代诊断。

这显然离“翻译猫语”还很远,却更能回答一个实际的问题:模型的提示有没有帮助主人更早发现异常。猫未必需要用一句人话描述牙痛,主人发现它神态不对,随后由兽医检查出问题,这条信息就有了可以核实的结果。

回头看我们前面谈到的所有进展,从蝙蝠吵架到鲸鱼字母表,从大象的名字到草雀的实时对话,再到现在识别猫的状态,AI 真正能做到的其实一直是同一件事:帮人类听见(以及看见)更多此前听不见的东西。它能从十几万次叫声里捞出人耳分辨不了的差异,能发现咔嗒声里藏着可以自由组合的结构,能生成一段让鸟愿意接话的声音。但从听见到听懂,中间隔的那一步,至今没有被跨过。

2025 年,Jeremy Coller 基金会设了一个一千万美元的大奖,颁给第一个实现跨物种双向交流的团队。首届十万美元年度奖给了研究海豚哨声的 Laela Sayigh,她在佛罗里达的萨拉索塔湾跟踪同一群宽吻海豚跟踪了几十年。一千万美元的奖金,足以证明人类对于这一梦想的迫切程度。

而首届年度奖的去向,则说明这件事很难只靠一次算法突破完成。AI 可以在几十年的录音里寻找人耳难以发现的模式,也能帮助研究人员更快提出和检验假设。但让这些模式获得意义的,仍是像 Sayigh 一样愿意在野外蹲守多年、默默收集动物叫声的人。

回到家里的猫狗,道理其实也一样。App 可以分析一次叫声,把它归入饥饿、紧张或需要关注;主人还要看看它当时站在哪里、盯着什么,又会对开门、加粮或者抚摸作出怎样的反应。

所以,想读懂家里的猫狗,除了打开一个 App,终归还是需要你多看它几眼。

参考资料:

1.https://www.meowtalk.app/

2.https://www.nature.com/articles/srep39419

3.https://www.zoology.ubc.ca/edg/pdfs/Oren2024.pdf

4.https://www.nature.com/articles/s41467-024-47221-8

5.https://projects.earthspecies.org/naturelm-audio/prompting_guide.html

6.https://blog.google/innovation-and-ai/products/dolphingemma/

7.https://www.globenewswire.com/news-release/2026/05/21/3299008/0/en/traini-launches-the-world-s-first-pet-emotional-intelligence-api-opening-a-new-era-of-ai-for-non-human-communication.html

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
凌晨3点 皇马出战:冲击4连胜!穆帅恩怨对决 5大巨头交锋

凌晨3点 皇马出战:冲击4连胜!穆帅恩怨对决 5大巨头交锋

叶青足球世界
2026-09-04 08:01:17
绿卡拿了31年!亚裔老人现在想入籍已经晚了,当场被ICE逮捕,牵出赴美签证“问题”

绿卡拿了31年!亚裔老人现在想入籍已经晚了,当场被ICE逮捕,牵出赴美签证“问题”

华人生活网
2026-09-04 03:52:18
卖不走也用不上!巴萨天才帝星3轮0出场惨遭弗里克劝退,彻底沦为包袱

卖不走也用不上!巴萨天才帝星3轮0出场惨遭弗里克劝退,彻底沦为包袱

零度眼看球
2026-09-04 07:19:54
2025年重庆常住人口出生14.25万人 二孩占比为29.21%

2025年重庆常住人口出生14.25万人 二孩占比为29.21%

上游新闻
2026-09-02 16:32:17
细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

细思极恐!这是大S汪小菲第一次见面的照片,汪小菲像极了待宰羔羊

瞎说娱乐
2026-09-03 14:20:05
安踏,快被自己养大的“小弟”挤下主位了!

安踏,快被自己养大的“小弟”挤下主位了!

可乐爱微笑
2026-09-03 22:56:06
外媒:埃尔多安称,土耳其将考虑正式加入上合组织

外媒:埃尔多安称,土耳其将考虑正式加入上合组织

环球网资讯
2026-09-03 10:24:46
曝景甜口中的剧组夫妻:顶流男星剧组追过4位85花,成功率高达50%

曝景甜口中的剧组夫妻:顶流男星剧组追过4位85花,成功率高达50%

梦醉为红颜一笑
2026-09-03 08:11:32
短评:日本通缩30年留下的社会真相——消失的欲望

短评:日本通缩30年留下的社会真相——消失的欲望

财经飞说不可
2026-08-25 17:54:49
后续来了!那个叫嚣“我就是违法,你去告啊”的HR,被00后一夜治服了

后续来了!那个叫嚣“我就是违法,你去告啊”的HR,被00后一夜治服了

小徐讲八卦
2026-09-01 08:18:51
中俄永久免签意味着什么?

中俄永久免签意味着什么?

凤眼论
2026-09-02 19:47:16
全国唯一拥有两所“211”高校的县级市迎来5500多名新生

全国唯一拥有两所“211”高校的县级市迎来5500多名新生

21世纪经济报道
2026-09-03 16:25:55
离谱操作!巴萨截胡皇马封神引援翻车!世界杯 MVP 沦为替补轮换

离谱操作!巴萨截胡皇马封神引援翻车!世界杯 MVP 沦为替补轮换

奶盖熊本熊
2026-09-04 07:26:46
驻俄大使馆开始“提醒”某些人了!

驻俄大使馆开始“提醒”某些人了!

走读新生
2026-09-03 11:48:48
3台天价光刻机,发货!

3台天价光刻机,发货!

感知芯视界
2026-09-03 18:53:26
大三女儿暑假躺平40天,空调24小时不关奶茶30多一杯,我月薪几千省吃俭用,她张口又要3000旅游,我拒绝她摔门就走

大三女儿暑假躺平40天,空调24小时不关奶茶30多一杯,我月薪几千省吃俭用,她张口又要3000旅游,我拒绝她摔门就走

背包旅行
2026-09-01 11:59:19
尼泊尔外长感谢中国紧急援助支持,强调不会向中国等国家寻求“气候正义赔偿”

尼泊尔外长感谢中国紧急援助支持,强调不会向中国等国家寻求“气候正义赔偿”

界面新闻
2026-09-03 19:34:07
《牛来》延期上映,引发争议!网友:这娘俩吃相太难看了,票房都冲到6000万还不知足,普通人八辈子都花不完

《牛来》延期上映,引发争议!网友:这娘俩吃相太难看了,票房都冲到6000万还不知足,普通人八辈子都花不完

火山詩话
2026-09-02 09:28:46
孙割二怼胡锡进截图疑曝光?如果胡锡进再搅局,就放出40多页猛料,让景甜万劫不复

孙割二怼胡锡进截图疑曝光?如果胡锡进再搅局,就放出40多页猛料,让景甜万劫不复

小徐讲八卦
2026-09-03 10:09:54
李月汝护照丢失能否特事特办?苏群:已经特事特办了

李月汝护照丢失能否特事特办?苏群:已经特事特办了

懂球帝
2026-09-03 18:22:12
2026-09-04 08:20:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17185文章数 515199关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

媒体:美国驻华大使馆关心灾情的方式令人不适

头条要闻

媒体:美国驻华大使馆关心灾情的方式令人不适

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

教育
艺术
手机
旅游
数码

教育要闻

明明是送分题目,结果全军覆没!

艺术要闻

放大《汉宫春晓图》:撕掉宫斗剧滤镜,这才是明代深宫女子的真实日常

手机要闻

荣耀Robot Phone 16GB内存魔改24GB 结果翻车了

旅游要闻

2026教师节郑州、河南部分免票景区

数码要闻

英伟达发力“本地AI”!N1X设备10月上架 家庭算力路由器亮相

无障碍浏览 进入关怀版