语音正在变成人和机器人打交道的主要方式之一。这个判断来自 @humynlabs 的一条分享,他们给出的理由是:当机器人要听懂物理世界里真实发生的对话,语音识别的分量会比现在看起来重得多。
问题在于,真实对话很难转写。人们会停顿,会互相抢话,还会在一句话中间切换语言。这些恰恰是实验室里录出来的干净语音不会出现的情况。
![]()
被忽略的超55亿人
@humynlabs 提到一个数字:全球南方有超过 55 亿 非英语使用者。机器人要真正听懂人说话,就得覆盖这些人实际使用的语言,而不是只盯着英语。
但社区一直缺少一个能衡量这类前沿能力的好办法。于是 @humynlabs 做了 BRIDGE ASR 2.0,一个专门用来测这件事的基准。
测什么,怎么测
这个基准的测试对象是 23 个 语音识别模型,任务素材是真实的双人对话,每段时长 10 到 15 分钟。覆盖的语言包括 18 种印度语言,外加西班牙语、葡萄牙语和越南语。
@humynlabs 认为最有用的一个指标是 code-switch F1。它检查的是:一句印度语言里混进来的英语词,有没有被原样保留成英语。
举个具体的例子——如果模型把 "data backup" 写成天城文,这个指标上就是零分。
榜单可以自己筛
排行榜支持按语言筛选,也支持按指标筛选。方法和评测数据都是公开的,团队希望研究者去测这个基准,并且找出它在哪些地方会失效。
基准地址是 humynlabs.ai/bridge/ASR/2.0。这条分享发布于 9 月 25 日下午 2:47,目前有 1715 次浏览。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.