Hugging Face今年3月出的报告里,过去一年的模型下载,中国占了41%,美国是36.5%;Artificial Analysis的开源权重模型榜,前六名全是中国实验室;OpenRouter上按token量排,前五名里有四个是中国模型。
AI时代,中国大模型公司的开源文化整得风生水起,跟海对面以闭源为主的生态形成了典型的对比。
这几组数是我前几天做开源模型研究的时候查的,然后呢,查着查着,发现个意料之外的发现。前几天Hugging Face上语言相关模型分类下的两个趋势榜第一:Confucius4-R2T2在自动语音识别,Confucius4-T3PO在翻译。
Hugging Face上现在挂着300多万个模型,光自动语音识别这一个分类就有3.6万多个,翻译也有1.7万多个,趋势榜排的是最近这段时间谁最热。R2T2做实时语音识别,放上去才两个礼拜左右,算是最近被追得最热的实时语音模型了。
![]()
另一个T3PO是做实时翻译的,在翻译分类也还挂在第一。
![]()
我前几天做研究的时候,盯的几乎全是通用大模型,比谁更聪明、谁被调用得更多。这回两个第一落在语音识别和翻译上,写稿的时候,翻译分类趋势榜的前十里有一半是中国公司放出来的模型。中国的开源模型,已经从通用大模型一路铺到了语音、翻译这些更细的方向上了。
说实话,我对网易有道的印象,大概还停在有道词典、词典笔那儿。然后呢,我点进它在Hugging Face上的主页往前翻了翻,才发现它往上放模型已经放了两年多,前年是检索用的embedding和rerank模型,去年是推理和数学模型,今年5月、6月是多模态和语音合成,这个月是这两个,后面这几个名字里都带着Confucius,也就是有道2023年就发了的教育大模型「子曰」。没想到它做模型已经做了这么久。
这两个模型,一个管实时转写的时候哪几个字可以先定下来,一个管同传的时候哪半句话可以先开口翻译。我这两天把它俩的模型卡和源码翻了一遍,又拿自己的口播、苹果发布会、英伟达财报电话会的录音实际跑了一轮。
一、R2T2:出了的字,就不再改
你只要开过实时字幕,大概都见过这个画面:一句话还没说完,字幕先冒出几个字,过半秒被改掉,改完又变,一整行字在那跳。其实呢,模型是边听边猜的,猜错了就回头改,这种做法一般叫伪流式;不想让字跳,就只能等一句话说完再上屏,字是稳了,但慢了好几秒。
R2T2是Real Real-Time Transcription的缩写,是个真流式模型:每来一小段音频(80毫秒到2秒可调,默认160毫秒)就出字,没把握的字先不出,出了的字就是最终结果,之后不再改。拿我口播里的一句话来画,两种做法在屏幕上大概是这样的:
![]()
「有没有把握」这个判断是训出来的。有道自己设计了一套训练数据,有稳定前缀数据、强制时间对齐数据和词元级音频切分数据,再配合最长稳定前缀(Longest Stable Prefix,LSP)的学习范式,让模型自己判断什么时候可以把一段字定下来、什么时候还得再听一会儿,定下来的字再作为上下文喂回去,帮它判断后面的字。每来一段音频,它都会走一遍这个循环:
![]()
模型卡里有一组数:把基座模型直接按160毫秒一段、出了不许改的方式来跑,英文LibriSpeech clean的错误率是22.30%,中文会议场景是20.38%;R2T2在同样的条件下分别是2.13%和7.27%。有道在GitHub上还放了两张汇总图,是在一堆测试集上取的平均,上面一组是出了字就不改的真流式,下面一组是允许回改的伪流式,左边是错误率,右边是延迟:
![]()
中文这张,R2T2在160毫秒一段的设置下,质量优先档的错误率是6.42%,延迟优先档把平均延迟压到了0.32秒;英文那张分别是6.13%和0.21秒:
![]()
模型卡对这组结果的说法是,准确率接近离线识别,平均延迟在200到600毫秒之间。
二、T3PO:什么时候开口翻译
T3PO是个140亿参数级的纯文本模型,接在R2T2这种流式ASR后面,ASR每吐出一点英文,它就判断这时候要不要翻。
它的推理协议是这样的(我是让agent帮我读了半天推理代码才搞明白的):每次请求,把已经翻过的「原文¦译文」历史和当前还没翻的那截原文一起塞进去,模型输出空,就是WAIT,接着等;输出了文字就是TRANS,这一段定下来进历史,以后不再改。和R2T2一样,出去的字不收回。
我拿苹果9月发布会iPhone Duo那一段试了一下,按苹果官方的英文字幕一个词一个词往里喂:
![]()
「C2 also delivers faster」之后,它连着等了5次,一直等到「in the US」出来才开口,可能是因为中文得把「在美国」放到「增加了5G毫米波支持」前面,没听到地点这句话说不顺。然后它把「all while」先翻成「同时」丢了出去,没等后半句。这一段里的续航小时数、1999美元的起售价、256GB到2TB的存储、10月16日预购和10月23日上市,它也都翻对了。
模型卡里说它主要靠两件事训出来:一是从普通的平行语料(一句原文配一句译文的翻译数据)里自动构造出分段对齐的同传数据;二是一个「帕累托感知」的强化学习算法。等得越久翻得越准,但也越慢,这个RL大概就是在这两者之间找平衡,有道官方的说法是,它把延迟和质量的这条前沿往前推了一截,在很低的延迟下也能给出接近离线翻译的质量,调用的时候可以在low、native、high三档延迟模式里选。
英伟达Q2财报电话会上CFO讲资产负债表和下季度指引的那段,我用公开的逐字稿喂给它,145次请求里它选了101次等、44次开口。英文的billion翻成中文要换算成「亿」,这段里7处billion的换算它全对:
![]()
我是在自己的MacBook Pro(M4 Pro,24GB内存)上用llama.cpp跑的量化版,单次请求的中位数是0.51秒,这段话真人说完要280秒,它全部算完用了138秒,追得上语速。
两个模型串起来是什么样子,有道官方放过一段33秒的演示,素材挑得还挺有挑战性的:八十年代美国玩具车Micro Machines的电视广告,念广告的John Moschitta当年是吉尼斯纪录里说话最快的人(一分钟586个词)。左边是R2T2转出来的英文,右边是同传出来的中文,你可以盯着左边看,字是一段一段往后长的。
两年多前看AI做实时语音对话和同传的演示,我在即刻上随手写了句「我想到了《Her》」。测完这一轮,我觉得R2T2和T3PO这种出了字就不改的模型,放在Voice Agent(语音agent)的最前面可能挺合适的:上游转出来的字不会改,下游的LLM就不用等你一句话彻底说完再开始想,T3PO能边听边翻,前提也是R2T2给它的每个词都不会被收回,换成一个agent,也许在你话说到一半的时候,它就可以开始查资料、做规划了。
官方仓库里也备好了现成的WebSocket服务和把两个模型串起来的语音同传服务,接到自己的应用前面不用从零搭。有独立开发者在自己的GPU服务器上测过R2T2,160毫秒一段的配置下,首字延迟大约0.4秒,纯噪声输入的时候也没有冒出幻觉文字。
三、我的视频管线里,ASR干的活
说回我自己,我现在做B站视频有一整条生产线,写成了一个叫huashu-video-pipeline的skill,其实里面有好几步都要用ASR:出词级时间轴,字幕和剪辑切点都要靠它;带上下文转录,把「豆包工作」「橙皮书」这类专名转对;拿提词稿和实际转录对一遍,找出重录和口误,生成剪点候选;剪完之后,每个接缝切6秒再送回ASR读一遍,确认没切掉字。
我拿自己豆包工作那期视频的20分钟口播,中英夹杂、有重录有口癖,丢给有道部署在Hugging Face上的官方demo转了一遍。R2T2原生支持把上下文和热词塞进prompt,我分别跑了带术语表和不带的:
![]()
「飞书」在口播里出现了6次,不带术语表对了1次,带上之后6次全对;「豆包工作」9次,从7次对到9次全对。
开头有一句「再接着修改」我说了两遍,它也转了两遍。我的管线找重录剪点,需要转写把两遍都留下来。
英伟达那段财报,我还用官方权重在自己的Mac上离线转了一遍,从里面抽了13个金额和比例对照逐字稿,全对。
其实我最想要的,是看英文视频的时候实时出中文字幕,看发布会、看财报电话会都用得上。
两个榜一都在Hugging Face上,R2T2是2B,T3PO是140亿参数级,R2T2有官方的在线demo,可以直接传一段音频试。
我觉得很有趣的是,最早把这件事解决的,居然不是大模型公司,也不是语音公司,而反倒是一家大家印象里做词典的公司。现在想来,他们大概是在翻译,同传等领域积累的够深,对这个场景有更丰富的用户需求的洞察判断和know how才让他们结合现在的开源生态把最实用的技术做出来吧。
这也算是下个阶段挺显性的趋势,也许我们会看到越来越多垂直领域开源生态的蓬勃生长。
参考资料
R2T2:https://huggingface.co/netease-youdao/Confucius4-R2T2
T3PO:https://huggingface.co/netease-youdao/Confucius4-T3PO
R2T2在线试用:https://huggingface.co/spaces/netease-youdao/confucius4-r2t2-demo
R2T2 GitHub:https://github.com/netease-youdao/Confucius4-R2T2
T3PO GitHub:https://github.com/netease-youdao/Confucius4-T3PO
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.