![]()
Meta正式进军竞争激烈的实时语音转文字市场,推出全新音频感知模型Muse Voice Transcribe。该模型由Meta Superintelligence Labs开发,支持流式转录、端点检测及超过20人的说话人分离(Diarization),其公开API处理每小时音频的价格仅为0.18美元。
Muse旨在实时处理语音而非等待录音结束,支持超过一小时的长音频、无缝多语言代码切换及语言和关键词偏向。该模型在70多种语言上训练,初始发布时验证了其中25种语言的准确性。值得注意的是,虽然支持20多名说话人是显著优势,但这并非行业最高纪录:Speechmatics实时服务默认支持50人(可增至100人),Amazon Transcribe则支持最多30人。
说话人分离成为核心语音堆栈
随着转录内容接入下游AI系统,区分“说了什么”与“是谁说的”至关重要。错误的说话人归属会导致会议记录、客服分析及合规工作流不可靠。Muse将说话人归属直接整合至自回归多模态架构中,通过“自适应延迟”机制平衡字错率与延迟,统一训练ASR、说话人分离和端点检测,而非将其作为独立的下游过程。
在Meta Model API中,说话人分离被列为一级操作模式,提供基于轮次(turn-level)而非单词的时间戳,标签仅限于会话范围。
性价比与准确率的双重优势
Muse的定价策略极具侵略性。每1000分钟3美元(即每小时0.18美元)的费率,使其在包含说话人分离功能的服务中处于市场低位。相比之下,Deepgram含说话人分离的综合成本约为每小时0.47美元,AssemblyAI约为0.57美元,而OpenAI GPT Live Transcribe高达1.02美元且未列出说话人分离功能。Soniox虽以每小时0.12美元更便宜,但仅支持最多15名说话人。
在准确率方面,Meta提供的基准数据显示,Muse在Artificial Analysis流式索引中的字错率(WER)为3.1%,优于Cartesia Ink-2(3.4%)、ElevenLabs Scribe v2(3.6%)及Qwen3 ASR Flash(3.7%)等竞品。在AMI-IHM等数据集上,其平均说话人分离错误率为17.5%,同样低于竞争对手。
尽管存在部署限制——如仅提供基于轮次的时间戳、默认并发8个流、单会话最长60分钟——但Muse凭借高容量实时说话人分离、低延迟转录及低廉价格,为企业开发者构建会议系统、实时助手及环境AI提供了极具竞争力的新选择,同时也迫使竞争对手在说话人意识准确性和总体运营成本上展开新一轮较量。
【星途科讯 图文丨LCC 首发于ZAKER科技,转载请注明出处】
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.