AI 终于不抢话了
今天凌晨,OpenAI 发布了 GPT-Live:新一代语音模型,并从今天起成为 ChatGPT 的默认语音模式
官方博客:openai.com/index/introducing-gpt-live
至于进步点,大概如下:
![]()
之前版本的问题
早在 2023 年,ChatGPT 就推出了语音模式,这其实是仨模型的接力:一个负责语音转文字,一个负责写回复,一个负责朗读,所以声音总是又慢又僵
2024 年的高级语音模式(Advanced Voice Mode)把三步并成一个模型,直接处理音频,快了不少。但它是轮流制,你说一轮,它说一轮,靠工程方法判定回复时间(比如检测你多久没说话)
这东西最大的体感,就是我在说话的时候,说着想一想,然后呢,他就开始回复了,就让我很头疼
真正的听说同步
GPT-Live 的第一个改动是全双工,能做到一直输入,随时输出,其背后的原理是每秒做很多次决策:开口,继续听,停下,插话,还是调工具(顺手还解决了实时翻译问题)
在闲聊模式下,这里也放个音频 demo,可与之前的进行对比
![]()
前台聊天,后台干活
这个模型(如果能被称之为模型的话)的第二个改动,是把「聊天」和「干活」解耦,如果遇到需要搜索、推理、多步执行的问题,GPT-Live 把任务委托给 GPT-5.5,自己继续跟你忽悠拖时间,等后台结果出来了在播放
![]()
这里的解耦,也是为了之后的升级,比如以后出了新模型,语音也不用重新训练,不用再等文本模型「降级适配」,以期适配更 Agent 的任务
跑分
盲测里,5 到 10 分钟的真实对话,GPT-Live-1 和 mini 在偏好度、接话、打断、流畅度、自然度上全面强于高级语音模式
![]()
GPQA(研究生级科学题)、BrowseComp(刁钻信息检索)、τ³-Voice Telecom(多轮电信客服任务)三项也都是明显领先
档位说明:Instant 档和 mini 背后是 GPT-5.5 Instant,Medium 和 High 档背后是 GPT-5.5 Thinking,推理力度对应中和高
在哪用
今天开始,这个东西已经能在 ChatGPT 里用了,iOS、Android、网页都有
付费用户默认给 GPT-Live-1,免费用户默认 mini,但暂时不支持视频通话和屏幕共享
API 目前还没有,但可以填表单登记,上线了会通知
→ API 登记表单:https://openai.com/form/gpt-live-1-in-the-api/
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.