第一财经「新皮层」独家获悉,田永龙近期也被纳入腾讯CEO/总裁办公室(CEO|President’s Office),同时其头衔已明确为「混元多模态负责人」,向姚顺雨汇报。
7月24日,腾讯将原本相互独立、分别由姚顺雨和薄列峰领导的大语言模型和多模态模型部门合并,成立基础模型部,由姚顺雨统一负责。田永龙在此次腾讯大模型架构调整期间加入其多模态团队,担任VLM(视觉语言模型)负责人。
接近腾讯的人士称,7月的架构调整后,曾任多模态模型负责人的薄列峰就不再直接负责一线模型业务,与王迪一道担任基础模型部运营负责人。
田永龙本科毕业于清华大学,2014年至2016年在香港中文大学多媒体实验室(MMLab)攻读硕士,师从商汤科技创始人汤晓鸥和商汤科技首席科学家王晓刚,从事视觉基础算法、检测/识别类早期工作。
2017年,田永龙进入麻省理工攻读计算机博士,并于博士期间先后在英伟达、Google及DeepMind实习。2022年毕业后,田永龙加入Google,担任高级研究科学家,后转至DeepMind。2024年10月,他加入OpenAI担任研究员,主要研究方向是多模态表征学习和自回归视觉生成。同一时期,姚顺雨也在OpenAI担任研究员。
腾讯CEO/总裁办公室最初只有腾讯「大语言模型(LLM)一号位」、首席科学家姚顺雨一名成员,该部门去年12月随着姚顺雨的公开入职而设立,明确了姚顺雨在领导大语言模型团队向所属上级部门TEG的总裁卢山汇报之外,也要直接向腾讯总裁刘炽平汇报。
田永龙的任命意味着腾讯提升了多模态的重要性,并试图复制它在语言模型领域的翻身之路——先找到一位海外优秀模型厂商的核心研究员,再将人才放置到某个模型一把手的位置,并赋予他向上可以直接跟腾讯集团一把手说上话、向下统领从预训练到后训练以及数据和Infra的模型完整产线的权力——此前,姚顺雨加入腾讯后走的就是这条路。今年7月和8月,腾讯接连发布的Hy3和Hy4 preview,都由姚顺雨主导。
Hy4 preview发布时,腾讯称,在其组织的163名内部专家、203个工程任务的盲测中,Hy4 preview(均分2.99/4)的表现略优于GLM 5.3(均分2.92/4.00)和Kimi K3(均分2.94/4.00)。
腾讯看起来对姚顺雨在语言模型领域的工作是满意的,并试图将这一模式复制到多模态领域。
「新皮层」此前曾报道,腾讯混元自去年11月至今就没有再发布过新的多模态模型。这一周期显著超过同行的模型迭代速度。同一周期内,阿里巴巴、字节跳动和可灵先后突破了视频生成的音画一体化能力,并在多模态生成的推理能力上取得进展,其中字节在此期间更新了Seedance 2.0和Seedance 2.5两代模型。
在多模态领域的落后削弱了腾讯在终端应用上服务用户的能力。目前,腾讯旗下的元宝、WorkBuddy等产品内置的混元系模型仍然无法原生地理解和生成图片和视频,完成这两项任务时,两个应用都要调用第三方工具才能实现。
9月2日的腾讯WorkBuddy生态大会上,WorkBuddy接入了Plaud、Rokid、影石、科大讯飞、安克、猛玛、京东京造、优篮子等公司的硬件。其中所涉及的多模态场景,也只涉及语音识别和理解,比如优篮子的「键盘麦」,其中一项功能是方便用户语音输入。影石的摄像设备接入WorkBuddy,WorkBuddy目前能够为其解决的也是视频的音频转写,不涉及对视频画面的处理。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.