![]()
DeepSeek发布V4.1 Flash、宇树开源具身基座模型、月之暗面拟A+H上市
9月10日,DeepSeek正式发布V4.1 Flash,这是其全新模型结构系列中尺寸最小的一款,具备原生多模态视觉理解能力。
官方首次公开其采用的因果编码器—解码器(Causal-Encoder-Decoder)非对称架构:总参数5520亿主干、另配1960亿参数的Engram条件记忆,输入处理每Token仅激活80亿参数、输出生成激活160亿参数。关键数字是缓存压缩——全局KV缓存降至每Token约890字节、约为上一代V4-Flash的四分之一,持久化缓存SSD占用降至约八分之一;Engram以查表方式调用条件记忆,可将大型记忆表放在CPU主机内存。
模型以MIT许可开放权重,API闲时缓存命中输入价降至0.02元/百万Token、输出4元,高峰时段为两倍。
同日,宇树科技完全开源UnifoLM-WLA-1.0具身基座模型,实现单模型统筹64项任务,覆盖桌面操作与全身移动操作,具备跨任务、跨末端执行器泛化能力。
另据《南华早报》,月之暗面正研究"香港+上海"双重上市方案,并已完成港股秘密递表,同时进行上市前最后一轮融资,估值可能达约500亿美元;DeepSeek则在筹备科创板IPO。港股大模型板块因此承压,智谱跌逾10%、MiniMax跌近9%。(来源:财联社、每日经济新闻、DeepSeek官方、《南华早报》、凤凰网科技,2026-09-10至11日)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.