网易首页 > 网易号 > 正文 申请入驻

会做饭的AI,能听懂"只说做好之后的步骤"吗?

0
分享至


你有没有试过让家里的智能音箱做一件稍微复杂点的事?比如说"把客厅的灯调暗一点,但不要低于三十瓦,而且如果现在是晚上十点以后,就顺便把卧室的灯也关了"。

大概率它会卡壳,或者干脆只执行了第一句。

现在把这个场景搬到视频理解的AI模型上,情况会更复杂。假设你让一个AI看一段十分钟的做饭视频,然后问它:"只描述食材下锅之后的步骤,按时间顺序列出来,每一步都要带时间戳,而且请用JSON格式回复,不要超过五十个字。"

这已经不是"看懂视频"那么简单了。这是要求AI同时做到三件事:理解视频里发生了什么、精确锁定"食材下锅"这个时间节点之后的内容、并且严格按照你给的格式规则组织答案。

这篇来自腾讯优图实验室等团队的论文,就是在探究一个问题:现在这些号称能"看视频"的大模型,到底有多擅长听你的话?

现有的考试都在考"答得对不对",没人考"听得准不准"

这里要先说清楚一件事。过去几年,评估视频理解AI的benchmark(基准测试集)已经出了不少,像是MVBench、Video-MME、TempCompass这些。

> **Benchmark**:指用来统一测试和比较不同AI模型能力的标准化数据集和评分方法,相当于给AI做的"标准化考试"。

这些考试考的都是同一类问题:你说说视频里发生了什么,AI答对了吗?考的是理解力、时序推理能力、长视频的记忆能力,甚至专业知识的调用能力。

但没有人问过另一个问题:如果我提的要求很复杂,AI能不能把每一条要求都做到?

这两件事看起来像是一回事,其实完全不是。一个模型可能对视频内容理解得很准确,但你一旦加上"用列表格式回答""不超过三十个字""不要提到颜色"这样的附加条件,它就开始顾此失彼。这在文本领域已经有了专门的研究方向,叫做"指令遵循"(instruction following),像IFEval、FollowBench这些benchmark都是干这个的。但把这套评估思路搬到视频领域,之前基本是空白。

> **指令遵循(Instruction Following)**:指AI模型是否能够严格按照用户给出的具体要求(包括格式、内容范围、语言风格等约束条件)来生成回答,而不仅仅是给出内容上"正确"的答案。

这就好比你请了一位很懂做菜的厨师,他确实能做出好吃的菜,但你要是提出"不要放葱""装盘要用圆盘""得在二十分钟内做完"这样的组合要求,他可能就手忙脚乱了。这两件事考察的是完全不同的能力:一个是专业技能,一个是听指挥的能力。

如果不专门去测这个能力,会发生什么?答案是,你根本不知道这些AI模型在真实场景里能不能用。因为现实中的用户提问,从来都不是干干净净的一句"描述一下这个视频",而是夹杂着各种具体要求的复杂指令。

一套指令分类体系:从简单到烧脑

研究团队做的第一件事,是搭建一套指令的分类框架,一共设计了四种模板:单任务、多任务、选择型和嵌套型。

单任务指令很好理解,就是"从视频里找一个信息,附带几条格式或内容上的限制"。比如"描述视频最后十秒发生的动作,用JSON格式回答,动作字段控制在二十到五十个字之间"。

多任务指令则是一次提出两个或更多任务,考验模型能不能在一次回复里同时兼顾多件事。

真正有意思的是后两种。选择型指令要求模型先根据视频的实际内容,判断走哪一条分支,再去执行对应分支下的指令。举个例子,"如果视频开头出现了'如何修复进水笔记本电脑'这几个字,那么按顺序回答这几个问题;否则用西班牙语回答另一组问题。"AI得先看视频,确认到底是不是那个开头,然后才能知道该按哪套要求来答。

嵌套型指令则是把这种条件判断层层叠加,做成一棵树。论文里给出的一个真实例子,条件嵌套深度最多达到了十五层。你可以理解成一个巨大的"if-else"决策树,AI必须一层一层往下走,走到正确的叶子节点,才能拿到真正需要执行的那条指令。

这套设计背后的用意其实很直接:现实中的视频理解需求,从来不是单一维度的。你可能只是想问一句话,也可能想让AI帮你梳理一整套复杂的条件逻辑,就像医生看诊断报告时要判断"如果指标A超标,且指标B正常,那么走方案一;否则走方案二"。如果benchmark只测第一种简单场景,那测出来的能力和实际部署时需要的能力完全不是一回事。

这就好比一个学生只做过选择题,突然被要求写一篇有严格字数、格式、论证结构的议论文。你会发现,"知道答案"和"按要求呈现答案"根本是两种不同的能力,第一种是知识储备,第二种是执行纪律性。如果不专门去考第二种能力,学生的真实写作水平永远是个谜。

39种约束条件,覆盖了你能想到的所有"刁难"

光有指令结构还不够,研究团队还专门整理了一套约束条件的分类体系,一共39种,分成语义约束(22种)和格式约束(17种)两大类。

> **语义约束**:要求AI理解视频内容本身的语义信息才能满足的条件,比如"只描述某个时间段内的内容""不要提到某个人的性别""按照事件发生的时间顺序排列"。

> **格式约束**:对回答的呈现形式提出的要求,跟视频内容本身没有直接关系,比如"用JSON格式输出""控制在八十到一百二十个字之间""每段不超过三个要点"。

语义约束里有一类特别刁钻,叫做"时间锚点约束",要求模型只能描述某个参照事件之前或之后发生的内容。比如"只描述门打开之前的画面"。这听起来简单,但对AI来说,要做到这一点,它得先精准定位"门打开"这个瞬间发生在视频的哪一秒,然后才能判断哪些内容属于"之前"、哪些属于"之后"。

还有一类叫"转场边界约束",要求模型定位状态发生变化的临界点,比如"某人进入或离开画面的每一个瞬间"。这类约束逼着AI必须做到帧级别的精细观察,稍微看走眼一帧,答案就全错了。

格式约束相对简单一些,比如要求回答必须是恰好八条的列表、必须用JSON对象、必须用第一人称叙述、必须控制在指定的字数区间内。这些约束不需要模型理解视频内容,只需要严格执行格式规则。

为什么要把约束分成这两大类?因为团队后来发现,这两类约束对AI来说的难度天差地别,这个发现放在后面细说。

数据是怎么造出来的:让AI自己给自己出题

这套benchmark最终包含了1500个精心设计的样本,覆盖了七百多个视频,总时长将近四十九个小时,视频时长从十秒到十分钟不等,覆盖了十个不同领域,从科技资讯到烹饪教程都有。

问题来了:这么复杂的指令结构,靠人工一条条编写,成本会高到离谱。研究团队想了个办法,搭建了一套半自动化的数据生产流水线,核心思路是让大模型先干粗活,人工再来把关精修。

具体流程是这样的。先用一个多模态大模型给每个视频提取两层信息:一层是整体的视频描述,另一层是更精细的"事实清单",也就是把视频拆解成一条条带时间戳的原子事实,比如"第4到6秒,人把笔记本电脑放到烤盘上"。对于比较长的视频,团队还专门把视频切成一分钟一段,让AI按段处理,同时维护一个"角色记忆表",确保前后段落里对同一个人、同一个物体的指代能保持一致。

有了这些事实素材,接下来就是生成单任务和多任务指令,直接从事实清单里挑几条,配上随机抽取的约束条件,让AI生成对应的指令。

选择型和嵌套型指令的生成要麻烦得多。团队发现,如果直接让AI去"编"一个带分支判断的复杂指令,它编出来的分支往往过于简单,缺乏真正的挑战性。于是他们改用了一套更巧妙的办法:先把某条真实事实做三种变形,一种是"编辑变形"(比如把"键盘"改成"屏幕",制造一个视觉上相近但事实上错误的说法),一种是"否定变形"(比如把"倒水"改成"没有倒水"),还有一种是把编辑和否定叠加起来。这样就能人为构造出一批"看起来真实、但实际上是假的"条件分支,再混合真正的事实,拼出一棵完整的决策树,并且确保树里有且只有一条路径是真正正确的。

这个设计思路挺有意思的。这就好比出一道数学选择题,如果四个选项里只有一个是对的、其他三个明显离谱,那这道题就没什么难度。但如果错误选项都是从正确答案稍微改动而来,看起来非常接近真相,那才叫真的考验计算能力。团队用"编辑+否定"的方式制造干扰项,本质上就是在给AI设置"高仿干扰答案",逼它必须真正看清视频细节,而不是靠蒙。

生成好指令之后,还有最后一道工序:为每一条约束生成对应的检查项。每个检查项本质上是一个"是/否"的判断问题,配合视频内容作为判断依据。之后所有这些自动生成的样本都要经过人工核验,问题不对的、指令有歧义的、检查项写错的,全部要修正或者直接丢弃。

怎么给AI的回答打分:两把尺子一起量

评分这块,团队设计了一套混合验证机制,把"AI来判卷"(LLM-as-Judge)和"程序自动检查"结合在了一起。

> **LLM-as-Judge**:用另一个大语言模型来充当"阅卷老师",判断被测模型的回答是否满足某项要求,通常用于那些需要理解语义、无法用简单规则判断的场景。

为什么不能全部用程序判断?因为像"回答是不是恰好八条列表"这种规则性很强的要求,用代码检测又快又准,没必要浪费算力去调用大模型。但像"是否只描述了00:20到00:55这段时间内的事件"这种需要理解语义的判断,程序就无能为力了,必须靠另一个大模型结合视频证据来做判断。

评分时还有一个关键概念叫"生效指令"(active instruction)。因为一个样本里可能藏着好几条候选指令(尤其是选择型和嵌套型),只有被正确路径选中的那一条才是真正需要执行的指令。对于单任务和多任务样本,给出的指令本身就是生效指令;但对选择型和嵌套型样本,只有走对分支或路径之后对应的那条指令才算数。

基于这套框架,团队设计了两个核心的量化指标,分别叫TCSR和TISR。

TCSR衡量的是,在模型正确识别出应该完成哪些任务的前提下,它平均满足了多少条约束。TISR则更严格,它要求模型不仅任务方向没找错,还得把这条指令下面所有的检查项全部满足才算数,只要有一条没做到,这一题就是零分。

这两个指标的差距其实很能说明问题。就好比考试有两种评分方式,一种是按点给分(做对几步给几步的分),另一种是全对才给分、错一步就是零分。TISR用的就是后一种严苛标准,因为现实中的用户不会因为你满足了百分之九十的要求就满意,往往是"差一点就等于没做到"。

二十多个模型同场竞技,结果比想象中更严峻

团队测试了超过二十个当前主流的多模态大模型,包括谷歌的Gemini-3-Pro和Gemini-3-Flash、OpenAI的GPT-5.4、字节跳动的Doubao,以及Gemma、InternVL3.5、Qwen系列等一大批开源模型。

结果是,即便是表现最好的Gemini-3-Pro,综合TCSR也只有76.5分,TISR更是只有54.5分。

这意味着什么?意味着即使是当前最顶尖的模型,在"完全满足用户提出的所有约束条件"这件事上,成功率也刚过一半。开源模型里表现最好的是Qwen3.5-397B-A17B-Think(思考模式),TCSR为69.6,TISR为46.1,和Gemini-3-Pro还有六到八个百分点的差距。

更值得关注的是不同指令类型之间的表现差异。很多模型在多任务指令上的得分反而比单任务指令要高,这说明真正卡住模型的瓶颈,不是"要不要同时处理好几件事",而是"能不能满足又多又复杂的约束条件"。

而选择型和嵌套型指令,则是所有模型的重灾区。嵌套型指令上,即便是Gemini-3-Pro也只拿到了53.7分的TCSR和46.0分的TISR,最好的开源模型更是只有33.0和28.2分。

这个数字放在实际场景里意味着什么?意味着如果你让AI先判断视频里发生了什么条件、再执行对应的操作,超过一半的情况下它可能压根就走错了路,答的是一道完全不该回答的题目。这就像你让导航软件先判断"如果前方是收费站就走左道,否则走右道",结果导航系统压根没识别清楚前方是不是收费站,直接把车带偏了。这种错误比"答案本身不够精确"要严重得多,因为它意味着整个理解的起点就错了。

| 模型 | Single TCSR/TISR | Multi TCSR/TISR | Selection TCSR/TISR | Nested TCSR/TISR | Overall TCSR/TISR |

| Gemini-3-Pro | 79.6/52.3 | 88.6/58.8 | 68.5/59.2 | 53.7/46.0 | **76.5/54.5** |

| Gemini-3-Flash | 76.7/49.2 | 87.6/56.4 | 63.9/54.8 | 39.9/30.7 | 72.2/49.5 |

| Doubao-Seed-2.0-Pro | 76.7/44.6 | 87.1/51.1 | 46.5/38.2 | 17.8/14.4 | 65.7/40.8 |

| GPT-5.4 | 72.8/34.7 | 82.4/43.2 | 21.1/16.9 | 12.1/7.6 | 57.4/30.0 |

| Qwen3.5-397B-A17B-Think | 79.4/48.5 | 86.0/52.8 | 52.1/44.9 | 33.0/28.2 | 69.6/46.1 |

哪些约束最容易把AI绊倒

团队进一步分析了具体哪种类型的约束最难满足。结果发现,涉及时间定位和条件相关内容选取的约束,几乎全线垫底,比如"转场边界"、"时间锚点"、"时间范围"和"动作相关选择"。

这说明了一个挺根本的问题:现在的模型在把回答和视频里那些精细的证据对齐这件事上,还远远做不到位。尤其是当指令要求根据具体的视觉或音频条件去定位事件的时候,模型经常出错。

再进一步对比语义约束和格式约束这两大类,差距更加明显。几乎所有模型在语义约束上的表现都显著弱于格式约束。这个结果其实挺容易理解:格式约束是"你只要照做就行"的规则,比如用JSON格式输出,模型只需要遵守语法规则,跟视频内容毫无关系。但语义约束要求模型真的理解视频里发生了什么,才能判断该不该提到某个内容、该不该在某个时间段之内。

这就像考试里有两类题目,一类是"请用不超过一百字的篇幅回答",另一类是"请只描述主角哭泣之后发生的事情"。前者你不需要真的读懂文章就能满足格式要求,后者你必须精确理解文章内容才能知道从哪里开始写。如果一个学生总是在第二类题目上失分,说明的不是他不遵守规则,而是他压根没读懂材料。

任务数量不是问题,约束数量才是真正的难关

团队还专门做了一组对照实验,来验证"到底是任务数量拖后腿,还是约束数量拖后腿"。

结果相当清楚。当任务数量从一到四个逐步增加到九个以上时,表现好的模型基本保持稳定,比如Gemini-3-Pro在三个任务区间段的通过率分别是95.6%、94.9%、96.3%,几乎没有波动。

但当约束数量增加时,情况完全不同。Gemini-3-Pro的TISR从一到四条约束时的62.7%,一路跌到九条以上约束时的46.9%,掉了将近十六个百分点。而对于本身能力较弱的开源模型,这个跌幅堪称雪崩:Qwen3-Omni-30B-A3B-Instruct从40.1%直接跌到3.5%,Gemma-4-E4B-it从38.4%跌到7.1%。

这个对比揭示了一个挺重要的道理:让AI同时干几件事,它大体上还能应付,但让它同时记住并遵守一堆细碎的规则,它就开始顾此失彼。这就好比你让一个厨师同时炒三道菜,他忙是忙,但基本能应付过来;可你要是让他炒一道菜的同时还得记住"不能放盐""必须在十五分钟内完成""装盘用蓝色盘子""不能用铲子只能用筷子"这一堆规则,哪怕只做一道菜,他大概率会漏掉一两条。任务的复杂度是"广度"问题,约束的复杂度是"精细度"问题,这两者对AI能力的要求完全不在一个维度上。

决策树越深,AI越容易迷路

嵌套指令的深度敏感性分析也很能说明问题。团队发现,随着决策树的最大深度增加,任务通过率普遍下降。

Gemini-3-Pro从深度2到4区间的64.6%通过率,降到深度8到14区间的55.6%。Qwen3.5-397B-A17B-Think的降幅更明显,从40.5%跌到22.2%。而本身能力偏弱的开源模型,即使在浅层嵌套结构下表现就已经很差了,深度增加对它们来说几乎是雪上加霜。

这说明嵌套结构越深,模型越难在众多条件判断中保持清醒,追踪到底走到了树的哪一层、下一步该判断哪个分支。这跟人在阅读一份层层嵌套的法律条文或合同条款时的困境挺像的:如果条件只嵌套两三层,你还能靠脑子记住每一层的前提;但要是嵌套到七八层甚至十几层,大多数人也会看晕,得靠纸笔一层层画出决策树才能理清逻辑。AI显然还没有学会"画草稿"这项技能,深层嵌套结构对它来说就是认知负荷的直接叠加。

位置偏见:AI也会"偷懒"

还有一个特别有意思的发现,跟选择型指令里"正确分支放在哪个位置"有关。

团队做了对照实验,在保持分支数量不变的情况下,把真正正确的那条分支从第一位挪到第二位、第三位,观察模型表现的变化。

结果显示,几乎所有模型都对第一个分支有明显偏好。Qwen3.5-397B-A17B-Think在正确分支排第一位时通过率是76.5%,挪到第三位就跌到52.9%。它的指令版本(非思考模式)跌幅更夸张,从70.6%直接掉到29.4%。

这说明当前的模型在评估多个条件分支时,并不是真正对每一个分支都做了同等程度的仔细检查,而是存在某种"先入为主"的倾向,可能更倾向于相信排在前面的选项就是正确答案。这就像人在做选择题时,如果没有认真读完所有选项,潜意识里容易更快认定第一个看起来合理的答案就是正确的,尤其是在时间紧迫或者注意力不集中的时候。AI这种行为模式,某种程度上也暴露了它在处理长文本、多分支条件时,注意力分配并不均匀这个深层问题。

思考模式管用吗?答案是:看情况

论文里还专门比较了"思考模式"(也就是模型在回答前先做一段显式推理)对指令遵循能力的影响。

结果发现,思考模式对Qwen3和Qwen3.5系列模型有明显的提升效果,但对InternVL3.5系列几乎没有帮助,甚至在个别情况下还出现了轻微下降。这说明"让模型多想一会儿"这件事,效果高度依赖于模型在训练阶段是怎么设计推理奖励机制的,并不是一个放之四海皆准的万能药。

另外,思考模式带来的提升,在语义约束上普遍比在格式约束上更明显。这个现象也符合直觉:格式约束本身不需要理解视频内容,多思考也帮不上太多忙;但语义约束需要模型真正琢磨视频里发生了什么、时间点在哪里,多一步推理反而能帮它想清楚。

Q&A

Q1:Video-IFBench是什么?

A:Video-IFBench是腾讯优图实验室等团队推出的一个视频理解指令遵循能力评测基准,专门用来测试多模态大模型能不能在理解视频内容的同时,严格满足用户提出的各种复杂约束条件,包含1500个样本,覆盖700多个视频和39种约束类型。

Q2:为什么现有的视频理解AI测试不够用?

A:因为现有的benchmark像MVBench、Video-MME都只测"回答对不对",不测"是不是完全按用户要求做的"。现实中用户提问往往带着格式、时间范围、语言等多重限制,而这个能力此前几乎没有专门的测试体系。

Q3:测试结果显示AI模型表现怎么样?

A:即便是表现最好的Gemini-3-Pro,综合严格得分(TISR)也只有54.5分。模型普遍在约束数量多、涉及语义理解、需要条件判断选择正确分支的复杂指令上表现很差,说明视频指令遵循仍然是一个远未解决的难题。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
越南“骗婚团伙”骗走中国男子2.8亿越南盾,假新娘仅得500多元被判7年监禁

越南“骗婚团伙”骗走中国男子2.8亿越南盾,假新娘仅得500多元被判7年监禁

红星新闻
2026-09-09 13:05:20
三“虎”同日被处理!原正部级老虎王祥喜被“双开”,金湘军一审被判死缓,李百安被公诉

三“虎”同日被处理!原正部级老虎王祥喜被“双开”,金湘军一审被判死缓,李百安被公诉

上观新闻
2026-09-08 19:09:21
王菲在镜头前把矿泉水瓶标签撕得干干净净!网友:不是矫情,是太清楚自己这张脸值多少钱

王菲在镜头前把矿泉水瓶标签撕得干干净净!网友:不是矫情,是太清楚自己这张脸值多少钱

背包旅行
2026-09-09 14:45:19
谁也没想到,4岁孩子摸人事件出现意外变化,《狗的审判》给答案

谁也没想到,4岁孩子摸人事件出现意外变化,《狗的审判》给答案

萧狡科普解说
2026-09-09 10:36:21
香烟价格再调整?10元以下香烟会消失吗,烟民需要提前了解变化

香烟价格再调整?10元以下香烟会消失吗,烟民需要提前了解变化

小鹿姐姐情感说
2026-09-09 07:29:50
不可思议啊!深圳网约车司机苦等10多分钟还要求再等,拒绝后女生当场大哭,家长拦车不让走

不可思议啊!深圳网约车司机苦等10多分钟还要求再等,拒绝后女生当场大哭,家长拦车不让走

火山詩话
2026-09-09 08:27:38
大陆新法10月1日实施,“台独”末日到了,岛内:条条都具杀伤力

大陆新法10月1日实施,“台独”末日到了,岛内:条条都具杀伤力

潋滟晴方DAY
2026-09-09 13:23:29
小米澎程首撞冲上绿化带,雷军流量反噬来了!

小米澎程首撞冲上绿化带,雷军流量反噬来了!

互联网品牌官
2026-09-09 15:41:33
存款大局已定:不出意外下半年,银行存款利率或将重演2016年行情

存款大局已定:不出意外下半年,银行存款利率或将重演2016年行情

人类文明之光
2026-09-09 14:39:01
钱再多有什么用?40岁自曝确诊的陈赫,给广大中年人敲响“警钟”

钱再多有什么用?40岁自曝确诊的陈赫,给广大中年人敲响“警钟”

兵鉴史
2026-09-09 17:48:23
哈里梅根反击查尔斯!“我们是公众人物,不是普通公民”,引发争议

哈里梅根反击查尔斯!“我们是公众人物,不是普通公民”,引发争议

译言
2026-09-09 12:20:26
游客自驾大兴安岭遇棕熊趴引擎盖讨食,官方回应:不投喂、不下车、不开窗

游客自驾大兴安岭遇棕熊趴引擎盖讨食,官方回应:不投喂、不下车、不开窗

大风新闻
2026-09-09 16:37:24
一家民企的终极防御:既然我犯法,那把这27家同行全抓了吧

一家民企的终极防御:既然我犯法,那把这27家同行全抓了吧

有戏
2026-09-07 14:49:53
沉默六天,终于瞒不住了!中方登临日船只检查,高市政府罕见失声

沉默六天,终于瞒不住了!中方登临日船只检查,高市政府罕见失声

流云青史
2026-09-08 15:28:32
底层的戾气越来越重了

底层的戾气越来越重了

知肇分子
2026-09-07 20:40:32
9月9日美网战报,2-0,2-0,2-0,萨巴伦卡晋级,中国金花无缘四强

9月9日美网战报,2-0,2-0,2-0,萨巴伦卡晋级,中国金花无缘四强

南海浪花
2026-09-09 07:58:38
南通烤肉店老板老陶深夜跳江身亡!6家门店,一个爱好毁掉一切

南通烤肉店老板老陶深夜跳江身亡!6家门店,一个爱好毁掉一切

天天热点见闻
2026-09-08 06:33:00
律师公开广西朱广成涉黑案中大规模刑讯逼供细节:有人被逼到撞墙自杀,有人在庭审期间死亡

律师公开广西朱广成涉黑案中大规模刑讯逼供细节:有人被逼到撞墙自杀,有人在庭审期间死亡

追月数星
2026-09-08 14:09:40
美网只剩郑钦文和前5种子了!仅13%胜率进四强 能否10天5次惊天下

美网只剩郑钦文和前5种子了!仅13%胜率进四强 能否10天5次惊天下

风过乡
2026-09-09 13:57:50
郭德纲,大概不会再复出了

郭德纲,大概不会再复出了

娱慧
2026-09-08 17:30:13
2026-09-09 18:19:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9789文章数 568关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

父亲病逝独生女未露面被伯父起诉剥夺继承权 女方发声

头条要闻

父亲病逝独生女未露面被伯父起诉剥夺继承权 女方发声

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

艺术
房产
健康
公开课
军事航空

艺术要闻

17幅 当代俄罗斯画家 布鲁西洛夫风景油画

房产要闻

砸388亿+首个方案出炉!三亚,又一片区要起飞!

中风康复为何像“抽丝剥茧”?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

停止互袭首都3天后 俄乌猛烈交火

无障碍浏览 进入关怀版