网易首页 > 网易号 > 正文 申请入驻

AI点点鼠标就能找到对象,为什么GUI操作还是找不到按钮? - 科技行者

0
分享至


你有没有遇到过这种情况:让手机助手帮你点一下屏幕上某个按钮,它偏偏点歪了,点到旁边那个功能完全不同的图标上去。

这不是段子,这是现在最先进的AI模型每天都在发生的事。

一群研究者做了一个特别刁钻的测试,结果发现,市面上最强的商业AI模型,在最简单的空间判断题上,正确率只有三成左右。三成是什么概念?如果这是考试,那是不及格里的不及格。而人类做同样的题,正确率是96.9%。这中间差了65个百分点。

**这篇论文的名字叫GUI-PRIMITIVES,来自南加州大学和卡塔尔计算研究院的两位研究者。**

他们想搞清楚一件事:当AI代理去操作电脑界面时,点错按钮到底是哪个环节坏了。

先搞清楚,这些AI代理到底在干什么

现在有一类叫"计算机使用代理"的AI系统,正在快速崛起。

**计算机使用代理**:读取屏幕截图,理解需要执行的操作,然后输出一个点击坐标或者一串按键指令的AI系统。

它们的工作流程听起来特别简单:看屏幕、找目标、点鼠标。这跟人打开一个软件窗口,找到自己要点的那个控件,然后伸手点过去,是完全一样的逻辑。这个"找目标、点过去"的过程,研究者们管它叫GUI grounding。

**GUI grounding(图形界面定位)**:让模型根据一句自然语言指令,在屏幕截图上准确找到对应的界面元素并给出点击坐标的能力。

在这篇论文出现之前,业界已经有不少测试AI这项能力的基准,比如OSWorld、ScreenSpot、ScreenSpot-Pro。这些基准测的方式都差不多:给模型一句指令,看它点的位置是不是落在正确的按钮框里。这套测试方式的问题是,它只告诉你模型点对了还是点错了,完全不告诉你点错的原因。

这就好比一个学生做数学题,只判对错,不看解题步骤。如果这个学生总是把加法算错,你光看最终答案是永远发现不了的,你以为他不会做题,其实他只是把7加8算成了16。而GUI-PRIMITIVES这篇论文,做的就是把这个"解题步骤"拆开来看。

为什么以前的测试查不出病因

要理解这篇论文的价值,得先弄明白一个陷阱,叫答案偏好陷阱。

想象一下,如果一个模型不管指令是什么,永远都倾向于点击屏幕上最显眼、最居中、或者标签写得最清楚的那个按钮,那么在很多常规测试里,它其实能蒙对不少题。因为大部分真实场景里,最显眼的按钮往往恰好就是用户想要的那个。

这就好比一个从来没学过地理的学生去做选择题,如果他发现答案C出现的频率总是最高,那他每次都选C,说不定还能拿个及格分。这不是他真的懂了知识,这是他找到了一个统计学上的漏洞。

研究者们要堵住这个漏洞,用的方法叫**对比对构造**。

**minimal pair(最小对/对比对)**:两道题共享同一张截图和同一个参照物,唯一的区别是那个描述空间关系的关键词换了一个方向,导致正确答案从一个候选目标换到了另一个候选目标。

举个具体例子。同一张软件截图里有个叫"break debugger"的图标。第一道题问"点击break debugger右边的元素",第二道题问"点击break debugger左边的元素"。截图一模一样,问的问题只换了一个方向词,但正确答案完全不同,一个在右边一个在左边。

**如果一个模型不管方向词是什么,永远点同一个位置,那它在这两道题里必然一对一错,两道题合起来的得分永远是零。**

这个设计彻底堵死了"蒙对"的可能性,逼着模型必须真正理解"左"和"右"这两个词到底对应哪个物理位置。

如果不用这种对比对设计会怎样?那模型完全可以靠"点最中心、最大、最显眼的元素"这个懒办法拿到不错的分数,测试结果看起来光鲜,但根本反映不出模型是不是真的听懂了空间关系词。

七种最基本的空间关系,像小学生的基础题

这个基准测试一共设计了七种最基础的空间关系,研究者管它们叫"元素能力",因为这些关系是所有复杂GUI操作的最底层积木。

具体是这七种:左右方向(左边的按钮还是右边的按钮)、上下方向(上面的元素还是下面的元素)、包含关系(元素在面板里面还是外面)、对齐关系(是不是在同一行或同一列)、远近关系(哪个元素离参照物最近或最远)、列表序号(是列表的第一项还是第二项)、遮挡关系(元素是完全可见还是被弹窗部分挡住)。

这七种关系被分成三大类:方向类(左右上下)、拓扑类(包含)、布局类(对齐、远近、序号、遮挡)。

**这七种关系为什么是"最基础"的?**

因为再复杂的GUI指令,拆开来看基本都是这几种关系的组合。你说"点击工具栏里最左边那个按钮的上方图标",这句话其实就是包含关系加上左右方向加上上下方向的叠加。研究者的逻辑是,如果连这些最基础的单块积木都搭不稳,那更复杂的指令肯定也搭不好。

**这就像学开车之前先学倒车入库和侧方停车。**这两项练习看起来简单枯燥,跟实际市区开车的复杂场景差很远,但如果连车都停不好,上路遇到复杂情况必然更抓瞎。GUI-PRIMITIVES测的就是AI能不能先做好这些"简单枯燥"的入门科目。

一共有994道题,涵盖两种截图来源。一部分是真实桌面软件截图(290道题),来自一个叫UI-Vision的数据集,涉及网页、Mac系统、VS Code、Office等真实软件界面。另一部分是研究者自己设计生成的合成截图(704道题),因为像"包含关系"和"遮挡关系"这种题目,在真实软件截图里很难找到干净标注的样本,只能靠人工搭建可控场景来生成。

找了五个人来打分,结果人类几乎不出错

光有题目还不够,得知道这些题目本身出得靠不靠谱。

研究者找了五名标注员,独立审核了其中196道题目。每个人回答两个问题:这道题表述清楚吗、正确答案应该是哪个候选框。

结果显示,五个人对"题目是否表述清楚"这件事的一致程度极高,用统计学指标Fleiss kappa衡量,达到了0.94,属于"几乎完全一致"的水平。对"正确答案是哪个"这个问题的一致程度也有0.79,属于"高度一致"。

**Fleiss kappa(Fleiss卡帕系数)**:一种衡量多人打分是否一致的统计指标,数值范围从0到1,数值越接近1说明多人判断越吻合,排除了纯粹靠猜蒙对的可能性。

11道被大多数标注员判定为表述有问题的题目被剔除,剩下185道题作为"人类清洁核心集",人类在这套题目上的正确率是96.9%。

这个数字很关键,因为它相当于给这套考试划定了一个及格线的参照物。**如果人类都做不好这套题,那说明题目本身有问题;但如果人类做得很好,AI做不好,那问题一定出在AI身上。**结果就是,人类几乎全对,AI一塌糊涂。

十九个AI模型集体翻车

研究者测试了19个主流视觉语言模型,涵盖开源和商业闭源两大阵营,包括Claude系列、GPT系列、Gemini系列,以及Qwen、InternVL、Llama-Vision、Gemma等开源模型。

**最强的模型是Claude Opus 4.7,在清洁核心集上的正确率是32.4%。**

这跟人类的96.9%比起来,差了整整65个百分点。而且这不是某一个模型的偶然失误,四个最强的商业模型全都挤在24%到31%这个窄区间里,谁也没能突破这个天花板。

更有意思的是一个"以小博大"的现象。开源模型Qwen2.5-VL-7B只有70亿参数,能跑在一张普通显卡上,正确率是24.5%,而闭源商业模型Claude Haiku 4.5正确率是25.0%,两者几乎没有统计学意义上的差别。**模型规模的大小,在这道题上根本没起到决定性作用。**

这有点像考试成绩跟补习班学费没关系一样,一个花大钱上顶级私教班的学生,考出来的分数跟一个自学的学生几乎一样低,说明问题不在于砸了多少资源,而在于这门课本身教的方法有问题。

拆开来看,问题到底出在哪一步

七种空间关系里,有一种表现特别突出,叫列表序号。排名前五的模型(Claude系列、GPT-5、Qwen2.5-VL)在这项上的正确率达到0.80到0.83,远超作为基准参照线的0.50。

这个基准线怎么理解?

**因为每种关系都设计成了二选一的对比对形式,所以随便乱猜的期望正确率是0.50,这个数字被称为"两候选参照水平"。**

超过0.50说明模型真的在用逻辑判断,而不是瞎蒙。列表序号做得好,可能是因为数数这件事对语言模型来说本来就不难,找到列表边界之后,数第几项跟数数字一样简单。

但另外六种关系,情况就很惨了。左右方向、上下方向的正确率普遍在0.2到0.3左右,远低于随机蒙的基准线。而包含关系、遮挡关系、对齐关系、远近关系这四种,所有19个模型的成绩都低于0.50这个基准,一个不例外,包括那四个最强的商业模型。

这说明一件很反常的事:**在这四种关系上,模型的表现比瞎猜还差。**

这个数字太反常了,研究者必须找出背后真正的原因。他们做了一件很关键的诊断:把每一个模型的预测点击坐标,按落在哪个候选框里来分类。一种是落在正确目标框里,一种是落在错误干扰框里,一种是压根没落在任何一个候选框里,还有一种是模型没输出有效坐标。

**结果发现,60%到92%的预测坐标,压根就没落在两个候选框里的任何一个。**

这个发现彻底改变了对"模型表现比瞎猜还差"这件事的理解。不是模型分不清左和右,而是模型压根就没找准到底哪两个元素是候选目标,它点在了截图上完全不相关的第三个地方。

再进一步看,如果只统计那些确实落在了某个候选框里的预测,看它到底更偏向正确目标还是干扰项,结果是:左右方向、上下方向、远近关系、列表序号这四种关系,选中正确目标的比例达到0.82到0.90,说明模型只要找准了候选范围,判断方向词的能力其实还不错。但包含关系和遮挡关系这两种,选中正确目标的比例是0.548和0.554,跟随便蒙的0.50基本没差别。

**这个结果说明,问题的主体不是"模型看不懂空间关系词",而是"模型没能锁定正确的候选区域"。**

这好比让一个人在超市里找一样特定的商品,他压根没走到那个货架前面,你却在纠结他是不是分不清"左数第三个"和"右数第三个"。真正的问题是他连货架都没找对,后面的方向判断根本无从谈起。而在包含和遮挡这两类关系上,即便模型走到了正确的货架区域,它依然分不清哪个是里面哪个是外面,说明这两种关系上确实存在真正的理解缺陷。

拆开真假screenshot,发现问题更集中在真实场景

研究者还做了一个对比,把真实桌面截图和合成截图分开单独看。

在合成截图上,即便严格的"点进方框内"正确率不高,宽松一点的"点在目标附近"(目标对角线两倍范围内)正确率能到0.60到0.76。这说明合成截图上的错误,很多时候是模型瞄准了大方向,但落点稍微偏了一点,属于精细度不够,不是完全找错了对象。

但在真实的UI-Vision桌面截图上,情况完全不同。严格正确率对所有模型在所有关系上几乎都是零,就算放宽到"点在附近",正确率也只有6%到23%。候选区域的分类分析显示,真实截图上96%的预测坐标都落在了候选区域之外。

这个反差很说明问题:**真实软件的按钮往往又小又密集,跟合成截图那种刻意放大、间距明显的布局完全不是一个难度级别。**

这就像给一个新手司机练车,先在空旷停车场画好线练侧方停车,跟直接把他扔进上下班高峰期的市中心停车场,是完全不同的两种考验。真实世界的按钮小到几个像素,挤在一堆功能相似的图标里,模型的视觉定位能力在这种密度下几乎崩溃。

关联性验证:这个诊断测试真的有用吗

发现问题只是第一步,研究者还想验证一个更实际的问题:**这个精心设计的诊断测试,能不能预测模型在真实任务上的表现?**

他们拿10个模型,同时跑了GUI-PRIMITIVES和另一个业界标准基准ScreenSpot-Pro(专门测试高分辨率专业软件里的定位能力),然后看两者的分数是否相关。

结果是斯皮尔曼相关系数达到0.736,p值是0.015,说明这个相关性在统计学上是显著的,不太可能是偶然。而且这个相关性在真实截图子集和合成截图子集里分别验证,依然稳定存在。用留一法交叉验证(每次去掉一个模型重新算相关性)测试,结果的稳健区间是0.62到0.86,说明不是某一个特别极端的模型在拉高或拉低这个相关性。

**这意味着一件很实际的事:如果一个模型在这套基础空间关系测试上表现好,它在真实的专业软件操作里也更可能表现好。**

这就像一个学生在数学基础运算题上表现扎实,往往在需要复杂计算的应用题上也不会太差,因为基础运算是所有复杂题目的地基。反过来说,如果基础题都做不好,指望复杂应用题突然开窍,是不现实的。

三种补救方法:一个真管用,两个不管用

问题找到了,研究者接着测试了三种在不改变模型参数的前提下能不能改善表现的方法。

第一种叫Set-of-Mark(简称SoM),做法是在截图上的两个候选框位置直接画上编号标记,让模型只需要回答"选1号还是2号",而不用自己去猜坐标。

第二种叫思维链提示(CoT),做法是在指令前加一段引导文字,明确点出这是什么空间关系,让模型先做一步显式推理再给答案。

第三种叫激活值引导(activation steering),是一种更底层的技术,通过在模型内部的神经网络层里注入一个方向向量,直接调整模型的"思考方式"。

**结果只有第一种方法有效,而且效果惊人。**

给GPT-5打上标记之后,正确率从30%飙升到87%,提升了57个百分点。给开源模型OS-Atlas打标记,正确率从10%涨到52%。给Qwen2.5-VL打标记,从22%涨到57%。

思维链提示几乎没有效果,正确率只提升了0.5个百分点,统计上不显著。研究者观察到一个特别耐人寻味的细节:模型在推理文字里明明正确说出了"应该往右边找",但紧接着给出的坐标却还是错的。这说明模型知道该往哪个方向想,但没能把这个想法真正落实到具体的坐标点击上。激活值引导的提升也只有1.5个百分点,同样不显著。

**为什么只有SoM有效?因为它换了一种解决问题的方式,绕开了模型原本要自己找候选区域这个最大的坎。**

打个比方,如果考试题目是"请在这幅世界地图上找出巴黎的准确经纬度",这需要精确的空间定位能力。但如果换个问法,"这幅地图上标了1号和2号两个点,哪个是巴黎",这变成了一道识别题,难度完全不同。SoM本质上是把一道定位题变成了一道选择题,绕开了模型最不擅长的那部分,而不是真的修复了模型的空间理解缺陷。

研究者自己也很清楚这一点,他们特别强调这是一个"诊断用的理论上限",不是一个真正能部署使用的解决方案。因为现实世界里,AI并不会提前知道两个候选框在哪里,这个位置信息本身就是需要模型自己去找的东西,SoM相当于直接把答案的一半喂给了模型。

干扰实验:证明这套测试真的在测东西

为了证明这套基准真的在检测空间推理能力,而不是随便测出一些噪声,研究者设计了三个破坏性对照实验,专门用来验证测试的有效性。

第一个是纯文字对照:把截图换成一张空白画布,只留下文字指令。结果正确率从22%暴跌到6.5%,跌了15.5个百分点。这说明模型确实是在依赖截图内容做判断,没有截图它基本没法答对。

第二个是打乱截图:把正确的截图换成另一道题的截图(同类型但内容不同)。正确率跌到14.8%,跌了7.2个百分点。同样说明模型依赖的是这张特定截图的具体信息。

第三个是重度模糊化:把截图用高斯模糊处理,让细节完全看不清。这个的跌幅只有5.3个百分点,跌到16.7%,跌幅比前两个小很多,甚至没有达到研究者事先设定的十个百分点的显著性门槛。

**这三个对照实验放在一起看很有意思:模糊化的影响远小于抹掉截图或换错截图。**

这说明模型在做空间判断的时候,依赖的更多是整体的布局结构,比如"这里大概是个左侧边栏,那里大概是个顶部工具栏",而不是精细的文字识别或图标细节。就算字迹模糊看不清,只要大概轮廓还在,模型依然能凑出一部分答案。**这暗示了一个更深层的问题所在,很可能不是文字识别环节出了错,而是更早期的视觉编码或者跨模态信息融合环节出了问题。**

一个方向性的偏见:AI更喜欢往左看

研究者还发现了一个很有意思的系统性偏差。19个模型里有15个,在做"左边的元素"这类题目时,表现明显好于"右边的元素"这类题目,平均差距接近17个百分点。

**这个偏差背后很可能藏着一种训练数据里的布局习惯。**

在很多西方软件界面设计里,主要操作按钮往往习惯性地摆在左侧,比如返回按钮、主菜单、常用工具,都偏爱靠左摆放。如果模型的训练数据里充斥着这种布局倾向,它很可能学到了一种"往左边找准没错"的经验法则,而不是真正理解了"左"这个词在空间上到底意味着什么。

有意思的是,这个左偏问题在候选区域分类里也能验证到:预测坐标落在候选区域内的概率,当目标恰好在左边时是右边情况的2.7倍,说明模型不仅答案偏左,连"愿意去左边找"这个搜索行为本身都是偏左的。这跟包含关系、遮挡关系上表现出的方向理解缺失完全不同,属于另一种性质的偏差,一种源自训练数据统计规律的惯性,而不是理解能力的缺失。

写在后面

读到这篇论文最让我停下来想的,是那个候选区域分类的发现,60%到92%的预测坐标压根没落在两个候选框的任何一个里面。

在这之前我以为AI"点错按钮"这件事,最大的问题应该是分不清左右、分不清里外这种语义理解层面的错误。结果研究揪出来的真相是,绝大部分时候模型压根没在正确的地方附近点,它是完全瞄歪了,方向判断的问题反而是相对次要的部分。

这让我想起一个类比,可能有点跳跃,但确实是我读完之后的第一反应:这有点像我们平时批评一个人"说话没说到点上",但仔细一想,他可能压根没搞清楚讨论的是哪个问题,跑偏到另一个话题去了。方向感的问题,往往比表达能力的问题更根本,也更容易被误判成后者。

这篇论文里还有个细节我觉得特别值得单独说一说:SoM打上标记之后,Qwen2.5-VL的列表序号能力反而变差了,掉了32.4个百分点。因为这个模型原本已经能靠数数把列表序号题做对,给它加标记选择反而多了一道不必要的手续,把一件本来简单的事变复杂了。这提醒我,干预手段不是万能的补丁,用错场景反而可能帮倒忙。

这套基准现在覆盖的是英文、单次点击这类场景,还没延伸到拖拽操作、多语言界面、真实完整任务链路上。研究者自己也承认包含关系和遮挡关系这两类只能靠合成场景来测,因为真实软件截图里根本没有干净的标注数据能支撑这种测试。

问题是,如果连这两种最基础的空间关系都测不出真正的解决办法,未来那些真正复杂的、跨越多个步骤的电脑操作任务,AI又要靠什么来把按钮点对呢?

Q&A

Q1:GUI-PRIMITIVES基准测试是什么?

A:它是一个由994道题目组成的诊断工具,专门用来测试AI模型在图形界面操作中的七种基础空间理解能力,包括左右方向、上下方向、包含关系、对齐、远近、列表序号和遮挡关系。

Q2:为什么最强的AI模型在这个测试里表现这么差?

A:候选区域分析发现,60%到92%的预测坐标压根没落在正确目标或干扰项的候选框里,说明主要问题不是分不清方向词,而是模型没能先锁定该看哪个区域。

Q3:有没有办法能提升AI在这类任务上的表现?

A:给候选目标打上编号标记(Set-of-Mark方法)效果显著,能让GPT-5的正确率从30%提升到87%,但这本质上是绕开了定位难题而非真正修复了模型的空间理解能力,属于理论上限而非可部署方案。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
英国国王明确小儿子身份!哈里停用殿下头衔,为威廉继位化解隐患

英国国王明确小儿子身份!哈里停用殿下头衔,为威廉继位化解隐患

八八尚语
2026-09-08 09:42:15
新股上市第二天跳空大跌24%,首日进场的股民全部被套,无一幸免

新股上市第二天跳空大跌24%,首日进场的股民全部被套,无一幸免

财经智多星
2026-09-08 06:42:21
不拖船才是最明智选择!中国突然亮剑,马科斯正步立陶宛后尘

不拖船才是最明智选择!中国突然亮剑,马科斯正步立陶宛后尘

楠楠自语
2026-09-08 10:53:12
一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

旧史新谭
2026-09-07 18:40:37
谈判彻底崩了!

谈判彻底崩了!

安安说
2026-09-08 09:26:46
官宣!歼-10CE涂上击落“阵风”战绩标识

官宣!歼-10CE涂上击落“阵风”战绩标识

武器纵论
2026-09-07 21:57:28
小姨子暂住我家,洗完澡后总在客厅晃荡:姐夫,家里就咱俩你怕啥

小姨子暂住我家,洗完澡后总在客厅晃荡:姐夫,家里就咱俩你怕啥

千秋文化
2026-07-06 18:59:26
太懒散,踢得太差! 罗德里场边下吐槽瓦伦西亚,被镜头完整拍下

太懒散,踢得太差! 罗德里场边下吐槽瓦伦西亚,被镜头完整拍下

夜白侃球
2026-09-08 10:03:50
全国首例二十多岁的女留学生要起诉四岁男孩摸她臀部?女子揪衣领弄伤男童

全国首例二十多岁的女留学生要起诉四岁男孩摸她臀部?女子揪衣领弄伤男童

西楼知趣杂谈
2026-09-08 10:31:39
iPhone 18 Pro Max价格曝光 1万2起步顶配2万

iPhone 18 Pro Max价格曝光 1万2起步顶配2万

PChome电脑之家
2026-09-07 11:03:49
随着兹维列夫3-0,美网男单八强全部诞生:仅3大世界前十悍将在列

随着兹维列夫3-0,美网男单八强全部诞生:仅3大世界前十悍将在列

侧身凌空斩
2026-09-08 11:47:57
24岁百万吃播网红莹莹去世,最后一条视频说身体第一三天后人没了

24岁百万吃播网红莹莹去世,最后一条视频说身体第一三天后人没了

闻识
2026-09-07 13:39:23
2 0,郑钦文赢球不可怕,可怕的是赛后斯瓦泰克这番话,彻底破防

2 0,郑钦文赢球不可怕,可怕的是赛后斯瓦泰克这番话,彻底破防

暮雨清歌u
2026-09-08 10:50:34
CCTV5直播波多黎各VS中国女篮,苏群聊给宫鲁鸣道歉,杨毅谈李梦

CCTV5直播波多黎各VS中国女篮,苏群聊给宫鲁鸣道歉,杨毅谈李梦

体育大学僧
2026-09-08 12:09:26
CCTV5直播,中国女篮PK波多黎各队,2人成为胜负手,宫鲁鸣冲八强

CCTV5直播,中国女篮PK波多黎各队,2人成为胜负手,宫鲁鸣冲八强

体坛小快灵
2026-09-08 10:22:33
杨毅:女篮战意大利做出明显调整 最大的特点是果断出现空位不拒投

杨毅:女篮战意大利做出明显调整 最大的特点是果断出现空位不拒投

狼叔评论
2026-09-08 12:00:18
家属突发讣告!24岁女网红确认离世,出事三天前还在更新账号

家属突发讣告!24岁女网红确认离世,出事三天前还在更新账号

南方都市报
2026-09-08 08:00:08
女篮世界杯12强及资格赛对阵出炉,中国vs波多黎各直播预告

女篮世界杯12强及资格赛对阵出炉,中国vs波多黎各直播预告

真理是我亲戚
2026-09-08 10:54:40
世界冠军夏煊泽,被免职

世界冠军夏煊泽,被免职

南方都市报
2026-09-08 11:21:40
三甲科主任因病去世,年仅54岁

三甲科主任因病去世,年仅54岁

医学界
2026-09-08 07:33:53
2026-09-08 13:40:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9772文章数 568关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

德国极右翼赢得历史性大胜感谢马斯克 欧洲或连番变天

头条要闻

德国极右翼赢得历史性大胜感谢马斯克 欧洲或连番变天

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

教育
时尚
亲子
艺术
军事航空

教育要闻

北京国际学校推荐看排名?还是“常春藤”“G5”?主流学习解析

白露食白——露从今夜白,味从此时鲜

亲子要闻

2026年全国托育服务宣传月启动仪式在石家庄举办

艺术要闻

597米!中国第三、世界第六高楼,新效果图曝光!

军事要闻

伊朗锡里克婚礼遭袭现场发现美武器残骸

无障碍浏览 进入关怀版