网易首页 > 网易号 > 正文 申请入驻

苹果教AI"看视频先想后答":不用画图,也能预判未来

0
分享至


你有没有过这种经历:正在看一场球赛直播,球员刚刚起跳,你脑子里已经"看到"了他大概会往哪个方向扣篮。你不需要真的在脑海里画出一张未来的画面,你只是"感觉"到了接下来会发生什么。

这种能力,对人类来说毫不费力,但对AI来说,是一道相当棘手的题。

苹果的研究团队最近发了一篇论文,专门琢磨这件事:怎么让多模态大模型(能同时理解文字和图像视频的AI系统)在看一段没播完的视频时,提前"预感"接下来会发生什么,而且还要做到既快又准。这篇论文的名字叫《Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning》,翻译过来大致是"超越视觉思维链:为主动式视频推理内化视觉思考"。

听起来有点绕,我们慢慢拆开讲。

先搞清楚:AI要解决的是个什么问题

先说说这类任务到底是什么。研究者把它叫做"主动式视频推理",具体分成两种情况。

第一种叫早期事件预测

*早期事件预测:在一个动作还没做完的时候,就要认出这是个什么动作。比如一个人刚抬起手准备倒水,视频还没播到"水倒出来"那一刻,AI就得说出"这是倒水"这个答案。*

第二种叫下一事件预测

*下一事件预测:预测接下来即将发生、但目前画面里压根还没出现的动作。比如看到一个人正在拿杯子,AI要猜出他接下来大概率会去倒水,而这个倒水动作在当前画面里根本还没开始。*

这两种任务和我们平常说的"看完一整段视频再回答问题"完全不是一回事。普通的视频问答,证据都摆在那儿了,AI只需要老老实实"看完再说"。但主动式推理不一样,它要求AI在信息不全的情况下,靠已经看到的这一小段,去推断没看到的部分。这就好比让你看一部电影的前十分钟,然后回答"男主角接下来会不会和女主角吵架"——你手里的线索是不完整的,你得靠经验和逻辑去补全。

那现在的AI是怎么处理这类问题的?主流思路是"思维链"

*思维链(Chain-of-Thought,简称CoT):让AI在给出最终答案之前,先生成一系列中间推理步骤,就像人做数学题时先写演算过程再写答案。*

大多数模型用的是"文字版"思维链,也就是模型先在心里(其实是在生成的文本里)嘀咕几句话,分析一下情况,然后再给出答案。这个办法在很多任务上确实管用,但放到视频推理里,问题就露出来了:语言天生不擅长精确描述运动、位置、物体形态这些视觉信息。你让AI用文字描述"球员起跳后手臂会怎么摆动,篮筐的角度大概是多少",这种描述往往又啰嗦又不准,甚至有时候模型会说一堆和真实画面毫无关系的"幻觉"内容。

于是有人想出了另一个办法:既然文字讲不清楚,那就让AI直接"画"出来。这就是所谓的"视觉思维链"

*视觉思维链(Visual CoT):AI在回答问题前,先生成一张或几张representing推理过程的图像(比如画出未来可能发生的场景),然后再基于这些图像给出最终答案。*

这个思路听起来挺聪明,毕竟"一图胜千言"。论文里提到的一个代表性方法叫Zebra-CoT,它的做法是:模型先想象并画出一张"接下来会发生什么"的画面,然后把这张画面重新编码成AI能理解的信息,再据此生成文字答案。这套流程在空间推理、机器人操作规划等任务上确实拿到了不错的成绩。

但问题来了:画一张图,可不是免费的。

画图的代价:慢了5到6倍,还不一定值

研究者做了一个非常扎实的对照实验,专门衡量"画图预判"这件事到底值不值。

他们拿Zebra-CoT这套视觉思维链方案,和一个只做文字回答、不画图的基础模型(叫Answer-Only SFT,即"只用标准答案微调")放在同一起跑线上比较。

*Answer-Only SFT:一种最朴素的训练方式,直接把观察到的视频片段和问题丢给模型,让它输出答案文字,中间不经过任何额外的视觉生成步骤。*

结果很有意思。在早期事件预测任务上,视觉思维链确实带来了提升,四个评价指标全面超过了纯文字方案,其中CIDEr(一种衡量生成文本质量的指标)提升了17.9%。这说明"画一张未来的画面"确实能帮上忙,至少在动作已经开始、只是还没结束的情况下是这样。

可是到了下一事件预测任务,情况就变了。那里要预测的事件压根还没开始,视觉思维链的效果变得可有可无,甚至在三个指标上还出现了轻微下降,只有METEOR指标涨了4.3%。

更要命的是速度。研究者用端到端的实际运行时间来衡量效率,而不是简单数生成了多少个文字token,因为画图这件事牵涉到解码出一张图片、再把图片重新编码成模型能处理的向量,这些开销根本不会体现在"生成了多少字"这种统计里。测出来的结果是,视觉思维链让早期事件预测的平均延迟涨到了原来的6.2倍,下一事件预测涨到了5倍。

这就好比你问朋友"这场比赛谁会赢",他非要先跑去买一份实体报纸、翻到体育版、画一张详细的赛况示意图,再根据这张图告诉你答案。等他画完图,比赛可能已经打完了。如果不这么做,直接凭经验脱口而出,虽然可能少了几分"依据感",但至少能在比赛还没结束时给出预判——而这正是"主动式"任务最看重的东西:时机。

研究者还做了一个特别巧妙的诊断实验:如果给模型的不是它自己画出来的(可能不准确的)未来画面,而是真实发生的未来画面(也就是"作弊"用了正确答案对应的真实帧),结果会怎样?

答案是:所有指标全面暴涨。早期事件预测的ROUGE-L指标涨了21.6%,下一事件预测涨了6.8%。

*ROUGE-L:一种常用于评估自动生成文本质量的指标,衡量生成的答案和标准答案之间在词序上的重合程度。*

这个结果揭示了一个关键的事实:未来的视觉信息本身是有用的,问题不在于"要不要参考未来",而在于AI自己画出来的那张"未来的画"到底靠不靠谱。它画得不准,就等于给自己挖了个坑,反而可能误导后面的判断。研究者管这个叫"取决于生成未来状态的保真度"——翻译过来就是,如果你的想象力不靠谱,靠它来推理反而会拖后腿。

这个发现直接引出了整篇论文的核心问题:未来的视觉信息确实有价值,但把它变成一张真实的图片再重新处理一遍,这个过程又贵又不一定准。有没有办法只要"未来信息的价值",不要"画图和读图"的成本?

核心方案:把"想象"内化到脑子里,而不是画在纸上

苹果团队给出的答案叫Internalized Visual Thinking

*内化视觉思考(Internalized Visual Thinking,简称IVT):一种后训练框架,让模型在训练阶段学习预测未来画面的隐藏表示(不是真实图片,而是一串数字向量),但在实际使用时不再生成任何图像,直接给出文字答案。*

这里最关键的设计思路是:训练的时候让模型"脑补"未来,但推理的时候不要求它把脑补的画面画出来。

具体怎么操作?论文用一个简单的公式说明了这件事。假设模型看到了一段视频的前半部分,还有一个问题要回答。标准的训练方式只会计算一个损失,衡量模型给出的文字答案和标准答案之间的差距。IVT额外加了一项:让模型同时预测未来几帧画面的"潜在表示"

*潜在表示(latent representation):不是一张能直接看的图片,而是经过某个编码器处理后得到的一串抽象数字向量,包含了图像的关键信息,但不是像素本身。*

打个比方:如果画一张完整的图片相当于"把一整段乐曲完整地演奏一遍",那预测潜在表示更像是"心里默唱这段旋律的骨架,记住它的节奏和走向,但不发出声音"。你依然在"想",只是没有把这个想法转成外部可感知的完整作品。而且默唱的过程比真实演奏快得多,也不需要乐器。如果不这么做,非要每次都完整演奏一遍才能继续往下想,那整个思考过程就会被表演本身拖慢。

训练的时候,模型的损失函数由两部分组成:一部分是常规的文字生成损失,另一部分是预测未来潜在表示的损失,两者加权相加(论文里权重设成1)。这样训练完之后,模型的参数里已经"吸收"了大量关于画面如何演变、物体如何转移、动作如何延续的知识。

关键的一步在这里:等到真正要用这个模型回答问题的时候,IVT走的是和"只用标准答案微调"完全一样的推理路径,直接从观察到的视频片段生成文字答案,不再多走一步"预测未来潜在表示"的计算,更不会去解码出一张真实图片。

这就意味着IVT在推理阶段的计算图,和那个最朴素、最快的Answer-Only SFT基本一样。训练时它多想了很多,但用的时候,它一步到位。

预测什么样的"未来画面"最管用

内化的思路定下来了,但具体要往模型脑子里塞什么样的未来表示,这里面还有大量讲究。研究者试了四种不同的目标表示。

第一种叫Flux-VAE潜变量

*Flux-VAE:一种图像生成模型中用来压缩图片信息的编码器,它把图像转换成的潜变量保留了大量细节和空间结构信息,主要是为了后续能把图片准确还原出来。*

第二种是DINOv2特征

*DINOv2:一种自监督视觉特征提取模型,它抓取的是图像里更高层次的语义概念,比如"这是一只猫"这种抽象信息,而不太关心猫的每一根毛发长什么样。*

第三第四种都基于SigLIP2

*SigLIP2:一种视觉-语言联合编码模型,论文里测试了它的两个变体,一个是"自适应"版本,编码器的参数会随着训练一起更新;另一个是"冻结"版本,编码器参数固定不变。*

实验结果显示,预测Flux-VAE潜变量的效果是四种方案里最强、最稳定的,在早期事件和下一事件预测两类任务上全面领先。DINOv2也有提升效果,但幅度和稳定性都比不上Flux-VAE。自适应版本的SigLIP2普遍比冻结版本表现更好。

这个结果背后传递的信息值得琢磨一下:不是随便找个"辅助视觉目标"塞进训练过程就管用,关键要看这个目标表示本身是不是暴露了足够多的、和场景演变有关的结构信息。DINOv2那种偏向语义抽象的特征("这是一只猫")固然有用,但对于"这只猫接下来会往哪边跑""它的爪子会怎么落地"这类细粒度的动态预测,保留了更多空间细节的Flux-VAE明显更对味。

这就好比让一个学生提前预习明天要考的内容。如果只告诉他"明天考的是关于猫的知识"(相当于语义特征),他确实能有点准备,但比起把整份考试大纲的具体条目都给他看一遍(相当于保留细节的表示),后者能让他准备得更精准、更充分。如果预习材料只给一个模糊的主题词,学生大概能猜个方向,但具体到哪道题、考哪个细节,他是抓瞎的。

训练数据怎么配比,是个大问题

确定了预测什么之后,下一个问题是:训练过程中,应该让模型花多少精力去练"预测未来"这件事,又花多少精力去练"回答问题"这件事?

研究者对比了三种数据配比方案:1比1、3比1、5比1,数字越大意味着分配给"回答问题"这个任务的训练样本越多,相应地留给"预测未来"的样本就越少。

结果出乎不少人的预料。那些偏重"回答问题"的配比(3比1和5比1)在训练刚开始的时候表现更好,进步很快。但训练进行到大约12000到18000步之后,这些配比就开始停滞不前,甚至掉头下降。反倒是最均衡的1比1配比,一开始表现落后,但一直在稳步上升,最终在20000步的时候,四个指标全部超过其他两种配比,拿到了整场比赛里最好的成绩。

这个现象说明了什么?说明预测未来这件事,不能被当成一个"偶尔调味"的辅助任务。如果对它的训练强度不够,那个"预测未来"的能力就会在持续的答题训练中被慢慢覆盖、稀释掉,最终对下游推理起不到什么帮助。

这就好比健身,如果你每周只抽10分钟练核心力量,剩下的时间全在跑步,短期内你确实跑得更快了,但核心力量始终没能真正建立起来,跑到后期反而容易受伤、掉速度。只有把核心训练和有氧训练放在同等重要的位置上,长期坚持下来,才能看到综合能力的提升。如果不坚持给核心力量足够的训练量,那这项能力永远只是个摆设,遇到需要它发挥作用的场合就顶不上去。

基于这个发现,研究团队在后续所有实验里都统一采用了1比1的均衡配比。

怎么"教"模型预测未来:两种不同的教法

定好了要预测什么、按什么比例训练,接下来要解决"怎么教"的问题。论文比较了两种预测目标的训练方式。

第一种叫直接特征回归

*直接特征回归:让模型直接预测出目标表示的具体数值,用均方误差衡量预测值和真实值之间的差距,这是最直接、最朴素的监督方式。*

第二种叫矫正流匹配

*矫正流匹配(Rectified-Flow Matching):一种源自扩散模型的训练技巧,不直接预测目标本身,而是让模型学习一个"速度场",也就是从一个随机噪声逐步演化到目标表示所需要走的路径方向。*

实验发现,这两种训练方式谁更好,取决于你预测的是什么类型的目标。对于DINOv2这种语义特征,直接回归的效果明显更好,四个指标全面领先。而对于Flux-VAE潜变量,两种方式的差距就小得多,直接回归在大部分训练阶段领先,但到了训练末期,矫正流匹配在个别指标上反而略微反超。

这里有个挺值得说一说的细节。论文提到,虽然它们用的基础模型BAGEL原本在生成图像的时候用的就是矫正流匹配这套方法,但把这个方法直接搬来预测未来的潜在表示,效果并不总是最优的。直接回归这种更简单的方式,在很多情况下反而表现相当,甚至更好。

这说明一个道理:某个技术在它原本的用途里表现出色,不代表把它挪到一个新场景里依然是最佳选择。真正决定用哪种训练方式的,是目标表示本身的特性,比如它的数值范围、分布形态、维度大小,而不是"这个方法在别的地方好用"这种经验之谈。

训练节奏:一步到位,还是分两步走

接下来,研究者琢磨了另一个问题:预测未来这件事,应该和回答问题这件事同步训练,还是分成两个独立阶段,先专门练预测未来,再专门练回答问题?

他们对比了三种做法。第一种是只练回答问题的基础方案。第二种叫两阶段训练,先花10000步专门练"预测未来",然后完全切换到只练"回答问题"的模式,继续训练。第三种是联合训练,让两个目标从头到尾同步进行。

结果非常清楚:联合训练在所有指标上都拿到了最好的成绩,比基础方案的ROUGE-L提升了12.6%,CIDEr提升了26.3%。而两阶段训练反而比什么都不做(基础方案)还要差,所有指标全面下滑,ROUGE-L掉了6.5%。

这个结果相当反直觉。你可能会觉得,先打好"预测未来"的基础,再去专攻"回答问题",听起来是个很合理的学习顺序,就像先学走路再学跑步。但实验数据推翻了这个直觉:一旦进入第二阶段的"专攻"训练,模型好像把第一阶段辛苦学到的东西给忘掉了大半,最后甚至比完全没学过还差。

这其实揭示了一个很朴素但容易被忽视的道理:如果两种能力要互相配合发挥作用,那么训练它们的过程也得是配合进行的,不能指望先各自练好再拼装到一起。就像学一门乐器合奏,如果吉他手和鼓手分别关起门来单练一个月,最后拼到一起,配合度往往还不如从第一天就一起排练来得好。分开练习各自都能精进技术,但两者之间的呼应关系,只有在同步训练里才会真正建立起来。如果不这样同步训练,那"预测未来"学到的东西,很可能就是一堆和"回答问题"这个最终目标脱节的知识,派不上用场。

模型内部结构:共享脑子,还是分开思考

最后一个关键设计选择,是关于模型内部的架构安排。研究者比较了两种结构。

第一种叫Dense设计

*Dense(密集)架构:模型处理"理解型"信息和"预测型"信息时,用的是完全同一套解码器参数,两种任务的训练信号会直接一起更新这套共享参数。*

第二种叫MoE设计

*MoE(Mixture-of-Experts,混合专家)架构:模型内部准备了两套不同的前馈网络参数,理解类信息交给"理解专家"处理,预测未来的信息交给"预测专家"处理,两者只在其余部分共享计算资源,专家的选择是按信息类型直接指定的,不是靠一个学出来的路由器动态决定。*

研究者还测试了不同的"预测视野"

*预测视野(Prediction Horizon):模型需要往未来预测多少帧画面。比如预测视野等于1,就是只预测未来1秒后的画面;等于3,就是要同时预测未来1秒、2秒、3秒这三个时间点的画面。*

结果显示,两种架构在所有预测视野下都比基础方案表现更好,但各有各的脾气。在预测视野较短的情况下(只预测未来1到2秒的画面),共享参数的Dense架构明显更胜一筹,比如在预测视野为2的时候,Dense拿到37.4的ROUGE-L,而MoE只有33.8。但随着预测视野拉长,Dense的表现开始走下坡路,而MoE反而表现得更平稳,大约在预测视野为3的时候达到自己的最佳状态,而且视野从3拉到4变化也不大。

这个规律说明,当你要预测的未来足够"近"、足够确定的时候,让预测任务和回答任务共用一套大脑,信号传递得更直接,效果更好。但一旦要预测得更远,未来的不确定性变大,把预测任务和回答任务绑得太紧,反而可能把一些不那么靠谱的信号硬灌进语言生成的通路里,拖累最终表现。这时候把两条通路适当隔开,反而能减少这种"噪音干扰"。

这就好比一个团队里,如果任务目标非常明确、时间紧迫(比如"下一秒该做什么"),让所有人共用一份信息、协同决策效率最高。但如果要规划的是一个相对模糊、跨度更长的目标(比如"接下来几天团队方向如何调整"),让专门的人负责专门的模块,反而能减少互相干扰,各自把自己那块想清楚。如果不做这个区分,硬要一套人马应对所有时间跨度的决策,短期任务或许还行,长期规划很容易变得混乱。

真正的成绩单:六个测试场景全面告捷

把前面所有的设计决策敲定之后,研究团队在三个大规模数据集上做了完整测试:Ego-Exo4D、Ego4D、EPIC-KITCHENS-100

*Ego-Exo4D、Ego4D、EPIC-KITCHENS-100:三个大规模第一人称视角视频数据集,记录了大量日常活动,比如做饭、修东西、运动等,常被用来研究人类行为理解和预测。*

每个数据集都测试了早期事件预测和下一事件预测两类任务,总共构成六个评测场景。

对比的对象包括几个开源视频大模型作为参照基准,比如LLaVA-NeXT-Video、VideoLLaMA3、Qwen2.5-VL、Qwen3-VL,再加上论文自己搭建的几个受控对比方案:只用标准答案训练的基础方案、文字思维链方案、视觉思维链方案,以及IVT本身。

最终结果是,IVT在全部六个测试场景里,每一个场景的每一个指标,都超过了只用文字训练的基础方案。这是一个相当干净、没有例外的胜利。

跟视觉思维链比,情况稍微复杂一点。IVT在六个场景里的四个场景中表现更好,而且在全部三个下一事件预测的场景里都获胜了。视觉思维链只在两个早期事件预测场景上略胜一筹,分别在Ego4D和EPIC-KITCHENS-100上超出IVT约1.2到1.3个ROUGE-L点。

放在下一事件预测这个更难的任务上看,差距相当明显。IVT在三个数据集上的平均ROUGE-L是49.7,而视觉思维链只有45.9,差了将近4个点。这符合前面观察1里提到的那个规律:视觉思维链在"未来事件根本还没开始"的情况下,画出来的那张想象图很难真正靠谱,反而是内化在模型参数里的预判能力更管用。

跟外部的通用大模型比,IVT在7B这个参数规模量级上具备了竞争力,不过还是稍稍落后于规模更大的Qwen3-VL-8B。这也提示我们,IVT这套方法本身并没有让模型变得"无限强大",它解决的是效率和准确度之间的权衡问题,不是凭空创造出超越模型规模天花板的能力。

速度方面的对比更是直观。IVT的推理路径和最朴素的基础方案几乎一致,平均延迟维持在1.2秒左右,而视觉思维链平均要花6.5秒以上,慢了超过5倍。在极端情况下(P95延迟,也就是最慢的5%的样本),视觉思维链甚至要花将近8秒,IVT只要不到2秒。

对于那些真正需要"在事情发生前给出预判"的场景来说,这个速度差距不是锦上添花,而是决定这套系统能不能真正落地的门槛。想象一下自动驾驶系统需要判断"前方行人接下来是否会突然横穿马路",如果这个判断要花6秒才能算出来,那这套系统压根没有实用价值,行人可能早就走过去了或者出事了。

换个场景考验一下:没见过的数据集,行不行

到这里,研究团队还留了一手,专门测试了一下"举一反三"的能力。他们把Charades这个数据集完全排除在训练数据之外,直接拿在Ego-Exo4D上训练好的模型去测试。

*Charades:一个记录人们在室内进行各种日常活动的视频数据集,常用于动作识别和理解任务。*

这个测试相当苛刻,因为Charades和训练用的Ego-Exo4D在画面内容和任务形式上都有明显差异,Ego-Exo4D是开放式的文字描述任务,而Charades要求从多个选项里选出正确答案。这意味着模型不仅要面对全新的视觉场景,还要在完全没见过的答题格式上保持不出错。

结果是,IVT依然拿到了在所有受控对比方案里最好的成绩,准确率达到73.2%,超过了基础方案的71.7%和视觉思维链的58.2%(视觉思维链在这个跨域测试里掉得特别惨)。而且这个优势在不同的预测视野设置下都保持稳定。

这个结果给了一个额外的信心:IVT训练出来的那种"预判未来"的能力,不是死记硬背某个数据集里的具体场景规律,而是真的学到了一些更通用的、关于视觉动态变化的知识,换个陌生场景依然能派上用场。

写在后面

读完这篇论文,最触动我的一点是那个"用真实未来帧替代生成帧"的诊断实验。研究者没有满足于"视觉思维链效果一般"这个表面结论,而是硬生生把答案先泄露给模型,看看模型到底能不能用好这份"作弊"信息。结果发现能,而且用得很好。这说明视觉思维链的失败不是"未来信息没用"这个假设的失败,而是"生成未来信息的能力不够"这个具体环节的失败。这种拆解问题的方式,值得在做任何"为什么方法A不如方法B"的分析时借鉴,别急着否定整个思路,先看看是不是某个具体齿轮卡住了。

另一个让我意外的地方是两阶段训练的失败。直觉上"先打基础再精修"是很多人做事的默认策略,但这篇论文用扎实的数字告诉你,至少在这个场景下,分阶段训练比完全不做预测训练还差。这多少提醒我们,某些看似合理的"分步走"策略,在特定任务结构下可能反而是有害的,值得多留一分警惕,别把直觉当成必然正确的经验。

论文里没有细谈的一个问题是,如果预测视野继续拉长到几十秒甚至几分钟,这套内化预判的思路还能不能撑住?毕竟越往远处预测,不确定性会指数级增长,那时候模型内部藏着的这份"预感",到底还剩多少含金量,这个问题留给了未来的研究者。

Q&A

Q1:Internalized Visual Thinking(IVT)是什么?

A:IVT是苹果团队提出的一种后训练框架,让多模态大模型在训练阶段学习预测未来视频帧的潜在表示,但在实际推理时不需要真正生成图像,直接输出文字答案,从而兼顾预判能力和响应速度。

Q2:IVT和视觉思维链(Visual CoT)相比有什么优势?

A:IVT在六个测试场景中全面超过纯文字训练方案,并在四个场景中优于视觉思维链,尤其在下一事件预测任务上表现更好,同时推理速度比视觉思维链快5倍以上,避免了生成和重新编码图片带来的延迟。

Q3:为什么视觉思维链在预测还没发生的事件时效果不好?

A:因为视觉思维链需要模型自己"画出"未来画面,如果画得不准确,反而会误导后续判断。实验显示,用真实的未来帧替代模型生成的帧后,效果大幅提升,说明问题出在生成质量上,不是未来信息本身没有价值。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国家一级女演员陈丽云被逮捕!

国家一级女演员陈丽云被逮捕!

许三岁
2026-03-28 09:24:30
75年贺龙追悼会,周总理审阅悼词后改了一句话,毛主席批示:同意

75年贺龙追悼会,周总理审阅悼词后改了一句话,毛主席批示:同意

大运河时空
2026-09-08 08:10:03
小米米家智能鱼缸2 Pro发售:31L容量,649元

小米米家智能鱼缸2 Pro发售:31L容量,649元

IT之家
2026-09-07 08:22:09
莎拉含泪投案自首!内部叛徒泄露行踪,阿基诺家族突然变脸捅刀

莎拉含泪投案自首!内部叛徒泄露行踪,阿基诺家族突然变脸捅刀

芳芳历史烩
2026-09-08 00:54:38
军事 | 为了军援乌克兰,爱沙尼亚白白被骗7000万欧元,骗子在印度还是意大利?

军事 | 为了军援乌克兰,爱沙尼亚白白被骗7000万欧元,骗子在印度还是意大利?

新民周刊
2026-09-07 09:12:55
33万电车两年亏掉21万!车主含泪自述:我买的不是车,是电动爹

33万电车两年亏掉21万!车主含泪自述:我买的不是车,是电动爹

民间胡扯老哥
2026-09-07 07:27:01
在长沙,工资就是一个巨大的3500

在长沙,工资就是一个巨大的3500

一条要飞跃的咸鱼
2026-08-28 08:22:02
China GT赛场燃起大火!车手49秒火海救人,吴彦祖:赛事方太丢人

China GT赛场燃起大火!车手49秒火海救人,吴彦祖:赛事方太丢人

娱圈办事处
2026-09-07 18:45:22
一位日本兵回忆:我们强迫中国女人在尸体旁跳舞,画下了一张丑恶的画

一位日本兵回忆:我们强迫中国女人在尸体旁跳舞,画下了一张丑恶的画

千秋文化
2026-09-07 20:20:56
美乌密谈结束,特朗普和平方案获三方认可,俄罗斯要和美国谈大单

美乌密谈结束,特朗普和平方案获三方认可,俄罗斯要和美国谈大单

邱震海
2026-09-07 20:20:03
郭德纲演出案罚没63.56万,相当于武汉文旅此前全年罚没收入的一半

郭德纲演出案罚没63.56万,相当于武汉文旅此前全年罚没收入的一半

马小白
2026-09-08 09:39:51
经济学家马光远:根据国际经验,房地产再回到上一轮高点需要10年

经济学家马光远:根据国际经验,房地产再回到上一轮高点需要10年

史之铭
2026-08-22 18:13:05
中老年人多久吃一次他达拉非最合适?牢记 “2 种方案 + 3 个关键”

中老年人多久吃一次他达拉非最合适?牢记 “2 种方案 + 3 个关键”

阿兵科普
2026-08-27 22:20:39
特朗普斡旋俄乌失败,俄军日损失超1500人

特朗普斡旋俄乌失败,俄军日损失超1500人

名人苟或
2026-09-07 16:00:21
成龙确诊ADHD,粉丝心疼极了

成龙确诊ADHD,粉丝心疼极了

大爱三湘
2026-09-05 22:24:19
事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

阿讯说天下
2026-08-30 06:10:34
罗德里撞翻埃里克后嘀咕:不是哥们儿,这他*也太倒霉了

罗德里撞翻埃里克后嘀咕:不是哥们儿,这他*也太倒霉了

懂球帝
2026-09-07 15:28:14
60~70岁老人,这12条占八条福人,占10条,牛人,全占堪比活神仙

60~70岁老人,这12条占八条福人,占10条,牛人,全占堪比活神仙

暖风吹过竹林
2026-09-08 09:53:29
郑钦文美网逆转,1亿代言费保住了!

郑钦文美网逆转,1亿代言费保住了!

乡野小珥
2026-09-06 07:12:19
北京49岁岳母自述:从前并不觉得世上有天生坏种,直到遇到了他

北京49岁岳母自述:从前并不觉得世上有天生坏种,直到遇到了他

温情邮局
2025-05-12 15:59:16
2026-09-08 11:48:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9772文章数 568关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

新加坡舆论场出现歧视印度裔言论 李显龙、黄循财发声

头条要闻

新加坡舆论场出现歧视印度裔言论 李显龙、黄循财发声

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

数码
时尚
亲子
房产
军事航空

数码要闻

英特尔High-NA EUV晶圆处理量突破百万片,超越其他厂商总和

白露食白——露从今夜白,味从此时鲜

亲子要闻

手足口病进入高发期,这些症状家长别忽视

房产要闻

真快啊!海口这个超级城更,又有大动作!

军事要闻

伊朗锡里克婚礼遭袭现场发现美武器残骸

无障碍浏览 进入关怀版