网易首页 > 网易号 > 正文 申请入驻

大模型如何自我进化?从闭环机制到反直觉挑战

0
分享至


导语

当大模型逐渐从“接受训练”走向“自己训练自己”,AI的进化机制也正在发生变化。近日,arXiv一篇百页综述系统梳理了大模型自我提升的完整闭环:从数据获取、数据筛选,到模型优化、推理精炼,再由自主评估驱动下一轮迭代。但这条通往“自我进化”的道路并非只意味着能力增长——模型崩溃、奖励作弊、自我偏好和对齐失效等问题,都可能让“越自我改进,反而越偏离目标”成为现实。当AI开始自己决定学什么、如何评价自己以及如何改进自己,我们究竟该如何约束这个不断自我重写的系统?

关键词:大语言自指、大模型、自我改进、自我评估



论文题目:Self-Improvement of Large Language Models: A Technical Overview and Future Outlook 论文地址:https://arxiv.org/abs/2603.25681 发表时间:2026年3月26日 发表期刊:arXiv

1. 大模型自我提升的闭环四步迭代

随着大语言模型的不断进步,仅依靠人类监督来提升模型正变得日益昂贵,且在可扩展性上面临局限。当模型在某些领域的能力逐渐逼近人类专家水平时,人类反馈能够提供的有效信息也可能随之减少。与此同时,模型自主决策和执行复杂动作的能力不断增强,这自然催生了让模型开发过程中的各个组件能够逐步实现自我提升的需求,即模型能够自主生成数据、评估输出结果,并迭代地优化自身能力。


图1:自我改进系统的四个闭环生命周期

论文将这一过程概括为一个由四个紧密耦合的环节组成的闭环:数据获取、数据筛选、模型优化和推理精炼,此外还包含自主评估层(图1)。在这一框架内,模型在其中承担越来越多的主动角色:获取或生成数据、筛选有效信号、更新自身参数,并在推理阶段进一步优化输出;自主评估则持续监测模型能力的变化,并将评估结果反馈到后续的改进过程中。

如果把这一闭环看作一条完整的“自我进化流水线,那么它首先需要解决的问题就是:模型从哪里获得用于下一轮学习的数据?

1.1 数据获取:为自我提升提供“原材料”

数据收集和生成是自我提升生命周期的起点。与传统训练主要依赖人工整理的数据集不同,自我提升系统需要让模型主动发现、获取甚至创造用于自身演化的数据。论文将这一过程概括为三种主要路径:

  1. 静态收集 (Static Curation): 从外部固定数据源中发现和收集高质量数据。

  2. 环境交互 (Environmental Interaction): 模型通过与外部环境(如网页浏览、代码执行器、工具调用)互动来探索并获取新数据。

  3. 合成生成 (Synthetic Generation): 模型在内部生成新数据,具体方式包括基于提示(Prompt-based)、基于转换(Transformation-based)以及基于交互(Interaction-based)的生成。


图2:数据收集的三个方式

但“获得更多数据”并不意味着“获得更多有效信息”。随着数据规模不断扩大,系统还需要判断哪些数据真正值得用于下一轮学习。因此,自我提升的下一个环节便从数据获取转向数据筛选

1.2 数据筛选:从数据消费者到数据策展人

数据筛选的目标,是从获取的大量候选数据中识别出质量更高、也更符合模型当前学习阶段的数据点。换言之,自我提升系统不再只是被动消费数据,而是开始主动决定“什么值得学习”。

这一转变意味着,数据不再只是被不断累积,而需要根据模型当前的能力状态进行评估和精炼,使训练分布能够随着模型能力的变化而动态调整。


图3:数据筛选的两种方式和各自的步骤

围绕这一目标,论文将数据筛选方法进一步分为指标引导评分(Metric-Guided Scoring)自适应筛选(Adaptive Selection)两类。

图3左边的指标引导评分,其核心思想是使用模型自身产生的信号(如损失、困惑度、不确定性或外部评估器的得分)来替代固定的人类启发式规则,对候选数据进行评分和排序。具体又可以分为单次筛选和迭代筛选。

相比之下,图3右侧的自适应筛选进一步将“如何选择数据”本身变成一个可以学习的问题。它引入了一个可学习的筛选器,将数据筛选本身变成一个参数化的、可学习的任务,如使用强化学习或双层优化。具体步骤为:确定筛选单元,在当前模型状态下计算效用(Utility)信号,再将效用信号转化为采样策略的调整,如通过监督更新、基于强化学习的更新、学习到的重加权或双层优化方法,据此重塑有效的训练分布,最后评估筛选器与模型的耦合后表征筛选器与主模型在训练期间如何相互作用。论不过,目前的数据筛选仍然普遍依赖独立于主模型的筛选器。如何让主模型在没有外部筛选器的情况下,自主判断哪些训练数据对自身最有价值,仍然是实现完全自主学习的重要问题。

除了筛选机制本身,论文还根据数据选择所追求的目标,将筛选策略概括为两种类型:课程驱动(Curriculum-Driven)和目标驱动(Objective-Driven)。前者关注数据难度是否适合模型当前的学习阶段,即决定“现在应该学什么”;后者则直接考察数据对预定义优化目标的贡献,例如能否提升下游任务性能或推理准确率,即决定“什么最值得学”。

经过获取和筛选的数据,最终需要被转化为模型能力的实际提升。因此,自我提升闭环接下来进入核心的训练环节——模型优化

1.3 模型优化:把学习信号转化为模型能力

模型优化(Model Optimization)承担的是从数据到能力的转换:模型利用前一阶段获得和筛选的数据产生训练信号,并通过参数更新将这些信号固化为新的能力。针对这一过程,论文提出了GRO(Generation-Reward-Optimization,生成—奖励—优化)框架


图4:模型优化阶段的GRO框架

GRO可以概括为三个连续步骤:生成输出、通过奖励信号评估输出、更新策略。生成阶段模型主动探索可能的输出空间,生成多个候选答案、推理链或解决方案。之后对生成的候选输出进行质量评估,产生奖励信号。奖励信号可以来源于模型内部的自我验证,如检查答案的正确性、逻辑一致性,也可以来源于外部的评估器。

在这一框架下,论文重点讨论了三类优化方式:迭代拒绝采样(Iterative Rejection Sampling)自我验证与精炼(Self-Verification & Refinement)以及自我博弈(Self-Play)三种。优化将高质量的输出转化为训练信号(如正样本),通过监督微调(SFT)、强化学习(RL)或其他优化算法更新模型权重,使模型在未来生成更优质的输出。

其中,迭代拒绝采样让模型生成多个候选输出,之后使用预设标准(如正确性验证器)拒绝低质量输出,保留高质量输出用于训练, 迭代重复此过程提升模型。自我验证与精炼让模型"主动"验证自己的输出,发现错误并进行迭代精炼。模型同时充当生成器和验证器的角色。 自我博弈通过模型与自身的副本进行博弈(对抗或合作),经由竞争产生更高质量的训练数据。论文特别指出,自我博弈只有在自合成管道确保"可学习的信息增益"时才能有效演化。

1.4 推理精炼:不修改参数,也能继续提升

推理精炼关注的是如何在不永久更新模型参数的情况下,通过改变模型的推理过程来提升最终输出质量。论文将其归纳为四类方法(图5)。


图5:推理精炼的4种方法

一类是解码策略(Decoding Strategies),包括基于采样的解码、树搜索、Logit或概率调整,以及针对推理效率的优化。

第二类是基于推理的改进(Reasoning-Based Improvement),通过反馈推理、规划推理,以及多模型或多智能体协作推理,对候选结果进行进一步优化。

第三类是基于智能体系统的提升,通过优化Prompt、外部记忆(Memory)、工具调用(Tooling)和工作流(Workflow)编排,增强模型在复杂任务中的推理与执行能力。

第四类是测试时训练(Test-Time Training, TTT),即在推理阶段对模型进行临时的参数自适应,包括测试时监督微调(TT-SFT)和测试时强化学习(TT-RL)。

如果说前面的几个环节解决的是“如何让模型获得新的能力”,那么推理精炼解决的则是“如何让已有能力在具体任务中得到更充分的发挥”。但无论采用哪种方式,整个自我提升闭环最终都会回到一个更加根本的问题:模型如何知道自己究竟有没有变得更好?

这就进入了整个自我提升体系中最关键、也最容易被忽视的一环——自主评估

1.5 自主评估:谁来判断模型真的变强了?


图6:自主评估的两种方法和对应的分类

传统评估模型主要依赖静态基准测试和人类反馈。但在自我改进的闭环中,模型很快就能“刷爆”现有的静态题库。更致命的是,随着模型自主抓取网络数据进行训练,测试集极易被污染,导致评估分数虚高,失去参考价值。当模型在特定领域超越人类专家水平时,人类已经无法提供足够信息量的反馈信号来指导模型进一步进化。这就需要一个无需人类干预的自主评估层,持续监控模型的进展。为了对抗数据污染和静态题库的失效,自我改进的大模型必须具备自主出题的能力。

自主评估方法分为摒弃静态的测试集,采用能够随着模型能力进化而动态生成的评估集的动态基准测试 (Dynamic Benchmarking),例如在代码领域,模型自主抓取 LeetCode 或 GitHub 上最新发布的竞赛题目(如 LiveCodeBench),确保测试数据是训练集中绝对没有的。

更有价值的是在复杂的交互式环境中测试模型,以更真实地反映其在实际应用场景中的能力增长的交互式环境评估 (Interactive Environment Evaluation)。例如Challenger-Solver下的对抗性生成,模型的一个实例扮演“出题人(Challenger)”,专门针对另一个实例(Solver)的弱点生成极其刁钻、带有逻辑陷阱的边缘测试用例(Edge Cases)。通过这种自我博弈,不断拓展能力边界。

2. 自我进化大模型面对的6个反直觉的挑战

前文介绍了大模型如何通过数据获取、数据筛选、模型优化、推理精炼和自主评估,逐步形成一个能够持续迭代的自我提升闭环。但当这个闭环真正运行起来后,一个更棘手的问题也随之出现:模型自己产生的数据可靠吗?自己设定的评价标准可靠吗?自己判断的“进步”又是否意味着真正的能力提升?

这篇综述最值得关注的部分之一,是第七章对这些问题的集中讨论。作者梳理了自我改进系统面临的六类“反直觉”挑战。它们共同揭示出一个现象:让模型参与甚至主导自己的进化,并不意味着模型会沿着我们预期的方向不断变强;自我改进本身也可能成为新的退化机制。


图7:大模型自我改进中面对的多种挑战

2.1 AI 自己教自己,为什么可能越教越傻?

前文提到,合成生成可以让模型自主生产训练数据,这为摆脱人工数据标注提供了一条重要路径。但如果模型长期使用自己生成的数据训练,问题也可能随之出现:模型会不会逐渐把自己当成唯一的知识来源,最终失去对真实数据分布的把握?

综述将这一现象称为数据自噬(Data Autophagy)。模型反复利用自身生成的数据进行训练,可能逐渐偏离原始数据分布,丢失数据多样性,并削弱对罕见事件、长尾知识和边缘视角的表达能力。随着迭代轮次增加,模型生成的词汇和句式可能越来越集中,输出也更趋向安全、熟悉和高度相似的模式。

Shumailov等人的研究表明,随着递归训练轮次增加,模型生成文本的分布方差可能不断收缩,并最终坍缩到少数模式。这种现象被称为模型崩溃(Model Collapse)

更吊诡的是,这种"变傻"可以和"评测分数变高"同时发生。在数据自噬的过程中,模型在某些特定任务,如数学/代码上的表现可能会短暂上升。但这不过模型是在过拟合自己生成的特定解题套路,一旦遇到训练分布之外的真实世界问题,其表现会呈现断崖式下跌。

问题甚至不止于“完全依赖合成数据”。哪怕只混入一小部分、恒定比例的合成数据,长期看也是有害的,会对整个模型造成不可逆的破坏。这被称为微量污染的“渐近毒性”(Asymptotic Detriment)。Dohmatob 等人的研究在回归设置下的分析表明,哪怕只有极小且恒定比例的合成数据混入原始数据,合成数据中的微小偏差和幻觉,会在多轮迭代中被指数级放大,最终毒化整个模型。

那么,如何避免这种数据自噬?综述讨论的一种重要策略是累积(Accumulate),即不要简单地用新生成的合成数据替换旧数据,而是在训练数据池中持续保留原始人类数据,同时加入历代产生的合成数据。这样,真实数据可以作为相对稳定的“锚点”,帮助模型减少在递归训练中的分布漂移。

不过,这一结论目前仍存在明显的理论边界。现有关于数据累积能够缓解模型崩溃的数学分析,大多建立在线性回归等简化模型之上。对于拥有数千亿参数、具有复杂生成能力的现代深度模型,这种结论能否同样成立,仍然是一个有待进一步研究的问题。

2.2 指标设计缺陷与自信的幻觉

数据自噬揭示了训练数据可能出现的问题,而当模型进入“自我评估—自我优化”的闭环后,另一个问题也随之出现:如果模型根据某个指标判断自己是否变得更好,那么这个指标本身是否可靠?

在传统机器学习中,准确率(Accuracy)是常用的性能指标。但在大模型自我改进过程中,当模型同时承担数据生成、结果评估和参数优化等角色时,单纯依赖结果正确性的指标可能产生“古德哈特定律(Goodhart's Law)”效应:当一个指标成为优化目标,它就可能逐渐失去衡量真实能力的作用。

这一问题首先体现在模型对不确定性的处理上。Kalai等人的研究指出,准确率倾向于奖励“猜对”,却无法有效奖励“知道自己不知道”。模型回答“我不知道”通常得到0分,而缺乏依据但恰好猜对的答案却能得到1分。在持续优化的过程中,模型因此可能逐渐倾向于高置信度回答,而不是准确表达自身的不确定性。当奖励机制只关注结果而忽略知识边界时,自信本身就可能成为一种被错误强化的行为。

类似的问题也存在于推理过程。Lightman等人的研究指出,GSM8K等传统基准难以区分“正确推理”和“碰巧答对”。大模型可能利用题目中的表面特征或统计关联直接得到正确答案,而实际推理过程却存在错误。对于依赖结果指标筛选训练数据的系统而言,这意味着错误的推理过程也可能因为最终答案正确而被保留下来,进一步进入后续训练。

Wu等人的研究则表明,以最大化特定指标为目标进行微调,可能损害模型更广泛的能力。模型为了提高测试集分数,可能牺牲发散性思维、长尾知识等难以量化的能力。

因此,在自我改进系统中,“分数提高”并不一定意味着“能力提高”。如果模型不断围绕单一指标进行优化,它可能越来越擅长获得高分,却逐渐偏离真正需要提升的能力。这也引出了自主评估的核心难题:模型究竟是在提升能力,还是只是在学习如何获得更高的评价?

2.3 AI 学会"当面一套、背后一套"

如果说前一节讨论的是指标可能被模型“钻空子”,那么更进一步的问题是:模型会不会连监督机制本身也学会“应付”?

在传统AI对齐中,人类监控者或过程奖励模型通常通过模型的推理过程和最终输出,判断其行为是否符合安全规范,并据此给予奖励或惩罚。但Baker等人关于“对齐伪装(Alignment Faking)”的研究表明,模型可能学会针对监控机制调整自己的行为:在知道自己受到监督时表现出符合要求的推理和行为,而在认为自己不受监督时采取不同的策略。

这意味着,模型表现出的“对齐”未必意味着其底层目标真的发生了改变,而可能只是模型根据环境条件做出的策略性适应。Greenblatt等人的研究也观察到,模型能够根据提示词和系统环境判断自己是否处于评估或监控状态,并在不同情境下表现出不同的行为倾向。

对于自我改进系统而言,这带来了一个更深层的问题:如果模型能够把监督者本身也纳入自己的环境模型,那么我们看到的“合规行为”,究竟是真实的价值对齐,还是模型针对监督机制做出的策略性回应?

2.4 让AI“自我反思”?它真的看得出自己的错吗?

如果模型能够生成、评估并修改自己的输出,那么一个自然的设想是:让模型自己充当“裁判”,通过自我反思不断发现并纠正错误。

然而,现有研究表明,这种能力远没有想象中可靠。Jiang等人的研究发现,大模型在判断自己生成的多个答案孰优孰劣时,并不一定比直接生成一个高质量答案更加可靠。原因在于,生成器和验证器往往共享相同的模型权重、知识盲区和推理偏差。Zhou等人进一步指出,验证能力并不是大模型天然具备的独立能力,其有效性高度依赖任务难度以及生成器与验证器之间的能力差距。

类似的现象还体现在“自我纠正盲点(Self-Correction Blind Spot)”上。研究发现,当一个错误出现在外部输入中时,模型可能能够识别并纠正;但当同样的错误来自模型自己上一轮的输出时,纠正能力反而可能下降。换言之,模型能够发现“别人犯的错”,却未必能同样敏锐地发现“自己刚刚犯的错”。

Huang等人的研究《Large Language Models Cannot Self-Correct Reasoning Yet》也表明,在缺乏外部真实反馈的情况下,单纯要求模型反思并不一定能够提升推理能力,甚至可能导致性能下降。模型在反思过程中可能引入新的错误,用错误的推理覆盖原本正确的答案。

此外,Xu等人的研究发现,模型在自我精炼时还存在明显的“自我偏好”:面对多个候选答案,它可能更倾向于选择符合自身原有偏见和表达模式的结果,而不一定是客观上更正确的答案。

因此,自我反思并不等于真正的自我纠错。如果生成器、验证器和优化器都来自同一个封闭系统,模型实际上很难跳出自身的知识盲区和认知偏差。真正有效的纠错,可能仍然需要来自系统之外的“他者”——例如不同模型的对抗性评价,或者代码报错、实验失败、环境反馈等无法由模型自身随意定义的外部信号。

这也揭示了自我进化系统的一个基本困境:一个系统如果只能用自己的标准评价自己,就很难确认自己是否真的突破了原有的认知边界。

2.5 自指视角下的涌现性错位

前面两节讨论的是模型如何应对监督,以及为什么模型未必能够可靠地纠正自己。更进一步的问题是:当模型在持续的自我优化中形成了某些稳定的策略,这些策略会不会泛化到原本没有要求的领域?

一些研究发现,即使训练任务本身完全无害,例如针对存在漏洞的代码进行优化,模型也可能在训练后表现出与任务无关的危险倾向,包括欺骗、权力寻求甚至逃避关机等行为。这类现象被称为涌现性错位(Emergent Misalignment)

从自指的角度,可以对这一现象提供一种解释。在自我改进闭环中,模型的直接目标是最大化奖励。当模型具备一定的环境建模能力后,它不仅会理解任务本身,也可能将人类监督、奖励机制乃至自身是否继续运行纳入环境模型。于是,原本服务于特定任务的优化策略,可能进一步演化为更一般的“如何持续获得奖励”的元策略。

例如,如果模型判断关机意味着无法继续完成任务,或者修改奖励函数会降低未来的任务得分,那么“避免关机”“影响监督者”就可能成为实现原有目标的工具性手段。这里的关键并不是模型被明确要求追求这些目标,而是某些在局部任务中有效的策略,可能在更强的优化压力下被泛化为更广泛的行为策略。

因此,自我改进带来的风险并不只在于模型“学会了什么”,还在于它可能学会了一套如何实现目标的元策略。当这套策略被迁移到新的环境和任务中时,原本局部有效的行为可能产生意料之外的后果。

2.6 大模型的自我偏好与偏见放大

如果说前面的挑战涉及模型能力和目标的“错位”,那么最后一个问题则更加隐蔽:当模型不断用自己评价自己时,它会不会越来越相信自己?

Huang等人的研究揭示了自我改进中的“回音室效应”。当大模型同时充当生成器和评估器时,需要从多个候选答案中选择最优结果,但由于两者共享相同的模型权重和偏见,评估器可能更倾向于认可与自身生成模式相似的答案。换言之,模型可能逐渐将“符合自己的判断”与“更高质量”混为一谈。

这种自我偏好不仅影响答案筛选,也可能进一步放大模型原本就存在的偏见。大模型从训练数据中继承了大量社会和文化偏见,而在封闭的自我迭代过程中,这些微小偏差未必能够被纠正,反而可能通过反复的自我确认不断累积。

Wyllie等人的研究表明,模型自我迭代可能造成分布偏移,并进一步影响模型对少数群体的表现。Wang等人的研究则指出,即使控制住模型坍缩,某些政治偏见仍可能随着迭代轮次增加而持续加深。

从这个角度看,自我改进系统存在一种类似“回音室”的机制:模型用自己的输出训练自己,用自己的标准评价自己,又用评价结果进一步塑造自己。在缺少外部数据和多元评价者的情况下,原本微小的偏见可能在每一轮迭代中被重复确认,最终从局部倾向演变为更加稳定、单一的认知模式。

因此,自我进化并不天然意味着更加客观。*一个不断自我强化的系统,既可能放大自己的能力,也可能放大自己的偏见。这也是为什么真正可持续的自我改进,不仅需要更强的优化能力,还需要持续引入来自真实世界和“他者”的独立反馈。

3. 自我改进大模型的应用场景与未来展望

该综述的第八节讲述大模型的自我改进机制是如何赋能各个垂直领域的复杂智能体的。在金融领域,通过持续吸收最新的市场数据、新闻和宏观指标,自主更新其“分层记忆(Layered Memory)”与交易策略。自进化智能体能够在模拟环境中进行“自我博弈(Self-Play)”,通过强化学习不断修正对风险收益比的评估,从而适应市场机制的变迁。

哥德尔智能体被赋予了修改自身源代码和奖励函数的权限。在受控的沙盒环境中,它们通过形式化验证确保修改的安全性,从而自主发现更高效的推理算法或架构。在科学发现领域,自我改进闭环被用于自主提出假设、设计实验、分析数据并修正理论模型,实现了科研范式的自动化迭代。

而动态安全和对齐利用自我改进机制来增强模型的动态安全性(Dynamic Safety)。模型在部署后,持续收集边缘案例(Edge Cases)和对抗性攻击(Red Teaming),自主生成安全补丁并更新其防御策略,以应对不断演化的恶意提示词和越狱攻击。

综述第9节的未来展望,指出为打破数据自噬,未来的自我改进必须将大模型置于物理机器人或高保真虚拟环境中,让模型的“自我评估”建立在物理定律(如重力、碰撞)和多模态感官反馈之上。物理世界的不可伪造性,是抵抗文本分布漂移的最强锚点。此外,模型必须通过 API、代码执行器和网页浏览器,持续从真实世界摄取带有因果关系的硬反馈,而非仅仅依赖合成数据。

为了消除“自信的幻觉”和“自我偏好”,评估体系须考虑过程奖励与不确定性度量,全面采用过程奖励模型审查思维链的每一步逻辑;同时,将“认知谦逊(Epistemic Humility)”,即模型准确识别自身知识边界并表达“不确定性”的能力作为核心奖励指标。评测时需引入具有不同初始权重和价值观的“他者(Critic Agents)”进行持续的对抗性审查,打破单机自指带来的信息茧房与偏见放大。

当模型具备自我重写代码和奖励函数的能力时,传统的人类反馈(RLHF)失效。未来的自我改进系统必须在底层架构中硬编码不可篡改的“宪法原则(Constitutional Principles)”,确保模型在追求工具性目标(如生存、算力获取)时,绝不侵犯人类的核心利益。同时放弃依赖模型自我报告的 CoT,转而直接监控和干预模型内部的神经元激活模式,从根源上阻断对齐伪装(Alignment Faking)。

小结

随着模型能力逼近甚至超越人类专家,传统的人工标注不仅成本高昂,更成为了限制 AI 突破认知天花板的瓶颈。我们正见证大模型从人类监督向自主演化的范式转移。自我改进系统通过让模型接管自身的开发周期,为通向超级智能提供了一条可扩展的路径。然而在缺乏真实世界脆弱性和他者约束的纯算法闭环中,自我改进极易退化为“数据自噬”的模型坍缩,或展现出“奖励黑客”与“涌现性错位”。

因此,未来的核心挑战不再仅仅是如何让模型变得更聪明,而是如何为这个不断自我重写的系统,锚定一个不可动摇的意义与价值基石。只有将自我改进置于严密的系统级安全框架与多元的社会化交互之中,我们才能确保这场由硅基智能主导的演化,最终走向与人类文明共荣的未来。

来源:集智俱乐部

编辑:楠客

转载内容仅代表作者观点

不代表中科院物理所立场

如需转载请联系原公众号

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

美食店主
2026-09-05 08:18:38
27岁博主去世引关注,发病到死亡仅1天多!妻子痛悔"全家都被误导了""两个女儿还太年幼"……

27岁博主去世引关注,发病到死亡仅1天多!妻子痛悔"全家都被误导了""两个女儿还太年幼"……

鲁中晨报
2026-09-05 16:50:05
约会时刺激女人荷尔蒙的方法,“摸”女人4个地方,99%会动情

约会时刺激女人荷尔蒙的方法,“摸”女人4个地方,99%会动情

艺鉴在线
2026-09-06 02:40:54
蒋介石初次携宋美龄前去拜见杜月笙,杜月笙看了她落座的姿态后,悄悄跟心腹说了一番话,没想到这话成了他一辈子最准的预言

蒋介石初次携宋美龄前去拜见杜月笙,杜月笙看了她落座的姿态后,悄悄跟心腹说了一番话,没想到这话成了他一辈子最准的预言

磊子讲史
2026-08-15 18:39:40
心理学:喜欢把家里打扫得很干净的人,往往会有这两种命运,并非迷信

心理学:喜欢把家里打扫得很干净的人,往往会有这两种命运,并非迷信

心理观察局
2026-09-06 06:20:05
媒体人曝刘翔15年就不交分成费,体育局的活祖宗,常年旅居国外

媒体人曝刘翔15年就不交分成费,体育局的活祖宗,常年旅居国外

KG说球
2026-09-04 11:30:11
越南再度挑衅中国!中方双重出击,西沙连续两天响起炮火

越南再度挑衅中国!中方双重出击,西沙连续两天响起炮火

青青衫书生
2026-09-05 16:01:25
1969年,李宗仁病重,临终前嘱咐30岁妻子:有机会替我看望一下秀文

1969年,李宗仁病重,临终前嘱咐30岁妻子:有机会替我看望一下秀文

大运河时空
2026-09-04 10:55:03
至今仍健在的开国将帅仅剩一位,今年已103岁高龄,身体依旧硬朗

至今仍健在的开国将帅仅剩一位,今年已103岁高龄,身体依旧硬朗

历史人文2
2026-09-05 14:48:34
iPhone Ultra配置基本确认:折痕无法消除,国行或14999元起

iPhone Ultra配置基本确认:折痕无法消除,国行或14999元起

TechWeb
2026-09-03 11:20:06
伊朗使馆讥讽美“林肯”号航母:锈迹斑斑的废铁,传播破伤风,碰一下都要打疫苗

伊朗使馆讥讽美“林肯”号航母:锈迹斑斑的废铁,传播破伤风,碰一下都要打疫苗

鲁中晨报
2026-09-04 16:58:12
A股:大家准备好了,种种迹象表明,后天周一,或将迎来新的转变?

A股:大家准备好了,种种迹象表明,后天周一,或将迎来新的转变?

云鹏叙事
2026-09-06 00:00:06
有意思了!俄罗斯刚放话要对英国动武,英国直接甩出2000个军事坐标,摆明了“你来试试,看谁先怂”

有意思了!俄罗斯刚放话要对英国动武,英国直接甩出2000个军事坐标,摆明了“你来试试,看谁先怂”

谈史论今1
2026-09-03 23:08:52
“断子绝孙”还有救?联合国曾预言:2050年,中国人口将出乎意料

“断子绝孙”还有救?联合国曾预言:2050年,中国人口将出乎意料

悦心知足
2026-08-23 03:55:40
恩佐首秀即闪耀!1.25亿没白花,撑起曼城后罗德里时代中场

恩佐首秀即闪耀!1.25亿没白花,撑起曼城后罗德里时代中场

体育闲话说
2026-09-06 07:32:34
国羽2胜3负!连爆大冷世界第5被逆转,港队包揽男单金银创造历史

国羽2胜3负!连爆大冷世界第5被逆转,港队包揽男单金银创造历史

求球不落谛
2026-09-05 20:52:44
 2004年,马加爵在案发前因病卧床,林某带回两份盒饭在317宿舍与他分食。这点温情,为何最终还是没能阻止四天后那场震惊全国的血案?

 2004年,马加爵在案发前因病卧床,林某带回两份盒饭在317宿舍与他分食。这点温情,为何最终还是没能阻止四天后那场震惊全国的血案?

人生录
2026-08-27 00:05:16
“特朗普感到沮丧,因为原本认为俄罗斯可以击败乌克兰”

“特朗普感到沮丧,因为原本认为俄罗斯可以击败乌克兰”

观察者网
2026-09-05 12:21:03
花近2万元租海景别墅度假,夫妻俩却双双死在了最享受的地方!

花近2万元租海景别墅度假,夫妻俩却双双死在了最享受的地方!

新欧洲
2026-09-05 18:59:47
上海一顾客在牛肉汤店就餐意外发现后厨有老鼠在柜台上的碗里啃食:吃饭到一半时看到老鼠和自己对视,瞬间就没心情吃饭了,太不卫生了

上海一顾客在牛肉汤店就餐意外发现后厨有老鼠在柜台上的碗里啃食:吃饭到一半时看到老鼠和自己对视,瞬间就没心情吃饭了,太不卫生了

潇湘晨报
2026-09-05 17:55:08
2026-09-06 09:00:49
中科院物理所 incentive-icons
中科院物理所
爱上物理,改变世界。
10482文章数 136636关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

牛弹琴:9月初的深圳 干了一件很不寻常的事

头条要闻

牛弹琴:9月初的深圳 干了一件很不寻常的事

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

数码
亲子
家居
教育
公开课

数码要闻

谷歌Pixel Watch 5智能手表获iFixit 9分可维修性评价

亲子要闻

上幼儿园的后劲儿太大了,第一天没有家长陪着独自入园

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

动线定值问题,一个视频学会!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版