假设宇宙中存在一个被称为「拉普拉斯妖」1的幽灵。它拥有无限的计算能力,掌握了宇宙中所有原子的动量和位置。你可能会觉得,这个生灵一定拥有宇宙中至高无上的智慧,能看透。
真实情况完全出乎我们的意料。数学和计算机科学告诉我们一个冷酷的事实:拥有无限算力,意味着它根本不需要具备人类所定义的「智慧」。在拉普拉斯妖的眼中,这个世界没有「苹果」,没有「国家」,没有「爱情」,只有一堆按照物理定律枯燥运动的原子。它不需要总结规律,因为它能直接暴力推演一切。
近期,arXiv 上出现了一篇极具思想冲击力的论文,题为 From Entropy to Epiplexity。几位来自卡内基梅隆大学和纽约大学的研究者重新审视了经典信息论,并提出了一个极度反常识的结论:如果你想在这个世界上学到真正有用的知识体系,建立起所谓的高级认知,你必须是一个「算力受限」的观察者。
这篇论文虽然通篇在用严格的数学公式和密码学概念讨论大语言模型(LLM)和机器学习,它实际上揭示了一套极高深的人生算法。
一、Shannon 的死穴与雪花屏的诅咒
在经典的信息论中,信息的单位是比特。Claude Shannon2 告诉我们,信息的本质是「消除不确定性」。一个事件越是不可预测、越显得混乱,它蕴含的信息量就越大。这就是所谓的「信息熵」(Entropy)。在这个标准下,我们每天都在被海量的信息无情轰炸。
或许有人会说,我们要获取更多的信息才能找到一个「正确」的人生路径。但想象一台没有插天线的旧电视机,屏幕上全是密密麻麻的雪花噪点。它的画面是完全随机的,你永远无法预测下一个像素是黑还是白。根据 Shannon 的理论,以及后来苏联数学家 Kolmogorov 的复杂性理论,这台雪花屏包含的信息量极大,几乎达到了理论上的极值。
但绝对没有任何正常人会盯着雪花屏看上一整天。因为那里面毫无「意义」可言。
为了填补这个漏洞,论文作者引入了两个全新的核心概念:Time-bounded Entropy(时间受限熵)和 Epiplexity。
时间受限熵,指的是在有限的时间和算力下,你觉得完全随机、毫无头绪的不可预测内容。生活中的绝大多数琐事、社交媒体上的情绪宣泄、股市里每天高频的随机波动,对普通人来说都属于这种极高的时间受限熵。你投入再多的精力去追踪,也提炼不出任何可复用的规律。你只是在消耗生命,去计算一组类似于密码学中的伪随机数。
与之相对的,Epiplexity 这个词可以精准地翻译为「结构复杂性」3。它代表的是数据中隐藏的、可以通过有限算力提取出来的高级规律、长程依赖和底层逻辑。
普通人面对庞杂的世界,往往被困在雪花屏前。他们贪婪地刷着短视频,阅读着碎片化的八卦,大脑全速运转去处理那些极高的时间受限熵。他们以为自己获得了海量信息,大脑却依然空空如也。
高手面对同样的世界,采取的策略截然不同。他们极度克制地过滤掉随机噪音,把所有宝贵的算力用来从中提取 Epiplexity。Nassim Nicholas Taleb 在经典著作 Fooled by Randomness 中,曾用概率论揭示过类似的道理。Taleb 曾提到,他几乎不看社交媒体,甚至不读报纸。
如果你每天观察自己的投资组合,你会看到无数微小的波动。在 Taleb 看来,这些波动中 99% 都是噪音,只有 1% 是信号。那些频繁查看报价的投资者,实际上是把算力浪费在了捕捉随机漫步的噪声上。Taleb 认为,信息的质量随着观测频率的增加而急剧下降。这种高频的、杂乱的信息,正是论文中所说的时间受限熵。
只有当你把观测的时间跨度拉长,从每天看一次改为每十年看一次,那些细碎的噪音才会自动湮灭。剩下的、真正改变命运的结构性趋势,才是 Epiplexity。高手深谙此道。他们主动放弃对即时反馈的关注,通过与外界保持距离,强行降低大脑处理高熵信息的负荷。这种克制,是提取底层结构的必要代价。
论文中有一个非常绝妙的实验结论。研究人员对比了语言文本数据和高清图像数据,发现文本数据包含了极高的 Epiplexity。尽管一张高清图片(例如 CIFAR-5M 数据集中的图片)在计算机里占据的字节数极大,但其中超过 99% 的信息都是毫无规律的像素级随机噪声。文本的内容结构则完全不同,每一个词的排列都蕴含着极强的逻辑关联和抽象概念。一段经典名著的字节数可能远不如一张低像素的风景照,文本含有的 Epiplexity 却是图像的成百上千倍。
这也完美解释了为什么当前的人工智能革命是由预训练的大语言模型(LLM)引领的。在海量文本上预训练的模型,能够涌现出惊人的跨领域泛化能力,它们甚至能零样本去解决复杂的逻辑推理题。仅仅看图的模型却极难做到这一点。
生活也是如此。高密度的深度阅读、系统性的硬核思考,本质上就是在高效提取高 Epiplexity 的内容。单纯追逐短平快的瞬时感官刺激,充其量只是在大口吞咽庞大而无用的随机熵。
二、计算能力的诅咒与「涌现」的奇迹
这篇论文最精彩的洞见,在于彻底揭示了「算力受限」的核心价值。
我们常常抱怨自己记忆力不够好、大脑处理信息的速度不够快。我们总幻想如果大脑能像超级计算机一样过目不忘、瞬间计算,我们就能无往不利。这篇论文用严格的数学证明证明了:唯有算力受限,才能逼迫一个系统产生「涌现」(Emergence)现象。
真正的智慧,恰恰诞生于局限之中。
设想一下著名的 Conway 生命游戏(Conway’s Game of Life)。在这个庞大的二维网格里,黑白方块仅仅根据极其简单的几条相邻规则进行繁衍或死亡。如果让前文提到的拉普拉斯妖去预测未来,它毫无压力。它只需要严格按照基础规则,一步一步去推演每一个网格的微观状态。在超级计算体系的眼中,整个世界只有枯燥的 0 和 1。
人类的大脑算力存在绝对瓶颈。我们无法在一秒钟内计算几万个网格的复杂演化。为了能够预测生命游戏未来的走向,人类被迫发明了一套全新的高级抽象词汇。我们观察到了特定形状的方块组合,并将它们命名为「滑翔机」(gliders)、「稳定块」(static blocks)和「振荡器」(oscillators)。我们甚至进一步总结出了滑翔机移动的固定速度,以及它们彼此碰撞时的宏观规律。
在这个奇妙的过程中,无限算力的机器只看到了局部规则,算力受限的人类却敏锐地看到了「结构」。这种为了克服自身算力不足而提炼出的高级概念组合,正是我们需要获取的 Epiplexity。
你可以把这种现象映射到细胞自动机(Elementary Cellular Automata)的实验中。研究人员让大语言模型去学习各种自动机的演化规则。像 Rule 15 这种规则过于简单,生成的画面全是周期性重复的图案,毫无学习价值。像 Rule 30 这种规则生成的画面则极其混乱,充满了伪随机信息,模型算力耗尽也毫无建树。只有像 Rule 54 这种处于混沌边缘地带的复杂规则,既包含了变化,又隐藏着宏观的几何逻辑,模型在学习它时提取到了极高的 Epiplexity。
大语言模型的这一举动,极其生动地展示了什么是真实的学习过程。
如果你试图死记硬背工作中的所有细枝末节,记住每一个客户说过的一字一句,记住每一行代码的微小变动,你仅仅是在把自己降级为一块低效的机械硬盘。而真正的高手会坦然接受自身大脑容量和处理速度的物理局限。他们主动放弃对微观变量的机械穷举,转而死磕事物背后的宏观模式与底层规律。
你记不住所有的树叶,所以你发明了「树」这个概念。你算不出所有的价格波动,所以你总结出了「周期」和「均值回归」。物理局限不仅没有锁死人类的智慧,它恰恰是人类迈向顶层认知的核心驱动力。
三、因式分解的痛苦,是重塑大脑的捷径
在经典的信息论中,还有一个长期被奉为圭臬的假设:信息的总量与观测时的分解顺序毫无关联。先观察要素 A 再观察要素 B,和先观察 B 再观察 A,你最终获得的总信息量理应完全一致。这在数学上被称为信息的对称性。
真实世界的反馈完全粉碎了这个美好的错觉。论文作者通过一项极其硬核的国际象棋实验,彻底打碎了这层理论滤镜,揭示了认知升级的第三个秘密。
研究人员将成千上万局国际象棋(Lichess 数据集)的专业棋谱喂给 AI 模型进行严苛的训练。他们特意使用了两种截然不同的数据排列方式:
- 顺向逻辑。 模型先看到一长串的走棋序列(比如白方走 E4,黑方走 E5),最后再让模型看一眼最终的棋盘状态布局。
- 逆向逻辑。 模型先看到最终的定格棋盘状态,然后再让它去预测和反推之前复杂的走棋序列。
实验结果非常令人震撼。对模型来说,第二种逆向训练法的预测难度飙升。根据经典理论,两组数据包含的绝对信息量是一模一样的,只是顺序变了。但在实际训练中,逆向预测强行迫使模型提取到了更为丰厚的 Epiplexity。
在随后的未知任务测试中,这种差异展现得淋漓尽致。研究人员让这两个模型去完成一项它们从未见过的任务:给一个陌生的棋局打分,评估双方的优劣势(所谓的 Centipawn 评估)。经历了逆向训练的模型展现出了极强的分布外(OOD)泛化能力,得分远超第一种顺向模型。
为什么会这样?答案藏在计算的非对称性里。因为艰难的逆向推导逼迫模型彻底放弃了表面的统计学死记硬背,它必须在大脑的深层神经网络中,建立起对棋盘整体局势极其深刻的内部表征。
由因推果往往是一条平坦的高速公路。给你一步步的走法,顺水推舟推导出最终盘面,这只需要简单的规则叠加。这就好比你在看一本侦探小说,作者按照时间顺序平铺直叙,你毫不费力就能读到结尾。
由果推因则是一条崎岖的蜀道。看到最终棋盘,你要在脑海里穷举无数种可能的历史路径,还要反向推演每一步的战术意图。由于算力受限,模型不可能使用暴力穷举法去倒推。艰难的逆向推导逼迫模型彻底放弃了表面的统计学死记硬背,它必须在大脑的深层神经网络中,建立起对棋盘整体局势、棋子价值和高阶战术极其深刻的内部表征。这套内部表征,就是极其珍贵的 Epiplexity。
我们在现实生活中学习任何一项新技能时,同样面临这两种截然不同的路径选择。
顺向学习就像是坐在教室里听老师讲课,顺着前人铺好的现成推导过程一路滑行下来,听着高管分享成功经验,一切都显得无比丝滑。你感觉自己什么都听懂了,大脑深处却没有建立起任何深刻的认知回路。这种知识是脆弱的,一旦遇到陌生的跨领域问题,顺向积累的经验瞬间崩塌。
真正的刻意练习,必定包含这种逆向的、极其困难的「因式分解」。丢给你一个已经大获成功的商业案例,没有任何背景提示,让你孤立无援地反推创始人当初面临的生死抉择。拿给你一个业界顶尖的工业产品,让你从零开始逆向工程它的核心设计思路。
这条路布满荆棘,它会急剧消耗你的心智与认知资源,让你感到极度的挫败。正因为如此,它能最大程度地打破你现有的神经连接,把冰冷的信息转化为你大脑中鲜活的 Epiplexity。高手都在日复一日地刻意给自己制造这种心智训练上的「剧烈不适感」。
舒适区里永远只有低质的熵,只有在极其费力的逆向解构中,你才能提炼出智慧的黄金。
四、闭关锁国与算法的左脚踩右脚
我们经常听到一种笃定的说法:一个人如果不去积极接触外界的新信息,不保持对前沿资讯的极度饥渴,他就永远不可能产生新的认知跃迁。经典信息论中的「数据处理不等式」(Data Processing Inequality)也在用冷冰冰的数学语言表达同样的观点:对现有数据进行完全确定性的计算变换,绝对不可能凭空增加任何一丁点信息量。
但是 Google 的 DeepMind 开发的 AlphaZero,或者说 0-shot learning,是对这一铁律的一个有力的反击。
AlphaZero 在训练之初,仅仅被赋予了最基础的国际象棋规则。它完全拒绝输入任何人类高手留下的海量棋谱,没有任何外部知识的输入。它仅仅通过在封闭系统内,左右互搏,不知疲倦地进行自我对弈。几天之后,它演化出了极其深奥、甚至让整个人类国际象棋界都叹为观止的全新战略。它甚至发明了人类棋手几百年都没想到的弃子开局法。
根据数据处理不等式,没有任何外部新数据的注入,AlphaZero 的系统总信息量应该始终为零。那个庞大的、包含了几千万个参数的神经网络里,装着的极其复杂的战略思维,究竟是从哪里凭空冒出来的?
论文研究者给出了一个极度精辟的理论解释。当我们惊叹于 AlphaZero 学到了「新知识」时,我们谈论的完全脱离了 Shannon 意义上的信息量范畴,其本质依然是 Epiplexity。
数据处理不等式有一个隐藏的致命前提:它假定观察者拥有无限算力。对于无限算力的上帝来说,国际象棋的规则和国际象棋的最优解,在信息量上是完全等价的。有了规则,最优解就已经注定存在于那里了。
真实世界的观察者算力是极其有限的。规则虽然简单,但从规则推导出高阶战略,需要跨越一条极度宽广的计算鸿沟。对于一个计算资源受限的系统来说,通过投入大量的「计算」过程,完全可以把极其确定性的、看似毫无增量信息的基本公理,硬生生地转化为极具实战价值的结构化信息。
计算的动作本身,就是在源源不断地创造新知识。
这也完美解释了为什么合成数据(Synthetic Data)能够让现代大模型变得更聪明,而不是所谓的 “Garbage in, garbage out”。模型用自己生成的看似没有新意的数据去继续训练自己,这种「左脚踩右脚」上天的做法,在古典理论看来是荒谬的。在算力受限的理论框架下,模型通过推演和生成,实际上是在将潜藏的深层结构显性化。
将这个原理投射到人类历史上,你会发现那些最顶级的思想家,往往也有这样的经历。以 Isaac Newton 为例。当年为了躲避伦敦的严重瘟疫,牛顿把自己关在偏僻的伍尔索普庄园。长达一年多的时间里,他彻底切断了与外界学术圈的交流。没有任何新信息的输入,仅凭极其有限的几个基础物理学直觉和极其简单的数学公理,牛顿在自己的头脑中疯狂推演,最终构建出了极其庞大且严密的经典力学体系和微积分基本定理。
王阳明也如此。《明史》载:
(阳明)谪龙场,穷荒无书,日绎旧闻。忽悟格物致知,当自求诸心,不当求诸事物,喟然曰:「道在是矣。」遂笃信不疑。其为教,专以致良知为主。谓宋周、程二子后,惟象山陆氏简易直捷,有以接孟氏之传。而朱子「集注」、「或问」之类,乃中年未定之说。学者翕然从之,世遂有「阳明学」云。
现代社会的绝大多数人过分迷信「获取新信息」的神奇功效。他们患有严重的信息错失恐惧症(Fearing of Missing Out, FOMO),仿佛每天强迫自己刷完几百篇干货满满的行业报告、听完几十个观点前卫的播客,就能自动进化得更加聪明。
这是一种本末倒置的错觉。真正的知识壁垒,极度依赖于深度的内在计算。当你费尽心思掌握了足够优秀的第一性原理之后,你最需要做的动作是果断关上房门,彻底切断外部世界汹涌的随机熵流,用你自己的大脑去进行残酷的自我博弈。
去疯狂推演、去反复计算、去激烈碰撞。去思考一个极简法则在不同极端场景下的变体。这种看似枯燥的确定性内部重组,绝对可以为你淬炼出极其惊人的结构化智慧。
知识的质变,永远发生在深刻的内部计算中,绝不发生在浮躁的外部检索里。
结语
回到我们文章最初的那个思考。真实世界的信息学,本质上是一门关于认知资源极限分配的硬核科学。
因为我们的物理生命和脑力算力是极其有限的,我们要坚决拒绝把宝贵的算力浪费在那些看似热闹、实则高熵的随机事件上。新闻的头条、短期的股价波动、八卦绯闻,这些东西只会耗尽你的时间受限熵。你的目标是寻找那些历经时间考验、具备深层逻辑和长程依赖的知识,去疯狂提取 Epiplexity。
因为我们的物理生命和脑力算力是极其有限的,我们要彻底放弃做一个试图记住所有细节的人肉照相机,勇敢地拥抱你的「算力不足」。正因为你记不住,你才会被迫去寻找事物背后的宏观模式,去总结规律,去创造抽象概念。局限性,是你获得涌现智慧的最强催化剂。
因为我们的物理生命和脑力算力是极其有限的,我们要刻意且勇敢地选择那条逆向的、极为难走的推理小径,去逼迫大脑完成真正的底层升级。警惕那些嚼碎了喂给你的顺向知识。去拆解、去逆向工程、去由果推因。在极度烧脑的不适感中,你的大脑神经元正在发生实质性的重连。
因为我们的物理生命和脑力算力是极其有限的,我们要停止无休止的外部信息摄入。留出大段的空白时间,用你已经掌握的第一性原理,在头脑中进行深刻的演算和自我博弈。通过深度的内部计算,你完全可以凭空创造出属于你自己的新知识体系。
所谓高手,头脑无比清醒地知道自己只不过是一个「算力受限」的凡躯。他们绝不奢求去充当那个全知全能的拉普拉斯妖。他们只是在这个充斥着无穷无尽噪音的荒芜宇宙里,心无旁骛、坚定不移地执行着提取 Epiplexity 的终极生存算法。
-
对于非物理学背景的读者,「拉普拉斯妖」(Laplace’s Demon)是科学史上一个著名的思维实验,由法国数学家皮埃尔-西蒙·拉普拉斯(Pierre-Simon Laplace)于 1814 年提出。拉普拉斯假设,如果宇宙中存在一个智能生物,能够掌握某一瞬时所有物质的精确位置与动量,并具备处理这些数据的超凡算力,那么根据经典力学的因果律,整个宇宙的过去与未来对其而言都将是确定的。这一概念是「机械决定论」的极致体现,暗示宇宙如同精密运转的钟表,一切演化皆可预见。然而,20 世纪量子力学的发展打破了这一幻想。海森堡提出的不确定性原理(Uncertainty Principle)从底层逻辑上证明,微观粒子的位置与动量无法同时被精确测量。这意味着即便存在所谓的「妖」,它也无法获得推演未来的初始数据,从而在科学层面宣告了这一全知模型的失效。 ↩
-
没错,Anthropic 公司的 AI 产品就是用的 Shannon 的名字。个人认为 A 司是一个有 taste 的公司。 ↩
-
对于熟悉词源学的读者。Epiplexity, literally,指的是「在原有复杂性之上的复杂性」。
- 前缀 Epi-(ἐπί):在希腊语中意为「在……之上」、「附加」或「外层」。通常表示一个更高的维度、叠加的层次或是在基础结构之上的衍生。
- 词根 -plexity:源自拉丁语 plectere(编织、缠绕)。它与 Complex(复杂)同源,指的是多个元素交织在一起,形成一个难以拆分的整体。