四句话讲清整件事
- 重构目标。把"预测下一个字"改成预测一个行动的干预结果(P(结果 | do(行动)))以及反事实差值(当初换个行动会怎样)。这对应 Judea Pearl 因果阶梯的第 2、3 层。
- 有一堵墙。因果层级定理告诉我们:几乎不可能从纯观察数据里凭空推出干预/反事实答案。这不是工程难题,而是信息层面的守恒律——今天的 LLM 就困在第 1 层。
- 钥匙在数据。要爬上阶梯,必须把干预与反事实写进 token 流本身。而一个可控、可"读档回放"的模拟器,是唯一能免费、无限地生产这种数据的地方。
- 用演化来检验。在一个有限资源、有限寿命、优胜劣汰的多智能体世界里,若"会预测干预、会反事实推理"的个体能把基因/策略更大概率传下去,就说明因果能力被自然选择偏好——而这,正是可以做成 MVP 去证伪的猜想。
因为它把三条本来分开的前沿——因果推断(Pearl / Schölkopf)、世界模型(LeCun 的 JEPA、Dreamer、Genie)、开放式演化(ALife / Neural MMO / Era of Experience)——用一根逻辑主线串了起来:模拟器不是玩具,而是唯一能合法生产"观察数据里没有"的那部分因果信息的引擎。下文会给出这条主线的严谨依据、已有的 2025 年实证锚点、数据与验证方法、以及一个 90 天可证伪的创业路径。
为什么"预测下一个字"还不够
大语言模型做的事,本质上是一件事:给定前文,预测下一个 token 的概率分布。这让它成为一台惊人的关联机器——但"关联"只是因果世界的最底层。
Judea Pearl 用一座三级阶梯刻画了"理解世界"的三种层次。它们不是难度递增的同类问题,而是三种本质不同的问题,需要三种不同的信息才能回答。
关键在于最后一层。反事实问的是一件在现实中永远无法同时观测的事:同一个个体、同一时刻,既做了 x′、又改做 x 的两种结局之差。这正是人类"后悔""归因""责任""如果当初……"背后的心理机制,也是任何真正的决策智能绕不开的能力。
公鸡打鸣和日出高度相关(L1)。但让公鸡闭嘴,太阳照升(L2 干预)。而"如果昨天那只已经打鸣的公鸡当初没叫,太阳还会升吗"(L3 反事实)——要回答它,你得有一个能"倒带重放同一个世界、只改动一个变量"的机制。观察再多次日出与鸡鸣的共现,也变不出这台倒带机。
那堵墙:因果层级定理
这不是"再多堆点数据、再大点模型"就能翻过去的坡,而是一道信息层面的守恒律。理解它,才能理解为什么"因果 token 化"必须从数据下手,而不是从架构下手。
因果层级定理(Causal Hierarchy Theorem, CHT)——由 Bareinboim、Correa、Ibeling、Icard 等人形式化——粗略地说:对几乎任意一个结构因果模型(SCM),仅凭第 1 层(观察)分布,无法唯一确定第 2、3 层(干预、反事实)的答案。换句话说,总存在两个 SCM,它们产生的观察数据一模一样,却对"如果干预会怎样"给出不同预测。低层的数据里,根本不含高层问题的答案。
因为答案缺失是结构性的,不是统计性的。样本无穷多也不行——你观测的是 P(Y|X),而问题问的是 P(Y|do(X));两者一般不相等(除非满足可识别性条件,如无混杂、有合法工具变量或后门集)。要么补上额外假设(一张你相信的因果图),要么补上额外数据(真实的干预/实验数据)。天下没有免费的因果。
这把"LLM 到底懂不懂因果"的争论一刀劈开。Zečević 等人在 Causal Parrots(2023)里给出了一个清醒的诊断:LLM 之所以能"谈论"因果,很可能是因为它的语料里本来就写着大量因果事实(人类把因果结论写进了文本)。模型是在复述一个"关于因果事实的元分布",而不是在计算因果。会背"吸烟致癌",不等于会算"让这个人戒烟,他的风险变化多少"。
既然低层数据装不下高层答案,那么想让模型学会干预与反事实,就必须把干预与反事实的信息,显式地放进训练数据(token 流)里。问题随即变成:这种"自带 do 与反事实"的数据,从哪里来?——答案,指向一个你能亲手掌控并反复读档的世界。
因果 Token 化到底是什么
一句话:不改变"预测下一个 token"这个训练机器,只改变 token 流里装的是什么。当 token 序列里显式地写着"做了什么干预、结果如何、以及同一世界换个做法会如何","预测下一个 token"就自动变成了"预测干预结果"和"预测反事实"。
落到实处,一条训练样本大致长这样(示意):
⟨obs sₜ⟩ ⟨do aₜ⟩ ⟨next sₜ₊₁⟩ ⟨reward rₜ⟩ … ⟨cf-replay seedₜ⟩ ⟨do aₜ′⟩ ⟨cf-next s′ₜ₊₁⟩ ⟨Δ⟩
注意:这与"把强化学习当序列建模"(Decision / Trajectory Transformer)是近亲但不同。后者把〈回报、状态、动作〉token 化后做自回归,靠条件(conditioning)生成动作;而因果 token 化坚持的是干预(intervening)与反事实——这一步的差别,正是下一节两篇 2025 年工作分野的地方。
已被 2025 年验证的两个锚点
"用下一个 token 预测去学因果"不是一个我提出的空概念——2025 年有两篇针锋相对却互补的工作,恰好把边界画得清清楚楚:纯观察,只到 L1;把 do 与反事实写进 token,就能上 L2/L3。
Butkus 等,《Causal Discovery and Inference through Next-Token Prediction》(NeurIPS 2025)
他们把线性高斯 SCM 的干预数据(含 do 算子)和反事实推断示例编码成字符串,训练一个 12 层 GPT-2 式模型做纯 next-token 预测。结果:模型学到的不是记忆,而是一套通用的因果推断算法——它能对训练时只见过干预数据、从没见过反事实的新 SCM,正确回答反事实查询。线性/MLP 探针能从残差流里以 >90% 精度解出 SCM 权重;反事实均值/标准差的绝对误差低至 ~0.01–0.03(接近编码精度上限)。
→ 结论:next-token 预测器完全有能力爬到 L2/L3——只要数据里真的含有 do 与反事实。
《A Causal World Model Underlying Next Token Prediction》(arXiv:2412.07446, 2025)
他们把 GPT 的注意力矩阵与结构因果模型建立数学对应,在 Othello、国际象棋这类纯观察(合法棋谱)上训练,并用零样本因果发现算法从注意力里重建因果图。发现很漂亮:模型确实隐式恢复了博弈的因果结构,且"因果结构置信度"越高、越守规则。但作者明确承认:这套框架只支持 rung-1 推断(关联/条件独立),并未证明干预或反事实能力。
→ 结论:纯观察数据里,next-token 最多学到因果"骨架",学不到干预/反事实——正好是 CHT 那堵墙的实证回声。
瓶颈从来不是架构,而是数据。Transformer + next-token 这台机器,天花板足够高(锚点 A 已证到 L3);限制它的是"训练语料里到底有没有真正的干预与反事实"(锚点 B 说明纯观察不够)。于是唯一的问题变成:去哪弄一座能无限、廉价、带真值地生产干预与反事实数据的矿?
模拟器 = 无限的干预/反事实数据引擎
这是全篇的枢纽。"模拟大自然"听上去像一个浪漫的支线,其实它是整条逻辑链上唯一能合法生产 L2/L3 数据的地方。理由只有两条,但都很硬。
- 干预是免费的。在你自己写的世界里,你可以对任意变量执行 do(a)——强制一个智能体做某件事、强行改变一处资源、掐断一条因果箭头,然后观测下游。真实世界里做一次干预要跑一次昂贵且有伦理约束的实验;模拟器里,它只是一次函数调用。
- 反事实也是免费的。因果推断的"根本难题"是:对同一个体,你永远只能观测到一种结局,另一种(反事实)已随时间永久丢失。但在模拟器里,你保存了随机种子(exogenous 噪声)——于是可以"读档":回到同一时刻、同一世界、同样的隐变量,只改动一个行动,重跑。Pearl 的溯因—行动—预测三步,在模拟器里就是"存档—改一步—重放"。
值得强调:这个闭环也正是 David Silver 与 Richard Sutton 在《Welcome to the Era of Experience》(2025)中描绘的范式转移——让智能体从自己与世界互动产生的经验流中学习,而不是从人类写好的静态语料里模仿。因果 token 化,给这条经验流补上了它最缺的两味:do 与反事实。
设计一个"数字自然":生存 · 资源 · 遗传
现在把引擎具体化成一个能跑的世界。它的每条规则都不是为了好玩,而是为了制造选择压力——让"会不会因果推理"变成一件生死攸关、因而可被演化衡量的事。
为什么"会因果推理"可能被选择出来
这不是凭空的类比。进化生物学里的社会脑假说 / 马基雅维利智能假说认为:正是社会互动的复杂性(预测同类、结盟、欺骗、反欺骗)驱动了灵长类大脑的膨胀。而预测"我若这样做,对手会如何反应""要是我当初没背叛,联盟还在吗"——本质上就是干预与反事实推理。于是有了一个可检验的形状:
核心猜想与可证伪的子猜想
一个好的研究纲领,必须能被杀死。下面先给出一句可以钉在墙上的核心猜想,再把它拆成四个由"已被部分证明"到"最危险"的子猜想,每个都配一个明确的证伪信号。
在一个可控、可回放的世界里,对〈行动、干预结果、反事实回放〉token 化后的经验做序列预测,会自发长出一个可迁移的因果世界模型(能正确回答 do(·) 与 what-if);并且这种因果能力,会可测量地提升智能体在多智能体生存竞争中的广义适合度。
| 子猜想 | 主张 | 度量 | 证伪信号 | 现有证据 |
|---|---|---|---|---|
| C1 因果可学性 | 把 do 与反事实写进 token,模型的干预/反事实精度显著超过纯关联基线。 | 干预、反事实的绝对误差 vs 观察基线;探针能否解出结构。 | 注入 do 数据后,仍无法在干预预测上超过关联基线。 | 强 Butkus 2025 玩具版已证 |
| C2 机制而非记忆 | 对没见过的干预与世界配置也能正确外推——学到的是算法,不是查表。 | OOD 干预/反事实误差;跨世界泛化;机制可解释性探针。 | 只会插值,换一个世界/未见干预就崩。 | 中 已泛化到未见 SCM 反事实 |
| C3 适合度优势 (演化 claim) | 同一生态里,因果型智能体的谱系存活/后代数显著高于关联型与 model-free 型,且随复杂度出现阈值 τ。 | 谱系存活曲线、后代计数、资源占有;τ 的位置。 | 无可测优势;或优势其实来自奖赏设计而非因果能力。 | 弱 最具原创性的空白 |
| C4 因果 sim-to-real (龙) | 模拟世界里学到的因果能力,迁移到真实/半合成的决策任务上仍然有效。 | 真实决策域上的干预决策质量、反事实预测校准度。 | 换到真实分布后因果能力完全失效。 | 未知 开放问题 |
C1、C2 已被 2025 年的工作大幅去风险;C3 是最有新意、也最适合 MVP 去抢的空白;C4(因果的 sim-to-real 迁移)才是真正决定这条路能否通向真实价值的关键,而它目前没有答案。任何声称"训练个模拟世界就能解决现实因果决策"的说法,都是在跳过这条龙。本报告的立场是:先在你完全掌握真值的世界里把 C1–C3 做扎实,再分阶段、带验证地逼近 C4——而不是假装它不存在。
如何准备数据
因果 token 化的数据配方,核心不是"多",而是"覆盖"。CHT 的那堵墙,会原封不动地出现在你的数据集里:如果某个变量你从没干预过,模型就永远学不会对它的 do。
每条经验记录什么
episode = [ (obs sₜ, action aₜ, do_flag, next sₜ₊₁, reward rₜ, death, lineage_id, rng_seed) , … ]
其中三个字段最关键:do_flag 标记这一步是"自然发生"还是"被外部强制干预";rng_seed 记录该时刻的外生随机噪声,这是日后能做反事实回放的唯一凭据;lineage_id 记录血缘,用来在演化实验里追踪基因/策略的存留。
| 数据类型 | 阶梯 | 怎么生成 | 为什么必须有 |
|---|---|---|---|
| 观察轨迹 | L1 | 让智能体自由行动,如实记录 (状态→动作→结果)。 | 打底:学到关联与世界的因果骨架(锚点 B 已证纯观察能到这里)。 |
| 干预轨迹 | L2 | 随机干预(强制随机动作,保证探索与可识别性)+ 主动干预(对特定变量做 do)。 | 没有 do 数据,就没有 do 能力。随机干预尤其重要——它是打破混杂、拿到可识别因果量的黄金标准(等价于"随机对照试验")。 |
| 反事实对 | L3 | 取一条已发生轨迹,用同一 rng_seed 回放,只改动某一步的动作,得到成对 (事实, 反事实)。 | 提供 L3 的直接监督信号与评估真值。真实世界永远拿不到这种成对数据——这正是模拟器的独门红利。 |
| 安慰剂/对照 | — | 随机化的"假干预"、打乱变量命名的对照集。 | 防止模型用机械记忆或伪相关"作弊"(见第 09 节的反面校验)。 |
先从单智能体、全可观测、低维、干预充分的世界起步(此时几乎一切因果量都可识别,便于拿干净的 L2/L3 真值做验证),再逐步加入多智能体、部分可观测、外生冲击。这样每一步的能力增长都能被干净地归因,也让 C1→C2→C3 的验证有清晰的推进次序。衡量数据质量的第一指标不是 token 数,而是"干预覆盖度":每个可干预变量、每个关键状态区域,是否都有足够的 do 样本。
如何验证:接近还是偏离
这里是与普通语言模型评估最不一样的地方。普通 LM 只能比困惑度;而你,因为手里握着模拟器的真值,可以逐阶梯、逐轨迹地量出"模型的因果预测离世界的真实因果有多远"。"接近还是偏离"不是感觉,而是一个可以算出来的数。
| 能力 | 验证问题 | 真值从哪来 | 指标 | 判据 |
|---|---|---|---|---|
| L1 关联 | 能否预测"自然会发生什么"? | 留出的观察轨迹 | 留出似然 / 下一步预测准确率 | 必要不充分:过了只说明没跑偏,不代表懂因果 |
| L2 干预 | P(Y | do(X)) 预测得准吗?平均处理效应(ATE)恢复得对吗? | 留出整段干预:训练时不给这个 do,评估时现场在模拟器里执行它取真值 | 干预分布误差、ATE 误差、决策后悔值(regret) | 显著优于"仅观察"基线 = 真的会 do |
| L3 反事实 | "当初换个做法会怎样"预测得准吗? | 同种子回放给出的逐轨迹反事实真值(金标准,仅模拟器独有) | 逐轨迹反事实误差、方向正确率、校准度 | 反事实误差随"有反事实训练"下降,且优于插值基线 |
| 泛化 | 换个没见过的世界/干预还成立吗? | 未见过的世界配置 / SCM(仿 Butkus 留出反事实查询) | OOD 误差、机制探针精度 | OOD 不崩 = 学到机制而非查表(C2) |
| 不变性 | 干预造成分布漂移后,预测还稳吗? | 多环境/多干预下的同一机制 | 跨环境不变性(对标 ICP,Peters & Bühlmann) | 真因果关系应在干预下保持不变 |
| 适合度 (C3) |
因果能力真的更能活、更能传基因吗? | 同生态多臂 A/B:因果 vs 关联 vs model-free | 谱系存活曲线、后代数、资源占有、阈值 τ | 显著存活优势,且能排除"奖赏设计"的解释 |
好指标最容易骗人。至少做三件事:①安慰剂干预——对不该有因果效应的变量做 do,模型应预测"无效应",若它照样编出效应,说明在幻想因果。②打乱变量命名——防止模型靠符号记忆而非结构推理(Butkus 的做法)。③对抗反事实——构造与训练分布最不像的 what-if,看它是外推还是崩溃。记住 Causal Parrots 的教训:能说对因果,不等于能算对因果——务必用只有算得对才能过的题去考它。
优点 · 缺点 · 机会 · 风险
把话摊开讲。这条路有一个别人难以复制的结构性优势,也有一条谁都还没驯服的龙。
优势 Strengths
- 模拟器提供无限、带标签、含真值的干预与反事实数据——正是 CHT 断言"观察数据里没有"的那部分。
- 评估客观:手里有反事实金标准,"对不对"能算成一个数,而非靠人评。
- 数据护城河来自世界引擎,而非爬取的文本——难被简单复制。
- 站在 2025 已验证成果(C1/C2)之上,起点不是零。
劣势 Weaknesses
- 因果 sim-to-real(C4)未被证明——这是真正的龙。
- 玩具世界的因果能否 scale 到高维、丰富语义,未知。
- "每条序列一个 SCM"式的表示可能泛化脆弱。
- 适合度/奖赏设计困难,易出现规格博弈(specification gaming)。
- 开放式演化算力开销大;C3 的因果优势难与其他因素干净隔离。
机会 Opportunities
- 世界模型被广泛视作LLM 之后的下一跃(LeCun / Genie / model-based RL)。
- 决策类场景价值巨大:运营、供应链、定价、实验设计、机器人、自主 agent。
- 与"经验的时代"大势高度契合,顺风而非逆风。
- "评估即产品":一个能答 do 与 what-if 的因果决策引擎本身就是卖点。
威胁 Threats
- 大厂高速推进世界模型/ALife(DeepMind Genie、Meta JEPA、Sakana ASAL),可能被吞并或抢跑。
- 押注单一归纳路径:邻近押注(纯 JEPA、纯 model-based RL)可能先到。
- "因果"主张极易被夸大,一旦兑现不了会反噬信任。
- 能反事实推理的自主体带来新的安全与治理问题。
相关工作地图:你不是一个人在战斗
这个构想坐落在五条正在汇流的河流的交点上。看清它们,既是站在巨人肩上,也是认清谁可能先到。
Pearl 的因果阶梯与因果层级定理立起了整套语言;Rubin 的潜在结果框架给了反事实的统计形式;Schölkopf 的因果表征学习追问"如何从数据里学出因果变量与机制";Peters & Bühlmann 的不变因果预测(ICP)给了跨环境验证的抓手。→ 提供理论地基与验证判据。
Decision / Trajectory Transformer 把〈回报·状态·动作〉token 化做自回归——最接近的近亲,但靠"条件"而非"干预",在随机环境里可能被回报的偶然性误导;Dreamer(潜空间想象)与 MuZero(可规划的学习模型)会预测行动结果,但通常不做同种子反事实、也不暴露显式因果结构。→ 证明"行动可 token 化",也标出因果化尚缺的一环。
LeCun 的 JEPA / 能量模型 / 自主机器智能主张在潜表示空间里做"行动条件下的预测 + 规划",并明确认为纯自回归 token 预测不足以支撑稳健世界模型;DeepMind Genie 系列展示了可动作控制、可游玩的生成式世界模型。→ 与本构想同源,且 Genie 类系统本身可充当数据引擎。
Butkus 等(NeurIPS 2025)正面证明 token 化 do+反事实可让 next-token 学到通用因果推断;arXiv:2412.07446 反面标出纯观察只到 rung-1;Causal Parrots 警告"会谈因果 ≠ 会算因果"。→ 本报告中心论点的直接实证锚点。
Neural MMO(大规模生存)、Melting Pot(社会困境与泛化)、AI Economist(经济体)提供多智能体生态;ASAL 用基础模型自动搜索并度量开放式/新奇性;Evolution Through Large Models、FunSearch、AlphaEvolve、ShinkaEvolve 把 LLM 当演化算子;POET 与 novelty search 给出"共演化环境与智能体、不设死目标"的开放式方法论。→ 现成的世界与演化工具箱。
更大的图景:经验的时代
把镜头拉到最远,这件事是一次范式转移的一个具体切口。
Silver 与 Sutton 在《Welcome to the Era of Experience》(2025)里说:下一代智能不会主要靠模仿人类写下的静态数据,而会靠与世界互动产生的经验流,以及接地的(grounded)奖赏来学习。Sutton 更早的《苦涩的教训》则反复提醒:能利用算力去搜索与学习的通用方法,终将胜过手工雕琢的知识。
把这两条放在一起,本报告的主张就有了它的历史位置:与其手写因果图,不如让一个大模型在海量、可干预、可回放的模拟经验里,自己长出因果。因果 token 化,正是把"经验流"升级为"可做实验的经验流"的那一步。
大语言模型学会了世界怎么"说"。
下一步,是让模型学会世界怎么"动",以及它本可以怎样"不同"。
MVP 与 90 天验证
好消息:这个构想的 MVP 天生便宜且干净。因为世界是你写的,真值免费;因为猜想已拆成带证伪信号的子命题,每一步都能明确回答"继续还是收手"。
最小可行闭环
一个小的、全可观测、可控的多智能体网格"培养皿"(有限资源 + 有限寿命 + 带变异的繁殖)→ 把每个 episode 按因果 token 化记录(含显式 do 与同种子反事实回放)→ 训练一个决策/世界 transformer → 对着模拟器真值逐阶梯评 L1/L2/L3 → 在同一生态里做智能体 A/B。整套东西一两个人、几张卡即可跑起来,且每个环节都对应一个上文定义好的指标。
可控世界 + 因果 token 化日志 + L1/L2 基线
搭出最小世界与记录管线,注入随机/主动干预数据,在你自己的世界里复现"Butkus 式"结果:模型对 do(·) 的预测显著超过纯观察基线。
同种子回放 + L3 评估 + 泛化测试
加入反事实回放与 L3 监督/评估;在没见过的世界配置与干预上测泛化,确认学到的是机制而非查表。
多智能体生态 + 适合度 A/B + 开放式度量
开放到多智能体生存竞争,做因果 vs 关联 vs model-free 的谱系 A/B;借"ASAL 式"基础模型评估器度量世界的开放性与新奇性,寻找适合度阈值 τ。
产品的北极星是一台能回答"我若这样干预,会发生什么;当初若不这么做,又会怎样"的因果决策引擎。落地次序要诚实地尊重 C4:先在你完全掌握真值的合成/半合成决策域(供应链与库存、定价与促销、实验/AB 设计、运营调度)交付可验证的价值——这些领域本就有大量可干预、可回放的结构;再分阶段、带验证地向真实世界的因果决策迁移。先卖"在可仿真的域里做对因果决策",而不是一步登天承诺"通用因果 AI"。
把训练目标从"下一个字"改成"下一个干预结果与反事实"(第 03 节);因为 CHT,这只能靠把 do 与反事实写进数据(第 02、04 节);而可回放的模拟自然,是免费生产这种数据的唯一引擎(第 05 节);用生存竞争检验"因果是否被选择"(第 06、07 节);靠模拟器真值逐阶梯验证"接近还是偏离"(第 08、09 节);90 天内用 A/B 与杀死信号把猜想逐条证伪或证成(第 13 节)。
参考文献与延伸阅读
带链接者为本报告直接查证所用;其余按惯例署名。分组对应第 11 节的五条河流。
因果基础
- Bareinboim, Correa, Ibeling, Icard. On Pearl's Hierarchy and the Foundations of Causal Inference. — causalai.net/r60.pdf(因果阶梯与因果层级定理)
- Schölkopf 等. Toward Causal Representation Learning. — arXiv:2102.11107
- Peters, Bühlmann, Meinshausen. Invariant Causal Prediction (ICP).(跨环境不变性作为验证判据,2016)
- Rubin / Neyman. 潜在结果框架(Potential Outcomes).(反事实的统计形式)
next-token × 因果(本报告核心锚点)
- Butkus 等. Causal Discovery and Inference through Next-Token Prediction. NeurIPS 2025 — OpenReview · Poster
- A Causal World Model Underlying Next Token Prediction: Exploring GPT in a Controlled Environment. — arXiv:2412.07446
- Zečević 等. Causal Parrots: LLMs May Talk Causality But Are Not Causal. — arXiv:2308.13067
序列建模 × 决策 · 世界模型
- Chen 等. Decision Transformer: RL via Sequence Modeling. — arXiv:2106.01345
- Hafner 等. Dream to Control / Dreamer. — arXiv:1912.01603;MuZero(Schrittwieser 等,2020)
- LeCun. A Path Towards Autonomous Machine Intelligence / JEPA & 潜变量能量模型. — arXiv:2306.02572
- DeepMind. Genie: 生成式交互环境 / 基础世界模型. — Genie 2 · Genie 3
多智能体 · 人工生命 · 演化
- Suarez 等. Neural MMO 2.0. — arXiv:2311.03736
- Leibo 等. Melting Pot. — DeepMind
- Zheng 等. The AI Economist.(多智能体经济体,Salesforce)
- Kumar 等(Sakana AI 等,与 Ken Stanley、MIT). Automating the Search for Artificial Life with Foundation Models (ASAL). — sakana.ai/asal · arXiv:2412.17799
- Lehman, Meyerson, …, Stanley. Evolution Through Large Models (ELM). — Springer;FunSearch / AlphaEvolve / ShinkaEvolve(LLM 驱动的演化式程序搜索)
- Lehman & Stanley. Abandoning Objectives: Evolution through the Search for Novelty Alone. — PDF;POET(Wang 等,共演化环境与智能体)
更大的图景
- Silver & Sutton. Welcome to the Era of Experience. 2025 — PDF
- Sutton. The Bitter Lesson. 2019
- Dunbar(社会脑假说)/ Byrne & Whiten(马基雅维利智能)——"社会复杂度驱动认知演化"的生物学背景。