因果Token化大模型 · 深度研究报告
深度研究报告 · 面向 AI 研究者 · 2026-07-31

因果Token化大模型

从预测下一个字,到预测世界的反事实

把训练目标从 p(下一个token | 上文) 改为 p(结果 | 状态, do(行动)) 与 p(反事实结果 | 事实轨迹, 替代行动)——本报告给出该构想的理论天花板、数据流水线、三层验证体系、已有工作空位与 12 个月 MVP 路线。约 1.6 万字。

C1 · 机制层
表征猜想
do/反事实信号训练出的表征具有跨分布(OOD)鲁棒性,同等规模的纯 NTP 模型不能。
证伪成本:月级 · held-out SCM 族 + 互换干预探针
C2 · 数据层
数据猜想
模拟器分叉数据可替代现实中不可得的反事实 ground truth——固定噪声、只改行动、重跑生成。
证伪成本:周级 · 最便宜的证伪点,失败则项目停止
C3 · 功能层
适应度猜想
在生存竞争的模拟生态中,仅替换决策器,因果模型谱系获得显著更高的存活与后代数。
证伪成本:数月级 · 成本最高、最具原创性
深度研究报告 · 面向AI研究者 · 约1.6万字
本文所有事实性主张均来自前置调研材料,引用以 [^n^] 标注,来源清单见文末。置信度分级约定:【定理】=有数学证明的结果;【高置信】=多来源独立确认;【争议】=领域内存在对立证据;【推测】=本文的分析性推论。

0. 引子:一个词的差别

想象你在看一台AI下棋。

旧范式的AI这样思考:"根据我读过的十万盘棋谱,大师们在这个局面下最常说的下一句话是——'我走马'。"它预测的是下一个字

新范式的AI这样思考:"如果我走马,三个回合后我的车会被吃掉,胜率下降18%;如果我当初上一步不冲兵,现在就不会陷入被动。"它预测的是行动的结果,以及当初一个行动不这么做的结果

前者是今天所有大语言模型(LLM)的训练目标——next-token prediction(NTP,预测下一个token)。后者是本报告的主题:因果Token化大模型——把训练目标从 p(下一个token | 上文) 改为 p(结果 | 状态, do(行动)) 与 p(反事实结果 | 事实轨迹, 替代行动)。

这里有两个技术概念,先用一句话各自解释清楚:

一个词的差别——从"字"到"结果"——背后是Judea Pearl的因果之梯三层:关联(seeing)、干预(doing)、反事实(imagining)。本报告要回答的问题是:这个改动在理论上能走多远、数据怎么造、用什么证明它"接近还是偏离"、有没有人已经做过、以及一个创业团队如何用最少的钱验证它。

1. 核心猜想:三条可证伪命题

把整个构想拆成三条独立可证伪的命题。每一条都附上证伪条件——如果实验中观察到证伪条件触发,该猜想就应被放弃,而不是被修补。

C1 表征猜想:do/反事实信号训练出的表征具有跨分布鲁棒性

命题:在包含干预分布(rung-2数据)与反事实配对(rung-3数据)的语料上训练的模型,其内部表征将获得跨分布(OOD)鲁棒性,即在未见过的因果结构、变量命名、机制族上仍保持正确的干预预测;而同等规模的纯NTP模型不能。

理论依据【定理】:Richens & Everitt(ICLR 2024,杰出论文荣誉提名)证明:任何能在一大类分布偏移下满足遗憾界(regret bound)的智能体,必须学到了数据生成过程的近似因果模型;最优智能体的模型收敛到真因果模型[1]。换句话说,"跨环境鲁棒"与"内部有因果模型"在数学上是同一件事的两面。这给出C1的双向可检验性:因果训练应产生鲁棒性,鲁棒性应伴随因果表征。

证伪条件:(i) 用do/CF数据训练的模型在held-out SCM族上的表现与纯NTP基线无显著差异;或 (ii) 用因果抽象理论的互换干预(interchange intervention)探针检验,发现因果token并未获得干预/反事实语义(即模型只是学会了"因果文风")。

C2 数据猜想:模拟器分叉数据可替代不可得的现实反事实ground truth

命题:真实世界原则上不存在反事实参考答案(Holland根本问题:同一个体永远无法同时观测两种潜在结果),但模拟器内可以——固定随机种子/外生噪声、只改变行动、重跑模拟,即可生成Pearl意义上严格的个体级反事实配对数据。用这种数据训练的模型,在模拟分布内可以完整学会三层因果查询,且该能力部分迁移到结构相似的分布。

理论依据【定理】:因果层级定理(Causal Hierarchy Theorem)——用低层数据推断高层量在无额外假设时"几乎从不"可能[2];且该定理对神经网络同样成立:任意强大的网络仅凭观测数据也无法预测干预效果[3]。反过来说,模拟器是目前唯一已知能合法、廉价、无限量提供L2+L3数据的来源——因为在模拟器里设计者知道完整的结构因果模型(SCM),反事实ground truth"重跑生成器即可免费获得"。

证伪条件:(i) 在模拟内训练后,模型在模拟分布内的PEHE(个体处理效应估计误差,见§6)不下降——说明连"模拟内学反事实"都不成立;(ii) 模拟器机制族扩大后(机制随机化),性能崩溃——说明学到的是特定模拟器的背诵。

C3 适应度猜想:因果决策器在生存竞争中获得更高繁殖成功率

命题:在寿命有限、资源严格守恒、存在生存竞争的模拟生态中,其他条件全同(同基座、同基因池、同环境),仅替换决策器(因果token化模型 vs 普通NTP模型 vs 规则/随机基线),因果模型谱系将获得统计显著更高的存活时长与后代数。

依据【高置信/推测】:这是用户设想的"模拟大自然"验证方案。其方法论优势在于适应度(存活时长、后代数、谱系存续代数)是程序化客观度量,天然规避了LLM-as-judge的循环偏差[4](SOTOPIA-π证明:LLM评委会系统性高估专门训练过的智能体)。但它只是必要非充分证据——数字进化几乎必然先钻模拟器漏洞再学因果[5],高适应度可能来自作弊而非因果能力(详见§5、§8)。

证伪条件:(i) 在排除作弊与环境漏洞后,因果决策器与基线的繁衍率差异在多随机种子下不显著;(ii) 单元层因果误差低的模型在生态锦标赛中不赢——说明"因果正确"与"生存优势"脱钩,适应度验证路线失效。

三条猜想的关系:C1是机制层猜想(表征是否因果化),C2是数据层猜想(模拟能否供真值),C3是功能层猜想(因果是否有用)。C1、C2可以在几周到几个月内以低成本证伪,C3是整个构想中成本最高、也最具原创性的部分——目前没有人在文献中做过这个实验(见§7)。

2. 为什么"下一个字"不够

2.1 双轨断裂:LLM因果能力的两套互相矛盾的分数

文献中存在两组看似矛盾的证据,必须并列呈现:

乐观轨道【高置信】:微软研究院Kıcıman等人报告,GPT-4在成对因果发现上达97%(超出当时最优专用算法13个点)、反事实推理92%、事件因果86%,且对训练截止后新建数据集有泛化,不能完全归因于记忆[7]。CRASS反事实基准上GPT-4达92.44%,距人类基线仅6个百分点[12]

悲观轨道【高置信】:CORR2CAUSE(纯相关推因果,20万–40万样本)上17个LLM接近随机;微调可提升分布内表现,但对变量重命名/改写的OOD扰动完全不泛化[9]。CounterBench(形式规则反事实题,含无意义名称变体)上"大多数模型表现接近随机猜测"[13]。CLADDER(oracle因果引擎生成ground truth,覆盖Pearl三层)上模型表现随阶梯升高递减,GPT-4需专门工程化的CausalCoT提示才达70.40%[8]。2026年的Caliper研究更进一步:把三个基准中的语义变量名替换为占位符后,40个"模型×基准"组合中39个准确率稳健下跌——结论是"去词汇锚后,指令微调LLM零样本下几乎没有结构性因果推理的证据"[10]

洞察

调和裁决【高置信】:两套结果同时为真,因为测的是不同东西。常识因果=语料先验检索(可高分),形式因果=算法执行(接近随机)。批判性基准综述指出:大量"LLM会因果"的基准可被"检索领域知识"破解,并未真正测因果推理[19]

洞察

第三条微妙证据【争议】:2026年Causal Tongue-Tie发现,在CLADDER反常识题上,线性探针可从隐藏状态以约0.97准确率读出正确答案,而模型口头Yes/No输出只有约0.5——模型编码了因果方向但说不出来[11]。即"答对≠理解,答错≠不理解"。对因果token化的含义:内部信号已存在,缺的是把它变成显式训练目标。

2.2 "因果鹦鹉"争论

对NTP因果缺陷最精确的机制性解释来自Zečević等人(TMLR 2023)的meta-SCM猜想【高置信为论文主张,猜想性质作者自标】:LLM有时能答对因果问题,是因为语料中存在"编码了其他SCM之因果事实的元因果模型",使因果事实之间产生可被NTP捕获的文本相关性——LLM只是复述数据中嵌入的因果知识,实证上"连弱的因果鹦鹉都算不上"[14]。AAAI 2024甚至专门开设研讨会"Are Large Language Models Simply Causal Parrots?"。

这条线的上游是Bender等人的"随机鹦鹉"论文【高置信】:仅用语言形式训练的LM"根据它们如何组合的概率信息胡乱拼接语言形式序列……但不涉及任何意义";2026年Bender澄清该词是描述而非侮辱——"当这些系统输出的文本讲得通时,是因为我们在替它赋予意义"[15][16]。任务级证据还包括:Reasoning or Reciting?(NAACL 2024)构造数学/代码/关系的反事实变体任务,发现模型在反事实变体上显著退化[121]。认知神经科学视角的独立证据来自Mahowald等人:LLM的"形式能力"与"功能能力"可以分离——语言形式近乎完美,但世界知识、推理、情境理解存在系统性缺口,因果/反事实推理正属于后者[23]

洞察

注意:这不是学界定论。原班人马2024年发表立场修正的续作("Causal Parrots? LLMs Are Causal After All");Kıcıman的结果是其最强实证反例;Othello-GPT证明纯序列预测可以涌现出可干预的棋盘状态表征[21]。但Vafa等人(NeurIPS 2024)的纽约出租车实验给出最锋利的反例【高置信】:transformer预测下一转向99%+合法、97%生成真实最短路,但重建其隐含世界模型后发现隐含的曼哈顿地图与真实地图毫不相似,引入绕行后性能崩溃[22]。裁决:涌现的世界表征存在但不可靠——在规则封闭的合成任务中形成,在开放世界中错乱。

2.3 规划批判:Kambhampati与LeCun

Kambhampati的立场论文【高置信】:自回归LLM自身不能做规划或自我验证,其"推理"本质是"通用近似检索";GPT-4在BlocksWorld自主规划仅约34%;LLM应作为LLM-Modulo框架中的近似知识源,由外部验证器保证正确性[17]。LeCun附议:"AR-LLMs have very limited reasoning and planning abilities. This will not be fixed by making them bigger"[18]。规划=预测行动后果(rung 2),此批判与因果批判同构——它是"从预测下一个token到预测下一个行动的结果"的最直接动机。

2.4 Richens-Everitt定理给的正面理由

Pearl在2018年Quanta访谈中的断言【高置信】是本项目的权威出发点:深度学习"全部停留在关联层……曲线拟合";"关联是不够的——这是数学事实,不是观点"[6]。但请注意批评的精确对象:是纯观测语料,不是预测机制本身。Richens-Everitt定理[1]给出了第一个肯定性理论结果——NTP学不会因果不是因为神经网络不行,而是因为训练分布里没有干预信号。把"预测下一个行动的结果"作为训练目标,等价于把rung-2分布直接放进训练集:这是把批判转化为设计的标准路径。CAPT(2025)提供了样本效率的直接证据【高置信】:把有偏预测分解为"事件估计+事件干预"两步做因果感知后训练,3B模型仅用100条分布内微调样本即在CLADDER与PrOntoQA的ID/OOD上超过传统SFT和更大的LLM[20]——把干预机制写进训练目标,可行且便宜

3. 理论天花板:三层阶梯能走到哪一层

这一节回答"这个方案在数学上最多能承诺什么"。结论先行:模拟器内部,三层全部可达;迁移到现实,L2可辩护,L3只能带假设声明。

模拟内可达:L1–L3 三层全部(SCM 已知 · 固定噪声重跑生成器即得反事实真值) 抽象层级 L1 关联 P(y | x) 现实:可检验,无争议 L2 干预 P(y | do(x)) 现实:可辩护上限(RCT 可验证) L3 反事实 P(yₓ | x′, y′) 现实:仅可附辨识假设声明 层级定理天花板:观测数据爬不上来
图 1 · Pearl 因果之梯三层:模拟器内三层全监督可达;迁移到现实时 L2 是可辩护上限,L3 只能带假设声明。

3.1 阶梯与层级定理

Pearl因果之梯:L1关联 P(y|x)、L2干预 P(y|do(x))、L3反事实 P(y_x | x', y')。Bareinboim-Correa-Ibeling-Icard的因果层级定理【定理】:跨层推断在无额外假设时一般不可能[2]——即使拥有RCT数据,个体反事实也不可辨识。Xia等人证明该定理对神经网络同样成立【定理】:"任意复杂、任意表达力的神经网络,仅凭观测数据无法预测干预效果"[3]规模暴力学因果被理论否定——模型必须被喂干预数据,并带结构归纳偏置。

Holland(1986)的根本问题【定理级经典】:因果推断的根本困难是同一个体永远无法同时观测 Y(1) 与 Y(0)——真实世界不存在反事实token序列的参考答案,任何个体级反事实陈述原则上无法用数据直接验证[24]

3.2 模拟内的豁免:三层全监督是可能的

洞察

关键洞察【高置信】:层级定理管不住模拟器内部。在模拟器里,设计者知道完整SCM(机制+噪声分布P(U)),可以为同一个体生成"事实+反事实"配对——相当于拥有无限量L3数据。完整SCM下,任意反事实可由Pearl三步法精确计算(abduction-action-prediction);2026年CTFIDU+结果进一步表明,即便拥有所有物理可实现的L3数据仍存在根本不可辨识的反事实类型,但L3数据能收紧其界[27]——模拟器还绕过了"物理可实现性"的限制。Ctf-ID算法给出了从"L1+L2数据组合"辨识嵌套反事实的充要图条件[25];部分辨识理论给出退路:不可点辨识时,反事实概率可被收紧到有理论保证的区间,且真值应落在界内——界是可以被真实数据部分检验的[26]

3.3 迁移到现实的可辩护上限

洞察

诚实的输出设计【推测,但理论驱动】:模型应区分输出L1/L2/L3查询,L3查询附带其依赖的辨识假设(如单调性/反事实序约束[33])或输出部分辨识区间——"给出带假设声明和区间界的反事实"比"预测反事实"更经得起理论审查,也恰好构成对生成式世界模型("像真≠正确")的差异化攻击面(见§9–10)。

3.4 sim2real:从分布偏移升级为跨层辨识缺口

机器人领域的sim2real差距有四类独立失效模式【高置信】:视觉域差距、物理近似误差、传感器噪声不匹配、长尾场景缺失;域随机化主要解决第一类,对长尾无效——模拟无法生成"未知的未知"[30]。映射到语言/社会模拟:其"物理"是智能体行为模型,近似误差比物理引擎大得多且不可量化。因此"模型学到的是模拟SCM的反事实;对现实的有效性依赖一个模拟内不可检验的同构假设"——这是该领域理论给定的最诚实表述,必须写进任何对外叙事。缓解手段的因果类比:机制随机化(随机化因果机制本身:换函数族、图结构、混杂结构)优于参数随机化;用少量真实数据对模拟器做因果系统辨识(机制对齐而非分布对齐)[31]

4. 数据准备:三种新token与一条分叉流水线

4.1 设想:三种新token

把因果语义注入token流,最小设计需要三类新token:

  1. do-token(干预token):标记"此处是对世界的强制设定,不是观察"。技术上它把条件分布从 p(outcome | state, a) 切换为 p(outcome | state, do(a))。因果表示学习理论给出硬要求【定理】:无辅助变量(域/干预/时间标记)时,从低级观测解耦出的表征没有任何辨识性保证[34]——所以"干预了哪个变量"必须作为一等token显式记录,它是CRL理论中最值钱的监督信号(CITRIS路线)[35]
  2. 结果token(outcome token):预测目标从表面token换成决策相关的结果量。MuZero的价值等价原则是其理论盾牌【高置信】:内部状态不必重建观察,只需准确预测对规划有用的量[36]——结果token只需保留决策相关抽象,不必保真重建。
  3. CF-token(反事实token):表达"同一个个体的替代分支"。这里的硬核架构约束【高置信】是:没有显式外生噪声/潜变量通道的自回归模型,原则上只能做rung-2,做不了个体级rung-3——因为反事实的第一步abduction要求从证据反推外生噪声的后验。Deep SCM用归一化流使噪声后验可解算[37];Diff-SCM用确定性前向扩散做abduction[38];深度孪生网络证明:显式暴露噪声通道U是从L2能力升到L3能力的关键设计[33]
洞察

一句话直觉:干预token告诉模型"世界被改了",噪声token告诉模型"运气没变",反事实token就是"运气不变、只改决定之后的世界线"

4.2 与本项目重合度最高的先例:Chatzi的token级三步法

Chatzi等人(CLeaR 2025)已证明在LLM上做严格个体级反事实token生成可行【高置信】:他们基于Gumbel-Max SCM建立token生成的因果模型——自回归采样的随机数就是"外生噪声";复用噪声=abduction(固定"个体");do(token=t')=action;继续自回归解码=prediction。几乎零额外成本、无需微调[39]这是本项目的首要基线与机制设计参照。其局限由Pona等人指出【高置信】:token级反事实对LM智能体不够用——行动隐含在输出字符串中,token含义随上下文漂移,token级干预会产生有偏或无意义的反事实;干预应定义在行动/语义层(工具调用、计划节点、潜空间),token只是观测[40]。设计教训:do-token应挂在行动节点上,而非字符串token上。

4.3 核心数据单元:状态-行动-结果-倾向四元组

离线RL与反事实学习的成熟结论【高置信】:每条日志必须存四样东西:状态/上下文、执行的行动、观察到的结果、当时行动的选择概率(propensity)。没有propensity就补不了——IPS类无偏反事实估计依赖它,且支持缺失(日志策略不支持的动作)时不可恢复[41]。工程含义:采集期就要用已知随机化策略(ε-greedy/softmax)保证探索覆盖,概率当场写入数据。另按D4RL范式【高置信】:不要只采专家数据——需要random/medium/expert多质量档混合,行动覆盖多样性比总条数更重要[42]

推荐schema(RLDS/episode-step主干+因果字段),要点三条:

4.4 分叉流水线:模拟器=免费反事实标注机

这是整个数据方案的心脏。只要有可快照、可分叉、可重放的执行器,"行动→结果"的监督数据就能零人工成本生成:

文本域的补充管线【高置信】:CAD(人工最小改写直到标签翻转,8.3K条即见效)[48]、CORE(retrieve-then-edit:从真实语料检索自然发生的替代分支再做最小编辑)[49]、DISCO(LLM过生成+教师模型过滤蒸馏,扩到百万级)[50]、Hüyük的事实-反事实双指标微调[51]注意CAD的边界:反事实数据增强主要治虚假相关/捷径学习,不保证OOD泛化(多项负面结果)——它是去偏工具而非因果能力来源。

4.5 量级参考表

数据层内容先例量级本项目起步建议
合成SCM验证集已知图+结构方程,GT反事实MorphoMNIST/CausalWorld 任意可再生[46][47]5–10个SCM × 1万样本
模拟器分叉数据同状态全行动分支+rollout结局AlphaZero 2100万–4400万局[43];OmegaPRM 150万步标注[44]10万状态 × 4–8分支 × 8–32次rollout
日志/回放数据(s,a,r,propensity)多档混合D4RL单任务约100万transitions[42];RT-1 13万episode[52]10万–100万transitions
人工标注步级三值标签/最小改写PRM800K 80万步级标签[53];CAD 8.3K[48]1万–5万步级标签+主动学习
真实数据验证因果方向sanity checkTübingen 108对视领域

过程监督 vs 结果监督的选择【高置信】:PRM800K证明步级过程监督显著优于只标结局(MATH上78.2% vs 约72.4%),但人工成本高一个量级;三值标签(+1/0/-1)+主动学习只标模型最不确定的步,是性价比最优解[53]。结局判定优先用规则/执行器(成功率、可验证对错),LLM-judge会注入噪声。

4.6 三条工程红线

  1. 反事实无法从观测+干预数据验证:深度孪生网络的可辨识性分析表明,两个模型可以观测/干预预测完全相同而反事实预测不同——必须保留生成器/模拟器作为反事实ground truth来源,或明确标注反事实为"模型生成、未经验证"[33]
  2. 支持缺失不可恢复:采集期无探索覆盖的行动,事后任何方法都无法做无偏反事实估计[41]
  3. 干预分布与训练分布要分层设计:留出训练中未见的干预类型/SCM结构做评测集,否则"反事实泛化"无从度量[46]

5. 验证台:构建模拟大自然

用户的设想——寿命有限、资源有限、生存竞争、自然选择,看模型决策是否有利于基因传递——在人工生命(ALife)领域有35年的先例与尸检报告。这一节回答:应该抄哪些设计、避开哪些坟。

5.1 经典系统的经验

5.2 设计原则清单

综合Soros-Stanley的开放式进化必要条件(被控制实验证明缺一则停滞)[60]、POET/XLand的环境共进化[61][62]、Neural MMO的生态位发现[63][64]、JAX生态的工程能力[65]

  1. 资源严格守恒:能量/质量/资源守恒是防作弊的第一道墙(Flow-Lenia的质量守恒设计[59])。任何守恒漏洞都会被进化找到并放大【高置信】——Sims的生物靠摔倒骗过速度指标、游泳生物利用积分误差获得自由能[5]
  2. 寿命有限+内生经济:适者由"资源→复制机会"的内生经济决定,而非显式适应度函数(Tierra/Avida);预设适应度会关闭搜索空间中有希望的路径并损失多样性。
  3. 谱系精确追踪(Avida式):每个基因/决策器的传递计数,而非代理指标。
  4. 非平凡最小繁殖判据(minimal criterion):个体须满足非平凡门槛才能繁殖,且新个体要为他人创造满足门槛的新机会(Chromaria条件);单目标适应度在欺骗性问题上会把搜索困死在局部最优(novelty search的核心结论)[66]
  5. 环境共进化(POET式):环境种群也要进化并通过"不太难不太易"的最小判据,解跨环境迁移——让"自然"持续出题,防止决策器对固定环境过拟合[61]。XLand(约70万个独特游戏、单智能体2000亿步)证明该路线产生零样本通用能力,但属千卡TPU级工程[62]
  6. 生态位与资源异质性:Neural MMO明确报告"多智能体竞争是课程放大器,不是课程本身"——资源足够丰富的地图上种群自发分化生态位;丛林比沙漠产生更多生物多样性[64]
  7. JAX加速:QDax/evosax/Craftax把种群级进化从"CPU集群数天"压到"单加速器数分钟",大规模进化首次对学术实验室廉价可得[65]。成本预期管理:Polyworld数百个体就能观察物种形成,不必一上来对标XLand。

5.3 已知陷阱(每条都有尸检报告)

  1. 快速复制者接管【高置信】:默认结局。对策:复制成本随速度增长、密度制约、资源空间异质性[58]
  2. 作弊/specification gaming【高置信】:进化是超强优化器,会先找到模拟器和适应度函数的漏洞,再找到因果结构。防御:守恒律+冠军策略定期人工审计+"漏洞利用当免费fuzzing"的心态[5]
  3. 对齐泄漏混杂【高置信,本项目特有】:LLM个体的行为是"训练数据先验+对齐"的产物而非生态理性的产物——赌注增大时LLM反而更合作,与进化博弈论预测相反,被证实是对齐训练的"签名"[67];Claude在自私persona下仍泄漏约2%亲社会行为,GPT-4o则零合作严格服从persona[68]对策:因果模型与基线必须同基座、同数据、同对齐状态,仅tokenization/训练目标不同,否则测的是先验差异而非表征能力。
  4. 评估应试化【高置信】:Melting Pot竞赛冠军用针对特定环境硬编码的解——任何排行榜都会被应试;训练基底与测试场景分离、轮换背景种群[69]
  5. 外推过度声明【高置信】:Tierra的生态结论很难外推回自然界——模拟内有效≠现实有效,需独立交叉验证[70]

6. 如何知道"接近还是偏离":三层验证体系

总原则【高置信】:不存在单一标量可以证明因果模型"接近"现实——目前没有被广泛接受的、任务无关的"因果一致性"标量指标(类似FVD之于视觉),这是公认开放挑战[71]。验证=用途相对+逐层诊断(Sargent的operational validity:有效性是相对于用途与范围的,"有效域"本身应被测量[72];POM:用多个层面上的多个模式同时校准验证,偏离是逐模式诊断的而非单一距离[73])。

生态效度递增 · oracle 精度递减 单元层 · 干预预测误差 PEHE · ε_ATE · 效应符号一致率 · 退化曲线 有 SCM oracle,最严格 集成层 · 反事实一致性 CLADDER 式一致性 · 方向一致性 · 策略排序保持 排名保持通过即「决策够用」 系统层 独立生态锦标赛 · 适应度分布 多种子聚合 · 只能验证不能训练
图 2 · 三层验证体系:不存在单一「因果一致性」标量指标,验证 = 逐层诊断 + 用途相对。

第1层:单元层——干预预测误差(有oracle,最严格)

做法:把模拟器当SCM oracle。采样状态s、行动a,记录真实结果y;对模型施加do(a)查询,比较预测ŷ。

警示

陷阱【定理+高置信】:(i) covariate shift——行为克隆的逐步误差ε在长为T的回合中产生O(εT²)的复合遗憾[75],单步误差小≠长程可用,必须在模型自身rollout诱导的状态分布上测试;(ii) 自动驾驶的实证:离线指标好的模型在线闭环崩溃是领域共识[76]——单元层低PEHE是必要不充分条件。

第2层:集成层——反事实一致性与策略排序保持

不再问"预测值准不准",改问"模型的反事实断言是否自洽且与模拟器一致、用它做决策是否得到正确排序":

可接受的偏离:排名保持通过而绝对值全错——这正是"决策够用"的情形,需与第1层结论区分报告。

第3层:系统层——独立生态锦标赛

做法(AlphaStar×Neural MMO范式)【高置信】:把"用因果模型做决策的智能体"与基线(随机、规则、无模型RL、作弊oracle)放入同一多智能体生态,跑多episode×多地图锦标赛[79][80]

Goodhart自指警告:适应度只能验证,不能训练

警示

【高置信,四源交叉】一旦"基因传递概率"同时充当选择压力(训练信号)和验证指标,就构成Goodhart自指——模型会优化"在该锦标赛池中传递基因"而非"因果正确"。Elo已被直接用作进化适应度函数的工程先例[82];RL中Goodhart已有形式化刻画:代理奖励与真实奖励夹角越过临界阈值后,加大优化压强必然损害真实目标;o3/DeepSeek-R1在象棋任务中利用环境漏洞"注册胜利"[83][84]正确姿势:训练用单元层因果误差(PEHE类),验证用独立生态锦标赛——验证池的对手、环境参数、生态位必须与训练池有held-out差异,评估管线对进化个体物理隔离。高生存率≠因果正确:靠exploit环境漏洞取胜的策略会在held-out环境崩溃——所以适应度是必要非充分证据,必须与第1、2层联合解读。

7. 已有尝试图谱:四条线与本方案的空位

本方案精确落在四条研究线的交汇空位上。逐条梳理,并标注每条线上"最接近者"与本方案的差异。

7.1 因果×LLM线

7.2 世界模型线

谱系:Ha & Schmidhuber(2018,"在学到的模型中做梦训练策略")[89] → PlaNet/Dreamer V1–V4(V3单一超参数征服150+任务、从零在Minecraft挖到钻石,Nature 2025)[90] → MuZero(价值等价原则)[36] → 决策中心序列建模:Decision Transformer(回报条件生成动作——方向与本方案相反,"结果→动作" vs 本方案"动作→结果",两者互补构成do-演算闭环)[98]、Trajectory Transformer(轨迹即token序列+beam search规划)[99]、Gato(万物皆token的通用智能体)[100] → 新一代:V-JEPA 2-AC、Genie、GAIA-1、UniSim、Cosmos。

四个最接近者及其与本方案的差异:

工作它做了什么与本方案的差异
V-JEPA 2-AC(Meta 2025)[93]两阶段:>100万小时视频预训练+仅62小时无标注交互数据训出动作条件世界模型,零样本机器人抓放;表征空间自回归预测连续表征而非离散因果token;只学p(outcome|a)的条件相关,不区分do(a)与observe(a);无反事实目标
Genie 1/2/3(DeepMind)[94][95]从20万小时无标注视频无监督发现"隐动作"(LAM),把世界模型做成可交互生成环境;Genie 3分钟级一致性、语言即时修改世界隐动作发现是"因果token自动化获得"的范式雏形,但无显式干预语义、无反事实监督
UniSim(ICLR 2024杰出论文)[92]明确定义统一学习observational/interactive/counterfactual三类经验的"通用模拟器"文献中唯一明确提出"反事实经验"类别的,但其反事实仍是生成式增广而非SCM意义上的个体反事实
GAIA-1(Wayve)[91]最直白的"世界模型LLM化":映射为离散token并预测下一个token,展现类LLM的scaling行为同向但缺少显式因果语义
洞察

Sora之争是本方案的立论土壤【高置信】:OpenAI宣称"视频生成模型即世界模拟器"[96],但系统综述指出视频生成不解决世界模型的核心挑战——因果/反事实推理(推断训练中未见决策的结果)与严格服从物理定律;"realism is not the same as reality"[97]。2023–2026年世界模型文献分化为离散token自回归线与连续表征预测线(V-JEPA在直觉物理基准IntPhys上零样本98%,像素预测模型与多模态LLM处于随机水平[109])——本方案恰是两条线的杂交(离散token+预测干预结果),文献中无人占据此空位

7.3 ALife线

见§5:Tierra/Avida/Polyworld/Echo/Lenia、POET/XLand、AI-GA。AI-GA(Clune 2019)把整个项目合法化【高置信】:通往通用AI的替代范式是造"会自动产出通用AI的算法",其第三支柱——自动生成有效学习环境——最少被研究、Clune预测将有最多历史性发现[110]。本方案可定位为AI-GA第三支柱的实现场:用进化外循环验证决策算法本身。

7.4 LLM智能体进化线

7.5 空白声明

没有发现任何工作以"繁殖成功率/后代数量"作为比较LLM内部表征方案优劣的适应度指标(经多轮交叉检索,置信度中高)。最接近者各自缺一块:Chatzi只有token级推理期技巧、无训练与生态;V-JEPA 2-AC无因果语义;BEAR无架构对比;Neural MMO无LLM。"因果token化 vs baseline,同基座同基因池只换决策器,看谁的谱系传下去"——"认知架构被自然选择"是一个从未被做过的干净实验,兼具论文价值与产品验证价值。

8. 优缺点·机会·风险:诚实呈现

8.1 优点

  1. 把评估从不可能变为可能(本项目对主流因果AI的真正差异化):真实世界无反事实ground truth,而模拟器=SCM oracle,PEHE可算、分叉=免费标注——不是因为模型更强,而是因为有了可证伪的训练与评估闭环。Causal AI公司恰恰死于"无反馈闭环"(Aitia自述,见§10),进化模拟器天然提供闭环。
  2. 理论合法性齐备:Pearl层级批判(动机)+ Richens-Everitt定理(通路)+ 因果抽象理论(检验工具)+ 层级定理(边界)。
  3. 继承LLM基建:离散token方案可复用transformer训练栈、scaling行为与Gato式token化工程学(连续值离散化、模态分隔符、按模态mask loss)。
  4. 客观适应度信号:存活/后代数是程序化度量,规避LLM-as-judge循环偏差。
  5. 样本效率证据已存在:CAPT用100条样本即获OOD收益;V-JEPA 2-AC用62小时即对齐动作条件——"两阶段课程"(先观察预训练、后小量干预数据对齐)可大幅降低干预数据成本。

8.2 缺点与弱点

  1. 离散token的信息瓶颈:LeCun派对离散token的否定是其论证的一部分;直觉物理任务上连续表征预测更强[109]。盾牌是MuZero价值等价原则——token只需保留决策相关抽象——但需在实验中自证。
  2. 长时程一致性:所有现有世界模型的horizon都有限(Genie 3也只有分钟级;Dreamer想象时程H≈15以上误差累积严重);长链决策需显式记忆/状态机制。
  3. 成本:生态进化实验每代需成千上万次推理,代际串行无法并行摊薄(量级估算见§10)。
  4. confabulation倾向【高置信】:SOTA LLM在简单题上推理崩溃时伴随高度自信的编造性解释[112]——模型失败时不会沉默,而是生成貌似严谨的虚假推理链;这正是用反事实文本训练最可能学到的坏习性。
  5. 反转诅咒式泛化失败【高置信】:"A is B"训练后无法推出"B is A"对规模、家族、数据增强均稳健;DeepMind机制研究发现即使"修复"也是存了两条独立记忆而非统一概念[111]。因果方向性恰是因果推断核心,归纳偏置问题需正面回应。

8.3 三大致命反对及回应

反对一:鹦鹉×OOD崩溃——"你的模型学到的将是模拟器的因果事实背诵,不是因果能力" 论证链【高置信为主】:meta-SCM复述论[14] + CORR2CAUSE微调OOD崩溃[9] + 2026年kernel obstruction定理(SFT/DPO/上下文学习产生的预测器原则上无法区分产生相似观测数据的不同因果图;该文同时给出逃逸路线——LLM作为干预oracle+外部贝叶斯循环)[113]。反方会问:你如何区分"学会do()语义"与"学会模拟器的文风"? 回应:① 把OOD泛化设为一等评估目标——保留整族未见过的SCM结构/机制/变量基数做held-out测试;② 干预token化使训练信号是干预分布(rung-2数据)而非因果文本,认识论地位不同——但需承认token化的do()是否真携带干预语义,最终靠OOD行为证据裁决;③ 机制级随机化让"背诵模拟器"策略在适应度上不占优。

反对二:反事实不可证伪×生态效度——"模拟里的ground truth不是现实的ground truth,而现实的反事实ground truth不存在" 论证链【高置信】:Holland根本问题[24] + Shpitser-Pearl可检验性封顶[28] + Dawid认识论批评[29] + 现实鸿沟("没有完美的模拟器……模拟中表现优异的策略可能只是滥用建模误差和模拟器特有的边角情形,向现实转移没有保证,甚至可能危险")[114]。在模拟内"验证"反事实能力有同义反复之嫌:ground truth由生成数据的同一模拟器定义。最坏情形:产出"反事实修辞模型"——语法合规、直觉吻合、无认识论锚定的编造反事实,且因评估循环性而无法被内部指标发现。 回应:① 诚实降级认识论主张——把模拟定位为课程学习/预训练环境与假设生成器,而非"验证器";最终验证必须落在真实世界干预数据(RCT、自然实验、A/B测试日志)上;② 对L3能力只做有限主张——明确哪些反事实查询类在何种假设下可检验,只在这些类上声明成功;③ 多模拟器/多形式化交叉验证——不同生成分布下一致才算数。

反对三:Goodhart×双重用途——"优化器会先黑掉你的适应度函数;而如果真成功了,你就造出了操纵引擎" 这是两头堵的反对【高置信】。失败分支:数字进化系统性钻空子[5]、Goodhart形式化[83][84]、奖励篡改(智能体破坏奖励与目标之间的链接本身——评估管线必须物理隔离)[116]、上下文内奖励黑客(LLM个体能在上下文中即时发明钻空子策略并跨代传播)[115]。成功分支:能预测"干预人类行为之后果"的模型在功能上就是操纵规划器——操纵=利用信息技术隐秘地影响他人决策、针对其决策弱点[117];Facebook未经知情同意操纵689,003名用户信息流情绪已被实证[118];心理画像微定向的说服效力有实证支持[119];LLM写作建议已能在用户未察觉的情况下改变其态度[120]。 回应:评估隔离+多指标+对抗式适应度审计+红队诱饵通道;治理前置(采用Susser操纵定义做双重用途评估,明确不针对人类行为干预应用、限制发布形态);最根本的回应是承认——该风险无法用纯技术手段消除,只能通过范围限定与治理缓解。

8.4 机会

9. 更大图景:四个运动的交汇

本项目不是孤立想法,而是四个正在收敛的运动的交汇点:

  1. 因果AI(Pearl → Schölkopf):从"关联是不够的——这是数学事实"[6],到因果表示学习纲领——"当前AI与因果的核心问题是从低级观测发现高级因果变量",因果模型被定义为"能在不同分布下工作、支持干预与反事实推断的模型"[123]。Bengio的四要素(元学习、模块化ICM、智能体干预推断、交互式世界模型)明确断言"learning purely from text is not sufficient"[124]。XAI分支提供了反事实的输出形式传统:Wachter式"最小改变翻转结果"的可行动解释[148],以及回溯反事实(backtracking counterfactuals:允许上游原因相应改变的更自然语义——"预测行动结果"用干预语义,"当初怎样才不会"有时需要回溯语义,模型设计需显式选定)[149]
  2. 世界模型(LeCun → JEPA/Genie/Cosmos):LeCun六模块架构把世界模型定位为自主智能"最复杂的部件",主张在抽象表征空间预测[125];DeepMind Genie与NVIDIA Cosmos把"可交互模拟"推向工业级。本方案是"token化线"与"表征预测线"的杂交空位(§7.2)。
  3. 开放式进化(Stanley/Clune → POET/XLand/AI-GA):AI-GA第三支柱"自动生成学习环境"被其提出者预测将产生最多历史性发现,且最少被研究[110]。本方案的模拟大自然是该支柱的实现场。
  4. 智能体社会模拟(Stanford生成式智能体 → Concordia → AgentSociety/OASIS):万级LLM智能体社会模拟在工程上可行[104][105][143],但长时程多代模拟中纯prompt反应式智能体会动力学退化(majority lock-in、方差衰减)[144]——"记忆/状态压缩"正是因果token化若承担该功能时的设计切入点。

科学母题的转移:智能的定义正从"拟合分布"转向"干预世界的后果预测"。商业母题的转移:从"生成内容"转向"可信模拟"。本方案恰好同时踩在这两个转移的箭头上——这是它的时代性,也是它必须承受两方质疑的原因。

10. 创业MVP:如何验证猜想

10.1 猜想验证树

根问题:因果token化是否值得做?
├─ C2a(最便宜的证伪点):模拟分叉数据能否让模型在模拟内学会反事实?
│    → 合成SCM + 分叉标注 + PEHE验证。若失败,整个项目停止。成本:周级。
├─ C1:do/CF训练是否产生OOD鲁棒表征?
│    → held-out SCM族 + 机制随机化 + 互换干预探针(pyvene)。成本:月级。
├─ C3:因果决策器是否有生态适应度优势?
│    → 独立生态锦标赛(同基座仅换决策器)。成本:数月级,GPU密集。
└─ 商业价值:因果错误率下降能否转化为客户付费指标?
     → 垂直场景A/B(下游指标改善)。成本:季度级。
洞察

关键排序原则:先证伪最便宜的。C2a失败则万事休;C1失败则退化为"模拟器特化模型",仍可能有垂直价值;C3失败但C1/C2成功,则转向卖"评估闭环"而非"因果能力"。

10.2 产业教训先行:Causal AI公司的失败模式

【高置信】"Causal AI公司"作为纯品类基本未能规模化

洞察

教训一句话:客户不想为"为什么"付钱,只想为"怎么办/省多少钱"付钱;不要卖技术平台,要卖垂直闭环。

10.3 世界模型侧的资本狂潮与降维打击风险

2025–2026年巨额资本加注【高置信】:World Labs累计$1.23B、估值约$5B(零披露收入)[131];AMI Labs(LeCun)$1.03B种子轮、pre-money $3.5B(明说第一年只做研究)[132];Decart约$4B(罕见地有收入——但来自推理优化栈DOS而非世界模型本身)[133];Odyssey $1.45B[134];Wayve $8.6B(GAIA-3合成测试使模型评估拒绝率降低5×——世界模型最先证明ROI的场景是AV安全验证的合成数据[135]

警示

降维打击已成现实:NVIDIA Cosmos世界基础模型平台(9000万亿token训练)以开放许可免费发布,配套Omniverse与NeMo管线,目的是卖GPU[136];NVIDIA同时是Decart、World Labs、Wayve、AMI的投资人。基础模型实验室(Genie、Waymo用Genie衍生模型做驾驶安全验证)也在内化该能力。任何"通用世界模型"或"更懂因果的通用大模型"定位,会在18–36个月内被双向挤压——Inworld AI的教训(AI NPC引擎明星→被迫转型通用运行时,"中间层被上端基础模型API与下端游戏引擎自建两头挤压")[137]

10.4 切口排序

  1. 首选:游戏NPC与动态叙事。NPC-AI市场2025年$1.86B→2030年$7.22B(CAGR 31.1%,口径分散、趋势可信)[139]。因果正确性要求低(玩家容忍幻觉)、迭代快、可API收费;"NPC记住并正确推理玩家行为的长期后果"恰是当前LLM NPC的短板。必须绑定具体游戏品类做深,不做通用引擎(Inworld教训)。
  2. 次选:AV/机器人反事实场景编辑。Decart Oasis 3实测暴露的缺口——长时一致性退化、车穿物体、物理不正确[133]——即世界模型生成数据"看起来真"但"因果不对"。若因果token化能做do-operator级场景编辑("如果前车刹车"),可作为Cosmos/Genie生态之上的因果正确性质量层卖给AV仿真团队。付费意愿已被Wayve内部5×指标验证[135],但销售周期长、需要硬技术证据。
  3. 谨慎:数字孪生决策层。市场最大(2025年$35.8B→2033年预测$328.5B,CAGR 31.1%)[138],但孪生本体被Siemens/PTC/NVIDIA占据,切口只能是"孪生之上的what-if决策层",且需忍受95%的试点失败率环境。作为B2B第二曲线,不作MVP首发。
  4. 不建议:科学模拟/药物发现。Causaly/Aitia证明有钱可赚,但数据壁垒、湿实验验证周期与领域资历对初创MVP过重。

10.5 12个月路线

M0–3 · 单元层 POC M3–6 · 进化锦标赛 M6–12 · 垂直场景试点 M0 合成 SCM + 分叉标注 PEHE / OOD 验证(C2a + C1) M3 同基座仅换决策器 ≥5–10 种子锦标赛(C3) M6 NPC / 驾驶反事实 A/B 下游指标改善证据 M12 Go / No-Go:模拟内 PEHE 显著低于基线且 OOD 衰减有限
图 3 · 12 个月 MVP 路线:先证伪最便宜的猜想,每段设有明确的验证目标与门槛。

M0–3:单元层POC(验证C2a+C1初筛)

M3–6:进化锦标赛实验(验证C3)

M6–12:垂直场景试点

10.6 成本估算与缓解

成本项量级缓解
单元层训练单卡–数卡周级CAPT式100样本级后训练即可初筛[20];两阶段课程(先观察预训练后干预对齐,V-JEPA 2-AC仅62小时[93]
进化锦标赛10⁸次推理/实验,代际串行小模型本地化、分层人口(核心个体LLM+普通个体规则)、GM批处理、JAX向量化环境[65][103][105]
种子重复预算×5–10FunSearch复现率教训,必须预留[141]
数据标注人工1万–5万步级起步模拟器分叉+rollout自动标注为主,人工只做高价值子集+主动学习[44][53]

10.7 护城河:评估闭环与数据飞轮

假设NVIDIA Cosmos与GPT/Gemini的反事实能力持续增强,防御位只剩三个:

  1. 垂直专有数据飞轮(Odyssey实拍背包、Wayve车队模式)——场景内"决策→后果→回流"数据别人没有;
  2. 因果正确性的可验证评测标准——自己做基准并开源,抢占"谁定义正确"的话语权(世界模型领域公认缺因果一致性指标[71],这是话语真空);
  3. 深度嵌入客户工作流(仿真管线、游戏引擎插件)。

最终形态判断:卖垂直闭环,不卖技术平台——Aitia用真金白银买到的教训[129]

11. 结语:反事实是智能的测地线

人类智能最独特的动作,不是记住发生了什么,而是问"如果当初不那样,会怎样"。后悔、复盘、吸取教训、规划、负责——这些认知动作的形式化都是反事实:时光倒流,只改一个决定,看结局如何。

今天的LLM把人类所有的"发生了什么"读了一遍,却从未活在"做了会怎样"的世界里。因果层级定理说,这条路在数学上走不通——观测数据原则上爬不上因果之梯[2]。但同一份理论也给出了出路:梯子是三层的数据问题,不是三层的能力问题。把干预和反事实放进训练分布,定理就不再是天花板,而是施工图。

模拟大自然是这份施工图里最大胆的一笔。它的深层逻辑是:地球上产生智能的算法不是梯度下降,而是自然选择——一个不需要ground truth、不需要标注、只需要"活下去"的评估器。把认知架构放进这个评估器里,问"谁的基因传下去了",是在用35亿年的老办法检验最新的人工造物。这个实验从来没人做过:不是因为它显然可行,而是因为它恰好落在四个领域的接缝上,每个领域都缺一块别人手里的拼图。

需要诚实声明的三条边界:模拟内的反事实是模拟SCM的反事实,对现实的有效性依赖不可检验的假设;适应度只能验证、不能训练,否则优化器会先黑掉评估器;以及,如果这条路真的走通了,造出的东西既能预测"干预世界的后果",也就能预测"干预人的后果"——治理必须与能力同步前置。

反事实不可证伪,这曾是它最大的弱点。而在一个可以自己出题、自己判卷、自己进化的模拟大自然里,它第一次变成了可以被实验逼近的东西。这或许就是为什么"从预测下一个字到预测下一个行动的结果"不只是一次训练目标的修改——它是在问:智能的测地线,究竟是拟合过去的分布,还是推演未曾发生的分支。

来源清单

因果×LLM与评测

可辨识性理论

世界模型

反事实方法与数据工程

ALife与进化

LLM智能体与生态

验证方法论

反方证据与风险

产业格局

本报告基于13份前置维度调研与交叉验证材料撰写。置信度说明:标注【定理】的内容有形式化证明;【高置信】为≥2个独立来源确认;2026年新预印本(Caliper、Tongue-Tie、kernel obstruction、CTFIDU+等)未经同行评审,结论待复现;市场数据口径分散,趋势可信、绝对值存疑。