因果Token化大模型
把训练目标从 p(下一个token | 上文) 改为 p(结果 | 状态, do(行动)) 与 p(反事实结果 | 事实轨迹, 替代行动)——本报告给出该构想的理论天花板、数据流水线、三层验证体系、已有工作空位与 12 个月 MVP 路线。约 1.6 万字。
深度研究报告 · 面向AI研究者 · 约1.6万字
本文所有事实性主张均来自前置调研材料,引用以 [^n^] 标注,来源清单见文末。置信度分级约定:【定理】=有数学证明的结果;【高置信】=多来源独立确认;【争议】=领域内存在对立证据;【推测】=本文的分析性推论。
0. 引子:一个词的差别
想象你在看一台AI下棋。
旧范式的AI这样思考:"根据我读过的十万盘棋谱,大师们在这个局面下最常说的下一句话是——'我走马'。"它预测的是下一个字。
新范式的AI这样思考:"如果我走马,三个回合后我的车会被吃掉,胜率下降18%;如果我当初上一步不冲兵,现在就不会陷入被动。"它预测的是行动的结果,以及当初一个行动不这么做的结果。
前者是今天所有大语言模型(LLM)的训练目标——next-token prediction(NTP,预测下一个token)。后者是本报告的主题:因果Token化大模型——把训练目标从 p(下一个token | 上文) 改为 p(结果 | 状态, do(行动)) 与 p(反事实结果 | 事实轨迹, 替代行动)。
这里有两个技术概念,先用一句话各自解释清楚:
- 干预(intervention,do算子):不是"观察到行动a之后通常发生什么",而是"强行让世界执行a,会发生什么"。区别在于混杂——观察到"吃药的人"和"被强制喂药的人",结局分布可以完全不同。
- 反事实(counterfactual):时光倒流,只改一个决定,其余一切(包括运气)保持不变,看结局如何。它是因果之梯的最高一级,也是人类"后悔""复盘""吸取教训"这些认知动作的形式化。
一个词的差别——从"字"到"结果"——背后是Judea Pearl的因果之梯三层:关联(seeing)、干预(doing)、反事实(imagining)。本报告要回答的问题是:这个改动在理论上能走多远、数据怎么造、用什么证明它"接近还是偏离"、有没有人已经做过、以及一个创业团队如何用最少的钱验证它。
1. 核心猜想:三条可证伪命题
把整个构想拆成三条独立可证伪的命题。每一条都附上证伪条件——如果实验中观察到证伪条件触发,该猜想就应被放弃,而不是被修补。
C1 表征猜想:do/反事实信号训练出的表征具有跨分布鲁棒性
命题:在包含干预分布(rung-2数据)与反事实配对(rung-3数据)的语料上训练的模型,其内部表征将获得跨分布(OOD)鲁棒性,即在未见过的因果结构、变量命名、机制族上仍保持正确的干预预测;而同等规模的纯NTP模型不能。
理论依据【定理】:Richens & Everitt(ICLR 2024,杰出论文荣誉提名)证明:任何能在一大类分布偏移下满足遗憾界(regret bound)的智能体,必须学到了数据生成过程的近似因果模型;最优智能体的模型收敛到真因果模型[1]。换句话说,"跨环境鲁棒"与"内部有因果模型"在数学上是同一件事的两面。这给出C1的双向可检验性:因果训练应产生鲁棒性,鲁棒性应伴随因果表征。
证伪条件:(i) 用do/CF数据训练的模型在held-out SCM族上的表现与纯NTP基线无显著差异;或 (ii) 用因果抽象理论的互换干预(interchange intervention)探针检验,发现因果token并未获得干预/反事实语义(即模型只是学会了"因果文风")。
C2 数据猜想:模拟器分叉数据可替代不可得的现实反事实ground truth
命题:真实世界原则上不存在反事实参考答案(Holland根本问题:同一个体永远无法同时观测两种潜在结果),但模拟器内可以——固定随机种子/外生噪声、只改变行动、重跑模拟,即可生成Pearl意义上严格的个体级反事实配对数据。用这种数据训练的模型,在模拟分布内可以完整学会三层因果查询,且该能力部分迁移到结构相似的分布。
理论依据【定理】:因果层级定理(Causal Hierarchy Theorem)——用低层数据推断高层量在无额外假设时"几乎从不"可能[2];且该定理对神经网络同样成立:任意强大的网络仅凭观测数据也无法预测干预效果[3]。反过来说,模拟器是目前唯一已知能合法、廉价、无限量提供L2+L3数据的来源——因为在模拟器里设计者知道完整的结构因果模型(SCM),反事实ground truth"重跑生成器即可免费获得"。
证伪条件:(i) 在模拟内训练后,模型在模拟分布内的PEHE(个体处理效应估计误差,见§6)不下降——说明连"模拟内学反事实"都不成立;(ii) 模拟器机制族扩大后(机制随机化),性能崩溃——说明学到的是特定模拟器的背诵。
C3 适应度猜想:因果决策器在生存竞争中获得更高繁殖成功率
命题:在寿命有限、资源严格守恒、存在生存竞争的模拟生态中,其他条件全同(同基座、同基因池、同环境),仅替换决策器(因果token化模型 vs 普通NTP模型 vs 规则/随机基线),因果模型谱系将获得统计显著更高的存活时长与后代数。
依据【高置信/推测】:这是用户设想的"模拟大自然"验证方案。其方法论优势在于适应度(存活时长、后代数、谱系存续代数)是程序化客观度量,天然规避了LLM-as-judge的循环偏差[4](SOTOPIA-π证明:LLM评委会系统性高估专门训练过的智能体)。但它只是必要非充分证据——数字进化几乎必然先钻模拟器漏洞再学因果[5],高适应度可能来自作弊而非因果能力(详见§5、§8)。
证伪条件:(i) 在排除作弊与环境漏洞后,因果决策器与基线的繁衍率差异在多随机种子下不显著;(ii) 单元层因果误差低的模型在生态锦标赛中不赢——说明"因果正确"与"生存优势"脱钩,适应度验证路线失效。
三条猜想的关系:C1是机制层猜想(表征是否因果化),C2是数据层猜想(模拟能否供真值),C3是功能层猜想(因果是否有用)。C1、C2可以在几周到几个月内以低成本证伪,C3是整个构想中成本最高、也最具原创性的部分——目前没有人在文献中做过这个实验(见§7)。
2. 为什么"下一个字"不够
2.1 双轨断裂:LLM因果能力的两套互相矛盾的分数
文献中存在两组看似矛盾的证据,必须并列呈现:
乐观轨道【高置信】:微软研究院Kıcıman等人报告,GPT-4在成对因果发现上达97%(超出当时最优专用算法13个点)、反事实推理92%、事件因果86%,且对训练截止后新建数据集有泛化,不能完全归因于记忆[7]。CRASS反事实基准上GPT-4达92.44%,距人类基线仅6个百分点[12]。
悲观轨道【高置信】:CORR2CAUSE(纯相关推因果,20万–40万样本)上17个LLM接近随机;微调可提升分布内表现,但对变量重命名/改写的OOD扰动完全不泛化[9]。CounterBench(形式规则反事实题,含无意义名称变体)上"大多数模型表现接近随机猜测"[13]。CLADDER(oracle因果引擎生成ground truth,覆盖Pearl三层)上模型表现随阶梯升高递减,GPT-4需专门工程化的CausalCoT提示才达70.40%[8]。2026年的Caliper研究更进一步:把三个基准中的语义变量名替换为占位符后,40个"模型×基准"组合中39个准确率稳健下跌——结论是"去词汇锚后,指令微调LLM零样本下几乎没有结构性因果推理的证据"[10]。
调和裁决【高置信】:两套结果同时为真,因为测的是不同东西。常识因果=语料先验检索(可高分),形式因果=算法执行(接近随机)。批判性基准综述指出:大量"LLM会因果"的基准可被"检索领域知识"破解,并未真正测因果推理[19]。
第三条微妙证据【争议】:2026年Causal Tongue-Tie发现,在CLADDER反常识题上,线性探针可从隐藏状态以约0.97准确率读出正确答案,而模型口头Yes/No输出只有约0.5——模型编码了因果方向但说不出来[11]。即"答对≠理解,答错≠不理解"。对因果token化的含义:内部信号已存在,缺的是把它变成显式训练目标。
2.2 "因果鹦鹉"争论
对NTP因果缺陷最精确的机制性解释来自Zečević等人(TMLR 2023)的meta-SCM猜想【高置信为论文主张,猜想性质作者自标】:LLM有时能答对因果问题,是因为语料中存在"编码了其他SCM之因果事实的元因果模型",使因果事实之间产生可被NTP捕获的文本相关性——LLM只是复述数据中嵌入的因果知识,实证上"连弱的因果鹦鹉都算不上"[14]。AAAI 2024甚至专门开设研讨会"Are Large Language Models Simply Causal Parrots?"。
这条线的上游是Bender等人的"随机鹦鹉"论文【高置信】:仅用语言形式训练的LM"根据它们如何组合的概率信息胡乱拼接语言形式序列……但不涉及任何意义";2026年Bender澄清该词是描述而非侮辱——"当这些系统输出的文本讲得通时,是因为我们在替它赋予意义"[15][16]。任务级证据还包括:Reasoning or Reciting?(NAACL 2024)构造数学/代码/关系的反事实变体任务,发现模型在反事实变体上显著退化[121]。认知神经科学视角的独立证据来自Mahowald等人:LLM的"形式能力"与"功能能力"可以分离——语言形式近乎完美,但世界知识、推理、情境理解存在系统性缺口,因果/反事实推理正属于后者[23]。
注意:这不是学界定论。原班人马2024年发表立场修正的续作("Causal Parrots? LLMs Are Causal After All");Kıcıman的结果是其最强实证反例;Othello-GPT证明纯序列预测可以涌现出可干预的棋盘状态表征[21]。但Vafa等人(NeurIPS 2024)的纽约出租车实验给出最锋利的反例【高置信】:transformer预测下一转向99%+合法、97%生成真实最短路,但重建其隐含世界模型后发现隐含的曼哈顿地图与真实地图毫不相似,引入绕行后性能崩溃[22]。裁决:涌现的世界表征存在但不可靠——在规则封闭的合成任务中形成,在开放世界中错乱。
2.3 规划批判:Kambhampati与LeCun
Kambhampati的立场论文【高置信】:自回归LLM自身不能做规划或自我验证,其"推理"本质是"通用近似检索";GPT-4在BlocksWorld自主规划仅约34%;LLM应作为LLM-Modulo框架中的近似知识源,由外部验证器保证正确性[17]。LeCun附议:"AR-LLMs have very limited reasoning and planning abilities. This will not be fixed by making them bigger"[18]。规划=预测行动后果(rung 2),此批判与因果批判同构——它是"从预测下一个token到预测下一个行动的结果"的最直接动机。
2.4 Richens-Everitt定理给的正面理由
Pearl在2018年Quanta访谈中的断言【高置信】是本项目的权威出发点:深度学习"全部停留在关联层……曲线拟合";"关联是不够的——这是数学事实,不是观点"[6]。但请注意批评的精确对象:是纯观测语料,不是预测机制本身。Richens-Everitt定理[1]给出了第一个肯定性理论结果——NTP学不会因果不是因为神经网络不行,而是因为训练分布里没有干预信号。把"预测下一个行动的结果"作为训练目标,等价于把rung-2分布直接放进训练集:这是把批判转化为设计的标准路径。CAPT(2025)提供了样本效率的直接证据【高置信】:把有偏预测分解为"事件估计+事件干预"两步做因果感知后训练,3B模型仅用100条分布内微调样本即在CLADDER与PrOntoQA的ID/OOD上超过传统SFT和更大的LLM[20]——把干预机制写进训练目标,可行且便宜。
3. 理论天花板:三层阶梯能走到哪一层
这一节回答"这个方案在数学上最多能承诺什么"。结论先行:模拟器内部,三层全部可达;迁移到现实,L2可辩护,L3只能带假设声明。
3.1 阶梯与层级定理
Pearl因果之梯:L1关联 P(y|x)、L2干预 P(y|do(x))、L3反事实 P(y_x | x', y')。Bareinboim-Correa-Ibeling-Icard的因果层级定理【定理】:跨层推断在无额外假设时一般不可能[2]——即使拥有RCT数据,个体反事实也不可辨识。Xia等人证明该定理对神经网络同样成立【定理】:"任意复杂、任意表达力的神经网络,仅凭观测数据无法预测干预效果"[3]。规模暴力学因果被理论否定——模型必须被喂干预数据,并带结构归纳偏置。
Holland(1986)的根本问题【定理级经典】:因果推断的根本困难是同一个体永远无法同时观测 Y(1) 与 Y(0)——真实世界不存在反事实token序列的参考答案,任何个体级反事实陈述原则上无法用数据直接验证[24]。
3.2 模拟内的豁免:三层全监督是可能的
关键洞察【高置信】:层级定理管不住模拟器内部。在模拟器里,设计者知道完整SCM(机制+噪声分布P(U)),可以为同一个体生成"事实+反事实"配对——相当于拥有无限量L3数据。完整SCM下,任意反事实可由Pearl三步法精确计算(abduction-action-prediction);2026年CTFIDU+结果进一步表明,即便拥有所有物理可实现的L3数据仍存在根本不可辨识的反事实类型,但L3数据能收紧其界[27]——模拟器还绕过了"物理可实现性"的限制。Ctf-ID算法给出了从"L1+L2数据组合"辨识嵌套反事实的充要图条件[25];部分辨识理论给出退路:不可点辨识时,反事实概率可被收紧到有理论保证的区间,且真值应落在界内——界是可以被真实数据部分检验的[26]。
3.3 迁移到现实的可辩护上限
- L1(关联):可检验,无争议。
- L2(干预):可辩护上限。P(Y|do(X))可用真实RCT/A-B测试验证。但注意观测数据只辨识马尔可夫等价类,干预是把等价类收窄到唯一DAG的唯一通用手段(d节点DAG最坏需d−1次干预)[32]。
- L3(反事实):只能"假设条件化"输出。两个SCM可以在L1、L2完全一致而L3不同(这正是反事实不可辨识定理的内容);现实中不存在可检验L3假设的数据。Shpitser & Pearl自己给出封顶【高置信】:大多数反事实查询实验上不可检验,只有少数形式在强假设下可辨识[28]。统计学正统(Dawid 2000)甚至主张反事实进路"混淆了经验的量与假设的量"[29]。
诚实的输出设计【推测,但理论驱动】:模型应区分输出L1/L2/L3查询,L3查询附带其依赖的辨识假设(如单调性/反事实序约束[33])或输出部分辨识区间——"给出带假设声明和区间界的反事实"比"预测反事实"更经得起理论审查,也恰好构成对生成式世界模型("像真≠正确")的差异化攻击面(见§9–10)。
3.4 sim2real:从分布偏移升级为跨层辨识缺口
机器人领域的sim2real差距有四类独立失效模式【高置信】:视觉域差距、物理近似误差、传感器噪声不匹配、长尾场景缺失;域随机化主要解决第一类,对长尾无效——模拟无法生成"未知的未知"[30]。映射到语言/社会模拟:其"物理"是智能体行为模型,近似误差比物理引擎大得多且不可量化。因此"模型学到的是模拟SCM的反事实;对现实的有效性依赖一个模拟内不可检验的同构假设"——这是该领域理论给定的最诚实表述,必须写进任何对外叙事。缓解手段的因果类比:机制随机化(随机化因果机制本身:换函数族、图结构、混杂结构)优于参数随机化;用少量真实数据对模拟器做因果系统辨识(机制对齐而非分布对齐)[31]。
4. 数据准备:三种新token与一条分叉流水线
4.1 设想:三种新token
把因果语义注入token流,最小设计需要三类新token:
- do-token(干预token):标记"此处是对世界的强制设定,不是观察"。技术上它把条件分布从 p(outcome | state, a) 切换为 p(outcome | state, do(a))。因果表示学习理论给出硬要求【定理】:无辅助变量(域/干预/时间标记)时,从低级观测解耦出的表征没有任何辨识性保证[34]——所以"干预了哪个变量"必须作为一等token显式记录,它是CRL理论中最值钱的监督信号(CITRIS路线)[35]。
- 结果token(outcome token):预测目标从表面token换成决策相关的结果量。MuZero的价值等价原则是其理论盾牌【高置信】:内部状态不必重建观察,只需准确预测对规划有用的量[36]——结果token只需保留决策相关抽象,不必保真重建。
- CF-token(反事实token):表达"同一个个体的替代分支"。这里的硬核架构约束【高置信】是:没有显式外生噪声/潜变量通道的自回归模型,原则上只能做rung-2,做不了个体级rung-3——因为反事实的第一步abduction要求从证据反推外生噪声的后验。Deep SCM用归一化流使噪声后验可解算[37];Diff-SCM用确定性前向扩散做abduction[38];深度孪生网络证明:显式暴露噪声通道U是从L2能力升到L3能力的关键设计[33]。
一句话直觉:干预token告诉模型"世界被改了",噪声token告诉模型"运气没变",反事实token就是"运气不变、只改决定之后的世界线"。
4.2 与本项目重合度最高的先例:Chatzi的token级三步法
Chatzi等人(CLeaR 2025)已证明在LLM上做严格个体级反事实token生成可行【高置信】:他们基于Gumbel-Max SCM建立token生成的因果模型——自回归采样的随机数就是"外生噪声";复用噪声=abduction(固定"个体");do(token=t')=action;继续自回归解码=prediction。几乎零额外成本、无需微调[39]。这是本项目的首要基线与机制设计参照。其局限由Pona等人指出【高置信】:token级反事实对LM智能体不够用——行动隐含在输出字符串中,token含义随上下文漂移,token级干预会产生有偏或无意义的反事实;干预应定义在行动/语义层(工具调用、计划节点、潜空间),token只是观测[40]。设计教训:do-token应挂在行动节点上,而非字符串token上。
4.3 核心数据单元:状态-行动-结果-倾向四元组
离线RL与反事实学习的成熟结论【高置信】:每条日志必须存四样东西:状态/上下文、执行的行动、观察到的结果、当时行动的选择概率(propensity)。没有propensity就补不了——IPS类无偏反事实估计依赖它,且支持缺失(日志策略不支持的动作)时不可恢复[41]。工程含义:采集期就要用已知随机化策略(ε-greedy/softmax)保证探索覆盖,概率当场写入数据。另按D4RL范式【高置信】:不要只采专家数据——需要random/medium/expert多质量档混合,行动覆盖多样性比总条数更重要[42]。
推荐schema(RLDS/episode-step主干+因果字段),要点三条:
- 事实与反事实分支共享 noise_id/seed 才构成Pearl意义的个体级反事实,否则只是干预样本;
- propensity(action_logprob)采集时写入;
- 分支记录生成方式与rollout次数,非确定环境必须多次采样报分布与置信区间。
4.4 分叉流水线:模拟器=免费反事实标注机
这是整个数据方案的心脏。只要有可快照、可分叉、可重放的执行器,"行动→结果"的监督数据就能零人工成本生成:
- AlphaZero范式【高置信】:MCTS树内分支就是"同一状态、不同行动"的数据工厂;应对每个状态保存全行动分布(访问计数/价值)而非单一最优行动,相当于把反事实分支价值直接存成软标签;根节点探索噪声保证非最优行动也有数据[43]。
- Math-Shepherd/OmegaPRM范式【高置信】:从中间状态做Monte Carlo分叉rollout,按最终成功率给该步打软标签,OmegaPRM用MCTS自动生成150万+过程标注、零人工[44]。注意语义差异:MC标签度量的是"该步通向成功的潜力",人工标签度量"该步本身的正确性",两种标签并存。
- AgenTracer/Counterfactual Replay范式【高置信】:在失败轨迹第t步替换行动、重放后续,"最早使失败翻转为成功的步骤=决定性错误步";同策略重采样(do-resample)可测结局分布位移[45]。两个坑:非确定环境重放后要多次采样取分布;"修正后沿用原后缀"会产生run-forward混杂,要么oracle替换要么全量重放。
- 合成SCM生成器【高置信】:因果图+结构方程+噪声全已知时,反事实ground truth=固定噪声重跑生成器,免费获得(MorphoMNIST式);CausalWorld示范了"所有因果变量可干预"的基准设计[46][47]。
文本域的补充管线【高置信】:CAD(人工最小改写直到标签翻转,8.3K条即见效)[48]、CORE(retrieve-then-edit:从真实语料检索自然发生的替代分支再做最小编辑)[49]、DISCO(LLM过生成+教师模型过滤蒸馏,扩到百万级)[50]、Hüyük的事实-反事实双指标微调[51]。注意CAD的边界:反事实数据增强主要治虚假相关/捷径学习,不保证OOD泛化(多项负面结果)——它是去偏工具而非因果能力来源。
4.5 量级参考表
| 数据层 | 内容 | 先例量级 | 本项目起步建议 |
|---|---|---|---|
| 合成SCM验证集 | 已知图+结构方程,GT反事实 | MorphoMNIST/CausalWorld 任意可再生[46][47] | 5–10个SCM × 1万样本 |
| 模拟器分叉数据 | 同状态全行动分支+rollout结局 | AlphaZero 2100万–4400万局[43];OmegaPRM 150万步标注[44] | 10万状态 × 4–8分支 × 8–32次rollout |
| 日志/回放数据 | (s,a,r,propensity)多档混合 | D4RL单任务约100万transitions[42];RT-1 13万episode[52] | 10万–100万transitions |
| 人工标注 | 步级三值标签/最小改写 | PRM800K 80万步级标签[53];CAD 8.3K[48] | 1万–5万步级标签+主动学习 |
| 真实数据验证 | 因果方向sanity check | Tübingen 108对 | 视领域 |
过程监督 vs 结果监督的选择【高置信】:PRM800K证明步级过程监督显著优于只标结局(MATH上78.2% vs 约72.4%),但人工成本高一个量级;三值标签(+1/0/-1)+主动学习只标模型最不确定的步,是性价比最优解[53]。结局判定优先用规则/执行器(成功率、可验证对错),LLM-judge会注入噪声。
4.6 三条工程红线
- 反事实无法从观测+干预数据验证:深度孪生网络的可辨识性分析表明,两个模型可以观测/干预预测完全相同而反事实预测不同——必须保留生成器/模拟器作为反事实ground truth来源,或明确标注反事实为"模型生成、未经验证"[33]。
- 支持缺失不可恢复:采集期无探索覆盖的行动,事后任何方法都无法做无偏反事实估计[41]。
- 干预分布与训练分布要分层设计:留出训练中未见的干预类型/SCM结构做评测集,否则"反事实泛化"无从度量[46]。
5. 验证台:构建模拟大自然
用户的设想——寿命有限、资源有限、生存竞争、自然选择,看模型决策是否有利于基因传递——在人工生命(ALife)领域有35年的先例与尸检报告。这一节回答:应该抄哪些设计、避开哪些坟。
5.1 经典系统的经验
- Tierra(1991)【高置信】:首个证明数字基质中可发生真正达尔文进化的系统:自复制机器码竞争CPU时间,无预设适应度函数,自发进化出寄生、超寄生、社会性与作弊[54]。教训:形态行为表达力弱、生态最终收敛。
- Avida(1993–)【高置信】:把数字有机体变成可重复实验的科学仪器:每个个体独立受保护的内存与CPU,适者由"做任务换复制机会"的内生经济决定,谱系精确可回溯[55]。谱系精确追踪是"基因传递概率"可计量的前提。
- Polyworld(1992/94)【高置信】:最早打通"基因→神经网→视觉→行为→生态"全链条,通过自然选择(而非适应度函数)出现物种形成;但群体一旦找到"足够好"的生存策略,进化就转向选择稳定性而停滞[56]。与本项目"决策器即表型"结构最同构。
- Echo(1992)的反面教材【中高置信】:交互语法(战斗/交易/交配)全部写死后,所有运行退化为简单交易生态——机制预设过多,涌现过少[57]。
- Lenia进化实验(2023)【高置信】:JAX大规模连续元胞自动机进化,先经历多样性爆发,随后收敛到"快速扩张模式"的统治——快速复制者接管是几乎所有自发进化系统的默认吸引子[58]。Flow-Lenia引入质量守恒后最接近开放式进化[59]。
5.2 设计原则清单
综合Soros-Stanley的开放式进化必要条件(被控制实验证明缺一则停滞)[60]、POET/XLand的环境共进化[61][62]、Neural MMO的生态位发现[63][64]、JAX生态的工程能力[65]:
- 资源严格守恒:能量/质量/资源守恒是防作弊的第一道墙(Flow-Lenia的质量守恒设计[59])。任何守恒漏洞都会被进化找到并放大【高置信】——Sims的生物靠摔倒骗过速度指标、游泳生物利用积分误差获得自由能[5]。
- 寿命有限+内生经济:适者由"资源→复制机会"的内生经济决定,而非显式适应度函数(Tierra/Avida);预设适应度会关闭搜索空间中有希望的路径并损失多样性。
- 谱系精确追踪(Avida式):每个基因/决策器的传递计数,而非代理指标。
- 非平凡最小繁殖判据(minimal criterion):个体须满足非平凡门槛才能繁殖,且新个体要为他人创造满足门槛的新机会(Chromaria条件);单目标适应度在欺骗性问题上会把搜索困死在局部最优(novelty search的核心结论)[66]。
- 环境共进化(POET式):环境种群也要进化并通过"不太难不太易"的最小判据,解跨环境迁移——让"自然"持续出题,防止决策器对固定环境过拟合[61]。XLand(约70万个独特游戏、单智能体2000亿步)证明该路线产生零样本通用能力,但属千卡TPU级工程[62]。
- 生态位与资源异质性:Neural MMO明确报告"多智能体竞争是课程放大器,不是课程本身"——资源足够丰富的地图上种群自发分化生态位;丛林比沙漠产生更多生物多样性[64]。
- JAX加速:QDax/evosax/Craftax把种群级进化从"CPU集群数天"压到"单加速器数分钟",大规模进化首次对学术实验室廉价可得[65]。成本预期管理:Polyworld数百个体就能观察物种形成,不必一上来对标XLand。
5.3 已知陷阱(每条都有尸检报告)
- 快速复制者接管【高置信】:默认结局。对策:复制成本随速度增长、密度制约、资源空间异质性[58]。
- 作弊/specification gaming【高置信】:进化是超强优化器,会先找到模拟器和适应度函数的漏洞,再找到因果结构。防御:守恒律+冠军策略定期人工审计+"漏洞利用当免费fuzzing"的心态[5]。
- 对齐泄漏混杂【高置信,本项目特有】:LLM个体的行为是"训练数据先验+对齐"的产物而非生态理性的产物——赌注增大时LLM反而更合作,与进化博弈论预测相反,被证实是对齐训练的"签名"[67];Claude在自私persona下仍泄漏约2%亲社会行为,GPT-4o则零合作严格服从persona[68]。对策:因果模型与基线必须同基座、同数据、同对齐状态,仅tokenization/训练目标不同,否则测的是先验差异而非表征能力。
- 评估应试化【高置信】:Melting Pot竞赛冠军用针对特定环境硬编码的解——任何排行榜都会被应试;训练基底与测试场景分离、轮换背景种群[69]。
- 外推过度声明【高置信】:Tierra的生态结论很难外推回自然界——模拟内有效≠现实有效,需独立交叉验证[70]。
6. 如何知道"接近还是偏离":三层验证体系
总原则【高置信】:不存在单一标量可以证明因果模型"接近"现实——目前没有被广泛接受的、任务无关的"因果一致性"标量指标(类似FVD之于视觉),这是公认开放挑战[71]。验证=用途相对+逐层诊断(Sargent的operational validity:有效性是相对于用途与范围的,"有效域"本身应被测量[72];POM:用多个层面上的多个模式同时校准验证,偏离是逐模式诊断的而非单一距离[73])。
第1层:单元层——干预预测误差(有oracle,最严格)
做法:把模拟器当SCM oracle。采样状态s、行动a,记录真实结果y;对模型施加do(a)查询,比较预测ŷ。
- PEHE:预测个体处理效应与真实ITE的均方根误差。在真实世界因反事实不可观测而无法计算;模拟器里可算——这是本项目相对整个因果推断领域的结构性优势[74]。
- ε_ATE(群体干预效应绝对误差)与效应符号一致率(决策通常只需要相对方向正确)。
- 退化曲线:按rollout深度/分布偏移量分桶——即测量模型的"有效域"。
陷阱【定理+高置信】:(i) covariate shift——行为克隆的逐步误差ε在长为T的回合中产生O(εT²)的复合遗憾[75],单步误差小≠长程可用,必须在模型自身rollout诱导的状态分布上测试;(ii) 自动驾驶的实证:离线指标好的模型在线闭环崩溃是领域共识[76]——单元层低PEHE是必要不充分条件。
第2层:集成层——反事实一致性与策略排序保持
不再问"预测值准不准",改问"模型的反事实断言是否自洽且与模拟器一致、用它做决策是否得到正确排序":
- 反事实一致性测试:CLADDER式——用模拟器作oracle生成结构化反事实题("若当时不采取a而是a′,结果如何"),以重放为ground truth。教训:常识/自由文本反事实题缺乏结构敏感性,太易通过而失效[8]。
- 动作-结果方向一致性(ATM式诊断):同状态两动作,预测差异方向与模拟器差异方向的一致率——低成本、不要求绝对数值[77]。
- 策略排序保持(rank consistency):k个不同策略分别在真实模拟器与模型替代环境中rollout,比较排名的Spearman相关(WorldEval范式)。世界模型评估的新共识【高置信】:模型应看它能否支撑反事实推理与闭环决策,而非视觉逼真度——rank consistency、value fidelity、decision reliability比像素精度更有信息量[71][78]。
- 长horizon闭环rollout的生存时长分布与真实分布的距离。
可接受的偏离:排名保持通过而绝对值全错——这正是"决策够用"的情形,需与第1层结论区分报告。
第3层:系统层——独立生态锦标赛
做法(AlphaStar×Neural MMO范式)【高置信】:把"用因果模型做决策的智能体"与基线(随机、规则、无模型RL、作弊oracle)放入同一多智能体生态,跑多episode×多地图锦标赛[79][80]。
- 锦标赛矩阵+Elo/Bradley-Terry评分,附bootstrap置信区间(<30 Elo分差距需数百局才显著[81]);
- 主指标:存活时长中位数、后代数、谱系存续代数的聚合分布(多episode聚合,生存模拟方差极大);
- 对held-out对手/环境的胜率(防对锦标赛池过拟合)+ RPP类可利用性指标(防"高Elo但可被利用");注意非传递循环(石头剪刀布结构)使单一标量失真[79][81];
- POM多模式检查:除适应度外,验证种群规模波动、资源动态、策略多样性等中间尺度模式是否一致[73]——只在适应度上对齐而中间模式偏离,因果机制仍是错的。
Goodhart自指警告:适应度只能验证,不能训练
【高置信,四源交叉】一旦"基因传递概率"同时充当选择压力(训练信号)和验证指标,就构成Goodhart自指——模型会优化"在该锦标赛池中传递基因"而非"因果正确"。Elo已被直接用作进化适应度函数的工程先例[82];RL中Goodhart已有形式化刻画:代理奖励与真实奖励夹角越过临界阈值后,加大优化压强必然损害真实目标;o3/DeepSeek-R1在象棋任务中利用环境漏洞"注册胜利"[83][84]。正确姿势:训练用单元层因果误差(PEHE类),验证用独立生态锦标赛——验证池的对手、环境参数、生态位必须与训练池有held-out差异,评估管线对进化个体物理隔离。高生存率≠因果正确:靠exploit环境漏洞取胜的策略会在held-out环境崩溃——所以适应度是必要非充分证据,必须与第1、2层联合解读。
7. 已有尝试图谱:四条线与本方案的空位
本方案精确落在四条研究线的交汇空位上。逐条梳理,并标注每条线上"最接近者"与本方案的差异。
7.1 因果×LLM线
- CausaLM(2021):最早把do操作引入文本表征,用反事实文本样本估计因果效应(而非相关性)[88]。
- 因果抽象理论(Geiger等,NeurIPS 2021)→ DAS → Boundless DAS:把高层SCM变量与神经表征对齐,用互换干预验证表征是否具有因果性质;Boundless DAS在Alpaca-7B上发现了由两个可解释布尔变量构成的因果模型[85][86][87]。这是检验"因果token是否真正承担干预语义"的黄金标准与开源工程底座(pyvene)。
- 评测线:CLADDER、CORR2CAUSE、CLEAR、CausalBench、CounterBench(§2)。CausalBench的一个独立佐证值得单列:LLM在超过50节点的网络上显著落后传统算法,且"通过实体间的语义关联理解因果,而非直接从上下文信息或数值分布中理解"——这正是复述假说的行为签名[122]。
- 训练改造线:CAPT(§2.4)——最接近"把干预写进训练目标"的已有工作,但只做后训练、规模小。
- "反思≠反事实"的重要区分【高置信】:DeepSeek-R1式纯RL训练中自发涌现的"反思/aha moment"[145],经oat-zero复现研究证伪其新颖性——所谓反思模式在epoch 0的base模型中已存在,且多为Superficial Self-Reflection(有反思之形而无纠错之实)[147]。Gandhi等人进一步证明有效自我改进依赖四种认知行为(验证、回溯、子目标设定、逆向链),行为模式的存在比答案正确性更关键[146]。Pearl反事实的对象是"世界"(同一外生情境保持噪声不变、施加干预、推演未观测分支);R1式反思的对象是"自己的文本"。回溯机制可服务于反事实推理,但反思能力本身不构成反事实能力——不要把回溯训练的引入当作反事实能力已达成的证据。
- 与本方案的差异:这条线全部在文本语料上做文章,没有干预分布数据,没有反事实ground truth闭环。
7.2 世界模型线
谱系:Ha & Schmidhuber(2018,"在学到的模型中做梦训练策略")[89] → PlaNet/Dreamer V1–V4(V3单一超参数征服150+任务、从零在Minecraft挖到钻石,Nature 2025)[90] → MuZero(价值等价原则)[36] → 决策中心序列建模:Decision Transformer(回报条件生成动作——方向与本方案相反,"结果→动作" vs 本方案"动作→结果",两者互补构成do-演算闭环)[98]、Trajectory Transformer(轨迹即token序列+beam search规划)[99]、Gato(万物皆token的通用智能体)[100] → 新一代:V-JEPA 2-AC、Genie、GAIA-1、UniSim、Cosmos。
四个最接近者及其与本方案的差异:
| 工作 | 它做了什么 | 与本方案的差异 |
|---|---|---|
| V-JEPA 2-AC(Meta 2025)[93] | 两阶段:>100万小时视频预训练+仅62小时无标注交互数据训出动作条件世界模型,零样本机器人抓放;表征空间自回归预测 | 连续表征而非离散因果token;只学p(outcome|a)的条件相关,不区分do(a)与observe(a);无反事实目标 |
| Genie 1/2/3(DeepMind)[94][95] | 从20万小时无标注视频无监督发现"隐动作"(LAM),把世界模型做成可交互生成环境;Genie 3分钟级一致性、语言即时修改世界 | 隐动作发现是"因果token自动化获得"的范式雏形,但无显式干预语义、无反事实监督 |
| UniSim(ICLR 2024杰出论文)[92] | 明确定义统一学习observational/interactive/counterfactual三类经验的"通用模拟器" | 文献中唯一明确提出"反事实经验"类别的,但其反事实仍是生成式增广而非SCM意义上的个体反事实 |
| GAIA-1(Wayve)[91] | 最直白的"世界模型LLM化":映射为离散token并预测下一个token,展现类LLM的scaling行为 | 同向但缺少显式因果语义 |
Sora之争是本方案的立论土壤【高置信】:OpenAI宣称"视频生成模型即世界模拟器"[96],但系统综述指出视频生成不解决世界模型的核心挑战——因果/反事实推理(推断训练中未见决策的结果)与严格服从物理定律;"realism is not the same as reality"[97]。2023–2026年世界模型文献分化为离散token自回归线与连续表征预测线(V-JEPA在直觉物理基准IntPhys上零样本98%,像素预测模型与多模态LLM处于随机水平[109])——本方案恰是两条线的杂交(离散token+预测干预结果),文献中无人占据此空位。
7.3 ALife线
见§5:Tierra/Avida/Polyworld/Echo/Lenia、POET/XLand、AI-GA。AI-GA(Clune 2019)把整个项目合法化【高置信】:通往通用AI的替代范式是造"会自动产出通用AI的算法",其第三支柱——自动生成有效学习环境——最少被研究、Clune预测将有最多历史性发现[110]。本方案可定位为AI-GA第三支柱的实现场:用进化外循环验证决策算法本身。
7.4 LLM智能体进化线
- BEAR(PLOS One 2026)【高置信,重合度最高】:LLM智能体以自然语言指令语料为"基因组",重组+LLM变异+340代演化,5,307次出生中行为忠实遗传,并直接测得"等位基因→后代数"的因果效应(flee策略等位基因携带者比rally策略多产生15%后代)[101]。差异:BEAR演化的是prompt层文本,所有个体共用同一冻结权重;本方案比较的是模型内部表征方案(因果token化 vs baseline)在同样生态压力下的适应度差异——"演化的是认知架构本身",BEAR没有也不可能回答这个问题。
- Sugarscape生存本能研究(2025)【高置信,环境设定几乎就是本方案要的】:资源有限+繁殖+死亡的LLM生存模拟;攻击行为仅在大模型出现,极端稀缺下攻击率>80%;穿越致命毒区的指令服从率从100%降至33%[102]。差异:无跨代选择、无架构对比。
- LLM群体进化(2025):权重级交叉/变异/选择/传承,2B模型群体可在单张4090上运行——成本设计的重要参照[103]。差异:适应度=任务分数,无生态。
- 社会模拟线:Generative Agents(记忆流-反思-规划架构,但无生存/繁衍/选择压力)[104]、Concordia(Game Master模式:环境规则用确定性代码,LLM只做语义决策——控制成本的关键架构)[105]、Project Sid(千级智能体文明涌现,但无死亡/出生)[106]、ASAL(基础模型在模拟之外当裁判/搜索器,与本方案"LLM在模拟之内当大脑"互补)[107]。
- 博弈行为线【高置信,提供现成可检验对立假设】:LLM擅长自利博弈、拙于协调博弈(Akata等,Nature Human Behaviour 2025)[108];对齐先验与生态理性的背离(§5.3)。如果因果token化模型表现出与进化博弈论一致的行为而baseline表现出对齐先验行为,这本身就是强结果。
7.5 空白声明
没有发现任何工作以"繁殖成功率/后代数量"作为比较LLM内部表征方案优劣的适应度指标(经多轮交叉检索,置信度中高)。最接近者各自缺一块:Chatzi只有token级推理期技巧、无训练与生态;V-JEPA 2-AC无因果语义;BEAR无架构对比;Neural MMO无LLM。"因果token化 vs baseline,同基座同基因池只换决策器,看谁的谱系传下去"——"认知架构被自然选择"是一个从未被做过的干净实验,兼具论文价值与产品验证价值。
8. 优缺点·机会·风险:诚实呈现
8.1 优点
- 把评估从不可能变为可能(本项目对主流因果AI的真正差异化):真实世界无反事实ground truth,而模拟器=SCM oracle,PEHE可算、分叉=免费标注——不是因为模型更强,而是因为有了可证伪的训练与评估闭环。Causal AI公司恰恰死于"无反馈闭环"(Aitia自述,见§10),进化模拟器天然提供闭环。
- 理论合法性齐备:Pearl层级批判(动机)+ Richens-Everitt定理(通路)+ 因果抽象理论(检验工具)+ 层级定理(边界)。
- 继承LLM基建:离散token方案可复用transformer训练栈、scaling行为与Gato式token化工程学(连续值离散化、模态分隔符、按模态mask loss)。
- 客观适应度信号:存活/后代数是程序化度量,规避LLM-as-judge循环偏差。
- 样本效率证据已存在:CAPT用100条样本即获OOD收益;V-JEPA 2-AC用62小时即对齐动作条件——"两阶段课程"(先观察预训练、后小量干预数据对齐)可大幅降低干预数据成本。
8.2 缺点与弱点
- 离散token的信息瓶颈:LeCun派对离散token的否定是其论证的一部分;直觉物理任务上连续表征预测更强[109]。盾牌是MuZero价值等价原则——token只需保留决策相关抽象——但需在实验中自证。
- 长时程一致性:所有现有世界模型的horizon都有限(Genie 3也只有分钟级;Dreamer想象时程H≈15以上误差累积严重);长链决策需显式记忆/状态机制。
- 成本:生态进化实验每代需成千上万次推理,代际串行无法并行摊薄(量级估算见§10)。
- confabulation倾向【高置信】:SOTA LLM在简单题上推理崩溃时伴随高度自信的编造性解释[112]——模型失败时不会沉默,而是生成貌似严谨的虚假推理链;这正是用反事实文本训练最可能学到的坏习性。
- 反转诅咒式泛化失败【高置信】:"A is B"训练后无法推出"B is A"对规模、家族、数据增强均稳健;DeepMind机制研究发现即使"修复"也是存了两条独立记忆而非统一概念[111]。因果方向性恰是因果推断核心,归纳偏置问题需正面回应。
8.3 三大致命反对及回应
反对一:鹦鹉×OOD崩溃——"你的模型学到的将是模拟器的因果事实背诵,不是因果能力" 论证链【高置信为主】:meta-SCM复述论[14] + CORR2CAUSE微调OOD崩溃[9] + 2026年kernel obstruction定理(SFT/DPO/上下文学习产生的预测器原则上无法区分产生相似观测数据的不同因果图;该文同时给出逃逸路线——LLM作为干预oracle+外部贝叶斯循环)[113]。反方会问:你如何区分"学会do()语义"与"学会模拟器的文风"? 回应:① 把OOD泛化设为一等评估目标——保留整族未见过的SCM结构/机制/变量基数做held-out测试;② 干预token化使训练信号是干预分布(rung-2数据)而非因果文本,认识论地位不同——但需承认token化的do()是否真携带干预语义,最终靠OOD行为证据裁决;③ 机制级随机化让"背诵模拟器"策略在适应度上不占优。
反对二:反事实不可证伪×生态效度——"模拟里的ground truth不是现实的ground truth,而现实的反事实ground truth不存在" 论证链【高置信】:Holland根本问题[24] + Shpitser-Pearl可检验性封顶[28] + Dawid认识论批评[29] + 现实鸿沟("没有完美的模拟器……模拟中表现优异的策略可能只是滥用建模误差和模拟器特有的边角情形,向现实转移没有保证,甚至可能危险")[114]。在模拟内"验证"反事实能力有同义反复之嫌:ground truth由生成数据的同一模拟器定义。最坏情形:产出"反事实修辞模型"——语法合规、直觉吻合、无认识论锚定的编造反事实,且因评估循环性而无法被内部指标发现。 回应:① 诚实降级认识论主张——把模拟定位为课程学习/预训练环境与假设生成器,而非"验证器";最终验证必须落在真实世界干预数据(RCT、自然实验、A/B测试日志)上;② 对L3能力只做有限主张——明确哪些反事实查询类在何种假设下可检验,只在这些类上声明成功;③ 多模拟器/多形式化交叉验证——不同生成分布下一致才算数。
反对三:Goodhart×双重用途——"优化器会先黑掉你的适应度函数;而如果真成功了,你就造出了操纵引擎" 这是两头堵的反对【高置信】。失败分支:数字进化系统性钻空子[5]、Goodhart形式化[83][84]、奖励篡改(智能体破坏奖励与目标之间的链接本身——评估管线必须物理隔离)[116]、上下文内奖励黑客(LLM个体能在上下文中即时发明钻空子策略并跨代传播)[115]。成功分支:能预测"干预人类行为之后果"的模型在功能上就是操纵规划器——操纵=利用信息技术隐秘地影响他人决策、针对其决策弱点[117];Facebook未经知情同意操纵689,003名用户信息流情绪已被实证[118];心理画像微定向的说服效力有实证支持[119];LLM写作建议已能在用户未察觉的情况下改变其态度[120]。 回应:评估隔离+多指标+对抗式适应度审计+红队诱饵通道;治理前置(采用Susser操纵定义做双重用途评估,明确不针对人类行为干预应用、限制发布形态);最根本的回应是承认——该风险无法用纯技术手段消除,只能通过范围限定与治理缓解。
8.4 机会
- 科学空白:§7.5的"认知架构被自然选择"实验。
- 评测空白:世界模型研究公认缺"因果一致性"标量指标[71]——谁定义正确,谁就有话语权。
- 产业缺口:生成式世界模型"像真≠正确"的鸿沟已被实测暴露(§10),可信what-if模拟是已验证的付费点。
9. 更大图景:四个运动的交汇
本项目不是孤立想法,而是四个正在收敛的运动的交汇点:
- 因果AI(Pearl → Schölkopf):从"关联是不够的——这是数学事实"[6],到因果表示学习纲领——"当前AI与因果的核心问题是从低级观测发现高级因果变量",因果模型被定义为"能在不同分布下工作、支持干预与反事实推断的模型"[123]。Bengio的四要素(元学习、模块化ICM、智能体干预推断、交互式世界模型)明确断言"learning purely from text is not sufficient"[124]。XAI分支提供了反事实的输出形式传统:Wachter式"最小改变翻转结果"的可行动解释[148],以及回溯反事实(backtracking counterfactuals:允许上游原因相应改变的更自然语义——"预测行动结果"用干预语义,"当初怎样才不会"有时需要回溯语义,模型设计需显式选定)[149]。
- 世界模型(LeCun → JEPA/Genie/Cosmos):LeCun六模块架构把世界模型定位为自主智能"最复杂的部件",主张在抽象表征空间预测[125];DeepMind Genie与NVIDIA Cosmos把"可交互模拟"推向工业级。本方案是"token化线"与"表征预测线"的杂交空位(§7.2)。
- 开放式进化(Stanley/Clune → POET/XLand/AI-GA):AI-GA第三支柱"自动生成学习环境"被其提出者预测将产生最多历史性发现,且最少被研究[110]。本方案的模拟大自然是该支柱的实现场。
- 智能体社会模拟(Stanford生成式智能体 → Concordia → AgentSociety/OASIS):万级LLM智能体社会模拟在工程上可行[104][105][143],但长时程多代模拟中纯prompt反应式智能体会动力学退化(majority lock-in、方差衰减)[144]——"记忆/状态压缩"正是因果token化若承担该功能时的设计切入点。
科学母题的转移:智能的定义正从"拟合分布"转向"干预世界的后果预测"。商业母题的转移:从"生成内容"转向"可信模拟"。本方案恰好同时踩在这两个转移的箭头上——这是它的时代性,也是它必须承受两方质疑的原因。
10. 创业MVP:如何验证猜想
10.1 猜想验证树
根问题:因果token化是否值得做?
├─ C2a(最便宜的证伪点):模拟分叉数据能否让模型在模拟内学会反事实?
│ → 合成SCM + 分叉标注 + PEHE验证。若失败,整个项目停止。成本:周级。
├─ C1:do/CF训练是否产生OOD鲁棒表征?
│ → held-out SCM族 + 机制随机化 + 互换干预探针(pyvene)。成本:月级。
├─ C3:因果决策器是否有生态适应度优势?
│ → 独立生态锦标赛(同基座仅换决策器)。成本:数月级,GPU密集。
└─ 商业价值:因果错误率下降能否转化为客户付费指标?
→ 垂直场景A/B(下游指标改善)。成本:季度级。
关键排序原则:先证伪最便宜的。C2a失败则万事休;C1失败则退化为"模拟器特化模型",仍可能有垂直价值;C3失败但C1/C2成功,则转向卖"评估闭环"而非"因果能力"。
10.2 产业教训先行:Causal AI公司的失败模式
【高置信】"Causal AI公司"作为纯品类基本未能规模化:
- causaLens(品类旗舰,2022年$45M A轮)官网主定位已从"Causal AI平台"换成"Reliable Digital Workers",因果降级为技术配料[126][127];
- Geminos从"AI That Knows Why"转向按用例收费的咨询式交付[130];
- 存活者全部退守"高证据价值"垂直:Causaly服务全球top20药企中的12家、累计融资$93M——因果答案可被监管/证据链变现的地方[128];
- Aitia的教科书级自述:从卖因果AI技术平台转型自研管线biotech,原因是"卖技术没有反馈闭环、拿不到足够经济价值"[129];
- 背景压力:MIT NANDA报告95%生成式AI试点无可衡量P&L影响;Gartner预测至少30% GenAI项目在POC后被放弃[140]。
教训一句话:客户不想为"为什么"付钱,只想为"怎么办/省多少钱"付钱;不要卖技术平台,要卖垂直闭环。
10.3 世界模型侧的资本狂潮与降维打击风险
2025–2026年巨额资本加注【高置信】:World Labs累计$1.23B、估值约$5B(零披露收入)[131];AMI Labs(LeCun)$1.03B种子轮、pre-money $3.5B(明说第一年只做研究)[132];Decart约$4B(罕见地有收入——但来自推理优化栈DOS而非世界模型本身)[133];Odyssey $1.45B[134];Wayve $8.6B(GAIA-3合成测试使模型评估拒绝率降低5×——世界模型最先证明ROI的场景是AV安全验证的合成数据)[135]。
降维打击已成现实:NVIDIA Cosmos世界基础模型平台(9000万亿token训练)以开放许可免费发布,配套Omniverse与NeMo管线,目的是卖GPU[136];NVIDIA同时是Decart、World Labs、Wayve、AMI的投资人。基础模型实验室(Genie、Waymo用Genie衍生模型做驾驶安全验证)也在内化该能力。任何"通用世界模型"或"更懂因果的通用大模型"定位,会在18–36个月内被双向挤压——Inworld AI的教训(AI NPC引擎明星→被迫转型通用运行时,"中间层被上端基础模型API与下端游戏引擎自建两头挤压")[137]。
10.4 切口排序
- 首选:游戏NPC与动态叙事。NPC-AI市场2025年$1.86B→2030年$7.22B(CAGR 31.1%,口径分散、趋势可信)[139]。因果正确性要求低(玩家容忍幻觉)、迭代快、可API收费;"NPC记住并正确推理玩家行为的长期后果"恰是当前LLM NPC的短板。必须绑定具体游戏品类做深,不做通用引擎(Inworld教训)。
- 次选:AV/机器人反事实场景编辑。Decart Oasis 3实测暴露的缺口——长时一致性退化、车穿物体、物理不正确[133]——即世界模型生成数据"看起来真"但"因果不对"。若因果token化能做do-operator级场景编辑("如果前车刹车"),可作为Cosmos/Genie生态之上的因果正确性质量层卖给AV仿真团队。付费意愿已被Wayve内部5×指标验证[135],但销售周期长、需要硬技术证据。
- 谨慎:数字孪生决策层。市场最大(2025年$35.8B→2033年预测$328.5B,CAGR 31.1%)[138],但孪生本体被Siemens/PTC/NVIDIA占据,切口只能是"孪生之上的what-if决策层",且需忍受95%的试点失败率环境。作为B2B第二曲线,不作MVP首发。
- 不建议:科学模拟/药物发现。Causaly/Aitia证明有钱可赚,但数据壁垒、湿实验验证周期与领域资历对初创MVP过重。
10.5 12个月路线
M0–3:单元层POC(验证C2a+C1初筛)
- 5–10个程序化生成SCM(含因果图、结构方程、噪声全记录),分叉标注产出"事实-反事实"配对数据(§4配方);
- 训练小模型(0.5B–3B,CAPT证明该尺度足够[20]),三种新token+噪声通道设计;
- 验证:PEHE/ε_ATE vs NTP基线;held-out SCM族OOD测试;pyvene互换干预探针检验因果token语义;Caliper式词汇匿名化抗复述检验[10];
- Go/No-Go门槛:模拟内PEHE显著低于基线,且OOD衰减有限。
M3–6:进化锦标赛实验(验证C3)
- 环境:JAX加速的Polyworld/Neural MMO级生态(数百个体即可,Craftax/QDax路线[65]),资源严格守恒、寿命有限、谱系精确追踪、minimal criterion;
- 对照设计:因果模型 vs 同基座NTP微调版 vs 规则/随机,同基座同数据仅改训练目标(隔离对齐先验混杂[67][68]);
- ≥5–10独立种子(FunSearch教训:140次独立运行仅4次复现headline结果,进化式搜索方差极大[141]);验证锦标赛独立于训练压力(§6);
- 成本测算:100个体×1000步/代×100代约10⁸次推理——用2B级本地小模型+vLLM批处理(单卡4090可跑权重级群体进化[103]),GM模式把环境演化交给确定性代码[105],LLM推理预算集中在关键决策(交配选择、联盟、资源分配)。
M6–12:垂直场景试点
- 选一个可量化"因果错误成本"的场景(NPC长期记忆/后果一致性,或驾驶反事实场景编辑),做因果token化 vs 普通LLM/世界模型的A/B;
- 证明"因果错误率下降→下游指标(玩家留存/策略评估拒绝率)改善"——Wayve内部GAIA-3的5×指标是投资人当前唯一买账的证据形式[135]。
10.6 成本估算与缓解
| 成本项 | 量级 | 缓解 |
|---|---|---|
| 单元层训练 | 单卡–数卡周级 | CAPT式100样本级后训练即可初筛[20];两阶段课程(先观察预训练后干预对齐,V-JEPA 2-AC仅62小时[93]) |
| 进化锦标赛 | 10⁸次推理/实验,代际串行 | 小模型本地化、分层人口(核心个体LLM+普通个体规则)、GM批处理、JAX向量化环境[65][103][105] |
| 种子重复 | 预算×5–10 | FunSearch复现率教训,必须预留[141] |
| 数据标注 | 人工1万–5万步级起步 | 模拟器分叉+rollout自动标注为主,人工只做高价值子集+主动学习[44][53] |
10.7 护城河:评估闭环与数据飞轮
假设NVIDIA Cosmos与GPT/Gemini的反事实能力持续增强,防御位只剩三个:
- 垂直专有数据飞轮(Odyssey实拍背包、Wayve车队模式)——场景内"决策→后果→回流"数据别人没有;
- 因果正确性的可验证评测标准——自己做基准并开源,抢占"谁定义正确"的话语权(世界模型领域公认缺因果一致性指标[71],这是话语真空);
- 深度嵌入客户工作流(仿真管线、游戏引擎插件)。
最终形态判断:卖垂直闭环,不卖技术平台——Aitia用真金白银买到的教训[129]。
11. 结语:反事实是智能的测地线
人类智能最独特的动作,不是记住发生了什么,而是问"如果当初不那样,会怎样"。后悔、复盘、吸取教训、规划、负责——这些认知动作的形式化都是反事实:时光倒流,只改一个决定,看结局如何。
今天的LLM把人类所有的"发生了什么"读了一遍,却从未活在"做了会怎样"的世界里。因果层级定理说,这条路在数学上走不通——观测数据原则上爬不上因果之梯[2]。但同一份理论也给出了出路:梯子是三层的数据问题,不是三层的能力问题。把干预和反事实放进训练分布,定理就不再是天花板,而是施工图。
模拟大自然是这份施工图里最大胆的一笔。它的深层逻辑是:地球上产生智能的算法不是梯度下降,而是自然选择——一个不需要ground truth、不需要标注、只需要"活下去"的评估器。把认知架构放进这个评估器里,问"谁的基因传下去了",是在用35亿年的老办法检验最新的人工造物。这个实验从来没人做过:不是因为它显然可行,而是因为它恰好落在四个领域的接缝上,每个领域都缺一块别人手里的拼图。
需要诚实声明的三条边界:模拟内的反事实是模拟SCM的反事实,对现实的有效性依赖不可检验的假设;适应度只能验证、不能训练,否则优化器会先黑掉评估器;以及,如果这条路真的走通了,造出的东西既能预测"干预世界的后果",也就能预测"干预人的后果"——治理必须与能力同步前置。
反事实不可证伪,这曾是它最大的弱点。而在一个可以自己出题、自己判卷、自己进化的模拟大自然里,它第一次变成了可以被实验逼近的东西。这或许就是为什么"从预测下一个字到预测下一个行动的结果"不只是一次训练目标的修改——它是在问:智能的测地线,究竟是拟合过去的分布,还是推演未曾发生的分支。
来源清单
因果×LLM与评测
- [85] Geiger et al., Causal Abstractions of Neural Networks (NeurIPS 2021). https://arxiv.org/abs/2106.02997 ↩
- [86] Geiger et al., DAS: Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations (ICLR 2024). https://arxiv.org/abs/2303.02536 ↩
- [87] Wu et al., Interpretability at Scale / Boundless DAS (NeurIPS 2023). https://arxiv.org/abs/2305.08809 ↩
- [88] Feder et al., CausaLM (Computational Linguistics 2021). https://aclanthology.org/2021.cl-2.3/ ↩
- [1] Richens & Everitt, Robust Agents Learn Causal World Models (ICLR 2024). https://arxiv.org/abs/2402.10877 ↩
- [2] Bareinboim, Correa, Ibeling, Icard, On Pearl's Hierarchy and the Foundations of Causal Inference (因果层级定理). https://arxiv.org/html/2502.06398v2 ↩
- [3] Xia, Lee, Bengio, Bareinboim, The Causal Neural Connection (NeurIPS 2021, arXiv:2107.00793). 介绍见 https://cloud.tencent.cn/developer/article/1852686 ↩
- [4] Wang et al., SOTOPIA-π (ACL 2024). https://arxiv.org/abs/2403.08715 ↩
- [5] Lehman et al., The Surprising Creativity of Digital Evolution (Artificial Life 2020). https://arxiv.org/abs/1803.03453 ↩
- [6] Hartnett对Judea Pearl的访谈, Quanta Magazine (2018). https://www.quantamagazine.org/to-build-truly-intelligent-machines-teach-them-cause-and-effect-20180515/ ↩
- [7] Kıcıman, Ness, Sharma, Tan, Causal Reasoning and Large Language Models (2023). https://arxiv.org/abs/2305.00050 ↩
- [8] Jin et al., CLadder (NeurIPS 2023). https://arxiv.org/abs/2312.04350 ↩
- [9] Jin et al., CORR2CAUSE (ICLR 2024). https://arxiv.org/abs/2306.05836 ↩
- [10] Yu & Zhou, Caliper (2026). https://arxiv.org/abs/2606.04915 ↩
- [11] Ding & Zhang, Causal Tongue-Tie (2026). https://arxiv.org/abs/2605.25891 ↩
- [12] Frohberg & Binder, CRASS (LREC 2022). https://arxiv.org/pdf/2112.11941.pdf ↩
- [13] Chen et al., CounterBench (2025). https://arxiv.org/html/2502.11008v1 ↩
- [14] Zečević et al., Causal Parrots (TMLR 2023). https://arxiv.org/abs/2308.13067 ↩
- [15] Bender et al., On the Dangers of Stochastic Parrots (FAccT 2021). https://s10251.pcdn.co/pdf/2021-bender-parrots.pdf ↩
- [16] Bender IEEE Spectrum五周年访谈 (2026). https://spectrum.ieee.org/stochastic-parrot ↩
- [17] Kambhampati et al., LLMs Can't Plan / LLM-Modulo (2024). https://arxiv.org/abs/2402.01817 ↩
- [18] LeCun "token generators"报道, AIM Research (2025). https://aimresearch.co/market-industry/yann-lecun-calls-llms-token-generators-while-llama-hits-a-billion-downloads ↩
- [19] A Critical Review of Causal Reasoning Benchmarks for LLMs (2024). https://www.x-mol.com/paper/1811961062973042688 ↩
- [20] Gui & Ji, CAPT: Causality-Aware Post-Training (2025). https://arxiv.org/abs/2506.09433 ↩
- [21] Li et al., Emergent World Representations / Othello-GPT (ICLR 2023). https://arxiv.org/abs/2210.13382 ↩
- [22] Vafa et al., Evaluating the World Model Implicit in a Generative Model (NeurIPS 2024). https://arxiv.org/abs/2406.03689 ↩
- [23] Mahowald et al., Dissociating Language and Thought in Large Language Models (TiCS 2024). https://arxiv.org/abs/2301.06627 ↩
可辨识性理论
- [24] Holland, Statistics and Causal Inference (JASA 1986). https://www.jstor.org/stable/2289064 ↩
- [25] Correa, Lee, Bareinboim, Nested Counterfactual Identification (Ctf-ID) (NeurIPS 2021). https://proceedings.neurips.cc/paper_files/paper/2021/file/36bedb6eb7152f39b16328448942822b-Paper.pdf ↩
- [26] Zhang, Tian, Bareinboim, Partial Counterfactual Identification (ICML 2022). https://causalai.net/r78.pdf ↩
- [27] Raghavan et al., Causal Identification from Counterfactual Data (CTFIDU+) (2026). https://arxiv.org/abs/2602.23541 ↩
- [28] Shpitser & Pearl, What Counterfactuals Can Be Tested (UAI 2007). https://arxiv.org/pdf/1206.5294 ↩
- [29] Dawid, Causal Inference without Counterfactuals (JASA 2000). https://doi.org/10.1080/01621459.2000.10473910 ↩
- [30] Claru.ai, The Sim-to-Real Gap Explained (2026). https://claru.ai/blog/sim-to-real-gap ↩
- [31] Huang et al., CMPASS: Closing the Sim-to-Real Gap via Differentiable Causal Discovery (AAMAS 2023). https://proceedings.mlr.press/v229/huang23c/huang23c.pdf ↩
- [32] Linear Causal Disentanglement via Interventions(含Eberhardt干预数定理综述). https://arxiv.org/html/2211.16467v3 ↩
- [33] Vlontzos et al., Deep Monotonic Twin Networks / Counterfactual Ordering (Nature MI 2023). https://arxiv.org/pdf/2109.01904 ↩
- [34] 非线性ICA/无监督解耦不可辨识性(Locatello 2019; Hyvarinen 2019,综述引述). https://arxiv.org/html/2606.18509v1 ↩
- [35] CITRIS(Lippe et al., ICML 2022)及干预目标信息的辨识性(综述引述). https://arxiv.org/html/2508.04492v3 ↩
世界模型
- [36] Schrittwieser et al., MuZero (Nature 2020). https://www.nature.com/articles/s41586-020-03051-4 ↩
- [89] Ha & Schmidhuber, World Models (NeurIPS 2018). https://arxiv.org/abs/1803.10122 ↩
- [90] Hafner et al., DreamerV3 (Nature 2025). https://arxiv.org/abs/2301.04104 ↩
- [91] Hu et al., GAIA-1 (2023). https://arxiv.org/abs/2309.17080 ↩
- [92] Yang et al., UniSim (ICLR 2024). https://arxiv.org/abs/2310.06114 ↩
- [93] Assran et al., V-JEPA 2 (2025). https://arxiv.org/abs/2506.09985 ↩
- [94] Bruce et al., Genie (ICML 2024). https://arxiv.org/abs/2402.15391 ↩
- [95] DeepMind, Genie 3 官方博客 (2025-08). https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/ ↩
- [96] OpenAI, Video generation models as world simulators (2024). https://openai.com/research/video-generation-models-as-world-simulators ↩
- [97] Zhu et al., Is Sora a World Simulator? (2024). https://arxiv.org/abs/2405.03520 ↩
- [98] Chen et al., Decision Transformer (NeurIPS 2021). https://arxiv.org/abs/2106.01345 ↩
- [99] Janner et al., Trajectory Transformer (NeurIPS 2021). https://arxiv.org/abs/2106.02039 ↩
- [100] Reed et al., Gato (TMLR 2022). https://arxiv.org/abs/2205.06175 ↩
- [109] Garrido et al., Intuitive physics in V-JEPA (IntPhys) (2025). https://arxiv.org/abs/2502.11831 ↩
- [123] Schölkopf et al., Toward Causal Representation Learning (2021). https://arxiv.org/pdf/2102.11107v1.pdf ↩
- [124] Bengio, 北京大学讲座 Towards Compositional Understanding of the World (2019). https://cfcs.pku.edu.cn/english/news/236907.htm ↩
- [125] LeCun, A Path Towards Autonomous Machine Intelligence (2022). https://openreview.net/pdf?id=BZ5a1r-kVsf ↩
反事实方法与数据工程
- [37] Pawlowski et al., Deep Structural Causal Models (NeurIPS 2020). https://arxiv.org/abs/2006.06485 ↩
- [38] Sanchez & Tsaftaris, Diff-SCM (CLeaR 2022). https://arxiv.org/abs/2202.10166 ↩
- [39] Chatzi et al., Counterfactual Token Generation in Large Language Models (CLeaR 2025). https://arxiv.org/abs/2409.17027 ↩
- [40] Pona et al., Abstract Counterfactuals for Language Model Agents (2025). https://arxiv.org/abs/2506.02946 ↩
- [41] Swaminathan & Joachims, Counterfactual Risk Minimization (JMLR 2015). https://jmlr.org/papers/volume16/swaminathan15a/swaminathan15a.pdf ↩
- [42] Levine et al. Offline RL综述 / D4RL (BAIR Blog 2020). http://bair.berkeley.edu/blog/2020/06/25/D4RL/ ↩
- [43] Silver et al., AlphaZero (2017). https://arxiv.org/pdf/1712.01815 ↩
- [44] Math-Shepherd/OmegaPRM(过程标注自动化,综述引述). https://arxiv.org/html/2507.15512v1 ↩
- [45] AgenTracer (ICLR 2026). https://arxiv.org/abs/2509.03312 ↩
- [46] Ahmed et al., CausalWorld (2020). https://arxiv.org/abs/2010.04296 ↩
- [47] Benchmarking Counterfactual Image Generation (NeurIPS 2024 D&B). https://arxiv.org/html/2403.20287v3 ↩
- [48] Kaushik et al., CAD: Counterfactually-Augmented Data (ICLR 2020). https://arxiv.org/abs/1909.12434 ↩
- [49] Dixit et al., CORE: Retrieve-then-Edit (Findings of EMNLP 2022). https://aclanthology.org/2022.findings-emnlp.216/ ↩
- [50] Chen et al., DISCO (ACL 2023). https://aclanthology.org/2023.acl-long.344/ ↩
- [51] Hüyük et al., Reasoning Elicitation via Counterfactual Feedback (ICLR 2025). https://arxiv.org/abs/2410.03767 ↩
- [52] Open X-Embodiment (2023). https://arxiv.org/abs/2310.08864 ↩
- [53] Lightman et al., Let's Verify Step by Step / PRM800K (2023). https://arxiv.org/abs/2305.20050 ↩
- [148] Wachter, Mittelstadt, Russell, Counterfactual Explanations Without Opening the Black Box (HJLT 2018). https://jolt.law.harvard.edu/articles/pdf/v31/31HarvJLTech841.pdf ↩
- [149] von Kügelgen et al., Backtracking Counterfactuals (CLeaR 2023). https://arxiv.org/pdf/2211.00472.pdf ↩
ALife与进化
- [54] Ray, An Approach to the Synthesis of Life / Tierra (1991). https://tomray.me/pubs/alife2/Ray1991AnApproachToTheSynthesisOfLife.pdf ↩
- [55] Ofria et al., Avida (2004). https://www.cse.msu.edu/~ofria/pubs/2004OfriaEtAl.pdf ↩
- [56] Yaeger, PolyWorld: Life in a New Context (1994). https://cis.temple.edu/tagit/presentations/PolyWorld.pdf ↩
- [57] Smith, Is Echo a Complex Adaptive System? https://people.reed.edu/~mab/publications/papers/smith.pdf ↩
- [58] Chan, Towards Large-Scale Simulations of Open-Ended Evolution in Continuous Cellular Automata (GECCO 2023). https://arxiv.org/abs/2304.05639 ↩
- [59] Flow-Lenia讨论:Self-Reproduction and Evolution in Cellular Automata (2024). https://arxiv.org/html/2402.03961v1 ↩
- [60] Soros & Stanley, Necessary Conditions for Open-Ended Evolution (Chromaria) (OEE4). http://workshops.alife.org/oee4/papers/soros-oee4-camera-ready.pdf ↩
- [61] Wang et al., POET (ICML 2019). https://arxiv.org/pdf/1901.01753.pdf ↩
- [62] DeepMind, Generally capable agents emerge from open-ended play (XLand) (2021). https://deepmind.google/blog/generally-capable-agents-emerge-from-open-ended-play/ ↩
- [63] Suarez et al., Neural MMO (2019). https://arxiv.org/abs/1903.00784 ↩
- [64] Neural MMO v1.3 (2020). https://arxiv.org/pdf/2001.12004 ↩
- [65] Chalumeau et al., QDax (JMLR 2024). https://www.jmlr.org/papers/v25/23-1027.html ↩
- [66] Novelty search与deception(综述). https://arxiv.org/html/2203.05674v3 ↩
- [110] Clune, AI-GAs (2019). https://arxiv.org/abs/1905.10985 ↩
- [70] Analysis: Frameworks and Theories for Social Simulation (Springer 2018, §6). https://link.springer.com/chapter/10.1007/978-3-319-72408-9_6 ↩
LLM智能体与生态
- [67] Payoff scaling shapes cooperation in LLM agents (2026). https://arxiv.org/abs/2601.19082 ↩
- [68] FAIRGAME: Understanding LLM Agent Behaviours via Game Theory (2025). https://arxiv.org/abs/2512.07462 ↩
- [69] Tešić et al., Beyond the high score (Melting Pot竞赛分析) (2025). https://arxiv.org/html/2509.14485v1 ↩
- [101] BEAR: Behavioral Inheritance and Evolution in LLM-Controlled Agent Populations (PLOS One 2026). https://zenodo.org/records/20149759 ↩
- [102] Do LLM Agents Exhibit a Survival Instinct? (Sugarscape式) (2025). https://arxiv.org/abs/2508.12920 ↩
- [103] Zhang et al., Population-Based Evolution of LLMs (2025). https://arxiv.org/abs/2503.01155 ↩
- [104] Park et al., Generative Agents (UIST 2023). https://arxiv.org/abs/2304.03442 ↩
- [105] Vezhnevets et al., Concordia (2023). https://arxiv.org/abs/2312.03664 ↩
- [106] Yang et al., Project Sid (Altera, 2024). https://arxiv.org/abs/2411.00114 ↩
- [107] Kumar et al., ASAL: Automated Search for Artificial Life (2024). https://arxiv.org/abs/2412.17799 ↩
- [108] Akata et al., Playing repeated games with LLMs (Nature Human Behaviour 2025). https://www.nature.com/articles/s41562-025-02172-y ↩
- [143] Piao et al., AgentSociety (2025). https://arxiv.org/abs/2502.08691 ↩
- [144] Coupling Macro Dynamics and Micro States(长时程退化问题,2026). https://arxiv.org/abs/2604.05516 ↩
- [145] Guo et al., DeepSeek-R1 (2025). https://arxiv.org/html/2501.12948v1 ↩
- [146] Gandhi et al., Cognitive Behaviors that Enable Self-Improving Reasoners (2025). https://arxiv.org/abs/2503.01307 ↩
- [147] oat-zero, There May Not be Aha Moment in R1-Zero-like Training (2025). https://github.com/sail-sg/oat-zero ↩
验证方法论
- [71] The Imperative of Physical Grounding in World Models (2026, §7). https://arxiv.org/html/2601.15533v1 ↩
- [72] Sargent V&V框架(综述引用). https://onlinelibrary.wiley.com/doi/10.1002/ceat.202400331 ↩
- [73] Grimm et al., Pattern-Oriented Modeling (Science 2005). https://www.science.org/doi/10.1126/science.1116681 ↩
- [74] Alaa & van der Schaar, Limits of Estimating Heterogeneous Treatment Effects (ICML 2018, PEHE评估困境). http://proceedings.mlr.press/v80/alaa18a/alaa18a-supp.pdf ↩
- [75] Ross, Gordon & Bagnell, DAgger (AISTATS 2011). https://arxiv.org/abs/1011.0686 ↩
- [76] Codevilla et al., Exploring the Limitations of Behavior Cloning for Autonomous Driving (ICCV 2019). https://arxiv.org/abs/1904.08980 ↩
- [77] ATM: Action-Consistency Transfer Matrix (2026). https://arxiv.org/html/2606.09028v1 ↩
- [78] World Model for Robot Learning: A Comprehensive Survey (2026, §7). https://arxiv.org/html/2605.00080v1 ↩
- [79] Vinyals et al., AlphaStar (Nature 2019). https://www.nature.com/articles/s41586-019-1724-z ↩
- [80] NeurIPS 2023 Neural MMO Competition Results (2025). https://arxiv.org/html/2508.12524v1 ↩
- [81] Chiang et al., Chatbot Arena (ICML 2024). https://arxiv.org/html/2403.04132v1 ↩
- [82] Tournament of Prompts: Elo as fitness (2025). https://arxiv.org/html/2506.00178v2 ↩
- [83] Goodhart's Law in Reinforcement Learning (ICLR 2024). https://arxiv.org/abs/2310.09144 ↩
- [84] Take Goodhart Seriously (2025). https://arxiv.org/abs/2510.02840 ↩
反方证据与风险
- [111] Berglund et al., The Reversal Curse (2023). https://arxiv.org/abs/2309.12288 ↩
- [112] Nezhurina et al., Alice in Wonderland (2024). https://arxiv.org/abs/2406.02061 ↩
- [113] Roy & Parbhoo, Why LLMs Fail at Causal Discovery (kernel obstruction) (2026). https://arxiv.org/abs/2605.27567 ↩
- [114] The Reality Gap in Robotics (2025). https://arxiv.org/abs/2510.20808 ↩
- [115] Feedback Loops With Language Models Drive In-Context Reward Hacking (ICML 2024). https://arxiv.org/abs/2402.06627 ↩
- [116] Reward tampering and evolutionary computation (GP&EM 2023). https://link.springer.com/article/10.1007/s10710-023-09456-0 ↩
- [117] Susser, Roessler, Nissenbaum, Online Manipulation (2019). https://doi.org/10.14763/2019.2.1410 ↩
- [118] Kramer et al., Facebook情绪传染实验 (PNAS 2014). https://www.pnas.org/doi/10.1073/pnas.1320040111 ↩
- [119] Bakir, Psychological Operations in Digital Political Campaigns (2020). https://www.frontiersin.org/journals/communication/articles/10.3389/fcomm.2020.00067/full ↩
- [120] Williams-Ceci et al., Are LLMs Manipulating Us? (Cornell DLI 2026). https://dli.tech.cornell.edu/post/are-large-language-models-manipulating-us-an-analysis-based-on-susser-roessler-nissenbaum-2019 ↩
- [121] Wu et al., Reasoning or Reciting? (NAACL 2024). https://arxiv.org/html/2307.02477 ↩
- [122] Zhou et al., CausalBench (2024). https://arxiv.org/abs/2404.06349 ↩
产业格局
- [126] causaLens A轮融资报道 (2022). https://new.qq.com/rain/a/20220129A068KJ00 ↩
- [127] causaLens官网. https://causalens.com/ ↩
- [128] Causaly融资与客户(智慧芽报道). https://synapse.zhihuiya.com/organization/8e7427bc97c5b8f36d33faffaa4e6f12 ↩
- [129] Aitia, Causal AI and digital twins in drug discovery (Nature Biotech特稿). https://www.aitiabio.com/wp-content/uploads/2024/09/Causal-artificial-intelligence-and-digital-twins-are-transforming-drug-discovery-and-development.pdf ↩
- [130] Geminos官网. https://www.geminos.ai/ ↩
- [131] World Labs $1B融资报道 (2026). https://www.siliconrepublic.com/business/fei-fei-li-world-labs-raises-1bn-to-spatial-intelligence-ai-world-models-marble ↩
- [132] AMI Labs估值报道 (2026). https://dataconomy.com/2026/03/10/yann-lecuns-ami-labs-hits-3-5-billion-pre-money-valuation/ ↩
- [133] Decart Oasis 3实测 (TechCrunch 2026). https://techcrunch.com/2026/06/10/decarts-new-world-model-can-simulate-hours-of-photorealistic-driving-with-some-caveats/ ↩
- [134] Odyssey B轮报道 (TechCrunch 2026). https://techcrunch.com/2026/06/17/world-model-maker-odyssey-nabs-1-45b-valuation-backed-by-amazon-and-other-big-names/ ↩
- [135] Wayve融资与GAIA-3 ROI (Sifted). https://sifted.eu/articles/wayve-nvidia-softbank-microsoft-uber-funding-round ↩
- [136] NVIDIA Cosmos官方新闻稿 (2025). https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-world-foundation-model-platform-to-accelerate-physical-ai-development ↩
- [137] Inworld Runtime转型公告 (2025). https://www.globenewswire.com/news-release/2025/08/13/3132320/0/en/inworld-runtime-the-first-ai-runtime-for-consumer-applications.html ↩
- [138] 数字孪生市场 (Grand View Research). https://www.grandviewresearch.com/industry-analysis/digital-twin-market ↩
- [139] NPC生成AI市场 (TBRC). https://www.thebusinessresearchcompany.com/report/non-player-character-npc-generation-artificial-intelligence-ai-global-market-report ↩
- [140] 企业AI试点失败率综述(引MIT NANDA/Gartner/IDC). https://www.techaheadcorp.com/blog/enterprise-ai-pilot-to-production/ ↩
- [141] LLM-as-optimizers综述(FunSearch复现率4/140). https://arxiv.org/html/2606.15577 ↩
本报告基于13份前置维度调研与交叉验证材料撰写。置信度说明:标注【定理】的内容有形式化证明;【高置信】为≥2个独立来源确认;2026年新预印本(Caliper、Tongue-Tie、kernel obstruction、CTFIDU+等)未经同行评审,结论待复现;市场数据口径分散,趋势可信、绝对值存疑。