Research memo · 2026.07.30

从下一个 Token,走向下一种可能世界

一份关于“因果行动大模型”的可行性报告:如何让模型学习 行动 → 结果干预反事实, 并用有限寿命、有限资源、繁殖与自然选择的多智能体世界来生成可验证数据。

Executive verdict

可以做,但应把项目定义为“可分叉的因果行动世界模型”,而不是“把下一个字换成下一个行动”。

状态、动作、奖励早已被 Decision Transformer 与 Trajectory Transformer 序列化;Dreamer、Genie、 V-JEPA 等也已学习 action-conditioned future。你真正可能新增的东西,是在同一世界快照与同一外生随机条件下, 主动执行不同 do(action),得到成对乃至多分支的结果,并直接训练和评估“行动效应”。

核心猜想: 在等参数、等环境交互步数、等训练算力下,使用“共享起点 + 共享外生随机性 + 不同动作”的成对分支监督, 会比普通单轨迹世界模型学出更稳定的行动效应表示;这种优势应在未见机制组合、新对手策略与长期规划 regret 上表现出来。
Branching world model Causal representation Multi-agent RL Artificial life Open-ended learning Decision intelligence

“Token 化”只是接口

把动作写成 <DO SHARE> 并不会自动产生因果性;关联数据仍可能只让模型学到策略偏好与结果的混杂。

模拟器是因果显微镜

它能保存完整状态、精确分叉、控制随机源,因此可同时观察事实与反事实——现实日志通常做不到。

创业护城河在基础设施

可确定 replay、fork runtime、配对数据、严格评测与商业模拟器连接器,比单一 Transformer 结构更难替代。

01 / FALSIFIABILITY

先把大构想拆成三条可证伪命题,再承认第四条边界

“模型学会因果”太宽,任何结果都能被事后解释。真正可执行的研究计划应把表征、数据、功能和现实迁移分开验。

C1 · MECHANISM

表征猜想

do / 反事实信号训练出的表征,应在未见机制组合和分布偏移下更鲁棒。若只在原词表与原规则内有效,它学到的可能仍是查表。

C2 · DATA

分叉数据猜想

固定外生噪声、从同一状态只替换行动并重跑,可在模拟器内生成现实中不可得的个体级反事实真值;失败点是配对监督是否真的带来额外价值。

C3 · FUNCTION

适应度猜想

在独立生态锦标赛里,因果决策器应获得更低 regret、更高生存率或亲缘加权繁殖成功率。它最昂贵、最原创,也最容易被奖励投机污染。

C4 · sim-to-real 才决定现实价值

模拟器里学到的是模拟 SCM 的反事实。迁移到现实依赖一个无法只靠模拟内成绩证明的结构同构假设。最诚实的上限是:模拟内 L1–L3 可监督;现实中的干预层可通过实验逐步校准;个体反事实只能带结构假设声明。

Goodhart 隔离规则:适应度只能验证,不能同时充当训练目标

若“基因传递概率”既是选择压力又是成功指标,系统会先优化锦标赛漏洞。训练应使用单元层因果误差与配对损失;验证则放在物理隔离、规则族留出、对手与生态位均未见过的锦标赛里,并与 PEHE、校准和动作排序联合解读。

02 / SEMANTICS

先把三个问题分开:看见、干预、反事实

“预测行动之后发生什么”可能仍只是相关性预测。只有数据或结构假设支持 do(·) 语义,才进入因果层。

L1 · ASSOCIATION

看到采取 A 的人,后来怎样?

P(Y | A = a, history)

普通 next-token、行为克隆和观察轨迹可学。若行动由聪明策略选择,A 与 Y 可能同时受隐藏状态影响。

L2 · INTERVENTION

如果强制采取 A,会怎样?

P(Y | do(A = a), St)

需要随机干预、已知结构或足以消除混杂的状态。模拟器可直接把行动变量替换掉。

L3 · COUNTERFACTUAL

已知刚才做了 A,若当时做 B 呢?

P(YB | A=a, Y=y, evidence)

要先从事实证据反推这一次世界的隐藏扰动,再在同一“个体世界”上换行动并向前预测。

决定成败的概念边界

P(Y | A) 通常不等于 P(Y | do(A))。例如强者更常选择攻击且更容易存活, 观察数据会把“强者的体质”误算成“攻击的效果”。仅改变词表无法修复这一点。

一个很关键的“存在性证明”:next-token 与因果并不矛盾

NeurIPS 2025 的 Causal Discovery and Inference through Next-Token Prediction 表明, GPT 风格 Transformer 仅用 next-token loss,也能从干预样本发现简单线性高斯 SCM, 并把学到的反事实算法用于未见过反事实答案的 SCM。它证明训练目标不会阻止因果能力; 但实验仍是极小、有限的人工 SCM 家族,不能说明真实世界因果性会靠规模自动涌现。

你想回答的问题最低数据要求能否直接验真典型失败
下一状态

执行动作后短期发生什么

覆盖充分的状态—动作—结果轨迹 可,用留出轨迹 长程误差累积;罕见行动缺数据
干预结果

强制行动带来的分布变化

随机化行动、已知 propensity,或可信 SCM 可,用新的随机干预 隐藏混杂;策略选择偏差
个体反事实

这一条实际世界线若换行动

共享起点、共享外生变量的 twin branches 模拟器中可;现实中通常不可直接观察 随机流错位;把“另一次随机试验”误作反事实
02 / MODEL

模型不是只“预测动作”,而是建一个可查询的行动后果分布

世界模型负责回答候选行动会造成什么;planner / policy 再选择行动。把两者分开,才容易验证模型是否真的理解结果。

01 · OBSERVE 实体化世界状态

智能体、资源、关系、年龄、能量、基因、局部历史。

02 · INTERVENE 候选 do(action)

actor、verb、target、amount;保留合法动作 mask。

03 · IMAGINE 分布式世界 rollout

事件、下一状态、他者响应、死亡与出生的概率分布。

04 · VALUE 多时间尺度结果

t+1 能量、t+32 生存、t+256 亲缘加权谱系。

05 · DECIDE 选择或拒答

按效应、风险与不确定性排序,或在 OOD 时 abstain。

St+1 = F(St, At, Ut+1, M)   ·   τ(a,b;H,U) = WH(do(a),U) − WH(do(b),U)

推荐结构:Entity-centric Transformer + latent state

  • 对象 token 表示智能体、资源与地形,而不是把整个网格粗暴 BPE;
  • 关系 attention / 图消息传递表示竞争、亲缘、攻击与分享;
  • RSSM 或时序 Transformer 维护部分可观察的 belief state;
  • 事件头、survival hazard 头、零膨胀后代计数头与校准不确定性头。

不要泄漏的“作弊答案”

  • 未来随机 seed 只用于构造和验真 twin world,不直接喂给部署模型;
  • fork_group_id 只做配对索引,不作为可预测特征;
  • 局部观察模型不能偷看全局状态;全局状态仅给 oracle / critic;
  • 训练与测试必须按规则族切分,不能只换 episode seed。
03 / BRANCHLIFE

可以模拟“自然选择”,但第一版应是一台实验仪器,不是一颗数字地球

自然选择只需变异、遗传与差异繁殖成功。开放世界、真实物理和视觉渲染都不是验证核心猜想的前置条件。

有限世界

32×32 程序化网格,16–64 个体,3–4 类会再生或有毒的资源,局部可见。

有限生命

能量代谢、成熟年龄、最大寿命、受伤与死亡;死亡让长期代价不可逆。

可遗传变异

8–16 个基因位点控制代谢、感知、攻击、分享等;后代复制并小概率突变。

差异繁殖

繁殖消耗能量且受资源、社会关系与风险影响;选择压力通过存活后代产生。

清晰因果标签优先于生物学丰富度

第一阶段采用单倍体、无性繁殖。这样每个谱系和基因拷贝都能精确归因;性繁殖、重组、择偶与抚育放到第二阶段, 否则一开始就会把亲缘归因、策略互动和训练问题搅在一起。

FAST LOOP

个体一生内

策略根据观察与记忆行动,学习采集、分享、欺骗、攻击或逃避。这里是 RL / planning。

SLOW LOOP

跨世代选择

基因与策略偏置被继承、突变和筛选。这里是 evolutionary computation / artificial life。

MODEL LOOP

离线学世界

因果世界模型从事实与分支数据中学习行动效应,再用于 MPC 或主动选择更有信息量的干预。

Fitness Wi(H) = Σd ∈ descendants(i,t+H) relatedness(i,d)   而不是   W = “活得久”

同时报告存活时间、直接后代、亲缘加权后代、等位基因频率变化、灭绝概率与最差 10% 结果。 “短期能量”只能是辅助监督:一个靠抢夺获得高能量但随后被联盟围攻的策略,可能短期好、长期适应度差。

04 / DATA

真正的核心资产:同一世界的分叉数据

保存状态快照,在一个决策点复制世界,替换焦点行动;之后允许其他智能体自然响应,但使用同一套按事件寻址的随机源。

同一快照 St
完整状态 hash · 行为策略 · 机制版本
事实分支 A do(SHARE) + 外生随机流 U → YA
反事实分支 B do(RAID) + 同一随机流 U → YB
行动效应 Δ = YA − YB,并对多个 U 估计完整分布
不要用一个会随调用次数前移的全局 RNG

某个动作多触发一次攻击判定,后续所有随机数就会错位。应用 hash(world_seed, timestep, entity_id, event_type, lineage_id) 生成结构化随机值,让未受影响的事件在两条世界线中仍共享同一外生条件。

建议的 fork 数据协议

数据组关键字段为什么保留
世界env_version, rule_set_id, world_seed, map_seed复现机制并按规则族切分 OOD。
快照snapshot_id, state_hash, full_state, local_obs确保两个分支真的从同一起点开始。
个体agent_id, genotype, age, energy, inventory, lineage_id实体化建模与谱系适应度归因。
行为behavior_policy_id, joint_action, action_propensity审计策略选择偏差;支持观察数据估计。
干预focal agent, actual, alternative, direct/total effect明确哪个变量被替换,以及评估哪种效应。
外生变量exogenous_key, policy random keys, event-addressed noise构造 unit-level twin worlds;部署时不喂给模型。
结果events, alive, hazard, offspring, descendants, allele growth同时监督短期机制和长期繁殖结果。
审计fork_group_id, parent hash, branch id, censoring配对、去泄漏、检查 replay 一致性。

“因果行动 token”可以长这样

<WORLD rule=scarce-v3>
<STATE t=184>
<AGENT id=7 age=41 energy=.62 genotype=g17 lineage=L4>
<REL kind=kin src=7 dst=12 r=.50>
<RESOURCE id=22 type=fruit amount=3>
<DO actor=7 action=SHARE target=12 amount=2>
<EVENT dt=1 actor_energy=-2 target_energy=+2>
<EVENT dt=16 relation=alliance_formed>
<OUTCOME dt=256 alive=0 lineage_copies_bin=3>
<CF alternative=HOARD delta_lineage_copies=-1>

建议数据规模(MVP)

  • 2,000 万普通 transition;
  • 5 万短期 fork states × 6 动作 × 4 随机流 × 32 步;
  • 5,000 长期 fork states × 6 动作 × 8 随机流 × 256 步;
  • 结构化事件 + 状态增量,约 50–200 GB。

行为策略混合

  • 30% 随机 / 覆盖式探索;20% 手工生态型;
  • 30% 不同训练阶段的 PPO / MAPPO;
  • 20% self-play 与不确定区域主动干预;
  • 另保留罕见动作与失败策略库。
05 / TWIN-WORLD LAB

亲手运行一次“当初如果没有这么做”

下面不是训练好的模型,而是一台最小因果数据生成器:32 对世界从相同状态出发,共享同一随机流,只替换第 6 tick 的焦点行动。

BranchLife · paired counterfactual demo

曲线显示焦点基因谱系在后续 48 tick 的平均存活拷贝。改变世界、寿命或两种行动,观察行动效应是否稳定。

玩具机制 · 只演示评测几何
行动效应 Δ · 事实 − 反事实
谱系拷贝的配对 95% 区间
事实分支
反事实分支
两个行动分支的谱系规模 比较事实行动与反事实行动之后,焦点谱系随时间的平均存活拷贝数。
如何读这个实验

选择同一个行动作为 A 与 B,可做负对照:配对差应该接近 0。选择不同动作时,Δ 是这台玩具 SCM 内的因果效应估计; 它不证明真实自然中的分享或掠夺必然更优,也不代表训练模型已经学会了该效应。

06 / TRAINING

用普通轨迹学世界,用分支差分学行动效应

首版 30M–100M 参数足够检验算法价值。不要用十亿参数掩盖实验设计问题。

四阶段训练

  1. 普通轨迹预训练状态转移、事件与局部奖励;
  2. 短期 fork 学干预结果与成对差值;
  3. 长期 fork 学 survival hazard、后代分布与动作排序;
  4. 接入 MPC / candidate reranker,在真实模拟器闭环验证。

多尺度输出分布

  • 连续状态:mixture likelihood / quantile;
  • 事件:categorical NLL / Brier;
  • 生存:hazard / integrated Brier;
  • 后代:negative-binomial 或 zero-inflated count;
  • 行动效应:paired Huber / PEHE + ranking loss。
L = λ₁Ltransition + λ₂Levent + λ₃Loutcome-NLL + λ₄Lpaired-effect + λ₅Lranking + λ₆Lcalibration

必须击败的不是语言模型,而是强世界模型与公平零假设

Baseline / 消融它控制了什么如果打不过意味着什么
Trajectory Transformer状态、动作、奖励已经可被统一序列化。“行动 token 化”本身没有新意。
DreamerV3 / RSSM强 action-conditioned latent imagination。新方法没有胜过成熟世界模型。
相同分支轨迹,但不告诉配对两边数据完全相同,只有 paired objective 不同。差异来自更多数据,而非因果结构。
打乱 fork 配对破坏相同状态 / 相同 U 的语义。若性能不降,模型没利用反事实配对。
去掉差分 / 排序损失检验每项 objective 的边际价值。复杂损失只是装饰。
真实模拟器枚举 / 完整状态 oracle给出性能上界和不可约随机性。模型是否接近可达到极限。
07 / EVALUATION

“接近还是偏离”要从像不像,升级为决策是否等价

一条视频很逼真,不代表它给候选行动排对了序。对行动模型最有力的证据是:反事实分支、策略排名与闭环 regret。

层级
预测什么
怎么验
关键指标
L1 · 局部机制
事件与下一状态

能量、伤害、资源变化。

留出 transition

不只 teacher forcing,也闭环 rollout。

NLL / Brier

状态误差、事件 F1、校准。

L2 · 干预结果
P(Y | do(a), S)

多个随机流下的结果分布。

未见 fork states

对每个候选动作真实重跑。

CRPS / Wasserstein

ATE、CATE、effect sign。

L3 · 个体反事实
Ya − Yb

同状态、同 U 的成对差。

twin-world oracle

按 fork group 逐样本比。

PEHE / paired RMSE

区间 coverage。

L4 · 决策价值
动作排序与 policy value

模型选的行动是否真的更好。

模拟器闭环

MPC / reranking 后实际执行。

Kendall τ / regret

fitness、CVaR、灭绝率。

建议预注册的成功门槛

  • OOD normalized PEHE 或 intervention-CRPS 降低 ≥20%;
  • 候选行动排序 Kendall τ 提高 ≥0.10;
  • action regret 降低 ≥25%,亲缘加权 fitness 提高 ≥10%;
  • 至少 5 个训练种子、4 类未见生态,95% CI 不跨 0。

应停止“新模型范式”宣称

  • 同分支数据下 paired objective 改善不到 5%;
  • 预测指标好看,但模拟器中的决策没有改善;
  • 优势来自完整状态、未来 seed 或 branch ID 泄漏;
  • 只在一个规则集成立,外部环境复现失败。
现实世界的反事实没有一张可直接查看的“标准答案”

同一个人不可能在同一时刻既做 A 又做 B。真实场景只能依赖随机实验、A/B test、自然实验、结构假设和校准过的模拟器。 因此模拟器中的 twin-world 分数是算法单元测试,不等于现实因果有效性证明。

08 / LANDSCAPE

它不是从零出现,而是几条研究主线的交叉点

现有项目分别解决序列决策、世界建模、因果表示、多智能体社会与数字进化;相对空缺的是把它们用严格分叉协议连起来。

SEQUENCE DECISION

Decision / Trajectory Transformer

已把 return、state、action、reward 当序列处理,证明“行动可 token 化”;但普通离线轨迹不自动识别干预效应。

WORLD MODELS

Dreamer · Genie · V-JEPA

用行动条件想象未来、规划或生成可交互世界;主要目标通常不是 matched-noise 的个体反事实效应。

CAUSAL LEARNING

CausalWorld · CausalTriplet · C-JEPA

显式干预因果变量、评估 OOD 与反事实,提供最直接的方法论邻居。

MULTI-AGENT

Melting Pot · Neural MMO

覆盖合作、竞争、欺骗、信任、有限资源与大种群,是生态规则和外部验证的现成底座。

PROPOSED WEDGE

Branching Causal World Model

确定 replay + 结构化随机源 + paired branches + 长期谱系 fitness + 决策中心评测。

OPEN-ENDED EVOLUTION

Avida · POET · XLand

展示自复制数字生命、环境—智能体共进化与自生成课程;但不以行动反事实预测为中心。

最接近尝试的具体差异

项目 / 论文已经做到与你的设想仍差什么
Next-token causal discovery(NeurIPS 2025) GPT 风格模型从人工干预语言中发现线性高斯 SCM,并组合出反事实推理。 直接支持“next-token 目标可承载因果算法”,但范围限于小型、离散、同家族 SCM。
Decision Transformer / Trajectory Transformer 把 RL 变成条件序列建模或整条轨迹生成。 序列化不是因果识别;没有共享 U 的 twin branches。
DreamerV3 从经验学习 latent dynamics,并在想象轨迹中训练 actor-critic。 是必须击败的 action-conditioned baseline,不直接监督个体行动效应。
Genie 1–3 / V-JEPA 2 可控制的生成世界,或从视频与少量机器人轨迹做 latent planning。 视觉/控制能力强,但“逼真未来”与“正确干预排序”并不等价。
Causal Transformer 从时间变化 treatment 估计反事实 outcome,处理混杂表示。 更偏纵向治疗效应,不是开放多智能体与谱系适应度。
CausalWorld / CausalTriplet 允许控制因果变量,构造 actionable counterfactual 与 OOD 测试。 没有寿命、繁殖、共演化和长期后代结果。
Causal-JEPA(2026) 对象级遮蔽引入交互归纳偏置,并在 counterfactual QA 上改善。 遮蔽是对可观察性的干预,不等于对真实行动变量执行成对 world forks。
BridgeVLM Causal Tokens(2026) 把多图像诱导出的因果图编码成结构 token,并在解码器中做因果消息传递。 支持“结构化因果 token 有用”,但依赖图级监督,且跨 benchmark 泛化仍是问题。
CRONOS(2026) 通过视角、场景、对象类别和外观干预,评估视频模型的反事实物理一致性。 重点是诊断视觉物理一致性,不是多智能体策略和繁殖结果。
Melting Pot / Neural MMO 丰富社会互动、资源竞争、长时程与大规模种群。 需要补确定性 checkpoint、事件寻址 RNG 和 fork 数据协议。
Avida / POET 数字自复制进化,或开放式生成环境—解法对并迁移。 优化的是演化与开放性,不是训练可校准的反事实世界模型。
Polyworld / MABE2 前者含能量、食物、死亡、交配与遗传;后者提供模块化人工生命 / 进化框架。 最适合借鉴生态与软件分层,但仍需现代 fork、结构化 RNG、事件日志和 world-model 评测。
stable-worldmodel / 决策中心评测(2026) 标准化数据、训练、规划和 OOD;倡导分支、policy ranking、exploitability 与 calibration。 是可复用底座与评测哲学;你的增量应是多智能体生态分支与谱系目标。
2026 年研究趋势与你的直觉正好同向

最新世界模型评测工作明确主张:视觉质量只是低层证据,面向决策的模型应测试 interventional branches、 policy-induced distribution shift、policy-ranking agreement、optimization lift、exploitability 与 uncertainty calibration。 这使“反事实数据与评测基础设施”成为比再造一个生成模型更现实的切口。

09 / MVP

创业团队应先证明“分支监督有额外价值”,再谈模拟自然与 AGI

12–14 周足以完成一轮可证伪实验:环境、数据、强 baseline、paired model、OOD、闭环决策与公开报告。

W1–2

定义

BranchLife SCM、直接/总效应、指标、快照与数据协议。

W3–4

分叉

确定 replay、结构化 RNG、fork runner;相同 seed 的 state hash 必须一致。

W5–6

基线

数据 v1、Trajectory Transformer、RSSM / Dreamer、MAPPO。

W7–9

因果头

paired effect、多尺度 outcome、calibration 与排序损失。

W10–11

闭环

MPC / reranker,在模拟器中测试 regret、fitness 与风险。

W12–14

证伪

消融、机制 OOD、外部环境复现、公开 benchmark 与技术报告。

团队

1 名 causal/world-model 研究工程师 + 1 名 JAX/多智能体模拟工程师 + 1 名训练与 demo 工程师;兼职因果实验顾问。

模型与算力

30M–100M 参数;500–2,000 GPU 小时主实验,完整消融约 1,000–3,000 GPU 小时;64–128 vCPU 生成数据。

粗预算

云算力与存储约 5,000–25,000 美元;三个月团队 all-in 约 8万–25万美元,已有团队和本地算力可显著降低现金支出。

最现实的产品楔子

开源:CounterfactualGym

开放 BranchLife、fork schema、小模型和 leaderboard,让社区能公平比较观察式 world model 与 paired causal objective。

fork(snapshot)
  .intervene(agent=7, actions=candidates)
  .rollout(population_policy, seeds=16)
  .compare(["survival", "offspring", "risk"])

收费:Fork & Replay Infrastructure

面向本来就有数字世界的客户:游戏 NPC 与经济平衡、多机器人仓储、交通数字孪生、AI agent 决策回归测试。

predict_effects(
  snapshot,
  candidate_actions,
  horizon=256
)
# distributions, ranking, uncertainty
首个商业叙事

“我们不是替客户预测一条看起来合理的未来,而是在同一快照上系统地重放候选行动,告诉你哪些决策排序稳定、 哪些结果不确定、模型在哪些边缘情景会被利用。”

10 / RISKS

最大的风险不是模型不够大,而是把模拟器内的因果当成自然界的真理

还要防范长期混沌、共演化非平稳、目标投机与开放式竞争产生的危险策略。

模拟器真实性错觉

成功只说明模型理解了你写下的引擎。真实自然中的隐藏变量、物理与社会结构可能完全不同。

长期混沌

单条反事实轨迹会迅速分岔。必须预测分布与置信区间,而不是承诺唯一世界线。

联合动作爆炸

智能体数 × 动作数 × 时间深度呈组合爆炸;用局部干预、候选集、主动分叉与分层模型控制成本。

共演化非平稳

其他智能体也在学习,旧政策下的行动效应会失效。应先冻结对手库,再逐层开放共同演化。

繁殖目标投机

最大化基因传播可能涌现欺骗、寄生、极端攻击、资源垄断或卡模拟器漏洞;这不是价值对齐。

现实不可识别

真实日志往往缺完整状态、随机化行动和 propensity;模型会把历史策略偏好误作行动因果。

模型利用模拟器

规划器可能发现 world model 的盲点并选择虚假的高价值动作。必须测试 exploitability,并在真实引擎回放。

商业市场过窄

研究 demo 很漂亮,客户却可能只愿为稳定的 replay、风险测试和连接器付费,而不是“因果大模型”品牌。

安全边界

进化智能体必须运行在无网络、无外部工具、无真实资金和设备权限的封闭环境;记录策略与谱系, 保留一键回放、行为审计和资源上限。不要把“繁殖成功”直接迁移成人类或社会系统的价值函数。

Recommended next move

先做 CounterfactualGym,再决定是否值得做“因果大模型”。

第一里程碑不是生成更像真的世界,而是让同一状态上的行动排序更准。先发布一个可确定分叉的多智能体生态、 paired dataset、三类强 baseline 和决策中心评测。如果 paired objective 在公平数据下仍显著降低 OOD regret, 你就拥有一个值得扩展到游戏、机器人与数字孪生的研究核心;如果没有,fork / replay / evaluation 本身仍可能是产品。

第 1 周

写清 SCM、直接效应 / 总效应、fitness 与泄漏清单。

第 2 周

实现 snapshot + event-addressed RNG + 双分支 state-hash 测试。

第 3–4 周

生成首批 1 万 fork states,跑“同数据、不配对”零假设。

11 / ARCHIVE

完整研究档案

交互报告负责路线与实验;下面保留另外两份完整平行稿和原始研究问答,不用摘要替代原文。

完整证据档案

理论边界、论文证据、因果层级、反事实数据、世界模型评测与创业路径的长篇研究稿。

平行研究稿

另一套结构与论证顺序,保留不同的证据分级、实现取舍与风险表达。

研究问答原始档案

从 Macaron 落地、蒸馏与个体记忆,到因果智能体硬件方案的完整问题链和回答。

12 / SOURCES

主要来源与延伸阅读

优先列出论文、官方研究页与官方仓库。2026 年条目中有若干为预印本,应视为最新研究信号而非定论。

  1. Bareinboim et al. · The Three Layer Causal Hierarchy — association、intervention、counterfactual 的形式区分。
  2. Pearl · Causal Inference — Structural Causal Model 与干预/反事实基础。
  3. Causal Discovery and Inference through Next-Token Prediction(NeurIPS 2025) — next-token loss 学出简单 SCM 与反事实算法的存在性证明。
  4. Decision Transformer — 将 RL 转为条件序列建模。
  5. Trajectory Transformer — 状态、动作和奖励统一成轨迹序列并用于规划。
  6. DreamerV3 · Nature 论文 — action-conditioned latent world model 强基线。
  7. Google DeepMind · Genie 2Genie 3 — action-controllable generative worlds。
  8. Meta · V-JEPA 2 · 论文 — 视频自监督表示、预测与零样本机器人规划。
  9. CausalWorld — 可干预因果变量的机器人操作与迁移 benchmark。
  10. CausalTriplet — actionable counterfactual 与 intervention-centric representation benchmark。
  11. Causal Transformer — 时间变化 treatment 下的反事实 outcome 估计。
  12. Causal-JEPA(2026) — 对象级遮蔽、交互归纳偏置与 counterfactual reasoning。
  13. BridgeVLM · From Prompts to Tokens(2026) — 显式 Causal Tokens 与因果消息传递。
  14. CRONOS(2026) — 视频世界模型的反事实物理一致性 benchmark。
  15. How Should World Models Be Evaluated?(2026) — 分支、策略排名、优化收益、可利用性与校准。
  16. stable-worldmodel(2026) — 标准化世界模型数据、训练、规划与 OOD 评测。
  17. Google DeepMind · Melting Pot — 50+ 多智能体 substrate 与 256+ 社会泛化测试情景。
  18. Neural MMO · 文档 — 大规模多智能体、资源与生存环境。
  19. Avida — 自复制、可进化数字程序的人工生命平台。
  20. PolyworldMABE2 — 生态人工生命与模块化进化框架。
  21. POET / Enhanced POET — 环境与解法的开放式共同生成与迁移。
  22. Curious Causality-Seeking Agents in Open-ended Worlds — 主动干预与 context-dependent meta-causal graph。
  23. EpiCF-Bench(2026) — 用校准过的 agent-based model 生成时间变化干预的事实/反事实 benchmark。