“Token 化”只是接口
把动作写成 <DO SHARE> 并不会自动产生因果性;关联数据仍可能只让模型学到策略偏好与结果的混杂。
一份关于“因果行动大模型”的可行性报告:如何让模型学习 行动 → 结果、干预与反事实, 并用有限寿命、有限资源、繁殖与自然选择的多智能体世界来生成可验证数据。
状态、动作、奖励早已被 Decision Transformer 与 Trajectory Transformer 序列化;Dreamer、Genie、
V-JEPA 等也已学习 action-conditioned future。你真正可能新增的东西,是在同一世界快照与同一外生随机条件下,
主动执行不同 do(action),得到成对乃至多分支的结果,并直接训练和评估“行动效应”。
把动作写成 <DO SHARE> 并不会自动产生因果性;关联数据仍可能只让模型学到策略偏好与结果的混杂。
它能保存完整状态、精确分叉、控制随机源,因此可同时观察事实与反事实——现实日志通常做不到。
可确定 replay、fork runtime、配对数据、严格评测与商业模拟器连接器,比单一 Transformer 结构更难替代。
“模型学会因果”太宽,任何结果都能被事后解释。真正可执行的研究计划应把表征、数据、功能和现实迁移分开验。
用 do / 反事实信号训练出的表征,应在未见机制组合和分布偏移下更鲁棒。若只在原词表与原规则内有效,它学到的可能仍是查表。
固定外生噪声、从同一状态只替换行动并重跑,可在模拟器内生成现实中不可得的个体级反事实真值;失败点是配对监督是否真的带来额外价值。
在独立生态锦标赛里,因果决策器应获得更低 regret、更高生存率或亲缘加权繁殖成功率。它最昂贵、最原创,也最容易被奖励投机污染。
模拟器里学到的是模拟 SCM 的反事实。迁移到现实依赖一个无法只靠模拟内成绩证明的结构同构假设。最诚实的上限是:模拟内 L1–L3 可监督;现实中的干预层可通过实验逐步校准;个体反事实只能带结构假设声明。
若“基因传递概率”既是选择压力又是成功指标,系统会先优化锦标赛漏洞。训练应使用单元层因果误差与配对损失;验证则放在物理隔离、规则族留出、对手与生态位均未见过的锦标赛里,并与 PEHE、校准和动作排序联合解读。
“预测行动之后发生什么”可能仍只是相关性预测。只有数据或结构假设支持 do(·) 语义,才进入因果层。
普通 next-token、行为克隆和观察轨迹可学。若行动由聪明策略选择,A 与 Y 可能同时受隐藏状态影响。
需要随机干预、已知结构或足以消除混杂的状态。模拟器可直接把行动变量替换掉。
要先从事实证据反推这一次世界的隐藏扰动,再在同一“个体世界”上换行动并向前预测。
P(Y | A) 通常不等于 P(Y | do(A))。例如强者更常选择攻击且更容易存活,
观察数据会把“强者的体质”误算成“攻击的效果”。仅改变词表无法修复这一点。
NeurIPS 2025 的 Causal Discovery and Inference through Next-Token Prediction 表明, GPT 风格 Transformer 仅用 next-token loss,也能从干预样本发现简单线性高斯 SCM, 并把学到的反事实算法用于未见过反事实答案的 SCM。它证明训练目标不会阻止因果能力; 但实验仍是极小、有限的人工 SCM 家族,不能说明真实世界因果性会靠规模自动涌现。
| 你想回答的问题 | 最低数据要求 | 能否直接验真 | 典型失败 |
|---|---|---|---|
| 下一状态 执行动作后短期发生什么 |
覆盖充分的状态—动作—结果轨迹 | 可,用留出轨迹 | 长程误差累积;罕见行动缺数据 |
| 干预结果 强制行动带来的分布变化 |
随机化行动、已知 propensity,或可信 SCM | 可,用新的随机干预 | 隐藏混杂;策略选择偏差 |
| 个体反事实 这一条实际世界线若换行动 |
共享起点、共享外生变量的 twin branches | 模拟器中可;现实中通常不可直接观察 | 随机流错位;把“另一次随机试验”误作反事实 |
世界模型负责回答候选行动会造成什么;planner / policy 再选择行动。把两者分开,才容易验证模型是否真的理解结果。
智能体、资源、关系、年龄、能量、基因、局部历史。
actor、verb、target、amount;保留合法动作 mask。
事件、下一状态、他者响应、死亡与出生的概率分布。
t+1 能量、t+32 生存、t+256 亲缘加权谱系。
按效应、风险与不确定性排序,或在 OOD 时 abstain。
fork_group_id 只做配对索引,不作为可预测特征;自然选择只需变异、遗传与差异繁殖成功。开放世界、真实物理和视觉渲染都不是验证核心猜想的前置条件。
32×32 程序化网格,16–64 个体,3–4 类会再生或有毒的资源,局部可见。
能量代谢、成熟年龄、最大寿命、受伤与死亡;死亡让长期代价不可逆。
8–16 个基因位点控制代谢、感知、攻击、分享等;后代复制并小概率突变。
繁殖消耗能量且受资源、社会关系与风险影响;选择压力通过存活后代产生。
第一阶段采用单倍体、无性繁殖。这样每个谱系和基因拷贝都能精确归因;性繁殖、重组、择偶与抚育放到第二阶段, 否则一开始就会把亲缘归因、策略互动和训练问题搅在一起。
策略根据观察与记忆行动,学习采集、分享、欺骗、攻击或逃避。这里是 RL / planning。
基因与策略偏置被继承、突变和筛选。这里是 evolutionary computation / artificial life。
因果世界模型从事实与分支数据中学习行动效应,再用于 MPC 或主动选择更有信息量的干预。
同时报告存活时间、直接后代、亲缘加权后代、等位基因频率变化、灭绝概率与最差 10% 结果。 “短期能量”只能是辅助监督:一个靠抢夺获得高能量但随后被联盟围攻的策略,可能短期好、长期适应度差。
保存状态快照,在一个决策点复制世界,替换焦点行动;之后允许其他智能体自然响应,但使用同一套按事件寻址的随机源。
do(SHARE) + 外生随机流 U → YA
do(RAID) + 同一随机流 U → YB
某个动作多触发一次攻击判定,后续所有随机数就会错位。应用
hash(world_seed, timestep, entity_id, event_type, lineage_id)
生成结构化随机值,让未受影响的事件在两条世界线中仍共享同一外生条件。
| 数据组 | 关键字段 | 为什么保留 |
|---|---|---|
| 世界 | env_version, rule_set_id, world_seed, map_seed | 复现机制并按规则族切分 OOD。 |
| 快照 | snapshot_id, state_hash, full_state, local_obs | 确保两个分支真的从同一起点开始。 |
| 个体 | agent_id, genotype, age, energy, inventory, lineage_id | 实体化建模与谱系适应度归因。 |
| 行为 | behavior_policy_id, joint_action, action_propensity | 审计策略选择偏差;支持观察数据估计。 |
| 干预 | focal agent, actual, alternative, direct/total effect | 明确哪个变量被替换,以及评估哪种效应。 |
| 外生变量 | exogenous_key, policy random keys, event-addressed noise | 构造 unit-level twin worlds;部署时不喂给模型。 |
| 结果 | events, alive, hazard, offspring, descendants, allele growth | 同时监督短期机制和长期繁殖结果。 |
| 审计 | fork_group_id, parent hash, branch id, censoring | 配对、去泄漏、检查 replay 一致性。 |
<WORLD rule=scarce-v3>
<STATE t=184>
<AGENT id=7 age=41 energy=.62 genotype=g17 lineage=L4>
<REL kind=kin src=7 dst=12 r=.50>
<RESOURCE id=22 type=fruit amount=3>
<DO actor=7 action=SHARE target=12 amount=2>
<EVENT dt=1 actor_energy=-2 target_energy=+2>
<EVENT dt=16 relation=alliance_formed>
<OUTCOME dt=256 alive=0 lineage_copies_bin=3>
<CF alternative=HOARD delta_lineage_copies=-1>
下面不是训练好的模型,而是一台最小因果数据生成器:32 对世界从相同状态出发,共享同一随机流,只替换第 6 tick 的焦点行动。
曲线显示焦点基因谱系在后续 48 tick 的平均存活拷贝。改变世界、寿命或两种行动,观察行动效应是否稳定。
选择同一个行动作为 A 与 B,可做负对照:配对差应该接近 0。选择不同动作时,Δ 是这台玩具 SCM 内的因果效应估计; 它不证明真实自然中的分享或掠夺必然更优,也不代表训练模型已经学会了该效应。
首版 30M–100M 参数足够检验算法价值。不要用十亿参数掩盖实验设计问题。
| Baseline / 消融 | 它控制了什么 | 如果打不过意味着什么 |
|---|---|---|
| Trajectory Transformer | 状态、动作、奖励已经可被统一序列化。 | “行动 token 化”本身没有新意。 |
| DreamerV3 / RSSM | 强 action-conditioned latent imagination。 | 新方法没有胜过成熟世界模型。 |
| 相同分支轨迹,但不告诉配对 | 两边数据完全相同,只有 paired objective 不同。 | 差异来自更多数据,而非因果结构。 |
| 打乱 fork 配对 | 破坏相同状态 / 相同 U 的语义。 | 若性能不降,模型没利用反事实配对。 |
| 去掉差分 / 排序损失 | 检验每项 objective 的边际价值。 | 复杂损失只是装饰。 |
| 真实模拟器枚举 / 完整状态 oracle | 给出性能上界和不可约随机性。 | 模型是否接近可达到极限。 |
一条视频很逼真,不代表它给候选行动排对了序。对行动模型最有力的证据是:反事实分支、策略排名与闭环 regret。
能量、伤害、资源变化。
不只 teacher forcing,也闭环 rollout。
状态误差、事件 F1、校准。
多个随机流下的结果分布。
对每个候选动作真实重跑。
ATE、CATE、effect sign。
同状态、同 U 的成对差。
按 fork group 逐样本比。
区间 coverage。
模型选的行动是否真的更好。
MPC / reranking 后实际执行。
fitness、CVaR、灭绝率。
同一个人不可能在同一时刻既做 A 又做 B。真实场景只能依赖随机实验、A/B test、自然实验、结构假设和校准过的模拟器。 因此模拟器中的 twin-world 分数是算法单元测试,不等于现实因果有效性证明。
现有项目分别解决序列决策、世界建模、因果表示、多智能体社会与数字进化;相对空缺的是把它们用严格分叉协议连起来。
已把 return、state、action、reward 当序列处理,证明“行动可 token 化”;但普通离线轨迹不自动识别干预效应。
用行动条件想象未来、规划或生成可交互世界;主要目标通常不是 matched-noise 的个体反事实效应。
显式干预因果变量、评估 OOD 与反事实,提供最直接的方法论邻居。
覆盖合作、竞争、欺骗、信任、有限资源与大种群,是生态规则和外部验证的现成底座。
确定 replay + 结构化随机源 + paired branches + 长期谱系 fitness + 决策中心评测。
展示自复制数字生命、环境—智能体共进化与自生成课程;但不以行动反事实预测为中心。
| 项目 / 论文 | 已经做到 | 与你的设想仍差什么 |
|---|---|---|
| Next-token causal discovery(NeurIPS 2025) | GPT 风格模型从人工干预语言中发现线性高斯 SCM,并组合出反事实推理。 | 直接支持“next-token 目标可承载因果算法”,但范围限于小型、离散、同家族 SCM。 |
| Decision Transformer / Trajectory Transformer | 把 RL 变成条件序列建模或整条轨迹生成。 | 序列化不是因果识别;没有共享 U 的 twin branches。 |
| DreamerV3 | 从经验学习 latent dynamics,并在想象轨迹中训练 actor-critic。 | 是必须击败的 action-conditioned baseline,不直接监督个体行动效应。 |
| Genie 1–3 / V-JEPA 2 | 可控制的生成世界,或从视频与少量机器人轨迹做 latent planning。 | 视觉/控制能力强,但“逼真未来”与“正确干预排序”并不等价。 |
| Causal Transformer | 从时间变化 treatment 估计反事实 outcome,处理混杂表示。 | 更偏纵向治疗效应,不是开放多智能体与谱系适应度。 |
| CausalWorld / CausalTriplet | 允许控制因果变量,构造 actionable counterfactual 与 OOD 测试。 | 没有寿命、繁殖、共演化和长期后代结果。 |
| Causal-JEPA(2026) | 对象级遮蔽引入交互归纳偏置,并在 counterfactual QA 上改善。 | 遮蔽是对可观察性的干预,不等于对真实行动变量执行成对 world forks。 |
| BridgeVLM Causal Tokens(2026) | 把多图像诱导出的因果图编码成结构 token,并在解码器中做因果消息传递。 | 支持“结构化因果 token 有用”,但依赖图级监督,且跨 benchmark 泛化仍是问题。 |
| CRONOS(2026) | 通过视角、场景、对象类别和外观干预,评估视频模型的反事实物理一致性。 | 重点是诊断视觉物理一致性,不是多智能体策略和繁殖结果。 |
| Melting Pot / Neural MMO | 丰富社会互动、资源竞争、长时程与大规模种群。 | 需要补确定性 checkpoint、事件寻址 RNG 和 fork 数据协议。 |
| Avida / POET | 数字自复制进化,或开放式生成环境—解法对并迁移。 | 优化的是演化与开放性,不是训练可校准的反事实世界模型。 |
| Polyworld / MABE2 | 前者含能量、食物、死亡、交配与遗传;后者提供模块化人工生命 / 进化框架。 | 最适合借鉴生态与软件分层,但仍需现代 fork、结构化 RNG、事件日志和 world-model 评测。 |
| stable-worldmodel / 决策中心评测(2026) | 标准化数据、训练、规划和 OOD;倡导分支、policy ranking、exploitability 与 calibration。 | 是可复用底座与评测哲学;你的增量应是多智能体生态分支与谱系目标。 |
最新世界模型评测工作明确主张:视觉质量只是低层证据,面向决策的模型应测试 interventional branches、 policy-induced distribution shift、policy-ranking agreement、optimization lift、exploitability 与 uncertainty calibration。 这使“反事实数据与评测基础设施”成为比再造一个生成模型更现实的切口。
12–14 周足以完成一轮可证伪实验:环境、数据、强 baseline、paired model、OOD、闭环决策与公开报告。
BranchLife SCM、直接/总效应、指标、快照与数据协议。
确定 replay、结构化 RNG、fork runner;相同 seed 的 state hash 必须一致。
数据 v1、Trajectory Transformer、RSSM / Dreamer、MAPPO。
paired effect、多尺度 outcome、calibration 与排序损失。
MPC / reranker,在模拟器中测试 regret、fitness 与风险。
消融、机制 OOD、外部环境复现、公开 benchmark 与技术报告。
1 名 causal/world-model 研究工程师 + 1 名 JAX/多智能体模拟工程师 + 1 名训练与 demo 工程师;兼职因果实验顾问。
30M–100M 参数;500–2,000 GPU 小时主实验,完整消融约 1,000–3,000 GPU 小时;64–128 vCPU 生成数据。
云算力与存储约 5,000–25,000 美元;三个月团队 all-in 约 8万–25万美元,已有团队和本地算力可显著降低现金支出。
开放 BranchLife、fork schema、小模型和 leaderboard,让社区能公平比较观察式 world model 与 paired causal objective。
fork(snapshot)
.intervene(agent=7, actions=candidates)
.rollout(population_policy, seeds=16)
.compare(["survival", "offspring", "risk"])
面向本来就有数字世界的客户:游戏 NPC 与经济平衡、多机器人仓储、交通数字孪生、AI agent 决策回归测试。
predict_effects(
snapshot,
candidate_actions,
horizon=256
)
# distributions, ranking, uncertainty
“我们不是替客户预测一条看起来合理的未来,而是在同一快照上系统地重放候选行动,告诉你哪些决策排序稳定、 哪些结果不确定、模型在哪些边缘情景会被利用。”
还要防范长期混沌、共演化非平稳、目标投机与开放式竞争产生的危险策略。
成功只说明模型理解了你写下的引擎。真实自然中的隐藏变量、物理与社会结构可能完全不同。
单条反事实轨迹会迅速分岔。必须预测分布与置信区间,而不是承诺唯一世界线。
智能体数 × 动作数 × 时间深度呈组合爆炸;用局部干预、候选集、主动分叉与分层模型控制成本。
其他智能体也在学习,旧政策下的行动效应会失效。应先冻结对手库,再逐层开放共同演化。
最大化基因传播可能涌现欺骗、寄生、极端攻击、资源垄断或卡模拟器漏洞;这不是价值对齐。
真实日志往往缺完整状态、随机化行动和 propensity;模型会把历史策略偏好误作行动因果。
规划器可能发现 world model 的盲点并选择虚假的高价值动作。必须测试 exploitability,并在真实引擎回放。
研究 demo 很漂亮,客户却可能只愿为稳定的 replay、风险测试和连接器付费,而不是“因果大模型”品牌。
进化智能体必须运行在无网络、无外部工具、无真实资金和设备权限的封闭环境;记录策略与谱系, 保留一键回放、行为审计和资源上限。不要把“繁殖成功”直接迁移成人类或社会系统的价值函数。
第一里程碑不是生成更像真的世界,而是让同一状态上的行动排序更准。先发布一个可确定分叉的多智能体生态、 paired dataset、三类强 baseline 和决策中心评测。如果 paired objective 在公平数据下仍显著降低 OOD regret, 你就拥有一个值得扩展到游戏、机器人与数字孪生的研究核心;如果没有,fork / replay / evaluation 本身仍可能是产品。
写清 SCM、直接效应 / 总效应、fitness 与泄漏清单。
实现 snapshot + event-addressed RNG + 双分支 state-hash 测试。
生成首批 1 万 fork states,跑“同数据、不配对”零假设。
交互报告负责路线与实验;下面保留另外两份完整平行稿和原始研究问答,不用摘要替代原文。
优先列出论文、官方研究页与官方仓库。2026 年条目中有若干为预印本,应视为最新研究信号而非定论。