档案编号 CL-2026-0731 DECRYPTED 密级:公开整理

持续学习全景解密
当 AI 开始记住你

从 Macaron V1 到 SSI,谁在教 AI「不遗忘」——一份写给研究者、开发者与创业者的持续学习(Continual Learning)全景情报档案。

一句话钩子:预训练时代落幕(数据峰值已到),AI 的下一个前沿不是「更大」,而是「能一直学」。本档案逐层解密:谁在押注、走哪条路线、分数有多可信、以及你可以从哪里切入。
6
条并行推进的技术路线,边界正在消融
$30亿+
SSI 融资规模,估值 $320 亿,豪赌新范式
96.1 / 70–72
LoCoMo 头部自报分 vs 1.5M token M 变体最高分——分数通胀的真实差距
2032
Dwarkesh 给出的「类人 on-the-job 学习」中位数预测
向下滚动 · 开始解密
MAP

一篇主综述,三篇深度报告

READING MAP / 持续学习研究组 4 REPORTS 概念 → 工程 → 机制 → 前沿

这组材料不按“谁更新、谁更强”来堆新闻,而是沿着一个系统真正学会积累经验所需的四层问题展开。第一次阅读建议从本页开始;做产品可直接进入工程档案;研究个性化计算或世界模型,则从对应报告进入。

01

深入浅出:传统学习 vs 持续学习

FILE 01 / 概念奠基 DECRYPTED 阅读时长 ≈ 6 min

1.1两种范式,一张对比

传统范式

传统学习:印刷好的百科全书

一次性训练 → 冻结 → 部署。学完之后,模型是一张「照片」—— 知识永远截止在训练那一天。它不会因为你今天告诉它的事而明天变得更好, 要更新知识,只能回炉重训。

  • 训练与使用严格分离,部署后权重冻结
  • 知识有明确的「截止日期」,之后的世界与它无关
  • 每次升级 = 一次昂贵的全量工程
目标范式

持续学习:会写日记的图书馆员

像人一样,边工作边积累:新知识进来、旧知识不忘,还能越用越好。 它是有日记、会反思、不断修订自己的图书馆员——经验被沉淀为能力, 而不是用完即弃的上下文。

  • Continual / Lifelong Learning:知识与能力持续累积
  • 从交互和反馈中学习,部署即训练的一部分
  • 层次递进:记忆 → 适应 → 自我进化

1.2为什么这件事这么难:灾难性遗忘

神经网络学新任务时会覆盖旧权重——这就是灾难性遗忘(Catastrophic Forgetting)。 它不是新问题:早在 1990 年代,McCloskey & Cohen 就系统描述了它。 三十多年后,它依然是挡在「会学习的 AI」面前的核心障碍:写进权重会忘,不写进权重就留不住。 整个持续学习领域,本质上都是在「遗忘」与「可塑性」之间寻找工程与科学的平衡点。

1.3为什么是现在爆发

TABLE 1-A · 引爆点事件(2024–2025)
时间人物 / 事件核心信号
NeurIPS 2024 Ilya Sutskever 演讲 宣布「预训练终结 / 数据峰值」—— scaling 的旧引擎熄火
2025 Sutton & Silver《经验时代》 从人类数据时代转向在线终身 RL 的「经验时代」宣言
2025-10 Andrej Karpathy 诊断:「现有系统没有持续学习,认知上有欠缺」
2025–2026 Demis Hassabis 把 continual learning 直接写进 AGI 的定义

1.4能力的三个层次

记忆

记得你说过的——事实、偏好、历史交互被可靠地存取。

适应

按反馈调整行为——被纠正一次,下次不再犯同样的错。

自我进化

自己出题自己学——从经验中生成新任务,递归地改进自身。

KEY INSIGHT 今天的绝大多数产品只做到了第 Ⅰ 层,部分摸到第 Ⅱ 层; 而 2026 年最激进的下注(SSI、Ineffable、超衍智能)全部押在第 Ⅲ 层。

1.5人脑的答案:双系统 + 睡眠

神经科学的互补学习系统理论(CLS,McClelland 等,1995)认为人脑用两套系统绕开了稳定性—可塑性两难:海马体当“白板便签”,快速记下今天发生的具体事;新皮层当“结构化笔记本”,慢速沉淀统计规律;睡眠负责把便签誊写进笔记本。2024–2026 年几乎所有持续学习方案,都能在这张图里找到自己的工程位置。

FAST SYSTEM

海马体 ≈ 上下文 / 外挂记忆

  • 快:一次经历就能记住(in-context / 记忆库写入)
  • 具体:存的是“那件事”原文,可检索、可审计、可删除
  • 容量有限、易过载(上下文窗口、检索精度)
  • 对应产品:ChatGPT/Claude Memory、Mem0、Letta、MemOS、Macaron Deep Memory
SLOW SYSTEM

新皮层 ≈ 模型权重

  • 慢:要多次重放才能内化(微调 / RL / 蒸馏)
  • 泛化:存的是规律而非原文,用起来零成本
  • 改起来危险:灾难性遗忘、对齐漂移、不可精确删除
  • 对应技术:LoRA 适配器、sparse memory finetuning、SEAL、TTT
CONSOLIDATION “睡眠”不是装饰性比喻:它对应离线重放、蒸馏、sleep-time compute 与选择性巩固——把高频、稳定、可验证的经验从外部记忆逐步写进参数,同时保留回滚与拒绝坏更新的能力。

1.6遗忘有多快:85 → 45 → 83 的恢复实验

Thinking Machines 在 2025 年 10 月公开的实验里,先把 Qwen3-8B 在公司内部文档上微调:新知识学进去了,但指令跟随能力当场崩掉。再用“过去的自己”当老师做 on-policy 蒸馏,旧能力几乎全部找回,新知识也保住了。

TABLE 1-B · ON-POLICY DISTILLATION 读数
阶段指令跟随(IF-eval)内部知识发生了什么
微调前85%18%模型很听话,但基本不懂内部文档
微调新知识后45% ↓43%知识上升,指令能力被新梯度覆盖
on-policy 蒸馏后83% ↑41%早期版本充当 teacher,恢复旧行为并保住大部分新知识

来源:Thinking Machines · On-Policy Distillation(数值为该文实验读数)。

1.7“学习”其实分三层

TABLE 1-C · 看懂任何记忆产品的钥匙
发生在哪时间尺度像人类的什么今天的成熟度
第 1 层 · 上下文内学习推理时的注意力,不留任何痕迹秒–小时工作记忆(打电话时记住的号码)已解决:GPT-3 时代的礼物
第 2 层 · 外挂记忆模型外的数据库 / 文件 / 知识图谱,检索后注入上下文天–年日记、备忘录、相册产品化内卷中:记住 ≠ 学会
第 3 层 · 权重级学习参数本身被更新(全参 / LoRA / 记忆槽)周–终身技能内化:学会骑车后不再逐条回忆教程攻坚前沿:2025 下半年起关键零件才逐渐凑齐

行业黑话对照:第 2 层做得好叫“记忆(memory)”,第 3 层做得好才叫“持续学习(continual learning)”。市面上多数“AI 记忆”产品仍在第 2 层;真正的难题是第 3 层,以及让第 2、3 层自动流转、可审计、可回滚的“睡眠”机制。

02

Macaron V1 解密:第一个为持续学习而生的消费级架构

FILE 02 / 案例解剖 DECRYPTED 源:macaron.im/mindlab/research/introducing-macaron-v1 · 2026

Mind Lab 发布的 Macaron-V1 是目前把「持续学习」讲得最完整、也做得最工程化的一套系统: V1-Venti 748B(744B 基座 + 4×1B LoRA 专家),是首个在 GLM-5.2 上后训练的模型; 另有 V1-Tall 50B(基于 Qwen 3.6 35B,面向本地部署)。 权重在 HuggingFace 全量开放,同时提供官方 API(mint.macaron.im)。

2.1核心架构:Mixture-of-LoRA(MoL)

FROZEN · 基座冻结
GLM-5.2 基座 · 744B
参数不动 —— 新能力以 LoRA 插件形式累积,天然适配持续学习的参数隔离路线
L0 · 路由
Chat
对话与路由专家,决定调用谁
L1
Agent
长程任务执行与工具使用
L2
Coding
代码生成与工程能力
L3
GenUI
生成式界面与可视化输出
4 × 1B LoRA 专家 · 不同团队 / 用户的专家可自由组合 → 「集体智能 Collective Intelligence」

MoL 的意义在于:基座不动,新能力以 LoRA 插件形式累积——这是「天然适配持续学习」的参数隔离路线; 不同团队、不同用户训练出的专家可以组合共享,Macaron 称之为集体智能(Collective Intelligence)

2.2两大理念押注

理念 A

Adaptation · 递归自我改进(RSI)

Discovery 自造更难的任务 → Expansion 解题并优化 harness → Update 更新参数,然后循环往复。模型不只是解题,而是在造题—解题—更新的闭环里变强。

理念 B

Collaboration · 多智能体协作

多个智能体分工协作完成任务,把单模型能力上限问题转化为组织与协作问题—— 与 MoL 的「专家可组合」叙事互相咬合。

2.3四大基础设施件

TABLE 2-A · Macaron V1 关键子系统
子系统做什么关键数字 / 细节
LongStraw 超长程 RL 训练,把 RL 从 256K token 墙推到 2.1M token 8×H20 推 Qwen3.6-27B 到 2.1M GRPO;32×H20 推 GLM-5.2(78 层 MLA/DSA、256 专家)到 2.1M;常驻前缀路径 4.46M
MinT 百万级 adapter 目录与调度 adapter-only actor-learner 交接;支持 1T 参数;已开源 verl-mint / areal-mint
MindForge + HCP Harness Context Protocol:训练与生产同一 harness / memory 布局 / tool tokenization 消除训练—部署鸿沟(train-serving skew)
REPL Harness 工具生命周期:compose → validate → promote → reuse save_tool / promote_tool 跨会话保留验证过的工具 = 程序性记忆

2.4评测成绩(厂商自报)

ChatBench:Macaron V1 vs 前沿模型厂商自报 · 需谨慎
SOURCE: macaron.im · 自建基准 · 2026

自建基准

  • ChatBench 58.3 —— 超过 GLM-5.2(54.5)、GPT-5.5(55.5)、Opus 4.8(52.8)
  • LivingBench 64.0 —— 跨周交互的长程基准,直接对应「持续学习」叙事

第三方 / 公开基准

  • PinchBench 94.0 · ClawGym 77.7 · UI4ABench 87.8
  • SWE Verified 85.6(仅次 Opus 4.8 的 88.6)· TerminalBench 2.1 87.6
  • DeepSWE 58.4 · SWE Atlas QnA 49.5
开放姿态 HuggingFace 全量权重 + 官方 API(mint.macaron.im)——在「记忆层初创」阵营里, Macaron 是少数把底座权重直接开源的玩家。
03

推演:用 Kimi K3 替代 GLM-5.2 作底座,会有什么提升?

FILE 03 / 假设推演 DECRYPTED 对象:MoL 架构逐层重估
候选底座

Kimi K3

2026-07-16 上线 · 2026-07-27 开源权重

  • 2.8T 总参 / 104B 激活 MoE(896 专家激活 16 + 2 共享,激活率 1.8%)
  • 93 层:69 层 KDA 混合线性注意力 + 24 层 Gated MLA;Muon 优化
  • 1M 上下文;原生视觉(MoonViT-V2);扩展效率较 K2 提升 2.5×
  • 基准:HLE 43.5 / 56.0(带工具)、GPQA 93.5、DeepSWE 67.5、TerminalBench 2.1 88.3、SWE-Marathon 42.0(第一)、BrowseComp 91.2、MCPMark 94.5、Toolathlon 76.5、OSWorld 84.8
  • AA 智能指数 57(总榜第 4 / 开源第 1);LMArena 前端 1679 全球第一
  • 价格 $3 / $15;AA 实测单任务 $0.94
  • 配套:Kimi Code CLI、AgentEnv(沙箱快照 / 恢复 / Fork——环境状态持久化一等公民)、Preserved thinking history;实证连续 48h 自主芯片设计
现役底座

GLM-5.2

2026-06-13 发布 · MIT 开源

  • ~753B 总参 / 激活 ~40B
  • DSA + IndexShare:1M 上下文下每 token FLOPs 降 2.9×
  • 1M 上下文 / 128K 输出;纯文本
  • 基准:AIME 2026 99.2、HLE 40.5 / 54.7、GPQA 91.2、SWE-bench Pro 62.1、TerminalBench 81.0、DeepSWE 46.2、SWE-Marathon 13.0
  • 价格约为 K3 的 1/2–1/3(国际 $1.4 / $4.4);¥49/月起 Coding Plan
  • 红利:IndexCache 生态成熟,GLM-5.1→5.2 平滑升级,day-1 支持

3.1关键基准逐项对比

TABLE 3-A · Kimi K3 vs GLM-5.2(自报口径,加粗为领先项)
基准Kimi K3GLM-5.2差距解读
HLE(带工具)43.5 / 56.040.5 / 54.7K3 小幅领先
GPQA93.591.2K3 领先
DeepSWE67.546.2K3 大幅领先(+21.3)
SWE-Marathon42.0(第一)13.0长程耐力差 3 倍以上
TerminalBench 2.188.381.0K3 领先
AutomationBench30.812.9自动化场景 K3 碾压
AIME 202699.2纯数学 GLM 极强
价格(API)$3 / $15$1.4 / $4.4GLM 便宜 2–3 倍
许可证自定义 Kimi K3 LicenseMITGLM 商用友好
长程 Agentic 基准:K3 vs GLM-5.2厂商自报 · 需谨慎
SWE-MARATHON / DEEPSWE / AUTOMATIONBENCH · 越高越好

3.2替代带来的提升(对应 MoL 逐层分析)

3.3代价与风险

结论 · VERDICT 值得做「双底座」——Venti 旗舰换 K3,冲长程 agent 上限(尤其 LivingBench / 个人智能叙事); Tall 本地版保留 Qwen / GLM 系。实现路径与 GLM-5.2 迁移相同:MinT adapter 管线 + IndexCache→KDA 适配 + MindForge 重跑 RSI 循环。有没有实现价值:有 —— Macaron 的定位是「个人智能 + 持续学习」, 而 K3 是目前开源中长程 agentic 最强、且唯一自带环境状态持久化设施的底座;两者叙事完全咬合。
04

大佬下注图谱(2024–2026)

FILE 04 / 人物卷宗 DECRYPTED 最聪明的钱与人都已进场

判断一个方向是不是真前沿,最快的办法是看顶级头脑把职业生涯押在哪里。 2024–2026 年,持续学习相关的下注从「架构层记忆」「自我改进 harness」到「全新范式」全面铺开——以下是主要卷宗。

梁文锋 DeepSeek
押注方向:架构层记忆
BET: 记忆作为模型原生组件
  • NSA 原生稀疏注意力(2025-02)
  • mHC 流形约束超连接(2025-12)
  • Engram 条件记忆(2026-01,与北大合作):提出「条件记忆」为 MoE 之外的第二稀疏轴;27B 记忆模块带来 MMLU +3.4 / BBH +5.0,NIAH 84.2→97.0
  • V4 主打长期记忆(2026 年发布,已多次跳票)
  • R1 登上 Nature 封面
「闭源护城河是短暂的,创新组织才是护城河。」
翁荔 Lilian Weng
押注方向:自我改进 harness
BET: 持久化状态 → AI 改进自身研究能力
  • OpenAI 安全 VP(2024-11 离职)→ Thinking Machines 联创(2025-02)
  • 2026-07-30 重返 OpenAI,领导 RSI(递归自我改进)研究团队
  • Lil'Log 三部曲:Agent = LLM + 记忆 + 规划 + 工具(2023);Why We Think(2025-05);Harness Engineering for Self-Improvement(2026-07,持久化状态让 AI 改进自身研究能力)
Agent 的定义已成为行业公式;harness 工程是自我改进的载体。
陈勇超 Apex Intelligence
押注方向:自主进化基础模型
BET: Self-Improving Model
  • 中科大 → 哈佛 / MIT 联培博士;2026-08 入职清华助理教授
  • 2026-07-06 官宣创立超衍智能(Apex Intelligence),主攻「自主进化基础模型」
  • 一作 TUMIX:多 agent 互校,把 Gemini-2.5-Pro 的 HLE 从 21.6% → 34.1%
Ilya Sutskever SSI
押注方向:新范式(未公开)
BET: 迭代产生更强下一代的研究方式
  • 「预训练终结、数据峰值」(NeurIPS 2024-12)
  • 「数据有限,只有一个互联网」(Dwarkesh 播客,2025-11);2026 起是「新研究时代」
  • SSI 融资超 $30 亿、估值 $320 亿;2026-07-27 英伟达约 $50 亿战略投资 + Vera Rubin 算力 10×
  • Ilya 唯一表态:「我们已有值得扩大规模的研究」
外界普遍推测:押注「持续产生更强下一代的迭代方式」。

4.1其他关键下注一览

TABLE 4-A · 2024–2026 持续学习相关下注全景
人物 / 机构动作时间押注方向
Richard Sutton & David Silver《经验时代》(Era of Experience)2025在线终身 RL
David Silver创立 Ineffable Intelligence,$11 亿种子轮2026-01零人类数据 superlearner
Jeff CluneRecursive Superintelligence 出潜,$5 亿 pre-A / $40 亿估值2026-04Darwin Gödel Machine:SWE-bench 20%→50%
Yann LeCun创立 AMI Labs,$10.3 亿种子轮2026-03世界模型 / JEPA
Sakana AICTM 连续思维机2025-05连续时间神经动力学
GoogleNested Learning / HOPE(NeurIPS 2025)2025-12嵌套多时间尺度优化
MITSEAL:自生成 self-edit 做持久权重更新2025-06自我适应权重
Letta / Mem0融资 $10M / $24M2025外部记忆基础设施
Thinking MachinesTinker(LoRA 微调 API,2025-12 GA)+ Inkling(975B / 41B)2026-07参数高效持续微调
Andrej Karpathy公开诊断「现有系统没有持续学习,认知上有欠缺」2025-10定义问题 = 最大的下注
PATTERN RECOGNITION 注意时间密度:Ineffable(2026-01)、AMI Labs(2026-03)、Clune 出潜(2026-04)、 超衍智能(2026-07)、翁荔重返 OpenAI(2026-07)——最激进的一批下注全部发生在 2026 年
05

六条技术路线:原理、代表、卡点与最新动态

FILE 05 / 路线档案 DECRYPTED 点击标签切换路线 · 边界正在消融

路线一:参数更新 —— 直接写进权重

ROUTE 01 · WEIGHT UPDATES · 最古典也最硬核
原理 PRINCIPLE
  • 通过继续训练、正则约束、回放或参数隔离,把新知识直接写进模型权重
  • 核心矛盾:遗忘—可塑性权衡(stability–plasticity dilemma)
代表工作 KEY WORKS
  • CPT 继续预训练:Don't Stop Pretraining;Apple 遗忘 scaling law(2025)——1–5% 预训练数据回放即可稳住
  • EWC 正则(Kirkpatrick 2017)、O-LoRA 正交约束、CP-MoE(2026)
  • 经验回放:SSR 自合成回放
  • 参数隔离:O-LoRA、LLaMA-Pro、BTX、Macaron MoL
  • 模型合并:Model Soups / Task Arithmetic / TIES;持续合并(2025);RLVR 合并存在 Sparsity Curse
卡点 BLOCKERS
  • 遗忘—可塑性权衡尚无原理性解法
  • 泼冷水研究(2025):真实后训练中的遗忘其实比学术基准小——学术设置可能高估了问题
最新动态 LATEST
  • Macaron MoL 把参数隔离做成产品级架构(4×1B LoRA 专家)
  • Thinking Machines Tinker 把 LoRA 微调变成 API 基础设施(2025-12 GA)
成熟度
工具链成熟 · 原理未解

路线二:外部记忆 —— 权重冻结,检索注入

ROUTE 02 · EXTERNAL MEMORY · 最成功、已产品化
原理 PRINCIPLE
  • 权重完全不动,经验写入外部存储(向量库 / 图谱 / 文件),用时检索注入上下文
  • 把「学习」降维成「记忆管理」工程问题
代表工作 KEY WORKS
  • MemGPT / Letta:OS 分页式记忆(2023)
  • Mem0:ADD / UPDATE / DELETE / NOOP 操作原语,延迟 -91%(2025)
  • Zep / Graphiti:时序知识图谱,支持边失效
  • A-MEM(Zettelkasten 卡片)、Generative Agents、Reflexion、MemoryBank(艾宾浩斯曲线)
  • MIRIX(六类记忆);RL 学记忆管理:Memory-R1、Mem-α
卡点 BLOCKERS
  • 写入决策错误会自我强化(错的记忆越用越坚定)
  • 删除 / 遗忘原语缺失;记忆投毒(Trojan Hippo ASR 85–100%)
  • 成本与延迟随历史增长
最新动态 LATEST
  • 已产品化:ChatGPT Memory、Claude Projects、Macaron Deep Memory
  • RL 训练的记忆管理(Memory-R1 / Mem-α)开始取代启发式规则
成熟度
已产品化 · 最成功路线

路线三:测试时学习 —— 推理过程中更新

ROUTE 03 · TEST-TIME LEARNING · 学术最热
原理 PRINCIPLE
  • 把「前向推理」本身变成一次小型学习:隐藏状态 = 可学习的小模型,或推理时微调权重
  • 上下文不再是只读输入,而是可压缩进参数的训练信号
代表工作 KEY WORKS
  • TTT 层(Sun et al. 2024)、TTT-E2E(把上下文压进权重)
  • SEAL(MIT):self-edit 持久权重更新,72.5% vs ICL 0%
  • TTRL:无标注测试时 RL;agentic TTT(2026,沿轨迹更新)
  • test-time compute(o1 / R1 系);many-shot ICL:1M token 幂律提升
  • DeepMind 证明:数据匹配下 ICL 系统性泛化优于微调——但无持久性
卡点 BLOCKERS
  • 逐样本计算昂贵
  • 跨任务不持久;错误累积会导致崩溃
最新动态 LATEST
  • TTT-Discover 连破数学 / 内核 / 生信 SOTA(Thinking Machines)
  • 与路线 1/2 的边界消融:TTT-E2E = 2 + 3 + 1
成熟度
论文密集 · 工程早期

路线四:RL / 自我进化 —— 自己出题自己学

ROUTE 04 · SELF-EVOLUTION · 叙事最性感
原理 PRINCIPLE
  • 用 RL 闭环替代人类数据:模型自造任务、自我验证、自我奖励,递归改进
  • 对应能力层次的第 Ⅲ 层:自我进化
代表工作 KEY WORKS
  • Absolute Zero:零数据自出题自解(2025);R-Zero;SPICE(语料接地)
  • Self-Play SWE-RL;Darwin Gödel Machine
  • AlphaEvolve:56 年来首次改进矩阵乘法算法
  • Self-Rewarding;CPPO 持续 RLHF
  • Fast-Slow Training:反复权重 RL 会丧失可塑性(KL 偏移大 70%)
卡点 BLOCKERS
  • 奖励黑客(reward hacking)
  • 零数据存在知识天花板
  • 可验证奖励目前只在数学 / 代码成立
最新动态 LATEST
  • Macaron RSI 循环(Discovery→Expansion→Update)已产品化
  • 翁荔重返 OpenAI 领导 RSI 团队(2026-07);超衍智能创立(2026-07)
成熟度
受限域有效 · 开放域无解

路线五:架构级 —— 记忆原生架构

ROUTE 05 · MEMORY-NATIVE · 可能的终局
原理 PRINCIPLE
  • 不再外挂记忆,而是在架构里内置可写入的记忆组件(记忆层、快权重、多时间尺度优化)
  • 持续学习从「补丁」变成「原生属性」
代表工作 KEY WORKS
  • Meta Memory Layers at Scale(2024-12):128B 记忆参数 KV 查找层
  • Google Titans(2025-01):surprise 驱动测试时更新,>2M token
  • ATLAS;Nested Learning + HOPE(2025-12,NeurIPS 2025):嵌套多时间尺度优化 + Continuum Memory System——被视为 2025 年底最重要的架构方向
  • DeepSeek Engram 条件记忆(2026-01)
  • 快权重 / 超网络谱系
卡点 BLOCKERS
  • 未在 >100B 前沿规模验证
  • kernel / 基础设施门槛高
  • 与 RLHF 流程的兼容性未定
最新动态 LATEST
  • Nested Learning 把优化器 / ICL / 记忆统一为嵌套优化(= 路线 3 + 5)
  • DeepSeek V4 主打长期记忆,2026 年发布(已多次跳票)
成熟度
论文惊艳 · 规模未证

路线六:Agent 工程 —— 上下文与技能

ROUTE 06 · CONTEXT & SKILLS · 工业界主力
原理 PRINCIPLE
  • 不碰权重,把「学习」工程化为上下文管理与技能库沉淀
  • 用流程、协议和工具生命周期模拟记忆与成长
代表工作 KEY WORKS
  • 上下文工程:Dynamic Cheatsheet、ACE playbook、Claude Code 五层 compaction、sleep-time compute
  • 技能库:Voyager(2023,奠基)、Anthropic Agent Skills(2025,成事实标准)
  • 程序性记忆:Memp;CoALA 分类学
  • Macaron REPL Harness:save_tool / promote_tool 跨会话保留验证过的工具
卡点 BLOCKERS
  • compaction 会静默丢失安全指令
  • 能力上限被基座锁定;技能库膨胀后的治理难题
最新动态 LATEST
  • Agent Skills 成为跨厂商事实标准(2025)
  • sleep-time compute:闲时整理经验,成为混合系统标配组件
成熟度
工业界主力 · 已规模部署
收敛趋势 · CONVERGENCE 路线边界正在消融:TTT-E2E = 2 + 3 + 1;Nested Learning = 3 + 5; Memory-R1 = 2 + 4;Fast-Slow Training = 5 + 6。 结论:持续学习正在从「补丁」变成下一代架构的原生属性。
06

评测与 SOTA:分数通胀时代的真实格局

FILE 06 / 数据核验 DECRYPTED 注意:以下分数多为厂商自报,口径不一,需谨慎

6.1主要基准档案

TABLE 6-A · 记忆 / 持续学习基准一览
基准出处规模与特征关键发现
LongMemEval ICLR 2025 500 题;S 版 ~115K token / M 版 ~1.5M token GPT-4o 全上下文仅 57.7–63.8%;历史增长掉点 30–60%
LoCoMo ACL 2024 1986 题,多轮长对话 人类水平 87.9%;但 6.4% 答案损坏、judge 接受 62.8% 错答
MemoryBench 清华 · 2025-10 首个「持续学习」基准 核心结论:现有记忆系统都不能利用程序性知识从反馈中学习——「记忆 ≠ 持续学习」的最直接证据
BEAM 2025 1M / 10M token,未饱和 所有方法的弱项 = 矛盾消解;Mem0 仅 64.1 / 48.6
TRACE / Standard CL 经典 参数级持续学习基准 学术线主战场,与真实后训练差距大
τ-bench 系 2024– agent 场景评测 工具使用与策略一致性

6.2SOTA 梯队(厂商自报,需谨慎)

LoCoMo 各系统分数厂商自报
人类基线 87.9% · 1986 题 · 注意 6.4% 答案损坏
LongMemEval 各系统分数(S 版 ~115K)厂商自报
GPT-4o 全上下文区间 57.7–63.8%,取上界作图
M 变体与未饱和战场:这才是真实差距厂商自报
LONGMEMEVAL-M(~1.5M TOKEN)几乎无人敢测;MEMORYSTRESS(1000 会话)/ GROUPMEMBENCH / BEAM 均未饱和

6.3产品记忆方案对比

TABLE 6-B · 消费级产品记忆机制横评
产品机制特点 / 短板
ChatGPT Memory 双层记忆,起步最早 第三方 LoCoMo 实测垫底 52.9,时序题仅 21.7 —— 最自动但最不准
Claude 项目级隔离 + 24h 自动综合;Claude Code 三层 memory.md / Auto Dream 睡眠整合 透明度最高,用户可审计、可编辑
Gemini Personal Intelligence Gmail / Drive 数据护城河 本质是「用超长上下文推迟遗忘」,不是学会
Macaron Deep Memory RL 训练的记忆 token 消费级首创:记忆本身是被训练出来的能力
Letta MemFS 「存文件就够」 反直觉地拿到 74.0% —— 简单方案并不弱
行业判断 · READ THIS BEFORE TRUSTING SCORES 2026 年分数通胀严重、judge 不可比(LoCoMo 6.4% 答案损坏、judge 接受 62.8% 错答)。 真正的未饱和战场:BEAMMemoryStress(1000 会话,OMEGA 仅 38.3%)、 GroupMemBench(头部仅 46%)。看系统实力,先看这三个,而不是 LoCoMo 的 95+。
07

谁先突破?四条路线的预测

FILE 07 / 前瞻研判 DECRYPTED 多派观点 · 含主观判断
共识前提:持续学习是公认核心瓶颈。Dwarkesh 因此把「类人 on-the-job 学习」推到 2032 中位数;真正的 in-weights 终身学习还需 4–6 年
路线一 · 最激进

纯经验 RL

INEFFABLE INTELLIGENCE(SILVER)+ SUTTON OAK

理论自洽——从经验直接学习的 superlearner 是终局形态;但开放域奖励无解, 5 年内难产品化

⏳ 时间判断:范式级突破的候选,产品化 ≥ 5 年

路线二 · 中期最可验证

推理时 / 持续微调

THINKING MACHINES(TINKER)

Tinker 支撑的 SDFT 达 70.6%(vs SFT 63.2%)且抗遗忘;TTT-Discover 连破数学 / 内核 / 生信 SOTA—— 参数化持续学习目前最实的证据

⏳ 时间判断:2–4 年内给出可复现的中期答案

路线三 · 最先产品化 · 概率最高

前沿实验室混合派

ANTHROPIC · OPENAI · GOOGLE

Anthropic(Auto Dream 睡眠整合 + Memory Tool API 工程纵深)、 OpenAI(最大真实用户记忆数据 + 翁荔回归带 RSI)、 Google(个人数据护城河 + Nested Learning)。

⏳ 时间判断:2026–2028 「看起来已解决」的持续学习 = RL + 分层记忆 + 睡眠时计算的混合系统,出自这三家

路线四 · 体验先行

记忆层初创

MACARON · MEM0 · ZEP · 中国阵营

Macaron / Mem0 / Zep 继续刷新「用户体验到的持续学习」,但尚未触达参数层。 中国阵营(DeepSeek V4 长期记忆、腾讯姚顺雨团队、GLM 系)有环境与数据优势,是最大变量

⏳ 时间判断:体验逐年变强;参数层突破取决于底座演进

一句话预测 · ONE-LINE FORECAST 范式级突破看 Ineffable / Thinking Machines;产品级突破看 Anthropic / OpenAI; 架构级黑马看 DeepSeek Engram→V4Google HOPE; 体验级先行者 Macaron 已经把「记得你」做成了卖点。
08

我可以在哪里提供接口?个人介入点 L0–L5

FILE 08 / 行动指南 DECRYPTED 按投入成本分层 · 阶梯式进阶

持续学习的生态位远比「训一个大模型」宽阔。以下按投入成本从 1 天到一年分层, 每一层都有明确的空缺与窗口期。

L01天 – 2周
生态参与者

跑通 Mem0 / Graphiti / Hindsight 横评并发内容;给开源项目提 issue / 文档 / cookbook。 高质量第三方横评极度稀缺,是建立信誉最快的方式。

L12周 – 2月
开源贡献 性价比最高

Mem0 新 backend / provider(59k stars);Graphiti 新图数据库后端;Cognee(630 个 open issues); Letta 2026-03 转向 Letta Code 后服务端记忆工具弃用 = 生态真空窗口;LangMem 缺内置 memory-eval 模块; Memobase(2.8k stars,易成核心贡献者)。

L21周 – 1月
MCP / Claude Code 记忆插件 最热入口

官方 server-memory 已归档停维护;内置 auto-memory 无语义检索、无治理。 差异化机会:写入门禁(write gate)、TTL、纠正传播、冲突检测、本地隐私优先、 垂直场景记忆(代码决策 / 科研文献)。成功先例:claude-mem、MemPalace(56k stars)、 OMEGA(个人项目,LongMemEval 95.4%)。

L31 – 3月
评测与数据 影响力杠杆

榜单 judge 混乱 → 做统一协议复现榜(固定 reader / judge + 冻结 prompt hash,参考 Mnemoverse); LoCoMo 数据清洗版(6.4% 错误没人修);空缺数据:真实长周期对话、多语言、工具使用型、超长纵向压力; 发 HuggingFace + dataset paper(PerLTQA 已有先例)。

L43 – 12月
独立工具 / 产品

不要做通用 memory-as-a-service(kill-zone:Mem0 / Zep 卡住生态位 + 大实验室内置免费化)。 可做:记忆评测 / 可观测性层(「memory 的 Datadog」)、垂直记忆中间件(医疗 / 金融合规溯源)、 记忆可移植性(memory passport)、记忆安全(投毒防御几乎空白)。

L5可发论文
研究发力 只需 API 预算

记忆巩固(TiMem 刚起步)、学会遗忘(FadeMem / AgeMem,MemGym 环境可直接用)、 Supersede 过期事实修复(环境已开源)、可信反思(几乎无人系统做)、记忆压缩帕累托前沿、 多智能体记忆治理(wide open)、记忆红队、judge 可靠性(裁判宽松度可致 17 分波动)。

组合路径建议 · SUGGESTED PATH 第 1 月:统一协议横评,建立信誉 → 第 2–4 月:做 Claude Code 记忆治理插件或 LangMem eval 模块 → 第 3–6 月:把验证机制写成论文 + 开源数据 → 再判断是否产品化。
09

时间线:从灾难性遗忘到经验时代(1990s → 2032)

FILE 09 / 编年记录 DECRYPTED 点击任意条目展开详情 · 虚线节点为预测
ERA I · 问题提出与神经时代解法(1990s–2019)
1990s灾难性遗忘问题提出
McCloskey & Cohen 系统描述:神经网络学习新任务时会覆盖旧权重。这一问题定义了此后三十多年的持续学习研究。
2016EWC(DeepMind)
Elastic Weight Consolidation:用 Fisher 信息估计权重重要性,对重要参数加正则约束,防止旧任务被遗忘(Kirkpatrick et al.)。
2017Progressive Networks
参数隔离路线的早期代表:每个新任务配新列网络,通过横向连接复用旧知识,彻底避免遗忘但参数随任务线性增长。
ERA II · LLM 时代的接续与转向(2020–2023)
2020RAG / Don't Stop Pretraining
检索增强生成与继续预训练分别成为「外挂记忆」与「写进权重」两条路线的 LLM 时代起点。
2022Model Soups / Task Arithmetic 起点
模型合并路线兴起:不训练,直接在权重空间做算术,把多个模型的能力合并为一。
2023MemGPT · Generative Agents · Voyager · 翁荔 Agent 公式
外部记忆路线爆发:MemGPT 引入 OS 分页式记忆管理;Generative Agents 展示记忆驱动的社会模拟;Voyager 奠基技能库;翁荔提出 Agent = LLM + 记忆 + 规划 + 工具的行业公式。
ERA III · 范式转向(2024)
2024-02CL for LLMs 综述
持续学习与大模型的交叉首次被系统梳理,标志着 CL 正式成为 LLM 研究议程。
2024-12Ilya:「预训练终结」;Meta Memory Layers
NeurIPS 2024 上 Ilya 宣布数据峰值、预训练时代落幕;同月 Meta 发布 Memory Layers at Scale(128B 记忆参数 KV 查找层),记忆原生架构路线登场。
ERA IV · 经验时代(2025)
2025-01Google Titans
surprise 驱动的测试时记忆更新,支持 >2M token 上下文,架构级记忆路线的重要里程碑。
2025-04Sutton & Silver《经验时代》
Era of Experience:宣言式论文,主张 AI 从人类数据时代进入在线终身 RL 的经验时代。
2025-05Absolute Zero · Darwin Gödel Machine · CTM
零数据自我对弈学习、自我改写代码的 Gödel 机、Sakana 连续思维机——自我进化路线三连发。
2025-06MIT SEAL
模型自生成 self-edit 指令完成持久权重更新:测试时学习路线标志性工作(72.5% vs ICL 0%)。
2025-10Tinker · MemoryBench · Karpathy「认知欠缺」
Thinking Machines 发布 LoRA 微调 API Tinker;清华发布首个持续学习基准 MemoryBench;Karpathy 诊断「现有系统没有持续学习」。
2025-12Nested Learning / HOPE · mHC
Google 嵌套多时间尺度优化 + Continuum Memory System(NeurIPS 2025),被视为 2025 年底最重要架构方向;DeepSeek 提出流形约束超连接。
ERA V · 密集下注(2026)
2026-01DeepSeek Engram · Ineffable 成立
Engram 条件记忆(与北大合作):MoE 之外的第二稀疏轴;David Silver 创立 Ineffable Intelligence,$11 亿种子轮,零人类数据 superlearner。
2026-06GLM-5.2 发布
~753B / 激活 ~40B,DSA + IndexShare,1M 上下文,MIT 开源——随后成为 Macaron V1 的基座。
2026-07Macaron V1 · Kimi K3 开源 · 翁荔重返 OpenAI · 英伟达 $50 亿投 SSI · 超衍智能 · Inkling
单月密度史无前例:MoL 持续学习架构落地;K3 开源;翁荔回 OpenAI 领导 RSI;英伟达战略投资 SSI 约 $50 亿 + Vera Rubin 算力 10×;陈勇超创立超衍智能;Thinking Machines 发布 Inkling(975B / 41B)。
ERA VI · 预测(虚线节点)
2026 H2 – 2028预测:混合系统产品化窗口
RL + 分层记忆 + 睡眠时计算的混合系统将让持续学习「看起来已解决」,出自 Anthropic / OpenAI / Google 三家。
2032预测:Dwarkesh 中位数
「类人 on-the-job 学习」能力的中位数预测时间点;真正的 in-weights 终身学习预计还需 4–6 年。
10

FAQ:十个最常被问错的问题 + 四个补充

FILE 10 / 问答卷宗 DECRYPTED 点击展开 · 共 10 条 + 4 条补充
ANSWER · 不是 MemoryBench 实证:现有系统能「记得」,但不能从反馈中习得程序性知识。 记忆是持续学习的必要不充分条件——「记忆 ≠ 持续学习」。
ANSWER · 成本与风险 千亿级模型全量重训是百万美元级成本;重训有遗忘风险,安全对齐也会退化。 所以大家都在找中间路线:参数高效更新、记忆层、睡眠时计算。
ANSWER · 需要 LongMemEval 显示全上下文方案随历史增长掉点 30–60%;且每次推理都要重付全部成本、 没有跨会话持久性。「用上下文推迟遗忘」≠「学会」。
ANSWER · 分数通胀 LoCoMo 有 6.4% 答案损坏、judge 接受 62.8% 错答、各家裁判口径不一。 看未饱和基准:BEAM / MemoryStress / GroupMemBench 上,头部系统只有 38–64%。
ANSWER · 融合 Nested Learning 已把优化器 / ICL / 记忆统一为嵌套优化,路线边界正在消融。 产业界短期是「冻结基座 + 外部记忆 + 睡眠整合」,长期押注架构内生记忆。
ANSWER · 本地优先 本地优先记忆(MemPalace / OMEGA 路线)、写入门禁、可审计的记忆治理, 是开源生态最明确的空缺,也是大厂不愿做的位置——这正是个人开发者的机会。
ANSWER · 安全面几乎空白 记忆投毒(Trojan Hippo,85–100% ASR)、错误反思自我强化、compaction 静默丢失安全指令、 跨租户泄漏。防御方几乎空白 = 既是风险,也是机会。
ANSWER · 看赛道 通用记忆 API 晚了(kill-zone);治理 / 垂直 / 安全 / 评测 / 本地隐私正当时; 前沿叙事(RSI、自我进化)才刚开始——陈勇超、Silver、Clune 都是 2025–2026 才创立公司。
ANSWER · 严格意义上不是 K3 的权重不随用户更新。但它的 AgentEnv 状态持久化 + thinking history 保留, 是目前开源世界里最接近「学习型 agent 底座」的基础设施。
ANSWER · 四选一 Macaron(Deep Memory,RL 记忆 token)、Claude Projects(透明可控)、 ChatGPT Memory(最自动但最不准)、Gemini(数据最全)。
ANSWER · 能力上限 Ilya 认为人类的样本效率与在岗学习正是现有范式缺失的科学原理;梁文锋把它列为 CoT、Agent 之后的下一阶梯;Karpathy 用“失忆的同事”解释为什么 Agent 仍不成熟。共同内核是:不会持续学习的系统,能力上限被锁在训练截止日——它可以很博学,却不会越用越懂你、越干越熟练。
ANSWER · 有严格对应 生物睡眠会选择性重放白天经验、把海马体内容转写进皮层并修剪无用连接;离线巩固算法也在做选择经验、重放、蒸馏与遗忘。工程谱系从 CLS 理论(1995),到 Letta sleep-time compute(2025),再到自动巩固与“LLM 需要睡眠”的研究。产品文案可以很浪漫,但背后的计算问题是真实的。
ANSWER · 按投入排序 零代码:认真使用 ChatGPT/Claude 的记忆功能并定期审计它学到了什么;低代码:给 Agent 挂 Mem0/Letta/MemOS,用 Skills 沉淀工作流;动手训练:用托管微调或开源底座做领域 LoRA;产品级:采用冻结底座 + 场景适配器 + 可治理记忆系统,不要直接在线改生产模型权重。
ANSWER · 五个探针 ① 问它测什么榜,是否只报已饱和或口径宽松的分数;② 问学到的东西是否改变了后续行为;③ 问学新知识后旧能力掉了多少;④ 问用户能否查看、修改与彻底删除某条记忆;⑤ 问记忆有没有巩固、过期、冲突消解与回滚生命周期。能把五问都用数据答清楚的产品,才值得把“学习”写进名字。
11

参考来源

FILE 11 / 溯源清单 DECRYPTED 主要 arXiv 编号与官方链接
  1. Introducing Macaron V1(Mind Lab 官方研究博客)macaron.im/mindlab/research/introducing-macaron-v1
  2. Kimi K3 官方仓库与模型卡github.com/MoonshotAI/Kimi-K3
  3. GLM-5.2 官方技术博客z.ai/blog/glm-5.2
  4. Engram:条件记忆(DeepSeek × 北大)arXiv:2601.07372
  5. Nested Learning / HOPE(Google,NeurIPS 2025)arXiv:2512.24695
  6. Titans:Learning to Memorize at Test Time(Google)arXiv:2501.00663
  7. Memory Layers at Scale(Meta)arXiv:2412.09764
  8. MemGPT:OS 分页式 LLM 记忆管理arXiv:2310.08560
  9. Mem0:Building Production-Ready AI Agents with Scalable Long-Term MemoryarXiv:2504.19413
  10. Zep:A Temporal Knowledge Graph Architecture for Agent MemoryarXiv:2501.13956
  11. A-MEM:Agentic Memory(Zettelkasten 卡片式记忆)arXiv:2502.12110
  12. LongMemEval:Benchmarking Chat Assistants on Long-Term Interactive Memory(ICLR 2025)arXiv:2410.10813
  13. MemoryBench:首个持续学习基准(清华)arXiv:2510.17281
  14. SEAL:Self-Adapting Language Models(MIT)arXiv:2506.10943
  15. TTT:Learning to (Learn at Test Time)arXiv:2407.04620
  16. Absolute Zero:零数据自我对弈强化学习arXiv:2505.03335
  17. Darwin Gödel Machine(DGM)arXiv:2505.22954
  18. Lil'Log(翁荔博客):Agent 公式 / Why We Think / Harness Engineering for Self-Improvementlilianweng.github.io
  19. Welcome to the Era of Experience(Sutton & Silver)Era of Experience 论文
  20. SSI 融资与英伟达战略投资等相关报道TechCrunch 等媒体报道