从 Macaron V1 到 SSI,谁在教 AI「不遗忘」——一份写给研究者、开发者与创业者的持续学习(Continual Learning)全景情报档案。
这组材料不按“谁更新、谁更强”来堆新闻,而是沿着一个系统真正学会积累经验所需的四层问题展开。第一次阅读建议从本页开始;做产品可直接进入工程档案;研究个性化计算或世界模型,则从对应报告进入。
概念、Macaron、人物、六条路线、评测、预测、介入点、时间线与 FAQ;本页也是整个研究组的索引。
02 · ENGINEERING把“模型更强”与“学习栈更合适”分开判断,并给出影子教师、单专家 LoRA、原生移植和 Experience Gateway。
03 · ATTENTION经验被记住之前,系统先要决定看哪里、算多久、调用哪部分能力;这篇报告处理“选择什么进入学习”的机制层。
04 · CAUSALITY如果经验只有相关性,持续学习只会更熟练地复读偏差;可分叉世界模型尝试把干预、反事实和可证伪闭环放进训练分布。
一次性训练 → 冻结 → 部署。学完之后,模型是一张「照片」—— 知识永远截止在训练那一天。它不会因为你今天告诉它的事而明天变得更好, 要更新知识,只能回炉重训。
像人一样,边工作边积累:新知识进来、旧知识不忘,还能越用越好。 它是有日记、会反思、不断修订自己的图书馆员——经验被沉淀为能力, 而不是用完即弃的上下文。
神经网络学新任务时会覆盖旧权重——这就是灾难性遗忘(Catastrophic Forgetting)。 它不是新问题:早在 1990 年代,McCloskey & Cohen 就系统描述了它。 三十多年后,它依然是挡在「会学习的 AI」面前的核心障碍:写进权重会忘,不写进权重就留不住。 整个持续学习领域,本质上都是在「遗忘」与「可塑性」之间寻找工程与科学的平衡点。
| 时间 | 人物 / 事件 | 核心信号 |
|---|---|---|
| NeurIPS 2024 | Ilya Sutskever 演讲 | 宣布「预训练终结 / 数据峰值」—— scaling 的旧引擎熄火 |
| 2025 | Sutton & Silver《经验时代》 | 从人类数据时代转向在线终身 RL 的「经验时代」宣言 |
| 2025-10 | Andrej Karpathy | 诊断:「现有系统没有持续学习,认知上有欠缺」 |
| 2025–2026 | Demis Hassabis | 把 continual learning 直接写进 AGI 的定义 |
记得你说过的——事实、偏好、历史交互被可靠地存取。
按反馈调整行为——被纠正一次,下次不再犯同样的错。
自己出题自己学——从经验中生成新任务,递归地改进自身。
神经科学的互补学习系统理论(CLS,McClelland 等,1995)认为人脑用两套系统绕开了稳定性—可塑性两难:海马体当“白板便签”,快速记下今天发生的具体事;新皮层当“结构化笔记本”,慢速沉淀统计规律;睡眠负责把便签誊写进笔记本。2024–2026 年几乎所有持续学习方案,都能在这张图里找到自己的工程位置。
Thinking Machines 在 2025 年 10 月公开的实验里,先把 Qwen3-8B 在公司内部文档上微调:新知识学进去了,但指令跟随能力当场崩掉。再用“过去的自己”当老师做 on-policy 蒸馏,旧能力几乎全部找回,新知识也保住了。
| 阶段 | 指令跟随(IF-eval) | 内部知识 | 发生了什么 |
|---|---|---|---|
| 微调前 | 85% | 18% | 模型很听话,但基本不懂内部文档 |
| 微调新知识后 | 45% ↓ | 43% | 知识上升,指令能力被新梯度覆盖 |
| on-policy 蒸馏后 | 83% ↑ | 41% | 早期版本充当 teacher,恢复旧行为并保住大部分新知识 |
来源:Thinking Machines · On-Policy Distillation(数值为该文实验读数)。
| 层 | 发生在哪 | 时间尺度 | 像人类的什么 | 今天的成熟度 |
|---|---|---|---|---|
| 第 1 层 · 上下文内学习 | 推理时的注意力,不留任何痕迹 | 秒–小时 | 工作记忆(打电话时记住的号码) | 已解决:GPT-3 时代的礼物 |
| 第 2 层 · 外挂记忆 | 模型外的数据库 / 文件 / 知识图谱,检索后注入上下文 | 天–年 | 日记、备忘录、相册 | 产品化内卷中:记住 ≠ 学会 |
| 第 3 层 · 权重级学习 | 参数本身被更新(全参 / LoRA / 记忆槽) | 周–终身 | 技能内化:学会骑车后不再逐条回忆教程 | 攻坚前沿:2025 下半年起关键零件才逐渐凑齐 |
行业黑话对照:第 2 层做得好叫“记忆(memory)”,第 3 层做得好才叫“持续学习(continual learning)”。市面上多数“AI 记忆”产品仍在第 2 层;真正的难题是第 3 层,以及让第 2、3 层自动流转、可审计、可回滚的“睡眠”机制。
Mind Lab 发布的 Macaron-V1 是目前把「持续学习」讲得最完整、也做得最工程化的一套系统: V1-Venti 748B(744B 基座 + 4×1B LoRA 专家),是首个在 GLM-5.2 上后训练的模型; 另有 V1-Tall 50B(基于 Qwen 3.6 35B,面向本地部署)。 权重在 HuggingFace 全量开放,同时提供官方 API(mint.macaron.im)。
MoL 的意义在于:基座不动,新能力以 LoRA 插件形式累积——这是「天然适配持续学习」的参数隔离路线; 不同团队、不同用户训练出的专家可以组合共享,Macaron 称之为集体智能(Collective Intelligence)。
Discovery 自造更难的任务 → Expansion 解题并优化 harness → Update 更新参数,然后循环往复。模型不只是解题,而是在造题—解题—更新的闭环里变强。
多个智能体分工协作完成任务,把单模型能力上限问题转化为组织与协作问题—— 与 MoL 的「专家可组合」叙事互相咬合。
| 子系统 | 做什么 | 关键数字 / 细节 |
|---|---|---|
| LongStraw | 超长程 RL 训练,把 RL 从 256K token 墙推到 2.1M token | 8×H20 推 Qwen3.6-27B 到 2.1M GRPO;32×H20 推 GLM-5.2(78 层 MLA/DSA、256 专家)到 2.1M;常驻前缀路径 4.46M |
| MinT | 百万级 adapter 目录与调度 | adapter-only actor-learner 交接;支持 1T 参数;已开源 verl-mint / areal-mint |
| MindForge + HCP | Harness Context Protocol:训练与生产同一 harness / memory 布局 / tool tokenization | 消除训练—部署鸿沟(train-serving skew) |
| REPL Harness | 工具生命周期:compose → validate → promote → reuse | save_tool / promote_tool 跨会话保留验证过的工具 = 程序性记忆 |
2026-07-16 上线 · 2026-07-27 开源权重
2026-06-13 发布 · MIT 开源
| 基准 | Kimi K3 | GLM-5.2 | 差距解读 |
|---|---|---|---|
| HLE(带工具) | 43.5 / 56.0 | 40.5 / 54.7 | K3 小幅领先 |
| GPQA | 93.5 | 91.2 | K3 领先 |
| DeepSWE | 67.5 | 46.2 | K3 大幅领先(+21.3) |
| SWE-Marathon | 42.0(第一) | 13.0 | 长程耐力差 3 倍以上 |
| TerminalBench 2.1 | 88.3 | 81.0 | K3 领先 |
| AutomationBench | 30.8 | 12.9 | 自动化场景 K3 碾压 |
| AIME 2026 | — | 99.2 | 纯数学 GLM 极强 |
| 价格(API) | $3 / $15 | $1.4 / $4.4 | GLM 便宜 2–3 倍 |
| 许可证 | 自定义 Kimi K3 License | MIT | GLM 商用友好 |
判断一个方向是不是真前沿,最快的办法是看顶级头脑把职业生涯押在哪里。 2024–2026 年,持续学习相关的下注从「架构层记忆」「自我改进 harness」到「全新范式」全面铺开——以下是主要卷宗。
| 人物 / 机构 | 动作 | 时间 | 押注方向 |
|---|---|---|---|
| Richard Sutton & David Silver | 《经验时代》(Era of Experience) | 2025 | 在线终身 RL |
| David Silver | 创立 Ineffable Intelligence,$11 亿种子轮 | 2026-01 | 零人类数据 superlearner |
| Jeff Clune | Recursive Superintelligence 出潜,$5 亿 pre-A / $40 亿估值 | 2026-04 | Darwin Gödel Machine:SWE-bench 20%→50% |
| Yann LeCun | 创立 AMI Labs,$10.3 亿种子轮 | 2026-03 | 世界模型 / JEPA |
| Sakana AI | CTM 连续思维机 | 2025-05 | 连续时间神经动力学 |
| Nested Learning / HOPE(NeurIPS 2025) | 2025-12 | 嵌套多时间尺度优化 | |
| MIT | SEAL:自生成 self-edit 做持久权重更新 | 2025-06 | 自我适应权重 |
| Letta / Mem0 | 融资 $10M / $24M | 2025 | 外部记忆基础设施 |
| Thinking Machines | Tinker(LoRA 微调 API,2025-12 GA)+ Inkling(975B / 41B) | 2026-07 | 参数高效持续微调 |
| Andrej Karpathy | 公开诊断「现有系统没有持续学习,认知上有欠缺」 | 2025-10 | 定义问题 = 最大的下注 |
| 基准 | 出处 | 规模与特征 | 关键发现 |
|---|---|---|---|
| LongMemEval | ICLR 2025 | 500 题;S 版 ~115K token / M 版 ~1.5M token | GPT-4o 全上下文仅 57.7–63.8%;历史增长掉点 30–60% |
| LoCoMo | ACL 2024 | 1986 题,多轮长对话 | 人类水平 87.9%;但 6.4% 答案损坏、judge 接受 62.8% 错答 |
| MemoryBench | 清华 · 2025-10 | 首个「持续学习」基准 | 核心结论:现有记忆系统都不能利用程序性知识从反馈中学习——「记忆 ≠ 持续学习」的最直接证据 |
| BEAM | 2025 | 1M / 10M token,未饱和 | 所有方法的弱项 = 矛盾消解;Mem0 仅 64.1 / 48.6 |
| TRACE / Standard CL | 经典 | 参数级持续学习基准 | 学术线主战场,与真实后训练差距大 |
| τ-bench 系 | 2024– | agent 场景评测 | 工具使用与策略一致性 |
| 产品 | 机制 | 特点 / 短板 |
|---|---|---|
| ChatGPT Memory | 双层记忆,起步最早 | 第三方 LoCoMo 实测垫底 52.9,时序题仅 21.7 —— 最自动但最不准 |
| Claude | 项目级隔离 + 24h 自动综合;Claude Code 三层 memory.md / Auto Dream 睡眠整合 | 透明度最高,用户可审计、可编辑 |
| Gemini Personal Intelligence | Gmail / Drive 数据护城河 | 本质是「用超长上下文推迟遗忘」,不是学会 |
| Macaron Deep Memory | RL 训练的记忆 token | 消费级首创:记忆本身是被训练出来的能力 |
| Letta MemFS | 「存文件就够」 | 反直觉地拿到 74.0% —— 简单方案并不弱 |
INEFFABLE INTELLIGENCE(SILVER)+ SUTTON OAK
理论自洽——从经验直接学习的 superlearner 是终局形态;但开放域奖励无解, 5 年内难产品化。
⏳ 时间判断:范式级突破的候选,产品化 ≥ 5 年
THINKING MACHINES(TINKER)
Tinker 支撑的 SDFT 达 70.6%(vs SFT 63.2%)且抗遗忘;TTT-Discover 连破数学 / 内核 / 生信 SOTA—— 参数化持续学习目前最实的证据。
⏳ 时间判断:2–4 年内给出可复现的中期答案
ANTHROPIC · OPENAI · GOOGLE
Anthropic(Auto Dream 睡眠整合 + Memory Tool API 工程纵深)、 OpenAI(最大真实用户记忆数据 + 翁荔回归带 RSI)、 Google(个人数据护城河 + Nested Learning)。
⏳ 时间判断:2026–2028 「看起来已解决」的持续学习 = RL + 分层记忆 + 睡眠时计算的混合系统,出自这三家
MACARON · MEM0 · ZEP · 中国阵营
Macaron / Mem0 / Zep 继续刷新「用户体验到的持续学习」,但尚未触达参数层。 中国阵营(DeepSeek V4 长期记忆、腾讯姚顺雨团队、GLM 系)有环境与数据优势,是最大变量。
⏳ 时间判断:体验逐年变强;参数层突破取决于底座演进
持续学习的生态位远比「训一个大模型」宽阔。以下按投入成本从 1 天到一年分层, 每一层都有明确的空缺与窗口期。
跑通 Mem0 / Graphiti / Hindsight 横评并发内容;给开源项目提 issue / 文档 / cookbook。 高质量第三方横评极度稀缺,是建立信誉最快的方式。
Mem0 新 backend / provider(59k stars);Graphiti 新图数据库后端;Cognee(630 个 open issues); Letta 2026-03 转向 Letta Code 后服务端记忆工具弃用 = 生态真空窗口;LangMem 缺内置 memory-eval 模块; Memobase(2.8k stars,易成核心贡献者)。
官方 server-memory 已归档停维护;内置 auto-memory 无语义检索、无治理。 差异化机会:写入门禁(write gate)、TTL、纠正传播、冲突检测、本地隐私优先、 垂直场景记忆(代码决策 / 科研文献)。成功先例:claude-mem、MemPalace(56k stars)、 OMEGA(个人项目,LongMemEval 95.4%)。
榜单 judge 混乱 → 做统一协议复现榜(固定 reader / judge + 冻结 prompt hash,参考 Mnemoverse); LoCoMo 数据清洗版(6.4% 错误没人修);空缺数据:真实长周期对话、多语言、工具使用型、超长纵向压力; 发 HuggingFace + dataset paper(PerLTQA 已有先例)。
不要做通用 memory-as-a-service(kill-zone:Mem0 / Zep 卡住生态位 + 大实验室内置免费化)。 可做:记忆评测 / 可观测性层(「memory 的 Datadog」)、垂直记忆中间件(医疗 / 金融合规溯源)、 记忆可移植性(memory passport)、记忆安全(投毒防御几乎空白)。
记忆巩固(TiMem 刚起步)、学会遗忘(FadeMem / AgeMem,MemGym 环境可直接用)、 Supersede 过期事实修复(环境已开源)、可信反思(几乎无人系统做)、记忆压缩帕累托前沿、 多智能体记忆治理(wide open)、记忆红队、judge 可靠性(裁判宽松度可致 17 分波动)。