Continual Learning · 2026-07 全景报告

持续学习解密
让模型像人一样,边干活边变强

从 Macaron v1(GLM-5.2 底座 + LoRA 专家)这个具体案例出发,拆解「换成 Kimi K3 值不值」;再拉远镜头,看梁文锋、翁荔、陈勇超、Ilya Sutskever 各自押注的路线、四十年的问题史、可能的行业 SOTA 形态,以及你——一个开发者——可以插进这场变革的接口。

数据截至 2026 年 7 月 31 日 · 基于公开论文、模型卡与报道 · 传闻均已标注 · 深入浅出,可当科普读,也可当行研用

⏱ 60 秒版结论

  1. 换底座问题:Kimi K3 的天花板更高(AA 智能指数 57 vs 51,原生多模态,超长程任务碾压),但对 Macaron 这类个人 Agent,全量替换当下不划算——服务成本约 2~3 倍、K3 自定义 license 卡住 MIT 开源与 MaaS 商业化、幻觉率反而更高、全套 RL 基建要重做。合理打法是混合路由 + 保持底座无关
  2. 赛道本质:今天的大模型是「毕业即定型」——训练结束后不再真正学习。持续学习要解决的,是让模型在部署后不断吸收新经验而不遗忘旧能力(灾难性遗忘,1989 年就发现的老问题)。
  3. 路线收敛:五条路线(外挂记忆 / 改权重 / 改架构 / 经验 RL / 评测基建)正在向神经科学的「双系统 + 睡眠巩固」蓝图收敛:快记忆放上下文,慢知识进权重,中间靠离线「做梦」蒸馏。
  4. 谁先突破:产品级持续学习已经发生(ChatGPT dreaming、Macaron 一人一模型);权重级规模化个性学习,OpenAI(翁荔新掌 RSI 团队)与 DeepSeek(Engram→V4)概率最高;SSI 是方差最大的暗牌;Google 最可能贡献大家都抄的架构。
  5. 你的接口:普通开发者最稀缺的贡献不是训模型,而是RL 环境、长程评测、MCP 记忆中间件、领域 LoRA 适配器、带可验证反馈的数据飞轮——五个切入口,文末给了具体第一步。
01 · 案例解剖

Macaron v1:一个「持续学习产品化」的样本

2026-07-21,MindLab(心洲科技旗下前沿实验室,C 端产品 Macaron 个人 Agent)发布 Macaron-V1——自称「世界上第一个从 GLM-5.2 后训练而来的模型」。它有趣的地方不在分数,而在组织智能的方式:不动底座,只训「可插拔的专家」,这正是持续学习的一种产品化答案。

🧠 结构:Mixture-of-LoRA(MoL)

把 744B 的 GLM-5.2 底座完全冻结(相当于不再动的大脑皮层),在其上挂 4 个各约 1B 参数的 LoRA「专家帽子」,总参 748B。路由专家 L0 决定每个请求「戴哪顶帽子」,之后的推理与工具调用都留在该专家内。

L0 · Chat / 路由
对话、指令跟随,并把任务分派给专家
↓ 路由分派
L1 · Agent
长程重工具任务
L2 · Coding
SWE / 终端
L3 · GenUI
UI4A 生成界面
L(n) · 可扩展
新领域=注册新 LoRA
↓ 全部挂载于
GLM-5.2 底座 · 744B(冻结)
78 层 MLA/DSA 稀疏注意力 · 256 专家 MoE · MTP · 1M 上下文 · MIT 开源

「学新东西不动旧大脑」——新领域只需训练并注册一个新 LoRA,天然回避了灾难性遗忘;不同团队、不同用户的专家还能组合(官方称之为 Collective Intelligence)。这是参数隔离路线(2016 年 Progressive Networks 思想)的 2026 工业版。

🔁 训练:GRPO + 递归自我改进(RSI)

RL 算法用 GRPO,单次训练上下文达 210 万 token;更关键的是三段式 RSI 循环——模型参与生产自己的下一版:

① Discovery 出题
从种子任务构造更难、更多样的任务并验证过滤
② Expansion 做题
解题、审计轨迹、迭代 harness 配置
③ Update 改参数
用优化后的轨迹 + HCP 配置更新 LoRA 权重

支撑它的自研基建:MindForge(把生产环境的工具、记忆布局直接接进训练)、LongStraw(把百万级 token 的 RL 从「全序列内存问题」改写为「状态生命周期问题」)、MinT(后训练平台,支撑百万级 adapter 目录)、HCP(Harness Context Protocol,标准化任务元数据 / 记忆状态 / 路由指令)。

战绩:12 项评测全面超过原始 GLM-5.2,其中 7 项同时超过 GPT-5.5 与 Claude Opus 4.8(如 TerminalBench 2.1 87.6、自研 UI4A-Bench 87.8);但 SWE Atlas QnA 仅 +0.6——LoRA 擅长改变「怎么用已有能力」,难以补足底座缺的知识。这个短板正是「换底座」问题的由来。

📌 背景速览

Macaron 产品 2025-08-15 上线,定位「世界首个个人 AI Agent」:即时生成 mini-app + Deep Memory 长期记忆,2026-06 用户约 200 万,2026-07 开启商业化约两周 ARR 破 1000 万美元(公司口径)。创始人陈锴杰(Duke 辍学、连续创业者),首席科学家马骁腾(清华 RL 方向)。融资:真格天使 → 2026-01 蚂蚁领投超 2000 万美元 Pre-A → 2026-06 美团领投近 5000 万美元 A 轮。底座演进:70B → 671B 级(All-Sync RL)→ 2025-12 在 Kimi K2(1T)上跑通 LoRA-RL(<0.5% 参数保留 >90% 全参性能、GPU 省 90%,成果并入 NVIDIA Megatron-Bridge 与 verl)→ GLM-5.1(V1-Preview)→ GLM-5.2(V1)。注意:他们的训练栈从设计上就是底座无关的——这对下一节的问题很重要。

来源:Introducing Macaron-V1 · HF 模型卡(Venti) · V1-Preview · 万亿参数 LoRA-RL(GlobeNewswire) · 融资报道(投中网)

02 · 核心问题

如果把 GLM-5.2 换成 Kimi K3,会怎样?

Kimi K3(2026-07-16 发布,07-27 开放权重)是月之暗面的换代旗舰:2.8T 总参 / 104B 激活,69 层 KDA 线性注意力 + 24 层 Gated MLA 的 3:1 混合架构,原生多模态,1M 上下文。先看数据,再下判断。

同量纲指标对比(每行独立刻度,条长按该行最大值归一)

Kimi K3 GLM-5.2
Artificial Analysis 智能指数 v4.1综合能力,越高越强
K3 · 57
GLM · 51
GDPval-AA v2(真实白领任务 Elo)越高越强
K3 · 1668
GLM · 1514
DeepSWE(高难软件工程)底座知识差距最典型的一项
K3 · 67.5
GLM · 46.2
SWE-Marathon(超长程编码耐力)长任务续航,差距 3 倍
K3 · 42.0
GLM · 13.0
非幻觉率(AA-Omniscience)个人信任产品的生命线 —— GLM 反超
K3 · 49%
GLM · 72%
输出速度(tok/s,AA 实测)GLM 快 2.7 倍
K3 · 62
GLM · 167

注:两模型同 harness 独立复测 Terminal-Bench 2.1 打平(80.9 vs 81.0);τ²-bench 上 GLM-5.2 以 99.1% 居全榜第一(K3 未上榜);BrowseComp 长程检索 K3 以 91.2 领先全场,GLM 无官方数字。各基准量纲不同,不可跨行比较。

规格与生态对照

维度Kimi K3GLM-5.2
规模 / 激活2.8T / 104B(896 选 16 专家)753B / 40B(推理成本约为 K3 的 1/2.6)
注意力架构KDA 线性 + MLA 混合(3:1),KV cache −75%DSA 稀疏 + IndexShare(1M 上下文下 FLOPs ÷2.9)
多模态原生图像 / 视频输入(MoonViT-V2)纯文本
上下文1M1M
License自定义「K3 License」:MaaS 年收入 > $2000 万须另签商业协议;大规模产品须展示「Kimi K3」标识标准 MIT,无任何附加条款
API 价格(百万 token)$3.00 / $15.00$1.40 / $4.40(OpenRouter 竞价已至 ~$0.75/$2.37)
AA 单任务成本$0.94(token 更省但单价高)$0.47(更啰嗦但单价低)
自托管门槛1.56TB 权重,≈8×B200 起、多节点FP8 单节点 8×H200 可跑
RL 后训练生态SGLang+Miles day-0 LoRA-RL(demo 级,64×GB300);社区主要在等蒸馏/量化官方开源 slime 框架全系验证;Unsloth / Ollama / KTransformers / 昇腾适配;社区已有 OpenClaw-RL 等个人 agent RL 项目
推理档位发布初期仅 max reasoning 一档High / Max 两档(High 档省 2~2.5× token)

来源:K3 模型卡 · GLM-5.2 模型卡 · Artificial Analysis 对比 · LMSYS K3 day-0 博客 · Simon Willison 论 K3 license · slime

推演:提升什么 · 怎么实现 · 值不值

① 会提升什么

  • 能力天花板抬高一档:AA 指数 57 vs 51;GDPval Elo +154。MoL 的短板恰好是「补不了底座缺的知识」(SWE Atlas QnA 仅 +0.6),换更强底座直接抬升上限。
  • 原生多模态是质变:个人 Agent 天然要看照片(饮食、衣橱、小票、截图),GLM-5.2 纯文本必须外挂视觉模块;K3 原生看图看视频,产品形态直接解锁。
  • 超长程任务碾压:SWE-Marathon 42.0 vs 13.0、BrowseComp 91.2——「替我盯一件事忙一下午」的可靠性上一个台阶。
  • 生成 UI 更强:K3 居 Frontend Arena 第一(Elo 1679 vs 1587),对 Macaron 的 mini-app 生成主场景直接有利。
  • 长上下文经济性:KDA 混合线性注意力 KV cache −75%,百万 token 个人记忆流的解码吞吐更优。

② 要怎么实现

  • 训练栈重适配(最大工程):MinT/MindForge 要支持 KDA 线性注意力 + Gated MLA + LatentMoE 的 LoRA 注入与 checkpoint 转换——相当于把当年「适配 GLM5 的 DSA/MTP」(官方原话:听起来简单,it wasn't)再做一遍,且这次没有前人做过 2.8T 线性注意力混合架构的 LoRA-RL
  • 量化协同:K3 原生 MXFP4 权重,LoRA-RL 需按 QLoRA 思路「冻结 4bit 底座 + BF16 适配器」重新验证训练稳定性(IcePop、R3 router replay 等 trick 全部重调)。
  • 工具调用重对齐:160K 新词表、新对话模板,HCP 的 tool-call tokenization 重做,4 个专家 GRPO 重训 + RSI 循环重跑。
  • 算力翻倍以上:GLM-5.2 用 32×H20 完成 210 万 token 训练;2.8T/104B 激活至少 2.6~3.7 倍显存与算力(参考 LMSYS demo:64×GB300)。
  • 可行性背书:他们 2025-12 已在 Kimi K2(1T)跑通 LoRA-RL,路径不是从零开始——先在 K2.5/K2.6(1T)上验证 Kimi 系,再决定是否上 K3,是风险最低的阶梯。

③ 值不值(判断)

全量替换:当下不建议

  • License 硬伤:Macaron 靠 MIT 开源权重 + 卖 API(MaaS)立足;K3 条款恰好卡在这两点上(衍生权重难再 MIT、MaaS 超 $2000 万/年须谈判)。GLM-5.2 的 MIT 是战略资产。
  • 经济账:104B vs 40B 激活 ≈ 服务成本 2~3 倍,消费订阅业务(刚到 $10M ARR)毛利立刻恶化;速度还慢 2.7 倍。
  • 信任账:K3 幻觉率 51%(比上代还退步),对「记住你人生」的产品是致命伤;GLM 的低幻觉画像与 Macaron 自建的 ChatBench(考察长上下文中对用户诚实)同向。
  • 机会成本:3 个月量级的基建重做,赌的只是 6 分 AA 差距——而 GLM-5.5 传闻 8 月就到,Kimi 也会再降门槛。

推荐:混合策略

  • 路由分层:最难的长程 / 多模态 / 深度检索任务按需调 K3 API(它就是为「难题外包」定价的);高频日常与自托管默认留在 GLM-5.2 MoL。
  • 保持底座无关:MoL + MinT 的护城河本来就是「底座可换」;在 K2.5/K2.6 上小成本预研 Kimi 系 LoRA-RL,把「随时可换」当谈判筹码与期权。

一句话:「换 K3」买到的是天花板,付出的是毛利、开源身位与三个月基建重做;对一家护城河在「后训练工厂 + 记忆系统」而非底座本身的公司,期权价值大于行权价值。真正值得立刻做的是把多模态短板补上——要么等 GLM 系多模态版本,要么用 K3 API 混合路由。

03 · 深入浅出

持续学习 101:AI 为什么是「毕业即定型」?

今天最强的大模型,像一个考完最后一场试就再也不学习的天才:预训练 + 后训练结束的那一刻,它的权重被冻结,此后无论陪你工作多少年,它本体一个字都没记住、一点都没变强。Karpathy 的比喻很扎心:现在的 Agent 像「患了失忆症的同事」。

传统机器学习:训练与部署是两个世界

经典范式是「收集数据 → 训练 → 冻结 → 部署」。世界变了怎么办?回炉重训。这在小模型时代只是麻烦,在千亿模型时代是灾难:一次全量重训要烧掉数月与数千万美元,而且新数据一进来,老能力还可能被冲掉。

这个「冲掉」有个正式名字——灾难性遗忘(catastrophic forgetting),1989 年 McCloskey 与 Cohen 就在论文里量化了它:神经网络的知识分布在共享权重里,学新任务的梯度会直接改写旧任务赖以生存的那些权重。这不是 bug,是分布式表示的天性。

由此引出整个领域的元问题——稳定性-可塑性两难(stability–plasticity dilemma,Grossberg):太稳定学不进新的,太可塑忘光旧的。人脑是已知唯一优雅解开这个死结的系统。

遗忘有多快?一个真实实验

Thinking Machines 2025-10 的实验:把 Qwen3-8B 在公司内部文档上微调,新知识是学进去了,但指令跟随能力当场崩掉;再用「过去的自己」当老师做 on-policy 蒸馏,能力几乎全部找回,新知识还保住了。

指令跟随能力(IF-eval) 内部知识掌握
① 微调前(原始模型)
85%
18%
② 微调新知识后灾难性遗忘发生
45% ↓
43%
③ on-policy 蒸馏恢复后「学新不忘旧」的一个可行配方
83% ↑
41%

来源:Thinking Machines · On-Policy Distillation(数值为该文实验读数)

人脑的答案:双系统 + 睡眠(整个赛道的总蓝图)

神经科学的互补学习系统理论(CLS,McClelland 等,1995)认为人脑用两套系统绕开了两难:海马体当「白板便签」,快速记下今天发生的具体事;新皮层当「结构化笔记本」,慢速沉淀统计规律;睡眠负责把便签誊写进笔记本。你会看到,2024-2026 年几乎所有持续学习方案,都是这张图的工程化。

海马体 ≈ 上下文 / 外挂记忆
  • 快:一次经历就能记住(in-context / 记忆库写入)
  • 具体:存的是「那件事」原文,可检索、可审计、可删除
  • 容量有限、易过载(上下文窗口、检索精度)
  • 对应产品:ChatGPT/Claude Memory、Mem0、Letta、MemOS、Macaron Deep Memory
睡眠巩固
离线重放 · 蒸馏
sleep-time compute
ChatGPT「dreaming」
新皮层 ≈ 模型权重
  • 慢:要多次重放才能内化(微调 / RL / 蒸馏)
  • 泛化:存的是规律而非原文,用起来零成本
  • 改起来危险:灾难性遗忘、对齐漂移、不可精确删除
  • 对应技术:LoRA 适配器、sparse memory finetuning、SEAL、TTT

「学习」其实分三层(看懂任何记忆产品的钥匙)

发生在哪时间尺度像人类的什么今天的成熟度
第 1 层 · 上下文内学习 推理时的注意力,不留任何痕迹秒~小时工作记忆(打电话时记住的号码) 已解决 GPT-3 时代的礼物
第 2 层 · 外挂记忆 模型外的数据库 / 文件 / 知识图谱,检索后注入上下文天~年日记、备忘录、相册 产品化内卷中 记住 ≠ 学会
第 3 层 · 权重级学习 参数本身被更新(全参 / LoRA / 记忆槽)周~终身技能内化:学会骑车后再也不用「想」 攻坚前沿 2025 下半年起关键零件才凑齐

行业黑话对照:第 2 层做得好叫「记忆(memory)」,第 3 层做得好才叫「持续学习(continual learning)」。市面上 90% 的「AI 记忆」产品在第 2 层;这个赛道真正的圣杯在第 3 层——以及让 2、3 层自动流转的「睡眠」机制。

04 · 牌桌上的人

四位下注者:同一个命题,四层切口

2026 年中,「持续学习」罕见地同时出现在中国开源领军者、硅谷明星实验室、学院派创业者与最神秘的 AGI 押注者的议程上——但他们切入的层完全不同:架构层、后训练层、系统层、范式层。

梁文锋DeepSeek 创始人 · 幻方量化
下注点:架构层 —— 把「记忆」做成参数内的可查找模块,让持续学习先在架构上变得便宜
代表动作
共同署名 Engram 论文(2026-01):在 MoE 之外开辟「条件记忆」第三稀疏轴——哈希 N-gram O(1) 查表,把静态知识从反复神经计算中卸载,20~25% 参数挪给记忆模块最优(U 形曲线);此前有 NSA 稀疏注意力(ACL 2025 最佳论文)、DeepSeek-OCR「光学上下文压缩」(用图像模拟遗忘曲线)
最新状态
V4 于 2026-07 中旬正式发布(全系 1M 上下文);R2 从未单独面世,推理已并入主线。2026-06 完成首次外部融资 510 亿元(投后约 4000 亿),投资人 5 年锁定、基本无投票权
原话
2026-07 流出的投资人会议纪要(媒体转述):「CoT 是去年的阶梯,Agent 是今年的阶梯,下一阶段的核心命题是持续学习,最终通向 AI 自迭代与具身智能」;另有报道引述其称持续学习是「AGI 最难啃的骨头」
一句评
他赌的是:先把记忆的「存取成本」打下来(Engram 可放主机内存、绕开 HBM),持续学习才能从奢侈品变成基础设施——非常 DeepSeek 的思路:成本即战略。Engram 是否进 V4 官方未证实,属外界强推测

Engram 论文 · DeepSeek-OCR · V4 发布(TechNode) · 会议纪要(转述)

翁荔 Lilian WengThinking Machines 联创 → OpenAI(2026-07-29 官宣回归)
下注点:后训练 + Harness 层 —— 「每人一个便宜适配器 + 学新不忘旧的蒸馏配方 + 记忆工程」
代表动作
TML 三件套构成完整技术栈:LoRA Without Regret(小数据/RL 下 LoRA 追平全参微调——个性化的经济学基础)、On-Policy Distillation(灾难性遗忘的可操作解药,成本约 RL 的 1/9~1/30)、Tinker(微调 API,让这一切变成服务);2026-07 TML 又发布 Inkling(975B 开源底座,「为微调而生」)
最新状态
2026-07-27 因健康原因离开 TML(自述七个月来生病次数超过人生任何阶段),两天后 OpenAI 确认她回归,执掌专注递归自我改进(RSI)的研究团队。她 7 月初的博客《Harness Engineering for Self-Improvement》几乎就是新岗位的宣言:近期的自我改进靠模型外的工具、记忆管理与评估回路演进
一句评
四人中唯一交付过「可复现配方」的:遗忘问题在她的框架里不是玄学,是「微调 → 行为回退 → 蒸馏恢复」的工程循环。她转会 OpenAI,意味着这套配方将接上全球最大的用户数据飞轮——这是本报告判断「OpenAI 概率最高」的核心依据

LoRA Without Regret · On-Policy Distillation · Harness Engineering · 转会报道(TechCrunch)

陈勇超哈佛 SEAS + MIT LIDS 博士 → 清华 AI 学院助理教授 · 超衍智能创始人
下注点:系统 / 科学层 —— 「自主进化基础模型」+ AI Scientist:让模型自己发现未知,而不只是复刻人类已知
代表动作
Google 实习期一作 TUMIX(ICLR 2026):多 Agent 工具混合的 test-time scaling,把 Gemini-2.5-Pro 在「人类最后考试」上从 21.6% 拉到 34.1%;博士主线是 LLM + 机器人任务规划(代码-文本混合推理、自验证)。中科大郭沫若奖学金、婉拒 DeepMind 正式 offer
最新状态
2026-07-06 官宣创立超衍智能(Apex Intelligence),主打自主进化基础模型与 Auto Research,团队来自清华/哈佛/MIT + 谷歌/微软/月之暗面/智谱/蚂蚁;2026-08 同步入职清华任教。融资未披露
一句评
他代表「学院派创业」切口:持续学习不只是记住用户偏好,而是科学发现的自动化——模型在与环境交互中自己出题、自己验证、自己变强(与 Macaron 的 RSI、SEAL 的 self-edits 同构,但目标从「服务个人」换成「发现规律」)。注意:常有人把他与 Macaron 创始人陈锴杰混淆,两人无关联

36Kr 专访(创业与任教) · TUMIX 论文 · MIT REALM 页面

Ilya SutskeverSSI(Safe Superintelligence)联创 · 前 OpenAI 首席科学家
下注点:范式层 —— 泛化与样本效率是缺失的科学原理本身;超级智能必须是「在岗学习」的系统,而非「成品大脑」
代表观点
2025-11 Dwarkesh 访谈:scaling 时代结束,「回到研究的时代」;模型评测超人但实用拉胯,根源是泛化能力远逊人类(人类样本效率之谜);superintelligence 不应是 finished mind,而是持续学习系统;情绪 ≈ 价值函数,引导不确定下的探索;5~20 年可能出现「超级智能学习者」
最新状态
零论文、零产品、约几十人;2025-04 融资 $2B(估值 $32B);2026-07-27 多家报道 Nvidia 注资 $50 亿,并从 Google TPU 转向 Nvidia Vera Rubin 平台——报道暗示其内部达到了某个里程碑(金额与估值口径不一,均按传闻处理)。策略从「一步到位」松动为渐进部署、考虑做产品
一句评
他是唯一把持续学习当作「AGI 的定义本身」来赌的人:别人在给现有范式打补丁,他赌的是需要一座新山。方差最大——可能什么都不发直到发出改变一切的东西,也可能长期沉默

访谈要点整理 · Nvidia 注资报道(传闻)

牌桌上还有谁

Richard Sutton & David Silver(《Welcome to the Era of Experience》,2025-04)给整个方向写了纲领:人类数据红利见顶,下一波能力来自 Agent 自己的经验流。OpenAI 已把「dreaming」离线记忆巩固推到消费级(2026-05/06 ChatGPT 记忆大改版),又刚拿下翁荔坐镇 RSI。Google 手握 Titans/ATLAS/HOPE「嵌套学习」架构与 ReasoningBank 策略记忆,弹药最厚。Anthropic 走 Memory + Agent Skills 的「可审计程序性记忆」路线,对改权重最谨慎。Karpathy 则以「失忆的同事」比喻为需求侧代言:这是 Agent 十年而非 Agent 之年的原因。中国侧,陈锴杰的 MindLab(本报告案例)与记忆张量(MemOS)是产品与中间件层的活跃玩家。

05 · 路线图

五条技术路线:各自的赌注与进度

按「动不动权重、动哪一层」划分,当前所有工作可以放进五个箱子。成熟度用三格表示:一格 = 原型期,两格 = 突破期,三格 = 产品化。

路线 A · 外挂记忆(不改权重)
产品化

赌注:把「记住」外包给数据库/文件/知识图谱,检索后注入上下文——不碰权重,安全、可审计、立刻能卖。

代表:MemGPT→Letta(OS 式记忆分页 + sleep-time compute 睡眠预巩固)、Mem0(事实抽取流水线,自报 LoCoMo 92.5)、Zep/Graphiti(时序知识图谱)、MemOS(把记忆当一等系统资源,MemCube 统一文本/KV/参数三态)、Stanford ACE(只演化「攻略本」上下文,AppWorld +10.6%)、ChatGPT/Claude/Gemini 原生记忆。

天花板:记住 ≠ 学会——检索出来的经验不改变模型的「直觉」,上下文越塞越贵,且 benchmark 内卷严重(Mem0 与 Zep 曾公开互撕测法)。

路线 B · 参数化学习(改权重)
突破期

赌注:真正把新知识写进权重。2025 下半年三个零件凑齐,让这条路第一次「工程上可行」。

三零件:LoRA Without Regret——小数据下 LoRA=全参,便宜到可以每人一份;② Sparse Memory Finetuning(Meta)——只更新 TF-IDF 选中的记忆槽,遗忘比全参微调少 89%,解决「往哪写」;③ On-Policy Distillation——用旧我当老师防遗忘,解决「怎么不忘」。

其他弹药:MIT SEAL(模型自己生成训练数据与超参,RL 优化「怎么自我编辑」)、TTT 系列(推理即训练,把上下文压进权重)、model merging 谱系。短板:安全审计难、个性化权重的隐私与回滚、规模化服务百万个 adapter 的 infra 才刚起步(Macaron MinT、Tinker 是先行者)。

路线 C · 原生记忆架构(改模型本身)
突破期

赌注:Transformer 天生没有长期记忆器官,那就造一个新器官,让「边推理边记忆」成为架构内建行为。

两大流派:测试时学习的神经记忆——Google Titans(按「惊讶度」在线更新的记忆 MLP)→ ATLAS(10M 上下文)→ Nested Learning + HOPE(NeurIPS 2025:模型 = 多时间尺度嵌套优化,官方定位「直攻灾难性遗忘」);同族的还有线性注意力「固定状态即记忆」(Mamba、Kimi KDA——K3 已把它带上 2.8T 旗舰)。② 查表式条件记忆——DeepSeek Engram(O(1) 哈希查表,记忆表可放主机内存)、Meta Memory Layers(加参数不加算力)。

信号:这是 2026 年「从论文走向旗舰模型」速度最快的一条线;下一代旗舰(V4 系、Gemini 4、K3 后继)谁先原生集成完整记忆器官,谁就定义标准。

路线 D · 经验流 RL(改数据来源)
基建期

赌注:Sutton/Silver 的宣言——别再喂人类写好的数据,让 Agent 在环境里用自己的经验学(grounded rewards + 终身经验流)。持续学习的「学什么、跟谁学」由这条线供给。

代表:RLVR(可验证奖励,R1 引爆)、Prime Intellect Environments Hub(RL 环境的 GitHub)、Meta ARE+GAIA2、OpenEnv 统一接口;不改权重的「经验积累」变体——Voyager 技能库、Reflexion 自我反思、Google ReasoningBank(从成败轨迹蒸馏策略记忆,+34.2%)、Anthropic Skills(技能=可沉淀的程序性记忆)。Macaron 的 RSI、翁荔的 harness 工程都骑在这条线上。

瓶颈:高质量环境与可验证奖励稀缺——这恰是普通开发者最能插手的地方(见「你的接口」)。

路线 E · 评测与度量(裁判换代)
换代中

评测正从「记住了吗」(LoCoMo、LongMemEval)转向「随经验变强了吗」:LongMemEval-V2(2026-05,「有经验的同事」导向)、AgentCL(2026-06,首个 Agent 持续学习严格框架,直接度量遗忘与迁移)、MemOps(2026-07,记忆增改删过期全生命周期)、Mem2ActBench(记忆→行动)。宏观标尺是 METR 时程曲线:模型能完成的人类耗时任务长度,2024 年以来约每 89 天翻倍——任务越长,「中途学习」越不可回避。学界同步机构化:ICLR 与 COLM 2026 双双设立 Lifelong Agents workshop。

路线综述来源:LLM 持续学习综述(ACM CS) · Jessy Lin · The Continual Learning Problem · Google Nested Learning · Era of Experience · METR Time Horizon 1.1

06 · 时间线

四十年问题史:从「灾难性遗忘」到「做梦的模型」

蓝点为本报告叙事中的关键节点。四个时代的划分是本报告的解读框架,不是学界正式分期。

Ⅰ · 传统时代(1980s–2016):问题被发现,答案是补丁
1980s
Grossberg 提出稳定性-可塑性两难(ART 理论)——领域元问题定名。
1989
McCloskey & Cohen 定量揭示灾难性遗忘:顺序学习会覆盖共享权重中的旧知识。
1995
McClelland 等提出互补学习系统(CLS)理论:海马体快学 + 新皮层慢学 + 睡眠巩固——三十年后成为全行业蓝图。
2016
DeepMind Progressive Networks:每个新任务加一列网络、冻结旧列——参数隔离路线鼻祖(MoL 的精神祖先)。
2017
DeepMind EWC:用 Fisher 信息给重要权重上「弹性锚」——正则化路线代表作。同年 Transformer 问世。
Ⅱ · 预训练时代(2020–2023):用规模绕过学习
2020
GPT-3 展示 in-context learning:不改权重也能「现学现卖」——第 1 层学习被意外解锁。
2022-11
ChatGPT 发布。此后三年,行业主旋律是「更大的预训练 + 更强的后训练」,持续学习被规模红利掩盖。
2023-03/05
Reflexion(失败后自我反思写入记忆)与 Voyager(Minecraft 终身技能库):不改权重的「经验积累」原型。
2023-10
MemGPT 把操作系统虚拟内存思想搬进 LLM——外挂记忆路线开山,后成 Letta。
Ⅲ · 记忆觉醒(2024–2025):零件逐个就位
2024-02
ChatGPT Memory v1 上线;LoCoMo 基准发布——消费级记忆与其标尺同年出现。
2024-07
TTT layers:把 RNN 隐状态做成「推理时持续训练的小模型」——「学习即推理」流派成形。
2024-12
Meta Memory Layers at Scale:可训练稀疏查表层,加参数不加算力。
2025-01
Google Titans:按「惊讶度」测试时在线更新的神经长期记忆;Zep 时序知识图谱同月发布。
2025-04
Sutton & Silver 《Era of Experience》纲领发布;ChatGPT 可引用全部历史对话;Letta sleep-time compute(睡眠巩固工程化);Mem0 论文。
2025-06
MIT SEAL:模型自己生成训练数据与超参更新自己——「自我编辑」进入权重层。
2025-08
Macaron 产品上线(个人 Agent + Deep Memory);Prime Intellect Environments Hub(RL 环境的 GitHub)。
2025-09/10
六周内零件凑齐:LoRA Without Regret + Meta Sparse Memory Finetuning + On-Policy Distillation + Tinker + Stanford ACE + DeepSeek-OCR(光学压缩)+ Kimi Linear(KDA)+ Claude Skills + Karpathy「失忆同事」访谈。
2025-11
Ilya 访谈:「回到研究的时代」,superintelligence = 持续学习系统;Google Nested Learning + HOPE(NeurIPS 2025)。
2025-12
MindLab 在 Kimi K2(1T)上跑通 LoRA-RL(参数 <0.5%、GPU 省 90%),并入 NVIDIA Megatron-Bridge;Tinker GA。
Ⅳ · 巩固时代(2026–):从论文走进旗舰与产品
2026-01
DeepSeek Engram(梁文锋署名):条件记忆 = 第三稀疏轴;智谱港股 IPO;METR 时程 1.1(翻倍周期缩至约 89 天)。
2026-02/04
GLM-5 发布(华为昇腾全程训练);DeepSeek V4 预览;「LLM 睡眠巩固」论文潮开始(SCM、Sleep-like Consolidation 等)。
2026-05/06
ChatGPT「dreaming」大改版:空闲时自动跨对话巩固记忆——CLS 的「睡眠」正式进入十亿级消费产品;GLM-5.2 发布(MIT、1M 上下文);AgentCL、LongMemEval-V2 评测换代;DeepSeek 首次外部融资 510 亿元;Macaron A 轮(美团领投)。
2026-07
密度惊人的一个月:DeepSeek V4 正式发布 · Kimi K3(2.8T,KDA 上旗舰)· TML Inkling · Macaron-V1(GLM-5.2 + MoL)· 梁文锋「下一阶梯是持续学习」表态流出 · 翁荔转会 OpenAI 执掌 RSI 团队 · Nvidia 传闻 $50 亿注资 SSI · 陈勇超创立超衍智能 · MemOps 基准发布。

时间线各节点来源见文末「来源与延伸阅读」;2026-07 条目中 SSI 注资为多家媒体报道的传闻口径。

07 · 展望

行业 SOTA 会长什么样?谁最先摸到?

把五条路线叠起来,12~24 个月内「持续学习 SOTA 系统」的合理形态已经能画出轮廓——它不是某一篇论文,而是一个五层栈。

SOTA 蓝图:一个会睡觉的模型栈(自上而下 = 由快到慢)

① 交互层 · 秒级1M+ 上下文内学习;harness 携带任务状态(HCP 一类协议标准化「记忆随任务流动」)
② 记忆层 · 天级可审计的外挂记忆(事实图谱 + 情景流 + 技能库三态);写入即生效,可删除、可解释——隐私与合规的主承载层
③ 巩固层 · 周级「睡眠」调度:离线重放高价值经验,on-policy 蒸馏防遗忘,把热记忆蒸进 adapter、冷知识退役回记忆库(MemOS 三态流转 × ChatGPT dreaming 的权重级版本)
④ 个体层 · 月级每人/每组织一份 LoRA 级适配器(<0.5% 参数),百万级 adapter 目录的训练-路由-回滚 infra(MinT、Tinker 的成熟形态);行为经验通过 RLVR/经验流持续更新
⑤ 基座层 · 年级原生记忆器官:Engram 式查表记忆 + KDA/Titans 式测试时神经记忆 + HOPE 式多时间尺度更新,底座本身按更慢节奏滚动重训

判别一个系统是否接近 SOTA 的三问:新经验多快改变行为(可塑性)?旧能力掉了多少(稳定性)?整个过程可审计可回滚吗(安全)?——AgentCL 一类评测正是在把这三问标准化。

突破概率盘口(本报告的主观判断,依据见各卡)

「突破」按三个层次分别下注:产品级(记忆+巩固进入亿级产品)已经发生;下表赌的是权重级(规模化的个体持续学习成为默认)与原理级(learn-on-the-job 的泛化新原理)。五格 = 概率感,非精确数字。

OpenAI权重级最热门

配方(翁荔 RSI 团队 + on-policy 蒸馏方法论)× 最大数据飞轮 × 已跑通的 dreaming 记忆管线。最可能第一个把「你的 ChatGPT 权重和别人不一样」变成默认。风险:安全审查让权重级个性化放缓。

DeepSeek架构级 + 开源普及

Engram 已给出「记忆器官」的可扩展设计,梁文锋公开把持续学习定为下一阶梯;成本执念意味着一旦做成必开源普及,重演 R1 时刻。风险:算力与多模态短板拖累落地节奏。

Google DeepMind架构正统,集成偏慢

Titans→ATLAS→HOPE 是最完整的原生记忆架构谱系,加上 ReasoningBank 与 Era of Experience 的思想领导力;最可能发表「大家都抄」的那篇架构论文。风险:研究到 Gemini 主线的转化周期历来偏长。

SSI(Ilya)原理级最大方差

唯一全押「新原理」的玩家;Nvidia 传闻 $50 亿与「内部里程碑」暗示有货。但零可见性意味着无法定价:可能直接改写游戏,也可能长期无输出。期望值高,置信区间极宽。

AnthropicHarness 层领跑,权重层克制

Skills/Memory 把「可审计的能力积累」做成了事实标准,Agent 场景占有率高;对改权重的个性化最谨慎——大概率是最后一个做、但做得最稳的。

产品派新势力(MindLab、Letta、TML、超衍…)单点first最可能

Macaron 若在年内把「一人一模型」推到几十万用户,将是权重级个性化第一个规模化实证(哪怕不是最强)。小公司拿不下原理级,但「第一个做成某件事」的历史常由他们书写。

综合判断:产品级已发生;权重级 12~18 个月内见分晓,OpenAI 与 DeepSeek 并列领先、路径互补(闭源飞轮 vs 开源架构);原理级无法预测,SSI 是唯一的纯赌注。另一个常被低估的变量:中国团队(DeepSeek、MindLab、智谱、月之暗面)在「便宜的后训练 + 开源底座」上形成的组合优势,恰好是持续学习最需要的两种基础设施。

08 · 行动指南

你可以在哪里「提供接口」?

这个赛道当前最稀缺的不是又一个模型,而是环境、评测、记忆中间件、领域适配器、带反馈的真实数据——五样东西全部对个人开发者开放。按投入门槛从低到高排列:

① 写 RL 环境与可验证奖励 门槛:低 · 杠杆:极高

Sutton 的「经验时代」卡在环境荒:模型想从经验学习,但高质量、带可验证奖励的环境极度稀缺。你在任何领域的专业知识(报税、外贸单证、医疗编码、游戏、爬虫对抗……)都能变成一个环境。

第一步:verifiers/prime-rl 写一个环境上传 Prime Intellect Environments Hub,或按 OpenEnv 接口封装;训练侧任何人都能拿去跑 RLVR。

② 出长程评测题 门槛:低 · 杠杆:高

评测正在换代(「记住了吗」→「变强了吗」),而长周期真实用例只能来自真实用户。一份「30 天真实使用日志 + 每周该记住什么」的公开评测集,今天就是稀缺品(Macaron 自建 LivingBench 干的就是这件事,但行业需要中立版)。

第一步:研究 LongMemEval-V2AgentCL 的任务格式,贡献你所在领域的任务流;或向 ICLR/COLM 的 Lifelong Agents workshop 投基准论文。

③ 做记忆中间件 / MCP 接口 门槛:中 · 杠杆:高

记忆层正在标准化前夜:Letta 的 Agent File、MemOS 的 MemCube、Mem0/Graphiti 各有格式,互不相通——「记忆的互操作」是明显的空位。把领域数据源封装成 MCP server,就是给所有 Agent 提供「可被记住的接口」。

第一步:Letta/MemOS/Mem0 提 PR;或写一个 MCP server,把你手里的数据(笔记、CRM、传感器…)暴露成带时间戳的记忆流,再做一个「Agent File ↔ MemCube」转换器练手。

④ 训练并发布领域 LoRA 专家 门槛:中 · 杠杆:中高

MoL 的世界观是「专家可组合」:不同人训的 LoRA 可以挂在同一个冻结底座上协作(Collective Intelligence)。领域专家(法律、医疗、小语种、垂直工具链)训练的适配器,就是这个生态的「插件」。

第一步:Tinker 或 Macaron MinT/HCP 生态上训一个领域 specialist;开源侧用 GLM-5.2(MIT)+ slime 是当前国内个人可及的全栈组合(参考社区 OpenClaw-RL 项目)。

⑤ 在自己的产品里埋「可验证反馈」接口 门槛:视产品 · 杠杆:长期最高

所有实验室最终都缺同一样东西:带结果标签的纵向真实使用数据(这个建议被采纳了吗?这个 app 被用了几次?这个记忆三个月后还对吗?)。如果你有自己的产品或工作流,把「结果可验证」设计进交互(明确的接受/拒绝、可度量的完成信号),你就拥有了持续学习时代最稀缺的资产——它既能喂你自己的 adapter,也是与任何实验室合作的筹码。

第一步:把产品里的每个 AI 触点改造成「建议 → 用户行动 → 可观测结果」三元组并留档;哪怕只是个人工作流,坚持记录三个月,你就有了一份别人买不到的 LivingBench。

09 · FAQ

十二个高频疑问

持续学习和 RAG / 长上下文是一回事吗?

不是,但是亲戚。RAG 和长上下文都属于「第 2 层:外挂记忆」——信息在模型外面,每次用都要检索、注入、重新读一遍,模型本体没有任何变化,就像开卷考试永远要翻书。持续学习的目标是第 3 层:把反复出现的规律内化进权重,像你学会母语后再也不用查语法书。成熟系统会三层并用:新经验先进上下文,常用的沉淀进记忆库,规律性的蒸进权重。

那为什么不天天微调?技术上又不是做不到。

四个拦路虎:① 灾难性遗忘——学新忘旧(见上文 85%→45% 的实验);② 成本——全参微调千亿模型一次数十万美元级;③ 对齐回退——微调会不可预测地破坏安全训练,每次都要重新全面评测;④ 不可回滚——权重里的知识没法「精确删除」,用户说「忘了这件事」怎么办?2025 下半年的突破(LoRA 经济学 + 稀疏记忆槽 + on-policy 蒸馏)正是在逐个拆这四个雷,所以行业才突然热起来。

ChatGPT / Claude 已经有「记忆」了,这不就是持续学习吗?

是持续学习的前半段。它们的记忆是外挂库 + 上下文注入(第 2 层),模型权重纹丝不动——所以换个没有你记忆库的实例,它对你一无所知。真正的分水岭是 2026-05 ChatGPT 的「dreaming」:系统开始在空闲时主动巩固记忆(虽然目前仍巩固到记忆库而非权重)。当某天你的助手把「你的偏好」内化到连记忆库被清空都还「有感觉」,那才是完整的持续学习。

灾难性遗忘为什么这么难解决?人脑怎么就没这问题?

因为神经网络的知识是分布式的:没有哪个权重「专管」某条知识,每条知识摊在几百万个共享权重上,学新任务的梯度必然踩到旧知识的地盘。人脑的解法是「分区 + 分速 + 睡眠」:海马体快速记录不干扰皮层;睡眠时选择性重放,把重要的慢慢转写进皮层;突触巩固保护重要连接(EWC 的灵感来源)。2026 年的技术栈——记忆库(海马体)+ 稀疏记忆槽(分区)+ 蒸馏巩固(睡眠)——就是在照着抄这份作业。

为什么说 2025 下半年到 2026 年是转折点?

五件事在六个月里同时凑齐:① LoRA Without Regret 证明个性化便宜到可行;② Sparse Memory Finetuning 解决「往哪写不踩旧知识」;③ On-Policy Distillation 给出防遗忘配方;④ 原生记忆架构(Titans/HOPE/Engram/KDA)从论文走向旗舰;⑤ 评测换代(AgentCL 等)让进展可度量。再加上需求侧:Agent 任务越做越长(METR 时程每 ~89 天翻倍),「中途不学习」的成本指数上升。技术供给和需求压力第一次同时到位。

「一人一个模型」现实吗?成本扛得住吗?

三年前不现实,现在是工程问题。关键数字:LoRA 只需动 <0.5% 的参数就能保留 >90% 的全参微调效果(MindLab 在 1T 的 Kimi K2 上验证,GPU 用量约 10%);一个 1B 的适配器存储只要 2GB;推理时冻结底座共享、适配器按需热插拔。Macaron 已宣布从 2026 Q2 起为数十万用户做定制模型。真正的瓶颈在 infra(百万 adapter 的训练调度、路由、版本回滚)和信任(见下条),不在算力。

个人数据进了权重,隐私怎么办?欧盟的「被遗忘权」怎么落实?

这是权重级持续学习最硬的非技术难题:权重里的知识没有删除键(机器遗忘 machine unlearning 至今没有严格可验证的通用方案)。当前的务实架构是分层承压:敏感个人信息只进第 2 层(记忆库,可查、可删、可导出),权重级只蒸馏「去身份化的偏好与技能模式」,且 per-user adapter 天然支持「一键销毁你的那份权重」——这也是 MoL/Tinker 式「一人一适配器」相对「大模型直接记住所有人」的合规优势。监管尚未跟上,这一块规则真空。

持续学习和 AGI 到底什么关系?

三位重量级人物给了三个角度:Ilya 认为人类「样本效率 + 在岗学习」正是现有范式缺失的科学原理,补上它 = 通往超级智能;梁文锋把它列为 CoT、Agent 之后的「下一阶梯」,通向 AI 自迭代;Karpathy 用「失忆的同事」解释为什么 Agent 还要十年。共识内核:不会持续学习的系统,能力天花板锁死在训练截止日——它可以很博学,但永远不会「越用越懂你、越干越熟练」,而后者才是通用智能的标志。

传统持续学习研究(EWC、replay 那些)现在还有用吗?

思想全部活着,只是换了衣服。EWC 的「保护重要权重」→ sparse memory finetuning 的「只写不重要的槽」;replay 重放 → 训练时回混旧数据、睡眠巩固时重放高价值轨迹;Progressive Networks 的「新任务新模块」→ per-task/per-user LoRA(MoL 就是它的直系后代);CLS 双系统理论更是升格为全行业蓝图。读 2017 年前的持续学习文献,依然是理解 2026 年方案的最快捷径。

「睡眠」「做梦」这些说法是认真的还是营销?

是认真的技术隐喻,且有严格对应:生物睡眠做的事——选择性重放白天经验、把海马体内容转写进皮层、修剪无用连接——恰好是「离线巩固」算法要做的事。工程谱系清晰可查:CLS 理论(1995)→ Letta sleep-time compute(2025-04,同等准确率省 5 倍推理算力)→ ChatGPT dreaming(2026-05,空闲时自动巩固)→ 2026 上半年「LLM 需要睡眠」论文潮(SCM、Language Models Need Sleep 等)。当然,产品文案里的「做梦」比论文里的浪漫得多。

我今天就想用上,有什么现成的?

按投入排序:零代码——把 ChatGPT/Claude 的记忆功能真正用起来(主动告诉它偏好、定期让它总结「你学到了关于我的什么」);低代码——给自己的 Agent 挂 Mem0/Letta/MemOS 做外挂记忆,用 Claude Skills 沉淀工作流;动手训——Tinker(托管)或 GLM-5.2 + slime(自托管,MIT)做领域 LoRA;产品级——参考 Macaron 的 MoL 架构:冻结底座 + 场景化适配器 + 记忆系统三件套。

怎么分辨一个「记忆/持续学习产品」是真东西还是营销?

五个探针:① 问它测什么榜——只报 LoCoMo 高分要警惕(测法争议大),敢报 LongMemEval-V2/AgentCL/自建长周期评测的更可信;② 问「学到的东西改变行为了吗」——能否举出「上周纠正过的错误这周不再犯」的例子;③ 问遗忘曲线——学新东西后旧能力掉多少,有没有数;④ 问删除——用户能否查看、修改、彻底删除某条记忆;⑤ 问闭环——记忆是只进不出的仓库,还是有巩固/过期/冲突消解的生命周期(MemOps 基准测的就是这个)。五问全答得上的产品,2026 年也屈指可数。

10 · 附录

术语速查 & 来源

术语速查

持续学习 (Continual Learning) · 系统在部署后不断吸收新知识/技能而不丧失旧能力的性质;别名终身学习 (lifelong learning)。
灾难性遗忘 · 顺序学习新任务导致旧任务性能骤降;源于分布式表示共享权重(McCloskey & Cohen, 1989)。
稳定性-可塑性两难 · 太稳定学不进、太可塑忘得快的根本张力(Grossberg)。
CLS 互补学习系统 · 海马体快学 + 新皮层慢学 + 睡眠巩固的脑科学理论(1995),当代方案总蓝图。
LoRA · 低秩适配器:冻结底座,只训小矩阵;持续个性化的经济学基础。
MoL (Mixture-of-LoRA) · Macaron-V1 结构:冻结底座 + 多个 LoRA 专家 + 路由,「参数隔离」防遗忘。
GRPO · 组相对策略优化:R1 后成为主流的 RL 后训练算法,免 critic 模型。
RLVR · 可验证奖励强化学习:用单测/答案核验等自动信号替代人工奖励模型。
On-Policy Distillation · 学生自己采样、教师逐 token 纠偏;「学新不忘旧」的关键配方。
Sparse Memory Finetuning · 只更新被当前输入高度激活的记忆槽,把新知识写进「专属参数」减少干扰(Meta)。
TTT (Test-Time Training) · 推理时对隐状态/权重做梯度更新,「学习即推理」。
Titans / HOPE / Nested Learning · Google 的原生记忆架构谱系:测试时更新的神经记忆 + 多时间尺度嵌套优化。
Engram · DeepSeek 的条件记忆:哈希 N-gram O(1) 查表,MoE 之外的第三稀疏轴。
KDA (Kimi Delta Attention) · 细粒度遗忘门的线性注意力;固定状态本身就是压缩记忆;K3 以 3:1 混合上旗舰。
DSA (DeepSeek Sparse Attention) · 稀疏注意力,GLM-5 系继承并加 IndexShare;长上下文降本关键。
Sleep-time Compute / Dreaming · 空闲时离线重组记忆、预巩固经验;CLS「睡眠」的工程化(Letta 首创,ChatGPT 普及)。
RSI (递归自我改进) · 模型参与改进自己下一版的循环(出题→做题→更新);Macaron 三段循环、翁荔 OpenAI 新团队的主题。
HCP (Harness Context Protocol) · MindLab 提出的任务元数据/记忆状态/路由指令标准化协议。
MCP (Model Context Protocol) · Agent 连接外部工具与数据的开放协议;记忆中间件的通用接口层。
Machine Unlearning · 从权重中「删除」特定知识的研究方向;尚无严格通用解,隐私合规的技术缺口。