从 Macaron v1(GLM-5.2 底座 + LoRA 专家)这个具体案例出发,拆解「换成 Kimi K3 值不值」;再拉远镜头,看梁文锋、翁荔、陈勇超、Ilya Sutskever 各自押注的路线、四十年的问题史、可能的行业 SOTA 形态,以及你——一个开发者——可以插进这场变革的接口。
数据截至 2026 年 7 月 31 日 · 基于公开论文、模型卡与报道 · 传闻均已标注 · 深入浅出,可当科普读,也可当行研用
2026-07-21,MindLab(心洲科技旗下前沿实验室,C 端产品 Macaron 个人 Agent)发布 Macaron-V1——自称「世界上第一个从 GLM-5.2 后训练而来的模型」。它有趣的地方不在分数,而在组织智能的方式:不动底座,只训「可插拔的专家」,这正是持续学习的一种产品化答案。
把 744B 的 GLM-5.2 底座完全冻结(相当于不再动的大脑皮层),在其上挂 4 个各约 1B 参数的 LoRA「专家帽子」,总参 748B。路由专家 L0 决定每个请求「戴哪顶帽子」,之后的推理与工具调用都留在该专家内。
「学新东西不动旧大脑」——新领域只需训练并注册一个新 LoRA,天然回避了灾难性遗忘;不同团队、不同用户的专家还能组合(官方称之为 Collective Intelligence)。这是参数隔离路线(2016 年 Progressive Networks 思想)的 2026 工业版。
RL 算法用 GRPO,单次训练上下文达 210 万 token;更关键的是三段式 RSI 循环——模型参与生产自己的下一版:
支撑它的自研基建:MindForge(把生产环境的工具、记忆布局直接接进训练)、LongStraw(把百万级 token 的 RL 从「全序列内存问题」改写为「状态生命周期问题」)、MinT(后训练平台,支撑百万级 adapter 目录)、HCP(Harness Context Protocol,标准化任务元数据 / 记忆状态 / 路由指令)。
战绩:12 项评测全面超过原始 GLM-5.2,其中 7 项同时超过 GPT-5.5 与 Claude Opus 4.8(如 TerminalBench 2.1 87.6、自研 UI4A-Bench 87.8);但 SWE Atlas QnA 仅 +0.6——LoRA 擅长改变「怎么用已有能力」,难以补足底座缺的知识。这个短板正是「换底座」问题的由来。
Macaron 产品 2025-08-15 上线,定位「世界首个个人 AI Agent」:即时生成 mini-app + Deep Memory 长期记忆,2026-06 用户约 200 万,2026-07 开启商业化约两周 ARR 破 1000 万美元(公司口径)。创始人陈锴杰(Duke 辍学、连续创业者),首席科学家马骁腾(清华 RL 方向)。融资:真格天使 → 2026-01 蚂蚁领投超 2000 万美元 Pre-A → 2026-06 美团领投近 5000 万美元 A 轮。底座演进:70B → 671B 级(All-Sync RL)→ 2025-12 在 Kimi K2(1T)上跑通 LoRA-RL(<0.5% 参数保留 >90% 全参性能、GPU 省 90%,成果并入 NVIDIA Megatron-Bridge 与 verl)→ GLM-5.1(V1-Preview)→ GLM-5.2(V1)。注意:他们的训练栈从设计上就是底座无关的——这对下一节的问题很重要。
来源:Introducing Macaron-V1 · HF 模型卡(Venti) · V1-Preview · 万亿参数 LoRA-RL(GlobeNewswire) · 融资报道(投中网)
Kimi K3(2026-07-16 发布,07-27 开放权重)是月之暗面的换代旗舰:2.8T 总参 / 104B 激活,69 层 KDA 线性注意力 + 24 层 Gated MLA 的 3:1 混合架构,原生多模态,1M 上下文。先看数据,再下判断。
注:两模型同 harness 独立复测 Terminal-Bench 2.1 打平(80.9 vs 81.0);τ²-bench 上 GLM-5.2 以 99.1% 居全榜第一(K3 未上榜);BrowseComp 长程检索 K3 以 91.2 领先全场,GLM 无官方数字。各基准量纲不同,不可跨行比较。
| 维度 | Kimi K3 | GLM-5.2 |
|---|---|---|
| 规模 / 激活 | 2.8T / 104B(896 选 16 专家) | 753B / 40B(推理成本约为 K3 的 1/2.6) |
| 注意力架构 | KDA 线性 + MLA 混合(3:1),KV cache −75% | DSA 稀疏 + IndexShare(1M 上下文下 FLOPs ÷2.9) |
| 多模态 | 原生图像 / 视频输入(MoonViT-V2) | 纯文本 |
| 上下文 | 1M | 1M |
| License | 自定义「K3 License」:MaaS 年收入 > $2000 万须另签商业协议;大规模产品须展示「Kimi K3」标识 | 标准 MIT,无任何附加条款 |
| API 价格(百万 token) | $3.00 / $15.00 | $1.40 / $4.40(OpenRouter 竞价已至 ~$0.75/$2.37) |
| AA 单任务成本 | $0.94(token 更省但单价高) | $0.47(更啰嗦但单价低) |
| 自托管门槛 | 1.56TB 权重,≈8×B200 起、多节点 | FP8 单节点 8×H200 可跑 |
| RL 后训练生态 | SGLang+Miles day-0 LoRA-RL(demo 级,64×GB300);社区主要在等蒸馏/量化 | 官方开源 slime 框架全系验证;Unsloth / Ollama / KTransformers / 昇腾适配;社区已有 OpenClaw-RL 等个人 agent RL 项目 |
| 推理档位 | 发布初期仅 max reasoning 一档 | High / Max 两档(High 档省 2~2.5× token) |
来源:K3 模型卡 · GLM-5.2 模型卡 · Artificial Analysis 对比 · LMSYS K3 day-0 博客 · Simon Willison 论 K3 license · slime
⛔全量替换:当下不建议
✔推荐:混合策略
一句话:「换 K3」买到的是天花板,付出的是毛利、开源身位与三个月基建重做;对一家护城河在「后训练工厂 + 记忆系统」而非底座本身的公司,期权价值大于行权价值。真正值得立刻做的是把多模态短板补上——要么等 GLM 系多模态版本,要么用 K3 API 混合路由。
今天最强的大模型,像一个考完最后一场试就再也不学习的天才:预训练 + 后训练结束的那一刻,它的权重被冻结,此后无论陪你工作多少年,它本体一个字都没记住、一点都没变强。Karpathy 的比喻很扎心:现在的 Agent 像「患了失忆症的同事」。
经典范式是「收集数据 → 训练 → 冻结 → 部署」。世界变了怎么办?回炉重训。这在小模型时代只是麻烦,在千亿模型时代是灾难:一次全量重训要烧掉数月与数千万美元,而且新数据一进来,老能力还可能被冲掉。
这个「冲掉」有个正式名字——灾难性遗忘(catastrophic forgetting),1989 年 McCloskey 与 Cohen 就在论文里量化了它:神经网络的知识分布在共享权重里,学新任务的梯度会直接改写旧任务赖以生存的那些权重。这不是 bug,是分布式表示的天性。
由此引出整个领域的元问题——稳定性-可塑性两难(stability–plasticity dilemma,Grossberg):太稳定学不进新的,太可塑忘光旧的。人脑是已知唯一优雅解开这个死结的系统。
Thinking Machines 2025-10 的实验:把 Qwen3-8B 在公司内部文档上微调,新知识是学进去了,但指令跟随能力当场崩掉;再用「过去的自己」当老师做 on-policy 蒸馏,能力几乎全部找回,新知识还保住了。
来源:Thinking Machines · On-Policy Distillation(数值为该文实验读数)
神经科学的互补学习系统理论(CLS,McClelland 等,1995)认为人脑用两套系统绕开了两难:海马体当「白板便签」,快速记下今天发生的具体事;新皮层当「结构化笔记本」,慢速沉淀统计规律;睡眠负责把便签誊写进笔记本。你会看到,2024-2026 年几乎所有持续学习方案,都是这张图的工程化。
| 层 | 发生在哪 | 时间尺度 | 像人类的什么 | 今天的成熟度 |
|---|---|---|---|---|
| 第 1 层 · 上下文内学习 | 推理时的注意力,不留任何痕迹 | 秒~小时 | 工作记忆(打电话时记住的号码) | ✔已解决 GPT-3 时代的礼物 |
| 第 2 层 · 外挂记忆 | 模型外的数据库 / 文件 / 知识图谱,检索后注入上下文 | 天~年 | 日记、备忘录、相册 | ◆产品化内卷中 记住 ≠ 学会 |
| 第 3 层 · 权重级学习 | 参数本身被更新(全参 / LoRA / 记忆槽) | 周~终身 | 技能内化:学会骑车后再也不用「想」 | ▲攻坚前沿 2025 下半年起关键零件才凑齐 |
行业黑话对照:第 2 层做得好叫「记忆(memory)」,第 3 层做得好才叫「持续学习(continual learning)」。市面上 90% 的「AI 记忆」产品在第 2 层;这个赛道真正的圣杯在第 3 层——以及让 2、3 层自动流转的「睡眠」机制。
2026 年中,「持续学习」罕见地同时出现在中国开源领军者、硅谷明星实验室、学院派创业者与最神秘的 AGI 押注者的议程上——但他们切入的层完全不同:架构层、后训练层、系统层、范式层。
LoRA Without Regret · On-Policy Distillation · Harness Engineering · 转会报道(TechCrunch)
Richard Sutton & David Silver(《Welcome to the Era of Experience》,2025-04)给整个方向写了纲领:人类数据红利见顶,下一波能力来自 Agent 自己的经验流。OpenAI 已把「dreaming」离线记忆巩固推到消费级(2026-05/06 ChatGPT 记忆大改版),又刚拿下翁荔坐镇 RSI。Google 手握 Titans/ATLAS/HOPE「嵌套学习」架构与 ReasoningBank 策略记忆,弹药最厚。Anthropic 走 Memory + Agent Skills 的「可审计程序性记忆」路线,对改权重最谨慎。Karpathy 则以「失忆的同事」比喻为需求侧代言:这是 Agent 十年而非 Agent 之年的原因。中国侧,陈锴杰的 MindLab(本报告案例)与记忆张量(MemOS)是产品与中间件层的活跃玩家。
按「动不动权重、动哪一层」划分,当前所有工作可以放进五个箱子。成熟度用三格表示:一格 = 原型期,两格 = 突破期,三格 = 产品化。
赌注:把「记住」外包给数据库/文件/知识图谱,检索后注入上下文——不碰权重,安全、可审计、立刻能卖。
代表:MemGPT→Letta(OS 式记忆分页 + sleep-time compute 睡眠预巩固)、Mem0(事实抽取流水线,自报 LoCoMo 92.5)、Zep/Graphiti(时序知识图谱)、MemOS(把记忆当一等系统资源,MemCube 统一文本/KV/参数三态)、Stanford ACE(只演化「攻略本」上下文,AppWorld +10.6%)、ChatGPT/Claude/Gemini 原生记忆。
天花板:记住 ≠ 学会——检索出来的经验不改变模型的「直觉」,上下文越塞越贵,且 benchmark 内卷严重(Mem0 与 Zep 曾公开互撕测法)。
赌注:真正把新知识写进权重。2025 下半年三个零件凑齐,让这条路第一次「工程上可行」。
三零件:① LoRA Without Regret——小数据下 LoRA=全参,便宜到可以每人一份;② Sparse Memory Finetuning(Meta)——只更新 TF-IDF 选中的记忆槽,遗忘比全参微调少 89%,解决「往哪写」;③ On-Policy Distillation——用旧我当老师防遗忘,解决「怎么不忘」。
其他弹药:MIT SEAL(模型自己生成训练数据与超参,RL 优化「怎么自我编辑」)、TTT 系列(推理即训练,把上下文压进权重)、model merging 谱系。短板:安全审计难、个性化权重的隐私与回滚、规模化服务百万个 adapter 的 infra 才刚起步(Macaron MinT、Tinker 是先行者)。
赌注:Transformer 天生没有长期记忆器官,那就造一个新器官,让「边推理边记忆」成为架构内建行为。
两大流派:① 测试时学习的神经记忆——Google Titans(按「惊讶度」在线更新的记忆 MLP)→ ATLAS(10M 上下文)→ Nested Learning + HOPE(NeurIPS 2025:模型 = 多时间尺度嵌套优化,官方定位「直攻灾难性遗忘」);同族的还有线性注意力「固定状态即记忆」(Mamba、Kimi KDA——K3 已把它带上 2.8T 旗舰)。② 查表式条件记忆——DeepSeek Engram(O(1) 哈希查表,记忆表可放主机内存)、Meta Memory Layers(加参数不加算力)。
信号:这是 2026 年「从论文走向旗舰模型」速度最快的一条线;下一代旗舰(V4 系、Gemini 4、K3 后继)谁先原生集成完整记忆器官,谁就定义标准。
赌注:Sutton/Silver 的宣言——别再喂人类写好的数据,让 Agent 在环境里用自己的经验学(grounded rewards + 终身经验流)。持续学习的「学什么、跟谁学」由这条线供给。
代表:RLVR(可验证奖励,R1 引爆)、Prime Intellect Environments Hub(RL 环境的 GitHub)、Meta ARE+GAIA2、OpenEnv 统一接口;不改权重的「经验积累」变体——Voyager 技能库、Reflexion 自我反思、Google ReasoningBank(从成败轨迹蒸馏策略记忆,+34.2%)、Anthropic Skills(技能=可沉淀的程序性记忆)。Macaron 的 RSI、翁荔的 harness 工程都骑在这条线上。
瓶颈:高质量环境与可验证奖励稀缺——这恰是普通开发者最能插手的地方(见「你的接口」)。
评测正从「记住了吗」(LoCoMo、LongMemEval)转向「随经验变强了吗」:LongMemEval-V2(2026-05,「有经验的同事」导向)、AgentCL(2026-06,首个 Agent 持续学习严格框架,直接度量遗忘与迁移)、MemOps(2026-07,记忆增改删过期全生命周期)、Mem2ActBench(记忆→行动)。宏观标尺是 METR 时程曲线:模型能完成的人类耗时任务长度,2024 年以来约每 89 天翻倍——任务越长,「中途学习」越不可回避。学界同步机构化:ICLR 与 COLM 2026 双双设立 Lifelong Agents workshop。
路线综述来源:LLM 持续学习综述(ACM CS) · Jessy Lin · The Continual Learning Problem · Google Nested Learning · Era of Experience · METR Time Horizon 1.1
蓝点为本报告叙事中的关键节点。四个时代的划分是本报告的解读框架,不是学界正式分期。
时间线各节点来源见文末「来源与延伸阅读」;2026-07 条目中 SSI 注资为多家媒体报道的传闻口径。
把五条路线叠起来,12~24 个月内「持续学习 SOTA 系统」的合理形态已经能画出轮廓——它不是某一篇论文,而是一个五层栈。
判别一个系统是否接近 SOTA 的三问:新经验多快改变行为(可塑性)?旧能力掉了多少(稳定性)?整个过程可审计可回滚吗(安全)?——AgentCL 一类评测正是在把这三问标准化。
「突破」按三个层次分别下注:产品级(记忆+巩固进入亿级产品)已经发生;下表赌的是权重级(规模化的个体持续学习成为默认)与原理级(learn-on-the-job 的泛化新原理)。五格 = 概率感,非精确数字。
配方(翁荔 RSI 团队 + on-policy 蒸馏方法论)× 最大数据飞轮 × 已跑通的 dreaming 记忆管线。最可能第一个把「你的 ChatGPT 权重和别人不一样」变成默认。风险:安全审查让权重级个性化放缓。
Engram 已给出「记忆器官」的可扩展设计,梁文锋公开把持续学习定为下一阶梯;成本执念意味着一旦做成必开源普及,重演 R1 时刻。风险:算力与多模态短板拖累落地节奏。
Titans→ATLAS→HOPE 是最完整的原生记忆架构谱系,加上 ReasoningBank 与 Era of Experience 的思想领导力;最可能发表「大家都抄」的那篇架构论文。风险:研究到 Gemini 主线的转化周期历来偏长。
唯一全押「新原理」的玩家;Nvidia 传闻 $50 亿与「内部里程碑」暗示有货。但零可见性意味着无法定价:可能直接改写游戏,也可能长期无输出。期望值高,置信区间极宽。
Skills/Memory 把「可审计的能力积累」做成了事实标准,Agent 场景占有率高;对改权重的个性化最谨慎——大概率是最后一个做、但做得最稳的。
Macaron 若在年内把「一人一模型」推到几十万用户,将是权重级个性化第一个规模化实证(哪怕不是最强)。小公司拿不下原理级,但「第一个做成某件事」的历史常由他们书写。
综合判断:产品级已发生;权重级 12~18 个月内见分晓,OpenAI 与 DeepSeek 并列领先、路径互补(闭源飞轮 vs 开源架构);原理级无法预测,SSI 是唯一的纯赌注。另一个常被低估的变量:中国团队(DeepSeek、MindLab、智谱、月之暗面)在「便宜的后训练 + 开源底座」上形成的组合优势,恰好是持续学习最需要的两种基础设施。
这个赛道当前最稀缺的不是又一个模型,而是环境、评测、记忆中间件、领域适配器、带反馈的真实数据——五样东西全部对个人开发者开放。按投入门槛从低到高排列:
Sutton 的「经验时代」卡在环境荒:模型想从经验学习,但高质量、带可验证奖励的环境极度稀缺。你在任何领域的专业知识(报税、外贸单证、医疗编码、游戏、爬虫对抗……)都能变成一个环境。
第一步:用 verifiers/prime-rl 写一个环境上传 Prime Intellect Environments Hub,或按 OpenEnv 接口封装;训练侧任何人都能拿去跑 RLVR。
评测正在换代(「记住了吗」→「变强了吗」),而长周期真实用例只能来自真实用户。一份「30 天真实使用日志 + 每周该记住什么」的公开评测集,今天就是稀缺品(Macaron 自建 LivingBench 干的就是这件事,但行业需要中立版)。
第一步:研究 LongMemEval-V2 与 AgentCL 的任务格式,贡献你所在领域的任务流;或向 ICLR/COLM 的 Lifelong Agents workshop 投基准论文。
记忆层正在标准化前夜:Letta 的 Agent File、MemOS 的 MemCube、Mem0/Graphiti 各有格式,互不相通——「记忆的互操作」是明显的空位。把领域数据源封装成 MCP server,就是给所有 Agent 提供「可被记住的接口」。
第一步:给 Letta/MemOS/Mem0 提 PR;或写一个 MCP server,把你手里的数据(笔记、CRM、传感器…)暴露成带时间戳的记忆流,再做一个「Agent File ↔ MemCube」转换器练手。
MoL 的世界观是「专家可组合」:不同人训的 LoRA 可以挂在同一个冻结底座上协作(Collective Intelligence)。领域专家(法律、医疗、小语种、垂直工具链)训练的适配器,就是这个生态的「插件」。
第一步:在 Tinker 或 Macaron MinT/HCP 生态上训一个领域 specialist;开源侧用 GLM-5.2(MIT)+ slime 是当前国内个人可及的全栈组合(参考社区 OpenClaw-RL 项目)。
所有实验室最终都缺同一样东西:带结果标签的纵向真实使用数据(这个建议被采纳了吗?这个 app 被用了几次?这个记忆三个月后还对吗?)。如果你有自己的产品或工作流,把「结果可验证」设计进交互(明确的接受/拒绝、可度量的完成信号),你就拥有了持续学习时代最稀缺的资产——它既能喂你自己的 adapter,也是与任何实验室合作的筹码。
第一步:把产品里的每个 AI 触点改造成「建议 → 用户行动 → 可观测结果」三元组并留档;哪怕只是个人工作流,坚持记录三个月,你就有了一份别人买不到的 LivingBench。
不是,但是亲戚。RAG 和长上下文都属于「第 2 层:外挂记忆」——信息在模型外面,每次用都要检索、注入、重新读一遍,模型本体没有任何变化,就像开卷考试永远要翻书。持续学习的目标是第 3 层:把反复出现的规律内化进权重,像你学会母语后再也不用查语法书。成熟系统会三层并用:新经验先进上下文,常用的沉淀进记忆库,规律性的蒸进权重。
四个拦路虎:① 灾难性遗忘——学新忘旧(见上文 85%→45% 的实验);② 成本——全参微调千亿模型一次数十万美元级;③ 对齐回退——微调会不可预测地破坏安全训练,每次都要重新全面评测;④ 不可回滚——权重里的知识没法「精确删除」,用户说「忘了这件事」怎么办?2025 下半年的突破(LoRA 经济学 + 稀疏记忆槽 + on-policy 蒸馏)正是在逐个拆这四个雷,所以行业才突然热起来。
是持续学习的前半段。它们的记忆是外挂库 + 上下文注入(第 2 层),模型权重纹丝不动——所以换个没有你记忆库的实例,它对你一无所知。真正的分水岭是 2026-05 ChatGPT 的「dreaming」:系统开始在空闲时主动巩固记忆(虽然目前仍巩固到记忆库而非权重)。当某天你的助手把「你的偏好」内化到连记忆库被清空都还「有感觉」,那才是完整的持续学习。
因为神经网络的知识是分布式的:没有哪个权重「专管」某条知识,每条知识摊在几百万个共享权重上,学新任务的梯度必然踩到旧知识的地盘。人脑的解法是「分区 + 分速 + 睡眠」:海马体快速记录不干扰皮层;睡眠时选择性重放,把重要的慢慢转写进皮层;突触巩固保护重要连接(EWC 的灵感来源)。2026 年的技术栈——记忆库(海马体)+ 稀疏记忆槽(分区)+ 蒸馏巩固(睡眠)——就是在照着抄这份作业。
五件事在六个月里同时凑齐:① LoRA Without Regret 证明个性化便宜到可行;② Sparse Memory Finetuning 解决「往哪写不踩旧知识」;③ On-Policy Distillation 给出防遗忘配方;④ 原生记忆架构(Titans/HOPE/Engram/KDA)从论文走向旗舰;⑤ 评测换代(AgentCL 等)让进展可度量。再加上需求侧:Agent 任务越做越长(METR 时程每 ~89 天翻倍),「中途不学习」的成本指数上升。技术供给和需求压力第一次同时到位。
三年前不现实,现在是工程问题。关键数字:LoRA 只需动 <0.5% 的参数就能保留 >90% 的全参微调效果(MindLab 在 1T 的 Kimi K2 上验证,GPU 用量约 10%);一个 1B 的适配器存储只要 2GB;推理时冻结底座共享、适配器按需热插拔。Macaron 已宣布从 2026 Q2 起为数十万用户做定制模型。真正的瓶颈在 infra(百万 adapter 的训练调度、路由、版本回滚)和信任(见下条),不在算力。
这是权重级持续学习最硬的非技术难题:权重里的知识没有删除键(机器遗忘 machine unlearning 至今没有严格可验证的通用方案)。当前的务实架构是分层承压:敏感个人信息只进第 2 层(记忆库,可查、可删、可导出),权重级只蒸馏「去身份化的偏好与技能模式」,且 per-user adapter 天然支持「一键销毁你的那份权重」——这也是 MoL/Tinker 式「一人一适配器」相对「大模型直接记住所有人」的合规优势。监管尚未跟上,这一块规则真空。
三位重量级人物给了三个角度:Ilya 认为人类「样本效率 + 在岗学习」正是现有范式缺失的科学原理,补上它 = 通往超级智能;梁文锋把它列为 CoT、Agent 之后的「下一阶梯」,通向 AI 自迭代;Karpathy 用「失忆的同事」解释为什么 Agent 还要十年。共识内核:不会持续学习的系统,能力天花板锁死在训练截止日——它可以很博学,但永远不会「越用越懂你、越干越熟练」,而后者才是通用智能的标志。
思想全部活着,只是换了衣服。EWC 的「保护重要权重」→ sparse memory finetuning 的「只写不重要的槽」;replay 重放 → 训练时回混旧数据、睡眠巩固时重放高价值轨迹;Progressive Networks 的「新任务新模块」→ per-task/per-user LoRA(MoL 就是它的直系后代);CLS 双系统理论更是升格为全行业蓝图。读 2017 年前的持续学习文献,依然是理解 2026 年方案的最快捷径。
是认真的技术隐喻,且有严格对应:生物睡眠做的事——选择性重放白天经验、把海马体内容转写进皮层、修剪无用连接——恰好是「离线巩固」算法要做的事。工程谱系清晰可查:CLS 理论(1995)→ Letta sleep-time compute(2025-04,同等准确率省 5 倍推理算力)→ ChatGPT dreaming(2026-05,空闲时自动巩固)→ 2026 上半年「LLM 需要睡眠」论文潮(SCM、Language Models Need Sleep 等)。当然,产品文案里的「做梦」比论文里的浪漫得多。
按投入排序:零代码——把 ChatGPT/Claude 的记忆功能真正用起来(主动告诉它偏好、定期让它总结「你学到了关于我的什么」);低代码——给自己的 Agent 挂 Mem0/Letta/MemOS 做外挂记忆,用 Claude Skills 沉淀工作流;动手训——Tinker(托管)或 GLM-5.2 + slime(自托管,MIT)做领域 LoRA;产品级——参考 Macaron 的 MoL 架构:冻结底座 + 场景化适配器 + 记忆系统三件套。
五个探针:① 问它测什么榜——只报 LoCoMo 高分要警惕(测法争议大),敢报 LongMemEval-V2/AgentCL/自建长周期评测的更可信;② 问「学到的东西改变行为了吗」——能否举出「上周纠正过的错误这周不再犯」的例子;③ 问遗忘曲线——学新东西后旧能力掉多少,有没有数;④ 问删除——用户能否查看、修改、彻底删除某条记忆;⑤ 问闭环——记忆是只进不出的仓库,还是有巩固/过期/冲突消解的生命周期(MemOps 基准测的就是这个)。五问全答得上的产品,2026 年也屈指可数。