K3 更强的编码、工具调用和长程 Agent 能力,适合制造难题、审阅失败轨迹、提出 Harness 补丁。
Confidential no more · 持续学习全览
把模型从一次性产品,
变成会积累经验的系统
这不是“把上下文拉长”,也不是“多存一点记忆”。真正的持续学习,是系统在一连串任务中 吸收经验、迁移能力、保住旧本事,并且知道何时不该更新。
有限替换
K3 有提升空间,但不要直接整体替掉 GLM-5.2
先把 Kimi K3 接成影子教师 / 轨迹生成器,再把 L2 Coding 或 L1 Personal Agent 做成单专家 LoRA A/B。只有在三轮连续学习、旧任务保持与单位成本同时过线后,才值得做原生全栈移植。
一句话判断,不绕弯
“K3 比 GLM-5.2 强”与“K3 更适合承载 Macaron 的持续学习栈”是两个不同问题。
优先做 L2 Coding:测试可判定、奖励可验证、失败可重放,最容易测出“真的学会”还是基准幻觉。
Macaron 的 LongStraw 与分布式布局针对 GLM 深度适配;K3 的 KDA、896 专家、MXFP4 会把它变成新研究项目。
Macaron v1 到底是什么
它的创新点不是某一个 LoRA,而是把模型、专业适配器、Harness 与训练循环设计成同一套“可升级器官”。
Venti:744B GLM-5.2;Tall:Qwen 3.6 50B。底座不跟每次经验一起改。
持久 Python 命名空间、工具代理、技能保存/晋升、AGENTS.md、hooks 与 provider 配置。
Venti 的参数结构
748B 总量 = 冻结的 744B GLM-5.2 + 四个约 1B 的 LoRA 专家。运行时由 L0 路由到专家,专家保留在本轮持续推理中。
能力如何“留下来”
REPL Harness 允许组合、验证、晋升和复用工具;这是受控的程序性记忆,不是让模型随意改写自己的全部代码。
LongStraw / MinT
官方称可对 1T 级模型做 adapter-only actor/learner 交接,并把 GLM-5.2 的精确训练上下文推到 2.1M token。
公开仓库并非可复现实验包
LongStraw 仓库标注为 review-only / not runnable;镜像、认证、夹具与完整证据未公开。因此它证明“工程方向存在”,不等于“2M 训练质量已解决”。
K3 替换 GLM-5.2,提升在哪、代价在哪
K3 是更强的行动者候选;GLM-5.2 仍是更成熟的 Macaron 学习底座。结论取决于你替换的是“角色”还是“整套器官”。
| 维度 | Kimi K3 | GLM-5.2 / Macaron | 对替换的含义 |
|---|---|---|---|
| 规模 / 激活 | 2.8T 总参数,104B 激活;896 专家,Top-16 + 共享专家 | 约 744–753B,总激活约 40B | K3 潜在能力高,但推理、训练和拓扑复杂度更大 |
| 长上下文 | 1M 原生推理上下文;Fireworks LoRA 当前训练上限 192K | 1M 原生推理;当前公开 Macaron 服务配置为 262K;LongStraw 声称精确训练 2.1M | 托管版直接替换会失去 Macaron 最有辨识度的 2M 训练路径 |
| Agent / Coding | 官方基准普遍领先,尤其 SWE、终端、自动化与 Office | 底座较小,已与现有 HCP / LongStraw 深度耦合 | 非常适合先替代 L2 Coding 或充当教师 |
| 训练格式 | 原生 QAT:MXFP4 权重 / MXFP8 激活;KDA + Gated MLA | BF16 / FP8;现成 GLM 专用分布式实现 | 不是换 model id;需要新 kernel、状态捕获与并行布局 |
| 公开训练可用性 | 官方 Hugging Face 稀疏 MoE 参考实现不支持 training mode;需 Moonshot 后端、自建或 Fireworks 私有预览 | 已有 Macaron / GLM 训练路径,Slime、ms-swift 等生态可用 | K3 的权重已开放,不等于可直接用 Transformers + PEFT 训练 |
| 多模态 | 文本 + 图像,MoonViT-V2 | Macaron v1 重点在文本 Agent / UI / Coding | 为 GUI、屏幕与设备任务提供增量,但训练链需跟上 |
| 许可 | 自定义 Kimi K3 License,含大规模商业触发条款 | GLM-5.2 MIT | 研究与多数产品可行;做大规模 MaaS 前需法律复核 |
| 公开 API 单价 | 约 $3 输入 / $15 输出,每百万 token | 约 $1.40 输入 / $4.40 输出,每百万 token | K3 输出约 3.4×;应比较“每个成功任务成本”,不能只比单价或能力 |
同表基准:K3 相对 GLM-5.2
数据来自 K3 官方技术材料中的同表比较,属于厂商报告;不同模型官方榜单的 harness、采样和题库污染控制并不必然一致,不能替代你的同环境 A/B。
| Macaron 角色 | K3 预期上行 | 证据 | 建议 |
|---|---|---|---|
| L2 Coding | 高 | 多项编码、终端与 SWE 厂商同表领先;测试可判定 | 第一个迁移 |
| L1 Personal Agent | 中高 | 工具、自动化、Office、Legal 方向更强 | 第二个迁移 |
| L3 GenUI | 上限高 / 置信低 | 原生视觉可做“生成→截图→检查→修复”,但缺 UI4ABench 同条件结果 | 并行小试 |
| L0 Chat / Router | 未知 | 缺 ChatBench、LivingBench 同 Harness 对照;always-thinking 可能抬高路由成本 | 最后迁移,或先用轻量 router |
| 持续学习本身 | 间接提升 | 更好的任务与轨迹可能提高样本效率;遗忘与干扰机制没有因此消失 | 必须做序列评测 |
三条实现路线:从 2 天到数月
推荐顺序 A → B → C。每一层都要用前一层的结果作为投资门槛,而不是先造一个昂贵的新训练栈。
K3 只负责制造经验,不先改生产路径
- 同一 HCP / 工具 / 环境下记录 GLM-5.2 的失败轨迹。
- K3 生成更难且可判定的任务、审阅失败、提出技能或 Harness 补丁。
- 真实测试、规则或外部结果验证;LLM judge 只能做补充证据。
- 通过 no-regression gate 后,把经验晋升为记忆、skill 或下一轮 LoRA 数据。
价值:风险最小,也最直接检验“K3 的强是否能转化为学习数据质量”。
在 Fireworks 上训练 K3 L2 Coding 专家
- 固定 K3 底座,创建 L2 Coding LoRA;其余专家先不迁。
- 用确定性测试构造 reward,保留成功与高信息量失败,不把所有“看起来不错”的轨迹都喂回去。
- Multi-LoRA 服务同时挂载 base、旧 adapter、新 adapter,做逐请求 canary。
- 连续做三轮新任务 → 更新 → 旧任务回归;比较 base / RAG / skill / GLM-LoRA / K3-LoRA。
from openai import OpenAI
client = OpenAI(
base_url=FIREWORKS_BASE_URL,
api_key=FIREWORKS_API_KEY,
)
result = client.chat.completions.create(
model=K3_L2_ADAPTER_ID,
messages=messages, # 多轮时保留完整 reasoning_content
tools=tool_schema,
)
# 将执行结果送入 /v1/verify;只有通过回归门槛才能 /v1/promote
把 MinT / LongStraw 原生移植到 2.8T K3
- 为 KDA / Gated MLA 建立 resident-state 捕获、回放和分布式更新语义。
- 处理 896 专家的路由回放、EP/CP 布局与 adapter actor/learner 交接。
- 补齐 MXFP4 权重、MXFP8 激活下的训练 kernel 和数值稳定性。
- 兼容 AttnRes、视觉编码器、tokenizer、推理缓存版本与 K3 reasoning_content 语义。
- 建立不可变镜像、数据夹具、2M 级精确性证据与故障回滚。
建议:只有 B 路线显著胜出才启动;最好联合 Moonshot、Fireworks 或 MindLab,而不是独自重做大模型系统软件。
Stage 0
100–300 个同环境任务,先测能力、成本、延迟、验证器一致率和失败类型。
Stage 1–2
影子教师 → 单一 LoRA;只在可验证垂直上建立正循环。
Stage 3
三轮连续更新全部过门槛,才评估原生分布式移植。
“持续学习”不是一个按钮,而是五层能力
行业经常把记忆、RAG、技能、LoRA 与真正的在线权重更新混在一起。拆层后,哪些已经能做、哪些仍未解决会清楚很多。
请求结束多半消失;不是持久学习
可持久、可删除;模型参数没变
目前最容易产品化的经验复利
Macaron 的核心下注;需防遗忘与路由碎片
收益最大、风险最高,尚无通用公开解
用传统学习来理解:像,但不等同
稳定—可塑性难题
太稳定:新经验进不去;太可塑:学一点新东西就把旧能力冲掉。持续学习的本质不是“更新越快越好”,而是选择更新范围与速度。
常用解法组合
经验回放、正则约束、模块化专家、稀疏路由、周期巩固、版本化技能、回归门禁、canary 与回滚。单招都不够。
四个人,押的是四个不同层次
把他们放进同一张“谁会赢”的表格很诱人,但先要看清:有人造大脑,有人造训练闭环,有人造外部系统,有人造高价值环境。
梁文锋
CoT → Agent → 持续学习 → AI 研发 AI
优势是 RL、低成本训练、开源模型与 Agent Coding 已形成连续工程基础。具体路线来自流传的闭门会转写,DeepSeek 未确认;R1 的“自进化”仍发生在训练期。
翁荔 Lilian Weng
先让外部软件系统进化,再联合优化模型
持久记忆、子 Agent、工作流与代码通过 propose–evaluate–accept 迭代,以权限、回归测试和外置验证器约束。2026-07 已获确认回到 OpenAI 领导相关研究团队。
陈勇超
在可验证科研循环中产生高价值经验
多 Agent、工具、神经符号规划、代码执行与形式验证。TUMIX 等结果证明协作与测试时扩展,但并非跨任务持续学习;Apex 的完整长期曲线尚未公开。
Ilya Sutskever
造一个会在上岗后学会职业的“超级学生”
目标是人类式样本效率、可靠泛化与跨实例经验汇聚。SSI × NVIDIA 的算力合作是强信号,但算法、模型、基准均未公开。
| 谁最可能先…… | 判断 | 理由 |
|---|---|---|
| 做出能用的持续改进系统 | OpenAI / 翁荔 | 真实部署数据、Agent 工程、评测和 Harness 路线的短期可实现性 |
| 找到底层学习原理 | SSI / Ilya | 目标最基础,且有秘密研究与算力信号;不代表最早公开 |
| 把突破开源并压低成本 | DeepSeek / 梁文锋 | 训练基础设施与开放模型历史最匹配 |
| 在可验证科研窄域跑通 | Apex / 陈勇超 | 代码、形式证明、实验结果天然有更强验证器 |
没有一个“行业 SOTA”,只有分赛道领先者
用一个分数排所有持续学习方案会掩盖任务边界。今天最成熟的突破,都来自可验证、可回放、可拒绝坏更新的窄域。
AlphaEvolve
Gemini 生成候选 + 自动评估器 + 演化搜索,已用于 Google 基础设施与数学/算法问题。
成熟窄域领先RELAI-VCL / Self-Harness / DGM-H
RELAI-VCL 在其小型双阶段 Terminal-Bench 设置中领先,并实现正迁移 + 后续继续进步;不能外推为通用 SOTA。
新论文 / 小评测Macaron / MinT + K3 Multi-LoRA
前者公开了 2M 级精确训练方向,后者把 LoRA 带到 2.8T 模型;二者尚未成为同一条可复现链。
厂商工程前沿On-policy distillation
让学生在自己的分布上采样,再由教师给稠密目标;比离线 SFT 更贴近部署分布,也比纯 RL 信号丰富。
高潜路线Darwin Gödel Machine
在论文设置中通过改写 Agent 代码提升 SWE-bench;底座模型不变,属于 Harness 自进化。
公开研究仍未解决
人类式少样本、跨域正迁移、在线更新、跨实例汇聚、不遗忘、可审计与可撤销,尚无公开系统同时满足。
核心空白六条主路线
| 路线 | 改变什么 | 进展 | 主要瓶颈 |
|---|---|---|---|
| 记忆 / RAG | 外部状态 | 最成熟、可产品化 | 检索污染、过期、权限与“记得≠会做” |
| Skill / Harness 进化 | 工具与工作流 | 2025–26 快速前进 | 奖励作弊、软件腐化、评测过拟合 |
| Adapter bank / LoRA | 模块化参数 | 可扩到超大 MoE | 路由、合并、版本爆炸、跨专家迁移 |
| 回放 + 正则 | 权重巩固方式 | 传统 CL 基线 | 难扩展到开放任务,回放成本与隐私 |
| On-policy RL / 蒸馏 | 部署分布上的策略 | 高潜、仍在早期 | 教师偏差、验证器、成本、长期稳定性 |
| 自举科研 / 算法进化 | 任务、系统乃至优化器 | 可验证窄域已有效 | 开放世界评价与安全边界 |
最可能的行业解,不是“永远在线改权重”
近期 SOTA 更像分层记忆系统与受控软件发布系统的结合:高频经验留在外部,低频高价值规律才逐级巩固进参数。
动作、观察、结果、因果父节点、权限与隐私标签
测试、规则、真实结果、模型裁判与不确定性
不更新 / 上下文 / 记忆 / skill / LoRA / 全权重
回放、on-policy 蒸馏、RL、adapter 合并与淘汰
旧任务回归、canary、漂移监测、版本化撤销
近中期胜出架构
冻结的 frontier base + 每用户/租户记忆 + 版本化技能/Harness + adapter bank + 周期性 on-policy 更新 + 确定性验证与回归门禁。
最重要的设计原则
写入权必须比读取权更严格。模型可以自由提出经验,但只有可追溯、可重放、可验证、可撤销的经验才有资格被巩固。
你可以提供的接口:Experience Gateway
结合你已有的多模型 Gateway、Code Agent、OpenCLI/Kimi 适配器、eval harness 与 Fireworks K3 LoRA 通路,最有价值的不是再托管一个模型,而是做跨模型的“学习控制平面”。
capture · replay · verify · distill · promote · rollback
/v1/experience
不可变动作—观察—结果事件;带版本、因果链、同意与 PII 等级。
/v1/replay
环境快照和确定性回放;让失败可复现,让奖励可审计。
/v1/verify
测试、规则、外部结果、模型裁判的多证据融合与 provenance。
/v1/distill
将验证轨迹转换成 case、lesson、skill、HCP patch 或 adapter 数据。
/v1/promote
回归门禁、canary、版本、回滚;像发布代码一样发布“学到的东西”。
/v1/route-learning
按频率、价值、风险决定进入上下文、记忆、skill、LoRA 或权重。
/v1/eval/prequential
先预测、后观察、再学习;测适应、保持、迁移和单位成本。
/v1/registry
跨模型的 adapter / skill 生命周期、依赖、兼容性与废弃策略。
{
"experience_id": "exp_01J...",
"tenant_id": "t_acme",
"task": {"type": "code.fix", "spec_hash": "sha256:..."},
"runtime": {
"model": "kimi-k3",
"adapter": "l2-code@17",
"harness": "hcp@42",
"environment": "sandbox:sha256:..."
},
"causal_parents": ["exp_01H..."],
"trajectory_ref": "s3://immutable/trace/...",
"outcome": {
"verifiers": [
{"type": "tests", "score": 1.0, "evidence_ref": "run_88"},
{"type": "llm_judge", "score": 0.82, "uncertainty": 0.14}
],
"reward_vector": {"correctness": 1, "latency": -0.23, "cost": -0.07}
},
"governance": {
"consent": "training_allowed",
"pii_class": "none",
"retention_days": 90
}
}
六周 MVP:从 Code Agent 切入
事件 schema、轨迹 collector、模型/Harness/环境版本。
容器快照、确定性测试、多验证器 provenance。
memory/skill 生成、回归集、canary 与 rollback。
K3 影子生成难题、审阅失败、提 HCP patch。
Fireworks 上训练 K3 L2 adapter,多 LoRA A/B。
双阶段序列评测、学习曲线、成本与保持 dashboard。
如何证明它真的在持续学习
不能只看更新后的新任务分数。正确评测是按时间排序,在模型看到答案之前打分,并持续回放旧任务。
| 指标 | 问的问题 | 建议算法 / 记录 |
|---|---|---|
| Prequential score | 看到新经验之前,当前系统能做对吗? | predict → observe → learn,按时间累计 |
| Adaptation gain | 给 k 条经验后,新任务提升多少? | Δ success@k,画样本效率曲线 |
| Backward transfer | 学新任务后,旧能力变好还是变坏? | 旧任务固定回归集,按 cohort 分层 |
| Forward transfer | 没见过的相关任务是否更容易? | 保留隐藏任务族,防止重复题伪装迁移 |
| Learning efficiency | 每 1K token / 每美元 / 每分钟换来多少提升? | Δ outcome ÷ train+infer+verify cost |
| Calibration | 系统知道什么时候不该学、不该答吗? | 不确定性、拒答、验证器分歧、回滚率 |
| Governance | 坏经验、隐私或攻击能否污染全局? | 权限、数据谱系、poison canary、删除传播 |
建议的 go / no-go 门槛
目标任务绝对成功率,或至少 +20% 相对提升
旧任务保持下降上限
至少三个连续学习周期仍有正迁移
安全、隐私、数据污染的严重回归
以上是建议门槛,不是行业标准;应按任务价值和故障成本调整。
从“神经元一起激活”到“Agent 自己改 Harness”
持续学习不是 2026 年突然出现的新词。变化在于:模型终于有了环境、工具、可验证结果与足够便宜的训练接口。
Hebbian learning
“一起激活就加强连接”的局部学习思想,奠定经验驱动适应的直觉。
递归自我改进
I. J. Good 提出超智能机器能设计更好的机器;“智能爆炸”进入思想史。
灾难性遗忘被系统描述
神经网络学习新任务时会快速破坏旧任务,稳定—可塑性成为长期核心难题。
EWC 与现代深度持续学习
用参数重要性约束更新;与 replay、动态网络等路线共同形成现代 CL 工具箱。
Reflexion / Voyager
大模型开始把反思写入外部记忆,把可执行程序沉淀成技能;能力可跨 episode 复用。
Era of Experience
Silver 与 Sutton 主张 Agent 将主要从自身行动与环境结果中学习,而非只靠人类生成数据。
AlphaEvolve / DGM
可验证算法发现和 Harness 自改写分别展示窄域经验复利;底座仍多为冻结模型。
On-policy distillation / Self-Harness
学习开始更贴近模型自己的部署分布;系统化弱点发现、提案、回归验证成为主线。
Macaron / RELAI-VCL / HyperAgents
模块化超大模型训练、跨阶段 Harness 优化与元改进过程同时涌现;持续学习从概念走向系统竞争。
受控模型—Harness 共进化
高频经验留在可撤销层,稳定规律周期性巩固进 adapter / 权重;用长期回归而非单轮榜单定义进步。
常见问题
把最容易混淆的概念与实现决策放在一起。
K3 替掉 GLM-5.2,预期能提升多少?
无法从公开 benchmark 推出你的系统提升。厂商同表中,K3 在编码、终端、自动化和 Office 任务常有明显领先,但持续学习增益取决于同一 Harness 下的轨迹质量、验证器和更新稳定性。先设 +10pp 或 +20% 相对成功率的工程门槛,再用你的任务 A/B。
为什么不直接做四个 K3 LoRA 专家?
因为你会同时改变底座、路由、数据、训练与部署,失败时无法归因。先迁 L2 Coding,它有确定性测试;若成功,再迁 L1 Personal Agent。Chat 与 GenUI 的奖励更主观,适合后置。
1M 上下文等于持续学习吗?
不等于。它像更大的工作台:能放更多材料,但请求结束后不会自然形成长期、可迁移的能力。持续学习至少需要跨任务保存、选择、巩固与回归验证。
RAG、memory 和 LoRA 应该怎么分工?
频繁变化、需删除、用户私有的信息进 memory / RAG;可解释且反复使用的流程进 skill / Harness;跨场景稳定、频繁触发、上下文表达成本高的行为模式才考虑 LoRA;全权重更新留给广泛且确定的分布变化。
最值得先收集哪类数据?
不是泛泛的对话,而是带环境快照、动作、真实结果、验证证据和失败原因的可重放轨迹。Code Agent 的测试、终端返回码、补丁 diff 与用户是否接受,是很好的起点。
LLM-as-judge 能当唯一奖励吗?
不建议。模型裁判会有偏好、自洽偏差和被奖励破解的风险。优先使用测试、形式规则、真实业务结果;模型裁判用于覆盖模糊维度,并保留不确定性和多裁判分歧。
Fireworks K3 LoRA 能复刻 Macaron 的 2M 训练吗?
目前不能等价复刻。K3 托管 LoRA 的公开训练上下文上限为 192K,而 Macaron / LongStraw 的标志性主张是约 2.1M 精确训练。托管 LoRA 适合验证单专家价值,不是 LongStraw 的替代品。
谁最可能先突破?
“最先做出实用系统”更看好 OpenAI / 翁荔;“底层学习原理”SSI / Ilya 可能性更高;“开放且低成本”更像 DeepSeek;“可验证科学窄域”Apex 有切口。所有概率都高度不确定,真正通用的持续学习目前没有公开赢家。
持续学习最大的安全风险是什么?
把一次恶意或偶然的成功当成规律并扩散到全局。防线包括写入权限、经验谱系、污染 canary、租户隔离、最小化训练数据、可撤销 adapter、旧任务回归与人工审批高风险晋升。
证据等级与主要来源
已证实 = 官方或论文直接支持;厂商自报 = 有一手材料但缺独立复现;分析推断 = 基于公开事实的判断;尚未公开 = 关键证据不存在。