CL / 解密档案

Confidential no more · 持续学习全览

把模型从一次性产品,
变成会积累经验的系统

这不是“把上下文拉长”,也不是“多存一点记忆”。真正的持续学习,是系统在一连串任务中 吸收经验、迁移能力、保住旧本事,并且知道何时不该更新

建议
有限替换

K3 有提升空间,但不要直接整体替掉 GLM-5.2

先把 Kimi K3 接成影子教师 / 轨迹生成器,再把 L2 Coding 或 L1 Personal Agent 做成单专家 LoRA A/B。只有在三轮连续学习、旧任务保持与单位成本同时过线后,才值得做原生全栈移植。

结论置信度:中高 建议 MVP:1–3 周 原生移植:数月级研究 首选垂直:Code Agent
00 / DECISION

一句话判断,不绕弯

“K3 比 GLM-5.2 强”与“K3 更适合承载 Macaron 的持续学习栈”是两个不同问题。

综合判断
9/10影子教师价值

K3 更强的编码、工具调用和长程 Agent 能力,适合制造难题、审阅失败轨迹、提出 Harness 补丁。

综合判断
8/10单专家 LoRA 价值

优先做 L2 Coding:测试可判定、奖励可验证、失败可重放,最容易测出“真的学会”还是基准幻觉。

综合判断
3/10立即全栈替换价值

Macaron 的 LongStraw 与分布式布局针对 GLM 深度适配;K3 的 KDA、896 专家、MXFP4 会把它变成新研究项目。

真正的比较单位不是 base model,而是闭环: 同一环境、同一 Harness、同一经验流、同一验证器下,系统能否在第 N 次任务前预测得更准,更新后又不伤旧任务。
01 / ANATOMY

Macaron v1 到底是什么

它的创新点不是某一个 LoRA,而是把模型、专业适配器、Harness 与训练循环设计成同一套“可升级器官”。

FROZEN FOUNDATION 冻结底座

Venti:744B GLM-5.2;Tall:Qwen 3.6 50B。底座不跟每次经验一起改。

ROUTED EXPERTISE
L0 Chat对话 / 路由
L1 Personal Agent个人任务 / 行动
L2 Coding编码 / 终端
L3 GenUI生成式界面
CO-DESIGNED HARNESS HCP + REPL

持久 Python 命名空间、工具代理、技能保存/晋升、AGENTS.md、hooks 与 provider 配置。

已核验 · 官方

Venti 的参数结构

748B 总量 = 冻结的 744B GLM-5.2 + 四个约 1B 的 LoRA 专家。运行时由 L0 路由到专家,专家保留在本轮持续推理中。

已核验 · 官方

能力如何“留下来”

REPL Harness 允许组合、验证、晋升和复用工具;这是受控的程序性记忆,不是让模型随意改写自己的全部代码。

厂商自报

LongStraw / MinT

官方称可对 1T 级模型做 adapter-only actor/learner 交接,并把 GLM-5.2 的精确训练上下文推到 2.1M token。

关键缺口

公开仓库并非可复现实验包

LongStraw 仓库标注为 review-only / not runnable;镜像、认证、夹具与完整证据未公开。因此它证明“工程方向存在”,不等于“2M 训练质量已解决”。

拆穿一个词义陷阱: Macaron 所说的“持续学习”主要是离线/周期性的 adapter 更新 + Harness 与工具积累。它不是生产请求一结束就立即改权重的无约束在线学习。
两种“专家”不要混淆: Macaron 的四个 LoRA 是请求级路由——一次请求选一个,工具结果继续回到同一 LoRA; GLM-5.2 底座内部的 MoE 才是token 级专家路由。跨 LoRA 通过摘要传递状态,而不是逐 token 混合。
02 / SWAP TEST

K3 替换 GLM-5.2,提升在哪、代价在哪

K3 是更强的行动者候选;GLM-5.2 仍是更成熟的 Macaron 学习底座。结论取决于你替换的是“角色”还是“整套器官”。

维度Kimi K3GLM-5.2 / Macaron对替换的含义
规模 / 激活 2.8T 总参数,104B 激活;896 专家,Top-16 + 共享专家 约 744–753B,总激活约 40B K3 潜在能力高,但推理、训练和拓扑复杂度更大
长上下文 1M 原生推理上下文;Fireworks LoRA 当前训练上限 192K 1M 原生推理;当前公开 Macaron 服务配置为 262K;LongStraw 声称精确训练 2.1M 托管版直接替换会失去 Macaron 最有辨识度的 2M 训练路径
Agent / Coding 官方基准普遍领先,尤其 SWE、终端、自动化与 Office 底座较小,已与现有 HCP / LongStraw 深度耦合 非常适合先替代 L2 Coding 或充当教师
训练格式 原生 QAT:MXFP4 权重 / MXFP8 激活;KDA + Gated MLA BF16 / FP8;现成 GLM 专用分布式实现 不是换 model id;需要新 kernel、状态捕获与并行布局
公开训练可用性 官方 Hugging Face 稀疏 MoE 参考实现不支持 training mode;需 Moonshot 后端、自建或 Fireworks 私有预览 已有 Macaron / GLM 训练路径,Slime、ms-swift 等生态可用 K3 的权重已开放,不等于可直接用 Transformers + PEFT 训练
多模态 文本 + 图像,MoonViT-V2 Macaron v1 重点在文本 Agent / UI / Coding 为 GUI、屏幕与设备任务提供增量,但训练链需跟上
许可 自定义 Kimi K3 License,含大规模商业触发条款 GLM-5.2 MIT 研究与多数产品可行;做大规模 MaaS 前需法律复核
公开 API 单价 约 $3 输入 / $15 输出,每百万 token 约 $1.40 输入 / $4.40 输出,每百万 token K3 输出约 3.4×;应比较“每个成功任务成本”,不能只比单价或能力

同表基准:K3 相对 GLM-5.2

K3GLM-5.2

数据来自 K3 官方技术材料中的同表比较,属于厂商报告;不同模型官方榜单的 harness、采样和题库污染控制并不必然一致,不能替代你的同环境 A/B。

Macaron 角色K3 预期上行证据建议
L2 Coding多项编码、终端与 SWE 厂商同表领先;测试可判定第一个迁移
L1 Personal Agent中高工具、自动化、Office、Legal 方向更强第二个迁移
L3 GenUI上限高 / 置信低原生视觉可做“生成→截图→检查→修复”,但缺 UI4ABench 同条件结果并行小试
L0 Chat / Router未知缺 ChatBench、LivingBench 同 Harness 对照;always-thinking 可能抬高路由成本最后迁移,或先用轻量 router
持续学习本身间接提升更好的任务与轨迹可能提高样本效率;遗忘与干扰机制没有因此消失必须做序列评测
K3 不会自动解决: 灾难性遗忘、错误经验污染、用户隐私、跨任务正迁移、验证器偏差,以及“何时更新、更新哪一层”的稳定—可塑性问题。
03 / BUILD

三条实现路线:从 2 天到数月

推荐顺序 A → B → C。每一层都要用前一层的结果作为投资门槛,而不是先造一个昂贵的新训练栈。

2–7 天 · 首选

K3 只负责制造经验,不先改生产路径

A+
  1. 同一 HCP / 工具 / 环境下记录 GLM-5.2 的失败轨迹。
  2. K3 生成更难且可判定的任务、审阅失败、提出技能或 Harness 补丁。
  3. 真实测试、规则或外部结果验证;LLM judge 只能做补充证据。
  4. 通过 no-regression gate 后,把经验晋升为记忆、skill 或下一轮 LoRA 数据。

价值:风险最小,也最直接检验“K3 的强是否能转化为学习数据质量”。

1–3 周 · 推荐 MVP

在 Fireworks 上训练 K3 L2 Coding 专家

A
  1. 固定 K3 底座,创建 L2 Coding LoRA;其余专家先不迁。
  2. 用确定性测试构造 reward,保留成功与高信息量失败,不把所有“看起来不错”的轨迹都喂回去。
  3. Multi-LoRA 服务同时挂载 base、旧 adapter、新 adapter,做逐请求 canary。
  4. 连续做三轮新任务 → 更新 → 旧任务回归;比较 base / RAG / skill / GLM-LoRA / K3-LoRA。
OpenAI-compatible · 推理骨架
from openai import OpenAI

client = OpenAI(
    base_url=FIREWORKS_BASE_URL,
    api_key=FIREWORKS_API_KEY,
)

result = client.chat.completions.create(
    model=K3_L2_ADAPTER_ID,
    messages=messages,        # 多轮时保留完整 reasoning_content
    tools=tool_schema,
)

# 将执行结果送入 /v1/verify;只有通过回归门槛才能 /v1/promote
数月 · 研究合作

把 MinT / LongStraw 原生移植到 2.8T K3

C+
  • 为 KDA / Gated MLA 建立 resident-state 捕获、回放和分布式更新语义。
  • 处理 896 专家的路由回放、EP/CP 布局与 adapter actor/learner 交接。
  • 补齐 MXFP4 权重、MXFP8 激活下的训练 kernel 和数值稳定性。
  • 兼容 AttnRes、视觉编码器、tokenizer、推理缓存版本与 K3 reasoning_content 语义。
  • 建立不可变镜像、数据夹具、2M 级精确性证据与故障回滚。

建议:只有 B 路线显著胜出才启动;最好联合 Moonshot、Fireworks 或 MindLab,而不是独自重做大模型系统软件。

LoRA 目标层也不能照抄: 按公开配置推算,如果对 K3 的 92 个 MoE 层、896 个专家矩阵全部做 rank-16 LoRA,单适配器可能达到约 26.3B 参数、52.7GB BF16; attention-only rank-16 则约 176M 参数、0.35GB。前者不适合作为 MVP,后者更接近可验证起点。此处是配置推算,不是官方实测。

Stage 0

100–300 个同环境任务,先测能力、成本、延迟、验证器一致率和失败类型。

Stage 1–2

影子教师 → 单一 LoRA;只在可验证垂直上建立正循环。

Stage 3

三轮连续更新全部过门槛,才评估原生分布式移植。

04 / DEFINITION

“持续学习”不是一个按钮,而是五层能力

行业经常把记忆、RAG、技能、LoRA 与真正的在线权重更新混在一起。拆层后,哪些已经能做、哪些仍未解决会清楚很多。

上下文内适应提示、few-shot、长上下文

请求结束多半消失;不是持久学习

外部记忆事件、知识、RAG、用户偏好

可持久、可删除;模型参数没变

程序性技能工具、代码、Harness、工作流

目前最容易产品化的经验复利

模块化参数LoRA、adapter bank、路由专家

Macaron 的核心下注;需防遗忘与路由碎片

底座 / 学习算法自改进全权重、架构、优化器、自动研究

收益最大、风险最高,尚无通用公开解

用传统学习来理解:像,但不等同

工作记忆眼前正在想什么
情景 / 语义记忆经历过什么、知道什么
程序性记忆骑车、打字、做题套路
睡眠巩固筛选与重组白天经验
元认知知道自己哪里不会
上下文窗口当前 token 与工具状态
轨迹库 / RAG事件日志、向量库、知识图
Skill / Harness可复用工具与流程
周期性巩固去重、回放、LoRA / 权重更新
验证器 / 回归评测发现盲点,拒绝坏更新
类比边界:人类记忆不是数据库,人脑也不是 LoRA。这组映射只用来理解功能,不说明生物机制相同。

稳定—可塑性难题

太稳定:新经验进不去;太可塑:学一点新东西就把旧能力冲掉。持续学习的本质不是“更新越快越好”,而是选择更新范围与速度。

常用解法组合

经验回放、正则约束、模块化专家、稀疏路由、周期巩固、版本化技能、回归门禁、canary 与回滚。单招都不够。

05 / PLAYERS

四个人,押的是四个不同层次

把他们放进同一张“谁会赢”的表格很诱人,但先要看清:有人造大脑,有人造训练闭环,有人造外部系统,有人造高价值环境。

梁文锋

DEEPSEEK · 模型训练闭环
路线未官宣

CoT → Agent → 持续学习 → AI 研发 AI

优势是 RL、低成本训练、开源模型与 Agent Coding 已形成连续工程基础。具体路线来自流传的闭门会转写,DeepSeek 未确认;R1 的“自进化”仍发生在训练期。

两年内实用系统30%

翁荔 Lilian Weng

OPENAI · Harness → 权重
公开路线

先让外部软件系统进化,再联合优化模型

持久记忆、子 Agent、工作流与代码通过 propose–evaluate–accept 迭代,以权限、回归测试和外置验证器约束。2026-07 已获确认回到 OpenAI 领导相关研究团队。

两年内实用系统40%

陈勇超

APEX INTELLIGENCE · AI SCIENTIST
早期公司

在可验证科研循环中产生高价值经验

多 Agent、工具、神经符号规划、代码执行与形式验证。TUMIX 等结果证明协作与测试时扩展,但并非跨任务持续学习;Apex 的完整长期曲线尚未公开。

两年内实用系统18%

Ilya Sutskever

SSI · 新学习原理
秘密研究

造一个会在上岗后学会职业的“超级学生”

目标是人类式样本效率、可靠泛化与跨实例经验汇聚。SSI × NVIDIA 的算力合作是强信号,但算法、模型、基准均未公开。

两年内实用系统12%
主观概率,不是事实: 若目标是“两年内公开一个跨任务积累、回归可控的实用 Agent”,我更看好 OpenAI / 翁荔路线先落地。 若目标升级为“人类式少样本、跨域、在线改权重且不遗忘”,到 2028 年这四方都没真正解决的概率,我给 65%。
谁最可能先……判断理由
做出能用的持续改进系统OpenAI / 翁荔真实部署数据、Agent 工程、评测和 Harness 路线的短期可实现性
找到底层学习原理SSI / Ilya目标最基础,且有秘密研究与算力信号;不代表最早公开
把突破开源并压低成本DeepSeek / 梁文锋训练基础设施与开放模型历史最匹配
可验证科研窄域跑通Apex / 陈勇超代码、形式证明、实验结果天然有更强验证器
06 / FIELD MAP

没有一个“行业 SOTA”,只有分赛道领先者

用一个分数排所有持续学习方案会掩盖任务边界。今天最成熟的突破,都来自可验证、可回放、可拒绝坏更新的窄域。

VERIFIABLE DISCOVERY

AlphaEvolve

算法发现

Gemini 生成候选 + 自动评估器 + 演化搜索,已用于 Google 基础设施与数学/算法问题。

成熟窄域领先
HARNESS EVOLUTION

RELAI-VCL / Self-Harness / DGM-H

76.4

RELAI-VCL 在其小型双阶段 Terminal-Bench 设置中领先,并实现正迁移 + 后续继续进步;不能外推为通用 SOTA。

新论文 / 小评测
MODULAR PEFT

Macaron / MinT + K3 Multi-LoRA

2M / 2.8T

前者公开了 2M 级精确训练方向,后者把 LoRA 带到 2.8T 模型;二者尚未成为同一条可复现链。

厂商工程前沿
MODEL UPDATE

On-policy distillation

稳定 + 稠密监督

让学生在自己的分布上采样,再由教师给稠密目标;比离线 SFT 更贴近部署分布,也比纯 RL 信号丰富。

高潜路线
SELF-REWRITING SOFTWARE

Darwin Gödel Machine

20 → 50

在论文设置中通过改写 Agent 代码提升 SWE-bench;底座模型不变,属于 Harness 自进化。

公开研究
GENERAL CONTINUAL BRAIN

仍未解决

No public SOTA

人类式少样本、跨域正迁移、在线更新、跨实例汇聚、不遗忘、可审计与可撤销,尚无公开系统同时满足。

核心空白

六条主路线

路线改变什么进展主要瓶颈
记忆 / RAG外部状态最成熟、可产品化检索污染、过期、权限与“记得≠会做”
Skill / Harness 进化工具与工作流2025–26 快速前进奖励作弊、软件腐化、评测过拟合
Adapter bank / LoRA模块化参数可扩到超大 MoE路由、合并、版本爆炸、跨专家迁移
回放 + 正则权重巩固方式传统 CL 基线难扩展到开放任务,回放成本与隐私
On-policy RL / 蒸馏部署分布上的策略高潜、仍在早期教师偏差、验证器、成本、长期稳定性
自举科研 / 算法进化任务、系统乃至优化器可验证窄域已有效开放世界评价与安全边界
07 / ENDGAME

最可能的行业解,不是“永远在线改权重”

近期 SOTA 更像分层记忆系统与受控软件发布系统的结合:高频经验留在外部,低频高价值规律才逐级巩固进参数。

01 / OBSERVE事件化经验

动作、观察、结果、因果父节点、权限与隐私标签

02 / VERIFY多验证器

测试、规则、真实结果、模型裁判与不确定性

03 / ROUTE选学习层

不更新 / 上下文 / 记忆 / skill / LoRA / 全权重

04 / CONSOLIDATE周期性巩固

回放、on-policy 蒸馏、RL、adapter 合并与淘汰

05 / RELEASE门禁与回滚

旧任务回归、canary、漂移监测、版本化撤销

近中期胜出架构

冻结的 frontier base + 每用户/租户记忆 + 版本化技能/Harness + adapter bank + 周期性 on-policy 更新 + 确定性验证与回归门禁。

最重要的设计原则

写入权必须比读取权更严格。模型可以自由提出经验,但只有可追溯、可重放、可验证、可撤销的经验才有资格被巩固。

行业终局的 moat: 不是单个模型权重,而是“哪些经验值得学”的数据资产、环境快照、因果结果、验证器组合和长期不回退记录。
08 / YOUR WEDGE

你可以提供的接口:Experience Gateway

结合你已有的多模型 Gateway、Code Agent、OpenCLI/Kimi 适配器、eval harness 与 Fireworks K3 LoRA 通路,最有价值的不是再托管一个模型,而是做跨模型的“学习控制平面”。

Agent / OpenCLI
Android / Browser
Multi-agent Sim
EXPERIENCE GATEWAY

capture · replay · verify · distill · promote · rollback

Kimi K3 / Fireworks
GLM / Macaron
任意训练后端

/v1/experience

不可变动作—观察—结果事件;带版本、因果链、同意与 PII 等级。

/v1/replay

环境快照和确定性回放;让失败可复现,让奖励可审计。

/v1/verify

测试、规则、外部结果、模型裁判的多证据融合与 provenance。

/v1/distill

将验证轨迹转换成 case、lesson、skill、HCP patch 或 adapter 数据。

/v1/promote

回归门禁、canary、版本、回滚;像发布代码一样发布“学到的东西”。

/v1/route-learning

按频率、价值、风险决定进入上下文、记忆、skill、LoRA 或权重。

/v1/eval/prequential

先预测、后观察、再学习;测适应、保持、迁移和单位成本。

/v1/registry

跨模型的 adapter / skill 生命周期、依赖、兼容性与废弃策略。

最小经验事件 · 建议 schema
{
  "experience_id": "exp_01J...",
  "tenant_id": "t_acme",
  "task": {"type": "code.fix", "spec_hash": "sha256:..."},
  "runtime": {
    "model": "kimi-k3",
    "adapter": "l2-code@17",
    "harness": "hcp@42",
    "environment": "sandbox:sha256:..."
  },
  "causal_parents": ["exp_01H..."],
  "trajectory_ref": "s3://immutable/trace/...",
  "outcome": {
    "verifiers": [
      {"type": "tests", "score": 1.0, "evidence_ref": "run_88"},
      {"type": "llm_judge", "score": 0.82, "uncertainty": 0.14}
    ],
    "reward_vector": {"correctness": 1, "latency": -0.23, "cost": -0.07}
  },
  "governance": {
    "consent": "training_allowed",
    "pii_class": "none",
    "retention_days": 90
  }
}

六周 MVP:从 Code Agent 切入

W1 · 捕获

事件 schema、轨迹 collector、模型/Harness/环境版本。

W2 · 重放

容器快照、确定性测试、多验证器 provenance。

W3 · 晋升

memory/skill 生成、回归集、canary 与 rollback。

W4 · 教师

K3 影子生成难题、审阅失败、提 HCP patch。

W5 · LoRA

Fireworks 上训练 K3 L2 adapter,多 LoRA A/B。

W6 · 复利

双阶段序列评测、学习曲线、成本与保持 dashboard。

你的差异化: 模型厂商卖“会做事的模型”;你卖“任何模型都能安全地从真实结果中变好”的协议与控制面。
09 / GATES

如何证明它真的在持续学习

不能只看更新后的新任务分数。正确评测是按时间排序,在模型看到答案之前打分,并持续回放旧任务。

指标问的问题建议算法 / 记录
Prequential score看到新经验之前,当前系统能做对吗?predict → observe → learn,按时间累计
Adaptation gain给 k 条经验后,新任务提升多少?Δ success@k,画样本效率曲线
Backward transfer学新任务后,旧能力变好还是变坏?旧任务固定回归集,按 cohort 分层
Forward transfer没见过的相关任务是否更容易?保留隐藏任务族,防止重复题伪装迁移
Learning efficiency每 1K token / 每美元 / 每分钟换来多少提升?Δ outcome ÷ train+infer+verify cost
Calibration系统知道什么时候不该学、不该答吗?不确定性、拒答、验证器分歧、回滚率
Governance坏经验、隐私或攻击能否污染全局?权限、数据谱系、poison canary、删除传播

建议的 go / no-go 门槛

+10pp

目标任务绝对成功率,或至少 +20% 相对提升

<2pp

旧任务保持下降上限

至少三个连续学习周期仍有正迁移

0 P0

安全、隐私、数据污染的严重回归

以上是建议门槛,不是行业标准;应按任务价值和故障成本调整。

必须保留六组对照: 不学习、仅上下文、RAG / memory、skill / Harness、adapter / LoRA、全权重更新。否则你无法知道收益究竟来自哪里。
10 / TIMELINE

从“神经元一起激活”到“Agent 自己改 Harness”

持续学习不是 2026 年突然出现的新词。变化在于:模型终于有了环境、工具、可验证结果与足够便宜的训练接口。

Hebbian learning

“一起激活就加强连接”的局部学习思想,奠定经验驱动适应的直觉。

递归自我改进

I. J. Good 提出超智能机器能设计更好的机器;“智能爆炸”进入思想史。

灾难性遗忘被系统描述

神经网络学习新任务时会快速破坏旧任务,稳定—可塑性成为长期核心难题。

EWC 与现代深度持续学习

用参数重要性约束更新;与 replay、动态网络等路线共同形成现代 CL 工具箱。

Reflexion / Voyager

大模型开始把反思写入外部记忆,把可执行程序沉淀成技能;能力可跨 episode 复用。

Era of Experience

Silver 与 Sutton 主张 Agent 将主要从自身行动与环境结果中学习,而非只靠人类生成数据。

AlphaEvolve / DGM

可验证算法发现和 Harness 自改写分别展示窄域经验复利;底座仍多为冻结模型。

On-policy distillation / Self-Harness

学习开始更贴近模型自己的部署分布;系统化弱点发现、提案、回归验证成为主线。

Macaron / RELAI-VCL / HyperAgents

模块化超大模型训练、跨阶段 Harness 优化与元改进过程同时涌现;持续学习从概念走向系统竞争。

受控模型—Harness 共进化

高频经验留在可撤销层,稳定规律周期性巩固进 adapter / 权重;用长期回归而非单轮榜单定义进步。

11 / FAQ

常见问题

把最容易混淆的概念与实现决策放在一起。

K3 替掉 GLM-5.2,预期能提升多少?

无法从公开 benchmark 推出你的系统提升。厂商同表中,K3 在编码、终端、自动化和 Office 任务常有明显领先,但持续学习增益取决于同一 Harness 下的轨迹质量、验证器和更新稳定性。先设 +10pp 或 +20% 相对成功率的工程门槛,再用你的任务 A/B。

为什么不直接做四个 K3 LoRA 专家?

因为你会同时改变底座、路由、数据、训练与部署,失败时无法归因。先迁 L2 Coding,它有确定性测试;若成功,再迁 L1 Personal Agent。Chat 与 GenUI 的奖励更主观,适合后置。

1M 上下文等于持续学习吗?

不等于。它像更大的工作台:能放更多材料,但请求结束后不会自然形成长期、可迁移的能力。持续学习至少需要跨任务保存、选择、巩固与回归验证。

RAG、memory 和 LoRA 应该怎么分工?

频繁变化、需删除、用户私有的信息进 memory / RAG;可解释且反复使用的流程进 skill / Harness;跨场景稳定、频繁触发、上下文表达成本高的行为模式才考虑 LoRA;全权重更新留给广泛且确定的分布变化。

最值得先收集哪类数据?

不是泛泛的对话,而是带环境快照、动作、真实结果、验证证据和失败原因的可重放轨迹。Code Agent 的测试、终端返回码、补丁 diff 与用户是否接受,是很好的起点。

LLM-as-judge 能当唯一奖励吗?

不建议。模型裁判会有偏好、自洽偏差和被奖励破解的风险。优先使用测试、形式规则、真实业务结果;模型裁判用于覆盖模糊维度,并保留不确定性和多裁判分歧。

Fireworks K3 LoRA 能复刻 Macaron 的 2M 训练吗?

目前不能等价复刻。K3 托管 LoRA 的公开训练上下文上限为 192K,而 Macaron / LongStraw 的标志性主张是约 2.1M 精确训练。托管 LoRA 适合验证单专家价值,不是 LongStraw 的替代品。

谁最可能先突破?

“最先做出实用系统”更看好 OpenAI / 翁荔;“底层学习原理”SSI / Ilya 可能性更高;“开放且低成本”更像 DeepSeek;“可验证科学窄域”Apex 有切口。所有概率都高度不确定,真正通用的持续学习目前没有公开赢家。

持续学习最大的安全风险是什么?

把一次恶意或偶然的成功当成规律并扩散到全局。防线包括写入权限、经验谱系、污染 canary、租户隔离、最小化训练数据、可撤销 adapter、旧任务回归与人工审批高风险晋升。

12 / SOURCES

证据等级与主要来源

已证实 = 官方或论文直接支持;厂商自报 = 有一手材料但缺独立复现;分析推断 = 基于公开事实的判断;尚未公开 = 关键证据不存在。

MACARON · 官方研究页Introducing Macaron v1
MACARON · 模型与 HarnessVenti Model Card · Mixture-of-LoRA Harness
MACARON · 长训练LongStraw paper · Repository
MINT · 超大模型适配器训练MinT paper · verl-MinT
KIMI · 代码与模型卡Kimi K3 GitHub · Hugging Face · Technical report
KIMI · APIK3 Quickstart
GLM · 模型与训练GLM-5.2 Model Card · GLM-5 GitHub
FIREWORKS · 训练K3 LoRA Training · Pricing
OPENAI · 自我改进案例GPT-Red
翁荔 · 职务确认TechCrunch report
梁文锋 · 未确认转写36Kr 转述 · 新浪财经转述
陈勇超 · 一手Apex 创立公告 · 个人主页
APEX 路线相关TUMIX · AutoResearch 综述
ILYA / SSIIlya 访谈 · SSI
SSI × NVIDIA官方合作公告
ERA OF EXPERIENCESilver & Sutton paper
DARWIN GÖDEL MACHINEPaper · Sakana overview
HYPERAGENTS / DGM-HMeta research page