0摘要:五个关键结论
个性化一个用户所需的参数增量(LoRA,7B 基座)
≈0.2%
约 10–40 MB,而非一个 14 GB 的模型副本
单张 GPU 可同时服务的个性化补丁数(S-LoRA)
数千个
吞吐较朴素方案最高提升 4×
超网络"生成"一个用户的个性化参数耗时(P2P)
0.57 秒
逐用户微调(OPPU)需 20.44 秒,约 36×加速
动态稀疏注意力的解码加速(NSA,64k 上下文)
11.6×
前向 9×、反向 6×,效果不降反升
- "注意力固定"需要先拆解。Transformer 的注意力权重本来就随输入动态计算;真正固定的是三样东西——计算模式(所有 token 花同样算力)、参数(对所有人用同一套"注意力习惯")、可塑性(推理时冻结,不随交互成长)。这三层对应三条完全不同的技术路线。
- "动态分配注意力"已是 2024–2026 年最活跃的架构方向之一,不是设想而是现实。MoE 动态选参数、MoD 动态选层、NSA / MoBA / DSA 动态选 token、Titans / TTT 在测试时边用边学。DeepSeek V3.2 的稀疏注意力已让 API 价格减半,MoBA 已在 Kimi 生产环境运行。[1–5]
- 专人专属注意力 ≠ 一人一个微调模型。正确的单位不是"模型"而是"增量":LoRA 补丁只占约 0.1%–1% 参数,基座共享、补丁热插拔;把低秩增量挂在注意力投影矩阵(WQ/WK/WV)上,就是字面意义上的"每个人有不同的注意力变换"。逐人训练太贵的问题,已被超网络路线破解——用户画像一次前向直接生成该用户的参数。[15–19]
- 架构完全不动,也有四级过渡方案。内容层(记忆/RAG)→ 表征层(steering 向量、PASTA 注意力重加权,免训练)→ 参数层(per-user LoRA + 多租户服务)→ 架构层(测试时学习)。每一级都有已发表方法和可用工程,可以渐进上量。
- "一个领域一个注意力模型"不仅可行,而且已有工业先例(Branch-Train-Merge/MiX 的领域专家、遍地的领域 LoRA、LoraHub 组合、Text-to-LoRA 按描述生成)。500 个领域 × 每个 20–40 MB ≈ 10–20 GB 总存储,一台推理服务器即可承载;真正的难点在路由(该用哪个)与基座升级时的批量重训。合理顺序:领域级 → 群体级 → 个人级。
v1.1 修订新增:第 8 节(Claude / OpenAI / Gemini 商用机制对照、Text-to-LoRA 命令行级用法与边界)、第 9 节(GLM-5.2 / Kimi K3 落地手册:分档架构、五步自动化流水线、六个场景的价值账)。
1问题澄清:注意力到底"固定"在哪里
"当前注意力机制是固定的"——这句话对一半。先把"固定"拆开,后面的所有方案才有落点。
1.1 注意力权重本身是动态的
标准自注意力 softmax(QKT/√d)·V 中,每个 token 对其他 token 的注意力权重完全由当前输入内容决定——换一句话,权重分布就完全不同。所以严格地说,Transformer 的注意力从诞生起就是"内容驱动的动态加权"。它和人类注意力的差距不在"权重会不会变",而在下面三个层面。
1.2 真正固定的三个层面
- ① 计算模式固定(算力平均主义)。每一层、每个头,都要对所有 token 两两算一遍相关性:一个"的"字和一个关键论点花的算力一模一样。人类恰恰相反——注意力的本质是放弃:视网膜只有中央凹是高清的,大脑只精细加工被选中的一小部分。模型"看哪里"是动态的,"花多少算力看"却是静态的。
- ② 参数固定(千人一面)。决定"什么值得关注"的投影矩阵 WQ/WK/WV 训练后冻结。放射科医生看 X 光片的眼动模式是多年训练"刻"出来的,和实习生完全不同;而同一个基座模型给医生和给诗人用的是同一套注意力参数,个体差异只能靠输入内容(提示词、记忆)间接注入。
- ③ 可塑性缺失(不随使用成长)。人类注意力系统会因经验持续重塑;模型在推理时不发生任何学习,今天教会它"重点看合同的违约条款",明天的会话里这个"注意力习惯"荡然无存——除非写进记忆再靠内容提醒它。
1.3 与人类注意力的逐项对照
认知科学通常把人类注意力概括为:容量有限所以必须选择(Kahneman 的资源分配理论),由自下而上的显著性与自上而下的目标共同驱动(偏向竞争理论,Desimone & Duncan 1995),并且高度可塑。对照如下:
表 1 · 人类注意力 vs. Transformer 自注意力
| 维度 | 人类注意力 | Transformer 自注意力 |
| 算力分配 | 极端不均:选中处精加工,其余粗略或抑制("放弃"是核心能力) | 均匀:每个 token 两两全算,O(L²);不重要的内容不省算力 |
| 驱动方式 | 自下而上(显著性)+ 自上而下(当前目标持续调制) | 内容相似度驱动;"目标"只能靠提示词写进上下文间接实现 |
| 个体差异 | 显著:专家与新手的注意力模式截然不同,且因人经验而异 | 无:同一模型对所有用户使用同一套注意力参数 |
| 可塑性 | 终身可塑,训练可重塑(专家养成) | 推理时冻结;只有重新训练/微调才改变 |
| 时间连续性 | 目标可跨任务、跨天保持(警觉、期待、习惯) | 不跨会话;上下文窗口即全部"当下" |
| 容量约束 | 严格受限(约 4±1 组块的工作记忆),因此必须取舍 | 受上下文长度与显存限制;长上下文中出现"注意力稀释/迷失" |
核心洞察
三层"固定"对应三条技术路线:①算力平均主义 → 动态稀疏/条件计算(第 2 节);②千人一面 → 参数级个性化(第 5 节);③不可塑 → 测试时学习/持续学习(第 2.4、4 节)。讨论"动态注意力"时不区分这三层,是大多数争论各说各话的原因。
2动态注意力:已有的尝试
这个方向不但被想过,而且是当下架构研究竞争最激烈的赛道。按"动态化的对象"可以分成四条路线。
2.1 路线一:动态决定"看多远、想多久"
最早的尝试直接冲着"算力平均主义"去。Adaptive Attention Span(FAIR,2019)让每个注意力头自己学习需要回看多长的历史——结果发现底层头只需要很短的窗口,只有少数高层头需要长程注意力,这本身就证明了"均匀分配是浪费"。[6]更早的 Adaptive Computation Time(Graves,2016)及后来的 Universal Transformer、PonderNet 则让模型动态决定对每个位置"思考几步"——今天推理模型(o1/R1 类)按题目难度决定"想多久",是这条线在 test-time compute 上的延续。[7]
2.2 路线二:动态决定"看哪里"——稀疏注意力的复兴(2025 年爆发)
早期稀疏注意力(Sparse Transformer、Longformer、BigBird)大多用预先固定的模式(滑窗+全局 token),不算真正动态;Reformer、Routing Transformer 用哈希/聚类做内容驱动的动态稀疏,但硬件效率差,一直没成为主流。转折发生在 2025 年——三个工业级方案同时证明:可学习的动态稀疏注意力能同时做到更快和不掉点。
- NSA(DeepSeek,2025.2):每个 query 通过三条并行分支看上下文——压缩(把历史聚合成块级摘要,粗看全局)、选择(挑出最相关的 token 块精读)、滑窗(保住局部细节),再用可学习的门控加权融合。三条分支像人的"扫一眼全局 + 盯住重点 + 顺带看邻近",且端到端可训练、按 GPU 特性对齐设计。64k 序列上解码加速 11.6×、前向 9×、反向 6×,通用与长文benchmark 追平或超过全量注意力,获 ACL 2025 最佳论文奖。[1]
- MoBA(月之暗面,2025.2):把 MoE 思想搬进注意力——上下文切块,每个 query 经门控只路由到 top-k 个最相关的块,"该看哪里"完全由模型自主决定(论文强调 less structure 原则:不预设人为模式)。可在全量/稀疏注意力间无缝切换,已部署在 Kimi 的长上下文生产服务中。[2]
- DSA(DeepSeek V3.2,2025.9):用一个轻量"闪电索引器"(lightning indexer)为每个 query 快速打分,只对 top-k(2048)个历史 token 做真注意力,把主注意力从 O(L²) 降到 O(L·k)。直接结果:官方 API 长上下文价格砍半——动态注意力第一次以"账单"的形式被用户感知。[3]
2.3 路线三:动态决定"用哪部分脑子"——条件计算
- MoE(混合专家):每个 token 经路由器动态选择激活哪几个专家(如 DeepSeek-V3:671B 总参数,每 token 只激活约 37B;Mixtral:8 选 2)。这是"动态分配参数"——不同输入用模型的不同部分处理,已是旗舰模型标配。
- Mixture-of-Depths(DeepMind,2024.4):每层动态决定哪些 token 值得算,其余走残差直通——重要的词多算几层,虚词少算几层,同等算力下追平稠密基线。这是对"算力平均主义"最直接的否定。[4]
- MoDA(字节 Seed,2026.3):让注意力头跨层访问历史 KV(深度维度的注意力),缓解深层信息稀释,仅 3.7% FLOPs 开销带来下游任务 +2.11%——说明"注意力在哪一层看"也可以动态化。[5]
2.4 路线四:动态到参数层——测试时学习(最接近"人"的一条)
- TTT layers(2024.7):把 RNN 的隐状态本身做成一个小模型,推理时用梯度下降持续更新它——"读上下文"这个动作变成了"就地学习"。[9]
- Titans(Google,2025.1,NeurIPS 2025):引入神经长期记忆模块,按"惊讶度"(梯度大小)决定记住什么、按时间衰减决定忘掉什么,在测试时持续写入。这已经非常接近人类"注意力↔记忆"的耦合机制:出乎意料的东西自动获得更多加工。[10]
- Differential Transformer(微软,2024.10):算两组注意力图相减,像降噪耳机一样消掉"注意力噪声",显著提高对关键信息的信噪比——解决的是长上下文中"注意力被无关内容稀释"的问题。[8]
核心洞察
四条路线正好对应人类注意力的四个特征:看多远/想多久(跨度)、看哪里(选择)、用哪部分脑子(资源)、边看边学(可塑)。前三条已进入生产;第四条(测试时学习)是 2025–2027 年的前沿,也是"专人注意力"的终极形态。
3面临的挑战
动态注意力喊了十年才落地,卡点不在想法,在下面五件事。
- ① 硬件天生偏爱"规则稠密"。GPU 靠大块矩阵乘吃满算力;动态稀疏意味着不规则访存、分支发散,理论省的算力常被访存开销吃回去。早期稀疏注意力"论文里快、卡上慢"就是败在这里。NSA 的最大贡献不是"更稀疏",而是按块选择、按 GPU 访存模式对齐——把动态性设计成硬件友好的形状。这一条也是未来所有动态化方案的第一道关。
- ② 离散选择不可微。"选哪些 token / 块 / 专家"是离散决策,梯度传不过去,只能靠软化近似、直通估计或辅助损失,训练稳定性差;MoE 的负载均衡(防止路由塌缩到少数专家)至今仍要精细调教。
- ③ 训练-推理不一致。很多方案在训练时用全量注意力、推理时才裁剪(事后稀疏),模型没学过"在稀疏视野下工作",长链条推理时误差累积。NSA 用"原生可训练"直接回应这一点:预训练阶段就让模型习得自己的稀疏习惯。
- ④ "分配得好不好"难以度量。人类注意力有眼动仪可测,模型的注意力分配质量缺乏直接指标——注意力权重与模型行为解释之间的关系本身在学界就有争议("attention is not explanation" 之争)。最终只能靠端到端任务表现回推,调试反馈链条很长。
- ⑤ 动态性放大行为方差,个性化再叠加一层风险。路由决策让相同输入可能走不同计算路径,复现、评测、对齐都更难;到"专人注意力"层面,还要加上隐私(个性化参数即用户画像)、回音室(越来越只关注用户爱看的)、对齐漂移(个性化补丁可能削弱安全训练)三重治理问题。
4未来会如何发展
- 短期(1–2 年):动态稀疏成为长上下文标配。NSA / MoBA / DSA 三条线正在合流,"全量注意力"将像当年的"全精度推理"一样退为特例;算力从"想多久"(test-time compute)进一步细化到"看哪里"(token 级)、"用哪层"(深度级)的三维动态分配。
- 中期(2–4 年):记忆与注意力融合,测试时学习进入主流架构。Titans / TTT 类混合架构(注意力做短程精确检索 + 神经记忆做长程压缩存储)有望成为下一代基础架构;上下文不再是"平铺的 token",而是分层的、按惊讶度写入的记忆。这一步落地之日,"模型在与你交互中就地重塑注意力"就从比喻变成机制。
- 长期(4 年+):持续学习/终身个性化。最后一块拼图是让这种就地学习跨会话持久化而不产生灾难性遗忘与对齐漂移——技术上(参数隔离、记忆巩固)和治理上(个性化参数的隐私归属)都是硬问题。谁先解决,谁就拥有真正意义上"越用越懂你"的模型,而不是"记事本越来越厚"的模型。
5专人专属注意力:从"不同记忆"到"不同注意力"
现在的个性化(历史聊天提取、记忆、RAG)都在改变模型看到什么;你问的是怎么改变模型怎么看。这是两条不同的轴,后者有一个从免费到昂贵的完整干预谱系。
5.1 先划清两条轴
记忆轴(改内容):把用户相关信息注入上下文——模型的注意力参数没变,只是被喂了不同的东西。便宜、可解释,但它改变不了模型的"加工习惯":一个对法律条文不敏感的模型,你把合同贴给它,它依然按通用方式分配注意力。
注意力轴(改加工):让"什么值得关注"这个函数本身因人而异——同样一份合同,给律师用户的模型自动重仓违约与管辖条款,给财务用户的模型自动重仓付款与税务条款,即使提示词完全相同。实现它不需要重训模型,下面按成本从低到高给出五级手段。
5.2 干预谱系:五个层级
L0
提示层:系统提示 + 记忆 / RAG(现状)
在提示里写"重点关注 X"。本质是通过内容间接牵引注意力分布——有效但弱、不稳定,长上下文中易被稀释。
每用户增量:几 KB 文本 · 训练:无 · 现成度:所有产品都在用
L1
表征层(免训练):PASTA 注意力重加权 / steering 向量
PASTA 在推理时直接把指定文本片段在部分注意力头上的权重调高——字面意义的"告诉模型往哪看",免训练,只需对模型做一次性"头部画像"。steering 向量则是每人一个方向向量加在残差流上,持续改变模型的"关注倾向"。
每用户增量:几十 KB · 训练:无/极轻 · 现成度:论文+开源库(pastalib),需自集成
L2
输入参数层:软提示 / 前缀微调
每人一段可学习的"虚拟 token",拼在每层注意力的 K/V 前面——相当于给每个用户配一副"注意力预调滤镜"。大模型上效果可逼近全量微调(Lester et al. 2021)。
每用户增量:0.1–10 MB · 训练:轻量(冻结基座) · 现成度:PEFT 库开箱即用
L3
权重增量层:per-user LoRA(可只挂注意力矩阵)
每人一组低秩增量 ΔW 挂在 WQ/WK/WV/WO 上——每个用户的 Q/K/V 变换不同,注意力分布真的因人而异。这是"专人注意力配置"的字面实现。基座共享、补丁热插拔,OPPU(one-PEFT-per-user)已系统验证效果。
每用户增量:10–40 MB(7B 基座,rank 8–16) · 训练:每人几分钟-几十分钟 GPU · 现成度:多租户服务成熟(S-LoRA / Punica / vLLM)
L4
生成层:超网络按画像"生成"个性化参数(破解逐人训练)
P2P(ACL 2026):用户画像(历史行为摘要+检索样例)→ 超网络一次前向 → 直接输出该用户的 LoRA 参数。0.57 秒/人,零逐人训练,LaMP 基准上反超逐人微调,对新用户即时生效。Text-to-LoRA(Sakana AI)同思路:一句任务描述生成一个 adapter。
每用户增量:同 LoRA,但无需逐人训练 · 一次性成本:训练超网络(约 1,450 个用户后摊平) · 现成度:2025–2026 前沿,代码已开源
5.3 "需要微调吗?一人一个模型?"——算一笔账
不需要"一人一个模型"。个性化的正确单位是增量(Δ)而不是副本:
表 2 · 五级方案对比(以 7B 基座为例;成本为量级估计)
| 方案 | 改变什么 | 每用户增量 | 每用户训练成本 | 能否改变"怎么看" | 代表工作 |
| 全量微调副本 | 全部权重 | ≈14 GB | 数小时 GPU | 完全 | —(不可行,仅作参照) |
| per-user LoRA | 注意力/FFN 的低秩增量(≈0.2% 参数) | 10–40 MB | 几分钟–几十分钟 | 是(Q/K/V 变换因人而异) | OPPU · S-LoRA |
| 超网络生成 LoRA | 同上,参数由画像生成 | 10–40 MB | ≈0(0.57 秒生成) | 是 | P2P · Text-to-LoRA |
| 软提示/前缀 | 每层注意力的 K/V 前缀 | 0.1–10 MB | 轻量 | 部分(预调注意力起点) | Prompt/Prefix Tuning |
| steering 向量 | 残差流方向 | 几十 KB | 极轻/无 | 部分(改变关注倾向) | BiPO 等 |
| PASTA 重加权 | 推理时指定头的注意力权重 | ≈0(一份配置) | 无(一次性头部画像) | 是(直接改分布) | PASTA · LLMSteer |
| 记忆/RAG(现状) | 输入内容 | 几 KB–几 MB 文本 | 无 | 否(只改"看什么") | 各产品记忆功能 |
回答你的问题
"是需要微调么?一人一个微调版本?"——需要"因人而异的参数",但不需要"逐人微调",更不需要"一人一个模型"。工程答案是三件套:基座共享 + 每人一个热插拔小增量(LoRA/软提示/向量,MB 级)+ 超网络即时生成增量(免逐人训练)。单卡同时服务数千用户的个性化补丁在 2023 年(S-LoRA)就已解决;为新用户生成补丁的成本在 2025 年(P2P)降到了秒级。
6架构不动的过渡方案(工程路线图)
假设基座架构与权重都不能动(用 API 或不想维护训练管线),依然存在一条能渐进上量的路径。
阶段 0 · 现在就能做:把"内容层"做到极致
- 结构化用户画像(职业、目标、偏好的关注点)+ 记忆提取,注入系统提示;明确写出"本用户优先关注 X、忽略 Y"——这是在用内容模拟注意力先验。
- 让应用层显式标注重点(高亮、加权重述关键段落、把关键信息放在上下文首尾以对抗 lost-in-the-middle)。
- 指标:建立每用户的"关注命中率"评测(模型的回应是否覆盖了该用户真正关心的维度)——没有这个指标,后面所有阶段都无法验证收益。
阶段 1 · 数周级:表征层干预(免训练/极轻训练,自部署模型可用)
- 集成 PASTA 式注意力重加权:对部署的模型做一次头部画像,之后每个用户一份"重加权配置"(哪些类型的内容片段上调),推理时生效,零训练。
- 从用户点赞/修改行为中学 per-user steering 向量(几十 KB/人),挂在推理管线上。
- 这一阶段的本质:注意力配置成为用户资料的一部分,像头像一样跟着用户走。
阶段 2 · 数月级:参数层平台化(个性化的"正餐")
- 推理侧接入 multi-LoRA 服务(vLLM / S-LoRA / Punica,均开源):基座常驻显存,用户补丁按请求换入换出,统一分页内存管理。
- 冷启动走 超网络生成(P2P 路线):新用户注册即得个性化参数,0 训练等待;高价值/高数据用户再升级为 OPPU 式精调补丁。
- 隐私设计:个性化增量即用户画像的浓缩,应按用户数据对待(加密存储、可删除、可导出;敏感场景考虑本地/联邦训练)。
- 安全回归:每个补丁上线前跑对齐回归测试,防止个性化削弱安全行为。
阶段 3 · 跟随架构演进:测试时学习
- 当 Titans / TTT 类架构商用化,前三阶段积累的用户画像、评测体系、隐私框架全部直接复用——迁移的只是"个性化载体"(从静态补丁变成持续更新的记忆模块)。
- 提前布局的判断依据:该类架构是否出现在主流开源基座中(信号:Qwen/Llama 级别的模型采用混合记忆架构)。
核心洞察
四个阶段不是替代关系,是叠加关系:记忆(看什么)+ 重加权(往哪看)+ 补丁(怎么看)+ 就地学习(越看越会看)。每一层收益独立可测,失败可单层回滚——这正是"架构升级不了"时最稳的演进结构。
7"一个领域一个注意力模型"可行性分析
你的直觉是对的,而且这条路比"一人一个"更先走通——它已经有名字、有先例、有成本账。
7.1 先例:这件事已经被做过三遍
- MoE 隐式做过:混合专家模型里,不同专家确实会形成分工,但专家的"领域"是训练中自发涌现的,与人类领域划分并不对齐,也无法单独管理。它证明了"分而治之"有效,但不可控。
- Branch-Train-Merge / Branch-Train-MiX 显式做过:BTM(2022)按语料领域分支训练专家模型再组合;Meta 的 BTX(2024)进一步把各领域专家合并回一个 MoE,路由器学会按输入选领域专家——这就是"一个领域一个模型"的字面工业实现。[21]
- 开源社区每天在做:医疗、法律、金融、代码领域的 LoRA 已是事实标准;LoraHub(COLM 2024)证明多个领域 LoRA 可以动态加权组合去应对没见过的任务;Text-to-LoRA(Sakana AI)更进一步——一句领域描述直接生成对应 adapter。[18][20]
7.2 成本账:数百个领域完全在工程舒适区内
表 3 · "500 个领域注意力补丁"成本估算(7B 基座,LoRA rank 16,挂注意力+FFN;量级估计)
| 项目 | 单领域 | 500 个领域合计 | 说明 |
| 存储 | 20–40 MB | 10–20 GB | ≈ 一个 14B 模型的体积;对象存储成本可忽略 |
| 训练(一次性) | 数百–数千条数据,数 GPU 时 | 数千 GPU 时以内 | 可全并行;领域数据远比个人数据易获取、可复用 |
| 推理服务 | 1–2 张卡起步 | S-LoRA 式统一分页:基座常驻,热门补丁驻显存,长尾按需换入 |
| 切换开销 | 毫秒级 | 多租户 LoRA 服务的成熟能力,同 batch 可混合不同补丁 |
| 基座升级重训 | 全量补丁重训 | 最大隐性成本:增量与基座绑定;超网络路线可缓解(重训超网络→批量重新生成) |
7.3 真正要设计的三个问题
- ① 路由:谁来决定用哪个领域?四种机制按可控性排序:(a) 用户/应用显式选择(最可控,适合 To B);(b) 轻量分类器按输入路由(毫秒级,需置信度阈值,低置信回退通用基座);(c) LLM 自路由(灵活但引入额外延迟);(d) LoraHub 式软组合(多个领域按权重叠加,应对交叉任务)。建议 a+b 混合起步。
- ② 边界:领域是模糊的。"医疗合同纠纷"该用医疗还是法律补丁?两个可行答案:补丁可加权叠加(LoRA 天然支持线性组合,但需评测组合后是否互相干扰);或参照 BTX,把领域专家合并成显式 MoE,让路由在 token 级完成。
- ③ 版本与回归:一个领域一份考卷。每个领域补丁需要独立评测集与安全回归;500 个领域的 CI 矩阵是真实的维护负担——这是"数百个领域"从可行到可持续的分水岭,建议领域按使用量分级维护。
7.4 与相邻方案的对照
表 4 · 领域注意力补丁 vs. MoE vs. 个人补丁
| 维度 | 领域 LoRA 库(本方案) | MoE(模型内专家) | per-user 补丁(第 5 节) |
| 粒度 | 会话/请求级,按领域 | token 级,自动 | 会话级,按人 |
| 分工是否可控可解释 | 是:人为定义、可单独增删 | 否:涌现分工,不与人类领域对齐 | 是,但每人一份 |
| 需要改架构吗 | 否(推理框架加载即可) | 是(需 MoE 基座) | 否 |
| 数据需求 | 每领域数百–数千条,易获取 | 预训练级 | 每人的行为数据,稀疏且隐私敏感 |
| 冷启动 | 好(领域先验现成) | — | 难(靠超网络画像生成缓解) |
| 适合作为 | 第一步:先验强、复用高 | 基座能力(由模型厂商解决) | 第二步:叠加在领域补丁之上 |
结论与推荐顺序
"一个领域一个注意力模型"可行且应当先于"一人一个"去做:领域数据充足、补丁可复用、隐私压力小、数百个量级的存储与服务成本都在单机可承受范围。推荐演进顺序:领域级(数百个)→ 群体级(职业/角色,数千个)→ 个人级(超网络生成,百万级)——三级共用同一套 multi-LoRA 基础设施,且可叠加(用户 = 基座 + 领域补丁 + 个人补丁)。
8商用现状:三大厂商机制与 Text-to-LoRA 实操
把前面的 L0–L4 谱系拿来当标尺,逐一对照 Claude / OpenAI / Gemini 实际在卖什么,再把 Text-to-LoRA 拆到命令行级。
8.1 三大厂商逐一对照(截至 2026 年中)
表 5 · 三大厂商的个性化机制,映射到 L0–L4 谱系
| 厂商 | 消费级机制 | 开发者 / 企业级 | 做到"每人不同权重"了吗 |
Claude (Anthropic) |
记忆(项目内 + 跨对话)、Projects、Styles(回复风格)、Skills(可复用的技能/流程文件,按需加载——一种"程序性记忆",仍属内容层)、MCP 连接器。→ 全部 L0 |
不开放通用微调;企业经云平台(如 Bedrock)可微调个别小型号。个性化主推"记忆 + Skills"路线。 |
都没有。三家消费级全部停在 L0(改"看什么"),权重对所有用户相同;租户级微调(L3)只到"组织"粒度,不到"个人"。 原因并非技术不可行,而是:安全审查与对齐回归按"模型"为单位进行,per-user 权重会把回归矩阵放大百万倍;外加隐私归属与滥用责任。这正是开源自托管路线的差异化空间。 |
ChatGPT (OpenAI) |
记忆两件套(saved memories 显式记忆 + 引用全部历史对话的隐式画像)、自定义指令、GPT-5 人格预设、Custom GPTs、Pulse 主动简报。→ 全部 L0 |
微调 API 最全:SFT(GPT-4.1 系)、DPO、RFT(推理模型强化微调)——但粒度是"开发者的组织/产品",即 L3 用在租户级,不是个人级。 |
Gemini (Google) |
Personal Context(从历史对话自动学习用户画像,2025.8 上线)、Saved Info、Gems、接入 Gmail/Docs/搜索历史的个人上下文;临时对话(不入画像)。→ 全部 L0 |
Vertex AI 提供托管监督微调(LoRA,限 Flash 等型号);Gemini Enterprise 提供组织级个性化与记忆配置。同样止于租户级。 |
读法
三家的"个性化"本质都是越做越精的记忆系统(第 5.1 节的"记忆轴"),在"注意力轴"上均为空白——没有任何一家为个人改变哪怕 1 KB 的权重。这不是落后,是商业模式决定的取舍:闭源 API 的安全/合规按模型粒度运作。结论:L1–L4 的"专人注意力"目前只能在你自己控制权重的开源底座上做——这正是第 9 节的主题。
8.2 Text-to-LoRA:命令行级的真实用法与商用边界
Text-to-LoRA(Sakana AI,ICML 2025,Apache-2.0 开源)是一个已训练好的超网络:输入一句任务描述,一次前向直接输出一个 LoRA。实际操作四步:
# ① 装环境(需一张 >16GB 显存的 GPU)
git clone https://github.com/SakanaAI/text-to-lora && cd text-to-lora
uv venv --python 3.10 --seed && uv sync
# ② 下载官方超网络 checkpoint(基于 HuggingFace)
uv run huggingface-cli download SakanaAI/text-to-lora --local-dir .
# ③ 用一句话生成 LoRA —— 核心只有这一步
uv run python scripts/generate_lora.py <checkpoint路径> \
"从中文财报与合同文本中识别风险条款,给出条款位置与风险等级"
# ④ 挂载服务:生成的 LoRA 目录直接给 PEFT 加载,或 vLLM --enable-lora 热挂
商用边界,三条都很硬:
- 基座绑定。官方 checkpoint 只覆盖 Mistral-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-2-2b-it 三个基座;LoRA 与基座一一对应,不能拿去挂 GLM / Kimi。想在自己的底座上用这条路线,要"自训超网络":先在你的基座上训几百个领域/任务 LoRA 作训练集,再训超网络(P2P 论文就是这条路的 per-user 版,约 1,450 个用户后摊平成本)。
- 质量定位。生成式 adapter ≈"体面的零样本增益",在高价值头部任务上仍低于实训 LoRA。2026 年的正确用法:长尾领域与新用户冷启动用"生成",头部领域用"实训",两者共用同一套 multi-LoRA 服务。
- 成熟度。它是研究级开源(演示、原型没问题),没有 SLA;生产化要自己补评测门与回退机制(见 9.3)。
9开源底座落地手册:GLM-5.2 / Kimi K3
两个底座都在 2026 年开源了 1M 上下文的动态注意力架构——但"给用户提供自动化个性化"的正确姿势,取决于你的算力档位,而且个性化不一定要发生在最大的那个模型上。
9.1 先看清两个底座的硬约束
表 6 · 两个开源底座对照(2026 年 7 月)
| 维度 | GLM-5.2(智谱,2026.6) | Kimi K3(月之暗面,2026.7.27 开源) |
| 规模 | 753B 总参 / ~40B 激活(MoE) | 2.8T 总参,896 专家选 16(MoE) |
| 注意力机制 | IndexShare 稀疏注意力:多个稀疏层共享同一注意力索引器,1M 上下文下每 token FLOPs 降 2.9×(DSA 思路的工程化延伸) | KDA(Kimi Delta Attention)混合线性注意力 + attention residuals——本报告第 2 节"动态注意力"的最新生产实例 |
| 上下文 | 1M(输出至 131k) | 1M |
| 许可证 | MIT,无地域限制 | 开源权重已发布(刚开源数日,生态适配进行中) |
| 自托管现实 | 权重数百 GB 级,推理需多卡/多机;Day-0 已适配多种国产芯片 | TB 级权重,集群级部署;多数团队应走 API |
| 补丁工程含义 | 可自托管、可挂 LoRA;但在 753B 上训 LoRA 也是多机作业。家族小杯(如 GLM-4.5-Air,106B-A12B)是补丁试验田 | 旗舰不适合逐户补丁;同家族 Kimi Linear(48B-A3B,同为 KDA 架构)或 K2 系才是实验载体 |
9.2 参考架构:按算力分三档
- 档位 A · 只有 API / 纯推理算力:做 L0 到极致 + 轻量 L1。记忆画像、显式重点标注进系统提示;若自托管了任一开源模型,可加 per-user steering 向量(挂 forward hook 即可,不受 MoE/稀疏注意力影响,几百条偏好样本就能学)。注意:在 IndexShare/KDA 这类非标准注意力上做 PASTA 式权重干预,内核改造成本高,优先做 steering,别先碰注意力内核。
- 档位 B · 单机 8 卡级(多数创业团队):两级架构——旗舰(GLM-5.2 或 K3,API 或托管)当"通用大脑";小杯开源模型(GLM-4.5-Air / Kimi Linear 48B-A3B)当"个性化外壳",承载领域 + 个人 LoRA,负责按该用户视角做改写、重点标注、预处理与后处理。个性化的全部训练与服务成本都落在小杯上,单机可闭环。
- 档位 C · 多机集群(企业/平台):直接在 GLM-5.2 上做租户/领域级 LoRA(挂注意力矩阵,MIT 协议无障碍),vLLM 多补丁服务;个人级依然建议超网络生成而非逐人训练——753B 上逐人训练在经济上重演"一人一个模型"的错误。
9.3 自动化流水线:五步,可直接照抄
- 数据飞轮:埋点收集采纳/修改/高亮行为 → 整理成偏好对与示范样本,按用户/租户分桶;冷启动用画像问卷 + 用户历史文档。
- 训练作业:LLaMA-Factory 或 ms-swift 定时批量跑 LoRA(rank 8–16;
target = q/k/v/o 注意力投影——MoE 底座避开专家 FFN,补丁更小、不扰动路由,也最贴合"个性化注意力"本意)。数据少的用户先学 steering 向量,数据够了再升级 LoRA。
- 评测门(没有它一切都是玩具):每个补丁过三关——领域任务集、通用回归集(防能力退化)、安全回归集(防对齐漂移);任一不过,自动回退上一版补丁。
- 热加载服务:vLLM
--enable-lora 启动,运行时经 /v1/load_lora_adapter 动态挂载/卸载;请求按 model=租户或用户补丁名 路由,未命中回退基座。注意:单请求只挂一个 adapter,"领域 + 个人"两层叠加需离线合并(PEFT add_weighted_adapter)后作为一个补丁挂载。
- 升级预案(立项时就写进预算):基座升版 → 全量补丁批量重训(脚本化);若维护了超网络,则重训超网络 → 一键重生成全部补丁。这是"数百领域 + 海量用户"方案最大的隐性成本,见 7.2。
9.4 六个实际场景与价值账
表 7 · 场景 × 载体 × 相对"塞提示词"的增量价值
| 场景 | 个性化载体 | 价值(相对把规则塞进系统提示) |
电商客服 SaaS 每店铺一个"店铺注意力" | 租户级 LoRA;长尾店铺用生成式补丁冷启动 | 每次请求从上下文里拿掉 3–5k token 的店规:百万请求/天 ≈ 每天省 30–50 亿输入 token(直接是账单);且权重级约束比文本级稳,长对话不被稀释 |
| 律所合同审查 | 所级 LoRA(审查清单与风格)+ 会话级重点标注(谈判焦点条款) | 同一份合同,不同律所的模型自动看向各自重点;新人即用资深审查视角(专家注意力的组织资产化) |
| 医院分科报告解读 | 科室级补丁(放射/儿科/全科关注点不同) | RAG 补"知识",补不了"同一报告不同科室重点不同"——这恰是注意力层问题,内容层方案到顶也解决不了 |
| K12 个性化讲解 | 学生级,超网络按错题画像即时生成 | 新学生注册即得"薄弱点敏感"的讲解模型,把个性化从"攒几个月数据"变成"秒级冷启动" |
| 企业代码助手 | 公司级补丁(内部框架、规范、架构习惯) | 替代常驻上下文的万 token 规范文档;跨仓库命名与架构一致性由权重保证 |
| 投研 / 写作分身 | 个人 steering 向量起步,数据够后升级个人 LoRA | 分析师的风格与关注因子随人走;几十篇样本即可学出向量,是"个人级"最低门槛的入口 |
价值的三个来源
① token 账单:把常驻指令"焊进"权重,输入 token 直接省(规模化后是硬钱);② 稳定性:权重级约束不会像提示词一样在长上下文中被稀释、被越狱、被遗忘;③ 冷启动速度:生成式补丁把个性化从"先攒数据"变成"注册即得"。三者都可以在上线前用 A/B 直接量化——这也是说服业务方立项的三张牌。
10结论与建议
三句话总结:
- 模型注意力的"固定"固定在计算模式、参数、可塑性三层;其中前两层的动态化(NSA/MoBA/DSA、MoE/MoD)已在 2024–2026 年进入生产,第三层(测试时学习)是明确的下一站——方向本身没有悬念,悬念只在硬件对齐与训练稳定性的工程节奏。
- "专人专属注意力"不需要一人一个微调模型:基座共享 + 热插拔小增量 + 超网络即时生成把每用户成本从"14 GB + 数小时"压到"几十 MB + 0.57 秒",且把增量挂在 WQ/WK/WV 上就是字面意义的个性化注意力。
- 架构升级不了不是阻碍:内容层→表征层→参数层→架构层四级过渡方案每级都有已发表方法与开源工程;"一个领域一个注意力补丁"是其中性价比最高的第一步,数百个领域今天就能落地。
如果要行动,按这个顺序:①建立"关注命中率"的个性化评测(没有度量,一切优化都是盲飞);②接入 multi-LoRA 推理框架;③先做 10–20 个高频领域补丁验证收益;④用超网络路线解决个人级冷启动;⑤持续跟踪 Titans/TTT 类架构进入主流开源基座的信号。自托管 GLM-5.2 / Kimi 路线的分档架构与五步流水线,直接照第 9 节执行;三大厂商现状与 Text-to-LoRA 边界见第 8 节。
本报告基于公开论文与工程资料整理;具体数字(加速比、耗时、参数量)均出自对应论文的实验设置,迁移到不同基座/硬件时量级可参考、精确值需实测。以下为主要参考文献。
11参考文献
动态注意力与架构
- Yuan et al. Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention. DeepSeek, arXiv:2502.11089, 2025.(ACL 2025)
- Lu et al. MoBA: Mixture of Block Attention for Long-Context LLMs. Moonshot AI, arXiv:2502.13189, 2025.(代码)
- DeepSeek-AI. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models(DSA 稀疏注意力). arXiv:2512.02556;另见 SGLang 对 V3.2-Exp 的解读.
- Raposo et al. Mixture-of-Depths: Dynamically Allocating Compute in Transformer-Based Language Models. DeepMind, arXiv:2404.02258, 2024.
- Zhu et al. Mixture-of-Depths Attention (MoDA). ByteDance Seed, arXiv:2603.15619, 2026.
- Sukhbaatar et al. Adaptive Attention Span in Transformers. FAIR, arXiv:1905.07799, 2019.
- Graves. Adaptive Computation Time for Recurrent Neural Networks. arXiv:1603.08983, 2016.
- Ye et al. Differential Transformer. Microsoft Research, arXiv:2410.05258, 2024.
- Sun et al. Learning to (Learn at Test Time): RNNs with Expressive Hidden States. arXiv:2407.04620, ICML 2025.
- Behrouz et al. Titans: Learning to Memorize at Test Time. Google Research, arXiv:2501.00663, NeurIPS 2025.
- Xiao et al. Efficient Streaming Language Models with Attention Sinks (StreamingLLM). arXiv:2309.17453, 2023.
个性化:注意力与参数干预
- Zhang et al. Tell Your Model Where to Attend: Post-hoc Attention Steering for LLMs (PASTA). arXiv:2311.02262, ICLR 2024.(pastalib;另见 LLMSteer)
- Cao et al. Personalized Steering of LLMs: Versatile Steering Vectors via Bi-directional Preference Optimization. NeurIPS 2024.
- Lester et al. The Power of Scale for Parameter-Efficient Prompt Tuning, 2021;Li & Liang. Prefix-Tuning, 2021.
- Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685, 2021.
- Tan et al. Democratizing LLMs via Personalized Parameter-Efficient Fine-tuning (OPPU). EMNLP 2024.
- Lyu et al. Instant Personalized LLM Adaptation via Hypernetwork (Profile-to-PEFT, P2P). arXiv:2510.16282, ACL 2026.
- Charakorn et al.(Sakana AI). Text-to-LoRA: Instant Transformer Adaption. ICML 2025.
- Salemi et al. LaMP: When Large Language Models Meet Personalization. arXiv:2304.11406, 2023.(个性化标准基准)
多补丁服务与领域专家
- Sheng et al. S-LoRA: Serving Thousands of Concurrent LoRA Adapters. arXiv:2311.03285, MLSys 2024;Huang et al. LoraHub: Efficient Cross-Task Generalization via Dynamic LoRA Composition. COLM 2024.
- Li et al. Branch-Train-Merge: Embarrassingly Parallel Training of Expert LMs, 2022;Sukhbaatar et al.(Meta). Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM, 2024.
- Berges et al.(Meta). Memory Layers at Scale. arXiv:2412.09764, 2024.
商用现状与开源底座(v1.1 新增)
- OpenAI. Memory and New Controls for ChatGPT(saved memories + 引用历史对话).
- Google. Gemini Temporary Chats 与隐私控制;Personal Context 上线报道;Gemini Enterprise 个性化与记忆配置文档.
- Anthropic. Bringing Memory to Teams(Claude 记忆功能).
- Sakana AI. text-to-lora 开源仓库(Apache-2.0;官方 checkpoint 覆盖 Mistral-7B / Llama-3.1-8B / Gemma-2-2b).
- 智谱. GLM-5.2 上线并开源(MIT、1M 上下文、IndexShare 稀疏注意力);官方文档;规格另见 第三方技术解读(753B-A40B).
- 月之暗面. Kimi K3 开源(2026.7.27,2.8T 参数、KDA 混合线性注意力、1M 上下文):IT之家报道;21 财经报道.
- Moonshot AI. Kimi Linear 48B-A3B(KDA 架构小杯,补丁实验推荐载体).