研究报告 · LLM 架构与个性化

动态注意力与个性化注意力

从"固定计算模式"到"专人专属注意力"的技术路径:现状、挑战、过渡方案,以及"一个领域一个注意力模型"的可行性分析

2026 年 7 月 30 日基于公开论文与工程实践整理

0摘要:五个关键结论

个性化一个用户所需的参数增量(LoRA,7B 基座)
≈0.2%
约 10–40 MB,而非一个 14 GB 的模型副本
单张 GPU 可同时服务的个性化补丁数(S-LoRA)
数千个
吞吐较朴素方案最高提升 4×
超网络"生成"一个用户的个性化参数耗时(P2P)
0.57 秒
逐用户微调(OPPU)需 20.44 秒,约 36×加速
动态稀疏注意力的解码加速(NSA,64k 上下文)
11.6×
前向 9×、反向 6×,效果不降反升
  1. "注意力固定"需要先拆解。Transformer 的注意力权重本来就随输入动态计算;真正固定的是三样东西——计算模式(所有 token 花同样算力)、参数(对所有人用同一套"注意力习惯")、可塑性(推理时冻结,不随交互成长)。这三层对应三条完全不同的技术路线。
  2. "动态分配注意力"已是 2024–2026 年最活跃的架构方向之一,不是设想而是现实。MoE 动态选参数、MoD 动态选层、NSA / MoBA / DSA 动态选 token、Titans / TTT 在测试时边用边学。DeepSeek V3.2 的稀疏注意力已让 API 价格减半,MoBA 已在 Kimi 生产环境运行。[1–5]
  3. 专人专属注意力 ≠ 一人一个微调模型。正确的单位不是"模型"而是"增量":LoRA 补丁只占约 0.1%–1% 参数,基座共享、补丁热插拔;把低秩增量挂在注意力投影矩阵(WQ/WK/WV)上,就是字面意义上的"每个人有不同的注意力变换"。逐人训练太贵的问题,已被超网络路线破解——用户画像一次前向直接生成该用户的参数。[15–19]
  4. 架构完全不动,也有四级过渡方案。内容层(记忆/RAG)→ 表征层(steering 向量、PASTA 注意力重加权,免训练)→ 参数层(per-user LoRA + 多租户服务)→ 架构层(测试时学习)。每一级都有已发表方法和可用工程,可以渐进上量。
  5. "一个领域一个注意力模型"不仅可行,而且已有工业先例(Branch-Train-Merge/MiX 的领域专家、遍地的领域 LoRA、LoraHub 组合、Text-to-LoRA 按描述生成)。500 个领域 × 每个 20–40 MB ≈ 10–20 GB 总存储,一台推理服务器即可承载;真正的难点在路由(该用哪个)与基座升级时的批量重训。合理顺序:领域级 → 群体级 → 个人级。

v1.1 修订新增:第 8 节(Claude / OpenAI / Gemini 商用机制对照、Text-to-LoRA 命令行级用法与边界)、第 9 节(GLM-5.2 / Kimi K3 落地手册:分档架构、五步自动化流水线、六个场景的价值账)。

1问题澄清:注意力到底"固定"在哪里

"当前注意力机制是固定的"——这句话对一半。先把"固定"拆开,后面的所有方案才有落点。

1.1 注意力权重本身是动态的

标准自注意力 softmax(QKT/√d)·V 中,每个 token 对其他 token 的注意力权重完全由当前输入内容决定——换一句话,权重分布就完全不同。所以严格地说,Transformer 的注意力从诞生起就是"内容驱动的动态加权"。它和人类注意力的差距不在"权重会不会变",而在下面三个层面。

1.2 真正固定的三个层面

1.3 与人类注意力的逐项对照

认知科学通常把人类注意力概括为:容量有限所以必须选择(Kahneman 的资源分配理论),由自下而上的显著性与自上而下的目标共同驱动(偏向竞争理论,Desimone & Duncan 1995),并且高度可塑。对照如下:

表 1 · 人类注意力 vs. Transformer 自注意力
维度人类注意力Transformer 自注意力
算力分配极端不均:选中处精加工,其余粗略或抑制("放弃"是核心能力)均匀:每个 token 两两全算,O(L²);不重要的内容不省算力
驱动方式自下而上(显著性)+ 自上而下(当前目标持续调制)内容相似度驱动;"目标"只能靠提示词写进上下文间接实现
个体差异显著:专家与新手的注意力模式截然不同,且因人经验而异无:同一模型对所有用户使用同一套注意力参数
可塑性终身可塑,训练可重塑(专家养成)推理时冻结;只有重新训练/微调才改变
时间连续性目标可跨任务、跨天保持(警觉、期待、习惯)不跨会话;上下文窗口即全部"当下"
容量约束严格受限(约 4±1 组块的工作记忆),因此必须取舍受上下文长度与显存限制;长上下文中出现"注意力稀释/迷失"
核心洞察

三层"固定"对应三条技术路线:①算力平均主义 → 动态稀疏/条件计算(第 2 节);②千人一面 → 参数级个性化(第 5 节);③不可塑 → 测试时学习/持续学习(第 2.4、4 节)。讨论"动态注意力"时不区分这三层,是大多数争论各说各话的原因。

2动态注意力:已有的尝试

这个方向不但被想过,而且是当下架构研究竞争最激烈的赛道。按"动态化的对象"可以分成四条路线。

2.1 路线一:动态决定"看多远、想多久"

最早的尝试直接冲着"算力平均主义"去。Adaptive Attention Span(FAIR,2019)让每个注意力头自己学习需要回看多长的历史——结果发现底层头只需要很短的窗口,只有少数高层头需要长程注意力,这本身就证明了"均匀分配是浪费"。[6]更早的 Adaptive Computation Time(Graves,2016)及后来的 Universal Transformer、PonderNet 则让模型动态决定对每个位置"思考几步"——今天推理模型(o1/R1 类)按题目难度决定"想多久",是这条线在 test-time compute 上的延续。[7]

2.2 路线二:动态决定"看哪里"——稀疏注意力的复兴(2025 年爆发)

早期稀疏注意力(Sparse Transformer、Longformer、BigBird)大多用预先固定的模式(滑窗+全局 token),不算真正动态;Reformer、Routing Transformer 用哈希/聚类做内容驱动的动态稀疏,但硬件效率差,一直没成为主流。转折发生在 2025 年——三个工业级方案同时证明:可学习的动态稀疏注意力能同时做到更快和不掉点

NSA 相对全量注意力的加速倍数(64k 序列)
动态稀疏不是"用效果换速度"——各项 benchmark 同时追平或反超全量注意力
12× 解码 11.6× 前向传播 9.0× 反向传播 6.0×
数据:NSA 论文(arXiv:2502.11089),64k 序列相对全量注意力;各项 benchmark 效果持平或更好。

2.3 路线三:动态决定"用哪部分脑子"——条件计算

2.4 路线四:动态到参数层——测试时学习(最接近"人"的一条)

动态注意力十年:关键节点
从"学术好奇"到"写进旗舰模型的账单"
  • 2016Adaptive Computation Time ·首次让模型动态决定"每个位置想几步"
  • 2019Adaptive Attention Span ·每个注意力头自学"该看多远"
  • 2020Reformer / Routing Transformer ·哈希/聚类实现内容驱动稀疏,受限于硬件效率
  • 2021LoRA / 软提示 ·参数高效微调成熟,为后来"per-user 注意力补丁"铺路
  • 2023PASTA · StreamingLLM · S-LoRA ·推理时注意力重加权;attention sink;单卡服务数千 LoRA
  • 2024Mixture-of-Depths · TTT · Differential Transformer ·动态选层/测试时学习/注意力降噪;MoE 成为旗舰标配
  • 2025NSA · MoBA · Titans · DSA(V3.2) ·可训练动态稀疏走向生产:Kimi 部署、DeepSeek API 降价一半、ACL 最佳论文
  • 2026MoDA · P2P 超网络 · GLM-5.2 / Kimi K3 开源 ·深度维注意力;"0.57 秒生成个性化参数";1M 上下文的稀疏/线性动态注意力进入旗舰开源模型(IndexShare、KDA)
核心洞察

四条路线正好对应人类注意力的四个特征:看多远/想多久(跨度)、看哪里(选择)、用哪部分脑子(资源)、边看边学(可塑)。前三条已进入生产;第四条(测试时学习)是 2025–2027 年的前沿,也是"专人注意力"的终极形态。

3面临的挑战

动态注意力喊了十年才落地,卡点不在想法,在下面五件事。

4未来会如何发展

5专人专属注意力:从"不同记忆"到"不同注意力"

现在的个性化(历史聊天提取、记忆、RAG)都在改变模型看到什么;你问的是怎么改变模型怎么看。这是两条不同的轴,后者有一个从免费到昂贵的完整干预谱系。

5.1 先划清两条轴

记忆轴(改内容):把用户相关信息注入上下文——模型的注意力参数没变,只是被喂了不同的东西。便宜、可解释,但它改变不了模型的"加工习惯":一个对法律条文不敏感的模型,你把合同贴给它,它依然按通用方式分配注意力。

注意力轴(改加工):让"什么值得关注"这个函数本身因人而异——同样一份合同,给律师用户的模型自动重仓违约与管辖条款,给财务用户的模型自动重仓付款与税务条款,即使提示词完全相同。实现它不需要重训模型,下面按成本从低到高给出五级手段。

5.2 干预谱系:五个层级

L0
提示层:系统提示 + 记忆 / RAG(现状)
在提示里写"重点关注 X"。本质是通过内容间接牵引注意力分布——有效但弱、不稳定,长上下文中易被稀释。
每用户增量:几 KB 文本 · 训练:无 · 现成度:所有产品都在用
L1
表征层(免训练):PASTA 注意力重加权 / steering 向量
PASTA 在推理时直接把指定文本片段在部分注意力头上的权重调高——字面意义的"告诉模型往哪看",免训练,只需对模型做一次性"头部画像"。steering 向量则是每人一个方向向量加在残差流上,持续改变模型的"关注倾向"。
每用户增量:几十 KB · 训练:无/极轻 · 现成度:论文+开源库(pastalib),需自集成
L2
输入参数层:软提示 / 前缀微调
每人一段可学习的"虚拟 token",拼在每层注意力的 K/V 前面——相当于给每个用户配一副"注意力预调滤镜"。大模型上效果可逼近全量微调(Lester et al. 2021)。
每用户增量:0.1–10 MB · 训练:轻量(冻结基座) · 现成度:PEFT 库开箱即用
L3
权重增量层:per-user LoRA(可只挂注意力矩阵)
每人一组低秩增量 ΔW 挂在 WQ/WK/WV/WO 上——每个用户的 Q/K/V 变换不同,注意力分布真的因人而异。这是"专人注意力配置"的字面实现。基座共享、补丁热插拔,OPPU(one-PEFT-per-user)已系统验证效果。
每用户增量:10–40 MB(7B 基座,rank 8–16) · 训练:每人几分钟-几十分钟 GPU · 现成度:多租户服务成熟(S-LoRA / Punica / vLLM)
L4
生成层:超网络按画像"生成"个性化参数(破解逐人训练)
P2P(ACL 2026):用户画像(历史行为摘要+检索样例)→ 超网络一次前向 → 直接输出该用户的 LoRA 参数。0.57 秒/人,零逐人训练,LaMP 基准上反超逐人微调,对新用户即时生效。Text-to-LoRA(Sakana AI)同思路:一句任务描述生成一个 adapter。
每用户增量:同 LoRA,但无需逐人训练 · 一次性成本:训练超网络(约 1,450 个用户后摊平) · 现成度:2025–2026 前沿,代码已开源

5.3 "需要微调吗?一人一个模型?"——算一笔账

不需要"一人一个模型"。个性化的正确单位是增量(Δ)而不是副本:

表 2 · 五级方案对比(以 7B 基座为例;成本为量级估计)
方案改变什么每用户增量每用户训练成本能否改变"怎么看"代表工作
全量微调副本全部权重≈14 GB数小时 GPU完全—(不可行,仅作参照)
per-user LoRA注意力/FFN 的低秩增量(≈0.2% 参数)10–40 MB几分钟–几十分钟是(Q/K/V 变换因人而异)OPPU · S-LoRA
超网络生成 LoRA同上,参数由画像生成10–40 MB≈0(0.57 秒生成)P2P · Text-to-LoRA
软提示/前缀每层注意力的 K/V 前缀0.1–10 MB轻量部分(预调注意力起点)Prompt/Prefix Tuning
steering 向量残差流方向几十 KB极轻/无部分(改变关注倾向)BiPO 等
PASTA 重加权推理时指定头的注意力权重≈0(一份配置)无(一次性头部画像)是(直接改分布)PASTA · LLMSteer
记忆/RAG(现状)输入内容几 KB–几 MB 文本否(只改"看什么")各产品记忆功能
个性化深度 × 每用户边际成本:方案版图
示意图——坐标为定性估计,用于表达相对关系;悬停查看各方案说明
当前性价比区 个性化深度(能改变"怎么看"的程度)→ 每用户边际成本 → 系统提示+记忆 PASTA 重加权 steering 向量 软提示/前缀 超网络生成 LoRA per-user LoRA 全量微调副本 测试时学习 (架构层,未来)
纵轴含训练、存储与服务的综合边际成本。蓝色 = 现有架构即可落地;灰色 = 依赖架构演进。定量数据见表 2。
回答你的问题

"是需要微调么?一人一个微调版本?"——需要"因人而异的参数",但不需要"逐人微调",更不需要"一人一个模型"。工程答案是三件套:基座共享 + 每人一个热插拔小增量(LoRA/软提示/向量,MB 级)+ 超网络即时生成增量(免逐人训练)。单卡同时服务数千用户的个性化补丁在 2023 年(S-LoRA)就已解决;为新用户生成补丁的成本在 2025 年(P2P)降到了秒级。

6架构不动的过渡方案(工程路线图)

假设基座架构与权重都不能动(用 API 或不想维护训练管线),依然存在一条能渐进上量的路径。

阶段 0 · 现在就能做:把"内容层"做到极致

阶段 1 · 数周级:表征层干预(免训练/极轻训练,自部署模型可用)

阶段 2 · 数月级:参数层平台化(个性化的"正餐")

阶段 3 · 跟随架构演进:测试时学习

核心洞察

四个阶段不是替代关系,是叠加关系:记忆(看什么)+ 重加权(往哪看)+ 补丁(怎么看)+ 就地学习(越看越会看)。每一层收益独立可测,失败可单层回滚——这正是"架构升级不了"时最稳的演进结构。

7"一个领域一个注意力模型"可行性分析

你的直觉是对的,而且这条路比"一人一个"更先走通——它已经有名字、有先例、有成本账。

7.1 先例:这件事已经被做过三遍

7.2 成本账:数百个领域完全在工程舒适区内

表 3 · "500 个领域注意力补丁"成本估算(7B 基座,LoRA rank 16,挂注意力+FFN;量级估计)
项目单领域500 个领域合计说明
存储20–40 MB10–20 GB≈ 一个 14B 模型的体积;对象存储成本可忽略
训练(一次性)数百–数千条数据,数 GPU 时数千 GPU 时以内可全并行;领域数据远比个人数据易获取、可复用
推理服务1–2 张卡起步S-LoRA 式统一分页:基座常驻,热门补丁驻显存,长尾按需换入
切换开销毫秒级多租户 LoRA 服务的成熟能力,同 batch 可混合不同补丁
基座升级重训全量补丁重训最大隐性成本:增量与基座绑定;超网络路线可缓解(重训超网络→批量重新生成)

7.3 真正要设计的三个问题

7.4 与相邻方案的对照

表 4 · 领域注意力补丁 vs. MoE vs. 个人补丁
维度领域 LoRA 库(本方案)MoE(模型内专家)per-user 补丁(第 5 节)
粒度会话/请求级,按领域token 级,自动会话级,按人
分工是否可控可解释是:人为定义、可单独增删否:涌现分工,不与人类领域对齐是,但每人一份
需要改架构吗(推理框架加载即可)是(需 MoE 基座)
数据需求每领域数百–数千条,易获取预训练级每人的行为数据,稀疏且隐私敏感
冷启动好(领域先验现成)难(靠超网络画像生成缓解)
适合作为第一步:先验强、复用高基座能力(由模型厂商解决)第二步:叠加在领域补丁之上
结论与推荐顺序

"一个领域一个注意力模型"可行且应当先于"一人一个"去做:领域数据充足、补丁可复用、隐私压力小、数百个量级的存储与服务成本都在单机可承受范围。推荐演进顺序:领域级(数百个)→ 群体级(职业/角色,数千个)→ 个人级(超网络生成,百万级)——三级共用同一套 multi-LoRA 基础设施,且可叠加(用户 = 基座 + 领域补丁 + 个人补丁)。

8商用现状:三大厂商机制与 Text-to-LoRA 实操

把前面的 L0–L4 谱系拿来当标尺,逐一对照 Claude / OpenAI / Gemini 实际在卖什么,再把 Text-to-LoRA 拆到命令行级。

8.1 三大厂商逐一对照(截至 2026 年中)

表 5 · 三大厂商的个性化机制,映射到 L0–L4 谱系
厂商消费级机制开发者 / 企业级做到"每人不同权重"了吗
Claude
(Anthropic)
记忆(项目内 + 跨对话)、Projects、Styles(回复风格)、Skills(可复用的技能/流程文件,按需加载——一种"程序性记忆",仍属内容层)、MCP 连接器。→ 全部 L0 不开放通用微调;企业经云平台(如 Bedrock)可微调个别小型号。个性化主推"记忆 + Skills"路线。 都没有。三家消费级全部停在 L0(改"看什么"),权重对所有用户相同;租户级微调(L3)只到"组织"粒度,不到"个人"。
原因并非技术不可行,而是:安全审查与对齐回归按"模型"为单位进行,per-user 权重会把回归矩阵放大百万倍;外加隐私归属与滥用责任。这正是开源自托管路线的差异化空间。
ChatGPT
(OpenAI)
记忆两件套(saved memories 显式记忆 + 引用全部历史对话的隐式画像)、自定义指令、GPT-5 人格预设、Custom GPTs、Pulse 主动简报。→ 全部 L0 微调 API 最全:SFT(GPT-4.1 系)、DPO、RFT(推理模型强化微调)——但粒度是"开发者的组织/产品",即 L3 用在租户级,不是个人级。
Gemini
(Google)
Personal Context(从历史对话自动学习用户画像,2025.8 上线)、Saved Info、Gems、接入 Gmail/Docs/搜索历史的个人上下文;临时对话(不入画像)。→ 全部 L0 Vertex AI 提供托管监督微调(LoRA,限 Flash 等型号);Gemini Enterprise 提供组织级个性化与记忆配置。同样止于租户级。
读法

三家的"个性化"本质都是越做越精的记忆系统(第 5.1 节的"记忆轴"),在"注意力轴"上均为空白——没有任何一家为个人改变哪怕 1 KB 的权重。这不是落后,是商业模式决定的取舍:闭源 API 的安全/合规按模型粒度运作。结论:L1–L4 的"专人注意力"目前只能在你自己控制权重的开源底座上做——这正是第 9 节的主题。

8.2 Text-to-LoRA:命令行级的真实用法与商用边界

Text-to-LoRA(Sakana AI,ICML 2025,Apache-2.0 开源)是一个已训练好的超网络:输入一句任务描述,一次前向直接输出一个 LoRA。实际操作四步:

# ① 装环境(需一张 >16GB 显存的 GPU)
git clone https://github.com/SakanaAI/text-to-lora && cd text-to-lora
uv venv --python 3.10 --seed && uv sync

# ② 下载官方超网络 checkpoint(基于 HuggingFace)
uv run huggingface-cli download SakanaAI/text-to-lora --local-dir .

# ③ 用一句话生成 LoRA —— 核心只有这一步
uv run python scripts/generate_lora.py <checkpoint路径> \
  "从中文财报与合同文本中识别风险条款,给出条款位置与风险等级"

# ④ 挂载服务:生成的 LoRA 目录直接给 PEFT 加载,或 vLLM --enable-lora 热挂

商用边界,三条都很硬:

9开源底座落地手册:GLM-5.2 / Kimi K3

两个底座都在 2026 年开源了 1M 上下文的动态注意力架构——但"给用户提供自动化个性化"的正确姿势,取决于你的算力档位,而且个性化不一定要发生在最大的那个模型上。

9.1 先看清两个底座的硬约束

表 6 · 两个开源底座对照(2026 年 7 月)
维度GLM-5.2(智谱,2026.6)Kimi K3(月之暗面,2026.7.27 开源)
规模753B 总参 / ~40B 激活(MoE)2.8T 总参,896 专家选 16(MoE)
注意力机制IndexShare 稀疏注意力:多个稀疏层共享同一注意力索引器,1M 上下文下每 token FLOPs 降 2.9×(DSA 思路的工程化延伸)KDA(Kimi Delta Attention)混合线性注意力 + attention residuals——本报告第 2 节"动态注意力"的最新生产实例
上下文1M(输出至 131k)1M
许可证MIT,无地域限制开源权重已发布(刚开源数日,生态适配进行中)
自托管现实权重数百 GB 级,推理需多卡/多机;Day-0 已适配多种国产芯片TB 级权重,集群级部署;多数团队应走 API
补丁工程含义可自托管、可挂 LoRA;但在 753B 上 LoRA 也是多机作业。家族小杯(如 GLM-4.5-Air,106B-A12B)是补丁试验田旗舰不适合逐户补丁;同家族 Kimi Linear(48B-A3B,同为 KDA 架构)或 K2 系才是实验载体

9.2 参考架构:按算力分三档

9.3 自动化流水线:五步,可直接照抄

  1. 数据飞轮:埋点收集采纳/修改/高亮行为 → 整理成偏好对与示范样本,按用户/租户分桶;冷启动用画像问卷 + 用户历史文档。
  2. 训练作业:LLaMA-Factory 或 ms-swift 定时批量跑 LoRA(rank 8–16;target = q/k/v/o 注意力投影——MoE 底座避开专家 FFN,补丁更小、不扰动路由,也最贴合"个性化注意力"本意)。数据少的用户先学 steering 向量,数据够了再升级 LoRA。
  3. 评测门(没有它一切都是玩具):每个补丁过三关——领域任务集、通用回归集(防能力退化)、安全回归集(防对齐漂移);任一不过,自动回退上一版补丁。
  4. 热加载服务:vLLM --enable-lora 启动,运行时经 /v1/load_lora_adapter 动态挂载/卸载;请求按 model=租户或用户补丁名 路由,未命中回退基座。注意:单请求只挂一个 adapter,"领域 + 个人"两层叠加需离线合并(PEFT add_weighted_adapter)后作为一个补丁挂载。
  5. 升级预案(立项时就写进预算):基座升版 → 全量补丁批量重训(脚本化);若维护了超网络,则重训超网络 → 一键重生成全部补丁。这是"数百领域 + 海量用户"方案最大的隐性成本,见 7.2。

9.4 六个实际场景与价值账

表 7 · 场景 × 载体 × 相对"塞提示词"的增量价值
场景个性化载体价值(相对把规则塞进系统提示)
电商客服 SaaS
每店铺一个"店铺注意力"
租户级 LoRA;长尾店铺用生成式补丁冷启动每次请求从上下文里拿掉 3–5k token 的店规:百万请求/天 ≈ 每天省 30–50 亿输入 token(直接是账单);且权重级约束比文本级稳,长对话不被稀释
律所合同审查所级 LoRA(审查清单与风格)+ 会话级重点标注(谈判焦点条款)同一份合同,不同律所的模型自动看向各自重点;新人即用资深审查视角(专家注意力的组织资产化)
医院分科报告解读科室级补丁(放射/儿科/全科关注点不同)RAG 补"知识",补不了"同一报告不同科室重点不同"——这恰是注意力层问题,内容层方案到顶也解决不了
K12 个性化讲解学生级,超网络按错题画像即时生成新学生注册即得"薄弱点敏感"的讲解模型,把个性化从"攒几个月数据"变成"秒级冷启动"
企业代码助手公司级补丁(内部框架、规范、架构习惯)替代常驻上下文的万 token 规范文档;跨仓库命名与架构一致性由权重保证
投研 / 写作分身个人 steering 向量起步,数据够后升级个人 LoRA分析师的风格与关注因子随人走;几十篇样本即可学出向量,是"个人级"最低门槛的入口
价值的三个来源

① token 账单:把常驻指令"焊进"权重,输入 token 直接省(规模化后是硬钱);② 稳定性:权重级约束不会像提示词一样在长上下文中被稀释、被越狱、被遗忘;③ 冷启动速度:生成式补丁把个性化从"先攒数据"变成"注册即得"。三者都可以在上线前用 A/B 直接量化——这也是说服业务方立项的三张牌。

10结论与建议

三句话总结:

  1. 模型注意力的"固定"固定在计算模式、参数、可塑性三层;其中前两层的动态化(NSA/MoBA/DSA、MoE/MoD)已在 2024–2026 年进入生产,第三层(测试时学习)是明确的下一站——方向本身没有悬念,悬念只在硬件对齐与训练稳定性的工程节奏。
  2. "专人专属注意力"不需要一人一个微调模型:基座共享 + 热插拔小增量 + 超网络即时生成把每用户成本从"14 GB + 数小时"压到"几十 MB + 0.57 秒",且把增量挂在 WQ/WK/WV 上就是字面意义的个性化注意力。
  3. 架构升级不了不是阻碍:内容层→表征层→参数层→架构层四级过渡方案每级都有已发表方法与开源工程;"一个领域一个注意力补丁"是其中性价比最高的第一步,数百个领域今天就能落地。

如果要行动,按这个顺序:①建立"关注命中率"的个性化评测(没有度量,一切优化都是盲飞);②接入 multi-LoRA 推理框架;③先做 10–20 个高频领域补丁验证收益;④用超网络路线解决个人级冷启动;⑤持续跟踪 Titans/TTT 类架构进入主流开源基座的信号。自托管 GLM-5.2 / Kimi 路线的分档架构与五步流水线,直接照第 9 节执行;三大厂商现状与 Text-to-LoRA 边界见第 8 节。

本报告基于公开论文与工程资料整理;具体数字(加速比、耗时、参数量)均出自对应论文的实验设置,迁移到不同基座/硬件时量级可参考、精确值需实测。以下为主要参考文献。

11参考文献

动态注意力与架构
  1. Yuan et al. Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention. DeepSeek, arXiv:2502.11089, 2025.(ACL 2025)
  2. Lu et al. MoBA: Mixture of Block Attention for Long-Context LLMs. Moonshot AI, arXiv:2502.13189, 2025.(代码)
  3. DeepSeek-AI. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models(DSA 稀疏注意力). arXiv:2512.02556;另见 SGLang 对 V3.2-Exp 的解读.
  4. Raposo et al. Mixture-of-Depths: Dynamically Allocating Compute in Transformer-Based Language Models. DeepMind, arXiv:2404.02258, 2024.
  5. Zhu et al. Mixture-of-Depths Attention (MoDA). ByteDance Seed, arXiv:2603.15619, 2026.
  6. Sukhbaatar et al. Adaptive Attention Span in Transformers. FAIR, arXiv:1905.07799, 2019.
  7. Graves. Adaptive Computation Time for Recurrent Neural Networks. arXiv:1603.08983, 2016.
  8. Ye et al. Differential Transformer. Microsoft Research, arXiv:2410.05258, 2024.
  9. Sun et al. Learning to (Learn at Test Time): RNNs with Expressive Hidden States. arXiv:2407.04620, ICML 2025.
  10. Behrouz et al. Titans: Learning to Memorize at Test Time. Google Research, arXiv:2501.00663, NeurIPS 2025.
  11. Xiao et al. Efficient Streaming Language Models with Attention Sinks (StreamingLLM). arXiv:2309.17453, 2023.
个性化:注意力与参数干预
  1. Zhang et al. Tell Your Model Where to Attend: Post-hoc Attention Steering for LLMs (PASTA). arXiv:2311.02262, ICLR 2024.(pastalib;另见 LLMSteer)
  2. Cao et al. Personalized Steering of LLMs: Versatile Steering Vectors via Bi-directional Preference Optimization. NeurIPS 2024.
  3. Lester et al. The Power of Scale for Parameter-Efficient Prompt Tuning, 2021;Li & Liang. Prefix-Tuning, 2021.
  4. Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685, 2021.
  5. Tan et al. Democratizing LLMs via Personalized Parameter-Efficient Fine-tuning (OPPU). EMNLP 2024.
  6. Lyu et al. Instant Personalized LLM Adaptation via Hypernetwork (Profile-to-PEFT, P2P). arXiv:2510.16282, ACL 2026.
  7. Charakorn et al.(Sakana AI). Text-to-LoRA: Instant Transformer Adaption. ICML 2025.
  8. Salemi et al. LaMP: When Large Language Models Meet Personalization. arXiv:2304.11406, 2023.(个性化标准基准)
多补丁服务与领域专家
  1. Sheng et al. S-LoRA: Serving Thousands of Concurrent LoRA Adapters. arXiv:2311.03285, MLSys 2024;Huang et al. LoraHub: Efficient Cross-Task Generalization via Dynamic LoRA Composition. COLM 2024.
  2. Li et al. Branch-Train-Merge: Embarrassingly Parallel Training of Expert LMs, 2022;Sukhbaatar et al.(Meta). Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM, 2024.
  3. Berges et al.(Meta). Memory Layers at Scale. arXiv:2412.09764, 2024.
商用现状与开源底座(v1.1 新增)
  1. OpenAI. Memory and New Controls for ChatGPT(saved memories + 引用历史对话).
  2. Google. Gemini Temporary Chats 与隐私控制;Personal Context 上线报道;Gemini Enterprise 个性化与记忆配置文档.
  3. Anthropic. Bringing Memory to Teams(Claude 记忆功能).
  4. Sakana AI. text-to-lora 开源仓库(Apache-2.0;官方 checkpoint 覆盖 Mistral-7B / Llama-3.1-8B / Gemma-2-2b).
  5. 智谱. GLM-5.2 上线并开源(MIT、1M 上下文、IndexShare 稀疏注意力);官方文档;规格另见 第三方技术解读(753B-A40B).
  6. 月之暗面. Kimi K3 开源(2026.7.27,2.8T 参数、KDA 混合线性注意力、1M 上下文):IT之家报道;21 财经报道.
  7. Moonshot AI. Kimi Linear 48B-A3B(KDA 架构小杯,补丁实验推荐载体).