DeepMind SkillSmith 深度解读:当模型权重变成一种 “可读写模态”
DeepMind 的 SkillSmith 论文提出一个颠覆性视角:将权重视为可读写的新模态,与文本交错输入 LLM,实现推理时合成新技能。实验显示其在低资源场景下优势显著,为 Agent 技能复用和快速适配开辟了新路径,其核心洞见或许比技术实现更具价值。

上周 DeepMind 放出来的 SkillSmith 论文,我来回看了好几遍。
不是因为它有多复杂。恰恰相反,它的核心思路简单到你看完会拍大腿:权重凭什么不能是一种模态?
这个想法本身,可能比具体的技术实现更重要。

核心看点
- SkillSmith 首次将 prefix-tuning 的 KV-cache 权重视为 LLM 可原生读写的输入模态
- 文本和权重交错排列共同输入,端到端元训练,推理时一次前向即可生成新技能权重
- Composite-SNI 数据集上,微调后 Elo 2627 分,远超第二名 ICL 初始化的 2243 分
- MMLU-ProX 低资源场景下,零样本表现超过经过目标任务微调的基线方法
- 消融实验证实文本与权重存在跨模态协同效应,1+1>2
论文地址:https://arxiv.org/abs/2607.27497
01 一个长期存在的割裂
先说说问题本身。
现在的 Agent 系统,积累经验的方式其实是分裂的,两条线各干各的。
一条是文本线。
干完活儿写段反思,存到记忆库里,下次遇到类似的掏出来看看。灵活是真灵活,啥都能说,但占上下文啊。
塞多了窗口就爆了,而且每次推理都得重新加载一遍,效率低。
另一条是参数线。
用 LoRA、prefix-tuning 这些 PEFT 方法,把能力烧进一小段参数里,用时加载上去。
高效是真高效,推理不占 token,但组合起来特别笨。
两个技能放一起,就只能平均一下、拼一下,完全不懂语义上该怎么融合。
这个割裂大家都知道,但好像也没觉得有什么大问题。直到 SkillSmith 出来,把这层窗户纸捅破了。
02 核心洞见:权重是一种新模态
SkillSmith 最震撼的地方,不是架构有多复杂,而是一个视角转换。
我们说多模态,张口就来文本、图像、音频。这些东西形态各异,但本质上都是模型可以读入并理解的输入。
那权重呢?
权重也是一堆数字啊。
图像能当输入,权重为什么不能?
SkillSmith 干的就是这件事。
它把 prefix-tuning 的 KV-cache 权重,通过一个适配器投影到 LLM 的隐藏空间里,然后用特殊 token 把权重和文本交错排列,组成一个连续的序列喂进去。

LLM 现在可以像读一段文字一样,读一段权重了。
而且不仅能读,还能写。
给它几个已有技能的权重加描述,再用自然语言说一句 “我想要个能同时干这俩的新技能”,它一次前向传播,直接生成新技能的权重。
合成新技能的时候不需要重新训练,不需要梯度下降,推理时就完成了。
论文里管这个叫 “指令引导的参数合成”。
说白了,就是让模型学会用语言来操控自己的一部分权重。
03 具体是怎么实现的
架构其实不复杂,三层。

输入 KV 适配器。
就是一个 MLP,把权重张量投影成跟 token 嵌入一个维度的向量。
这样权重就能混进 Transformer 的计算流里了。
协处理器 LLM。
这是核心,用的是 Gemma 3 4B。它吃的输入序列长得有点怪:前面是一段说明文字,然后是一个接一个的技能包,每个包里先放文本描述,再放对应的权重,用特殊 token 隔开。
最后是一段组合指令,然后是一串占位符。
LLM 处理完这个序列,占位符位置上的隐藏状态,就是生成出来的新权重。
输出 KV 适配器。
把生成的隐藏状态再映射回权重空间,得到可以直接用的 prefix-cache。
训练是端到端的。
生成的权重直接接到一个冻结的下游基础模型上跑任务,用下游损失反传梯度来更新 SkillSmith。
还有一个细节值得注意。
论文里所有 prefix-cache 都只训全局层(global layers),不是所有层。
这个设计很关键,大幅减少了参数量和计算成本。
04 放在整个领域里看,它的位置在哪
这个思路不是凭空冒出来的。技能组合这个方向,之前大概有三条路线。
第一条是纯算术合并。
最经典的就是 Task Arithmetic、LoRA Soup,把多个 LoRA 或者 prefix 权重平均一下、拼接一下。
好处是简单,坏处是太笨了,完全不懂任务之间的语义关系。
两个技能能不能合、怎么合,全靠运气。
第二条是超网络路线。
用一个小网络来学习怎么合并权重,比如 LoRA RAR 这种。
比算术合并聪明点,能学出组合的规律,但它只能看到权重,看不到文本描述,还是缺了语义这一层。
第三条是纯文本路线。
就是现在 Agent 常用的,把技能写成文本,靠 prompt 来组合。
最灵活,但占上下文,而且大模型每次都得重新理解一遍,效率低。
SkillSmith 有意思的地方在于,它把第二条和第三条捏到一块儿了。
权重能看,文本也能看,两个模态一起进 LLM,让模型自己学着怎么组合。
这不是第一个做多模态权重合成的,但它是做得最完整、实验最扎实的一个。
而且它选的切入点很巧,用 prefix-tuning 的 KV-cache,因为文本天然就能转成 KV-cache,桥接起来特别自然。
05 实验结果:三组数据说清楚
论文做了三组实验,规律很清晰。
Composite-SNI:理想环境下的验证
第一组是他们自己造的数据集,叫 Composite-SNI。
用 Gemini 2.5 把 SNI 里的任务两两合成新任务,搞了两万多个。
好处是 ground truth 明确,每个复合任务的源任务是谁都知道。

结果很干净。
零样本下,SkillSmith 把所有纯权重合并的方法都拉开了明显差距。
微调后差距更大,SkillSmith 初始化的权重微调完 Elo 2627,第二名 ICL初始化的才 2243。
这里多说一句。
Elo 评分这个方法挺聪明的,因为不同任务的 NLL 尺度不一样,直接平均会被高方差任务带偏。
用 Elo 相当于把每个方法当选手,两两比胜率,最后算排名。
但它也有个局限:反映的是 “赢的次数”,不是 “赢了多少”。
有时候一个方法大多数任务上小赢,少数任务上大输,Elo 可能还是很高,但实际平均效果不一定最好。
MMLU-ProX:低资源场景的挑战
第二组是 MMLU-ProX,这个更狠。
跨语言跨领域,专门挑了 Gemma 3 表现最差的语言和没见过的科目来测,数据量也少,总共才约 250 个任务。

结果更有意思。
在目标任务上零样本的 SkillSmith,居然超过了在目标任务上做过微调的基线方法。
为什么低资源场景下优势这么大?
论文的解释挺到位的。数据多的时候,梯度下降能把初始化的坑填平。数据少、任务难的时候,起点差一点,终点就差很多。
SkillSmith 最大的价值,可能就是给你一个特别好的起点。
SNI:简单任务的天花板
第三组是 SNI,就是那个比较老的 NLP 任务数据集。
这里微调后各种方法差不多都摸到天花板了,差距不大。
但零样本下 SkillSmith 还是领先。

三组实验放一块儿,规律很明显:任务越难、数据越少,这东西越有用。
06 消融实验:几个关键问题的答案
论文做了不少消融,有几个我觉得挺关键的。
它真的在用权重吗?还是主要靠文本?

消融显示,只用权重 Elo 1455,只用文本 1622,都用上是 1714。
文本贡献确实更大,但权重有独立的增益,而且 1+1>2。
说明它确实在做跨模态的合成,不是光靠文本蒙的。
会不会只是因为看到了更多文本?
论文专门做了对照。把 SkillSmith 能看到的所有文本都直接拼到输入里,然后做标准的 prefix-tuning。结果还是不如 SkillSmith。

这个挺重要的。
说明收益不是来自信息量多,而是来自两种模态的协同。
能泛化到没见过的任务吗?
他们把测试集分成三类,两个源任务都见过、见过一个、都没见过。SkillSmith 在三类上都赢,而且都没见过的情况下优势还很大。
这说明它学的不是套路,是真的学会了组合的规则。
07 工程落地的几个现实问题
从论文到实际落地,中间还有几个事儿得想清楚。
首先是成本。
SkillSmith 本身是个 4B 模型,每次合成技能都要跑一次前向。
按 4B 模型的一般推理速度来估,大概几百毫秒到一秒的量级。
这个数字仅供参考,论文里没给具体 benchmark。
如果一个技能要复用很多次,这个成本完全可以接受。
但如果每个任务只干一次,那可能还不如直接微调来得快。
然后是生成的稳定性。
论文里没怎么提这个,但我觉得挺重要的。
同样的输入,每次生成的权重质量稳不稳?
会不会有时候生成出来完全不能用?这个对实际落地影响很大。
还有跟 LoRA 的兼容性。
现在业界主流是 LoRA,不是 prefix-tuning。
SkillSmith 这套思路能不能迁移到 LoRA 上?
从技术上讲应该可以,把 LoRA 矩阵投影成序列就行。
但效果怎么样,还不好说。
毕竟 prefix 和 LoRA 的参数结构差挺多的。
最后是检索质量。
真实场景里,你不知道哪些源技能跟目标任务相关,得靠检索。
论文做了检索实验,但检索噪声到底有多大影响,还得再看看。
08 几个存疑的地方
当然,它也不是完美的。说几个我觉得值得讨论的点。
规模问题。
4B 上成立,70B、几百 B 上还成立吗?
KV-cache 的维度随模型增大而增大,适配器会不会越来越大,最后得不偿失?这个不好说。
数据生成的问题。
Composite-SNI 是 Gemini 2.5 生成的,组合说明也是 Gemini 写的。SkillSmith 训练的时候,相当于在学 Gemini 对任务组合的理解。
这里面会不会有分布对齐的优势?就是说 Gemini 生成的任务,Gemini 自己最懂怎么组合,所以 SkillSmith 学起来特别顺。
换到真实任务上,这个优势会不会打折扣?
这些都是后续工作要回答的。
09 对 Agent 赛道意味着什么
扯远点,聊聊产业。
现在 Agent 有个老大难问题,技能复用难。你辛辛苦苦攒了一堆技能,换个场景很多用不上,或者组合起来效果稀烂。
SkillSmith 指向的未来是这样的:Agent 每干完一件事,留下两样东西,一段文字总结,一段固化的权重。
遇到新任务,先用文字推理一下需要哪些技能、怎么拼,然后直接合成出对应的权重。全程推理时完成,不用额外训练。
如果这个能走通,技能获取的成本可能会降一个数量级。
Agent 的学习曲线也会不一样。
现在的 Agent 是见一个学一个,每个新任务都从零开始攒经验。以后可能是技能库越积越多,合成新能力的速度越来越快。
这有点像人学习的方式。
我们学新东西也不是从零开始,都是把已有的知识和技能重新组合。
当然这些都是远期的。
近期来看,最可能先落地的是低资源场景。
小模型适配新任务、跨语言迁移、冷门领域的快速定制。这些地方数据少、训练贵,推理时合成的优势最明显。
最后说一句
SkillSmith 不是第一个做技能组合的,也不会是最后一个。但它最有价值的地方,是提出了一个特别简单的视角转换。
权重不是终点,是一种可以被读写的模态。
这个想法本身,可能比具体的技术实现更重要。因为一旦你接受了这个视角,很多以前觉得不可能的事,突然就变得可以想象了。
我个人判断,这套思路短期内最可能在小模型快速适配的场景落地。
大模型上能不能 work,还得看后续工作。但 “权重作为模态” 这个方向,大概率会成为接下来半年技能学习领域的一个重要分支。
DeepMind 这篇论文,更像是捅破了一层窗户纸。
后面的路还长,但方向已经亮了。
参考资料
[1] Dery, L. M., et al. (2026). SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge. arXiv:2607.27497. https://arxiv.org/abs/2607.27497
[2] Hu, E. J., et al. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685
[3] Li, X. L., &; Liang, P. Prefix-Tuning: Optimizing Continuous Prompts for Generation. arXiv:2101.00190
[4] Ilharco, G., et al. Task Arithmetic: Editing Models with Task Arithmetic. arXiv:2212.04089
[5] Zhuang, Y., et al. LoRAHub: Efficient Cross-Task Generalization via Dynamic LoRA Composition. arXiv:2307.13269
编辑:前沿在线 编辑部
本文由 @前沿在线 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




