2026年6月,arXiv 上连续抛出两篇重磅论文——ProtoAda 和 CRAM——同时盯上了视觉语言模型(VLM)的同一个老毛病:

灾难性遗忘。

给 VLM 加一个新能力(比如识别医学影像、读懂工业图纸),原来的能力就掉一截。这条拦路虎卡了多模态学习整整三年。

如今,两条不同路线同时给出解法。这不是巧合,而是 VLM 走向「可扩展」的分水岭。

一、为什么「持续学习」是多模态模型的死结

VLM 的能力扩展走的是两条路:扩参数、扩数据。但都绕不开同一个坑——

模型学到新分布的参数更新,会覆盖旧分布的权重。

直观理解:一个学生学了法语,结果把英语忘了。

在视觉语言场景下更严重:

• 工业质检 VLM 加了「缺陷识别」能力,原来「产品分类」准确率从 92% 跌到 71%

• 医学 VLM 加了「CT 影像解读」,原来「X 光片判读」漏检率翻倍

• 自动驾驶 VLM 加了「夜间行人识别」,白天「交通标志识别」召回率掉了 18%

这不是「没训练够」,而是「参数空间被新任务强行占据」。

过去的解决方案——正则化约束、回放缓冲区、参数隔离——要么效果有限,要么工程代价太高,无法工业化部署。

二、ProtoAda:用「原型」做参数隔离

ProtoAda 的核心思路极简:

不修改主干参数,只在主干之外挂载「任务原型」(Task Prototypes)。

具体机制:

• 主干网络冻结——保留通用视觉语言能力

• 每个新任务训练一组小型原型向量——本质是任务的「指纹」

• 推理时,根据输入特征匹配最相关的原型,按权重融合

带来的好处是颠覆性的:

零遗忘:主干不动,旧任务能力纹丝不变

轻量扩展:每个任务只需新增 0.3% 的参数

快速迁移:原型向量可在任务间插值,新场景只需少量样本冷启动

论文报告,在 12 个连续视觉任务的标准基准上,平均准确率 78.4%,比 SOTA 的微调基线高 11.6 个百分点,参数增量只有 1/15。

三、CRAM:让模型自己决定「记住什么」

CRAM(Cognitive Routing with Adaptive Memory)走的是另一条路——更激进、更类脑。

它引入了「自适应记忆库」机制:

• 模型内部维护一个动态记忆池,每个记忆单元带「重要性分数」

• 学新任务时,模型自动评估哪些旧记忆「仍有用」、哪些可以降权

• 路由网络(Router)根据任务上下文,动态选择调用哪些记忆

关键创新:「记忆遗忘」由模型自己决定,不再靠人工设计的正则项。

实验结果更夸张:

在长序列(25 个任务)的持续学习基准上,CRAM 保持 69.7% 的平均准确率,传统微调方法在第 8 个任务就崩盘到 41%。

CRAM 还展示了一个反直觉的能力:它能在学习新任务的同时,反向修复旧任务的偏差——等于模型有了「自愈」机制。

四、两篇论文为什么同时出现

这不是巧合。

过去半年,Meta、谷歌、阿里、字节的多模态团队都在公开场合抱怨同一个问题:「VLM 不好扩」。

市场对多模态模型的需求已经不是「通用」,而是「专用叠加」:

• 医院要通用 VLM + 医学专科

• 工厂要通用 VLM + 质检专科

• 车企要通用 VLM + 自动驾驶专科

• 零售要通用 VLM + 商品识别专科

传统做法是给每个场景训一个专属模型——成本爆炸、数据冗余、迭代缓慢。

ProtoAda 和 CRAM 给出了另一条路径:一个通用底座 + 一堆轻量外挂,按需组合。

这是多模态模型走向「工业化部署」的关键拼图。

五、对行业的判断

1. VLM 的竞争维度切换:从「谁更大」到「谁更能叠加」。一个 7B 的可扩展底座,可能比 70B 的单体模型更有商业价值。

2. 创业窗口出现:用 ProtoAda/CRAM 做底座,给垂类行业提供「通用 + 专科」的 VLM 服务,会是接下来 6-12 个月最拥挤的赛道。

3. 数据策略反转:以前攒数据是为了「训」,现在开始为了「挂」。数据飞轮的核心不是训练集规模,而是「任务多样性」。

4. 开源生态加速:两篇论文都承诺开源代码和权重,这会催生一波二次创新——医疗 V、教育 V、工业 V、自动驾驶 V 会像搭积木一样快速成型。

六、隐忧

两篇论文都不是「终极解」:

• ProtoAda 的原型数量随任务线性增长,长期会撞天花板

• CRAM 的路由网络对算力的额外开销不可忽视

• 两者都没解决「任务冲突」——两个相似任务同时挂载时性能会打架

但方向已经清晰:多模态模型的下一个十年,是「可组合性」的十年。

ProtoAda 和 CRAM,是这场变革的两个早期信号弹。