2026年6月,arXiv 上连续抛出两篇重磅论文——ProtoAda 和 CRAM——同时盯上了视觉语言模型(VLM)的同一个老毛病:
灾难性遗忘。
给 VLM 加一个新能力(比如识别医学影像、读懂工业图纸),原来的能力就掉一截。这条拦路虎卡了多模态学习整整三年。
如今,两条不同路线同时给出解法。这不是巧合,而是 VLM 走向「可扩展」的分水岭。
一、为什么「持续学习」是多模态模型的死结
VLM 的能力扩展走的是两条路:扩参数、扩数据。但都绕不开同一个坑——
模型学到新分布的参数更新,会覆盖旧分布的权重。
直观理解:一个学生学了法语,结果把英语忘了。
在视觉语言场景下更严重:
• 工业质检 VLM 加了「缺陷识别」能力,原来「产品分类」准确率从 92% 跌到 71%
• 医学 VLM 加了「CT 影像解读」,原来「X 光片判读」漏检率翻倍
• 自动驾驶 VLM 加了「夜间行人识别」,白天「交通标志识别」召回率掉了 18%
这不是「没训练够」,而是「参数空间被新任务强行占据」。
过去的解决方案——正则化约束、回放缓冲区、参数隔离——要么效果有限,要么工程代价太高,无法工业化部署。
二、ProtoAda:用「原型」做参数隔离
ProtoAda 的核心思路极简:
不修改主干参数,只在主干之外挂载「任务原型」(Task Prototypes)。
具体机制:
• 主干网络冻结——保留通用视觉语言能力
• 每个新任务训练一组小型原型向量——本质是任务的「指纹」
• 推理时,根据输入特征匹配最相关的原型,按权重融合
带来的好处是颠覆性的:
• 零遗忘:主干不动,旧任务能力纹丝不变
• 轻量扩展:每个任务只需新增 0.3% 的参数
• 快速迁移:原型向量可在任务间插值,新场景只需少量样本冷启动
论文报告,在 12 个连续视觉任务的标准基准上,平均准确率 78.4%,比 SOTA 的微调基线高 11.6 个百分点,参数增量只有 1/15。
三、CRAM:让模型自己决定「记住什么」
CRAM(Cognitive Routing with Adaptive Memory)走的是另一条路——更激进、更类脑。
它引入了「自适应记忆库」机制:
• 模型内部维护一个动态记忆池,每个记忆单元带「重要性分数」
• 学新任务时,模型自动评估哪些旧记忆「仍有用」、哪些可以降权
• 路由网络(Router)根据任务上下文,动态选择调用哪些记忆
关键创新:「记忆遗忘」由模型自己决定,不再靠人工设计的正则项。
实验结果更夸张:
在长序列(25 个任务)的持续学习基准上,CRAM 保持 69.7% 的平均准确率,传统微调方法在第 8 个任务就崩盘到 41%。
CRAM 还展示了一个反直觉的能力:它能在学习新任务的同时,反向修复旧任务的偏差——等于模型有了「自愈」机制。
四、两篇论文为什么同时出现
这不是巧合。
过去半年,Meta、谷歌、阿里、字节的多模态团队都在公开场合抱怨同一个问题:「VLM 不好扩」。
市场对多模态模型的需求已经不是「通用」,而是「专用叠加」:
• 医院要通用 VLM + 医学专科
• 工厂要通用 VLM + 质检专科
• 车企要通用 VLM + 自动驾驶专科
• 零售要通用 VLM + 商品识别专科
传统做法是给每个场景训一个专属模型——成本爆炸、数据冗余、迭代缓慢。
ProtoAda 和 CRAM 给出了另一条路径:一个通用底座 + 一堆轻量外挂,按需组合。
这是多模态模型走向「工业化部署」的关键拼图。
五、对行业的判断
1. VLM 的竞争维度切换:从「谁更大」到「谁更能叠加」。一个 7B 的可扩展底座,可能比 70B 的单体模型更有商业价值。
2. 创业窗口出现:用 ProtoAda/CRAM 做底座,给垂类行业提供「通用 + 专科」的 VLM 服务,会是接下来 6-12 个月最拥挤的赛道。
3. 数据策略反转:以前攒数据是为了「训」,现在开始为了「挂」。数据飞轮的核心不是训练集规模,而是「任务多样性」。
4. 开源生态加速:两篇论文都承诺开源代码和权重,这会催生一波二次创新——医疗 V、教育 V、工业 V、自动驾驶 V 会像搭积木一样快速成型。
六、隐忧
两篇论文都不是「终极解」:
• ProtoAda 的原型数量随任务线性增长,长期会撞天花板
• CRAM 的路由网络对算力的额外开销不可忽视
• 两者都没解决「任务冲突」——两个相似任务同时挂载时性能会打架
但方向已经清晰:多模态模型的下一个十年,是「可组合性」的十年。
ProtoAda 和 CRAM,是这场变革的两个早期信号弹。






