📰 新闻内容
大模型微调哪家强?以往评估 PEFT 方法的标准只有一个:下游任务准确率。但近日一篇来自arXiv的论文 PEFT-Arena 提出了更根本的追问:你在适配新任务的同时,到底保留了多少「前世记忆」?论文作者将这个问题框架化为「稳定性-可塑性困境」——一个来自神经科学的经典概念,终于被系统性地引入了 LLM 微调评估。
🧠 核心问题是什么? PEFT(Parameter-Efficient Fine-Tuning)已经成为 LLM 适配的标准范式——LoRA、Adapter、Prompt Tuning 等方法让人们不需要全量训练就能让模型适配特定任务。但现有评估体系的盲点在于:它只关心「学到了什么」,不关心「忘了什么」。一篇法律模型的微调可能在合同分类上达到 SOTA,但同时丢失了代码生成能力——这种事在现实中并不罕见。
PEFT-Arena 构建了一套双维度评估协议:不仅测下游准确率,还测量预训练知识的保留程度。实验覆盖了 LLaMA、Mistral、Qwen 等主流模型,结果揭示了一些反直觉的规律:某些高可塑性配置在下游任务上表现优异,但预训练知识保留率下降高达 40%。这意味着追求短期任务表现可能正在系统性损害模型的核心能力。
💡 这意味着什么? 这篇论文的价值不只是提出了一个新 benchmark,而是迫使我们重新思考「什么是好的微调」。当行业普遍把准确率当作唯一 KPI 时,PEFT-Arena 提醒我们:模型能力的「折旧」同样值得衡量。对于企业部署而言,这意味着更全面的模型选型依据;对于研究者,则打开了一个新的评估维度。 作者:Yangyi Huang, Ruotian Peng, Zeju Qiu | 来源:arXiv | 标签:#AI #LLM #PEFT #论文解读






