LoRA 是 Low-Rank Adaptation,中文常叫低秩适配。它是一种参数高效微调方法:不直接改动大模型全部参数,而是在部分层旁边增加较小的可训练矩阵,让模型学会新任务或新风格。
为什么它能省成本
全量微调就像重新训练一整台复杂机器,显存、数据和工程成本都很高。LoRA 更像给机器外挂一组可替换的小模块,只训练这部分新增参数。这样可以显著降低显存需求,也更方便在不同任务之间切换。
LoRA 适合什么
它适合让开源模型学习特定写作风格、行业术语、客服话术、结构化输出格式、图像风格或垂直任务。很多团队用 LoRA 做“比提示词更稳定,但比全量训练更轻”的定制模型。
它不适合什么
LoRA 不是魔法补丁。如果基础模型本来就不会某类能力,数据又少又乱,LoRA 很难凭空造出强能力。它也不能替代 RAG:如果任务需要回答经常变化的事实资料,检索知识库通常比把资料微调进模型更好维护。
和 QLoRA、全量微调的关系
QLoRA 可以理解为在量化基础上做 LoRA,进一步降低训练资源;全量微调则是修改更多原始参数,控制力更强但成本更高。实用判断是:先用提示词和 RAG 解决;仍需要稳定风格或固定任务表现,再考虑 LoRA;只有数据、预算和评测都成熟,才考虑更重的训练路线。