LoRA 微调是什么?为什么小成本也能训练专用模型
LoRA 是 Low-Rank Adaptation,中文常叫低秩适配。它是一种参数高效微调方法:不直接改动大模型全部参数,而是在部分层旁边增加较小的可训练矩阵,让模型学会新任务或新风格。 为什么它能省成本 全量微调就像重新训练一整台复杂机器,显存、数据和工程成本都很高。LoRA 更像给机器外挂一组...
找到 8 篇相关文章
LoRA 是 Low-Rank Adaptation,中文常叫低秩适配。它是一种参数高效微调方法:不直接改动大模型全部参数,而是在部分层旁边增加较小的可训练矩阵,让模型学会新任务或新风格。 为什么它能省成本 全量微调就像重新训练一整台复杂机器,显存、数据和工程成本都很高。LoRA 更像给机器外挂一组...
2026年4月24日,DeepSeek V4 已正式浮出水面。和几个小时前还只能依据媒体传闻判断不同,现在 DeepSeek 官方 Hugging Face 组织已经上线 DeepSeek-V4-Pro、DeepSeek-V4-Flash 及对应 Base 模型,官方 API 价格页也同步出现 de...
很多人第一次认真跑本地模型,最后几乎都会碰到 Ollama。原因不复杂,它把“下载模型、启动服务、用 API 调用”这件事压得足够简单,让本地推理从折腾环境,变成一个更像安装工具的动作。对开发者和尝鲜用户来说,这个门槛下降非常关键。 官方仓库: https://github.com/ollama/o...
GLM-5.1 正式发布,Z.ai 将其定义为面向 agentic engineering 的新一代开源旗舰。官方资料显示,这款模型主打代码、工具调用与长时自主执行,在 SWE-Bench Pro、NL2Repo 和 Terminal-Bench 2.0 等任务上给出一组靠前成绩,同时把单任务连续自...
模型蒸馏是近两年被频繁提到的一个关键词,尤其是在“小模型为什么越来越强”这个问题上,它几乎总会出现。简单说,蒸馏的思路就是让较小的学生模型去学习较大的教师模型,把后者的一部分能力、行为方式和输出规律迁移过来,从而在更低成本下拿到更接近的效果。 这件事之所以重要,是因为很多团队并不需要一个最顶级、最昂...
模型量化是本地部署和高效推理里绕不开的关键词。很多人在看模型部署教程时,经常会碰到 8-bit、4-bit、AWQ、GPTQ 这类词,但不知道它们到底在解决什么问题。简单说,量化的核心就是把模型权重用更低精度来表示,从而降低显存占用、减少内存压力,让原本太大的模型更容易跑起来。 它之所以总和本地部署...