模型压缩与量化
解释让模型变小变快的几条路线:蒸馏如何把大模型能力搬到小模型,量化怎样用更低精度换来显存与速度,以及小语言模型的适用边界。
把模型塞进手机或一台入门显卡,靠的是三种办法:蒸馏让小模型去模仿大模型的输出分布,量化把权重从十六位压到四位或八位,剪枝则直接删掉贡献小的连接。三者换来的是显存、延迟和电费,代价是精度与鲁棒性,而且不同任务掉点差别很大,长文本生成和数学推理往往最先受影响。本标签说明每种方法的适用条件,以及如何确认压缩后还能不能上线。
解释让模型变小变快的几条路线:蒸馏如何把大模型能力搬到小模型,量化怎样用更低精度换来显存与速度,以及小语言模型的适用边界。
模型蒸馏是近两年被频繁提到的一个关键词,尤其是在“小模型为什么越来越强”这个问题上,它几乎总会出现。简单说,蒸馏的思路就是让较小的学生模型去学习较大的教师模型,把后者的一部分能力、行为方式和输出规律迁移过来,从而在更低成本下拿到更接近的效果。 这件事之所以重要,是因为很多团队并不需要一个最顶级、最昂...
模型量化是本地部署和高效推理里绕不开的关键词。很多人在看模型部署教程时,经常会碰到 8-bit、4-bit、AWQ、GPTQ 这类词,但不知道它们到底在解决什么问题。简单说,量化的核心就是把模型权重用更低精度来表示,从而降低显存占用、减少内存压力,让原本太大的模型更容易跑起来。 它之所以总和本地部署...
小语言模型,也就是 SLM,正在成为端侧 AI 和本地 AI 场景里的高频概念。过去大家更关注“大模型有多强”,但随着手机、PC、车载系统和边缘设备开始真正落地 AI,行业发现不是所有任务都需要超大参数模型。很多时候,速度、成本、隐私和本地可运行性,比参数规模更重要,这也是小语言模型越来越受重视的原...