LoRAは「低階適応」の略で、中国語では一般的に「低級適」(低級配)と呼ばれます。 パラメータの微調整に非常に効率的な手法であり、大規模モデルのすべてのパラメータを直接変更する代わりに、特定の層の隣に小さな訓練可能な行列を追加することで、モデルが新しいタスクやスタイルを学習できるようにします。
コスト削減の理由
完全なファインチューニングは、複雑な機械全体を再訓練するようなもので、メモリ、データ、エンジニアリングに高いコストがかかります。 LoRAは、機械に置き換え可能なモジュールのセットを追加し、この部分の新しいパラメータだけを訓練するようなものです。 これによりメモリ要件が大幅に削減され、異なるタスク間の切り替えがより便利になります。
LoRAは以下の用途に適しています
オープンソースモデルが特定の文体、業界用語、カスタマーサービススクリプト、構造化出力フォーマット、画像スタイル、または縦方向のタスクを学習するのに適しています。 多くのチームはLoRAを使って「プロンプトより安定しつつ、フルトレーニングより軽い」カスタムモデルを構築しています。
何にも合わない
LoRAは魔法のパッチではありません。 ベースモデルに特定の能力がなく、データが小さく混沌としている場合、LoRAは無から強力な能力を作り出すのが難しいでしょう。 また、RAGの代わりにはなりません。頻繁に変化する事実データに対応する必要があるタスクであれば、ナレッジベースを取得する方が、モデルに微調整するよりも通常は管理が良いです。
QLoRAおよびフルファインチューニング
QLoRAは量子化の上にLoRAを実行すると理解でき、さらに訓練リソースを削減します。 完全な微調整はより多くの元のパラメータを修正し、より強力な制御を提供しますがコストは高くなります。 実際の判断としては、まずプロンプトとRAGで解くこと、 LoRAを検討する前に、安定したスタイルや固定されたタスクパフォーマンスが必要です。 データ、予算、評価が成熟して初めて、より重い訓練ルートが検討されます。