LoRA
ローラ

LoRA(Low-Rank Adaptation、読みは「ローラ」)とは、大規模言語モデルの重み行列に低ランクの差分行列を追加し、その差分だけを学習することで、モデル全体の 0.1〜1% 程度のパラメータ追加でファインチューニングを実現する手法。IoT 向け無線規格の LoRa とは別物。
LoRA は Transformer の各層にある重み行列 W に対し、低ランク行列の積 A×B を加算する構造をとる。元の重み W は凍結したまま、追加した A と B だけを学習するため、学習対象のパラメータ数はモデル全体の 0.1〜1% 程度に抑えられる。ランク r は 4〜64 程度で設定するのが一般的で、r が小さいほどパラメータ数は減るが表現力とのトレードオフになる。
なお、読みが同じ「LoRa」は IoT 向けの長距離無線規格、「ローラ」は人名でもあり、検索では混同されやすい。本項は AI モデルの LoRA を扱う。
フルファインチューニング・QLoRA・RAG との比較
| フルファインチューニング | LoRA | QLoRA | RAG | |
|---|---|---|---|---|
| 学習対象 | 全パラメータ | 追加した低ランク行列のみ | LoRA + ベースモデルを 4bit 量子化 | 学習しない(検索で補う) |
| 必要な GPU メモリ | 非常に大きい | 中程度 | 小さい(家庭用 GPU でも可) | 不要 |
| 成果物 | モデル全体(数十 GB) | アダプタ(数十 MB) | アダプタ(数十 MB) | 検索インデックス |
| 向く目的 | 大幅な能力の変更 | 文体・出力形式・タスク特化 | 同左を低コストで | 最新情報・社内知識の参照 |
| 知識の更新 | 再学習 | 再学習 | 再学習 | データ差し替えで即反映 |
「社内文書の内容を答えさせたい」なら RAG、「決まった形式・口調・判断基準で答えさせたい」なら LoRA、という切り分けが基本になる。判断の詳細はファインチューニングと RAG の選び方を参照。
LoRA 学習の手順(6 ステップ)
- 目的とベースモデルを決める: オープンウェイトモデルから、ライセンスと日本語性能で選ぶ
- 学習データを整える: 指示と回答のペアを数百〜数千件。データの品質が結果の大半を決める
- 設定を決める: r・alpha・対象層(attention の q/k/v/o や MLP)を設定する。最初は r=8〜16 から
- 学習を回す: Hugging Face の PEFT や Unsloth を使えば、既存パイプラインに数行の追加で組み込める。所要は数十分〜数時間
- 評価する: 評価セットで学習前後を比較する(自動評価+人手のサンプル確認)
- 配布する: アダプタ(数十 MB)を別ファイルとして配布するか、ベースモデルにマージして推論サーバへ載せる
学習済みアダプタはタスクごとに差し替えられるため、1 つのベースモデルを複数用途に使い回せる。GPU メモリに余裕があればマージして推論速度を維持する運用も可能だ。
費用と所要時間の目安
数十億パラメータ級のモデルであれば、クラウドの GPU 1 枚を数時間借りる規模で学習でき、GPU 利用料は数千円〜数万円のオーダーに収まることが多い。フルファインチューニングと比べて桁が 1〜2 つ小さい。実際の費用の大半は GPU ではなく、学習データの作成と評価にかかる人件費である。API 型のファインチューニング(モデル提供各社のマネージドサービス)は GPU を自前で用意せずに済む代わりに、データ量に応じた学習料金と推論単価の上乗せがある。
向く用途・向かない用途
- 向く: 出力形式の固定(JSON・帳票)、専門分野の口調や判断基準の学習、特定タスクの精度向上、小型モデルへの知識蒸留
- 向かない: 最新情報の反映(RAG で対応)、モデルが元々持たない能力の獲得(例: 未対応言語の追加。継続事前学習との併用が必要)
筆者の環境では r=16 が多くのタスクで精度と効率のバランスが良く、最初の設定として採用することが多い。
関連記事・用語
- PEFT(パラメータ効率型ファインチューニング)とは?
- ファインチューニング入門 — B2B 企業が独自 LLM を作る前に知るべき基礎と判断基準
- PEFT / QLoRA / ファインチューニング / 量子化 / 知識蒸留
- 独自モデルの要否判断や PoC はAI・DX サービスで支援している
よくある質問
- Q.LoRA と QLoRA の違いは何ですか?
- A.QLoRA は LoRA の学習時にベースモデルを 4bit に量子化して GPU メモリを大幅に減らす手法です。学習の仕組みは LoRA と同じで、精度をほぼ保ったまま家庭用 GPU でも学習できる点が違います。
- Q.LoRA のファインチューニングにはいくらかかりますか?
- A.数十億パラメータ級のモデルなら、クラウド GPU 1 枚を数時間借りる規模で、GPU 費用は数千円〜数万円のオーダーが目安です。実際には学習データの作成と評価にかかる人件費の方が大きくなります。
- Q.社内文書を答えさせたいなら LoRA と RAG のどちらですか?
- A.RAG です。LoRA は文体・形式・判断基準を学ばせるのに向き、知識の追加や更新には向きません。社内文書の内容を根拠に答えさせるなら、検索で文書を渡す RAG を先に検討してください。
この用語を扱う記事
- ファインチューニングとRAGの選び方:コスト・精度・用途で比較する実践ガイドファインチューニングとRAGはどちらを選ぶべきか。コスト・精度・更新頻度・セキュリティの4軸で比較し、業務ユースケース別に最適な選択基準を解説します。
- ファインチューニング入門 — B2B企業が独自LLMを作る前に知るべき基礎と判断基準ファインチューニングの仕組みを基礎から解説。PEFT/LoRA との関係、RAG との使い分け、コスト試算、B2B 企業が独自モデル開発を判断するためのチェックリストまでをまとめます。
- PEFT(パラメータ効率型ファインチューニング)とは?AI モデルカスタマイズのコストを 90% 削減する技術PEFT(Parameter-Efficient Fine-Tuning)の仕組みと主要手法(LoRA・QLoRA・Adapter)を意思決定者向けに解説。自社 GPU 環境での実践事例と投資判断のポイントも紹介。
- SLM蒸留とは?大規模LLMから小型特化モデルを作る方法大規模LLMを教師に使い、業務特化の小型プライベートモデルを低コストで構築するSLM蒸留の仕組みと実装手順を解説します。
関連用語

PEFT
PEFT(Parameter-Efficient Fine-Tuning)とは、大規模言語モデルの全パラメータではなく一部のみを更新することで、少ない計算資源とデータでモデルを特定タスクに適応させるフ

QLoRA
QLoRA(Quantized LoRA)とは、LoRA に 4bit 量子化を組み合わせることで、コンシューマ向け GPU でも大規模言語モデルのファインチューニングを可能にした手法である。

RLHF
RLHFとは人間のフィードバックを報酬として使う強化学習手法、RLVRとは検証可能な正解を報酬として使う強化学習手法であり、いずれもLLMの出力を人間の期待に沿うよう調整するために用いられる。

SLM(Small Language Model)
SLM(Small Language Model)とは、パラメータ数を数十億〜百億程度に抑えた言語モデルの総称で、LLMに比べ少ない計算資源で推論・Fine-tuningが可能なことを特徴とする。



