PEFT

PEFT(Parameter-Efficient Fine-Tuning)とは、大規模言語モデルの全パラメータではなく一部のみを更新することで、少ない計算資源とデータでモデルを特定タスクに適応させるファインチューニング手法の総称である。
数十億パラメータを持つ LLM をそのまま全パラメータ学習させようとすると、A100 を 8 枚並べても半日以上かかる。予算もハードウェアも限られた現場では、そもそも選択肢に入らないことが多い。PEFT はこの壁を「モデルの大部分を凍結し、追加した少量のパラメータだけを学習する」というアプローチで突破する。
代表的な手法を整理すると、以下のようになる。
- LoRA(Low-Rank Adaptation)— 重み行列に低ランクの差分を挿入する。追加パラメータはモデル全体の 0.1〜1% 程度。現時点で最も採用例が多い
- QLoRA — LoRA に 4bit 量子化を組み合わせ、GPU メモリをさらに半分以下に圧縮する。コンシューマ GPU でも 7B モデルの学習が回る
- Prefix Tuning / Prompt Tuning — 入力側に学習可能なベクトルを追加する方式。モデル本体には一切手を加えない
- Adapter — Transformer 層の間にボトルネック層を挿入する。LoRA 登場以前の主流だったが、今はやや影が薄い
筆者のチームでは、7B パラメータの LLM を LoRA で A100 1 枚・約 3 時間で学習させ、タスク特化の精度をベースモデル比 15〜20% 引き上げた。フル FT なら同じタスクに A100×8・12 時間は必要だったので、コスト差は歴然だった。
一方で万能ではない。モデルが元々持っていない能力——たとえば未対応言語での生成——を PEFT だけで獲得させるのは難しく、その場合は継続事前学習(Continued Pre-training)と組み合わせる必要が出てくる。
よく「PEFT と RAG はどちらを使うべきか」と聞かれるが、そもそも役割が違う。RAG は外部知識の参照、PEFT はモデルの振る舞いやスタイルの調整を担う。社内ナレッジを正確に引用させたいなら RAG、回答のトーンや形式を揃えたいなら PEFT、というのが実務での使い分けの出発点になる。両方を組み合わせるケースも珍しくない。
この用語を扱う記事
- ファインチューニングとRAGの選び方:コスト・精度・用途で比較する実践ガイドファインチューニングとRAGはどちらを選ぶべきか。コスト・精度・更新頻度・セキュリティの4軸で比較し、業務ユースケース別に最適な選択基準を解説します。
- PEFT(パラメータ効率型ファインチューニング)とは?AI モデルカスタマイズのコストを 90% 削減する技術PEFT(Parameter-Efficient Fine-Tuning)の仕組みと主要手法(LoRA・QLoRA・Adapter)を意思決定者向けに解説。自社 GPU 環境での実践事例と投資判断のポイントも紹介。
- ファインチューニング入門 — B2B企業が独自LLMを作る前に知るべき基礎と判断基準ファインチューニングの仕組みを基礎から解説。PEFT/LoRA との関係、RAG との使い分け、コスト試算、B2B 企業が独自モデル開発を判断するためのチェックリストまでをまとめます。
- ローカル LLM / SLM 導入比較 — クラウド API に依存しない AI 活用GPT OSS・Phi-4・Llama 4 Scout 等のオープンウェイトモデルを GPU 要件・タスク別精度・TCO の 3 軸でクラウド API と比較。データ主権とコスト最適化を両立するローカル AI 導入ガイド。
関連用語

QLoRA
QLoRA(Quantized LoRA)とは、LoRA に 4bit 量子化を組み合わせることで、コンシューマ向け GPU でも大規模言語モデルのファインチューニングを可能にした手法である。

RLHF
RLHFとは人間のフィードバックを報酬として使う強化学習手法、RLVRとは検証可能な正解を報酬として使う強化学習手法であり、いずれもLLMの出力を人間の期待に沿うよう調整するために用いられる。

SLM(Small Language Model)
SLM(Small Language Model)とは、パラメータ数を数十億〜百億程度に抑えた言語モデルの総称で、LLMに比べ少ない計算資源で推論・Fine-tuningが可能なことを特徴とする。

MoE(Mixture of Experts)
MoE(Mixture of Experts)とは、モデル内部に複数の「エキスパート」サブネットワークを持ち、入力ごとにその一部だけを活性化させることで、パラメータ総数を増やしつつ推論コストを抑えるア



