知識蒸留(Knowledge Distillation)
チシキジョウリュウ

大規模な教師モデルの知識を小規模な生徒モデルに転移させ、軽量かつ高精度なモデルを作成する手法。
知識蒸留とは
知識蒸留(Knowledge Distillation)とは、大規模な「教師モデル」の出力分布を学習データとして、小規模な「生徒モデル」を訓練する手法である。生徒モデルは教師モデルの推論パターンを模倣することで、パラメータ数を大幅に削減しながら高い精度を維持できる。
なぜ蒸留が必要か
数百億パラメータの LLM をそのまま本番環境に載せると、GPU コストとレイテンシが事業の制約になる。かといってゼロから小型モデルを訓練すると、大型モデルほどの精度は出にくい。蒸留はこの矛盾を解く実用的なアプローチだ。
たとえば Microsoft の Phi シリーズは、大型モデルが生成した合成データで小型モデルを蒸留し、SLM(Small Language Model)でありながら大型モデルに迫る性能を達成している。
ファインチューニングとの違い
ファインチューニングは既存モデルの重みを調整してタスクに特化させる手法であり、モデルサイズは変わらない。蒸留はモデルサイズ自体を小さくする点が異なる。実務ではまず蒸留で小型化し、その後 LoRA 等で業務ドメインに適応させるパイプラインが一般的になりつつある。
蒸留の限界
教師モデルが苦手なタスクは生徒モデルも苦手になる。また、教師モデルの出力を大量に生成する必要があるため、蒸留プロセス自体の計算コストは軽視できない。
この用語を扱う記事
- SLM蒸留とは?大規模LLMから小型特化モデルを作る方法大規模LLMを教師に使い、業務特化の小型プライベートモデルを低コストで構築するSLM蒸留の仕組みと実装手順を解説します。
- モデルマージとは?複数LLMを訓練なしで合成して性能を上げる技術ファインチューニング済モデルを数学的に結合し、計算コストを抑えながら複数スキルを統合するModel Mergingの仕組みと活用法を解説します。
- ファインチューニングとRAGの選び方:コスト・精度・用途で比較する実践ガイドファインチューニングとRAGはどちらを選ぶべきか。コスト・精度・更新頻度・セキュリティの4軸で比較し、業務ユースケース別に最適な選択基準を解説します。
関連用語

PEFT
PEFT(Parameter-Efficient Fine-Tuning)とは、大規模言語モデルの全パラメータではなく一部のみを更新することで、少ない計算資源とデータでモデルを特定タスクに適応させるフ

QLoRA
QLoRA(Quantized LoRA)とは、LoRA に 4bit 量子化を組み合わせることで、コンシューマ向け GPU でも大規模言語モデルのファインチューニングを可能にした手法である。

RLHF
RLHFとは人間のフィードバックを報酬として使う強化学習手法、RLVRとは検証可能な正解を報酬として使う強化学習手法であり、いずれもLLMの出力を人間の期待に沿うよう調整するために用いられる。

SLM(Small Language Model)
SLM(Small Language Model)とは、パラメータ数を数十億〜百億程度に抑えた言語モデルの総称で、LLMに比べ少ない計算資源で推論・Fine-tuningが可能なことを特徴とする。


