SLM(Small Language Model)
えすえるえむ

SLM(Small Language Model)とは、パラメータ数を数十億〜百億程度に抑えた言語モデルの総称で、LLMに比べ少ない計算資源で推論・Fine-tuningが可能なことを特徴とする。
「小さい」は弱いという意味ではない
LLMの世界では長らく「大きいほど賢い」が常識だった。GPT-4の推定1.8兆パラメータに対し、SLMは1B〜10B程度。桁が2つ違う。しかし2025年以降、この常識は急速に崩れつつある。
MicrosoftのPhi-4(14B)はいくつかの推論ベンチマークでGPT-4oに匹敵するスコアを出した。Googleの Gemma 3は1B〜27Bの範囲で、サイズあたりの性能が極めて高い。モデルアーキテクチャの改善と高品質な学習データのキュレーションによって、「小さくても特定タスクには十分な性能」が現実になった。
どこで使われているか
SLMの主戦場は3つある。
エッジデバイス: スマートフォン、IoTゲートウェイ、組み込み機器など、GPUリソースが限られる環境。AppleがiPhone上でオンデバイス推論を実行しているのはSLMの典型例だ。
コスト最適化: 分類・要約・データ抽出のような定型タスクにGPT-4クラスを使うのはオーバースペック。SLMなら推論コストが10分の1以下になることもある。
レイテンシ要件: リアルタイムチャット、音声応答、ゲームAIなど、数十ミリ秒の応答が求められる場面。パラメータが少ない分、推論速度は桁違いに速い。
LLMとの使い分け
万能な回答が必要な場面(複雑な推論、多言語対応、長文生成)にはLLMが依然として優位だ。一方、タスクを絞れるならSLMをFine-tuningした方が精度・速度・コストすべてで勝る場合がある。
実務では「まずLLM APIでプロトタイプを作り、タスクが固まったらSLMに蒸留してコストを下げる」という流れが定番になりつつある。蒸留(distillation)とは、大きなモデルの出力を教師データとして小さなモデルを訓練する手法のことだ。
この用語を扱う記事
- SLM蒸留とは?大規模LLMから小型特化モデルを作る方法大規模LLMを教師に使い、業務特化の小型プライベートモデルを低コストで構築するSLM蒸留の仕組みと実装手順を解説します。
- エッジAIとは?オンデバイスLLMの仕組みと業務での選び方エッジAI・オンデバイスLLMの基本と、クラウドLLMでは難しい低レイテンシ・データ持ち出し不可・通信不安定の業務をどう設計するかを解説します。
- ローカル LLM / SLM 導入比較 — クラウド API に依存しない AI 活用GPT OSS・Phi-4・Llama 4 Scout 等のオープンウェイトモデルを GPU 要件・タスク別精度・TCO の 3 軸でクラウド API と比較。データ主権とコスト最適化を両立するローカル AI 導入ガイド。
- ダイナミックプロンプトルーティングとは?クエリに応じてLLMを最適選択する設計単一LLMの限界を超え、クエリ内容に応じてリアルタイムで最適なモデルやテンプレートを振り分けるルーティング層の仕組みと実装パターンを比較解説。
関連用語

PEFT
PEFT(Parameter-Efficient Fine-Tuning)とは、大規模言語モデルの全パラメータではなく一部のみを更新することで、少ない計算資源とデータでモデルを特定タスクに適応させるフ

QLoRA
QLoRA(Quantized LoRA)とは、LoRA に 4bit 量子化を組み合わせることで、コンシューマ向け GPU でも大規模言語モデルのファインチューニングを可能にした手法である。

RLHF
RLHFとは人間のフィードバックを報酬として使う強化学習手法、RLVRとは検証可能な正解を報酬として使う強化学習手法であり、いずれもLLMの出力を人間の期待に沿うよう調整するために用いられる。

MoE(Mixture of Experts)
MoE(Mixture of Experts)とは、モデル内部に複数の「エキスパート」サブネットワークを持ち、入力ごとにその一部だけを活性化させることで、パラメータ総数を増やしつつ推論コストを抑えるア



