MoE(Mixture of Experts)
えむおーいー

MoE(Mixture of Experts)とは、モデル内部に複数の「エキスパート」サブネットワークを持ち、入力ごとにその一部だけを活性化させることで、パラメータ総数を増やしつつ推論コストを抑えるアーキテクチャである。
全部使わないから速い
GPT-4やLlama 4のような巨大モデルが、なぜ比較的現実的な速度で推論できるのか。その答えの一つがMoEアーキテクチャだ。
通常のTransformerモデル(Dense model)は、入力トークンが全パラメータを通過する。100Bパラメータのモデルなら、毎回100B個の重みが計算に関与する。MoEでは、たとえばモデル全体が2兆パラメータあっても、1回の推論で実際に使うのは170B程度——残りのエキスパートは「今回は出番なし」とスキップされる。
どのエキスパートを使うかを決めるのが「ゲーティングネットワーク」(ルーター)だ。入力トークンの特徴を見て、最も適切なエキスパートを2〜4個選択する。数学の問題ならロジック系のエキスパートが、翻訳タスクなら言語系のエキスパートが選ばれる、といったイメージで理解できる。
実際に使われているモデル
Meta の Llama 4 は Scout(17B active / 109B total)と Maverick(17B active / 400B total)でこのアーキテクチャを採用した。Google の Gemini シリーズも MoE ベースとされている。Mistral の Mixtral 8x7B は、7Bパラメータのエキスパート8個を束ねた構成で、推論時には2個だけを使う。
共通しているのは「パラメータ総数に対して、推論時のアクティブパラメータが劇的に少ない」という点だ。これにより、モデルの知識容量を維持しつつ推論速度とコストを現実的な範囲に収めている。
Dense model との使い分け
全パラメータを使う Dense model は、小〜中規模ではシンプルで扱いやすい。Fine-tuning もストレートにできる。MoEは大規模モデルでこそ本領を発揮するアーキテクチャで、数十B以下のモデルにはオーバーヘッドが見合わない場合もある。
また、MoEモデルのFine-tuningは全エキスパートに影響を与えないよう注意が必要で、LoRA等のPEFT手法との組み合わせ方にもノウハウが求められる。
この用語を扱う記事
- AIエージェント向けレイテンシ予算設計 — 思考時間と応答時間のトレードオフを制御する方法マルチステップ推論エージェントで「思考時間」が応答遅延を引き起こす問題を解説し、タスク複雑度に応じたレイテンシ予算の割り当てと実装パターンを比較します。
- Liquid Neural Networksとは?挙動が動的に変わる次世代AI推論推論中に時定数(time-constant)が入力に応じて変化し、ネットワークの挙動がリアルタイムに適応するLNNの仕組み・従来モデルとの違い・エッジAI活用の可能性を解説。学習済みの重みは固定したまま動的に振る舞う点を整理します。
- ローカル LLM / SLM 導入比較 — クラウド API に依存しない AI 活用GPT OSS・Phi-4・Llama 4 Scout 等のオープンウェイトモデルを GPU 要件・タスク別精度・TCO の 3 軸でクラウド API と比較。データ主権とコスト最適化を両立するローカル AI 導入ガイド。
- モデルマージとは?複数LLMを訓練なしで合成して性能を上げる技術ファインチューニング済モデルを数学的に結合し、計算コストを抑えながら複数スキルを統合するModel Mergingの仕組みと活用法を解説します。
関連用語

PEFT
PEFT(Parameter-Efficient Fine-Tuning)とは、大規模言語モデルの全パラメータではなく一部のみを更新することで、少ない計算資源とデータでモデルを特定タスクに適応させるフ

QLoRA
QLoRA(Quantized LoRA)とは、LoRA に 4bit 量子化を組み合わせることで、コンシューマ向け GPU でも大規模言語モデルのファインチューニングを可能にした手法である。

RLHF
RLHFとは人間のフィードバックを報酬として使う強化学習手法、RLVRとは検証可能な正解を報酬として使う強化学習手法であり、いずれもLLMの出力を人間の期待に沿うよう調整するために用いられる。

SLM(Small Language Model)
SLM(Small Language Model)とは、パラメータ数を数十億〜百億程度に抑えた言語モデルの総称で、LLMに比べ少ない計算資源で推論・Fine-tuningが可能なことを特徴とする。



