合成データ(Synthetic Data)
ゴウセイデータ

AIが生成した訓練用データ。実データの不足を補い、プライバシーを保護しながらモデルの学習・評価に活用される。
合成データとは
合成データ(Synthetic Data)とは、実データを直接使わず、AI やルールベースのアルゴリズムによって人工的に生成されたデータセットである。モデルの訓練・評価・蒸留に広く活用されている。
合成データが必要になる場面
実データには「量が足りない」「偏りがある」「個人情報を含む」という三つの壁がある。たとえば医療分野では希少疾患の画像データが極端に少なく、金融分野では不正取引データが全体の 0.1% 未満ということも珍しくない。合成データはこれらのギャップを埋める実用的な手段だ。
LLM 時代の合成データ
知識蒸留との組み合わせが急速に広がっている。大規模な教師モデルに多様なプロンプトを与えて回答を生成し、その出力を生徒モデルの訓練データとする——Microsoft Phi シリーズの成功が示したパイプラインだ。
ファインチューニングの訓練データ作成にも使われる。社内文書を元に LLM で Q&A ペアを自動生成し、そのデータで RAG の回答品質を改善するアプローチは、筆者のプロジェクトでも実績がある。
注意すべきリスク
合成データだけで訓練すると、モデルが自身の出力パターンを強化する「モデル崩壊」が起きうる。実データとの混合比率を管理し、定期的に人間が品質を検証する運用設計が欠かせない。
この用語を扱う記事
- AI × Synthetic シンセティックテスト とは?合成データで LLM・AI エージェントを評価する仕組みシンセティックテスト(Synthetic Test)は合成データで AI を評価する手法。LLM や AI エージェントの品質保証における役割、LLM-as-a-Judge との違い、導入4ステップを当社が解説。
- SLM蒸留とは?大規模LLMから小型特化モデルを作る方法大規模LLMを教師に使い、業務特化の小型プライベートモデルを低コストで構築するSLM蒸留の仕組みと実装手順を解説します。
- AIデータレディネス監査とは?エージェントAI導入前に社内データを検査する方法AIエージェント導入の失敗原因の多くはモデルではなくデータにある。社内データの品質・アクセス性・構造を評価するデータレディネス監査の手順を解説。
- Eval-Driven Development(EDD)とは?評価ファーストで作るAI開発プロセス勘に頼らず評価指標をサイクル全体に組み込むEDDの考え方と、プロンプト・パラメータを自動調整する実践手順を解説します。
関連用語

AIレッドチーミング(AI Red Teaming)
AIシステムの脆弱性を攻撃者の視点で体系的にテストし、安全性リスクを事前に特定する評価手法。

グラウンディング(Grounding)
LLMの出力を外部データソースや検索結果と照合し、事実に基づいた回答を生成する技術。ハルシネーション低減の中核手法。

コンテキスト・エンジニアリング
コンテキスト・エンジニアリング(Context Engineering)とは、AI モデルに与えるコンテキスト——コードベースの構造、コミット履歴、設計意図、ドメイン知識——を体系的に設計・最適化する

CoT(思考連鎖)
LLMに推論の中間ステップを明示的に生成させることで、複雑なタスクの正答率を向上させるプロンプト技法。



