トークン(Token)
とーくん

トークン(Token)とは、LLM がテキストを処理する際の最小単位である。単語そのものではなく、単語の一部や記号、空白なども含まれ、モデルの語彙(ボキャブラリー)に基づいてテキストを分割した結果の断片を指す。
単語とは違う
「トークン」と聞くと単語を思い浮かべがちだが、実際にはもう少し細かい。英語の "unbelievable" は "un", "believ", "able" の 3 トークンに分割されることがある。日本語の場合はさらに事情が複雑で、ひらがな 1 文字が 1 トークンになることもあれば、漢字 1 文字で 2〜3 トークンを消費することもある。
この分割処理をトークナイゼーションと呼び、モデルごとに異なるアルゴリズム(BPE、SentencePiece など)を使う。同じ文章でもモデルによってトークン数が変わるのはこのためだ。
なぜトークン数が重要か
LLM のコストと性能は、ほぼすべてトークン数で決まる。API 利用料金は入力・出力のトークン数に応じた従量課金が一般的であり、コンテキストウィンドウ(モデルが一度に扱えるテキスト量)もトークン数で定義される。
推論速度にも直結する。Dense Model では全パラメータが各トークンの処理に関与するため、トークン数が増えれば比例して計算量が増える。長文の要約タスクで入力を圧縮する工夫が求められるのはこの制約による。
実務での見積もり
英語では「1 トークン ≒ 4 文字 ≒ 0.75 単語」がよく使われる目安だ。日本語はトークン効率が低く、同じ意味内容でも英語の 1.5〜2 倍のトークンを消費する傾向がある。多言語対応のシステムを設計する際には、この差をコスト見積もりに織り込む必要がある。
この用語を扱う記事
- トークントラップとは?AIエージェントの隠れたコスト爆発を防ぐ消費管理の実践高頻度エージェントループで請求額が急増する「トークントラップ」の仕組みと、バジェット上限・スロットリング・ループ設計によるコスト爆発の防止策を解説します。
- LLMコスト最適化ガイド — トークン削減・モデル選定・キャッシュ実装LLM の本番運用で膨らむコストを削減する実践ガイド。トークン最適化・モデル選定・プロンプトキャッシュ・RAG 設計の4つの柱で、精度を保ちつつ月額コストを半減させる実装パターンを解説する。
- コンテキストエンジニアリングとは?LLM 開発の新パラダイムとプロンプトエンジニアリングからの進化コンテキストエンジニアリング(Context Engineering)とは、LLM アプリケーションに最適な情報を動的に組み立てる設計手法です。プロンプトエンジニアリングとの違い、コンテキストウィンドウの構成要素、RAG やエージェントでの実装パターンを整理します。
- SLM蒸留とは?大規模LLMから小型特化モデルを作る方法大規模LLMを教師に使い、業務特化の小型プライベートモデルを低コストで構築するSLM蒸留の仕組みと実装手順を解説します。
関連用語

PEFT
PEFT(Parameter-Efficient Fine-Tuning)とは、大規模言語モデルの全パラメータではなく一部のみを更新することで、少ない計算資源とデータでモデルを特定タスクに適応させるフ

QLoRA
QLoRA(Quantized LoRA)とは、LoRA に 4bit 量子化を組み合わせることで、コンシューマ向け GPU でも大規模言語モデルのファインチューニングを可能にした手法である。

RLHF
RLHFとは人間のフィードバックを報酬として使う強化学習手法、RLVRとは検証可能な正解を報酬として使う強化学習手法であり、いずれもLLMの出力を人間の期待に沿うよう調整するために用いられる。

SLM(Small Language Model)
SLM(Small Language Model)とは、パラメータ数を数十億〜百億程度に抑えた言語モデルの総称で、LLMに比べ少ない計算資源で推論・Fine-tuningが可能なことを特徴とする。



