AI Tokenomics

AIコストはどこで決まるのか:生成AIの費用構造を分ける5つのレイヤー

生成AIの費用を、シリコン、キャパシティ、推論スタック、モデル、ルーティングの5層に分け、トークン単価と消費量を別々に改善する方法を整理する。

更新 Research Note

AIトークノミクスの費用構造を、基盤からルーティングまで5層に分けて考えます。 人の確認費用を含む総原価の測り方は、AIトークノミクスの実務ガイドにまとめています。

生成AIの利用が増えるにつれて、企業では「トークン単価をどう下げるか」が議論されるようになりました。

しかし、モデルの料金表を比較するだけでは、AIコストの全体像は見えてきません。 同じ単価でも、キャッシュが効かず、過剰なモデルを選び、エージェントが再試行を繰り返せば、請求額は増えるからです。

Tokenomics Foundationが公開した生成AIの費用構造を5層に分ける解説には、この問題を端的に示す一節があります。

What a token costs is decided in the lower layers. How many tokens you spend is decided in the upper ones.

「1トークンのコストは下位レイヤーで決まり、消費するトークン数は上位レイヤーで決まる」という意味です(筆者訳)。

この二つを分ければ、AIコストを一つの数字として眺めるのではなく、どこで単価が決まり、どこで消費量が増えているのかを特定できます。

AIトークノミクスが扱うもの

トークノミクスという言葉から、暗号資産の発行量やインセンティブ設計を連想する人も多いでしょう。

しかし、元記事が扱うのは、生成AIがトークンを生成し、消費するまでの技術的な仕組みです。 トークンは分析対象そのものではなく、AI利用量を測るための計算単位として位置づけられています。

AIの費用は、単一のモデルによって決まるわけではありません。 どの半導体を使うのか、設備をどれだけ稼働させるのか、同じ計算を何度繰り返すのか、どのモデルへ処理を割り当てるのか。 こうした判断が積み重なった結果として、最終的なコストが決まります。

そこで元記事は、生成AIの費用構造を五つのレイヤーへ分けています。

AIコストを構成する5つのレイヤー

レイヤー 主な役割 コストに関する問い
L1:シリコン 半導体とハードウェア構成 1トークンを生成する物理コストはいくらか
L2:キャパシティ 設備容量、配置、稼働率 保有する計算資源をどれだけ有効利用できているか
L3:推論スタック キャッシュ、バッチ処理、推論エンジン 重複する計算をどこまで減らせるか
L4:モデルと量子化 モデルサイズと計算精度の調整 タスクに対してモデルが過剰ではないか
L5:ルーティングとガバナンス 振り分け、予算、上限、停止制御 不要な呼び出しや無制限な再試行を防げているか

この五層は独立していません。 下位レイヤーで生まれたコストと制約を上位レイヤーが引き継ぐため、下位で得た改善は上位の処理にも波及します。

一方、ガバナンス、アイデンティティ、監視、コスト管理は、特定の一層だけに置かれるものではありません。 どの処理がトークンを使ったのかを追跡し、予算を適用し、品質低下を検知するために、五層を横断して必要になります。

下位レイヤーがトークン単価を決める

L1とL2が決めるのは、主に1トークンあたりの実質的なコストです。

L1では、アクセラレーターの世代、メモリ、接続方式、消費電力などがコストの下限をつくります。 同じトークンを生成する場合でも、汎用GPUを使うのか、用途に適した専用ハードウェアを使うのかによって費用は変わります。

L2では、導入した計算資源をどれだけ仕事に使えているかが問われます。 高性能な設備を用意しても、利用の少ない時間帯に遊休状態が続けば、実際に処理されたトークンの単価は高くなります。

自社で推論基盤を運用する企業は、稼働率、地域配置、予約容量、オートスケーリングを確認できます。 外部の推論APIを利用する企業はL1とL2を直接操作できませんが、その差は利用モデル、提供プラン、地域などの価格条件を通じて現れます。

上位レイヤーがトークン消費量を変える

L3からL5は、仕事を処理するために必要な計算量そのものを変えます。

L3の推論スタックでは、キャッシュやバッチ処理を使って、同じ計算の繰り返しを抑えます。 共通のシステムプロンプトを毎回ゼロから処理する構成と、安定した接頭辞をキャッシュできる構成では、同じモデルを使っていても効率が異なります。

L4では、タスクに合ったモデルサイズと精度を選びます。 文章の分類や短い情報抽出のような処理に、常に最大規模のモデルを使う必要はありません。 小型モデルや量子化モデルで品質要件を満たせるなら、タスク単位の費用を下げられます。

L5では、リクエストの振り分けと利用上限を設計します。 簡単な依頼は小型モデルへ送り、複雑な依頼だけを高性能モデルへ回します。 エージェントが呼び出せる処理数や再試行回数に上限を設け、異常時には回路遮断の仕組みで停止させます。

ルーティングは平均的な効率を改善します。 予算上限と回路遮断は、最悪時の消費量を有限にするための制御です。

問い合わせ対応AIに当てはめる

この五層を、顧客からの問い合わせに回答するAIへ当てはめてみます。

すべての問い合わせを高性能モデルへ送り、毎回長い社内文書を読み込ませ、回答に失敗するたびに自動で再試行する構成では、利用量の増加とともに費用も膨らみます。

五層で分解すると、改善点を具体化できます。

  • L1とL2:計算資源の種類、契約形態、配置、稼働率を確認します。
  • L3:共通プロンプトや検索結果を再利用し、重複する推論を減らします。
  • L4:分類、検索、回答生成に必要なモデルの大きさと精度を個別に決めます。
  • L5:問い合わせの難易度による振り分けと、再試行回数や利用額の上限を設定します。

これにより、「もっと安いモデルを探す」という一つの施策ではなく、費用が発生する場所と消費が増える場所を分けて改善できます。

どのレイヤーから調べるか

五層の依存関係は下から上へ積み上がりますが、コスト調査を必ずL1から始める必要はありません。

まず、リクエスト単位の費用、キャッシュヒット率、モデル別の処理数、エージェントの呼び出し回数と再試行回数を記録します。 請求額が増えたときに、単価上昇と消費量増加を切り分けられる状態をつくるためです。

次に、上限のない処理をL5で止め、L3とL4で重複計算と過剰なモデル利用を減らします。 そのうえでL1とL2の設備、契約、稼働率を見直せば、上位レイヤーの無駄を高価な基盤で処理し続ける事態を避けられます。

ただし、品質指標を外して費用だけを最小化することはできません。 小型モデルへの切り替えや量子化によって業務品質が許容範囲を外れれば、安くても目的を満たさないためです。 各レイヤーの変更は、タスク成功率、応答時間、安全性と一緒に評価します。

コスト管理を共通の設計課題にする

AIコストは、経理部門だけが管理する数字でも、インフラ担当者だけが解決する問題でもありません。

製品チームが品質要件を決め、開発チームがモデルと処理方法を選び、基盤チームが計算資源を運用し、管理部門が予算と上限を設計します。 五層の枠組みを使えば、それぞれの判断が単価と消費量のどちらに影響するのかを共有できます。

元記事自身も、この五層を完成した標準ではなく、議論を始めるためのモデルとして位置づけています。 唯一の正解を示す表ではありません。 「トークンを安くつくる施策」と「使うトークンを減らす施策」を混同せず、AIコストを技術設計として話し合うための共通語彙です。

生成AIの利用が実験段階を終え、事業の通常業務へ組み込まれるほど、この区別は効いてきます。 モデルの価格表を見る前に、まず自社の処理が五つのレイヤーのどこで高くなっているのかを確認してください。

計算資源を調達してAIに成果物を作らせる方法と、成果物そのものを外部から購入する方法の関係は、BlackRock「マシンネイティブ経済」の解説で扱っています。 生成と調達を、同じ成果を得るための選択肢として比較します。

シリーズを最初から読む

AI Tokenomicsの管理対象から読み返すと、事業価値、トークン消費の増え方、費用構造のつながりを順に確認できます。

最初の記事を読む:AI予算を「トークン単価」だけで見てはいけない

AIトークノミクス講座

AI支出の可視化、トークン効率、予算管理を実務へ組み込む方法を講座で解説します。

AIトークノミクス講座を見る

参考文献

この記事を書いた人

中村泰行(Yasu Nakamura)

株式会社麻布技術研究所 代表取締役社長。 サイバーセキュリティ、人工知能、セキュアシステム、事業成長を主な専門領域としています。

著者プロフィール