第225号

推論マージンが80%を超えたのにAIの利用価格が変わらない理由

推論マージンとクラウド原価の推計値を区別し、AIサービスの価格構造を読み解きます。

ビジネス推論マージンが80%を超えたのにAIの利用価格が変わらない理由

クラウドが40ドル引くのにマージンはなぜ80%になるのか

AI企業が100ドルを稼ぐと、そのうち35〜40ドルは即座に別企業の口座へと吸い込まれていきます。AWS、Azure、Google Cloudです。推論1を走らせる計算コストだからです。クラウド大手3社はこのお金から10〜20ドルを営業利益として残します。営業利益率にすると35〜45%の水準です。

バークレイズが2026年8月28日に公表した、AI産業のユニットエコノミクスに関するレポートの数字です。業界サマリーの図表を筆者自身が直接確認しましたが、表に記されているとおり、すべてバークレイズによる推計値です。2026年以降の数値は予測であり、確定した実績ではありません。

同レポートには次のような箇所もあります。AIラボの有料推論利益率について、2025年の十数パーセントから2026年には50〜65%以上へと跳ね上がり、調整後売上総利益率の改善幅は1年間で30〜50%ポイントに達すると推計されています。直接提供するAPIの推論利益率の推計値に至っては80%を超えていました。

ここで不思議に思われるはずです。100ドルのうち40ドルが計算コストとして消えていくのに、どうやって利益率が80%になり得るのでしょうか。**この2つの数字は分母が異なっています。**40ドルはAIラボ全体の売上高を基準に計算されたクラウド費用であり、80%はAPI売上高から当該リクエストの直接計算原価を差し引いた金額を、ふたたびそのAPI売上高で割った比率です。これほどマージンが改善したにもかかわらず、購入者が支払う料金が据え置きのままなのはなぜなのか、順を追って見ていきましょう。

2つの数字が食い違って見える理由

まずは、この2つの数字の分母を整理してみます。バークレイズによる産業サマリーの推計値をまとめると次のようになります。

単位:10億ドル202420252026E2027E2028E
AIラボ売上高726137376690
推論原価
(対売上比)
4 (57%)17 (66%)58 (42%)157 (42%)292 (42%)
訓練原価
(対売上比)
7 (96%)19 (70%)66 (48%)132 (35%)210 (30%)
ハイパースケーラーのAI売上高1136124289502
対AIラボ売上比153%136%90%77%73%

バークレイズ・リサーチの推計によるもので、2026年以降は予測値です。

2026年の欄を見ると、推論原価が売上高の42%、訓練原価が48%となっています。この2つを足し合わせた1,240億ドルが、そのままハイパースケーラーのAI売上高になります。AIラボ売上高の90%に相当します。

「100ドルのうち35〜40ドル」というのは、このうち推論の取り分だけを切り出した数字です。訓練費用は含まれていません。

「推論利益率80%」の範囲は、さらに一段狭くなります。すでに完成したモデルを運用して得たAPI売上高から、そのリクエストを処理した直接計算原価だけを差し引いた値だからです。訓練費用も研究開発の人件費もデータ調達コストも、ここには一切含まれていません。

つまり、前者の数字は企業全体の損益であり、後者の数字は単一の生産ラインにおける限界利益(貢献利益)です。どちらも正しい数値ですが、同列に並べて比較してはいけない数字なのです。ちなみにICONIQが集計したAI製品の実際の売上総利益率は、2024年が41%、2025年が45%、2026年が52%水準です。改善傾向にはありますが、80%とは程遠い水準にとどまっています。

表の2024年の欄を見ると、この構造がよりはっきりと見えてきます。2024年には推論と訓練を合わせた計算コストが売上高の153%に達していました。計算コストだけで売上高をオーバーしていたということです。ハイパースケーラーがAIラボよりも稼いでいた時代でした。

また、この表は誤読されやすい側面も持っています。「ハイパースケーラーのAI売上高の90%がAIラボからもたらされている」といった解釈が出回ることがありますが、因果の向きが逆です。分母はあくまでAIラボの売上高です。AIラボが1ドル稼ぐときにハイパースケーラーが90セントを稼ぐという意味であって、ハイパースケーラーの売上高の90%がAIラボから来ているという意味ではありません。後者の数値はこの表からは読み取れません。この表を見る際は、何を分母にして算出された比率なのかを真っ先に確認する必要があります。

最も利益が残らない商品はサブスクリプション

バークレイズは製品ラインごとの推論利益率を次のように分類しています。直接APIが80%超、間接APIがその中間、サブスクリプション製品が約70%です。Claude CodeやCodexのような定額サブスクリプション商品は、3つのラインの中で推論利益率が最も低くなっています。

定額サブスクリプションをパッケージで販売する側のほうがマージンが良さそうに見えますが、結果は正反対です。

理由は単純です。AIラボがサブスクリプションユーザーのトークン原価を意図的に補助しているからです。つなぎ留めておくべき顧客だからです。APIの顧客はすでにそのモデルの上に自社製品を組み込んでいるため容易には乗り換えられませんが、サブスクリプションのユーザーは翌月にあっさりと解約できてしまうからです。

最近、サブスクリプション製品の利用上限が頻繁にリセットされる現象も、同じ文脈で捉えることができます。モデルの効率が向上した恩恵もありますが、離脱を阻止しようとする圧力が同時に働いた結果だと見られます。これはバークレイズの観測に基づく分析であり、確定した事実ではありません。

整理すると次のようになります。AIの価格設定は、原価よりも「どの顧客をつなぎ留めるべきか」という力学によって決まっています。原価負担が最も重いラインよりも、解約の可能性が高いサブスクリプションユーザーの側に補助金が集中的に投じられているのです。

事業構成が異なれば帳簿の見え方も変わる

バークレイズは、仮想のフロンティアラボを2社設定して比較を行いました。実在する企業ではなく、シミュレーションモデルです。

ラボAは売上高の70%がAPI、30%がサブスクリプションです。ラボBは逆に80%がサブスクリプション、20%がAPIです。同じ産業で似たような製品を扱っているにもかかわらず、調整後売上総利益率はAが約55%、Bが約38%という結果になります。17%ポイントもの差です。

この格差の半分は先ほど確認したマージン構造に起因し、残りの半分は会計処理の違いから生じています。ラボAは間接API売上高を総額表示2で計上し、ラボBは純額表示で計上するか、あるいは戦略的パートナーが代理で運用する分をそもそも売上高として認識しません。バークレイズはこの関係性をUberとLyftの会計処理の違いに例えています。実質的に同一の事業でありながら、収益認識基準の違いによってレポートされる数字の見え方が大きく歪んでいる状況です。

クラウド事業者側から眺めると、構図はふたたび反転します。ラボAの売上高100ドルに対応するクラウド売上高は35ドル、営業利益は11.8ドルで利益率は34%となります。一方のラボBでは、パートナーとのレベニューシェアが加わることでクラウド売上高41ドル、利益19.1ドル、利益率は47%に跳ね上がります。

バークレイズはここに但し書きを添えています。レベニューシェアによって押し上げられたのは見かけ上の利益率にすぎず、トークン1個あたりで実際に手元に残る利益額はどちらの場合も同一である、という点です。そして、そのレベニューシェア契約は2028年以降には解消されると見ています。

もう一点、見落としてはならない要素があります。エージェント型のサブスクリプション商品は、クラウド事業者側に対して追加の価値を生み出します。単発のリクエストで完結せず、タスクの実行状態を保持したまま稼働し続けるため、データベースやストレージといった周辺リソースを併せて消費するからです。売上高1ドルあたりに付随するリソース消費量がより多くなることを意味します。一部の領域では、クラウド事業者とAIラボがこの取り分を分け合う契約も存在します。

これは導入側の企業にとってもそのまま当てはまります。エージェントを組み込むほど、モデルの呼び出し料だけでなく、その背後で稼働するインフラの消費コストが連動して膨らんでいきます。見積書にモデルの単価しか記載されていないとすれば、背後にぶら下がるインフラ消費コストが見落とされていることになります。

AIラボ各社がGAAP(米国会計基準)ベースの財務諸表を開示し始めれば、投資家はこうした収益認識基準の違いを自ら見極めなければならなくなります。各種指標を鵜呑みにできなくなる局面については、以前にも取り上げたことがあります。あのときはARRの算出ロジックが問題でしたが、今回はマージンの分母です。

原価は一方向だけに動いているわけではない

ここまでの議論は、「原価は低下していく」という前提に立っていました。トークンあたりの推論原価は、実際に低下を続けています。同一のタスクを完了させるために必要なトークン数が減少し、量子化や投機的デコーディングといった最適化技術が実装され、新世代の計算資源が相次いで投入されたためです。

しかし、その計算資源を調達してくるための価格は、正反対の動きを見せています。例えばM8/M9グレードのCCL3のように、ハイエンド部材が主流になるにつれて、この傾向はいっそう強まっています。

区分引き上げ率備考
メモリ前四半期比+45%2026年第2四半期
CCL+12〜22%M8/M9ハイエンド
MLB+15%AIアクセラレータ向け
パッケージ基板+15%メモリ向け
MLCC+15〜35%AIサーバー向け大容量
AIサーバー+15%以上

サムスン証券が各種報道を取りまとめたデータです。メモリの引き上げ率は、TrendForceが第2四半期の見通しとして提示していた汎用DRAMの58〜63%より低めですが、製品群をミックスした実現値に近い数字と見られます。

2つの原価が互いに逆方向へと動いているのです。**トークン1個を生成する原価は下落している一方で、トークンを生成するためのハードウェアを調達する価格は高騰しています。**そしてこの設備調達コストの上昇分は、まだAIラボの損益計算書に十分には反映されていません。サーバーは一度購入すれば、複数年にわたる減価償却費として少しずつ計上されていくからです。

したがって、現在の80%というマージンは手元に残る余裕資金というよりは、今後損益計算書へ徐々に反映されてくる調達原価の上昇分を吸収するためのバッファと捉えるのが妥当です。

なぜ重要なのか

この構造から、実務的に導き出される示唆が3つあります。

**第1に、将来の値下げを予算計画の前提に組み込んではいけません。**AIの導入計画を策定する際、「どうせトークン単価は下がり続けるはずだ」と思い込んで3年分の予算を組んでしまう組織が少なくありません。しかし過去1年間でマージンが30〜50%ポイント改善した間にも、購入者側に還元された値下げ幅はそれに遠く及びませんでした。原価の下落分は顧客に還元されることなく、ベンダー側の内部に留保されたのです。名目上のAPI単価に至っては、むしろ引き上げられた局面すら存在します。

バークレイズの見通しも同じベクトルを指しています。売上高に対する推論原価の比率は、2025年の66%から2026年には42%へと急減しますが、2027年と2028年も42%のまま横ばいで推計されています。**大幅な原価下落の恩恵は、すでに一巡したと見なしているのです。**今後改善に向かうのは訓練費用の比率であって、推論単価そのものではありません。

**第2に、ベンダーの事業構成を見極めることで交渉の余地が見えてきます。**API売上比率の高いベンダーはマージンに余裕があるものの、それだけに価格水準を死守するインセンティブも強く働きます。サブスクリプション比率の高いベンダーはマージンが薄い反面、顧客の解約に対して極めて神経質です。サブスクリプション比率の高いベンダーに対しては、ボリュームディスカウントの約束よりも、解約の可能性を交渉カードとして提示するアプローチのほうが効果的です。同じ要求を突きつけるにしても、どちらのタイプのベンダーを相手にするかによって引き出せる回答は異なってきます。

**第3に、クラウド事業者が手にする取り分は、AIラボの売上高比で見れば今後も縮小し続けると見込まれています。**ハイパースケーラーのAI売上高をAIラボの売上高で割った比率は、2024年の153%から2026年には90%、2027年には77%、2028年には73%へと低下していきます。訓練支出の比率もまた、2024年の96%から2027年には35%、2028年には30%へと落ち込みます。ただし、金額そのものは拡大の一途をたどります。ハイパースケーラーのAI売上高は、2026年の1,240億ドルから2028年には5,020億ドルへと急拡大します。縮小していくのはあくまでAIラボ売上高に対する相対的な比率であって、絶対額自体は増え続けるのです。

make moneyそれでも大まかな方向性は明白です。**AIラボの売上高はハイパースケーラーのAI売上高よりも急速に拡大しており、2028年からは確定済みの独自インフラプロジェクトが稼働を開始します。**クラウドインフラに関する長期契約や投資判断を行う際には、このタイムラインを必ず織り込んでおく必要があります。

業界全体の売上高は、2024年の70億ドルから2026年には1,370億ドル、2028年には6,900億ドルへと拡大すると予測されています。すべては予測値であり、もしこの市場規模が実現しなければ、前述の各種比率も同時に瓦解することになります。

おわりに

最後に3点だけ整理しておきます。

第1に、AIのマージンに関する数字を目にしたときは、まず分母を確認する必要があります。推論利益率80%と売上総利益率52%は、どちらも正しい数字です。90%という数字も同様です。何を何で割った数値なのかを確かめるだけで十分です。

第2に、現在の価格設定は原価の積み上げではなく、顧客をつなぎ留めるための戦略的判断によって決定されています。解約リスクの高いサブスクリプションの領域に、手厚い補助金が注ぎ込まれています。

第3に、原価は一方向にのみ下がっているわけではありません。トークンあたりの原価が下落する裏でサーバーやコンポーネントの価格は高騰しており、そのコスト増は減価償却を経て、これから損益計算書へと重くのしかかってきます。

読者の皆さんがこの1年ほどの間に使ってきたAIツールの中で、単価が実際に安くなったと実感できた経験はあるでしょうか。それとも、利用上限枠だけが拡大されて請求金額は据え置きのままだったでしょうか。どちらのケースが多かったのか、ぜひ伺ってみたいところです。

参考資料と関連リンク

アン・グァンソプ(Oswarld)のイラスト

著者 アン・グァンソプ(Oswarld) は世宗大学校 兼任教授、INLEVEL9 戦略コンサルタントです。経歴、研究、著書、最近の活動は著者紹介で更新しています。 最近の活動 · 2026年7月:HEMA-2: A Consolidation-Aware Tri-Memory Architecture with Multi-Channel Scheduling for Lifelong Conversational AI

用語解説

각주

  1. 推論(inference)。すでに学習を完了したモデルを実際に稼働させ、回答を生成するプロセスのことです。モデルを一から構築する学習(トレーニング)とは異なり、サービスが提供されている間はずっと発生し続けます。

  2. 総額表示と純額表示。仲介的な性格を持つ取引において、取引総額全体を売上高として計上するか(総額)、手数料部分のみを売上高として計上するか(純額)の違いです。同一の事業内容であっても、どちらの会計基準を採用するかによって売上高の規模や利益率の見え方が大きく異なります。

  3. CCL(Copper Clad Laminate)。プリント配線板(PCB)の基材となる銅張積層板のことです。MLB(Multi Layer Board)は多層基板、MLCC(Multi-Layer Ceramic Capacitor)は電子回路に組み込まれる積層セラミックコンデンサを指します。