メガトレンド · Artificial Intelligence

モデルは「学習」されるのは一度きり、でも「実行」は何十億回——これは、その何十億回のために設計されたチップの話です

世界がよく知るAIチップ(NVIDIAのGPU)は、モデルを「学習(training)」させるのが得意なように作られています。でも学習が起きるのはほんの数回。いっぽうモデルを「実行」して実際に質問に答えさせる(inference=推論)のは、毎秒のように何百万、何十億回も起きます。実行の量が学習を何倍も上回るようになると、答え1つあたりのコスト(cost per token)と速さ(tokens/秒)が新しい主戦場になる——そして、GPU全般より速く安く「実行だけ」をこなす新種のチップに道が開けるんです。このレッスンでは Groq、Cerebras、d-Matrix、そして本当の主役の多くがいまも非公開企業である理由を見ていきます。

分野 Artificial Intelligence レベル 個別トピック 成熟度 拡大期 読む時間 約13分
ある巨大な工場が、チップの像をたった一体だけ丁寧に鋳造する。その像は数えきれないほどの小さな影に複製され、世界中の人々の手へと流れ出していく。モデルを一度学習させ、それを膨大に繰り返し実行することを表している
ภาพประกอบ (hero.webp)
一度つくれば、使い道は無限. AIモデルは一度だけ学習され、でも実際に質問へ答える「実行」は何十億回も繰り返されます——その何十億回こそが、このチップ群の戦場です。

01これは何?——「学習」ではなく「実行」のためのチップ

ある辞書を一冊つくる場面を思い浮かべてください。辞書を書いて編集するのには何年もかかり、膨大なチームが要ります——でもそれは一度きり。そのあと毎日起きるのは、人が言葉を引くこと、何百万回も。AIの世界もまったく同じです。モデルを「学習(training)」させるのが辞書を書くこと、モデルを「実行(inference)」するのが言葉を引くこと——そしてこのnodeは、その「言葉を引く」ためだけに設計されたチップの話なんです。書くためではなく。

メガトレンドの地図で見ると、このnodeは大きなトレンドArtificial Intelligenceの中のAI Compute & Accelerator Siliconの下にある枝葉(leaf)です。定義はシンプル:「低遅延(low-latency)で速く流れる(high-throughput)モデル実行のために設計されたアーキテクチャ」。人の言葉にすると——AIが速く、しかも正しく答えることを、答え1つあたり最も安いコストで実現するチップです。

なぜこの仕事に専用チップが要るのか?それは「実行」と「学習」がまったく別の仕事だから。学習は逆向きの計算で重みを何兆回も調整する必要があり、柔軟性と莫大な生のパワーを求めます。いっぽう実行は前向き一方向の計算で、同じことを繰り返す、予測のつく仕事——こういう「何をするか前もってわかっている」仕事は、専用チップを設計すれば汎用チップよりずっと速く、消費電力も抑えてこなせます。これが、GroqのLPUやCerebrasのウエハー規模のマシンといった新種のチップが生まれた理由なんです。

知っておきたい用語
Training · Inference · Token · Latency

Training(学習)=膨大なデータでモデルを教えること。一度きり/ごくたまにしか起きない · Inference(実行・推論)=学習し終えたモデルを使って実際に質問へ答えること。ずっと起き続ける · Token=モデルが一つずつ生み出す小さなテキストの単位(だいたい単語や単語のかけら)。1段落の答えは数百tokenになることも · Latency(遅延)=答えが返ってくるまでの待ち時間——低いほど「サクサク」感じます

02なぜ重要か——「実行」が「学習」を上回るとき

すべてを変えたのはコンピュートの配分が逆転しつつあることです。2023年にはモデルの学習がコンピュートの約3分の2を、実行は3分の1だけを使っていました。でもAIが実験室を出て、何百万人もの現実の利用へと広がると、すべてがひっくり返ります——2025年には実行が約半分まで上がり、2026年にはAIコンピュート全体の3分の2を占めると見られています。多くの調査機関は、2028〜2030年までに実行が70〜80%を食うと見ています。

コンピュートの重心が「学習」から「実行」へ動いている
AIコンピュート全体に占める inference(実行)の割合——2028年は予測値
出典: Deloitte TMT Predictions 2026(2026年に inference がコンピュートの約2/3)、Futurum/Silicon Analysts——2028年は予測レンジの中央値

実行が大きな塊になると、その仕事をこなすチップの市場も一気に膨らみます。多くの調査機関は inference チップ市場を、どこまでを数えるかで違う見方をしていますが、向きは一致しています:Deloitte は inference 向けに設計されたチップだけで2026年に500億ドルを超えると見ています。広く取った inference チップ市場全体は2025年に約1,050億ドルで、多くの調査機関は2030年代前半に年率25〜28%で3,000〜5,700億ドルまで伸びると見ています。

2026年にはAIコンピュート全体の〜2/3が「実行(inference)」の仕事になる——2023年には1/3にすぎなかったところからの逆転です。これが、実行のために専用設計されたチップが、誰もが入りたい新しい戦場になった理由です。

大きさ以上に重要なのが、そのエコノミクスが学習とはまるで違うことです。学習では、良いモデルを手に入れるために高い費用を一度だけ払います。でも実行では、誰かが質問するたびに繰り返し払うことになる。だから答え1つあたりのコストをほんの少しでも下げられれば、それを何十億回も掛け算すると莫大なお金になります——これこそ、このチップ群が存在する理由のすべてです:何でも器用にこなすためではなく、たった一つの仕事をtoken あたり最も速く、最も安くこなすために。

03どう動くのか——一度学習して、あとは果てしなく実行する

このnodeの核心は、学習と実行のあいだの非対称性にあります。1つのモデルの一生をたどって、なぜ「実行」がすべてを左右する大きなコストの塊になるのかを見ていきましょう。

GPUで一度学習し、それを何十億回も実行する モデルは大量のGPUで長い時間をかけて一度だけ学習されます。学習が終わるとデプロイされ、実際の質問に答えるために何十億回も呼び出されて実行される。その1回ごとが、繰り返し払う答え1つあたりのコスト。ここが、inference チップが速く安くする出番です。 1つのモデルの一生 1 学習(train) GPU 1万台 · 何か月も 「一度きり」起きる 2 デプロイ モデルが使える状態に 質問を待つ 3 実行(inference) 現実の質問すべてに答える 何十億回も …1回ごと=コスト/答え モデルの一生のコストの大半は第3段階にある——第1段階ではない token あたりの時間とコストをほんの少し下げる × 何十億回 = 莫大な節約 → これが inference チップが存在する理由
すべてを変える非対称性. 学習は一度きり、でも実行は果てしない——モデルの一生にかかるコストは「実行」に集中し、だからこそ token あたりの速さと価格がすべてを決めます。

では inference チップはどうやって速くするのか?鍵はメモリにあります。モデルを実行するとき、ボトルネックは掛け算をする計算器ではありません——モデルの重みをメモリから運んでチップに送る、その部分が遅いんです。一般的なGPUは重みを「チップの外」にある HBM メモリに置き、毎秒およそ8 TB/sでデータを送ります。いっぽうGroqは重みをチップ上の SRAM にそのまま置く設計を選びました。これは80 TB/s以上という速さ——10倍以上です。結果、チップはデータを待たずに済み、token をはるかに勢いよく吐き出せます。

知っておきたい用語
SRAM vs HBM · Deterministic execution

HBM=チップの隣に置く高帯域メモリ。容量は大きいがアクセスは遅め(HBM & AI Memoryを参照)· SRAM=チップ上にそのまま埋め込まれたメモリ。とても速いが容量は小さい。inference チップの一部は速さのために容量を割り切る · Deterministic execution=コンパイル時にすべての処理をクロック単位で前もってスケジュールしておくこと。これで「ランダムなつまずき」がなくなる——Groqはこの方法で速さと安定性を最大まで引き出しています

04GPUやASICとどう違うのか——そして何とつながるのか

このnodeには、同じ一族の中に区別すべききょうだいがいます。どれもモデルを「実行」できる点は同じですが、思想が違うんです:

  • GPU & Merchant Acceleratorsとの違い: GPUは学習も実行もできる汎用チップ。強みは柔軟性と、世界中の開発者が慣れ親しんだソフトウェア(CUDA)。でもその柔軟性は、実行のときには要らない余分を抱え込みます——専用の inference チップはその余分を切り落とし、実行だけの仕事での token あたりの速さ/価格の良さと引き換えにするんです
  • Custom Silicon / ASICとの違い: 境界線はとても薄い——専用の inference チップ自体が ASIC の一種です。違いは「誰が、何のために作るか」。node 10010200 はテックの巨人が自分のクラウドで使うために自前で作る ASIC(GoogleのTPUなど)が中心。いっぽうこのnodeは、独立系のチップ会社が誰にでも売る/提供する inference チップ(Groq、Cerebras、d-Matrix)が中心です
  • HBM & AI MemoryFoundry & Contract Fabricationに頼る: SRAMを選ぼうとHBMを選ぼうと、これらのチップもまた、他のAIチップと同じく最先端の製造プロセスと高度なパッケージングで作られる必要があります

チップ一族の外に目を向けると、このnodeは他のトレンドに火をつける「エンジン」です:

  • Agentic AIに直接パワーを供給する: 段階を踏んで働くAIエージェント(agent)は、1つの仕事のあいだにモデルを何度も呼び出します——その1回ごとが新しい実行。agent が広まるほど inference の需要は何倍にもなる。これは速さと低コストを誰よりも渇望する顧客です
  • Semiconductors (Logic)の相棒: inference チップは、AIの仕事のために設計されたロジックチップそのもの——このnodeを「AI需要のレンズ」で見るのに対し、Logicは業界全体のチップ製造技術のレンズで見る。同じものの二つの見方です
  • Energy Transition & Power Demandから電力を吸い、Cloud & Digital Infrastructureに頼る: 毎秒のように起きる実行は電力を消費し続けます(回ごとに終わる学習とは違って)。だからワットあたりの効率が、このチップ群の主な売りになる。そしてこのnodeは、AIに速く答えてほしいRoboticsBiotechの両方も「enables」します
視点 覚えやすい言い方:GPU=「万能ナイフ」(学習も実行もできる)· テックの巨人のASIC=「自分の厨房のために研いだナイフ」· 独立系の inference チップ=「切る仕事だけのために研いで、どの厨房にも売るナイフ」。どれも切れますが、専用になるほどその仕事を速く安く切れる——他のことができなくなる代わりに。

05いま、どこまで来たのか

この戦場はいま熱く、しかも驚きが二層あります。一層目はグラフを突き破る速さの数字。専用チップは LLM を、単体のGPUより文字どおり桁違いに速く実行します——Groqは毎秒およそ300〜750 token、一般的なGPUの約100に対して。そしてCerebrasはウエハー規模のマシンで、大型のLlamaモデルにおいてユーザー1人あたり毎秒2,500 token超を叩き出します。d-Matrixも、自社プラットフォームはGPUシステムより速く、コストが低く、消費電力も何倍も少ないと主張しています。

専用チップは単体のGPUより何倍も速く token を吐き出す
LLM 実行のおおよその速さ(token/秒・ユーザー1人あたり)——モデルや設定で変わる
出典: Groq(300〜750 tok/s)、Cerebras(Llama 4 Maverick で〜2,522 tok/s)、SemiAnalysis——数値はモデル/設定で変動

二層目は本当の主役の多くがいまも非公開企業であること——Groq、SambaNova、d-Matrix はまだ株式市場に上場しておらず、個人投資家が直接買うことはできません。d-Matrix は2025年末にシリーズCで2億7,500万ドルを、企業価値20億ドルで調達したばかり。いっぽうウエハー規模チップの先駆者 Cerebras は、この群でいち早く株式市場へ踏み出した1社で、2025年の売上は約5億1,000万ドル(76%増)、OpenAIからの200億ドル超のコンピュート購入契約が後押ししています。

もう一方では、NVIDIAやAMDといった王者も黙って見ているわけではありません。両社とも inference 向けにチューンしたチップ/モデルを出しています——NVIDIAは長大なコンテキストの実行向けに設計した Rubin CPX を発表(2026年末投入予定)、AMDは Instinct ファミリー(MI350/MI400)を演算あたりのコストで勝負する選択肢として押し出し、OpenAI を戦略パートナーに迎えました。だから inference の戦場は「スタートアップ vs 巨人」だけではなく、誰もが入ってくる速さ・コスト・柔軟性という軸での競争なんです。

1つの四角いチップが、小さなテキストの粒の流れを強い噴流のように勢いよく吐き出している。隣のチップが一滴ずつしか出さないのと対照的に、はるかに速く連射している。専用の inference チップが一般的なGPUより何倍も速く token を生み出すことを表している
ภาพประกอบ (firehose.webp)
勝負は答え1つあたりの速さ. 実行のために専用設計されたチップは、単体のGPUより何倍も勢いよく token を吐き出します——何十億回も繰り返す仕事では、その速さはそのままお金になります。
この分野の主役たち
米国 · ウエハー規模の先駆者
ウエハー1枚まるごとのサイズのAIチップ(Wafer-Scale Engine)を作り、モデルの重みをチップ全体に載せる。だから LLM を毎秒〜2,500 token という速さで実行できる——2025年の売上は約5億1,000万ドル(76%増)で、OpenAIからの200億ドル超のコンピュート契約が後押し。この群でいち早く株式市場へ入った1社。
core · 速さのリーダー
NVIDIANVDA · US
米国 · 自ら降りてきた王者
学習チップの王として知られていますが、NVIDIAはすでに inference の仕事の大半を握っており、長大なコンテキストの実行向けにチューンした Rubin CPX などの専用チップも出しています(2026年末予定)——inference が王者の「弱点」だと多くの人が思うほどには、そうではない理由です。
core · 王者
AMDAMD · US
米国 · コストの挑戦者
Instinct ファミリー(MI350/MI400)を、実行の仕事における演算あたりの総コストで勝負する選択肢として押し出し、OpenAI を戦略パートナーに迎えました——inference の戦場を速さだけでなくコストの軸でも競わせる、価格面の圧力です。
core · コストの競合
Groq非公開
米国 · 非公開
モデルの重みをチップ上の SRAM に置き(帯域は80 TB/s以上)、すべての処理をクロック単位で前もってスケジュールする(deterministic)ことで、速さと安定性を最大まで引き出す LPU(Language Processing Unit)の作り手。LLM を毎秒およそ300〜750 token で実行する。いまも非公開企業。
core · low-latency のリーダー
SambaNova Systems非公開
米国 · 非公開
大型モデルを効率よく実行するためにチューンした dataflow アーキテクチャを設計し、企業や政府にフルセットのシステムとして販売する——専用 inference の挑戦者の1社で、いまも非公開企業。
core · フルセット型
d-Matrix非公開
米国 · 非公開
Corsair チップ上で in-memory compute(メモリの中で計算する)という考え方を使い、「メモリの壁」を打ち破る——速さとエネルギーあたりの効率でGPUシステムを何倍も上回ると主張。2025年末にシリーズCで2億7,500万ドルを企業価値20億ドルで調達したばかり。いまも非公開。
core · in-memory compute

06未来——モデルが「たくさん考える」時代

このnodeにとって最大の追い風は推論型モデル(reasoning models)です。新しい世代のモデルはすぐには答えず、答える前に段階を踏んで「頭の中で考え」ます——その頭の中の思考とは、ユーザーには見えない膨大な token を生み出すこと。結果、1つの質問が実行段階で前の世代のモデルより5〜10倍のコンピュートを食うこともあります(重い仕事ではエネルギー換算で70〜100倍に達することも)。だから inference の需要は、利用者数だけでなく「質問あたりの token 数」の急増に沿っても伸びていくんです。

一見矛盾しているようで実は補い合っているのが、token あたりの価格がとても速く下がっていることです。GPT-3.5級のモデルを実行するコストは、2022年末から2024年末にかけて280倍以上も下がりました——でも安くなるほど人はもっと使い、モデルはもっと考えるので、総利用量が価格の低下より速く伸びる。これが「AIコストのパラドックス」で、単価が下がってもAI企業のコンピュート請求書がふくらみ続ける理由——そして、誰もが最も安く実行できるチップを探し回る理由です。

token あたりの価格は急落、でも利用量はそれより速く急増
おおよその指数(基準=2023年を100)——同じ能力レベルのモデルの token あたり価格 vs システム全体で使われた token の量
出典: Epoch AI & arXiv(2024年初め以降、inference 価格は平均で年〜200倍下落)、Deloitte——傾向を示すための合成指数

二つ目の方向は実行が分散していくことです。すべての仕事が巨大なデータセンターで動く必要はありません——inference の一部は、低遅延とプライバシーのために利用者の近くへ移り始めています(Edge & On-device AI Siliconを参照)。これが、大きなGPUの届かない場所で、特に低消費電力なアーキテクチャが活躍する余地を開きます。

脳の形をした思考の塊。その内部は長く入り組んだ曲がりくねった道で埋め尽くされ、最後にようやく終点でたった一文の短い答えへとたどり着く。モデルが答える前にとても長く段階的に考えることを表している
ภาพประกอบ (reasoning.webp)
考えるほど token を食う. 推論型モデルは答える前に膨大な「頭の中の思考」token を生み出します——だから実行の需要は、利用者数だけでなく賢さに沿って伸びるんです。

07課題とリスク

一つ目のリスクは王者も実行の戦場に降りてきていることです。多くの人は inference を NVIDIA の「弱点」だと思っていますが、実際には NVIDIA はすでに inference の仕事の大半を握っており、自分の陣地を守るためにチューン専用チップ(Rubin CPX など)まで出しています。いっぽうAMDも魅力的な総コストで追い上げてくる——だから inference スタートアップは、慣れ親しんだ「ソフトウェアのエコシステムから出る」ことに見合うだけ、十分に速く安くなければなりません。これはスライド上の速さの数字より越えるのが難しい壁です。

二つ目のリスクは目立つ主役の多くがいまも非公開企業であることです。Groq、SambaNova、d-Matrix はまだ株式市場におらず、一般の投資家が直接アクセスするのは難しい。そして顧客基盤をつくるためにまだ資金を燃やしている若い会社として、利益への道はこれから証明していく段階です——買収される会社もあれば、生き残れない会社もあるでしょう。「技術がすごい」ことが「事業が生き残る」ことを保証しない戦場です。

三つ目のリスクは少数の顧客への依存と、サイクルへの問いです。inference チップの大きな需要は、同時に巨額を投じる少数のAI企業とクラウドの巨人から来ています(Cerebras と OpenAI のあいだの巨大契約など)。もしAIからのリターンが想定より遅れたり、投資が鈍ったりすれば、尽きないように見えた需要も急速にしぼみかねません。そして顧客が少数に集中しているがゆえに、大型のディール1つを失うだけで会社全体が揺らぐこともあります。

投資家へのまとめ Inference-Optimized Silicon は、「AIが世界中で実際に使われるようになれば、実行は学習を何倍も上回り、token あたり最も速く安く実行できる者に報いる」という賭けです。鍵は三つ:(1)「たくさん考える」モデルが実行の需要を、利用者数だけでなく賢さに沿って押し上げる=構造的な追い風 · (2) 本当の優位は、GPUのエコシステムから移るに見合うほど良い「token あたりのコスト+速さ」 · (3) 本当の主役の多くがいまも非公開で、既存の王者も inference を握っている——価値が向かうのは、「現実の仕事で本当に速く安いと証明できる」者であって、紙の上だけの者ではありません。

ひとことで言えば:このnodeは、AIが最も頻繁にやる仕事——モデルを「実行」して実際の質問に何十億回も答えること——のために生まれたチップです。実行が大きくなり続け、モデルがますますたくさん考えるようになるほど、token あたり最も速く安く実行できる者が、AI経済全体を動かす大事な鍵の一つを握ることになります。

このテーマのライブデータ・銘柄・ニュースを見る →