GPU中心からメモリ中心へ:AI半導体パラダイムの変化
AIシステムのボトルネックは、演算性能だけでなく、データを保存・移動する能力へと移りつつある。HBM、NANDベースのHBF、カスタムベースダイ、3Dパッケージング、光インターコネクトが組み合わさり、アクセラレータとメモリを一体的に設計するメモリ中心コンピューティングが台頭している。
- メモリ中心コンピューティングはGPUをなくす概念ではなく、データ移動コストを削減するために演算装置とメモリ階層を一体的に設計するアプローチである。
- 長いコンテキストと同時リクエストの増加はKVキャッシュ容量を拡大させ、HBMの帯域幅だけでなく、メモリ全体の容量と階層化技術も重要にする。
- HBFはNANDフラッシュの高い集積度を活用するが、レイテンシー、書き込み寿命、エラー管理の問題から、HBMをそのまま置き換えるよりも補完する可能性が高い。
- GPUの上または下にメモリを垂直積層する構造は配線距離を短縮する一方、熱密度、歩留まり、電力供給、冷却という新たな制約をもたらす。
- カスタムHBMはメモリ企業の設計参加を拡大するが、メモリ価格の変動や供給サイクルそのものをなくすわけではない。
AI半導体の競争基準は、単純な演算回数から、どれだけ多くのデータを少ない電力で保存し、移動できるかへと拡張されている。大規模なAI推論では、GPUが計算を実行できないのではなく、必要なモデルの重みとKVキャッシュを適時に供給されず、待機する状況が発生する。
この変化は、しばしば「GPU中心からメモリ中心への転換」と表現される。ただし、GPUが消えたり、進化が止まったりしたという意味ではない。より正確には、GPU、HBM、外部メモリ、ストレージ、ネットワーク、ソフトウェアを一つのデータ移動システムとして共同設計する方向である。
メモリ中心コンピューティングとは何か
メモリ中心コンピューティングとは、データを演算器へ繰り返し運ぶコストを削減するため、メモリの位置、帯域幅、容量、演算機能をシステム設計の出発点とするアプローチである。
AIチップの演算処理量は急速に増加したが、チップ外部からデータを取得するプロセスは相対的に遅く、多くの電力を消費する。そのため、次のような技術が併せて重要になっている。
- GPUまたはAIアクセラレーターの近くに配置するHBM
- メモリとロジックを垂直に接続する3Dパッケージング
- ベースダイに制御機能または一部の演算機能を搭載するカスタムHBM
- CXLを利用したメモリ拡張とプーリング
- NANDフラッシュを広幅インターフェースで接続するHBF構想
- チップとサーバー間の伝送電力を低減するための光インターコネクト
- データをメモリの近くで処理するPIMとnear-memory computing
つまり、メモリ中心という表現は、特定のメモリ製品一つを意味するものではない。高速メモリから大容量ストレージまで、複数の階層を束ねてデータ移動を最小化するシステム原則である。
なぜAI推論がメモリのボトルネックを拡大するのか
モデルの重みとKVキャッシュは異なる負担である
AI推論に必要なメモリは、大きくモデルの重み、実行中に生成される活性値、KVキャッシュに分けられる。モデルの重みはリクエストがなくても一定の容量を占めるが、KVキャッシュは入力長、出力長、同時リクエスト数に応じて増加する。
Transformerモデルは、以前のトークンを毎回最初から計算し直さないよう、各レイヤーのAttentionのキーと値の情報をKVキャッシュに保存する。単純化すると、1リクエスト当たりのKVキャッシュ容量は次の要素に比例する。
正確なKVキャッシュ容量は、モデルアーキテクチャと実装仕様で確認する必要がある。
KVキャッシュには、キーと値がそれぞれ保存される。そのため、コンテキストが長くなったり、同時に処理するユーザーが増えたりすると、KVキャッシュは急速に大きくなる。すべてのモデルが数百万トークンを使用したり、キャッシュが一律に数百倍増加したりするわけではないが、長文推論とエージェント型タスクがメモリ圧力を高めるという方向性は明確である。
ハルシネーションとメモリ容量は同じ問題ではない
より長いコンテキストと検索拡張生成は、モデルにより多くの根拠を提供できる。しかし、メモリを増やすだけでハルシネーションがなくなるわけではない。検索結果の品質、プロンプトの構成、モデルの推論能力、出典の検証、評価体系も併せて必要となる。
ソフトウェアが物理メモリの需要を減らすこともある
KVキャッシュのボトルネックは、ハードウェアの増設だけで解決するものではない。
- MQAとGQAは、保存すべきKVヘッド数を減らす。
- 量子化は、重みとキャッシュのバイト数を減らす。
- PagedAttentionは、キャッシュをページ単位で管理し、断片化と無駄を軽減する。
- 継続的バッチ処理は、複数のリクエストを効率よくまとめる。
- プレフィックスキャッシュは、繰り返されるシステムプロンプトや共通コンテキストを再利用する。
- キャッシュの削除と階層別オフロードは、重要度の低い情報をより低速なメモリへ移動させる。
したがって、データセンターの実際のメモリ投資量は、モデルの規模だけでなく、推論エンジンの効率によっても変わる。
AIデータセンターのメモリ階層
一つのメモリですべての速度、容量、価格、電力効率を満たすことは難しい。AIデータセンターは、次のような階層構造へ発展する可能性が高い。
| 階層 | 代表技術 | 強み | 主な限界 | 想定される役割 |
|---|---|---|---|---|
| チップ内部 | SRAM、レジスター | 最も短いレイテンシ | 容量が非常に小さく、面積コストが高い | 直ちに使用するデータと演算中間値 |
| アクセラレーター隣接 | HBM | 高い帯域幅と比較的短いレイテンシ | 容量・パッケージングコスト・熱の制約 | アクティブな重み、頻繁に使用するKVキャッシュ |
| サーバーメモリ | DDR、CXL接続メモリ | HBMより大きな拡張容量 | アクセラレーターから遠く、帯域幅が低い | キャッシュ拡張、モデル階層化、メモリプール |
| 高帯域幅フラッシュ | HBF構想 | NANDベースの高い集積度と不揮発性 | 読み取りレイテンシ、書き込み寿命、制御の複雑性 | 使用頻度の低い重み・KVキャッシュ階層 |
| ストレージ | NVMe SSD | 大容量と低いビット当たりコスト | メモリより長いレイテンシ | チェックポイント、データセット、コールドデータ |
核心は、HBMとHBFのどちらか一方が勝つことではなく、データの使用頻度に応じて複数の階層を配置することである。
FMS 2026が示した次世代メモリ競争
2026年8月に米国サンタクララで開催されたFMSでは、HBM以降のAIメモリとストレージ構造が主要議題として取り上げられた。議論の中心には、より高い積層、NANDベースの大容量階層、カスタムメモリ、データセンター接続技術があった。
Samsung ElectronicsのGHBM、SK hynixがGoogle・SanDiskと議論したHBFなどは、こうした方向性を示す事例として紹介された。ただし、GHBM、HBF、THBMといった名称は、いずれもJEDECで同一仕様として確定された汎用的な世代名だと断定することは難しい。企業の発表段階にある技術、共同開発の概念、標準化された商用製品を区別して捉える必要がある。
また、世代名が上がったからといって、実際のAIサービスが必ず高速化するわけではない。実効帯域幅、メモリ容量、レイテンシ、電力、冷却、パッケージ歩留まり、ソフトウェア対応を併せて比較する必要がある。
HBMの強みと容量の限界
HBMは、複数のDRAMダイを垂直に積層し、シリコン貫通電極と広幅インターフェースで接続する。一般的なボード型メモリよりもアクセラレーターの近くで、多くのデータを並列に供給できることが核心的な利点である。
しかし、HBMの容量を無限に増やすことは難しい。
- 積層数が増加すると、製造歩留まりと検査の難易度が高まる。
- GPUとHBMを一緒に配置するパッケージ面積が大きくなる。
- アクセラレーターとメモリで発生した熱を、狭い空間から除去しなければならない。
- 電力供給網とインターポーザー配線も複雑になる。
- 高価なHBMを使用頻度の低いデータの保存にまで使うと、経済性が低下する。
このため、HBMは最も頻繁に使用するデータを担当し、残りをCXLメモリ、フラッシュ、またはSSDに移す階層化が重要になる。
HBFはHBMを代替できるのか
HBFはHigh Bandwidth Flashの略で、NANDフラッシュを並列化・積層し、従来のSSDよりアクセラレーターに近い高帯域幅メモリ階層を作ろうとする構想である。NANDはDRAMより高い集積度と不揮発性を提供するため、同じ物理空間により多くのデータを収容できる余地がある。
しかし、NANDはDRAMとは特性が異なる。
- 読み取りレイテンシが長い。
- 上書きの前に消去処理が必要である。
- 書き込み回数に応じた寿命管理が必要である。
- 不良ブロック、エラー訂正、ウェアレベリングが必要である。
- 小単位の不規則なアクセスより、大単位のシーケンシャルアクセスに適している。
したがって、HBFが商用化されてもHBMをそのまま置き換えるのではなく、HBMとSSDの間の大容量階層として機能する可能性が高い。読み取り中心のモデルの重み、再利用頻度の低いキャッシュ、チェックポイント、検索データなどが候補になり得る。実際の適合性は、インターフェース規格、レイテンシ、耐久性、コントローラー、推論ソフトウェアの対応に左右される。
GHBMとTHBMが提起する3Dパッケージングの課題
アクセラレーターとHBMをパッケージ上で横並びに配置する方式には、接続幅とパッケージ面積に限界がある。これを克服するため、ロジックとメモリを垂直に積み重ねて配線長を短縮する構想が登場している。
GPUの上にメモリを配置する構造
GHBMまたはZ軸HBMとして紹介される概念は、GPUとHBMを垂直に結合し、データの移動距離を短縮する方向である。短く多数の垂直接続により、高い帯域幅と低い入出力電力が期待される。
問題は熱である。GPUの上にメモリを配置すると、GPUで発生した熱がメモリと冷却装置の間を通過する可能性がある。「メモリが溶ける」という表現は、技術的な説明というよりも、熱問題を強調した比喩に近い。実際のリスクは、接合部とメモリの許容温度超過、リーク電流の増加、性能制限、寿命低下である。
メモリの下、GPUの上という構造
Kim Jung-ho KAIST教授側が提案したとされるTHBMは、HBMスタックの上側にGPUを置き、発熱の大きいロジックを冷却装置により近く配置する発想である。放熱には有利となり得るが、次の課題が残る。
- 重いロジックダイとメモリ積層の機械的安定性
- 電力供給と信号配線
- 異なるプロセスで製造したダイの接合歩留まり
- 不良ダイの交換とテスト可能性
- 冷却板まで含めたパッケージ設計
垂直積層の競争力は、概念図だけでは判断できない。熱抵抗、実効帯域幅、歩留まり、総所有コストを測定した結果が必要である。
光インターコネクトはメモリ依存を避ける迂回策なのか
GPU外部のメモリとストレージを使用するには、データがより長い距離を移動しなければならない。電気信号は、距離が長く伝送速度が高くなるほど、信号補正と再伝送により多くの電力を必要とする。光インターコネクトは、サーバー、ラック、クラスター間の高速接続において、帯域幅密度と伝送電力を改善する候補として注目されている。
NVIDIAが光ネットワーキングを強化する流れを、特定のメモリ企業への依存を避けるための戦略の一つとしてのみ説明することは難しい。より直接的な背景は、アクセラレーターの規模が一つのサーバーを超えてラックやデータセンター単位へ拡張され、ネットワークがAIシステム全体のボトルネックになっているためである。
光接続もHBMを代替するものではない。アクセラレーターのすぐ隣で求められる短いレイテンシはHBMが担い、光接続は、より遠くにあるメモリプールと複数のアクセラレーターを接続する役割を担う可能性が高い。
カスタムHBMがメモリ産業を変える仕組み
従来の汎用DRAMは、同一規格の製品を複数の顧客へ供給する性格が強かった。HBMは、GPUパッケージ、インターポーザー、ベースダイ、電力・熱設計を併せて調整する必要があるため、顧客とメモリ企業による共同設計の比重がより高い。
カスタムHBMまたはCHBMでは、ベースダイに次の機能を搭載できる。
- メモリ制御とインターフェースの最適化
- エラー訂正と信頼性管理
- データ圧縮と移動制御
- セキュリティまたは仮想化機能
- 限定的なデータ前処理と演算
この構造は、メモリサプライヤーを単純な部品メーカーから、システムの共同設計者へと引き上げる可能性がある。開発初期に数量と仕様を協議するため、長期契約と顧客囲い込みの効果も大きくなり得る。
ただし、カスタマイズによってメモリサイクルが完全になくなるわけではない。AI投資の速度、顧客集中度、パッケージング生産能力、歩留まり、汎用DRAM価格は、依然として業績変動を引き起こし得る。特定顧客向けに最適化した製品は、需要が変化した際に他の顧客へ販売しにくいというリスクもある。
GPUの進化が止まったという解釈は正確か
GPUの進化が事実上止まったと断定することは難しい。アクセラレーターは、低精度の演算形式、スパース性処理、Transformer専用エンジン、チップレット、ネットワーク、冷却を含む方向へ進化し続けている。
変わったのは評価基準である。チップ一つの最大演算性能よりも、次の指標が重要になった。
- 実際のモデルで達成する実効メモリ帯域幅
- ユーザー当たりの最初のトークンのレイテンシとトークン生成速度
- 1ワット当たりの処理トークン数
- ラック当たりのメモリ容量とネットワーク帯域幅
- モデルをサービスとして提供するための総コスト
オープンソースモデルが普及したからといって、すべてのモデルの能力が均一化されたわけでもない。ただし、類似したモデルを複数の事業者が活用できるようになり、ハードウェアの運用効率とサービス展開能力の重要性が高まったことは事実である。
見落としやすい変数:信頼性・セキュリティ・プログラミングモデル
次世代メモリの議論は帯域幅と容量に集中しているが、実際の商用化を左右する別の要素もある。
データの正確性と寿命
メモリの積層数と集積度が高くなるほど、熱、エラー率、寿命の問題がより重要になる。AI推論におけるサイレントデータ破損は、即時のシステム停止ではなく、誤った出力として現れる可能性がある。エラー訂正、データ完全性の検査、障害の隔離は、性能と同じくらい重要である。
共有メモリのセキュリティ
CXLメモリプールや外部キャッシュを複数のアクセラレーターと顧客が共有する場合、データの分離、暗号化、アクセス権限、残存データの削除が必要となる。メモリ容量が増えるほど、保護すべきモデルの重みとユーザーコンテキストも増える。
開発者が利用できるか
新たなメモリ階層があっても、コンパイラーと推論エンジンがデータ配置を自動的に決定できなければ、活用度は低い。どのテンソルとKVキャッシュをHBM、HBF、CXLメモリ、またはSSDに配置するかを管理するランタイムが必要である。最終的に、ハードウェア競争はメモリスケジューラーとシステムソフトウェアの競争へとつながる。
AIデータセンターはメモリ工場なのか
大規模AIデータセンターを「メモリ工場」と呼ぶことは、メモリの戦略的重要性を強調する比喩としては有用である。モデルの重み、KVキャッシュ、学習データ、チェックポイント、検索インデックスが複数の階層に保存されるためである。
しかし、データセンターコストの一定割合が常にメモリと電力に使われるといった一般化には、根拠が不足している。コスト構成は、学習と推論の比率、電力価格、サーバーの減価償却、ネットワーク、冷却、稼働率、モデル効率によって異なる。
より正確な結論は、次のとおりである。
未来のAIデータセンターは、GPUを大量に設置する場所を超え、データを最も適切なメモリ階層に配置し、最小限の電力で移動させるシステムになる。
韓国の半導体産業にとっての意味
韓国は、HBMとNANDフラッシュの大規模な製造能力を備えており、メモリ中心への転換において重要な位置にある。しかし、メモリの生産量だけで長期的な優位性を保証されることは難しい。
必要な戦略は次のとおりである。
- HBM・HBF・先端パッケージングを一体的に設計できる能力を確保する。
- ベースダイ、インターフェースIP、メモリコントローラーの設計比率を高める。
- 熱管理、パワー半導体、光インターコネクト、データセンターシステム企業を育成する。
- コンパイラーと推論エンジンが韓国製メモリを効率よく活用できるよう、ソフトウェアエコシステムを構築する。
- スマートフォン、自動車、ロボット、家電において、ハードウェア・AIモデル・サービスを結び付ける実際のユースケースを確保する。
- 特定顧客や単一のパッケージングサプライチェーンへの依存リスクを管理する。
「韓国を経由しなければAIを作ることが難しい地位」は、生産量だけで形成されるものではない。標準、設計資産、製造、パッケージング、ソフトウェア、最終サービスがつながったとき、代替困難な産業的地位が形成される。
展望:代替ではなく階層化と共同設計
AI半導体がGPU中心からメモリ中心へ完全に置き換わると見るよりも、演算器とメモリの境界が曖昧になるプロセスと捉えるほうが正確である。
- HBMは、最も高速に使用する必要があるデータを担当する。
- HBFとCXLメモリは、より大きな容量を提供する。
- SSDは、長期保存とコールドデータを担う。
- 光インターコネクトは、遠く離れたリソースへの接続コストを低減する。
- カスタムベースダイとPIMは、一部の演算をデータの近くへ移動させる。
- 推論ソフトウェアは、各データをどの階層に配置するかを決定する。
次世代AIインフラの勝者は、最も高速なGPUを一つ作った企業ではなく、演算、メモリ、接続、電力、冷却、ソフトウェアを一つのシステムとして最適化したエコシステムとなる可能性が高い。
FAQ
メモリ中心コンピューティングとは、GPUをメモリに置き換えるという意味ですか?
いいえ。GPUやその他のアクセラレータは引き続き演算を担う。メモリ中心コンピューティングは、アクセラレータ、HBM、外部メモリ、ストレージ、ネットワークを一体的に設計し、データ移動にかかる時間と電力を削減するアプローチである。
KVキャッシュは、なぜ長いコンテキストで大きくなるのですか?
トランスフォーマーは、以前のトークンのキーと値の情報をレイヤーごとに保存し、同じ計算を繰り返さない。保存量はおおむね、トークン数、レイヤー数、KVヘッド数、データ形式のサイズに比例するため、長いコンテキストと多数の同時リクエストによってメモリ使用量が増加する。
HBFはHBMより容量が大きければ、必ず優れているのですか?
そうではない。NANDベースのHBFは、高い集積度と不揮発性が利点だが、DRAMベースのHBMよりレイテンシが長く、書き込み寿命とエラー管理が複雑である。頻繁に使用するデータはHBMに、使用頻度の低いデータはHBFに置く階層型構成のほうが、より現実的である。
HBFと一般的なNVMe SSDの違いは何ですか?
HBFは、NANDフラッシュをより広帯域で並列性の高いインターフェースによりアクセラレータの近くへ接続し、従来のSSDより高い帯域幅を提供しようとする概念である。具体的な性能と接続方式は、製品や標準化の結果によって異なる可能性がある。
GPUとHBMを垂直積層すると、どのような利点がありますか?
接続距離が短くなり、多数の垂直配線を使用できるため、帯域幅と入出力電力の面で有利になり得る。一方で、熱密度、電力供給、接合歩留まり、検査、冷却の問題はさらに難しくなる。
光インターコネクトはHBMを置き換えられますか?
光インターコネクトは、遠距離で複数のアクセラレータやメモリリソースを接続するのに適しているが、アクセラレータのすぐ隣にあるHBMの低レイテンシをそのまま置き換えるものではない。両技術は、それぞれ異なる距離とメモリ階層を担う可能性が高い。
カスタムHBMは、メモリ価格のサイクルをなくせますか?
カスタム設計と長期供給契約は、汎用メモリよりも価格の安定性と顧客関係を強化できる。しかし、AI投資の変動、生産能力、歩留まり、顧客集中、汎用DRAM価格の影響までなくなるわけではない。
長いコンテキストをサポートすれば、AIのハルシネーションはなくなりますか?
いいえ。長いコンテキストはより多くの根拠を提供できるが、検索資料の品質、モデルの能力、指示文の構成、出典の検証が不十分であれば、誤った回答が出る可能性がある。メモリの増設は、ハルシネーションを軽減する手段の一つにすぎない。
GHBM、HBF、THBMは、すでに確定した業界標準ですか?
すべての名称を同じレベルで確定した標準と見なしてはならない。一部は企業発表や研究提案段階の名称である可能性があるため、JEDECなどの標準化団体の規格、メーカーの最終仕様、実際に量産されているかどうかを個別に確認する必要がある。
Sources
Images

