ストレージはAI推論にとっての新たな基盤

台北で開催されたComputex 2026において収録されたSix Five On The Roadのインタビューでは、ライアン・シュラウト氏が SolidigmのAIエコシステム・マーケットイネーブルメント担当バイスプレジデントであるアヴィ・シェッティと対談し、AI推論がデータセンターのストレージアーキテクチャとGPU利用のあり方をどのように変えつつあるかについて、掘り下げた話を聞かせてくれました。

その核心となるメッセージは、企業がAI学習からAI推論へと移行する中、ストレージがパフォーマンスを左右する極めて重要な要素になっている、ということです。

推論の本質はエンドユーザーへの応答性にあり、データは今日、その「ホットさ」(アクセス頻度)に応じて、それがプリフィルキャッシュ、KVキャッシュ、またはHBM(高帯域幅メモリ)のいずれに格納されているのか、あるいはエヴィクト済みであるのかにかかわらず、複数のストレージ層に分散して存在します。各層は、推論ワークロードにおける決定的な指標であるトークンTCO(総保有コスト)に直接影響します。

シェッティはその規模を、Solidigmの「Anatomy of a Prompt」調査を参照して説明しています。この調査では、わずか8語のLLMクエリ(「where's the best dumpling in Taipei?(台北で一番おいしい餃子はどこ?)」)であっても、およそ42,000トークンにまで膨れ上がり、12GBから13GBのKVキャッシュが必要となって、それをどこかに保存しなければならなくなることが示されています。コンテキストウィンドウが拡大して HBMが飽和すると、GPUは再コンピューティングを余儀なくされ、AIデータセンターにおいて最も貴重な資産であるGPUの利用率が低下します。

この議論においては、NVIDIAのジェンスン・フアンCEOがCESおよびGTCで述べた、2026年は『ストレージの年』になり、コンテキストメモリ層がストレージのTAM全体を占めるようになると予想されるという発言が引用されています。

シェッティは階層モデルの概要を以下のように説明しています。

  • G3(ダイレクトアタッチストレージ):GPUへの高速データ供給用
  • G3.5(コンテキストメモリ):再コンピューティング回避のため
  • G4(共有ストレージ):容量確保用

シェッティは、高密度QLCストレージの登場がデータセンターにおけるハードドライブを時代遅れにしたと主張し、Solidigm製の業界初となる122TB SSDを紹介しました。これを24台配置することにより、単一ラック内で4PBの低消費電力かつスケーラブルな容量を実現できます。

RFPやAIインフラを検討・評価中の企業が押さえておくべき要点:レイテンシやGPUの再計算について、それがどの程度の時間なら許容できるかを明確にし、それに応じて、スケーラブルなNVMeストレージをプロビジョニングすること。


 

アヴィ・シェッティ:全体としての目標、すなわちこのアプローチの核心は、GPUを最大限に活用できるよう徹底させることにあります。コンテキストメモリが増大するにつれて、ストレージアーキテクチャをデータセンターのアーキテクチャの一部として、確実に組み込む必要があります。

ライアン・シュラウト: 皆さん、こんにちは。Six Five On The Roadへようこそ。ホストのライアン・シュラウトです。台北で開催中のComputex 2026からお届けしています。今回は、AI推論がストレージとコンピューティングの世界にどのような影響を与えているかについてお話しします。ゲストとして、私の良き友人であるアヴィ・シェッティさんをお迎えしています。シェッティさんはSolidigm社でAIエコシステム・マーケットイネーブルメント担当バイスプレジデントを務めています。ようこそ。お越しいただきありがとうございます。

シェッティ:ありがとうございます。この場に招いていただいて、またComputexに参加できて光栄です。こちらに参加されているエコシステムパートナー各社から、たくさんの素晴らしい技術の発表があると思いますし、私も大変楽しみにしています。

シュラウト:ここ台北で開催されるCOMPUTEXが、この数年で進化していく様子を見るのは興味深いですね。AIの進化という革命のようなものが、これまで期待されていた多くの物事を全部、いったんゼロに戻してしまったような様子で、本当に興味深いです。

シェッティ:そうですね。このカンファレンスが全体として、その価値提案やミッションを根本的に変えてきた様子を、シュラウトさんも見てきたわけですよね? シュラウトさんのチームにも話していたんですが、私がここに来るのは今年で14年目か15年目だと思います。以前はクライアントの立場でここに来ていました。当時はPC業界にいて、最高にクールなPC技術で溢れていました。当時はそうした発表の中心地でしたが、今ではAI一色ですね。

シュラウト:それでは、いくつか質問させていただきたいと思います。データセンターの世界、そしてこのAI推論に向けた構築についてです。興味深いことの1つは、それはもうはるか昔のことのように感じますが、実際にはほんの数年前のことのわけですが、学習から推論へと移行が始まったことです。そして、多くの人々が、ストレージと容量、パフォーマンスが重要となるのは、そうした学習の領域に限られるものだと思い込み始めていたのだと思います。しかし推論においても、私たちは、ストレージは依然として極めて重要な価値をもち、そのような筋書きを推進させる要素であると捉えています。なぜ現在もそうなのでしょうか?

シェッティ:今後、さらに多くのことが見えてくると思います。そうでなければ、あまり情報が入ってきていないということになります。今後、推論関連のアーキテクチャに関する議論において、ストレージが鍵となる場面がさらに増えるでしょう。そして、その根本的な理由は、推論とはエンドユーザーに対する応答性にすべてがかかっているものだからです。そのため、データのホットさ(アクセス頻度)に応じて、さらには、データがプリフィルキャッシュ内か、KVキャッシュ内か、HBM内か、エヴィクションされているかといった状況に応じて、データはそれぞれ異なる層に配置されます。これらすべてが最終的に、トークンTCOに上乗せされます。これは本質的に、推論において必要とされるパラメータ、つまり推論が要求するものです。ご存知のとおり、すべてをHBMに収めることはできません。ですから、本質的にオフロードを行い、キャッシュからデータを読み込むための新たな階層が必要となります。それによって、どのような作業を行っていてもその作業に対する応答性を高められるようにするためです。そこで、私たちは調査を行いました。Solidigmは、単純なLLMリクエストに関する調査を行ったわけです。「ねえ、今台北にいるんだけど、一番美味しい餃子はどこ?」というような話についてですね。単純な8語、9語のクエリです。私たちは詳細な調査を行い、その内容についてはある程度当社ウェブサイトで触れています。「Anatomy of a [Prompt] token」という題の調査です。この8語の検索は、約42,000トークンに換算されます。そして、どこかに保存しなければならないKVのデータが、およそ12[GB]から13GBあります。それは、こうしたクエリのあくまで1つです。では、あなたがエンジニアリング環境にいると仮定して、まあ、「Jiraのこのチケットを修正して、履歴を調べて、解決済みかどうか確認して」と指示するとしましょう。こうなるとクエリは非常に複雑になり、その結果、トークン数は大幅に増加します。これらすべてが個々の推論ワークロードの一部であり、データは絶えず増加し続けることになるでしょう。

シュラウト:KVキャッシュについて触れられましたが、それが重要なものであることは承知しています。では、コンテキストウィンドウについてはどうでしょうか? 企業がそのストレージの必要性を感じているかもしれない領域は、他にはどこにあるでしょうか?

シェッティ:そうですね、コンテキストウィンドウは拡大しています。では、コンテキストウィンドウが拡大し、HBMを使い切るようになったら何が起こるのか、想像してみてください。そうなると、GPUの再コンピューティングが必要になります。つまり、再コンピューティングになるということは、GPUが十分に利用されていないということになります。データセンターにおける第一の資産はGPUです。全体としての目標、すなわちこのアプローチの核心は、GPUを最大限に活用できるよう徹底させることにあります。そして、コンテキストメモリが増大するにつれて、ストレージアーキテクチャをデータセンターのアーキテクチャの一部として、確実に組み込む必要があります。それぞれ異なる階層でストレージのプロビジョニングを完了させておき、さらには、スケーラビリティも確保しておくようにしなければなりません。そうしておくことで、最終的なトークン出力に付加価値をもたらし、GPUが継続的に利用され続ける環境が確保されます。

シュラウト:企業が見積もりを取り、RFPの内容を検討し、インフラを構築しようとしている最中である状況を考えると、「以前には必要なGPUの数だけを気にしていた」という状況から、今ではエージェントとの間で「どのくらいの数のCPUが必要か」という議論をしている状況へと、そのバランスがどのように変化しているとお考えですか? その中で、ストレージはどのような位置づけになるのでしょうか? つまり、こうした企業の意思決定において、そこにストレージも含めることを検討するよう、どのように推奨する、あるいは何らかの提案をするのがよいとお考えですか?

シェッティ:根本的には、学習と推論の違いですね。学習はこれらのメガワット級のデータセンターや大手基盤企業で行われますが、推論はどこでも実行できますよね? これは、バックオフィスでも、地下にある小規模なデータセンターでも、あるいは、設置した現地のコロケーション施設でも可能です。ですから、個々の企業の利用方法によって異なってきます。NVIDIAは青写真を提示していて、たとえば、今年、2026年は「ストレージの年」だと言っていますよね? 年初、ジェンスン・フアン氏はCESでも、それに続くGTCでも、ストレージ、すなわちこのKV層全体について語りました。彼の発言は、Solidigmにいる私たちも含め、私たちすべてのストレージベンダーの共感を呼ぶものだと思います。彼は、コンテキストメモリ層が今後、ストレージのTAM全体を占めるようになる、と述べたわけです。それこそが、今後数年間で推論に関して見られるであろう、コンテキストメモリの規模なのです。そして、これをどのように活用するのが最善か検討している企業にとって、自らに問いかけてみるべきこととは、レイテンシをどの程度許容できるのか、ということと、GPU再コンピューティング時間をどの程度許容できるのか、ということだと思います。もしこれらが極めて重要なパラメータであるならば、3つのレベルにおいて、つまり、ダイレクトアタッチであるG3、コンテキストメモリであるG3.5、そして共有ストレージであるG4において、適切なストレージアーキテクチャを確保しておく必要があります。

シュラウト:今後2~3年を見据えたとき、まあ、この分野で正確な予測を立てるのは本当に何というか困難なわけですが、2年後、あるいは3年後にストレージがどのような役割を担っているのか、私はとても興味があります。それは容量勝負になるのでしょうか? それともパフォーマンス勝負になるのでしょうか? あるいは、単に、どう変化するのでしょうか?

シェッティ:どれも当てはまるのではないでしょうか。ストレージに万能の解決策はありません。ストレージはメモリ階層全体のようなものといいますか、メモリの壁というのも経済性によって決まるものだと思いますが、どうでしょうか。理想を言えば、GPUアーキテクトやCPUアーキテクトに「何が欲しいですか?」と尋ねれば、こう答えることでしょう。「じゃあ、1ペタバイトの永続ストレージをくれ。それも不揮発性で、SRAM並みのレイテンシのものをね」。ですが、それは現実には不可能です。だからこそ、階層構造があるのです。SRAM、キャッシュがあり、HBMがあり、DRAM、そして階層型ストレージ、すなわち、G3、G3.5、G4の階層型ストレージがあります。これらのどれにも技術革新がもたらされるわけですが、ここでG3の焦点となるのは、そのセクション全体の目的である、GPUへの高速なデータ供給、を確実なものにし、その結果としてGPUの利用率が高まるようにすることです。G3.5は、毎回コンテキストを再コンピューティングする必要がないようにするためのものです。そのため、そこでは密度だけでなく、パフォーマンス含めて考えることが必要になります。そしてそれは、ワークロードがどれくらい大きいか、コンテキストがどのようなものかによって決まります。また、共有ストレージに関して言えば、もはやハードドライブは不要だということを示すデータポイントが十分にそろっている時代に私たちは現在来ていると私は考えています。これは純粋に、ハードドライブを9ラック分にするか、それとも高密度QLCストレージを搭載した1ラックにするか、という計算の問題だと思います。お見せするこちらがそれになります。これは、1つのU.2フォームファクタに収まった当社の122TBソリューションです。当社はさる [[2025] 年] 第4四半期に、これを業界で初めて導入しました。

シュラウト:大容量のストレージですね。

シェッティ:大容量なのですが、データセンターの効率性を考えれば、まだまだ十分とは言えません。1Uにこれを24個搭載すれば、4ペタバイト確保したことになり、低消費電力でかつ、エンドユーザーにとってスケーラブルなものとなります。

シュラウト:シェッティさんと私が以前いたクライアント分野では、いつもこのような多数のドライブを目にしてきたものですが、この革命がそれをどのように変えているのか、また、それらがどのように別の用途に再利用されていて、ボトルネックが実際にどこにあるのかを目の当たりにできるのは、素晴らしいことです。シェッティさん、本日はありがとうございました。お話が聞けて本当によかったです。皆さん、台北で開催中のComputex 2026におけるSix Fiveをご覧いただき、ありがとうございました。ライアン・シュラウトでした。ぜひ、ソーシャルメディアでのフォローをお願いします。また、sixfivemedia.comで私たちのその他のコンテンツもチェックしてください。