Groq 3 LPX の量産が開始、NVIDIA はエージェント向けの Vera Rubin 推論機能を拡張

投稿者:

AI 推論の次なる時代は、単一の画期的なチップやネットワーク、あるいはシステムによって定義されるものではありません。それは、AI ファクトリーのあらゆる層がいかに連携して機能するかによって決まるものです。そのため、NVIDIA はエージェント型システム向けの高速なトークン生成機能によって、Vera Rubin NVL72 の機能を拡張しています。

本日、NVIDIA Vera Rubin ラックスケール システムの一部である、インタラクティブ AI 推論アクセラレーターの NVIDIA Groq 3 LPX の量産を開始したことを発表しました。オープンソースのエージェント型モデル Gemma 4 31B を実行した Artificial Analysis のベンチマークでは、エージェント型システムにとって極めて重要な 10 万トークンのロング コンテキスト条件下で、1 秒あたり 3,400 トークンという記録を達成しました。これは、最も近い代替プラットフォームと比較して 4 倍の応答速度です。

世界中の業界パートナーが Vera Rubin プラットフォーム ソリューションを採用しています。SpaceXAI は、次世代のエージェント型 AI の基盤として NVIDIA Vera CPU を採用することを発表しました。CoreWeave は、複数の並列スイッチを用いて NVIDIA Vera Rubin ラックを接続し、高帯域幅かつフラットでロスレスな AI ネットワークを実現する Spectrum-X Multiplane を本番環境に導入しました。また、Nebius は NVIDIA Groq 3 LPX を採用する初の AI クラウドとなります。

AI がトレーニングからリーズニングやエージェント型へと移行する中、推論は新たなフロンティアとなっています。エージェント型 AI システムは、より多くのトークンを生成し、飛躍的に大きなコンテキスト ウィンドウを処理するとともに、複雑な課題を解決するために他の AI システムと連携するようになっています。

こうしたワークロードには、単なる性能だけでなく、スループット、応答性、そして経済性においても最適化された、かつてない規模の新しいクラスのインフラが求められています。

カリフォルニア州パロアルトで開催中の Hot Chips カンファレンスにおいて、NVIDIA は、緊密な協調設計がいかにして AI ファクトリーをエンドツーエンドで変革しているかを紹介しています。NVIDIA は、コンピュート、ネットワーク、推論アクセラレーションを統合されたシステムとして設計することで、長大なコンテキストを扱う推論やマルチエージェント型システムといった新たなニーズに特化したインフラの構築を支援しています。

パフォーマンスを最適化する緊密な協調設計

緊密な協調設計は、NVIDIA プラットフォームの根幹をなす設計思想です。Vera Rubin は、エージェントがますます長大なシーケンスをリーズニングする際の推論を高速化するように設計されています。

NVIDIA Spectrum-X Ethernet は、AI ファクトリー全体で膨大なデータフローを効率的に転送し、NVIDIA Groq 3 LPX は超高速でトークンを生成するよう構築されています。これらを組み合わせることで、NVIDIA は単一の統合型 AI ファクトリー アーキテクチャの一環として、コンテキストや通信から生成に至るまで、AI パイプラインのあらゆる段階を最適化しています。

NVIDIA Groq 3 LPX は、最も汎用性の高い AI ファクトリー プラットフォームである Vera Rubin NLV72 と連携して動作する、新たな低遅延推論アーキテクチャを実現します。これにより、企業やクラウド プロバイダーは、エージェント型アプリケーションに求められる低遅延、極めて高いスループット、そして拡張性のある経済性を実現できるようになります。

画期的なパフォーマンスは、個々のコンポーネントを単独で最適化するのではなく、スタックのあらゆる層を統合的に協調設計することによって実現されます。ネットワーキングやコンテキスト処理から大規模な推論に至るまで、NVIDIA のフルスタック プラットフォームは、AI ファクトリーを知能を生み出す統合エンジンへと変貌させ、増大し続けるトークン量を収益へと転換できるようにします。


NVIDIA パートナーが Vera Rubin を採用し、トークン生成コスト最小化

AI クラウドの主要な企業である Nebius は、NVIDIA Groq 3 LPX をいち早く採用しました。これにより、開発者は、極めて高い応答性が求められるエージェント型 AI アプリケーションにおいて、業界最高水準のトークン生成速度を利用できるようになります。

Nebius Token Factory において、NVIDIA Vera Rubin NVL72 に NVIDIA Groq 3 LPX が導入されることで、推論性能が大幅に向上します。その結果、開発者は、高度な対話型エージェントやコーディング システム、その他のリアルタイムの AI 体験を大規模に構築、展開することが可能になります。

CoreWeave は NVIDIA Vera Rubin ラックを接続し、本番環境に Spectrum-X Multiplane を導入することで、同社の AI クラウド インフラのさらなる進化を実現します。


SpaceXAI、エージェント型 AI 向け にNVIDIA Vera CPU を採用

SpaceXAI は、地球上のデータセンターから軌道上の衛星に至るまで、NVIDIA Vera Rubin を中核に据えた将来の AI アーキテクチャを構築および拡張する計画です。同社は、オーケストレーション、ツール利用、コード実行、データ処理、シミュレーションなど、エージェント型 AI を支える CPU 負荷の高い処理を高速化するため、本番環境に NVIDIA Vera CPU を導入予定です。

SpaceXAI とのパートナーシップにより、NVIDIA のフルスタック AI プラットフォームが SpaceXAI に導入されます。Vera CPU、NVIDIA のアクセラレーテッド コンピューティング、ネットワーク、そしてソフトウェアを統合することで、かつてない規模での AI の進化を推進します。

エージェントの時代を見据えて設計された Vera Rubin は、業界トップクラスのコアあたり性能、極めて高いメモリ帯域幅、そして高負荷時において予測可能なパフォーマンスを実現します。これにより、エージェントによるタスク完了の高速化と、貴重な GPU インフラの最大限の活用が可能になります。


NVIDIA Groq 3 LPX:インタラクティブ AI 推論アクセラレーター

Vera Rubin NVL72 プラットフォームと協調設計された NVIDIA Groq 3 LPX は、AI ファクトリーにおいて、エージェント型ワークロード向けのトークン生成を極めて低いレイテンシで実現するのに貢献しています。

エージェント型 AI は、デコード レイテンシという新たなパフォーマンス上の課題をもたらしています。AI エージェントはリーズニングやツールの使用、他システムとの連携を行う中で、トークンを一つずつ生成していきます。そのため、わずかな遅延であっても、複雑な処理のチェーン全体にわたってそれが積み重なり、増幅してしまいます。ユーザーが期待する速度でエージェントを稼働させるため、NVIDIA Groq 3 LPX は Vera Rubin NVL72 プラットフォームを拡張し、トークン生成に特化した高速化を提供します。

NVIDIA Rubin GPU が大規模なコンテキスト処理を担う一方で、LPX はレイテンシの影響を受けやすいデコード処理を高速化します。その結果、より高速かつ予測可能なトークン生成が実現し、AI ファクトリーは、応答性の高いリーズニング、円滑なエージェントのやり取り、そしてインフラ効率の向上を達成できるようになります。

Rubin GPU と LPU は、速度とスループットの間に従来存在したトレードオフを解消するように設計されており、AI プロバイダーが次世代のエージェント型 AI アプリケーション向けに、応答性に優れた大規模推論サービスを提供できるよう支援します。

トークン ファクトリーの構築

業界がモデルのトレーニングから大規模なインテリジェンスの提供へ移行するなか、インフラは、パフォーマンス、スループット、インテリジェンスの整合性、そして経済効率を同時に実現できる、NVIDIA がトークン ファクトリーと呼ぶものへと進化する必要があります。エージェント型 AI システムは、他の AI システムとの通信や複数のデータソースへのアクセス、さらには膨大なコンテキストの保持を頻繁に行うため、高速な推論に対するかつてない需要が生まれています。

NVIDIA Groq 3 LPX は、まさにこうしたワークロードのために設計されました。Vera Rubin NVL72 の拡張として、膨大なコンテキスト ウィンドウ全体にわたって超高速な応答性を実現すると同時に、サービス プロバイダーによるスループットとインフラ稼働率の最大化を支援します。

推論のための緊密な協調設計

スタンドアロン型のアクセラレーターとは異なり、NVIDIA Groq 3 LPX は、緊密な協調設計を通じて GPU と LPU の強みを融合させています。Rubin GPU と LPU が AI モデルのあらゆるレイヤーを連携して処理することで、エージェント型ワークロードにおいて新たなレベルの推論性能を実現します。

大規模な構成では、多数の LPU 群が、決定論的な推論に最適化された巨大なプロセッサとして機能します。ラックスケールの NVIDIA Groq 3 LPX 導入環境では、チップ間を直接接続するリンクで 256 基の LP30 アクセラレーターを接続でき、現代の AI ファクトリー向けに構築された高効率な推論エンジンを実現します。

エージェント型 AI 時代を見据えた設計

リーズニング モデルが大規模化し、エージェント型ワークフローが生成するトークン数が増大し続ける中、それらを支えるインフラも進化する必要があります。NVIDIA Groq 3 LPX は、Vera Rubin NVL72 プラットフォームを拡張するものであり、応答性、スループット、効率を最大化するように設計された推論専用アーキテクチャを採用し、次世代 AI ファクトリーの実現を支えます。

これはほんの始まりに過ぎません。さらなる最適化やモデルの拡充、そして Vera Rubin NVL72 との組み合わせによる性能向上など、スループットとインタラクティブ性の面で新たな次元が到来しようとしています。


NVIDIA Spectrum-X Multiplane が、よりフラットで強靭なネットワーク上で、AI ファクトリーの超大規模化を実現

AI ファクトリーが巨大化するにつれ、ネットワークは性能を左右する極めて重要な要素となっています。NVIDIA は Hot Chips において、Spectrum-X Multiplane を紹介しています。これは、ハードウェア アクセラレーションを活用した Spectrum-X Ethernet アーキテクチャの最新技術であり、新たなネットワーク階層を追加することに伴うレイテンシ、ジッター、コストの増大を回避しつつ、イーサネットをかつてない規模へと拡張することを可能にします。

NVIDIA Spectrum-X Ethernet は、AI ファクトリーやクラウド向けの AI インフラの性能と効率を向上させるために、NVIDIA Spectrum-X Ethernet スイッチ、SuperNIC、およびソフトウェアを組み合わせた、AI に最適化されたエンドツーエンドの Ethernet プラットフォームです。このプラットフォームは、一般的な Ethernet と比較して 1.6 倍の AI ネットワーク性能を実現すると同時に、マルチテナント環境においても一貫性のある予測可能なパフォーマンスを提供できるように設計されています。

Multiplane が新たな階層の導入にともなうトレードオフなしに拡張性を実現

AI ファクトリーを現在の最大規模のクラスターを超えて拡張する場合、従来は第 3 のネットワーク階層を追加する必要がありました。しかし、これを行うとレイテンシが増大し、処理速度が予測不能に低下するほか、ケーブル、光トランシーバー、電力にかかるコストも増大してしまいます。Spectrum-X Multiplane は、よりシンプルなアプローチを採用しています。各サーバーのネットワーク接続を複数の独立したパスまたはプレーンに分割し、それぞれのプレーン上で軽量な 2 階層ネットワークを個別に動作させます。その結果、第 3 階層の追加に伴うコストや複雑さを招くことなく、最大 51 万 2 千 基の GPU にまで拡張可能な、フラットでシンプルなネットワークが実現します。

これらすべては自動的に行われます。NVIDIA ConnectX SuperNIC に搭載された専用ハードウェア エンジンが各プレーン間のトラフィックを管理し、障害発生時には即座に迂回ルートへ切り替えるため、アプリケーションやソフトウェアからは、単一の高速かつ信頼性の高い接続として認識されます。8 プレーン構成のトポロジにおいて、仮に 1 つのプレーンで障害が発生しても、ネットワークは総帯域幅の約 90% を維持します。その際のハードウェアによる復旧速度は、ソフトウェア ベースのマルチプレーン ロードバランシングと比較して 11 倍高速です。これは、AI ファクトリーの処理能力が 1.6 倍向上することに相当します。

緊密な協調設計による実現

この高い信頼性は、スイッチ用シリコン、SuperNIC、そしてソフトウェアに及ぶ、Vera Rubin NVL72 の緊密な協調設計によって実現されています。102.4Tb/秒 の Spectrum-6 Ethernet ASIC をベースとする Spectrum-X SN6000 シリーズ スイッチや、GPU あたり最大 1,600Gb/秒に対応する ConnectX-9 SuperNIC は、Vera Rubin NVL72 AI ファクトリー向けに専用設計されたものです。さらに、Spectrum-XGS Ethernet はこの協調設計の適用範囲をデータセンター全体へと拡張し、複数の施設を単一の AI スーパーファクトリーとして機能させるとともに、マルチサイト間での NCCL コレクティブ通信を 1.9 倍高速化します。


BlueField-4 と DOCA を基盤とする、エージェント型AIファクトリー向けの スケールイン インフラ、NVIDIA Scale-Inを発表

NVIDIA は、同社の AI ネットワーキングにおける 5 つ目の柱であり、エージェント型 AI ファクトリー向けの新たなクラスのアクセラレーテッド ネットワーク インフラである NVIDIA Scale-In を発表しました。Scale-In は、AI ファクトリーのセキュリティ確保、管理、運用を担うインフラ サービスにまで、専用設計のアクセラレーションを拡張するものです。

NVIDIA BlueField-4 プロセッサと NVIDIA DOCA ソフトウェア プラットフォームを搭載し、NVIDIA Spectrum-X Ethernet で接続された NVIDIA Scale-In は、従来の内部と外部のアクセス ネットワークを、統合された高速インフラ ドメインへと変革します。

クラウド コンピューティングは、ソフトウェア定義のネットワーク、構成可能性、および弾力性をデータセンターにもたらし、ユーザー、アプリケーション、データ、およびサービスを動的に拡張することを可能にしました。

エージェント型 AI は、次のプラットフォーム変革を象徴しています。AI ファクトリーは、膨大な数の高速コンピュートと、増加し続けるユーザー、アプリケーション、および自律エージェントを統合し、これらすべてがデータ、ストレージ、およびサービスと継続的に相互作用します。これにより、AI を実現するインフラへの要求が変革されます。ネットワーク、ストレージ、サイバーセキュリティ、および運用は、AI コンピューティングと並行して高速化される必要があり、ソフトウェア定義の柔軟性と専用設計のハードウェア アクセラレーション、およびフルスタックの協調設計を組み合わせなければなりません。

NVIDIA Scale-In は、インフラの処理をホストのコンピュート リソースから独立させつつ、マルチテナント ネットワーキング、高性能なストレージ アクセス、シリコン レベルのセキュリティ、柔軟なプロビジョニング、リアルタイムのオブザーバビリティを実現します。AI ファクトリーの一部としてこれらのサービスを高速化し、協調設計することで、Scale-In はAIコンピュートの拡大に合わせてセキュリティ、データ アクセス、運用体制も拡張できるよう支援します。その結果、エージェント型 AI を大規模に展開および運用するための、安全かつ効率的で管理性に優れた共有インフラが実現されます。


NVIDIA NVLink Fusion が XPU と NVIDIA の最先端 AI プラットフォームを接続

NVIDIA NVLink Fusion は、カスタム シリコンを NVIDIA の世界をリードする AI インフラプラットフォームに統合します。これにより、ハイパースケーラーや AI ネイティブ企業は、より高いパフォーマンス、柔軟性、スピードを備えたセミカスタム AI ファクトリーを構築できるようになります。

AI モデルの規模と複雑さが増大する中、単なる素の演算能力だけでは不十分です。AI ファクトリーには、広帯域かつ低遅延なスケールアップ ネットワーキング、実績のあるラックスケール アーキテクチャ、そして電力、冷却、管理ソフトウェア、サプライ チェーンに及ぶ包括的なエコシステムが求められます。NVLink Fusion は、カスタム XPU や CPU を NVIDIA のスケールアップおよびスケールアウト技術スタックに接続することで、これらの課題を解決します。

このプラットフォームには、スケールアップ ネットワーキング専用に設計された第 6 世代 NVIDIA NVLink および NVLink Switch に加え、XPU と CPU 間のエネルギー効率に優れた接続を実現する NVLink-C2C が組み込まれています。NVIDIA MGX エコシステムを通じて、導入企業は、実稼働実績のあるラック設計、構成要素、製造パートナーのソリューションに加え、分散コンピューティング、ディスアグリゲーテッド ワークロード、クラスター管理に対応したオープンかつ拡張性の高いソフトウェアを利用できます。

NVLink Fusion は、GPU や XPU ベースのシステムを統一アーキテクチャに標準化することで、データセンターの構築とシリコンの供給状況を切り離して管理できるようにします。運用者は、ラックの設置スペース、ネットワーク、冷却、電力供給、管理システムを共有しつつ、供給状況やワークロードの要件の変化に応じて GPU と XPU の構成比を調整することが可能です。

NVLink Fusion は、NVIDIA AI プラットフォームの垂直統合型かつ水平開放型というアプローチを、カスタム シリコンの領域にまで拡張するものです。これによりパートナー企業は、コンピュート、ネットワーク、インフラ、ソフトウェアにわたる NVIDIA の技術を活用しながら、自社の強みとなる領域で自由にイノベーションを追求できるようになり、その結果、単独の企業では構築不可能な、単一かつ柔軟な AI ファクトリーが実現します。