NVIDIA とローカル AI コミュニティがオープンソース モデルとインテリジェント エージェントを推進

投稿者:

オープンソース エコシステムのおかげで、ますます高性能化するエージェントを、AI 愛好家や AI 開発者がローカルで構築、カスタマイズ、実行することが容易になっています。

NVIDIA は 8 月を通じて、エコシステム全体で新たに生まれているモデル、アプリケーション、ツールとともに、ローカル AI を推進しているパートナーやオープンソース コミュニティを称えています。これには、NVIDIA の最新のオープンモデル、ソフトウェア、開発者ツールに加えて、ユーザーが AI 開発を始めるのに役立つアクセラレーテッド コンピューティングやライブラリ、教育リソースも含まれます。

8 月は、エージェントにとって大きな月になりそうです。この NVIDIA ローカル AI ブログ シリーズの特別版では最新の開発状況をお届けし、今後数週間にわたって最新情報を追加する予定です。

XInstagramTikTokFacebook で NVIDIA RTX Spark をフォローしましょう。また、NVIDIA ローカル AI ニュースレターにご登録いただくと、最新情報を入手できます。LinkedIn と X で NVIDIA Workstation をフォローしてください。

NVIDIA RTX GPU が、フロンティア級の品質を誇る Qwen3.8-27B コーディング エージェントをローカル AI にもたらす

NVIDIA の RTX GPU は、Qwen3.8-27B を用いたフロンティアレベルのローカル コーディング エージェントを実現する高性能ソリューションを開発者に提供します。

Qwen3.8-Max のローカル版として、この 270 億パラメータのオープン モデルは単一のGPU で動作するサイズに設計されており、ローカル ファイル、ツール、プロジェクト コンテキストを活用した応答性の高いコーディング ワークフローを実現します。開発者は、開発プロセス全体を通じて高性能な AI アシスタントを活用しつつ、機密性の高いコード、独自のデータ、プロジェクト コンテキストを自身のシステム上に保持することができます。

GeForce RTX 5090、Intel Core Ultra 9 285K、64GB RAM、Windows 11、NVIDIA ドライバー 610.43 環境でテストを実施。lama.cpp ファイルに対し、speedbench ベンチマークで Q4_K_M チェックポイントを使用。MTP n_max = 3。

NVIDIA RTX GPU(NVIDIA RTX PRO GPU および NVIDIA GeForce RTX 5090 を含む)では、リリース初日からサポートが利用可能です。マルチトークン予測で最適化されたQwen3.8-27B は、MTP を使用した単一の GeForce RTX 5090 上で毎秒 131 トークンを達成し、開発者にエージェント型コーディング、ツールの使用、および長時間の開発タスクに向けた高速なローカル推論を提供します。

開発者は、NVIDIA RTX GPU 上で Qwen3.8-27B をサポートする「llama.cpp」、「Ollama」、「Unsloth」、「LM Studio Bionic」を活用して、すぐに開発を開始できます。NVIDIA RTX のパフォーマンス、CUDA ソフトウェア エコシステム、そして使い慣れたオープンソース ツールが相まって、開発者には新しいモデルに対する幅広いサポートと、応答性の高いローカル エージェント コーディング ワークフローのための強固な基盤が提供されます。

このモデルは DGX Spark および DGX Station でもサポートされており、すべてのNVIDIA ローカル AI デバイスに対する NVFP4 サポートを含む追加の最適化も間もなく提供される予定です。Qwen3.8-27B は、NVIDIA の常時稼働型パーソナル AI システムに、フロンティアレベルのローカル コーディング エージェントをもたらします。

PC やパーソナル AI システムにとどまらず、NVIDIA Jetson はエッジ環境において Qwen3.8-27B をリリース初日からサポートします。このモデルは、強力なリーズニング能力とエージェント機能を備えた非常に高性能なモデルであることが確認されており、MTP による投機的デコードにより、エッジ環境での高速かつ応答性の高いローカル推論を実現します。


8 月 11 日 (火) 午前 10 時 (太平洋時間)

#ICYMI: NVIDIA GPU によって高速化された新しいオープン モデルなどが本日提供開始

NVIDIA は先頃、ロボット、自動運転車、ビジョン AI 向けの 40 億パラメーターのオープン世界モデル「Cosmos 3 Edge」をリリースしました。これは Cosmos 3 Nano の 4 分の 1 の規模で、NVIDIA DGX Spark および NVIDIA Jetson でオンデバイス実行できます。

MiniMax-H3 は、330 億パラメーターのオープン ウェイト モデルで、テキスト、画像、ビデオ、音声、またはこれら 4 つの組み合わせからビデオと、ネイティブに同期されたステレオ音声を生成します。クリエーターは、ComfyUI を通じてこのモデルにアクセスし、NVIDIA GPU に最適化されたチェックポイントを使用してローカル実行できます。

Poolside AI は、数時間かかるタスクを処理する 1180 億パラメーターのエージェント型オープン ウェイト コーディング モデル「Laguna S 2.1」を発表しました。このモデルは、1 台の NVIDIA DGX Spark 上で、NVFP4 チェックポイントを使用して、コンピューティング要件とメモリの要件を抑えながら、精度を犠牲にすることなくローカル実行できます。

DeepSeek は先頃、2840 億パラメーターの MoE モデル「DeepSeek-V4-Flash」を更新しました。このモデルは、130 億のアクティブ パラメーターと 100 万トークンのコンテキスト ウィンドウを備えており、すでに利用可能なコミュニティビルドの GGUF バージョンを使用して、NVIDIA DGX Station 上でローカル実行できます。

Thinking Machines Lab の Inkling-Small は、テキスト、画像、音声にまたがるネイティブなリーズニングを備えていることに加え、思考量を調整することもできる、フロンティアクラスのオープン ウェイト マルチモーダル モデルです。NVIDIA GB300 NVL72 でトレーニングされたこの 2760 億パラメーター モデルは、トークンあたりわずか 120 億パラメーターを使用し、1 台の DGX Station または 2 台の DGX Spark システム上で動作します。NVIDIA Blackwell に最適化された NVFP4 チェックポイントは、Hugging Face で入手できます。

Unsloth は月曜日に Unsloth Desktop をローンチしました。この製品は、ローカル モデル推論、画像/ビデオ拡散、ファインチューニング、エージェント統合、Web リサーチ、およびコード実行を 1 つの完全なオープンソース デスクトップ アプリにまとめたもので、AI モデルのトレーニングと実行の両方をローカルで行う業界初のデスクトップ アプリです。

Unsloth Desktop は、ローカルでの AI トレーニングと推論を 1 つの完全なオープンソースのデスクトップ アプリにまとめたもので、AI モデルのトレーニングと実行をローカルで行う業界初のデスクトップ アプリです。

Alibaba は先頃、参照元となるビデオから、人間、漫画、ロボット、動物などのキャラクターの静止画像に動きや表情を転写する、140 億パラメーターのオープン ウェイト モデル「Wan-Animate-2」をリリースしました。このモデルは、ComfyUI の初日からのサポートにより、Apple M3 Ultra と比較して、NVIDIA RTX PRO 5000 Blackwell (48GB) で最大 16 倍、NVIDIA RTX 5090 で 26 倍高速に生成します。


8 月 11 日 (火) 午前 9 時 (太平洋時間)

LTX が LTX-2.5 を発表

LTX-2.5 は、LTX の最先端研究チームが開発した最新のオープン世界ビデオ生成モデルです。このモデルは、メディア & エンターテインメント、ロボティクス、リアルタイム生成などのユース ケースの基盤を提供し、ビデオ品質、プロンプト忠実度、複数回の生成結果を通じたキャラクター、シーン、音声の一貫性の向上を実現しています。

新しいマルチショットのサポートにより、連続性を維持しながら複数のカットにまたがるシーケンスを生成できます。また、拡散ビデオ デコーダーのアップグレードにより、視覚的な忠実度が向上し、アーチファクトが減少しています。さらに、生成編集によって既存の映像を洗練させることもでき、最初からやり直すことなく細部を修正し、洗練された外観を維持することが容易になります。

Gemma4 E2B とカスタム Gemma4 12B テキスト エンコーダーを搭載した新しいプロンプト エンハンサーにより、優れたプロンプト忠実度を実現し、出力に対する制御が大幅に向上しています。

新しい拡散ビデオ デコーダーは、変分オートエンコーダー ビデオ デコーダーを補完するもので、最終レンダリングの品質を向上させる第 2 のデコード パスを提供することでビデオ品質を改善します。

LTX-2.5 は、NVIDIA RTX GPU、DGX Spark、および DGX Station システムに最適化されており、NVIDIA RTX 6000 PRO GPU では、最大 20% のパフォーマンス向上と 40% のメモリ節約を実現します。これらの NVFP4、FastVideo、および ComfyUI の拡張機能は、テキスト、画像、およびビデオからのビデオ生成にすぐに利用できる ComfyUI ワークフローを通じて、ローカルで使用できます。

LTX-2.5 の詳細をご覧いただき、NVIDIA ハードウェアで高品質のローカル ビデオ生成を始める方法を学んでください。


8 月 11 日 (火) 午前 9 時 (太平洋時間)

NVIDIA が Meta の Muse Glimmer を高速化して常時稼働ローカル エージェント型 AI を実現

Meta は、12 万以上のコンテキスト ウィンドウを持ち、コーディングとローカル エージェント型 AI に特化した、300 億パラメーターの高密度オープンウェイト モデル「Muse Glimmer」を本日リリースしました。

Muse Glimmer は、NVIDIA GeForce RTX PC、NVIDIA DGX Spark、DGX Station、および NVIDIA Jetson に最適化されており、RTX 5090 上で毎秒 200 超のトークンを提供し、常時稼働エージェントがデータをローカルで処理し、単一のシステム上で複雑なマルチステップ タスクを実行できるようにします。

高密度アーキテクチャとハイブリッド アテンションは、エージェントが長時間のタスクを実行し、ツールを使用し、複数のステップにわたってコンテキストを維持する際に、処理とメモリの要求を管理可能な範囲に収めるのに役立ちます。

Muse Glimmer は、常時稼働ローカル エージェント ワークフローに最適化された 300 億パラメーター モデルです。コンシューマー向け GPU を 1 基搭載した PC で実行できるほど小型であるため、ローカル エージェントや関数呼び出しから、ローカル コーディング、LLM-as-a-Judge 評価までの幅広いユース ケースを実現できます。

AI 愛好家や AI 開発者は、NemoClaw を使用してエージェントを構築し、プライベートなデータまたは専用のデータをシステム上に保持したまま使用しながら、NVIDIA NeMo Automodel を使用して Muse Glimmer をローカルでファインチューニングできます。Muse Glimmer は、次のような用途向けに設計されています。

  • カスタム エージェント: 特定のタスク、ツール、データ、および専門分野に合わせてモデルを調整します。
  • プライベート データ処理: ローカルのファイル、文書、電子メール、およびメッセージを読み取り、要約し、それらに基づいてアクションを実行します。
  • 認証情報の処理: 推論をデバイス上に維持しながら、アプリケーション プログラミング インターフェイス キー、認証トークン、その他の機密情報を使用します。
  • マルチステップ タスク: 多数の連続したツール呼び出しを実行し、エラーや予期しない結果から復旧します。
  • 長時間実行ワークフロー: 大規模なプロジェクトを複数のステップに分割し、進行状況を追跡し、中断されたセッションを、コンテキストを維持したまま再開します。

Muse Glimmer は、テキスト生成、画像、リーズニング、ツール使用向けの vLLM や、BF16 と量子化された GGUF チェックポイントを使用したテキストおよび画像ワークロード向けの llama.cpp をはじめとする、一般的な推論フレームワークで実行できます。llama.cpp は、生成を高速化するために DFlash の投機的デコードもサポートしています。

Muse Glimmer は、1 台の NVIDIA RTX 5090 上で動作し、常時稼働エージェントがプライベート ファイル、アプリケーション、および通信を横断して処理できるようにすると同時に、クラウドベースの推論への依存を低減します。

Meta の Muse Glimmer の詳細をご覧ください。また、NVIDIA 技術ブログをご覧いただき、NVIDIA ハードウェアでローカル AI とファインチューニングを始める方法を学んでください。


8 月 11 日 (火) 午前 8 時 (太平洋時間)

NVIDIA Sync Cluster Assistant で DGX Spark のパフォーマンスを向上

GLM 5.2 や DeepSeek V4 Flash などの新しいオープン モデルは、ローカル システムにクラウドレベルのインテリジェンスをもたらし、コーディング エージェントやリサーチ エージェントなどの高度なワークロードを実現します。ただし、これらの大規模モデルを実行するには、複数の GPU または DGX Spark システムを連携させる必要がある場合があります。

NVIDIA Sync アプリのアップデートにより、複数の DGX Spark システムのクラスタリングが容易になり、大規模モデルの高速実行に必要なメモリ容量、推論パフォーマンス、トレーニング スループットが得られるようになります。

NVIDIA Sync は、Windows および macOS に対応し、接続されたシステムを自動的に検出して、Tailscale を通じてプライベートかつセキュアなリモート アクセスを提供します。また、手動でのネットワーク設定やターミナル コマンドのコピー不要で、1 台または複数の DGX Spark システムでアプリケーションを起動できるようにします。

NVIDIA Sync の Cluster Assistant は、複数の DGX Spark システムを高速クラスターとして自動構成します。開発者が NVIDIA ConnectX-7 ポートを介してシステムを接続すると、NVIDIA Sync はネットワークを構成し、ノード間でワークロードをルーティングし、システムの状態を監視します。

DGX Spark でエージェント型 AI を始めるには、NemoClawOpenClawHermes Agent、および OpenShell のプレイブックをご覧ください。

ソフトウェア製品に関する免責条項をご覧ください。


8 月 11 日 (火) 午前 8 時 (太平洋時間)

DGX Spark のその他のアップデート

8 月下旬に、開発者にとってエキサイティングな新機能が 2 つ登場します。

DGX Spark 向けに、Google Chrome がネイティブの ARM64 Linux ビルドとして提供され、DGX Dashboard からワンクリックでインストールできるようになります。つまり、Google アカウントの同期、拡張機能のエコシステム、デバイス間の連続性など、他のすべてのプラットフォームに標準搭載されているすべての機能が、DGX Spark でも利用できるようになります。一度サインインすると、ブラウザー環境はノート PC から Spark に引き継がれます。

新しい NVIDIA Sync Resource Monitor は、個々の DGX Spark またはクラスター全体の CPU と GPU の使用状況をリアルタイムおよび履歴表示します。追加の監視ソフトウェアや設定は不要です。一目でわかる可視化により、ワークロードの進行状況の追跡、ジョブまたはモデルを追加する前の利用可能容量の確認、ボトルネックや予期しない動作の迅速な特定に役立ちます。マーキーズーム機能により、ワークロードの全体像から特定の時点に移動できるため、トラブルシューティングの迅速化やシステムの有効活用に役立ちます。


8 月 11 日 (火) 午前 6 時 (太平洋時間)

NVIDIA が特化型エージェント型タスクを高速化する Nemotron 3.5 Lightning を発表

NVIDIA は本日、Nemotron 3 モデル ファミリーを拡充し、常時稼働エージェント向けのカスタマイズ可能な 300 億パラメーターのオープンな混合エキスパート (MoE) モデル「Nemotron 3.5 Lightning」を発表しました。

Nemotron 3.5 Lightning は、同クラスのオープン モデルと比較して、トークン生成を最大 4 倍高速化し、完了までの時間を 30% 短縮します。

また、Nemotron 3.5 Lightning はオープンウェイトであるため、AI 愛好家や AI 開発者は特定のタスク、関心、ワークフローに合わせて、独自のサンプルでファインチューニングできます。例えば、次のようなモデルのトレーニングが可能です。

  • 好みのスタイルでの記述: 電子メール、レポート、その他の文書を作成する際に、確立されたトーン、形式、用語に従う。
  • 専門分野の学習: 写真、ゲーミング、3D デザインなどの分野に関連する用語や一般的なタスクに対する理解を深める。
  • 特定の方法でのコーディング: コードの記述、レビュー、リファクタリングの際に、好みのコーディング規則、フレームワーク、テスト アプローチに従う。

これらのファインチューニングされたモデルをアプリ、ファイル、その他のツールへのアクセスと組み合わせることで、電子メールやカレンダーの管理を支援するアシスタントから、日常のルーチンを処理するスマートホーム エージェント、ローカル コードベースで開発者と連携して作業するコーディング コンパニオンまで、よりパーソナライズされたローカル エージェント型 AI 体験が実現します。

NVIDIA は、vLLM、Ollama、llama.cpp、および LM Studio と協力して、Nemotron 3.5 Lightning モデルの最適なローカル展開体験を提供しており、開発者は NVFP4 形式または GGUF 形式のモデルを選択できます。また、Unsloth も、Unsloth Studio を通じた効率的なローカル展開向けに、最適化および量子化されたモデルによる初日からのサポートを提供します。

Nemotron 3.5 Lightning は、NVIDIA RTX PCNVIDIA DGX Spark および OEM GB10 システムNVIDIA Jetson 上でローカルに動作し、RTX PRO ワークステーションNVIDIA DGX Station および GB300 デスクサイド システム、データセンター、クラウド環境にスケールアップできます。NVIDIA Blackwell システムは、Acer、ASUS、Dell TechnologiesExxactGIGABYTE、HP、Lenovo、MSISupermicro から入手可能で、ニーズに合わせて幅広いデバイスとフォームファクターから選択できます。

生成 AI の導入が進む中、企業は最先端のフロンティア インテリジェンスへのアクセスを犠牲にすることなく、トークン コストの上昇を抑制する方法を模索しています。オープンソースのルーティング ライブラリである NVIDIA NeMo Switchyard は、エージェントワークフローの各ステップを、精度、速度、コストに基づいて最適なモデルに自動的に振り分けます。また、さまざまなタスクに対し、モデルやプロバイダーを越えて作業できる柔軟性も提供します。

内部ベンチマークによると、NeMo Switchyard は各ステップをモデルのシステム全体にルーティングすることで、フロンティアレベルのタスク完了率を維持しながら、ベンチマーク完了コストを Opus 4.8 単独の場合の約 3 分の 1 に削減するのに役立ちました。NeMo Switchyard は GitHub から入手できます。

始めるには、Nemotron 3.5 LightningNeMo Switchyard、および Jetson AI の技術ブログをご覧ください。また、エッジで構築する場合は、Jetson AI Lab チュートリアルから始め、実際の Jetson プロジェクトを探してください。Nemotron 3.5 Lightning は、OpenRouter を通じて、build.nvidia.com で NVIDIA NIM マイクロサービスとして、あるいは NVIDIA クラウド パートナー、ポストトレーニング プラットフォーム、推論プラットフォーム、およびクラウド サービス プロバイダーの幅広いエコシステムを通じて入手することもできます。NeMo Switchyard は GitHub から入手できます。