🧪 新しいチュートリアルを公開中 — ロボットアームからセンサーまで
コンテンツへスキップ

ローカルでの LLM 実行 — 8GB Orin Nano 上の TensorRT Edge-LLM ​

お使いの Jetson Orin Nano Super 開発キット(8GB)は、言語モデルをローカルで実行できます。このための NVIDIA の最適化された経路が TensorRT Edge-LLM であり、JetPack 7.2 系列上の Jetson Orin を正式にサポートしています。本ページでは、8GB に何が収まるか、現在どのランタイムが動作するかを扱います。具体的な手順は NVIDIA のドキュメントにあり、以下にリンクしています。

まず読んでください — このキットの 4 つの制約 ​

  1. Orin で動作するのは FP16、INT8、INT4 エンジンのみです。FP8 と FP4 エンジンはこのデバイスでは動作しません — これらは Thor/Blackwell クラスの機能です(「Jetson Orin は FP8/FP4 モデルエンジンを実行しない」— サポートマトリクス)。
  2. エンジンは C++ ランタイムによってデバイス上でビルドされます。 ONNX エクスポートと量子化は x86-64 Linux ホスト上で実行され、Orin 上では実行されません。エンジンは SM 単位で厳密です:Thor(SM110)でビルドしたエンジンは Orin Nano(sm_87)にはロードできません。
  3. JetPack 7.2.1(L4T r39.2.1)がサポート対象のスタックです — CUDA 13.2.2、TensorRT 10.16.2。Edge-LLM は JetPack に含まれるこのプラットフォーム TensorRT を使用します。
  4. 8GB の統合メモリは OS とデスクトップと共有されます。 使用可能なのはおよそ 7.6 GB です。制約となるのは TOPS ではなくモデルのサイズであり、KV キャッシュも同じメモリに収まる必要があります。

重要: このキットでは INT4 AWQ または INT4 GPTQ のチェックポイントを選んでください。FP8、MXFP8、FP4、NVFP4 のチェックポイントは選択しないでください。INT8 GPTQ はサポートされていません。

TensorRT Edge-LLM がカバーする範囲 ​

TensorRT Edge-LLM は、エッジプラットフォーム上の LLM と VLM に向けた NVIDIA の公式ランタイムです。サポートマトリクスでは、Jetson Orin が JetPack 7.2 向けに「Official(正式)」と記載されており、エンジンはデバイス上でビルドされ、精度は FP16、INT8、INT4 です。

  • モデルのカバレッジ: サポートされるチェックポイントには Llama 3.2 1B/3B、Llama 3.1 8B、Qwen2.5(0.5B〜14B)、Qwen3(0.6B〜8B)、および VLM(Qwen2.5-VL 3B/7B、InternVL3/3.5(1B〜14B)など)が含まれます — 30B パラメータ未満の dense チェックポイントです。これは検証済みリストではありません:「記載されたすべてのチェックポイントが、サポート対象のすべてのプラットフォームと精度で完全に検証されているわけではありません」。
  • 8GB 向けビルドフラグ: Orin Nano で INT4 エンジンをビルドする場合は、--externalize-weights int4_ffn(dense)または --externalize-weights int4_ffn int4_moe(MoE)を指定して、エンジンビルド時のメモリを削減します。
  • ディスク容量: ONNX ファイルとエンジン用に、モデルワークフロー 1 つあたりおよそ 20〜50 GB を見込んでください。このキットには内蔵ストレージがありません(クイックスタート)。
  • 2 つのクイックスタート経路: C++ 経路(ホストでエクスポート/量子化し、デバイス上でエンジンをビルドして実行)と、サーバー経路 — tensorrt-edgellm-serve Qwen/Qwen3.5-0.8B(初回起動時にチェックポイントをダウンロード)。

Juxi のヒント: 正式な手順は NVIDIA のものです — クイックスタート、 インストール、 対応モデル。 0.10.1 のインストールページには次のように記載されています:「0.10.1 ではホイールは公開されておらず、既定のインストール経路でもありません」。

実際に 8GB に収まるもの ​

  • NVIDIA がこのモジュールでベンチマークしたのは最大 2B パラメータです。 Edge-LLM のベンチマークページで最大の Orin Nano(8GB)行は Qwen3.5-2B の 4,692 MB です:「2B は NVIDIA が Orin Nano 8GB でベンチマークした最大のモデルです」。
  • ベンダーのウォークスルーでは 4B モデルを実行しています。 Jetson AI Lab のチュートリアルは、Qwen3-4B-Instruct INT4 AWQ(重み約 2 GB)が「Orin Nano の 8GB 統合メモリ内」に収まると報告しています。InternVL3 1B/2B も INT4 AWQ で収まりますが、より大きなバリアントは AGX Orin または Thor を対象としています。(ベンダー提供の内容。)
  • NVIDIA のメモリブログが示す実用的な範囲:LLM は約 10B まで、VLM は約 4B パラメータまで — 4 ビット量子化と効率的なランタイムを使う、チューニング済み構成での値です。
  • ファイルサイズだけでは収まるかどうかの判断になりません — KV キャッシュも収まる必要があります。 コミュニティの報告では、12B/26B クラスの GGUF モデル(gemma4:12b は 7.4 GB、gemma4:26b は 16 GB)が 8GB ボード上の Ollama で失敗しています:cudaMalloc failed: out of memory ... failed to allocate buffer for kv cache。(未確認。)

このキットの公式パフォーマンス数値 ​

NVIDIA は Jetson Orin Nano(8GB) のベンチマーク表を公開しています — v0.10.0、JetPack 7.2 / CUDA 13.2 / TensorRT 10.16。MTBench(LLM)と COCO(VLM)でのランタイム結果で、ピーク GPU メモリ付きです:

モデル種類スループットピーク GPU メモリ
Qwen3-0.6BLLM77.0 tok/s1,917 MB
Qwen3-1.7BLLM36.5 tok/s2,992 MB
Qwen3-VL-2BVLM36.1 tok/s4,486 MB
Qwen3.5-0.8BLLM59.1 tok/s2,127 MB
Qwen3.5-0.8BVLM59.0 tok/s2,760 MB
Qwen3.5-2BLLM29.6 tok/s3,642 MB
Qwen3.5-2BVLM29.6 tok/s4,692 MB

Orin の行はバッチ 1 と外部化した INT4 重みを使用しています。ビルド制限:maxInputLen 2048、maxKVCacheCapacity 2200。「本番パフォーマンスはシステムレベルのチューニング(電力モード、メモリ構成、熱管理)によって変動する可能性があります」。

重要: NVIDIA が公開している AGX Orin 64GB の tokens/sec 表は、このキットには適用されません — モジュール、メモリ帯域幅、電力範囲が異なります。AGX Orin の数値から Orin Nano の数値を推定しないでください。ここでの Ollama や llama.cpp の経路について、ファーストパーティの数値は存在しません。

このキットで使えるその他のランタイム ​

Ollama ​

NVIDIA スタッフが開発者フォーラムで JetPack 7.2.1 について検証した現在の状況(2026 年 9 月):標準のインストーラーが動作し — curl -fsSL https://ollama.com/install.sh | sh — ollama ps は 100% GPU を示すはずです。「Unsupported JetPack version detected」という警告は無害です。

古いビルドは、プリビルドされた CUDA ライブラリに Orin のコンピュートケイパビリティである sm_87 が欠けていたため、CPU にフォールバックしていました。コミュニティの報告によれば Ollama 0.30.11 が「CC 87 for CUDA v13」を追加し、NVIDIA スタッフが修正を確認しています。一部のコミュニティの不具合報告は残っています(2026 年 8〜9 月)— お使いの実機で ollama ps を確認してください。CUDA v13 のソースビルドが引き続きフォールバック手段です。

JetPack 7.2 用の Python ホイール ​

JetPack 7.2 / CUDA 13.2 向けの CUDA 対応 Python パッケージ(PyTorch など)は、NVIDIA スタッフが参照先として挙げる Jetson AI Lab の SBSA インデックスから入手できます:

https://pypi.jetson-ai-lab.io/sbsa/cu130

これを pip インデックスとして使用します(--index-url https://pypi.jetson-ai-lab.io/sbsa/cu130)。torch 2.11.0、torchvision 0.25.0、vllm 0.20.0+cu130 などの aarch64 ホイールが配布されています。jp7/* インデックスは存在せず、JetPack 6 時代のインデックスは jp6/cu126 です。CUDA 13.2 により、Orin は Arm SBSA ツールキット(R595 以降のドライバー)に統一されます。

jetson-containers と Jetson AI Lab(代替経路) ​

jetson-containers は JetPack 6.2(CUDA 12.6)と JetPack 7(CUDA 13.x)をサポートしています。主要なサービング経路向けにビルド済みの -jetson-orin イメージがあり、ghcr.io/nvidia-ai-iot/llama_cpp:latest-jetson-orin や ghcr.io/nvidia-ai-iot/vllm:latest-jetson-orin などが含まれます。

ベンダー資料による 8GB での注意点:vLLM の例では --shm-size=16g を使用しており(ここでのサイズ推奨ではありません)、推奨セットアップでは Docker のデータルートを NVMe に移し、16 GB のスワップファイルを追加します(先に ZRAM を無効化)。

8GB 向けのチューニング ​

モデルが収まらない場合は、プラットフォームのメモリを解放し(ヘッドレスモードで最大約 865 MB を回収)、4 ビットに量子化し、KV キャッシュとコンテキストを意図的に設計してください — 8GB でのメモリ効率を参照。

トラブルシューティング ​

  • ロード時にメモリ不足 — cudaMalloc failed: out of memory ... failed to allocate buffer for kv cache は、モデルと KV キャッシュが 8GB の統合メモリを超えていることを意味します。より小さい、またはより強く量子化したモデルを使うか、コンテキストを短縮してください。Edge-LLM のエンジンビルドでは --externalize-weights int4_ffn を追加し、--maxInputLen / --maxKVCacheCapacity を小さくしてください。
  • Ollama の CPU フォールバック、または「Unsupported JetPack version detected」警告 — まず Ollama を更新してください(古いビルドには sm_87 がありませんでした)。NVIDIA スタッフによると、7.2.1 ではこの警告は無害です。ollama ps(100% GPU)で確認してください。
  • バージョンやセットアップの問題 — システムの確認とトラブルシューティングを参照してください。

出典 ​

ステータス:ドラフト、cheny によるレビュー待ち。記載した日付時点の NVIDIA 公式ドキュメントに基づいています。Juxi Technology による実機検証はまだ行われていません。


NVIDIA® および Jetson™ は NVIDIA Corporation の商標です。本ページは Juxi Technology によって公開されており、NVIDIA の公式出版物ではありません。