🧪 新教程持續更新中 · 由機械臂到傳感器,跟隨教程從零搭建
跳到主要內容

在本地執行 LLM——JetPack 7.2 上的 TensorRT Edge-LLM ​

你的 AGX Orin 64GB 可以在本地執行大型語言模型——無需雲端、無需網絡。NVIDIA 針對此用途的最佳化路徑是 TensorRT Edge-LLM,它正式支援 JetPack 7.2 上的 Jetson Orin。本頁幫你建立整體概念:你的套件能做什麼、不能做什麼,工作流程的樣貌,以及可以預期的性能。權威的分步操作在 NVIDIA 官方文件中(全文附有連結)。

先讀這一節——三個 Orin 專屬事實 ​

  1. Orin 僅執行 FP16、INT8 與 INT4 引擎。Orin 不支援 FP8 與 FP4(它們屬於 Thor 等級的能力)。NVIDIA 的支援矩陣明確說明了這一點——請據此規劃你的量化選擇。
  2. Orin 部署路徑的引擎在裝置上構建(不是從 PC 交叉編譯)。
  3. JetPack 7.2 是受支援的軟件堆疊——CUDA 13.2 搭配平台版 TensorRT(本版本為 10.16.2)。aarch64 wheel 針對 Jetson Orin(SM87),支援 Python 3.10–3.12。

(來源:TensorRT Edge-LLM 官方支援矩陣,查閱於 2026-09-24。)

TensorRT Edge-LLM 涵蓋的範圍 ​

根據 NVIDIA 官方文件,Edge-LLM 為邊緣平台上的文字、視覺、音頻、語音與動作模型提供優化推論:

能力文件中的示例
文字生成含 Qwen、Gemma、Nemotron 的 LLM 系列
多模態(VLM)Phi-4 Multimodal 示例
語音辨識(ASR)專屬示例工作流程
語音生成(TTS)專屬示例工作流程
視覺-語言-動作VLA 示例(機器人)
Omni(音頻 + 視覺 + 語音 I/O)專屬示例工作流程

功能亮點:量化(Orin 上的 INT8/INT4)、推測解碼(EAGLE3、DFlash 等)、KV cache 複用、詞彙縮減、針對 VLM 的 DART 視覺 token 剪枝、串流輸出,以及 LoRA 支援。

工作流程(依官方文件) ​

TensorRT Edge-LLM 有兩條官方記載的 Quick Start 路徑:

  1. ONNX + C++ runtime——匯出/量化檢查點(通常在 x86 主機上)、傳輸到裝置、在裝置上構建引擎、執行 C++ runtime。
  2. 單行 Python 伺服器——更快取得服務端點的路徑。

從這裡開始:TensorRT Edge-LLM Quick Start

除了 Quick Start 之外:

鉅犀提示: 匯出/量化工具在 x86 Linux 主機上執行效果最好(依文件中所列 x86 開發者條目) ;引擎構建與推論則在你的套件上執行。請為模型檢查點預留磁碟空間——每個模型數 GB 是常態。

服務:OpenAI 相容端點(以及 Claude Code) ​

文件中包含一個實驗性 Python API 與伺服器,提供 OpenAI 相容的聊天介面——文件中有 OpenAI 風格客戶端的示例,甚至還有**「Anthropic 與 Claude Code」整合示例**(把 Claude Code 指向你在 Jetson 上託管的端點)。

預期性能(AGX Orin 64GB) ​

NVIDIA 公布了 64GB 模組在 JetPack 7.2 上的以下每秒 token 數據(2026 年 6 月;完整背景與方法見原始部落格):

模型AGX Orin 64GB
Nemotron3 Nano 30B A3B~40 tok/s
Qwen 3.5 4B~28 tok/s
Qwen 3.5 9B~17 tok/s
Qwen 3.6 27B~7 tok/s
Gemma 4 E4B~32 tok/s

你的數據會因模型、量化、上下文長度與電源模式而不同。請將這些視為原廠公布的參考值,而不是保證。

更簡單的替代方案 ​

如果 Edge-LLM 的匯出/構建工作流程對你現在的需求來說過於繁重,NVIDIA 的 Jetson AI Lab 為其他 runtime(llama.cpp、vLLM 等)提供了實作教學——照著較舊的教學操作之前,請先確認它的 JetPack 版本說明。

故障排除 ​

  • 首次執行較慢: 首次啟動時引擎構建可能需要數分鐘;之後的執行會複用引擎(DeepStream 也是同樣的行為——參見我們的 DeepStream 教學)。
  • FP8/FP4 指令無法運作: 這是預期行為——Orin 僅支援 FP16/INT8/INT4 引擎。
  • 版本不對: 請先確認 JetPack 7.2.1——驗證你的系統。

資料來源 ​

狀態:草稿,待 cheny 審閱。內容依據截至所列日期的 NVIDIA 官方文件;尚未由鉅犀科技在實體硬體上驗證。


NVIDIA® 與 Jetson™ 是 NVIDIA Corporation 的商標。本頁由鉅犀科技發布,並非 NVIDIA 官方出版物。