🧪 新教程持續更新中 · 由機械臂到傳感器,跟隨教程從零搭建
跳到主要內容

記憶體效率——在 64GB 上執行更大的工作負載 ​

在邊緣設備上,限制你能執行哪些模型的通常是記憶體,而不是算力。JetPack 7.2 發佈時把記憶體效率作為頭號主題,並提供三層已文檔化的優化:平台、模型與測量。本頁梳理這些手段,每一項都附有權威來源的連結。

手段 1——平台層面(NVIDIA 智能體技能) ​

據 NVIDIA 介紹,JetPack 7.2 的記憶體優化智能體技能可引導 AI 智能體檢視並降低整個堆疊的記憶體佔用:

  • Bootloader 記憶體預留區(carveouts)——回收 Linux 啟動前就預留的記憶體
  • 內核記憶體預留——調整內核保留的記憶體
  • 使用者空間額外負擔——找出並移除多餘的進程與服務

NVIDIA 陳述的目標:讓更強的工作負載裝進更小的記憶體佔用(這正是同一代硬件隨著軟件版本不斷變得更好用的原因)。從這裏開始:

注意: 預留區與預留記憶體的改動會影響開機行為。請一次只改一處,保留恢復路徑 (參見 刷機與更新),並在投入 生產前重新驗證。

手段 2——模型層面(TensorRT Edge-LLM 的特性) ​

對 LLM/VLM 工作負載來說,最佔用記憶體的是權重與 KV cache。TensorRT Edge-LLM 文檔中記錄了這些手段(Jetson Orin 執行 FP16/INT8/INT4 引擎——參見本地 LLM 推論):

手段作用文檔
量化(Orin 上的 INT8/INT4)權重更小,佔用帶寬更低量化指南
詞彙表縮減縮小輸出詞彙表 / embedding 表縮減詞彙表
KV cache 複用在相關請求之間複用緩存,而不是重新計算KV cache 複用
DART 視覺 token 剪枝為 VLM 裁掉多餘的圖像 tokenDART 剪枝

(文檔中也有 FP8 KV cache,但它是面向 Thor 的;根據官方支援矩陣,Orin 僅限 FP16/INT8/INT4 引擎。)

手段 3——先測量,不要猜 ​

  • 系統視角: tegrastats(內置於 Jetson Linux)可實時查看 CPU/GPU/記憶體——參見驗證你的系統。
  • 模型視角: TensorRT Edge-LLM 提供了記憶體監控的設計與工具並發佈各版本的性能基準。
  • 方法: 先記錄基線(空載與負載下的記憶體佔用),只改一個手段,再測量一次。對外發佈的數字應始終來自你自己的工作負載。

實際意味著什麼 ​

  • 64GB 模組已經能執行 30B 級別的模型(已發佈的數字見本地 LLM 推論);記憶體優化讓你能在其之上再加更多內容——多模型管線、更長的上下文、常駐智能體(智能體 AI)、與推論並行的視頻管線(DeepStream)。
  • 如果你的工作負載現在勉強裝得下,請先從手段 2(模型層面)入手——它風險最低、文檔最齊全。需要從平台本身再擠出記憶體時,再用手段 1。

資料來源 ​

狀態:草稿,待 cheny 審核。內容依據所列日期的 NVIDIA 官方文件;尚未由鉅犀科技在實體硬件上驗證。


NVIDIA® 與 Jetson™ 是 NVIDIA Corporation 的商標。本頁面由鉅犀科技發佈,並非 NVIDIA 官方出版物。