🧪 新教程持续更新中 · 从机械臂到传感器,跟着教程从零搭建
跳到主要内容

内存效率——在 64GB 上运行更大的负载 ​

在边缘设备上,限制你能运行哪些模型的因素通常不是算力,而是内存。JetPack 7.2 发布时把内存效率作为头号主题,并提供了三层已文档化的优化:平台、模型与测量。本页梳理这些手段,每一条都链接到权威来源。

手段 1——平台层面(NVIDIA 智能体技能) ​

据 NVIDIA 介绍,JetPack 7.2 的内存优化智能体技能可引导 AI 智能体审计并降低整个技术栈的内存占用:

  • Bootloader 内存预留区(carveouts)——回收 Linux 启动前就预留的内存
  • 内核内存预留——调整内核保留的内存
  • 用户空间开销——找出并移除冗余的进程与服务

NVIDIA 陈述的目标:让更强的负载装进更小的内存占用(这正是同一代硬件随软件版本不断变得更好用的原因)。从这里开始:

注意: 预留区与预留内存的改动会影响启动行为。请一次只改一处,保留恢复路径(参见 刷机与更新),并在投入生产前重新验证。

手段 2——模型层面(TensorRT Edge-LLM 的特性) ​

对 LLM/VLM 负载来说,最占内存的是权重与 KV cache。TensorRT Edge-LLM 文档中记录了这些手段(Jetson Orin 只运行 FP16/INT8/INT4 引擎——参见本地 LLM 推理):

手段作用文档
量化(Orin 上的 INT8/INT4)权重更小,带宽占用更低量化指南
词表缩减缩小输出词表 / embedding 表缩减词表
KV cache 复用在相关请求间复用缓存,而不是重新计算KV cache 复用
DART 视觉 token 剪枝为 VLM 裁掉冗余的图像 tokenDART 剪枝

(文档中也记录了 FP8 KV cache,但它面向 Thor;根据官方支持矩阵,Orin 仅限 FP16/INT8/INT4 引擎。)

手段 3——先测量,不要猜 ​

  • 系统视角: tegrastats(内置于 Jetson Linux)可实时查看 CPU/GPU/内存——参见验证你的系统。
  • 模型视角: TensorRT Edge-LLM 提供了内存监控的设计与工具并发布各版本的性能基准。
  • 方法: 先记录基线(空载与负载下的内存占用),只改一个手段,再测一次。对外发布的数字始终应来自你自己的负载。

实际意味着什么 ​

  • 64GB 模块已经能运行 30B 级别的模型(已发布数字见本地 LLM 推理);内存优化让你能在其之上再加更多内容——多模型流水线、更长的上下文、常驻智能体(智能体 AI)、与推理并行的视频流水线(DeepStream)。
  • 如果你的负载现在勉强装得下,先从手段 2(模型层面)入手——它风险最低、文档最全。需要从平台本身再挤出内存时,再用手段 1。

来源 ​

状态:草稿,待 cheny 审核。内容依据所列日期的 NVIDIA 官方文档;尚未由钜犀科技在实体硬件上验证。


NVIDIA® 和 Jetson™ 是 NVIDIA Corporation 的商标。本页面由钜犀科技发布,并非 NVIDIA 官方出版物。