内存效率——在 64GB 上运行更大的负载
在边缘设备上,限制你能运行哪些模型的因素通常不是算力,而是内存。JetPack 7.2 发布时把内存效率作为头号主题,并提供了三层已文档化的优化:平台、模型与测量。本页梳理这些手段,每一条都链接到权威来源。
手段 1——平台层面(NVIDIA 智能体技能)
据 NVIDIA 介绍,JetPack 7.2 的内存优化智能体技能可引导 AI 智能体审计并降低整个技术栈的内存占用:
- Bootloader 内存预留区(carveouts)——回收 Linux 启动前就预留的内存
- 内核内存预留——调整内核保留的内存
- 用户空间开销——找出并移除冗余的进程与服务
NVIDIA 陈述的目标:让更强的负载装进更小的内存占用(这正是同一代硬件随软件版本不断变得更好用的原因)。从这里开始:
注意: 预留区与预留内存的改动会影响启动行为。请一次只改一处,保留恢复路径(参见 刷机与更新),并在投入生产前重新验证。
手段 2——模型层面(TensorRT Edge-LLM 的特性)
对 LLM/VLM 负载来说,最占内存的是权重与 KV cache。TensorRT Edge-LLM 文档中记录了这些手段(Jetson Orin 只运行 FP16/INT8/INT4 引擎——参见本地 LLM 推理):
| 手段 | 作用 | 文档 |
|---|---|---|
| 量化(Orin 上的 INT8/INT4) | 权重更小,带宽占用更低 | 量化指南 |
| 词表缩减 | 缩小输出词表 / embedding 表 | 缩减词表 |
| KV cache 复用 | 在相关请求间复用缓存,而不是重新计算 | KV cache 复用 |
| DART 视觉 token 剪枝 | 为 VLM 裁掉冗余的图像 token | DART 剪枝 |
(文档中也记录了 FP8 KV cache,但它面向 Thor;根据官方支持矩阵,Orin 仅限 FP16/INT8/INT4 引擎。)
手段 3——先测量,不要猜
- 系统视角:
tegrastats(内置于 Jetson Linux)可实时查看 CPU/GPU/内存——参见验证你的系统。 - 模型视角: TensorRT Edge-LLM 提供了内存监控的设计与工具并发布各版本的性能基准。
- 方法: 先记录基线(空载与负载下的内存占用),只改一个手段,再测一次。对外发布的数字始终应来自你自己的负载。
实际意味着什么
- 64GB 模块已经能运行 30B 级别的模型(已发布数字见本地 LLM 推理);内存优化让你能在其之上再加更多内容——多模型流水线、更长的上下文、常驻智能体(智能体 AI)、与推理并行的视频流水线(DeepStream)。
- 如果你的负载现在勉强装得下,先从手段 2(模型层面)入手——它风险最低、文档最全。需要从平台本身再挤出内存时,再用手段 1。
来源
- NVIDIA 技术博客——JetPack 7.2 中的内存效率与智能体技能(核对于 2026-09-24)
- TensorRT Edge-LLM 文档(功能与支持矩阵;核对于 2026-09-24)
状态:草稿,待 cheny 审核。内容依据所列日期的 NVIDIA 官方文档;尚未由钜犀科技在实体硬件上验证。
NVIDIA® 和 Jetson™ 是 NVIDIA Corporation 的商标。本页面由钜犀科技发布,并非 NVIDIA 官方出版物。

