🧪 Se publican nuevos tutoriales — del brazo robótico al sensor
Saltar al contenido

Eficiencia de memoria — ejecutar cargas de trabajo más grandes en 64GB ​

En los dispositivos de borde, la memoria — no la capacidad de cómputo — suele ser lo que limita los modelos que puede ejecutar. JetPack 7.2 se lanzó con la eficiencia de memoria como tema principal, y hay tres capas documentadas de optimización: la plataforma, el modelo y la medición. Esta página traza el mapa de las palancas; cada una enlaza con su fuente autorizada.

Palanca 1 — Nivel de plataforma (habilidades de agente de NVIDIA) ​

Las habilidades de agente de optimización de memoria de JetPack 7.2 guían a un agente de IA en la auditoría y la reducción del consumo de memoria en toda la pila, según NVIDIA:

  • Carveouts de memoria del bootloader — recupere la memoria reservada antes de que Linux arranque
  • Reservas de memoria del kernel — ajuste lo que el kernel retiene
  • Sobrecarga del espacio de usuario — encuentre y elimine procesos y servicios redundantes

El objetivo que declara NVIDIA: que quepan cargas de trabajo más capaces en una huella de memoria más reducida (así es como el mismo hardware resulta cada vez más útil a lo largo de las versiones de software). Comience aquí:

Precaución: los cambios de carveouts y reservas afectan el comportamiento de arranque. Haga los cambios de uno en uno, conserve una ruta de recuperación (consulte Flasheo y actualizaciones) y vuelva a validar antes de pasar a producción.

Palanca 2 — Nivel de modelo (funciones de TensorRT Edge-LLM) ​

Para las cargas de trabajo de LLM/VLM, los mayores consumidores de memoria son los pesos y la caché KV. TensorRT Edge-LLM documenta estas palancas (Jetson Orin ejecuta motores FP16/INT8/INT4 — consulte Inferencia LLM local):

PalancaQué haceDocumentación
Cuantización (INT8/INT4 en Orin)Pesos más pequeños, menos ancho de bandaGuía de cuantización
Reducción del vocabularioReduce el vocabulario de salida / las tablas de embeddingReducir el vocabulario
Reutilización de la caché KVReutiliza la caché entre solicitudes relacionadas en lugar de recalcularReutilización de la caché KV
Poda de tokens visuales DARTRecorta los tokens de imagen redundantes para los VLMPoda DART

(La caché KV FP8 existe en la documentación, pero está orientada a Thor; Orin se limita a los motores FP16/INT8/INT4 según la matriz de compatibilidad oficial.)

Palanca 3 — Mida, no adivine ​

Qué significa esto en la práctica ​

  • El módulo de 64GB ya ejecuta modelos de la clase 30B (consulte las cifras publicadas en Inferencia LLM local); la optimización de memoria es lo que le permite añadir más por encima — pipelines multimodelo, contextos más largos, agentes siempre activos (IA agéntica), pipelines de video junto con la inferencia (DeepStream).
  • Si su carga de trabajo cabe hoy pero apenas, comience por la Palanca 2 (nivel de modelo) — es la de menor riesgo y la mejor documentada. Use la Palanca 1 cuando necesite exprimir la propia plataforma.

Fuentes ​

Estado: borrador, pendiente de revisión por cheny. Basado en la documentación oficial de NVIDIA a la fecha indicada; aún no verificado en hardware físico por Juxi Technology.


NVIDIA® y Jetson™ son marcas comerciales de NVIDIA Corporation. Esta página es publicada por Juxi Technology y no es una publicación de NVIDIA.