🧪 De nouveaux tutoriels arrivent — du bras robotique au capteur
Aller au contenu

Efficacité mémoire — exécuter de plus grosses charges de travail sur 64GB ​

Sur les appareils en périphérie, c'est généralement la mémoire — et non la puissance de calcul — qui limite les modèles que vous pouvez exécuter. JetPack 7.2 est sorti avec l'efficacité mémoire comme thème phare, et il existe trois couches d'optimisation documentées : la plateforme, le modèle et la mesure. Cette page cartographie les leviers ; chacun renvoie à sa source de référence.

Levier 1 — Niveau plateforme (compétences d'agent NVIDIA) ​

Les compétences d'agent d'optimisation mémoire de JetPack 7.2 guident un agent IA dans l'audit et la réduction de la consommation mémoire sur toute la pile, selon NVIDIA :

  • Carveouts mémoire du bootloader — récupérez la mémoire réservée avant le démarrage de Linux
  • Réservations mémoire du noyau — ajustez ce que le noyau se réserve
  • Surcoût de l'espace utilisateur — identifiez et supprimez les processus et services redondants

L'objectif énoncé par NVIDIA : faire tenir des charges de travail plus exigeantes dans une empreinte mémoire plus réduite (c'est ainsi que le même matériel gagne en utilité au fil des versions logicielles). Commencez ici :

Attention : les modifications de carveouts et de réservations touchent au comportement de démarrage. Faites les changements un par un, gardez un chemin de récupération (voir Flashage et mises à jour), et revalidez avant de passer en production.

Levier 2 — Niveau modèle (fonctionnalités TensorRT Edge-LLM) ​

Pour les charges de travail LLM/VLM, les plus gros consommateurs de mémoire sont les poids et le cache KV. TensorRT Edge-LLM documente ces leviers (Jetson Orin exécute des moteurs FP16/INT8/INT4 — voir Inférence LLM locale) :

LevierCe que cela faitDocs
Quantification (INT8/INT4 sur Orin)Poids plus petits, moins de bande passanteGuide de quantification
Réduction du vocabulaireRéduit le vocabulaire de sortie / les tables d'embeddingRéduire le vocabulaire
Réutilisation du cache KVRéutilise le cache entre requêtes liées au lieu de recalculerRéutilisation du cache KV
Élagage de jetons visuels DARTRéduit les jetons d'image redondants pour les VLMÉlagage DART

(Le cache KV FP8 existe dans la documentation, mais il est orienté Thor ; Orin est limité aux moteurs FP16/INT8/INT4 d'après la matrice de prise en charge officielle.)

Levier 3 — Mesurez, ne devinez pas ​

Ce que cela signifie en pratique ​

  • Le module 64GB exécute déjà des modèles de la classe 30B (voir les chiffres publiés dans Inférence LLM locale) ; l'optimisation de la mémoire est ce qui vous permet d'en ajouter plus par-dessus — pipelines multi-modèles, contextes plus longs, agents toujours actifs (IA agentique), pipelines vidéo en parallèle de l'inférence (DeepStream).
  • Si votre charge de travail tient aujourd'hui, mais tout juste, commencez par le levier 2 (niveau modèle) — c'est le moins risqué et le mieux documenté. Utilisez le levier 1 lorsque vous devez comprimer la plateforme elle-même.

Sources ​

Statut : brouillon, en attente de relecture par cheny. Fondé sur la documentation officielle NVIDIA à la date indiquée ; pas encore vérifié sur matériel physique par Juxi Technology.


NVIDIA® et Jetson™ sont des marques de NVIDIA Corporation. Cette page est publiée par Juxi Technology et ne constitue pas une publication de NVIDIA.