🧪 Stanno arrivando nuovi tutorial — dal braccio robotico al sensore
Vai al contenuto

Efficienza della memoria — Carichi di lavoro più grandi su 64GB ​

Sui dispositivi edge, di norma è la memoria — non la potenza di calcolo — a limitare quali modelli si possono eseguire. JetPack 7.2 è arrivato con l'efficienza della memoria come tema principale, e ci sono tre livelli documentati di ottimizzazione: la piattaforma, il modello e la misurazione. Questa pagina mappa le leve disponibili; ciascuna rimanda alla fonte autorevole.

Leva 1 — Livello piattaforma (competenze agente di NVIDIA) ​

Le competenze agente di ottimizzazione della memoria di JetPack 7.2 guidano un agente IA nell'audit e nella riduzione del consumo di memoria su tutto lo stack, secondo NVIDIA:

  • Aree riservate del bootloader (carveout) — recuperare la memoria riservata prima dell'avvio di Linux
  • Riservazioni di memoria del kernel — regolare quanto il kernel trattiene
  • Overhead dello spazio utente — individuare e rimuovere processi e servizi ridondanti

L'obiettivo dichiarato da NVIDIA: far rientrare carichi di lavoro più impegnativi in meno memoria (è così che lo stesso hardware diventa via via più utile nel corso delle release software). Inizi da qui:

Attenzione: le modifiche alle aree riservate e alle riservazioni di memoria toccano il comportamento di avvio. Apporti le modifiche una alla volta, mantenga una via di ripristino (vedere Flashing e aggiornamenti) e verifichi di nuovo prima di passare alla produzione.

Leva 2 — Livello modello (funzionalità di TensorRT Edge-LLM) ​

Per i carichi di lavoro LLM/VLM, i maggiori consumatori di memoria sono i pesi e la cache KV. TensorRT Edge-LLM documenta queste leve (Jetson Orin esegue engine FP16/INT8/INT4 — vedere Inferenza LLM locale):

LevaCosa faDocumentazione
Quantizzazione (INT8/INT4 su Orin)Pesi più piccoli, meno larghezza di bandaGuida alla quantizzazione
Riduzione del vocabolarioRiduce il vocabolario di output / le tabelle di embeddingRidurre il vocabolario
Riutilizzo della cache KVRiutilizza la cache tra richieste correlate invece di ricalcolarlaRiutilizzo della cache KV
Pruning dei token visivi DARTTaglia i token immagine ridondanti per i VLMPruning DART

(La cache KV FP8 esiste nella documentazione ma è orientata a Thor; Orin è limitato a engine FP16/INT8/INT4 secondo la matrice di supporto ufficiale.)

Leva 3 — Misurare, non indovinare ​

Cosa significa in pratica ​

  • Il modulo da 64GB esegue già modelli della classe 30B (vedere i dati pubblicati in Inferenza LLM locale); l'ottimizzazione della memoria è ciò che permette di aggiungere altro sopra — pipeline multi-modello, contesti più lunghi, agenti sempre attivi (IA agentica), pipeline video accanto all'inferenza (DeepStream).
  • Se il suo carico di lavoro oggi rientra ma a malapena, inizi dalla Leva 2 (livello modello) — è la meno rischiosa e la meglio documentata. Usi la Leva 1 quando deve spremere la piattaforma stessa.

Fonti ​

Stato: bozza, in attesa di revisione da parte di cheny. Basato sulla documentazione ufficiale NVIDIA alla data indicata; non ancora verificato su hardware fisico da Juxi Technology.


NVIDIA® e Jetson™ sono marchi di NVIDIA Corporation. Questa pagina è pubblicata da Juxi Technology e non è una pubblicazione NVIDIA.