🧪 Novos tutoriais em andamento — do braço robótico ao sensor
Ir para o conteúdo

Eficiência de memória — Executar cargas de trabalho maiores em 64GB ​

Nos dispositivos de borda, a memória — e não o poder de computação — é normalmente o que limita os modelos que consegue executar. O JetPack 7.2 chegou com a eficiência de memória como tema central, e há três camadas de otimização documentadas: a plataforma, o modelo e a medição. Esta página mapeia as alavancas; cada uma remete para a fonte autoritativa.

Alavanca 1 — Nível da plataforma (competências de agente da NVIDIA) ​

As competências de agente de otimização de memória do JetPack 7.2 orientam um agente de IA na auditoria e redução do consumo de memória em toda a pilha, segundo a NVIDIA:

  • Reservas de memória do bootloader (carveouts) — recuperar memória reservada antes de o Linux arrancar
  • Reservas de memória do kernel — ajustar o que o kernel retém
  • Sobrecarga do espaço de utilizador — encontrar e remover processos e serviços redundantes

O objetivo definido pela NVIDIA: encaixar cargas de trabalho com mais capacidades em pegadas de memória mais pequenas (é assim que o mesmo hardware se torna cada vez mais útil ao longo das versões de software). Comece por aqui:

Atenção: as alterações a carveouts e reservas afetam o comportamento de arranque. Faça as alterações uma de cada vez, mantenha um caminho de recuperação (consulte Gravação e atualizações) e volte a validar antes de avançar para produção.

Alavanca 2 — Nível do modelo (funcionalidades do TensorRT Edge-LLM) ​

Para cargas de trabalho LLM/VLM, os maiores consumidores de memória são os pesos e a KV cache. O TensorRT Edge-LLM documenta estas alavancas (o Jetson Orin executa motores FP16/INT8/INT4 — consulte Inferência de LLM local):

AlavancaO que fazDocumentação
Quantização (INT8/INT4 no Orin)Pesos mais pequenos, menos largura de bandaGuia de quantização
Redução de vocabulárioEncolhe o vocabulário de saída / as tabelas de embeddingReduzir o vocabulário
Reutilização da KV cacheReutiliza a cache entre pedidos relacionados em vez de recalcularReutilização da KV cache
Poda de tokens visuais DARTCorta tokens de imagem redundantes para VLMsPoda DART

(A KV cache FP8 existe na documentação, mas é orientada ao Thor; o Orin está limitado a motores FP16/INT8/INT4 segundo a matriz de suporte oficial.)

Alavanca 3 — Medir, não adivinhar ​

O que isto significa na prática ​

  • O módulo de 64GB já executa modelos da classe dos 30B (ver números publicados em Inferência de LLM local); a otimização de memória é o que lhe permite acrescentar mais por cima — pipelines com vários modelos, contextos mais longos, agentes sempre ativos (IA agêntica), pipelines de vídeo em paralelo com a inferência (DeepStream).
  • Se a sua carga de trabalho já cabe hoje, mas por pouco, comece pela Alavanca 2 (nível do modelo) — é a de menor risco e a melhor documentada. Use a Alavanca 1 quando precisar de espremer a própria plataforma.

Fontes ​

Estado: rascunho, pendente de revisão por cheny. Baseado na documentação oficial da NVIDIA na data indicada; ainda não verificado em hardware físico pela Juxi Technology.


NVIDIA® e Jetson™ são marcas comerciais da NVIDIA Corporation. Esta página é publicada pela Juxi Technology e não é uma publicação da NVIDIA.