🧪 Novos tutoriais em andamento — do braço robótico ao sensor
Ir para o conteúdo

Eficiência de memória — Executando cargas de trabalho maiores em 64GB ​

Em dispositivos de borda, é a memória — não a computação — que normalmente limita quais modelos você consegue executar. O JetPack 7.2 chegou com a eficiência de memória como tema de destaque, e há três camadas documentadas de otimização: a plataforma, o modelo e a medição. Esta página mapeia as alavancas; cada uma aponta para a fonte oficial.

Alavanca 1 — Nível da plataforma (habilidades de agente da NVIDIA) ​

As habilidades de agente de otimização de memória do JetPack 7.2 guiam um agente de IA pela auditoria e redução do consumo de memória em toda a pilha, segundo a NVIDIA:

  • Regiões reservadas de memória do bootloader (carveouts) — recupere a memória reservada antes de o Linux iniciar
  • Reservas de memória do kernel — ajuste o que o kernel retém
  • Sobrecarga do espaço de usuário — encontre e remova processos e serviços redundantes

O objetivo declarado pela NVIDIA: encaixar cargas de trabalho mais capazes em menos memória (é assim que o mesmo hardware continua ficando mais útil ao longo das versões de software). Comece por aqui:

Atenção: alterações em carveouts e reservas afetam o comportamento de inicialização. Faça as alterações uma de cada vez, mantenha um caminho de recuperação (consulte Gravação e atualizações) e valide novamente antes de ir para produção.

Alavanca 2 — Nível do modelo (recursos do TensorRT Edge-LLM) ​

Para cargas de trabalho de LLM/VLM, os maiores consumidores de memória são os pesos e o cache KV. O TensorRT Edge-LLM documenta estas alavancas (o Jetson Orin executa engines FP16/INT8/INT4 — consulte Inferência de LLM local):

AlavancaO que fazDocumentação
Quantização (INT8/INT4 no Orin)Pesos menores, menos largura de bandaGuia de quantização
Redução de vocabulárioEncolhe o vocabulário de saída / as tabelas de embeddingsReduzir vocabulário
Reutilização de cache KVReutiliza o cache entre solicitações relacionadas em vez de recalcularReutilização de cache KV
Poda de tokens visuais DARTCorta tokens de imagem redundantes para VLMsPoda DART

(O cache KV em FP8 existe na documentação, mas é voltado ao Thor; o Orin é limitado a engines FP16/INT8/INT4 conforme a matriz de compatibilidade oficial.)

Alavanca 3 — Meça, não adivinhe ​

O que isso significa na prática ​

  • O módulo de 64GB já executa modelos da classe de 30B (veja os números publicados em Inferência de LLM local); a otimização de memória é o que permite adicionar mais em cima — pipelines com múltiplos modelos, contextos mais longos, agentes sempre ativos (IA agêntica), pipelines de vídeo em paralelo com a inferência (DeepStream).
  • Se a sua carga de trabalho cabe hoje, mas por pouco, comece pela Alavanca 2 (nível do modelo) — é a de menor risco e melhor documentada. Use a Alavanca 1 quando você precisar espremer a própria plataforma.

Fontes ​

Status: rascunho, pendente de revisão por cheny. Baseado na documentação oficial da NVIDIA na data indicada; ainda não verificado em hardware físico pela Juxi Technology.


NVIDIA® e Jetson™ são marcas registradas da NVIDIA Corporation. Esta página é publicada pela Juxi Technology e não é uma publicação da NVIDIA.