Os usuários Windows com RTX GPUs agora podem executar mais agentes de AI localmente, cortando a fricção de configuração e mantendo o trabalho sensível fora da nuvem. NVIDIA, Microsoft e vários parceiros de software expandiram o suporte para executar agentes de IA localmente no hardware NVIDIA, ao lado de novos PCs Windows na linha RTX Spark. Os anúncios focam na instalação mais fácil para software agente local, inferência mais rápida em ferramentas de código aberto amplamente usadas, e uma nova camada de software chamada NVIDIA PAIR, que distribui trabalhos de inferência em vários PCs em uma rede local. Três aplicativos de agentes estão adicionando configuração simplificada de modelos locais nos sistemas Windows com GPUs NVIDIA: Hermes Agent, OpenClaw e Computador Portátil Perplexidade. As alterações são destinadas a reduzir a configuração manual necessária anteriormente para escolher modelos, compará- los com servidores de inferência e configurações de sintonia para uso local. Hermes Agent, desenvolvido pela Nous Research, oferecerá uma configuração local de um clique em sistemas RTX e DGX no Windows. O software é projetado para detectar o GPU instalado do NVIDIA, escolher um modelo e configuração, e executá- lo através de uma versão integrada do lama.cpp com otimizações do NVIDIA já aplicadas. Uma vez instalado, o Hermes é destinado a manter o contexto entre as tarefas, manter a informação entre as sessões e construir habilidades reutilizáveis ao longo do tempo. O suporte Linux para a configuração simplificada é devido mais tarde. OpenClaw também está adicionando um processo de configuração Windows simplificado para modelos locais em GPUs RTX com pelo menos 24 GB de VRAM.

O projeto construiu um grande código aberto de seguindo, e NVIDIA, Microsoft e OpenClaw disseram que trabalharam juntos no aplicativo Windows para reduzir barreiras para usuários que instalam modelos locais. Computador portátil de perplexidade, que já funciona localmente em sistemas Linux incluindo DGX Spark, também está sendo estendido para GPUs RTX NVIDIA com pelo menos 24 GB de VRAM. O suporte ao Windows é devido mais tarde, trazendo a mesma abordagem em pacotes para modelos, orquestração e ferramentas para uma base de usuário mais ampla do PC. O software permite que os usuários mantenham os fluxos de trabalho completos no dispositivo enquanto enviam tarefas selecionadas para modelos de nuvem se for necessário pesquisa ou raciocínio adicionais. Ele pede permissão antes de o conteúdo ser enviado para a nuvem, visando ajudar os usuários a manter material sensível em seus próprios dispositivos. NVIDIA também está visando o desempenho na pilha de inferência de código aberto. Novo trabalho com as comunidades lama.cpp e vLLM melhorou o rendimento para cargas de trabalho dos agentes locais em sistemas GeForce RTX, RTX Pro e DGX. No lama.cpp, as últimas atualizações entregam até 1.9 vezes maior rendimento em um GeForce RTX 5090 através de alterações no kernel, melhorias na decodificação especulativa e pré- preenchimento mais rápido. Em vLLM, o rendimento aumenta por 1.2 vezes em um RTX Pro 6000 Blackwell Workstation Edition e tanto quanto 1.4 vezes em dois clusters de Spark DGX. Esses ganhos estão disponíveis diretamente nas inferências e através de aplicativos, incluindo o LM Studio e o Ollama.

O foco no llamam.cpp e vLLM reflete seu crescente uso entre desenvolvedores e entusiastas executando modelos de linguagem localmente em vez de em ambientes hospedados. O novo software NVIDIA PAIR está dirigido a usuários com mais de uma máquina na mesma rede. PAIR, abreviado para o router pessoal IA, identifica automaticamente PCs compatíveis e encaminha pedidos de inferência separados para qualquer sistema que tenha capacidade disponível. O software funciona com Ollama e LM Studio e está disponível em beta para Windows, macOS e Linux. hardware suportado inclui GeForce RTX 20 Série GPUs e mais recentes, RTX Pro GPUs de estação de trabalho baseados na arquitetura Turing e mais tarde, sistemas DGX Spark, e Apple M 4 ou silício mais novo. NVIDIA posicionou a ferramenta como uma forma de usar recursos de computação inacessíveis em casas e escritórios pequenos onde vários PCs ficam subutilizados para partes do dia. Na prática, um agente quebrando uma tarefa em tarefas menores pode espaçá- las em várias máquinas em vez de esperar por uma GPU para processar cada pedido em sequência. O push local da IA está ligado aos próximos PCs RTX Spark Windows da NVIDIA, que chegarão em outubro através de parceiros de hardware, incluindo Lenovo e Acer. Desenhos compactos de computadores e laptops já foram adicionados à linha de lançamento agendada para lançamento. Lenovo anunciou o Yoga Pro 9 n e Yoga 9 n 2 - em- 1, enquanto o Acer tem mostrado um conceito compacto de área de trabalho. NVIDIA disse que os sistemas são construídos em torno de um projeto de GPU Blackwell e CPU Grace destinado a suportar criadores, jogadores e agentes IA locais na mesma máquina.

NVIDIA também disse que editores de jogos, incluindo Electronic Arts, Embark e Ubisoft estão entre aqueles que trazem títulos para os sistemas RTX Spark, adicionando a uma lista divulgada anteriormente. CyberLink está entre as empresas de software que alinham suporte para RTX Spark. O modo de PC AI do seu PhotoDirector irá integrar modelos de difusão de imagens no PhotoDirector 365 para tarefas incluindo edição de imagens, realce, remoção de objetos e substituição de fundo, com usuários capazes de escolher entre processamento local e nuvem. Na NVIDIA GPUs, o software usa TensorRT-RTX e FP 8 para o processamento local de IA. A adição sublinha o esforço mais amplo da NVIDIA para ligar o uso local da IA não apenas para software de codificação e agente, mas também para aplicativos criativos de consumo. O fundo mais amplo é um crescente empurrão da indústria para mover cargas de trabalho mais gerativas de IA dos serviços na nuvem para dispositivos locais, especialmente para usuários preocupados com privacidade, latência e custos de uso contínuos. Os últimos movimentos da NVIDIA mostram que está tentando fortalecer a camada de software em torno de suas GPUs, à medida que a concorrência aumenta sobre onde as cargas de trabalho da AI são executadas. Mais da metade dos domicílios dos EUA tem dois ou mais PCs, de acordo com a NVIDIA, e grande parte desse poder de computação permanece inactivo durante o dia.