2

NVIDIA rende più semplice l'IA locale su RTX con Hermes, OpenClaw e Perplexity

Tre applicazioni riducono la configurazione richiesta per usare modelli locali, mentre llama.cpp e vLLM ricevono nuove ottimizzazioni con guadagni fino a 1,9 volte.

NOTIZIA di Simone Lelli   —   03/09/2026
NVIDIA Local AI

Installare un agente IA in locale significa ancora dover scegliere il modello, trovare un motore di inferenza compatibile, configurare la quantizzazione e occuparsi degli aggiornamenti. NVIDIA sta lavorando con alcuni dei progetti più utilizzati per eliminare buona parte di questi passaggi e rendere l'avvio di un modello locale più vicino all'installazione di una normale applicazione.

Le prime soluzioni coinvolte sono Hermes Agent, OpenClaw e Perplexity Portable Computer. Tutte utilizzeranno llama.cpp e le ottimizzazioni NVIDIA per semplificare la configurazione sui sistemi compatibili.

Perplexity Portable Computer arriverà a settembre sulle GPU NVIDIA RTX con almeno 24 GB di VRAM, sia su Windows sia su Linux. Il software permette di eseguire interi flussi di lavoro direttamente sul computer senza consumare crediti e, quando necessario, può affidare parti del lavoro a oltre 15 modelli frontier disponibili nel cloud.

Il passaggio al cloud non avviene senza controllo: prima di inviare contenuti verso l'esterno, Portable Computer deve chiedere il permesso all'utente. Questo consente, per esempio, di analizzare localmente documenti finanziari o dati aziendali e ricorrere ai servizi online soltanto quando servono ricerca o capacità di ragionamento aggiuntive.

Hermes sceglierà automaticamente modello e configurazione

Hermes Agent, sviluppato da Nous Research, riceverà una procedura di configurazione locale con un solo clic sui sistemi RTX e DGX con Windows e Linux. Il programma rileverà automaticamente la GPU NVIDIA presente nel computer, sceglierà un modello e una configurazione adeguati e utilizzerà llama.cpp integrato con le ottimizzazioni NVIDIA.

L'utente non dovrà quindi occuparsi manualmente del download del modello o della regolazione dei principali parametri. Una volta avviato, Hermes continuerà a utilizzare strumenti, conservare il contesto delle attività, ricordare informazioni tra una sessione e l'altra e creare skill riutilizzabili nel tempo.

OpenClaw sta seguendo una strada simile: NVIDIA, Microsoft e il team del progetto stanno collaborando sulla versione Windows dell'applicazione, che semplificherà la configurazione di un modello locale ottimizzato sulle RTX dotate di almeno 24 GB di VRAM. NVIDIA definisce OpenClaw il più grande progetto dedicato all'IA presente su GitHub, con oltre 380.000 stelle al momento della pubblicazione del documento.

llama.cpp raggiunge un throughput fino a 1,9 volte superiore

NVIDIA, inoltre, continua a collaborare con le community di llama.cpp e vLLM per migliorare l'inferenza sulle proprie piattaforme. Su una GeForce RTX 5090, le ultime ottimizzazioni di llama.cpp consentono di raggiungere un throughput fino a 1,9 volte superiore. NVIDIA attribuisce il risultato agli interventi sui kernel, alle nuove tecniche di speculative decoding e a un prefill più rapido.

vLLM mostra invece un incremento di 1,2 volte sulla RTX PRO 6000 Blackwell Workstation Edition e fino a 1,4 volte utilizzando due sistemi DGX Spark. In questo caso intervengono nuovi kernel XQA dedicati all'attenzione in FlashInfer insieme ad altre ottimizzazioni del backend. I miglioramenti sono già accessibili attraverso LM Studio, Ollama, llama.cpp e vLLM.

Alcune statistiche dei test
Alcune statistiche dei test

NVIDIA ha sfruttato l'occasione anche per riassumere diversi modelli locali arrivati nelle ultime settimane. Tra questi figurano Nemotron 3.5 Lightning da 30 miliardi di parametri, GLM-5.3-Flash di Z.ai, Qwen3.8-Flash-Next e Qwen3.8-27B, oltre al modello video LTX 2.5.

La lista comprende anche MiniMax-H3 per la generazione video con audio sincronizzato, Muse Glimmer di Meta per coding e attività svolte dagli agenti e DeepSeek v4 Flash, un modello Mixture-of-Experts da 284 miliardi di parametri totali e 13 miliardi attivi eseguibile localmente su DGX Station.

Aggiungici come fonte preferita su Google
Questo contenuto potrebbe includere link affiliati che generano commissioni.
Per conoscere i dettagli della nostra policy editoriale, è disponibile la pagina etica.