Scenario e contesto

Sembra una provocazione, ma è ciò che sta dimostrando Colibrì, un nuovo motore di inferenza scritto in C che permette di eseguire GLM-5.2 su una macchina consumer con circa 25 GB di RAM.

Il punto interessante non è che siano improvvisamente spariti i requisiti hardware. È cambiato il modo in cui viene gestita la memoria.

GLM-5.2 è un modello Mixture-of-Experts: possiede 744 miliardi di parametri complessivi, ma ne attiva circa 40 miliardi per ogni token. Colibrì mantiene in RAM la parte comune del modello e carica dal disco NVMe solo gli “esperti” necessari in quel momento.

In pratica, VRAM, RAM e SSD vengono trattati come un’unica gerarchia di memoria.

Implicazioni operative

Il risultato è tecnicamente notevole:
• nessuna GPU obbligatoria;
• circa 20 GB di RAM durante l’esecuzione;
• modello quantizzato INT4 da circa 370 GB su disco;
• inferenza completamente locale.

Ma attenzione all’hype: “può girare” non significa “può essere usato comodamente”.

Su una configurazione senza GPU e con cache fredda, il progetto dichiara circa 0,05–0,1 token al secondo. Significa attendere anche 10–20 secondi per un singolo token. Non è quindi un’alternativa pratica a ChatGPT o a un buon modello locale più piccolo.

La vera notizia è un’altra: l’inferenza locale non dipenderà soltanto dalla quantità di VRAM disponibile.

Cosa cambia per l'azienda

Architetture MoE, quantizzazione, streaming degli esperti e gestione intelligente della memoria stanno ampliando il numero di modelli eseguibili su hardware accessibile.

Per aziende e professionisti, il messaggio è chiaro: il futuro dell’AI locale non sarà necessariamente “un modello enorme su una GPU enorme”, ma la capacità di distribuire in modo efficiente il calcolo tra CPU, RAM, storage e acceleratori.

Colibrì oggi è soprattutto una dimostrazione tecnica. Ma indica una direzione molto concreta.

ai-academyitalia.it