In sintesi
Sembra una provocazione, ma è ciò che sta dimostrando Colibrì, un nuovo motore di inferenza scritto in C che permette di eseguire GLM-5.2 su una macchina consumer con circa 25 GB di RAM. Il punto interessante non è che siano improvvisamente spariti i requisiti
Scenario e contesto
Sembra una provocazione, ma è ciò che sta dimostrando Colibrì, un nuovo motore di inferenza scritto in C che permette di eseguire GLM-5.2 su una macchina consumer con circa 25 GB di RAM.
Il punto interessante non è che siano improvvisamente spariti i requisiti hardware. È cambiato il modo in cui viene gestita la memoria.
GLM-5.2 è un modello Mixture-of-Experts: possiede 744 miliardi di parametri complessivi, ma ne attiva circa 40 miliardi per ogni token. Colibrì mantiene in RAM la parte comune del modello e carica dal disco NVMe solo gli “esperti” necessari in quel momento.
In pratica, VRAM, RAM e SSD vengono trattati come un’unica gerarchia di memoria.
Implicazioni operative
Il risultato è tecnicamente notevole:
• nessuna GPU obbligatoria;
• circa 20 GB di RAM durante l’esecuzione;
• modello quantizzato INT4 da circa 370 GB su disco;
• inferenza completamente locale.
Ma attenzione all’hype: “può girare” non significa “può essere usato comodamente”.
Su una configurazione senza GPU e con cache fredda, il progetto dichiara circa 0,05–0,1 token al secondo. Significa attendere anche 10–20 secondi per un singolo token. Non è quindi un’alternativa pratica a ChatGPT o a un buon modello locale più piccolo.
La vera notizia è un’altra: l’inferenza locale non dipenderà soltanto dalla quantità di VRAM disponibile.
Cosa cambia per l'azienda
Architetture MoE, quantizzazione, streaming degli esperti e gestione intelligente della memoria stanno ampliando il numero di modelli eseguibili su hardware accessibile.
Per aziende e professionisti, il messaggio è chiaro: il futuro dell’AI locale non sarà necessariamente “un modello enorme su una GPU enorme”, ma la capacità di distribuire in modo efficiente il calcolo tra CPU, RAM, storage e acceleratori.
Colibrì oggi è soprattutto una dimostrazione tecnica. Ma indica una direzione molto concreta.
ai-academyitalia.it
Vuoi applicare l’AI alla tua azienda?
Partiamo da un caso d’uso concreto, misurabile e utile.
Possiamo analizzare processi, documenti e attività ripetitive per progettare una soluzione AI coerente con il tuo lavoro reale.
