Logo TSL Automation Solutions
Tecnologia4 min di lettura

NPU, GPU o CPU: quale chip per il suo carico di lavoro edge AI?

TSL Automation Solutions 17 agosto 2026 Aggiornato il 18 ago 2026
Confronto tra processori NPU, GPU e CPU per carichi di lavoro di inferenza edge AI nell'informatica industriale
Condividi

Indice dei contenuti

Perché la scelta del silicio è così importante?

Perché oggi i budget per l'edge AI sono denaro vero. Il mercato dell'hardware per edge AI ha raggiunto 26,14 miliardi di dollari nel 2025 e si prevede che arrivi a 58,90 miliardi di dollari entro il 2030, con un CAGR del 17,6% (MarketsandMarkets, 2025). Se sceglie un silicio troppo piccolo, nel giro di un anno la linea lo supera; se lo sceglie troppo grande, ha pagato il prezzo di una GPU per contare bottiglie. La buona notizia: le tre classi, CPU, NPU e GPU, suddividono lo spazio dei carichi di lavoro in modo più netto di quanto suggerisca il marketing.

Quando basta una semplice CPU?

Più spesso di quanto i fornitori ammettano. Modelli contenuti con cicli di lavoro contenuti, lettura di codici a barre con OCR occasionale, una classificazione ogni pochi secondi, controlli di anomalia sui dati dei sensori, girano in modo accettabile sugli stessi processori di classe Atom e Celeron già presenti nei Box PC industriali come il NUC-EHL. Nessun hardware aggiuntivo, nessun nuovo progetto termico, nessun secondo fornitore.

La leva che rende praticabili le CPU è la quantizzazione. La documentazione LiteRT di Google misura una quantizzazione INT8 completa che riduce MobileNet-v1 da 16,9 MB a 4,3 MB, circa 4 volte più piccolo, abbassando al contempo la latenza da 124 ms a 64 ms sullo stesso hardware (documentazione Google LiteRT). Se il suo modello quantizzato rispetta il tempo di ciclo sulla CPU che già possiede, ha finito: investa il risparmio altrove.

Che cosa le offre davvero una NPU?

Inferenza continua senza consumi elevati. Una unità di elaborazione neurale è un motore a funzione fissa per la matematica di moltiplicazione e accumulo di cui sono fatte le reti neurali, e gli esempi attuali mostrano l'ordine di grandezza: la piattaforma Intel Core Ultra 200V offre fino a 120 TOPS di piattaforma, di cui la NPU contribuisce con 48 TOPS INT8 (Intel Newsroom, 2024; The Register, 2024). Sul fronte ARM, l'RK3588 di Rockchip integra una NPU da 6 TOPS che supporta precisioni da INT4 a FP16 (Rockchip, ufficiale). I moduli acceleratori dedicati spingono ancora oltre l'efficienza: l'Hailo-8 di Hailo dichiara 26 TOPS con un consumo tipico di 2,5 W (Hailo, ufficiale).

Il significato pratico: uno o pochi flussi video continui, rilevamento difetti, monitoraggio della presenza, controlli qualità, in funzione per tutto il turno all'interno di un involucro termico senza ventola. Nel nostro catalogo questa è la classe Core Ultra: il Box PC EMS-ARH, il Panel PC APC-2146 e la scheda EMX-PTLP integrano tutti una NPU e, in ambito ARM, l'ACP-3588 porta i 6 TOPS dell'RK3588 al livello di prezzo di un single board computer (SBC) senza ventola.

Quando serve una GPU?

Quando il numero di flussi o la dimensione del modello superano le capacità dei motori a funzione fissa. La linea embedded Jetson Orin di NVIDIA illustra il limite superiore: fino a 275 TOPS con un consumo da 15 a 60 W su AGX Orin, 157 TOPS su Orin NX, 67 TOPS su Orin Nano (NVIDIA, ufficiale). Le GPU PCIe discrete vanno ancora oltre, con centinaia di watt.

Le GPU giustificano quel budget energetico in tre situazioni: molti flussi simultanei che alimentano un unico sistema, come una stazione AOI che sorveglia una dozzina di telecamere; modelli grandi o non quantizzati, reti di segmentazione, carichi di lavoro di classe LLM; e iterazione rapida, dove la maturità software di CUDA accorcia lo sviluppo. Lo schema hardware è una workstation con slot PCIe adeguati e un raffreddamento adeguato: nella nostra gamma è la classe HPS-ERSUTA, configurata con la GPU richiesta dal suo framework.

Come decidere concretamente?

Ragioni a ritroso partendo dalla linea, non in avanti partendo dai TOPS. Conti i flussi (una telecamera o dodici), definisca il tempo di ciclo (una decisione ogni 50 ms oppure ogni 5 s), dimensioni il modello (un classificatore quantizzato o una rete di segmentazione) e fissi il budget di contenitore (armadio sigillato senza ventola o rack ventilato). Poi: servizio leggero su un solo flusso, CPU. Visione continua su uno o pochi flussi dentro un box senza ventola, NPU. Molti flussi o modelli pesanti con raffreddamento disponibile, GPU.

E consideri i TOPS un numero di accesso, non un verdetto. Le valutazioni mescolano precisioni diverse (INT8 rispetto a FP16 raddoppia all'incirca il valore), presuppongono un utilizzo ideale e non dicono nulla sul comportamento in memoria del suo modello. La prova onesta è il suo modello, quantizzato come lo metterà in produzione, sull'hardware candidato. Questo dimensionamento basato prima di tutto sul benchmark è esattamente l'approccio che adottiamo nella nostra guida all'acquisto di server edge AI e, se la questione edge o cloud è ancora aperta, inizi dal nostro confronto tra edge e cloud. Ci comunichi il numero di telecamere e il tempo di ciclo e selezioneremo l'hardware su cui potrà eseguire i suoi benchmark.

Domande frequenti

Un NPU è un motore a funzione fissa per il calcolo delle reti neurali, estremamente efficiente nell'inferenza sostenuta: l'attuale NPU Intel offre 48 TOPS INT8 all'interno di un chip di classe laptop, mentre l'Hailo-8 raggiunge 26 TOPS a circa 2,5 W. Le GPU sono più flessibili e scalano più in alto, il Jetson AGX Orin raggiunge 275 TOPS, ma con maggiore consumo e costo.
Meno di quanto il marketing lasci intendere. Un classificatore quantizzato su un singolo stream può funzionare su una CPU; un NPU da 6 TOPS come quello dell'RK3588 gestisce la visione continua a singolo stream; l'AOI multi-stream spinge verso decine o centinaia di TOPS. Esegui il benchmark del tuo modello quantizzato reale, invece di acquistare in base a un numero.
Sì, per carichi di lavoro leggeri. I dati LiteRT di Google mostrano che la quantizzazione INT8 rende i modelli circa 4 volte più piccoli e 2 volte più veloci (MobileNet-v1: da 16,9 MB a 4,3 MB, da 124 ms a 64 ms), il che rende raggiungibili i carichi di lavoro di lettura codici a barre, OCR e classificazione periodica anche per PC industriali di classe Atom e Celeron.
La conversione dei pesi del modello da floating point a interi a 8 bit. Riduce le dimensioni del modello di circa il 75% e ne raddoppia approssimativamente la velocità con una perdita minima di precisione, ed è ciò per cui gli NPU sono ottimizzati. Nella maggior parte delle installazioni edge conviene quantizzare prima di acquistare hardware più potente.
La generazione Core Ultra: il Box PC modulare EMS-ARH, il Panel PC APC-2146 e la scheda Thin Mini-ITX EMX-PTLP includono tutti l'NPU integrato di Intel, mentre l'SBC ACP-3588 monta l'NPU da 6 TOPS del Rockchip RK3588. Per l'inferenza di classe GPU, la workstation HPS-ERSUTA accetta schede PCIe discrete.
Solo in modo approssimativo. Le specifiche mescolano precisione INT8 e FP16 (una differenza di circa 2 volte), presuppongono un utilizzo perfetto e ignorano la larghezza di banda della memoria, che spesso limita i modelli reali. Usa i TOPS per selezionare una classe di hardware, poi valida con il tuo modello quantizzato sul silicio target.
Tag: NPU vs GPU NPU vs CPU hardware per inferenza edge AI TOPS spiegato quantizzazione INT8 acceleratore edge AI NPU RK3588 NPU Intel Core Ultra inferenza GPU edge selezione hardware AI hardware per visione artificiale
Le è stato utile? Lo condivida
T

TSL Automation Solutions

Responsabile marketing, TSL Automation Solutions

Sanjana si occupa di tendenze dell'automazione industriale, lanci di prodotto e approfondimenti tecnologici per TSL Automation Solutions, distributore con sede a Mumbai di HMI, Panel PC e sistemi di computing embedded al servizio dei produttori in India e nel mondo.

Ha bisogno di aiuto per scegliere il prodotto giusto?

Il nostro team di Mumbai può consigliarle l'HMI, il Panel PC o il sistema embedded giusto per la sua applicazione.

Contatti TSL Automation