
Perché oggi i budget per l'edge AI sono denaro vero. Il mercato dell'hardware per edge AI ha raggiunto 26,14 miliardi di dollari nel 2025 e si prevede che arrivi a 58,90 miliardi di dollari entro il 2030, con un CAGR del 17,6% (MarketsandMarkets, 2025). Se sceglie un silicio troppo piccolo, nel giro di un anno la linea lo supera; se lo sceglie troppo grande, ha pagato il prezzo di una GPU per contare bottiglie. La buona notizia: le tre classi, CPU, NPU e GPU, suddividono lo spazio dei carichi di lavoro in modo più netto di quanto suggerisca il marketing.
Più spesso di quanto i fornitori ammettano. Modelli contenuti con cicli di lavoro contenuti, lettura di codici a barre con OCR occasionale, una classificazione ogni pochi secondi, controlli di anomalia sui dati dei sensori, girano in modo accettabile sugli stessi processori di classe Atom e Celeron già presenti nei Box PC industriali come il NUC-EHL. Nessun hardware aggiuntivo, nessun nuovo progetto termico, nessun secondo fornitore.
La leva che rende praticabili le CPU è la quantizzazione. La documentazione LiteRT di Google misura una quantizzazione INT8 completa che riduce MobileNet-v1 da 16,9 MB a 4,3 MB, circa 4 volte più piccolo, abbassando al contempo la latenza da 124 ms a 64 ms sullo stesso hardware (documentazione Google LiteRT). Se il suo modello quantizzato rispetta il tempo di ciclo sulla CPU che già possiede, ha finito: investa il risparmio altrove.
Inferenza continua senza consumi elevati. Una unità di elaborazione neurale è un motore a funzione fissa per la matematica di moltiplicazione e accumulo di cui sono fatte le reti neurali, e gli esempi attuali mostrano l'ordine di grandezza: la piattaforma Intel Core Ultra 200V offre fino a 120 TOPS di piattaforma, di cui la NPU contribuisce con 48 TOPS INT8 (Intel Newsroom, 2024; The Register, 2024). Sul fronte ARM, l'RK3588 di Rockchip integra una NPU da 6 TOPS che supporta precisioni da INT4 a FP16 (Rockchip, ufficiale). I moduli acceleratori dedicati spingono ancora oltre l'efficienza: l'Hailo-8 di Hailo dichiara 26 TOPS con un consumo tipico di 2,5 W (Hailo, ufficiale).
Il significato pratico: uno o pochi flussi video continui, rilevamento difetti, monitoraggio della presenza, controlli qualità, in funzione per tutto il turno all'interno di un involucro termico senza ventola. Nel nostro catalogo questa è la classe Core Ultra: il Box PC EMS-ARH, il Panel PC APC-2146 e la scheda EMX-PTLP integrano tutti una NPU e, in ambito ARM, l'ACP-3588 porta i 6 TOPS dell'RK3588 al livello di prezzo di un single board computer (SBC) senza ventola.
Quando il numero di flussi o la dimensione del modello superano le capacità dei motori a funzione fissa. La linea embedded Jetson Orin di NVIDIA illustra il limite superiore: fino a 275 TOPS con un consumo da 15 a 60 W su AGX Orin, 157 TOPS su Orin NX, 67 TOPS su Orin Nano (NVIDIA, ufficiale). Le GPU PCIe discrete vanno ancora oltre, con centinaia di watt.
Le GPU giustificano quel budget energetico in tre situazioni: molti flussi simultanei che alimentano un unico sistema, come una stazione AOI che sorveglia una dozzina di telecamere; modelli grandi o non quantizzati, reti di segmentazione, carichi di lavoro di classe LLM; e iterazione rapida, dove la maturità software di CUDA accorcia lo sviluppo. Lo schema hardware è una workstation con slot PCIe adeguati e un raffreddamento adeguato: nella nostra gamma è la classe HPS-ERSUTA, configurata con la GPU richiesta dal suo framework.
Ragioni a ritroso partendo dalla linea, non in avanti partendo dai TOPS. Conti i flussi (una telecamera o dodici), definisca il tempo di ciclo (una decisione ogni 50 ms oppure ogni 5 s), dimensioni il modello (un classificatore quantizzato o una rete di segmentazione) e fissi il budget di contenitore (armadio sigillato senza ventola o rack ventilato). Poi: servizio leggero su un solo flusso, CPU. Visione continua su uno o pochi flussi dentro un box senza ventola, NPU. Molti flussi o modelli pesanti con raffreddamento disponibile, GPU.
E consideri i TOPS un numero di accesso, non un verdetto. Le valutazioni mescolano precisioni diverse (INT8 rispetto a FP16 raddoppia all'incirca il valore), presuppongono un utilizzo ideale e non dicono nulla sul comportamento in memoria del suo modello. La prova onesta è il suo modello, quantizzato come lo metterà in produzione, sull'hardware candidato. Questo dimensionamento basato prima di tutto sul benchmark è esattamente l'approccio che adottiamo nella nostra guida all'acquisto di server edge AI e, se la questione edge o cloud è ancora aperta, inizi dal nostro confronto tra edge e cloud. Ci comunichi il numero di telecamere e il tempo di ciclo e selezioneremo l'hardware su cui potrà eseguire i suoi benchmark.
TSL Automation Solutions
Responsabile marketing, TSL Automation Solutions
Sanjana si occupa di tendenze dell'automazione industriale, lanci di prodotto e approfondimenti tecnologici per TSL Automation Solutions, distributore con sede a Mumbai di HMI, Panel PC e sistemi di computing embedded al servizio dei produttori in India e nel mondo.
Il nostro team di Mumbai può consigliarle l'HMI, il Panel PC o il sistema embedded giusto per la sua applicazione.
Contatti TSL Automation