TSL Automation Solutions logo
Technologie3 min leestijd

NPU, GPU of CPU: welke chip draait uw edge-AI-workload?

TSL Automation Solutions 17 augustus 2026 Bijgewerkt 18 aug. 2026
NPU-, GPU- en CPU-processors vergeleken voor edge-AI-inferentie in industriële computing
Delen

Inhoudsopgave

Waarom is de chipkeuze zo belangrijk?

Omdat edge-AI-budgetten inmiddels om echt geld gaan. De markt voor edge-AI-hardware bereikte 26,14 miljard dollar in 2025 en komt naar verwachting in 2030 uit op 58,90 miljard dollar, een CAGR van 17,6% (MarketsandMarkets, 2025). Kies een chip die te klein is en de lijn groeit er binnen een jaar overheen; kies te groot en u hebt GPU-geld betaald om flessen te tellen. Het goede nieuws: de drie klassen, CPU, NPU en GPU, verdelen de workloadruimte netter dan de marketing doet vermoeden.

Wanneer volstaat een gewone CPU?

Vaker dan leveranciers toegeven. Bescheiden modellen bij een bescheiden inschakelduur, barcodes lezen met af en toe OCR, een classificatie om de paar seconden, anomaliecontroles op sensordata, draaien acceptabel op dezelfde processoren uit de Atom- en Celeron-klasse die al in industriële box-pc's zitten, zoals de NUC-EHL. Geen extra hardware, geen nieuw thermisch ontwerp, geen tweede leverancier.

De hefboom die CPU's haalbaar maakt, is kwantisatie. De LiteRT-documentatie van Google meet hoe volledige INT8-kwantisatie MobileNet-v1 verkleint van 16,9 MB naar 4,3 MB, ruwweg 4x kleiner, terwijl de latency daalt van 124 ms naar 64 ms op dezelfde hardware (LiteRT-documentatie van Google). Als uw gekwantiseerde model zijn cyclustijd haalt op de CPU die u al bezit, bent u klaar: besteed de besparing elders.

Wat levert een NPU u nu echt op?

Aanhoudende inferentie zonder de watts. Een neural processing unit is een fixed-function-engine voor de multiply-accumulate-rekenkunde waaruit neurale netwerken bestaan, en actuele voorbeelden tonen de schaal: het Intel Core Ultra 200V-platform levert tot 120 platform-TOPS, waarvan de NPU 48 INT8-TOPS bijdraagt (Intel Newsroom, 2024; The Register, 2024). Aan de ARM-kant integreert Rockchip in de RK3588 een NPU van 6 TOPS die precisies van INT4 tot en met FP16 ondersteunt (Rockchip, officieel). Speciale acceleratormodules drijven de efficiëntie nog verder op: de Hailo-8 van Hailo levert 26 TOPS bij typisch 2,5 W (Hailo, officieel).

De praktische betekenis: een of enkele continue camerastreams, defectdetectie, aanwezigheidsbewaking, kwaliteitspoorten, die een hele ploegendienst draaien binnen een ventilatorloze thermische envelop. In ons assortiment is dat de Core Ultra-klasse: de box-pc EMS-ARH, de panel-pc APC-2146 en het board EMX-PTLP hebben alle een geïntegreerde NPU, en aan ARM-zijde brengt de ACP-3588 de 6 TOPS van de RK3588 naar het prijsniveau van een ventilatorloze SBC.

Wanneer hebt u een GPU nodig?

Wanneer het aantal streams of de modelgrootte de fixed-function-engines voorbijstreeft. De embedded Jetson Orin-lijn van NVIDIA illustreert het plafond: tot 275 TOPS bij 15 tot 60 W op AGX Orin, 157 TOPS op Orin NX, 67 TOPS op Orin Nano (NVIDIA, officieel). Discrete PCIe-GPU's gaan nog verder, bij honderden watts.

GPU's verdienen dat vermogensbudget in drie situaties: veel gelijktijdige streams die één systeem voeden, een AOI-station dat een stuk of twaalf camera's bewaakt; grote of niet-gekwantiseerde modellen, segmentatienetwerken, workloads van LLM-formaat; en snelle iteratie waarbij de softwarevolwassenheid van CUDA de ontwikkeling verkort. Het hardwarepatroon is een workstation met volwaardige PCIe-slots en koeling, in ons assortiment is dat de klasse HPS-ERSUTA, gespecificeerd met de GPU die uw framework nodig heeft.

Hoe beslist u nu echt?

Werk terug vanaf de lijn, niet vooruit vanaf TOPS. Tel de streams (één camera of twaalf), benoem de cyclustijd (een beslissing om de 50 ms of om de 5 s), bepaal de omvang van het model (een gekwantiseerde classifier of een segmentatienetwerk) en leg het budget voor de behuizing vast (afgesloten ventilatorloze kast of geventileerd rack). Dan: lichte belasting op één stream, CPU. Continue machine vision op één tot enkele streams binnen een ventilatorloze box, NPU. Veel streams of zware modellen met koeling beschikbaar, GPU.

En beschouw TOPS als een toegangsgetal, niet als een oordeel. Specificaties mengen precisies (INT8 tegenover FP16 verdubbelt het getal ruwweg), gaan uit van ideale benutting en zeggen niets over het geheugengedrag van uw model. De eerlijke test is uw model, gekwantiseerd zoals u het gaat uitleveren, op de kandidaat-hardware. Die dimensionering met de benchmark voorop is precies hoe wij het aanpakken in onze koopgids voor edge-AI-servers, en als de vraag edge of cloud nog openstaat, begin dan met onze vergelijking van edge en cloud. Geef ons uw aantal camera's en uw cyclustijd, dan stellen wij een shortlist samen van hardware waarop u kunt benchmarken.

Veelgestelde vragen

Een NPU is een engine met vaste functie voor neuraal-netwerkberekeningen, uiterst efficiënt bij aanhoudende inferentie: de huidige NPU van Intel levert 48 INT8 TOPS in een chip van laptopklasse, en de Hailo-8 haalt 26 TOPS bij ongeveer 2,5 W. GPU's zijn flexibeler en schalen hoger, de Jetson AGX Orin haalt 275 TOPS, maar tegen een hoger vermogen en hogere kosten.
Minder dan de marketing doet vermoeden. Een gekwantiseerde classifier op één stream kan op een cpu draaien; een 6 TOPS NPU zoals die van de RK3588 verwerkt continue single-stream vision; multi-stream AOI vereist al snel tientallen tot honderden TOPS. Benchmark uw daadwerkelijke gekwantiseerde model in plaats van te kopen op basis van een getal.
Ja, voor lichte workloads. Gegevens van Google's LiteRT tonen aan dat INT8-kwantisering modellen ongeveer 4x kleiner en 2x sneller maakt (MobileNet-v1: 16,9 MB naar 4,3 MB, 124 ms naar 64 ms), waardoor barcode-, OCR- en periodieke classificatieworkloads binnen bereik komen van industriële pc's van de Atom- en Celeron-klasse.
Het omzetten van modelgewichten van floating point naar 8-bit gehele getallen. Dit verkleint de modelgrootte met ongeveer 75% en verdubbelt ruwweg de snelheid met minimaal nauwkeurigheidsverlies, en hier zijn NPU's voor geoptimaliseerd. De meeste edge-implementaties moeten kwantiseren voordat ze grotere hardware aanschaffen.
De Core Ultra-generatie: de EMS-ARH modulaire box-pc, de APC-2146 panel-pc en het EMX-PTLP Thin Mini-ITX-bord beschikken alle over Intels geïntegreerde NPU, en de ACP-3588 SBC bevat de 6 TOPS NPU van de Rockchip RK3588. Voor inferentie op GPU-niveau accepteert het HPS-ERSUTA-werkstation discrete PCIe-kaarten.
Slechts in beperkte mate. Specificaties combineren INT8- en FP16-precisie (een verschil van ruwweg 2x), gaan uit van perfecte benutting en houden geen rekening met geheugenbandbreedte, die vaak juist de beperkende factor is voor echte modellen. Gebruik TOPS om een klasse hardware te selecteren en valideer vervolgens met uw eigen gekwantiseerde model op de doelchip.
Tags: NPU versus GPU NPU versus CPU hardware voor edge-AI-inferentie TOPS uitgelegd INT8-kwantisering edge-AI-accelerator RK3588 NPU Intel Core Ultra NPU GPU-inferentie op de edge keuze van AI-hardware hardware voor machine vision
Was dit nuttig? Deel het
T

TSL Automation Solutions

Hoofd Marketing, TSL Automation Solutions

Sanjana schrijft over trends in industriële automatisering, productlanceringen en technologische inzichten voor TSL Automation Solutions, een in Mumbai gevestigde distributeur van HMI, panel-pc en embedded computersystemen voor fabrikanten in India en wereldwijd.

Hulp nodig bij het kiezen van het juiste product?

Ons team in Mumbai adviseert u over de juiste HMI, panel-pc of het juiste embedded systeem voor uw toepassing.

Neem contact op met TSL Automation