Logo TSL Automation Solutions
Technologie4 min de lecture

NPU, GPU ou CPU : quelle puce pour votre charge d'IA embarquée ?

TSL Automation Solutions 17 août 2026 Mis à jour le 18 août 2026
Comparaison des processeurs NPU, GPU et CPU pour les charges d'inférence d'IA embarquée en informatique industrielle
Partager

Sommaire

Pourquoi le choix du silicium compte-t-il autant ?

Parce que les budgets d'IA embarquée représentent aujourd'hui de vraies sommes. Le marché du matériel d'edge AI a atteint 26,14 milliards de dollars en 2025 et devrait atteindre 58,90 milliards de dollars d'ici 2030, soit un TCAC de 17,6 % (MarketsandMarkets, 2025). Choisissez un silicium trop petit et la ligne le dépassera en un an ; trop grand, et vous aurez payé le prix d'un GPU pour compter des bouteilles. La bonne nouvelle : les trois classes, CPU, NPU et GPU, découpent l'espace des charges de travail plus nettement que ne le laisse entendre le marketing.

Quand un simple CPU suffit-il ?

Plus souvent que les fournisseurs ne l'admettent. Des modèles modestes à taux d'utilisation modeste, la lecture de codes-barres avec de l'OCR occasionnel, une classification toutes les quelques secondes, des contrôles d'anomalies sur des données de capteurs, s'exécutent correctement sur les mêmes processeurs de classe Atom et Celeron déjà présents dans les Box PC industriels comme le NUC-EHL. Pas de matériel supplémentaire, pas de nouvelle conception thermique, pas de second fournisseur.

Le levier qui rend les CPU viables, c'est la quantification. La documentation LiteRT de Google mesure qu'une quantification INT8 complète fait passer MobileNet-v1 de 16,9 MB à 4,3 MB, soit environ 4 fois moins, tout en réduisant la latence de 124 ms à 64 ms sur le même matériel (documentation Google LiteRT). Si votre modèle quantifié respecte son temps de cycle sur le CPU que vous possédez déjà, c'est terminé : dépensez les économies ailleurs.

Qu'apporte réellement un NPU ?

De l'inférence soutenue sans les watts. Une unité de traitement neuronal est un moteur à fonction figée dédié aux multiplications-accumulations dont sont faits les réseaux de neurones, et les exemples actuels donnent l'échelle : la plateforme Intel Core Ultra 200V délivre jusqu'à 120 TOPS au niveau plateforme, dont 48 TOPS INT8 apportés par le NPU (Intel Newsroom, 2024 ; The Register, 2024). Côté ARM, le RK3588 de Rockchip intègre un NPU de 6 TOPS prenant en charge les précisions de INT4 à FP16 (Rockchip, officiel). Les modules accélérateurs dédiés poussent l'efficacité encore plus loin : le Hailo-8 de Hailo est annoncé à 26 TOPS pour 2,5 W typiques (Hailo, officiel).

Concrètement : un ou quelques flux caméra continus, détection de défauts, contrôle de présence, portes qualité, fonctionnant toute l'équipe dans une enveloppe thermique sans ventilateur. Dans notre catalogue, c'est la classe Core Ultra : le Box PC EMS-ARH, le Panel PC APC-2146 et la carte EMX-PTLP embarquent tous des NPU intégrés, et côté ARM, l'ACP-3588 amène les 6 TOPS du RK3588 au prix d'un ordinateur monocarte (SBC) sans ventilateur.

Quand avez-vous besoin d'un GPU ?

Lorsque le nombre de flux ou la taille du modèle dépasse les moteurs à fonction figée. La gamme embarquée NVIDIA Jetson Orin illustre le plafond : jusqu'à 275 TOPS pour 15 à 60 W sur AGX Orin, 157 TOPS sur Orin NX, 67 TOPS sur Orin Nano (NVIDIA, officiel). Les GPU PCIe dédiés vont encore plus loin, pour plusieurs centaines de watts.

Les GPU justifient ce budget énergétique dans trois situations : de nombreux flux simultanés alimentant un même système, par exemple un poste AOI surveillant une douzaine de caméras ; des modèles volumineux ou non quantifiés, réseaux de segmentation, charges de type LLM ; et l'itération rapide, où la maturité logicielle de CUDA raccourcit les développements. Le schéma matériel correspondant est une station de travail dotée de véritables emplacements PCIe et d'un refroidissement adapté : dans notre gamme, c'est la classe HPS-ERSUTA, spécifiée avec le GPU dont votre framework a besoin.

Comment décider concrètement ?

Raisonnez à rebours depuis la ligne, et non en partant des TOPS. Comptez les flux (une caméra ou douze), énoncez le temps de cycle (une décision toutes les 50 ms ou toutes les 5 s), dimensionnez le modèle (un classifieur quantifié ou un réseau de segmentation) et fixez le budget de boîtier (armoire scellée sans ventilateur ou baie ventilée). Ensuite : service léger sur un seul flux, CPU. Vision continue sur un à quelques flux dans un boîtier sans ventilateur, NPU. Beaucoup de flux ou des modèles lourds avec refroidissement disponible, GPU.

Et considérez les TOPS comme un chiffre d'entrée, pas comme un verdict. Les valeurs annoncées mélangent les précisions (INT8 contre FP16 double à peu près le compte), supposent une utilisation idéale et ne disent rien du comportement mémoire de votre modèle. Le test honnête, c'est votre modèle, quantifié tel que vous le livrerez, sur le matériel candidat. Ce dimensionnement par le banc d'essai d'abord est exactement notre approche dans notre guide d'achat des serveurs edge IA, et si la question périphérie ou cloud reste ouverte, commencez par notre comparaison edge contre cloud. Donnez-nous votre nombre de caméras et votre temps de cycle, et nous présélectionnerons du matériel que vous pourrez mettre à l'épreuve.

Questions fréquentes

Un NPU est un moteur à fonction fixe pour les calculs de réseaux neuronaux, extrêmement efficace pour l'inférence soutenue : le NPU actuel d'Intel offre 48 TOPS INT8 dans une puce de classe portable, et le Hailo-8 atteint 26 TOPS pour environ 2,5 W. Les GPU sont plus flexibles et montent plus haut, le Jetson AGX Orin atteignant 275 TOPS, mais avec une consommation et un coût plus élevés.
Moins que ce que le marketing laisse entendre. Un classificateur quantifié sur un seul flux peut fonctionner sur un CPU ; un NPU de 6 TOPS comme celui du RK3588 gère la vision en continu sur un seul flux ; l'AOI multi-flux nécessite plutôt des dizaines à des centaines de TOPS. Évaluez les performances de votre modèle quantifié réel plutôt que d'acheter un chiffre.
Oui, pour les charges de travail légères. Les données LiteRT de Google montrent que la quantification INT8 rend les modèles environ 4 fois plus petits et 2 fois plus rapides (MobileNet-v1 : de 16,9 Mo à 4,3 Mo, de 124 ms à 64 ms), ce qui met les charges de travail de lecture de codes-barres, d'OCR et de classification périodique à la portée des PC industriels de classe Atom et Celeron.
La conversion des poids du modèle de la virgule flottante vers des entiers 8 bits. Cela réduit la taille du modèle d'environ 75% et double approximativement la vitesse avec une perte de précision minimale, et c'est ce pour quoi les NPU sont optimisés. La plupart des déploiements en périphérie devraient quantifier avant d'acheter du matériel plus puissant.
La génération Core Ultra : le Box PC modulaire EMS-ARH, le Panel PC APC-2146 et la carte Thin Mini-ITX EMX-PTLP intègrent tous le NPU intégré d'Intel, et le SBC ACP-3588 embarque le NPU 6 TOPS du Rockchip RK3588. Pour une inférence de classe GPU, la station de travail HPS-ERSUTA accepte des cartes PCIe dédiées.
Seulement de façon approximative. Les valeurs annoncées mélangent les précisions INT8 et FP16 (un écart d'environ 2x), supposent une utilisation parfaite, et ignorent la bande passante mémoire, qui limite souvent les modèles réels. Utilisez les TOPS pour présélectionner une catégorie de matériel, puis validez avec votre propre modèle quantifié sur le silicium cible.
Mots-clés : NPU vs GPU NPU vs CPU matériel d'inférence IA embarquée TOPS expliqué quantification INT8 accélérateur IA embarquée NPU RK3588 NPU Intel Core Ultra inférence GPU en périphérie sélection du matériel IA matériel de vision industrielle
Cet article vous a été utile ? Partagez-le
T

TSL Automation Solutions

Responsable marketing, TSL Automation Solutions

Sanjana couvre les tendances de l'automatisation industrielle, les lancements de produits et les analyses technologiques pour TSL Automation Solutions, distributeur basé à Mumbai d'IHM, de Panel PC et de systèmes informatiques embarqués au service des industriels en Inde et dans le monde.

Besoin d'aide pour choisir le bon produit ?

Notre équipe à Mumbai peut vous recommander l'IHM, le Panel PC ou le système embarqué adapté à votre application.

Contacter TSL Automation