Logo TSL Automation Solutions
Technologia3 min czytania

NPU, GPU czy CPU? Który układ powinien obsłużyć zadania edge AI

TSL Automation Solutions 17 sierpnia 2026 Zaktualizowano 18 sie 2026
Porównanie procesorów NPU, GPU i CPU do obciążeń wnioskowania edge AI w komputerach przemysłowych
Udostępnij

Spis treści

Dlaczego wybór układu scalonego ma tak duże znaczenie?

Ponieważ budżety na edge AI to dziś realne pieniądze. Rynek sprzętu edge AI osiągnął 26,14 miliarda dolarów w 2025 roku i według prognoz sięgnie 58,90 miliarda dolarów do 2030 roku, przy CAGR na poziomie 17,6% (MarketsandMarkets, 2025). Jeżeli wybiorą Państwo zbyt słaby układ, linia przerośnie go w rok, a jeżeli zbyt mocny, zapłacą Państwo cenę GPU za liczenie butelek. Dobra wiadomość: te trzy klasy, CPU, NPU i GPU, dzielą przestrzeń obciążeń czyściej, niż sugeruje marketing.

Kiedy wystarczy zwykły procesor CPU?

Częściej, niż przyznają dostawcy. Skromne modele przy skromnych cyklach pracy, odczyt kodów kreskowych z okazjonalnym OCR, klasyfikacja co kilka sekund, kontrola anomalii w danych z czujników, działają akceptowalnie na tych samych procesorach klasy Atom i Celeron, które już znajdują się w przemysłowych komputerach typu box, takich jak NUC-EHL. Bez dodatkowego sprzętu, bez nowego projektu termicznego, bez drugiego dostawcy.

Dźwignią, która czyni procesory CPU realną opcją, jest kwantyzacja. Dokumentacja Google LiteRT podaje, że pełna kwantyzacja INT8 zmniejsza MobileNet-v1 z 16,9 MB do 4,3 MB, czyli około czterokrotnie, a jednocześnie skraca opóźnienie ze 124 ms do 64 ms na tym samym sprzęcie (dokumentacja Google LiteRT). Jeżeli Państwa skwantyzowany model mieści się w czasie cyklu na procesorze, który już Państwo mają, sprawa jest zamknięta, a zaoszczędzone środki można przeznaczyć na coś innego.

Co faktycznie daje NPU?

Ciągłe wnioskowanie bez wysokiego poboru mocy. Jednostka przetwarzania neuronowego to układ o stałej funkcji, przeznaczony do operacji mnożenia z akumulacją, z których zbudowane są sieci neuronowe, a aktualne przykłady pokazują skalę: platforma Intel Core Ultra 200V zapewnia do 120 TOPS na poziomie platformy, z czego NPU wnosi 48 TOPS INT8 (Intel Newsroom, 2024; The Register, 2024). Po stronie ARM układ Rockchip RK3588 integruje NPU o mocy 6 TOPS obsługujące precyzję od INT4 do FP16 (Rockchip, materiały oficjalne). Dedykowane moduły akceleratorów podnoszą efektywność jeszcze bardziej, Hailo-8 firmy Hailo osiąga 26 TOPS przy typowym poborze 2,5 W (Hailo, materiały oficjalne).

W praktyce oznacza to: jeden lub kilka ciągłych strumieni z kamer, wykrywanie defektów, monitorowanie obecności, bramki jakości, działające przez całą zmianę w bezwentylatorowej obudowie termicznej. W naszym katalogu to klasa Core Ultra, komputer typu box EMS-ARH, panel PC APC-2146 i płyta EMX-PTLP, wszystkie wyposażone w zintegrowane NPU, a po stronie ARM ACP-3588 wprowadza 6 TOPS układu RK3588 w cenie bezwentylatorowego SBC.

Kiedy potrzebne jest GPU?

Gdy liczba strumieni lub rozmiar modelu przerasta układy o stałej funkcji. Wbudowana linia NVIDIA Jetson Orin pokazuje pułap: do 275 TOPS przy poborze od 15 do 60 W w AGX Orin, 157 TOPS w Orin NX, 67 TOPS w Orin Nano (NVIDIA, materiały oficjalne). Dedykowane karty GPU na PCIe idą jeszcze dalej, przy setkach watów.

Karty GPU uzasadniają ten budżet energetyczny w trzech sytuacjach: wiele jednoczesnych strumieni zasilających jeden system, jak stanowisko AOI obserwujące kilkanaście kamer; duże lub nieskwantyzowane modele, sieci segmentacyjne, obciążenia klasy LLM; oraz szybka iteracja, gdzie dojrzałość oprogramowania CUDA skraca czas rozwoju. Wzorcem sprzętowym jest stacja robocza z odpowiednimi gniazdami PCIe i chłodzeniem, w naszej ofercie to klasa HPS-ERSUTA, skonfigurowana z kartą GPU, jakiej wymaga Państwa framework.

Jak właściwie podjąć decyzję?

Proszę pracować wstecz od linii produkcyjnej, a nie wprzód od liczby TOPS. Należy policzyć strumienie (jedna kamera czy dwanaście), określić czas cyklu (decyzja co 50 ms czy co 5 s), oszacować model (skwantyzowany klasyfikator czy sieć segmentacyjna) i ustalić budżet obudowy (szczelna szafa bezwentylatorowa czy wentylowana szafa rack). Następnie: lekka praca na jednym strumieniu, CPU. Ciągła wizja na jednym do kilku strumieni wewnątrz bezwentylatorowej obudowy, NPU. Wiele strumieni lub ciężkie modele przy dostępnym chłodzeniu, GPU.

Liczbę TOPS proszę traktować jako próg wejścia, a nie werdykt. Podawane wartości mieszają precyzje (INT8 wobec FP16 mniej więcej podwaja wynik), zakładają idealne wykorzystanie i nic nie mówią o zachowaniu pamięci Państwa modelu. Uczciwym testem jest Państwa model, skwantyzowany tak, jak trafi na produkcję, uruchomiony na rozważanym sprzęcie. Dokładnie takie podejście, najpierw benchmark, stosujemy w naszym przewodniku kupującego serwer edge AI, a jeżeli pytanie o brzeg czy chmurę pozostaje otwarte, proszę zacząć od naszego porównania brzegu i chmury. Proszę podać nam liczbę kamer i czas cyklu, a przygotujemy krótką listę sprzętu, na którym mogą Państwo przeprowadzić testy porównawcze.

Często zadawane pytania

NPU to układ o stałej funkcji przeznaczony do obliczeń sieci neuronowych, niezwykle wydajny w ciągłym wnioskowaniu: obecny NPU Intela zapewnia 48 TOPS INT8 w chipie klasy laptopowej, a Hailo-8 osiąga 26 TOPS przy poborze mocy około 2,5 W. GPU są bardziej elastyczne i skalują się wyżej, Jetson AGX Orin osiąga 275 TOPS, ale przy większym poborze mocy i wyższym koszcie.
Mniej, niż sugeruje marketing. Skwantyzowany klasyfikator dla jednego strumienia może działać na samym CPU; NPU o mocy 6 TOPS, taki jak w RK3588, obsługuje ciągłą wizję jednostrumieniową; wielostrumieniowa kontrola AOI wymaga już od kilkudziesięciu do kilkuset TOPS. Zamiast kierować się samą liczbą TOPS, warto przetestować własny skwantyzowany model.
Tak, w przypadku lekkich obciążeń. Dane Google LiteRT pokazują, że kwantyzacja INT8 zmniejsza modele około 4-krotnie i przyspiesza je około 2-krotnie (MobileNet-v1: z 16,9 MB do 4,3 MB, ze 124 ms do 64 ms), co sprawia, że zadania skanowania kodów kreskowych, OCR i okresowej klasyfikacji stają się osiągalne dla komputerów przemysłowych klasy Atom i Celeron.
Konwersja wag modelu z liczb zmiennoprzecinkowych na liczby całkowite 8-bitowe. Zmniejsza to rozmiar modelu o około 75% i mniej więcej podwaja szybkość przy minimalnej utracie dokładności, a właśnie do tego zoptymalizowane są NPU. Większość wdrożeń brzegowych powinna najpierw zastosować kwantyzację, zanim zdecyduje się na większy sprzęt.
Generacja Core Ultra: modularny komputer typu box EMS-ARH, panel PC APC-2146 oraz płyta Thin Mini-ITX EMX-PTLP mają wbudowaną zintegrowaną jednostkę NPU firmy Intel, a SBC ACP-3588 wyposażono w NPU o mocy 6 TOPS z układu Rockchip RK3588. Do wnioskowania klasy GPU przeznaczona jest stacja robocza HPS-ERSUTA obsługująca dyskretne karty PCIe.
Tylko w przybliżeniu. Podawane wartości TOPS łączą precyzję INT8 i FP16 (różnica rzędu 2x), zakładają idealne wykorzystanie zasobów i pomijają przepustowość pamięci, która często ogranicza rzeczywiste modele. Wartość TOPS warto wykorzystać do wstępnego wyboru klasy sprzętu, a następnie zweryfikować ją na docelowym układzie za pomocą własnego skwantyzowanego modelu.
Tagi: NPU a GPU NPU a CPU sprzęt do wnioskowania edge AI wyjaśnienie TOPS kwantyzacja INT8 akcelerator edge AI NPU RK3588 NPU Intel Core Ultra wnioskowanie GPU na brzegu sieci wybór sprzętu AI sprzęt do wizji maszynowej
Przydatne? Prosimy udostępnić
T

TSL Automation Solutions

Dyrektor marketingu, TSL Automation Solutions

Sanjana pisze o trendach w automatyce przemysłowej, premierach produktów i nowych technologiach dla TSL Automation Solutions, dystrybutora paneli HMI, paneli PC i systemów wbudowanych z siedzibą w Mumbaju, obsługującego producentów w Indiach i na całym świecie.

Potrzebna pomoc w wyborze właściwego produktu?

Nasz zespół w Mumbaju doradzi odpowiedni panel HMI, panel PC lub system wbudowany do Państwa zastosowania.

Kontakt z TSL Automation