Conform Playtech.ro: NVIDIA își schimbă strategia în domeniul inteligenței artificiale, prezentând o nouă abordare care combină puternicele sale GPU-uri cu o arhitectură inovatoare, denumită LP30, ce promite o eficiență energetică și o gestionare a căldurii superioare. Această mișcare sugerează o reconfigurare a pieței de hardware pentru AI, unde NVIDIA își consolidează poziția prin diversificarea soluțiilor.
O nouă arhitectură pentru eficiență sporită
Arhitectura LP30 elimină numeroase mecanisme întâlnite în procesoarele clasice, cum ar fi predicția ramificațiilor, cache-urile tradiționale sau execuția out-of-order. În locul acestora, compilatorul stabilește dinainte aproape fiecare operațiune, până la nivelul ciclurilor de ceas. Această abordare permite anticiparea consumului electric, sistemul putând pregăti alimentarea înainte ca o anumită zonă a cipului să solicite energie, reducând astfel variațiile de tensiune. NVIDIA afirmă că tehnologia poate reduce fenomenul de voltage droop cu peste 60%, iar depășirile de tensiune cu peste 70%.
Controlul predictibil al sarcinilor ajută și la gestionarea temperaturii. În loc ca performanța întregului cip să fie limitată de cea mai fierbinte zonă, sarcinile pot fi distribuite astfel încât căldura să fie mai uniformă. NVIDIA estimează că această metodă poate aduce aproximativ 10-11% performanță suplimentară în cadrul aceleiași limite termice, un avantaj considerabil în centrele de date unde eficiența energetică este crucială.
NVIDIA integrează Groq LP30 cu Vera Rubin, nu le înlocuiește
Groq 3 LPX nu este prezentat drept un înlocuitor pentru GPU-urile NVIDIA. Strategia companiei este, mai degrabă, să împartă procesarea unui model AI între două tipuri de hardware. GPU-urile din platforma Vera Rubin NVL72 s-ar ocupa de etapa de „prefill”, unde este necesară o putere de calcul imensă și o capacitate mare de memorie. Procesoarele LP30 ar primi apoi sarcina de „decode”, adică generarea efectivă a răspunsului.
Motivul acestei diviziuni este legat de diferența majoră de memorie. Un GPU Rubin dispune de aproximativ 288 GB de memorie HBM4, incomparabil mai mult decât cei aproximativ 500 MB de SRAM ai unui LP30. Pentru modelele de inteligență artificială extrem de mari, capacitatea memoriei devine rapid o problemă pentru arhitectura Groq.
În cazul unui model de 31 de miliarde de parametri în FP8, ar fi necesare aproximativ 62 de procesoare LP30 numai pentru stocarea parametrilor. Pentru modelele Mixture-of-Experts cu trilioane de parametri, numărul de cipuri poate ajunge la mii, distribuite în mai multe rack-uri, subliniind astfel nevoia de a combina arhitecturile pentru a atinge performanța dorită. Această abordare hibridă permite NVIDIA să beneficieze de avantajele ambelor tehnologii.
Sursa: Playtech.ro