NVIDIA heeft onlangs een diepgaande analyse uitgevoerd van de nieuwste Rubin GPU-architectuur, waarmee de belangrijkste doorbraken in het bereiken van grootschalige computing op multi-rack-, multi-systeem- en datacenterniveau worden aangetoond. Als belangrijke mijlpaal in de technologische evolutie van het bedrijf kan deze accelerator tot 50 PetaFLOPS aan rekenkracht leveren onder schaarse NVFP4-bewerkingen.
Op vol vermogen integreert de Rubin GPU tot 224 streaming multiprocessors (SM) en 288 GB HBM4-geheugen. Met 336 miljard transistors heeft Nvidia hem ook uitgerust met 896 tensorkernen met een Transformer-engine van de derde generatie. Om de enorme ruwe rekenkracht vrij te maken, verdeelt NVIDIA GPU-bronnen in grafische processorclusters met gecentraliseerde L2-cache, aangevuld met de GigaThread-engine om de workflow te coördineren en het gebruik van bronnen te optimaliseren. Bovendien zorgt de MIG-controlepartitioneringsfunctie ervoor dat deze GPU kan worden gepartitioneerd in meerdere virtuele GPU's, wat vergelijkbaar is met de manier waarop moderne CPU's met virtuele kernen omgaan.

Op het gebied van geheugenconfiguratie werkte Nvidia samen met geheugenpartners om 288 GB HBM4-geheugen te leveren via gestapelde modules met 12 lagen. De speciale HBM-controller werkt samen met de fysieke laag om een maximale geheugenbandbreedte van maximaal 22 TB per seconde te bereiken, wat extreem concurrerend is in de branche. De tensor-geheugenmanager is geüpgraded om de efficiëntie van de gegevensoverdracht te verbeteren, terwijl de verticale uitbreiding en communicatie van de gehele GPU volledig worden beheerd door NVLink 6. Met NVLink 6 bereikt de architecturale bandbreedte van volledig onderling verbonden GPU-communicatie 3600 GB per seconde, terwijl de NVLink-C2C chip-to-chip interconnect-technologie een CPU-GPU-communicatiebandbreedte van 1800 GB per seconde bereikt. Nvidia heeft ook een ingebouwde PCIe Gen 6-switch met 256 GB per seconde bandbreedte voor gegevensuitwisseling met externe apparaten.

Opschalingscommunicatie is een van de sterke punten van NVIDIA, waardoor GPU's efficiënt en naadloos kunnen communiceren met andere GPU's in rack-scale systemen. Traditionele communicatie tussen GPU's vereist vaak coördinatie en synchronisatie, wat resulteert in vertragingen wanneer het systeem vastloopt tijdens het wachten op gegevensoverdracht. Om dit pijnpunt aan te pakken introduceert de Rubin-architectuur een door het apparaat geïnitieerd communicatiemechanisme, waardoor elke GPU de datatransmissie onafhankelijk kan beheren, waardoor de noodzaak voor externe optimalisatie wordt geëlimineerd en de latentie effectief wordt verminderd.

Dergelijke krachtige systemen gaan vaak gepaard met een enorm stroomverbruik, en een enkel NVL72-rack integreert 72 GPU's. Voor het Vera Rubin NVL72-systeem heeft NVIDIA intelligente power smoothing-technologie ontwikkeld die alle systeemcomponenten integreert in één vast vermogensbereik. Bij het uitvoeren van kunstmatige intelligentie-workloads kunnen de stroomvereisten bijvoorbeeld enorm fluctueren tussen inactieve toestanden, wachtend op de CPU tot een volledig geladen GPU. Door middel van intelligente power smoothing-technologie wordt het gemiddelde energieverbruik van het Vera Rubin NVL72-systeem met ongeveer 10% verminderd in vergelijking met de vorige generatie Grace Blackwell NVL72, en wordt het piekvermogen van 50 milliseconden met ongeveer 20% verminderd. De optimalisatie van het energiebudget wordt verder ondersteund door NVIDIA DSX MaxLPS-technologie.