Bericht Architektur Deep Dive: So sollen AMDs CDNA-5-GPUs Platzhirsch Nvidia Paroli bieten

Snoopmore schrieb:
Wieso wird hier eigentlich noch der Begriff "GPU" verwendet?
Damit man versteht, woher die Architektur kommt. Wenn ich überall nur "Beschleuniger" schreibe ist es halt maximal unanschaulich.
CDLABSRadonP... schrieb:
Darin ist wirklich nichts mehr enthalten, was die Verwendung rechtfertigt.
Es gibt noch Video-Decoder ;)
 
foofoobar schrieb:
Naja, dann sind AVX-CPUs halt auch GPUs. Der Trick, wieso Larrabee im Gegensatz zu den Xeon Phi eine werden sollte war ja gerade die Nutzbarmachung dieser Rechenleistung für Grafik.
Colindo schrieb:
(...) Es gibt noch Video-Decoder ;)
Wahrscheinlich auch wegen den AI-Anwendungen, oder? Encoder gibt es keine mehr, das geschieht extern?
 
  • Gefällt mir
Reaktionen: Colindo
Colindo schrieb:
Der IO-Die ist jetzt nur noch das, was der Name sagt: eine Schnittstelle für Inputs und Outputs nach draußen, das heißt zum VRAM.
Ja, Schnittstelle nach außen, aber NEIN, VRAM also HBM wird direkt vom FCM angebunden und nicht vom I/O-Die. Geht auch gar nicht anders, da sonnst der Weg vom mittleren HBM zum I/O-Die außen viel zu weit wäre.


Hier steht´s: 192 Channel HBM4-interface ist im FCD-Die
1785096190459.png


I/O-Die ist wirklich nur die Kommunikation nach außen, PCIe, UALInk, UALoE lanes, etc...
 
  • Gefällt mir
Reaktionen: T1beriu, Kitsune-Senpai, CDLABSRadonP... und 2 andere
CDLABSRadonP... schrieb:
Darin ist wirklich nichts mehr enthalten, was die Verwendung rechtfertigt.
Klar die CDNA GPU verzichten weitgehend auf die fixed Funktion Units für die Grafikausgabe. Die MI455X hat immer noch SIMD32 verbaut, und die Shader der SIMD32 ist nun Mal der Kern einer GPU.
Ergänzung ()

Convert schrieb:
I/O-Die ist wirklich nur die Kommunikation nach außen, PCIe, UALInk, UALoE lanes, etc...
Sagt er doch, das HBM ist drinnen, on Package.
 
@ETI1120
Ja, das HBM ist on Package, wird aber nicht über das I/O-Die angebunden, so wie das im zitierten Satz zu lesen ist.
 
  • Gefällt mir
Reaktionen: T1beriu und bensen
theGucky schrieb:
Größer ist übrigens nicht besser.
Größer heißt, es können nur weniger gefertigt werden und die Warteliste ist lang.
Wobei es kommt darauf an, wo das Bottleneck ist. In der Chipfertigung oder im Packaging, was bei sovielen Chips sehr aufwendig ist..
Scheinbar geht AMD hier all-In weill es sich auszahlen dürfte.
Naja viel kann AMD nicht anders machen wenn sie oben mitspielen wollen.
 
PERKELE schrieb:
Ich bin gespannt was von all dem bei uns im Consumer Markt ankommt.
Nix natürlich, ist ja Servermarkt
PERKELE schrieb:
Ansonsten sag ich schon einmal Chapaeu AMD - ich hoffe das sie sich weiter im Servermarkt durchsetzen koennen und der Lederjacke paroli bieten koennen. :)
AMD geht letztlich den Weg weiter den sie begonnen haben
Das ist natürlich einerseits gut, andererseits... Schade
 
Ich bin gespannt, wie sich ROCm in Zukunft am Markt etabliert. In den letzten Monaten schient es ja massive Fortschritte bei dessen Entwicklung und softwareseitigen Unterstützung gegeben zu haben, aber man liest auch immer wieder davon, dass es noch nicht ganz ausgereift und alltagsstabil sei. Wenn AMD da noch ein bisschen enger mit den Software-Herstellern zusammenarbeitet und auch mehr eigene Ressourcen in die Weiterentwicklung und Optimierung von ROCm steckt, besteht hier durchaus die Chance, das Monopol von Nvidia und CUDA endlich zu brechen, und zwar nicht nur in der Theorie.

CDNA5 ist jedenfalls hardwareseitig ein massiver Schritt vorwärts und mischt die Karten neu! Hoffentlich wird RDNA5 (oder UDNA?) hier auch ein neuer Meilenstein, sodass man auch als Privatanwender in den Genuss kommt.
 
  • Gefällt mir
Reaktionen: ThePlayer
PERKELE schrieb:
Ich bin gespannt was von all dem bei uns im Consumer Markt ankommt.

Gitbst doch schon... ok... "consumer" ist realtive ... :evillol: :evillol: :evillol:

Hier clustert er einfahc mal 4 AMD Ryzen AI MAX+395 fürs "Wohnzimmer" zusammen.

Und hier gibts de AI Halos... die man auch bis zu 4 stück Clustern kann... was dann vermutlich eher ins "Wohnzimmer" passt.

CDDNA Lösugen wirst du sonst glaub ich niemals bei "Cunsumer" oder auch im Büro finden oder.... das wandern nur ihn riesige Datencenter oder?
 
  • Gefällt mir
Reaktionen: PERKELE
Convert schrieb:
@ETI1120
Ja, das HBM ist on Package, wird aber nicht über das I/O-Die angebunden, so wie das im zitierten Satz zu lesen ist.
Sorry, beim VRAM habe ich nicht geschaltet, habs zwar gelesen aber nicht mit dem HBM gleichgesetzt.

Ich sollte mir Merken nicht auf die Schnelle kurz vor dem Spazieren gehen zu antworten.
 
  • Gefällt mir
Reaktionen: CDLABSRadonP... und yummycandy
Wie wäre es mal mit eine Brute Force GPU, 128 oder 160CUs und 512Bit mit 32/48GB GDDR7 32Gbps, egal ob die 600 oder 800W Verbrauch, Leute kaufen das weil die Performance stimmt
 
  • Gefällt mir
Reaktionen: JarlBallin
SaschaHa schrieb:
Ich bin gespannt, wie sich ROCm in Zukunft am Markt etabliert. In den letzten Monaten schient es ja massive Fortschritte bei dessen Entwicklung und softwareseitigen Unterstützung gegeben zu haben, aber man liest auch immer wieder davon, dass es noch nicht ganz ausgereift und alltagsstabil sei.
AFAIU war das Hauptproblem, dass ROCm die Hardware nicht gut auslasten konnte. Hinzu kam, dass es Fälle gab an denen die Hardware an sich gut ausgelastet wurde, aber dass kleine Änderungen an der Software bewirkt haben, dass die Hardware plötzlich deutlich schlechter ausgelastet wurde. Ich denke das ist mit alltagsstabil gemeint.

Dafür dass ROCm erheblich besser geworden ist, gibt es sehr viele Belege. Die Hardwareabdeckung, die bessere Performance auf Strix Halo, das Abschneiden bei ML Perf Inference ...
SaschaHa schrieb:
Wenn AMD da noch ein bisschen enger mit den Software-Herstellern zusammenarbeitet und auch mehr eigene Ressourcen in die Weiterentwicklung und Optimierung von ROCm steckt,
AMD arbeitet sehr eng mit den Softwareherstellern zusammen. Und was meinst Du wie toll die das finden in Sourcen von ROCm reinschauen zu können und ggf. Änderungen und Optimierungen selbst vornehmen zu können.
SaschaHa schrieb:
besteht hier durchaus die Chance, das Monopol von Nvidia und CUDA endlich zu brechen, und zwar nicht nur in der Theorie.
NVIDIA hat einen sehr hohen Marktanteil aber kein Monopol. CUDA spielt bei ML nicht die Rolle die es früher bei HPC hatte. Der große Vorteil von NVIDIA ist, dass der Softwarestack sehr gut auf die Hardware abgestimmt ist und dass die Frameworks bei NVIDIA mit hoher Auslastung der Hardware arbeiten

SaschaHa schrieb:
CDNA5 ist jedenfalls hardwareseitig ein massiver Schritt vorwärts und mischt die Karten neu!
Es ist gerade die Hardware die das größte Risiko für AMD ist. Das Heliosrack sieht ganz toll aus. Aber es muss eben in hoher Stückzahl produziert werden. Dass die Hardware in den Netzwerktrays nicht von AMD ist, ist eben auch ein Risikofaktor.

Wir werden sehen ob die Zuversicht von AMD alles im Griff zu haben, berechtigt war.

Auf der anderen Seite war schon MI355 was die Rohdaten anging sehr gut. Hier war das Problem weniger die Rechenleistung als die Anbindung ans Netzwerk und das Fehlen einer echten Rackscale Lösung.
SaschaHa schrieb:
Hoffentlich wird RDNA5 (oder UDNA?) hier auch ein neuer Meilenstein, sodass man auch als Privatanwender in den Genuss kommt.
So wie es aussieht will AMD zumindest bis auf weiteres an den Bezeichnungen CDNA und RDNA festhalten. Denn sonnst hätte AMD CDNA5 als UDNA1 bezeichnen müssen.
 
  • Gefällt mir
Reaktionen: Kitsune-Senpai und CDLABSRadonP...
Oldtimer schrieb:
Mich würde es freuen, wenn die Monopolstellung von NVIDIA endlich mal gekippt wird. Vielleicht normalisieren sich dann mal die Preise...
Logisch, denn wenn AMD NVidia die Preise für die Produkte wesentlich zu senken, dann werden sich die RZs für das gleiche Geld noch mehr dieser Beschleuniger in die Racks stopfen können. Das heisst dann aber, dass die Nachfrage nach RAM noch weiter explodiert und nach Fertigungskapazität bei TSMC ebenfalls.

Wenn Du vernünftige Preise willst, dann müsstest Du hoffen, dass NVidia - zumindest in diesem Marktsegment - ohne jegliche Konkurrenz dasteht und für ihre AI-Produkte so unverschämte Preise aufriefe, dass kaum noch relevante Stückzahlen nachgefragt würden. Dann könnten wieder Consumer-GPUs billig bei TSMC gefertigt und mit RAM für nen paar Mark fuffzig versehen werden.

Bedenke also, was Du Dir wünschst.
 
timse201 schrieb:
Ist das nun schon UDNA oder kommt das erst noch?
UDNA scheint sich intern nicht als neue Marketingbezeichnung durchgesetzt zu haben.
CDNA- und RDNA-Bezeichnungen werden fortgeführt.

Davon ab kann man argumentativ CDNA5 und RDNA5 als erste Ableger der "UDNA"-Strategie ansehen.
Das Ziel von "UDNA" ist es die ISA und Speicherhierarchie zwischen den unterschiedlichen Märkten näher zu bringen, Enterprise & Client Market.

Genau das wird mit CDNA5 und RDNA5 gemacht.
Beide basieren auf RDNA in Bezug auf das Ausführungsmodell, Wave32, ähnlichere/gleiche Ausführungslatenzen für unterschiedliche Operationen, und etablieren eine neue Speicherhierarchie.

Auf WGP-Ebene fusioniert CDNA5 den LDS (Local Scratchpad Memory) mit den 2x L0 Caches zu einer neuen 384 KB Speicherstruktur.
Diese besteht anscheinend aus 6x 64 KB Segmenten, und bietet wie bei Nvidia und Intel unterschiedliche Speichersplits für Anwendungen an.
Als LDS kann man maximal 320 KB definieren, heißt 64 KB bleiben für den L0 Cache, man kann aber auch den LDS kleiner einstellen und einen größeren L0 Cache vorziehen.
Nachdem WGP Cache (vormals L0 bezeichnet, jetzt würde ich das lieber wieder L1 nennen) kommt der L2 Cache, und das wars.

Bei RDNA5 ist auch stark davon auszuegehen das AMD eine solche Unified Memory Structure einführt und es danach ebenso nur einen globalen L2 Cache gibt.
Die Kapaztiäten werden natürlich anders ausfallen, kleiner, aber die Grundlagen sind die gleichen bzw. deutlich näher als zuvor.

Vermutliche Kurzübersicht:
CDNA 1/2: Lokaler 16 KB L1$ + Globaler L2 Cache
CDNA 3/4: Lokaler 32 KB L1$ + Chip lokaler L2 Cache + L3$/Infinity Cache
CDNA 5: 384 KB Unified WGP L1 (Cache & LDS) + L2 Cache

RDNA 1: Lokaler 16 KB L0$ + Cluster 128 KB L1$ + Globaler L2 Cache
RDNA 2/3: Lokaler 16/32 KB L0$ + Cluster 128/256 KB L1$ + Globaler L2 Cache + L3$/Infinity Cache
RDNA 4: Lokaler 32 KB L"0"$ + Globaler L2 Cache + L3$/Infinity Cache
(Der L1 Cluster Cache wurde entfernt)
RDNA 5: Unified WGP L1 (Cache & LDS) + L2 Cache
ETI1120 schrieb:
Klar die CDNA GPU verzichten weitgehend auf die fixed Funktion Units für die Grafikausgabe. Die MI455X hat immer noch SIMD32 verbaut, und die Shader der SIMD32 ist nun Mal der Kern einer GPU.
Es ist ja nicht nur der weitgehende Verzicht auf FF HW für die Grafikausgabe, sondern allgemein der Verzicht auf die Grafikausgabe im traditionellen Sinne.
Kein 3D Shader / API-Support, keine direkte Display-Ausgabe.

Die Bezeichnung GPU hat dann schon fast keine Bedeutung, bzw. dient nur noch als grobe legacy Kennzeichnung.
Mit der Grund wieso teilweise einfach nur von xPUs geredet wird.
 
  • Gefällt mir
Reaktionen: Deinorius, Kitsune-Senpai, ComputerJunge und 5 andere
Jetzt kommt es vor allem auf die Softwareunterstützung an. Bei der Rohleistung der Hardware ist wohl im Moment mindestens Gleichstand. Die jetzt angekündigte Allianz mit Anthropic lässt zumindest hoffen, daß sich auch bei der Software einiges tut.
Mal sehen wie Nvidia reagiert.
 
ETI1120 schrieb:
Hinzu kam, dass es Fälle gab an denen die Hardware an sich gut ausgelastet wurde, aber dass kleine Änderungen an der Software bewirkt haben, dass die Hardware plötzlich deutlich schlechter ausgelastet wurde. Ich denke das ist mit alltagsstabil gemeint.
Durchaus möglich, aber de facto ist das dann wieder ein gewisses Risiko. Wenn man damit professionell arbeiten will, ist es fatal, wenn das nächste Software-, Treiber- oder Kernel-Update plötzlich wieder zu Problemen führt.

Beispiel: ComfyUI with ROCm became so slow, it's not usable (vor einem Monat)

Insgesamt werden solche Probleme deutlich weniger und ROCm nun tatsächlich eine Alternative zu CUDA, aber es mangelt eben noch ein wenig an Konsistenz. Da erhoffe ich mir in den nächsten Monaten weitere Verbesserungen.

Die neuste Version scheint ziemlich gut zu sein: ROCm 7.14.0 is fast (vor 7 Tagen)

ETI1120 schrieb:
NVIDIA hat einen sehr hohen Marktanteil aber kein Monopol.
Naja, in vielen Bereichen ist es ein Quasi-Monopol, da man für bestimmte Anwendungen eben an Nvidia gebunden war. Das wird sich dann hoffentlich ändern, sobald die Unterstützung für ROCm flächendeckend verfügbar ist und ordnungsgemäß funktioniert. Da hat sich zwar enorm viel getan, aber einige Baustellen gibt es halt noch.
 
Locuza schrieb:
Auf WGP-Ebene fusioniert CDNA5 den LDS (Local Scratchpad Memory) mit den 2x L0 Caches zu einer neuen 384 KB Speicherstruktur.
CDNA hatte aber nie die Bezeichnung "L0-Cache" oder? Da war doch immer die klassische L1 und L2 Struktur.

Aber interessant, was du über RDNA 4 sagst. Damit konnte ich mich bei Erscheinen nicht im Detail befassen und hatte nicht bemerkt, dass der L1-Cache entfernt wurde. Überrascht mich, ehrlich gesagt.
 
  • Gefällt mir
Reaktionen: Kitsune-Senpai
Sapphire Forum
Zurück
Oben