Du verwendest einen veralteten Browser. Es ist möglich, dass diese oder andere Websites nicht korrekt angezeigt werden.
Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
Du solltest ein Upgrade durchführen oder einen alternativen Browser verwenden.
Bericht Architektur Deep Dive: So sollen AMDs CDNA-5-GPUs Platzhirsch Nvidia Paroli bieten
foofoobar
Vice Admiral
- Registriert
- Dez. 2011
- Beiträge
- 6.391
Vektorrechner?CDLABSRadonP... schrieb:Darin ist wirklich nichts mehr enthalten, was die Verwendung rechtfertigt.
Damit man versteht, woher die Architektur kommt. Wenn ich überall nur "Beschleuniger" schreibe ist es halt maximal unanschaulich.Snoopmore schrieb:Wieso wird hier eigentlich noch der Begriff "GPU" verwendet?
Es gibt noch Video-DecoderCDLABSRadonP... schrieb:Darin ist wirklich nichts mehr enthalten, was die Verwendung rechtfertigt.
CDLABSRadonP...
Admiral
- Registriert
- Feb. 2021
- Beiträge
- 7.818
Naja, dann sind AVX-CPUs halt auch GPUs. Der Trick, wieso Larrabee im Gegensatz zu den Xeon Phi eine werden sollte war ja gerade die Nutzbarmachung dieser Rechenleistung für Grafik.foofoobar schrieb:Vektorrechner?
Wahrscheinlich auch wegen den AI-Anwendungen, oder? Encoder gibt es keine mehr, das geschieht extern?Colindo schrieb:(...) Es gibt noch Video-Decoder![]()
Ja, Schnittstelle nach außen, aber NEIN, VRAM also HBM wird direkt vom FCM angebunden und nicht vom I/O-Die. Geht auch gar nicht anders, da sonnst der Weg vom mittleren HBM zum I/O-Die außen viel zu weit wäre.Colindo schrieb:Der IO-Die ist jetzt nur noch das, was der Name sagt: eine Schnittstelle für Inputs und Outputs nach draußen, das heißt zum VRAM.
Hier steht´s: 192 Channel HBM4-interface ist im FCD-Die
I/O-Die ist wirklich nur die Kommunikation nach außen, PCIe, UALInk, UALoE lanes, etc...
Klar die CDNA GPU verzichten weitgehend auf die fixed Funktion Units für die Grafikausgabe. Die MI455X hat immer noch SIMD32 verbaut, und die Shader der SIMD32 ist nun Mal der Kern einer GPU.CDLABSRadonP... schrieb:Darin ist wirklich nichts mehr enthalten, was die Verwendung rechtfertigt.
Ergänzung ()
Sagt er doch, das HBM ist drinnen, on Package.Convert schrieb:I/O-Die ist wirklich nur die Kommunikation nach außen, PCIe, UALInk, UALoE lanes, etc...
pipip
Fleet Admiral
- Registriert
- Jan. 2011
- Beiträge
- 11.638
Scheinbar geht AMD hier all-In weill es sich auszahlen dürfte.theGucky schrieb:Größer ist übrigens nicht besser.
Größer heißt, es können nur weniger gefertigt werden und die Warteliste ist lang.
Wobei es kommt darauf an, wo das Bottleneck ist. In der Chipfertigung oder im Packaging, was bei sovielen Chips sehr aufwendig ist..
Naja viel kann AMD nicht anders machen wenn sie oben mitspielen wollen.
@Convert Danke für den Hinweis. Die Folie ist mir durchgegangen.
Genau.CDLABSRadonP... schrieb:Encoder gibt es keine mehr, das geschieht extern?
Nix natürlich, ist ja ServermarktPERKELE schrieb:Ich bin gespannt was von all dem bei uns im Consumer Markt ankommt.
AMD geht letztlich den Weg weiter den sie begonnen habenPERKELE schrieb:Ansonsten sag ich schon einmal Chapaeu AMD - ich hoffe das sie sich weiter im Servermarkt durchsetzen koennen und der Lederjacke paroli bieten koennen.![]()
Das ist natürlich einerseits gut, andererseits... Schade
SaschaHa
Rear Admiral
- Registriert
- Nov. 2007
- Beiträge
- 5.525
Ich bin gespannt, wie sich ROCm in Zukunft am Markt etabliert. In den letzten Monaten schient es ja massive Fortschritte bei dessen Entwicklung und softwareseitigen Unterstützung gegeben zu haben, aber man liest auch immer wieder davon, dass es noch nicht ganz ausgereift und alltagsstabil sei. Wenn AMD da noch ein bisschen enger mit den Software-Herstellern zusammenarbeitet und auch mehr eigene Ressourcen in die Weiterentwicklung und Optimierung von ROCm steckt, besteht hier durchaus die Chance, das Monopol von Nvidia und CUDA endlich zu brechen, und zwar nicht nur in der Theorie.
CDNA5 ist jedenfalls hardwareseitig ein massiver Schritt vorwärts und mischt die Karten neu! Hoffentlich wird RDNA5 (oder UDNA?) hier auch ein neuer Meilenstein, sodass man auch als Privatanwender in den Genuss kommt.
CDNA5 ist jedenfalls hardwareseitig ein massiver Schritt vorwärts und mischt die Karten neu! Hoffentlich wird RDNA5 (oder UDNA?) hier auch ein neuer Meilenstein, sodass man auch als Privatanwender in den Genuss kommt.
lynx007
Rear Admiral
- Registriert
- Feb. 2011
- Beiträge
- 5.950
PERKELE schrieb:Ich bin gespannt was von all dem bei uns im Consumer Markt ankommt.
Gitbst doch schon... ok... "consumer" ist realtive ...
Hier clustert er einfahc mal 4 AMD Ryzen AI MAX+395 fürs "Wohnzimmer" zusammen.
YouTube
An dieser Stelle steht ein externer Inhalt von YouTube, der den Forumbeitrag ergänzt. Er kann mit einem Klick geladen und auch wieder ausgeblendet werden.
Ich bin damit einverstanden, dass YouTube-Embeds geladen werden. Dabei können personenbezogene Daten an YouTube übermittelt werden. Mehr dazu in der Datenschutzerklärung.
Und hier gibts de AI Halos... die man auch bis zu 4 stück Clustern kann... was dann vermutlich eher ins "Wohnzimmer" passt.
YouTube
An dieser Stelle steht ein externer Inhalt von YouTube, der den Forumbeitrag ergänzt. Er kann mit einem Klick geladen und auch wieder ausgeblendet werden.
Ich bin damit einverstanden, dass YouTube-Embeds geladen werden. Dabei können personenbezogene Daten an YouTube übermittelt werden. Mehr dazu in der Datenschutzerklärung.
CDDNA Lösugen wirst du sonst glaub ich niemals bei "Cunsumer" oder auch im Büro finden oder.... das wandern nur ihn riesige Datencenter oder?
Sorry, beim VRAM habe ich nicht geschaltet, habs zwar gelesen aber nicht mit dem HBM gleichgesetzt.Convert schrieb:@ETI1120
Ja, das HBM ist on Package, wird aber nicht über das I/O-Die angebunden, so wie das im zitierten Satz zu lesen ist.
Ich sollte mir Merken nicht auf die Schnelle kurz vor dem Spazieren gehen zu antworten.
Ghostshield
Lt. Junior Grade
- Registriert
- Apr. 2012
- Beiträge
- 508
Wie wäre es mal mit eine Brute Force GPU, 128 oder 160CUs und 512Bit mit 32/48GB GDDR7 32Gbps, egal ob die 600 oder 800W Verbrauch, Leute kaufen das weil die Performance stimmt
AFAIU war das Hauptproblem, dass ROCm die Hardware nicht gut auslasten konnte. Hinzu kam, dass es Fälle gab an denen die Hardware an sich gut ausgelastet wurde, aber dass kleine Änderungen an der Software bewirkt haben, dass die Hardware plötzlich deutlich schlechter ausgelastet wurde. Ich denke das ist mit alltagsstabil gemeint.SaschaHa schrieb:Ich bin gespannt, wie sich ROCm in Zukunft am Markt etabliert. In den letzten Monaten schient es ja massive Fortschritte bei dessen Entwicklung und softwareseitigen Unterstützung gegeben zu haben, aber man liest auch immer wieder davon, dass es noch nicht ganz ausgereift und alltagsstabil sei.
Dafür dass ROCm erheblich besser geworden ist, gibt es sehr viele Belege. Die Hardwareabdeckung, die bessere Performance auf Strix Halo, das Abschneiden bei ML Perf Inference ...
AMD arbeitet sehr eng mit den Softwareherstellern zusammen. Und was meinst Du wie toll die das finden in Sourcen von ROCm reinschauen zu können und ggf. Änderungen und Optimierungen selbst vornehmen zu können.SaschaHa schrieb:Wenn AMD da noch ein bisschen enger mit den Software-Herstellern zusammenarbeitet und auch mehr eigene Ressourcen in die Weiterentwicklung und Optimierung von ROCm steckt,
NVIDIA hat einen sehr hohen Marktanteil aber kein Monopol. CUDA spielt bei ML nicht die Rolle die es früher bei HPC hatte. Der große Vorteil von NVIDIA ist, dass der Softwarestack sehr gut auf die Hardware abgestimmt ist und dass die Frameworks bei NVIDIA mit hoher Auslastung der Hardware arbeitenSaschaHa schrieb:besteht hier durchaus die Chance, das Monopol von Nvidia und CUDA endlich zu brechen, und zwar nicht nur in der Theorie.
Es ist gerade die Hardware die das größte Risiko für AMD ist. Das Heliosrack sieht ganz toll aus. Aber es muss eben in hoher Stückzahl produziert werden. Dass die Hardware in den Netzwerktrays nicht von AMD ist, ist eben auch ein Risikofaktor.SaschaHa schrieb:CDNA5 ist jedenfalls hardwareseitig ein massiver Schritt vorwärts und mischt die Karten neu!
Wir werden sehen ob die Zuversicht von AMD alles im Griff zu haben, berechtigt war.
Auf der anderen Seite war schon MI355 was die Rohdaten anging sehr gut. Hier war das Problem weniger die Rechenleistung als die Anbindung ans Netzwerk und das Fehlen einer echten Rackscale Lösung.
So wie es aussieht will AMD zumindest bis auf weiteres an den Bezeichnungen CDNA und RDNA festhalten. Denn sonnst hätte AMD CDNA5 als UDNA1 bezeichnen müssen.SaschaHa schrieb:Hoffentlich wird RDNA5 (oder UDNA?) hier auch ein neuer Meilenstein, sodass man auch als Privatanwender in den Genuss kommt.
Yosup
Lieutenant
- Registriert
- Nov. 2022
- Beiträge
- 957
Logisch, denn wenn AMD NVidia die Preise für die Produkte wesentlich zu senken, dann werden sich die RZs für das gleiche Geld noch mehr dieser Beschleuniger in die Racks stopfen können. Das heisst dann aber, dass die Nachfrage nach RAM noch weiter explodiert und nach Fertigungskapazität bei TSMC ebenfalls.Oldtimer schrieb:Mich würde es freuen, wenn die Monopolstellung von NVIDIA endlich mal gekippt wird. Vielleicht normalisieren sich dann mal die Preise...
Wenn Du vernünftige Preise willst, dann müsstest Du hoffen, dass NVidia - zumindest in diesem Marktsegment - ohne jegliche Konkurrenz dasteht und für ihre AI-Produkte so unverschämte Preise aufriefe, dass kaum noch relevante Stückzahlen nachgefragt würden. Dann könnten wieder Consumer-GPUs billig bei TSMC gefertigt und mit RAM für nen paar Mark fuffzig versehen werden.
Bedenke also, was Du Dir wünschst.
Locuza
Lieutenant
- Registriert
- Dez. 2010
- Beiträge
- 578
UDNA scheint sich intern nicht als neue Marketingbezeichnung durchgesetzt zu haben.timse201 schrieb:Ist das nun schon UDNA oder kommt das erst noch?
CDNA- und RDNA-Bezeichnungen werden fortgeführt.
Davon ab kann man argumentativ CDNA5 und RDNA5 als erste Ableger der "UDNA"-Strategie ansehen.
Das Ziel von "UDNA" ist es die ISA und Speicherhierarchie zwischen den unterschiedlichen Märkten näher zu bringen, Enterprise & Client Market.
Genau das wird mit CDNA5 und RDNA5 gemacht.
Beide basieren auf RDNA in Bezug auf das Ausführungsmodell, Wave32, ähnlichere/gleiche Ausführungslatenzen für unterschiedliche Operationen, und etablieren eine neue Speicherhierarchie.
Auf WGP-Ebene fusioniert CDNA5 den LDS (Local Scratchpad Memory) mit den 2x L0 Caches zu einer neuen 384 KB Speicherstruktur.
Diese besteht anscheinend aus 6x 64 KB Segmenten, und bietet wie bei Nvidia und Intel unterschiedliche Speichersplits für Anwendungen an.
Als LDS kann man maximal 320 KB definieren, heißt 64 KB bleiben für den L0 Cache, man kann aber auch den LDS kleiner einstellen und einen größeren L0 Cache vorziehen.
Nachdem WGP Cache (vormals L0 bezeichnet, jetzt würde ich das lieber wieder L1 nennen) kommt der L2 Cache, und das wars.
Bei RDNA5 ist auch stark davon auszuegehen das AMD eine solche Unified Memory Structure einführt und es danach ebenso nur einen globalen L2 Cache gibt.
Die Kapaztiäten werden natürlich anders ausfallen, kleiner, aber die Grundlagen sind die gleichen bzw. deutlich näher als zuvor.
Vermutliche Kurzübersicht:
CDNA 1/2: Lokaler 16 KB L1$ + Globaler L2 Cache
CDNA 3/4: Lokaler 32 KB L1$ + Chip lokaler L2 Cache + L3$/Infinity Cache
CDNA 5: 384 KB Unified WGP L1 (Cache & LDS) + L2 Cache
RDNA 1: Lokaler 16 KB L0$ + Cluster 128 KB L1$ + Globaler L2 Cache
RDNA 2/3: Lokaler 16/32 KB L0$ + Cluster 128/256 KB L1$ + Globaler L2 Cache + L3$/Infinity Cache
RDNA 4: Lokaler 32 KB L"0"$ + Globaler L2 Cache + L3$/Infinity Cache
(Der L1 Cluster Cache wurde entfernt)
RDNA 5: Unified WGP L1 (Cache & LDS) + L2 Cache
Es ist ja nicht nur der weitgehende Verzicht auf FF HW für die Grafikausgabe, sondern allgemein der Verzicht auf die Grafikausgabe im traditionellen Sinne.ETI1120 schrieb:Klar die CDNA GPU verzichten weitgehend auf die fixed Funktion Units für die Grafikausgabe. Die MI455X hat immer noch SIMD32 verbaut, und die Shader der SIMD32 ist nun Mal der Kern einer GPU.
Kein 3D Shader / API-Support, keine direkte Display-Ausgabe.
Die Bezeichnung GPU hat dann schon fast keine Bedeutung, bzw. dient nur noch als grobe legacy Kennzeichnung.
Mit der Grund wieso teilweise einfach nur von xPUs geredet wird.
eastcoast_pete
Commander
- Registriert
- Juni 2020
- Beiträge
- 2.649
Jetzt kommt es vor allem auf die Softwareunterstützung an. Bei der Rohleistung der Hardware ist wohl im Moment mindestens Gleichstand. Die jetzt angekündigte Allianz mit Anthropic lässt zumindest hoffen, daß sich auch bei der Software einiges tut.
Mal sehen wie Nvidia reagiert.
Mal sehen wie Nvidia reagiert.
SaschaHa
Rear Admiral
- Registriert
- Nov. 2007
- Beiträge
- 5.525
Durchaus möglich, aber de facto ist das dann wieder ein gewisses Risiko. Wenn man damit professionell arbeiten will, ist es fatal, wenn das nächste Software-, Treiber- oder Kernel-Update plötzlich wieder zu Problemen führt.ETI1120 schrieb:Hinzu kam, dass es Fälle gab an denen die Hardware an sich gut ausgelastet wurde, aber dass kleine Änderungen an der Software bewirkt haben, dass die Hardware plötzlich deutlich schlechter ausgelastet wurde. Ich denke das ist mit alltagsstabil gemeint.
Beispiel: ComfyUI with ROCm became so slow, it's not usable (vor einem Monat)
Insgesamt werden solche Probleme deutlich weniger und ROCm nun tatsächlich eine Alternative zu CUDA, aber es mangelt eben noch ein wenig an Konsistenz. Da erhoffe ich mir in den nächsten Monaten weitere Verbesserungen.
Die neuste Version scheint ziemlich gut zu sein: ROCm 7.14.0 is fast (vor 7 Tagen)
Naja, in vielen Bereichen ist es ein Quasi-Monopol, da man für bestimmte Anwendungen eben an Nvidia gebunden war. Das wird sich dann hoffentlich ändern, sobald die Unterstützung für ROCm flächendeckend verfügbar ist und ordnungsgemäß funktioniert. Da hat sich zwar enorm viel getan, aber einige Baustellen gibt es halt noch.ETI1120 schrieb:NVIDIA hat einen sehr hohen Marktanteil aber kein Monopol.
CDNA hatte aber nie die Bezeichnung "L0-Cache" oder? Da war doch immer die klassische L1 und L2 Struktur.Locuza schrieb:Auf WGP-Ebene fusioniert CDNA5 den LDS (Local Scratchpad Memory) mit den 2x L0 Caches zu einer neuen 384 KB Speicherstruktur.
Aber interessant, was du über RDNA 4 sagst. Damit konnte ich mich bei Erscheinen nicht im Detail befassen und hatte nicht bemerkt, dass der L1-Cache entfernt wurde. Überrascht mich, ehrlich gesagt.