Jackery IFA Fireplace

News CXL Memory Module: Kioxias Heilsbringer gegen DRAM-Knappheit wird bald bemustert

MichaG

Redakteur
Teammitglied
Registriert
Juli 2010
Beiträge
14.882
  • Gefällt mir
Reaktionen: TPD-Andy, konkretor, K3ks und eine weitere Person
ich kaufe teuren, proprietären Flash, um teuren DRAM zu ersetzen/entlasten?!?
 
  • Gefällt mir
Reaktionen: Crimvel
Entlastung für Serverkunden. Das wollte bestimmt jeder hier jetzt lesen :D
 
  • Gefällt mir
Reaktionen: Beitrag, TPD-Andy, drago-museweni und 2 andere
Technisch am ehesten mit einer SSD vergleichbar, wird aber nicht die klassische PCIe-Schnittstelle genutzt, sondern stattdessen der direkte Weg zur CPU via Compute Xpress Link (CXL) gesucht. Letztlich basiert CXL aber auch auf PCI Express, sodass es eine technische Verwandtschaft gibt.
Wait a minute...! :freak:

Aus "wir erweitern den RAM mit mehr RAM über eine langsamere Schnittstelle" wird "wir erweitern den RAM mit einer langsameren Technologie über eine langsamere Schnittstelle".

Damit ist das eine PCIe-SSD, auf die man RAM-Zugriffe auslagert. Voll die gute Idee, die garnicht nach Verzweifelung schreit, zumal Flash ja bekanntweise auch in rauhen Mengen günstig zu haben ist. Oh, wait... :rolleyes:

Die haben alle einen Knall.

Das bringt halt auch zusätzliche Komplexität in das Gesamtsystem. Selbst mit DRAM war CXL ja bisher kein richtiges Massenprodukt. Und weitere Geschwindigkeitsstufen zwischen Memory und Storage einzuführen hat ja in der Vergangenheit auch schon super geklappt. Erinnert sich überhaupt noch jemand an 3DXPoint und Optane?
 
Optane, Hybrid-HDDs und nun XL-FLASH – Ansätze, die versuchen, die Lücke zwischen den klassischen Speicherklassen zu schließen. Für bestimmte Anwendungen und gerade bei den aktuell hohen DRAM- und NAND-Preisen kann XL-FLASH durchaus sinnvoll sein.
Ob sich daraus allerdings ein breiter Markt entwickelt bezeweile ich aber stark.
 
Khorneflakes schrieb:
Die haben alle einen Knall.
Es gibt zu wenig DRAM.

Also sucht man nach Wegen Systeme mit weniger DRAM betreiben zu können.

Man wird sehen ob Kioxia jemand von diesem Konzept überzeugen kann.

Aber ja ich hätte jetzt auch lieber News gelesen dass Kioxia mit ihrer alternativen Speicherzelle vorankommt und bald in Produktion geht.

Es gibt viele Meldungen dann die Specs von AI Beschleunigern überarbeitet werden und die Menge an HBM reduziert wird. Die Hersteller bekommen nicht genug DRAM. Also müssen Alternativen her.
 
ETI1120 schrieb:
Es gibt zu wenig DRAM.

Also sucht man nach Wegen Systeme mit weniger DRAM betreiben zu können.
Nein, man lagert einfach nur DRAM Aufgaben auf andere Art Speicher aus. Das ist ein Unterschied.

Nach dem Motto "Wenn wir kein Brot haben, dann essen wir eben Kuchen."
An dem Grundproblem ändert sich dadurch überhaupt nichts. Es muss schlicht mehr DRAM produziert werden, wenn man aus diesem Dilemma rauskommen will.
 
  • Gefällt mir
Reaktionen: cvar, konkretor und .Snoopy.
Khorneflakes schrieb:
Damit ist das eine PCIe-SSD, auf die man RAM-Zugriffe auslagert.
Naja, mit völlig anderen Spezifikationen:
In puncto Latenz ist der XL-Flash mit etwas weniger als 5 µs deutlich langsamer als DRAM, aber rund zehnmal schneller als normaler NAND-Flash. Die Haltbarkeit gibt Kioxia mit 150.000 bis 250.000 Schreibzyklen an, auch das reicht lange nicht an DRAM heran, ist aber um ein Vielfaches höher als bei Standard-NAND.
Also eigentlich nicht, auch wenn Speicherzellen und Anbindung eine Verwandschaft mit PCIe-SSDs haben.
Als ob man sagen würde: "Ein Bagger ist auch nur ein Auto." Was ja nicht völlig falsch ist.

@MichaG
Ich hätt mir im obigen Absatz mehr Prozentangaben oder absolute Werte gewünscht und weniger "etwas, deutlich, lange nicht heranreichen, vielfaches".
Klar gibt Koxia das nir so schwammig an, aber die Zahlen die ihr hattet könntet ihr mehr in einen Kontext setzen.
Khorneflakes schrieb:
Voll die gute Idee, die garnicht nach Verzweifelung schreit, zumal Flash ja bekanntweise auch in rauhen Mengen günstig zu haben ist. Oh, wait... :rolleyes:
Günstiger als DRAM. Bis die Kurven sich treffen ist es also wirtschaftlich. Und Kioxia stellt den Flsh her, an günstigen Preisen haben die per se gar kein Interesse, nur an Argumenten im Verkauf.
Aber natürlich ist das grad ne Wette auf die Entwicklung, hält die Nachfrage lange genug kann man so Gewinne mitnehmen. Ausserdem kann man sich als Speicherhersteller zur Zeit Wetten leisten würde ich annehmen.
Ergänzung ()

Neodar schrieb:
Nein, man lagert einfach nur DRAM Aufgaben auf andere Art Speicher aus. Das ist ein Unterschied.

Nach dem Motto "Wenn wir kein Brot haben, dann essen wir eben Kuchen."
An dem Grundproblem ändert sich dadurch überhaupt nichts. Es muss schlicht mehr DRAM produziert werden, wenn man aus diesem Dilemma rauskommen will.
Wen juckt das Grundproblem? Solange alle anderen Mitbewerber genauso betroffen und der Markt nicht austrocknet ist es zumindest Firmen egal.
 
Zur OS Unterstützung gibts noch keine News? Ich seh vor meinem geistigen Auge schon Custom Kernels, Workarounds, zusätzliche Dependencies, .. ah warte, die Drecksarbeit kann die KI ja dann machen. :o

Ok, KI wusste schon Bescheid:
Kurz gesagt: Ja, das erfordert Kernel-Support – aber keine proprietären „Workarounds“, sondern standardisierte CXL-/Memory-Tiering-Mechanismen, die im Linux-Kernel seit einigen Versionen upstream sind.docs.kernel+2

OS-Support im Überblick​

Linux (primär unterstützt)​

  • CXL-Typ-3-Speicher (also speichererweiternde Geräte wie Kioxias CXL Memory Module) wird im Kernel als CPU-loser NUMA-Knoten behandelt und über den CXL-Subsystem-Treiber eingebunden.docs.kernel+2
  • Der Kernel nutzt Firmware-Tabellen (ACPI CEDT/CFMWS, ggf. CDAT/HMAT) zur Entdeckung und ordnet die Geräte automatisch Memory-Tiers zu (z. B. Tier 1 = DRAM, Tier 2 = CXL-XL-Flash).docs.kernel+2
  • Für die automatische Platzierung von „heißen/kalten“ Seiten gibt es upstream-Features wie Transparent Page Placement (TPP) und gewichtete Interleaving-Mechanismen (ab Kernel ~5.18/6.9+), plus NUMA-Balancing/AutoNUMA.computeexpresslink+2
  • Verwaltung erfolgt über das etablierte NVDIMM/NDCTL/DAXCTL-Tooling (CXL baut darauf auf): Regionen/Namespaces anlegen, als System-RAM freigeben, dann übernimmt das Memory-Tiering-Framework die Restarbeit.lenovopress.lenovo+1
Praktisch heißt das: Auf aktuellen Server-Distros (RHEL/Alma/Rocky, Ubuntu LTS, SLE, Debian) mit relativ neuem Kernel (≥ 6.x) und passender Firmware sollte das Modul nach BIOS/UEFI-Freigabe als zusätzlicher Speicherknoten erscheinen; die genauen Kernel-Versionen hängen vom Vendor-Backport ab.lenovopress.lenovo+2

Windows Server / Hypervisor​

  • Microsoft hat CXL-Support für Windows Server 2022/2025 sowie Hyper-V in begrenztem Umfang angekündigt/ausgebaut, vor allem für CXL-Memory-Expansion und Persistenzszenarien; Details sind aber stark hardware-/OEM-abhängig und oft an spezifische Server-Generationen gebunden.cdrdv2-public.intel
  • Für ein XL-Flash-basiertes CXL Memory Module ist davon auszugehen, dass Windows es zunächst als spezialisiertes Speichergerät behandelt; die volle „Memory-Tiering“-Integration (automatisches Hot/Cold-Paging zwischen DRAM und CXL) ist unter Windows weniger offen dokumentiert als unter Linux und dürfte OEM-Treiber/BIOS-Features benötigen.

VMware / andere​

  • VMware vSphere hat CXL-Schienen (vSphere 8.x) für Memory-Expansion angekündigt, aber die praktische Reife variiert je nach CPU/Platform-Generation und BIOS-Unterstützung. Für ein neues XL-Flash-Modul ist eine initiale Linux-First-Evaluierung typisch.

Braucht es „große Kernel-Workarounds“?​

Nein – das Design zielt genau darauf ab, ohne proprietäre Patches auszukommen:

  • CXL definiert ein standardisiertes Device-Modell (Type 3 Memory) und Register-Layouts, die der Kernel über den CXL-Subsystem-Treiber bedient.docs.kernel+2
  • Der Kernel sieht das Gerät als NUMA-Node ohne CPUs; Performance-Attribute kommen aus Firmware-Tabellen (HMAT/CDAT), nicht aus hartkodierten Werten.kernel-internals+1
  • Die „Intelligenz“ (Hot/Cold-Erkennung, Demotion/Promotion) liegt im Memory-Tiering-Framework (TPP, NUMA-Balancing, DAMON-basierte Heuristiken), das upstream ist.computeexpresslink+2
Was in der Praxis dennoch Aufwand bedeutet:

  • BIOS/UEFI-Einstellungen: CXL Memory Mode (z. B. „1LM+Vol“ / Memory Tiering) muss aktiviert sein; manche Plattformen bieten mehrere Modi (Flat Memory, Interleave, Tiering).lenovopress.lenovo
  • Firmware-Tabellen: Damit der Kernel die Latenz/Bandbreite richtig einordnet, müssen CEDT/CFMWS/CDAT/HMAT korrekt befüllt sein – sonst landet das Gerät ggf. im falschen Tier oder wird nicht optimal genutzt.docs.kernel+2
  • Distros/Kernel-Version: Ältere LTS-Kernel ohne aktuelle CXL-/Tiering-Backports brauchen ggf. Updates oder Vendor-Kernel.lenovopress.lenovo+2

Was bedeutet das konkret für Kioxias XL-Flash-Modul?​

  • Es wird im System wie ein CXL-Typ-3-Speicherexpander behandelt, nicht wie eine klassische NVMe-SSD.docs.kernel+2
  • Unter Linux erscheint es als zusätzlicher NUMA-Knoten; mit aktiviertem Memory-Tiering verschiebt der Kernel automatisch kalte Seiten dorthin und hält heiße Seiten im DRAM.kernel-internals+1
  • Die von Kioxia genannte „80/20“-Regel (20% heiße Daten → DRAM, Rest → XL-Flash) ist exakt das Szenario, für das Memory-Tiering + TPP/AutoNUMA gebaut wurden.
 
Schinken42 schrieb:
Naja, mit völlig anderen Spezifikationen
Naja, nicht wirklich "anders", das ist nur Augenwischerei. Das ist der gewöhnliche Flash, der anderswo auch verwendet wird, aber umgestellt auf SLC.

XL-FLASH™ basiert auf der BiCS FLASH™ 3D Flash-Speichertechnologie von KIOXIA und wurde entwickelt, um Rechenzentren, Cloud-Anbietern und Unternehmen dabei zu helfen, die Anforderungen zunehmend anspruchsvoller Anwendungen zu erfüllen. XL-FLASH™ ist einfach zu verwalten und zu skalieren und verfügt übereine 128 Gigabit (Gb)-Chiplage für SLC/256 Gigabit (Gb)-Chiplage für MLC (in einem 2-Chiplagen-, 4-Chiplagen-, 8-Chiplagen-Paket), eine 4kB-Seitengröße für effizienteres Lesen und Schreiben des Betriebssystems, schnelles Lesen und Programmieren von Seiten und eine Leselatenz von weniger als 5 Mikrosekunden.
https://europe.kioxia.com/de-de/business/memory/xlflash.html

steirerblut schrieb:
Zur OS Unterstützung gibts noch keine News?
Windows Server ab 2022 und Linux Kernel ab 6.5 supporten CXL, falls das deine Frage ist. Da das ein Standard ist, erwarte ich keine separaten Angaben zum OS-Support für ein CXL-Produkt. Die Komplexität mit unterschiedlich schnellen CXL-Devices und so weiter ist das Problem des Kunden, funktionieren wird die Infrastruktur ja.
 
Khorneflakes schrieb:
Naja, nicht wirklich "anders", das ist nur Augenwischerei. Das ist der gewöhnliche Flash, der anderswo auch verwendet wird, aber umgestellt auf SLC.



https://europe.kioxia.com/de-de/business/memory/xlflash.html
Hab die Werte für Flash nicht im Kopf also werd ich dir wohl glauben müssen, dass es keinen grossen Unterschied gibt 😅. Das Zitat gibt es für mich(!) so ohne Kontext nicht her.
Genau deswegen hätte ich mir auch ne bessere Einordnung im Artikel gewünscht 🙂.
 
Also pSLC mode wie bei vielen Industriellemn laufwerken üblich gepart mit einem schnellen interface und FW optimierungen für schnelles lesen und schreiben. Power fail usw braucht man in der anwendung nicht.
 
Neodar schrieb:
Nein, man lagert einfach nur DRAM Aufgaben auf andere Art Speicher aus.
So ist es nun Mal mit der Speicherpyramide. Man schiebt die Bits nach unten zu den langsamen aber billigen Speichern.

Und Kioxia macht dafür ein Angebot. Ob es angenommen wird werden wir sehen.

Die Speicherknappheit und die Prognosen zur Speicherknappheit haben nun einen Punkt erreicht, wo alles auf den Prüfstand kommt, Algorithmen, Architekturen ...

Da ist das Angebot von Kioxia nur eine Facette.
Neodar schrieb:
Nach dem Motto "Wenn wir kein Brot haben, dann essen wir eben Kuchen."
Nein, das Brot entspricht dem NAND
Der Kuchen entspricht dem DRAM.
 
Zuletzt bearbeitet:
Wartet mal. Man kann Flash nun als RAM für Server nutzen weil DRAM zu teuer ist? Das würde ja bedeutet dass SSD Preise auch extrem teuer werden könnten.

Wir sind cooked.
 
Khorneflakes schrieb:
Damit ist das eine PCIe-SSD, auf die man RAM-Zugriffe auslagert. Voll die gute Idee, die garnicht nach Verzweifelung schreit
Sieh es nicht als DRAM ersatz, sieh es als integrierte, dedizierte swap SSD.
Je nach anwendungsgebiet legt man den RAM ja für maximalverbrauch aus während der bedarf die meiste zeit über deutlich drunter liegt.
Ich bin z.b. HDD Kind, swapping ist furchtbar, SSDs zu schnell kaputtgeschrieben (oder zumindest in absehbarer zeit) und auch zu langsam um darauf richtig zu arbeiten. Also hab ich 96 GB im Rechner. Typische auslastung sind so 15-25% bisher, manchmal auch mehr und ich finde es sehr cool einfach mal 60 GB temporär auf den RAM werfen zu können (schont die ssd und ist schnell). Das reicht mir meist als workspace für z.b. encoding etc.
Aber hier wäre so ein CXL modul durchaus eine Lösung. Zumal noch 2 DRAM Slots frei sind. Ich weiß nicht ob ich mit 32 GB klarkommen würde, aber 48 würden vermutlich schon reichen wenn ein guter Swapspace die Spitzen abfängt. Soll halt nicht ruckeln beim Spielen nur weil ich Zeug im Hintergrund laufen lasse. Wenn das deutlich günstiger wäre als die volle RAM größe wäre das schon eine Überlegung wert, besonders jetzt wo man 96 GB 6000er RAM nicht mehr für 300 € bekommt.
Wenn man die Wahl hätte 32 GB DRAM + z.b. 64 GB 'swapflash' fürs gleiche Geld zu bekommen wie 64 GB DRAM dann überlegen da sicher einige sehr ernsthaft.
Im Serverbereich kann man zum teil zumindest auch besser abschätzen was da an schreibzugriffen auf einen zukommt und damit wie lange der flash etwa durchhält. Bei 150k Schreibzyklen ist das auch was anderes als auf 'bis zu 1500 zyklen'-TLC Flash zu swappen. Wobei ... da die Module deutlich kleiner sein dürften ist der vorteil nicht ganz so groß wie er erstmal klingt
 
Khorneflakes schrieb:
Naja, nicht wirklich "anders", das ist nur Augenwischerei. Das ist der gewöhnliche Flash, der anderswo auch verwendet wird, aber umgestellt auf SLC.
Nein, ist es nicht. Steht sogar in dem Link.
Ergänzung ()

LiPpO schrieb:
Also pSLC mode wie bei vielen Industriellemn laufwerken üblich gepart mit einem schnellen interface und FW optimierungen für schnelles lesen und schreiben.
Nein. Das ist auf Hardware-Ebene ein komplett anderer Aufbau.
Sieht man sich auch schon an der Datendichte. Die ist so gering da man eine viel hohere Parallelität benötigt. Also viel kleinere Page- und Blockgrößen und viel mehr Planes.
So kommt man auf geringere Zugriffszeiten und höheren Durchsatz als bei "normalem" NAND Flash.
 
Zurück
Oben