Jackery IFA Fireplace

RTX 4090 mit Black Screen Crash (Windows/Linux)

iSource

Lt. Junior Grade
Registriert
Juli 2009
Beiträge
335
1. Nenne uns bitte deine aktuelle Hardware:
  • Prozessor (CPU): AMD Ryzen 9 7950X3D
  • Arbeitsspeicher (RAM): G.Skill Trident Z5 DDR5-6000 (F5-6000J3040G32) (2x 32 GB)
  • Mainboard: ASUS ROG Strix X670E-E Gaming WiFi
  • Netzteil: Corsair HX1000i ATX 3.1
  • Gehäuse: Lian Li O11 Dynamic EVO XL
  • Grafikkarte: ASUS ROG Strix GeForce RTX 4090 OC
  • HDD / SSD: Samsung 990 Pro (2 TB) / WD Black SN850X (2x 4 TB)
  • Weitere Hardware, die offensichtlich mit dem Problem zu tun hat (Monitormodell, Kühlung usw.):
    • "Monitor" ist so gesehen ein Denon AVC-X3800H (per HDMI) hinter dem wiederum ein Samsung S95F hängt.
    • Kühlung: Das komplette System wird mit einer Custom Loop und ext. Radiator gekühlt.
  • Wird ein sog. "PCIe Riserkabel" genutzt? Nein, klassische horizontale Montage direkt im PCIe Slot.
Das System wird so seit über drei Jahren stabil/problemlos und ohne Änderungen an der Hardware betrieben, sowohl mit Windows als auch Linux.



2. Beschreibe dein Problem. Je genauer und besser du dein Problem beschreibst, desto besser kann dir geholfen werden (zusätzliche Bilder könnten z. B. hilfreich sein):

Ich habe seit dieser Woche leider das Problem, dass sich regelmäßig und plötzlich das komplette Videosignal verabschiedet. Will heißen:
  • Der Monitor wird aufgrund des Signalverlusts kurz schwarz und zeigt kurz darauf dann die "keine Quelle" Meldung.
  • In den Details des AVR/AVC kann man sehen, dass auf dem entsprechenden HDMI Port ab dann kein Signal mehr anliegt.
  • Diese Situation lässt sich bisher ausschließlich über einen kompletten Neustart des Systems beheben.
Das Verhalten lässt sich sowohl innerhalb Windows 11 als auch Linux (aktuell CachyOS) beobachten, weshalb sich ein Software-/Treiberproblem - leider - nahezu ausschließen lässt.

Wichtiges Detail zu der Situation: Das Problem betrifft ausschließlich die Bildausgabe bzw. die GPU als Ganzes. Das restliche System läuft weiter, im weiteren Sinne sogar funktionsfähig. Um die Aussage zu verdeutlichen:
  • Windows: Das System reagiert (auch wenn man nichts mehr sieht) noch auf sämtliche Eingaben. So ist es u.a. problemlos möglich mit einem Knopfdruck auf den Power-Knopf des Gehäuses das System sauber herunterzufahren (Button ist in den Energiesparoptionen entsprechend so belegt).
  • Linux: Auch hier läuft das System - abgesehen von der abgestürzten GPU - ebenso weiter. Eine SSH-Verbindung (von einem Drittsystem) ist ohne Einschränkungen möglich.
Nicht so ein lustiger "fun fact" zu Linux: CachyOS (was ich aktuell nutze) zeigt per Default ja via 'fastfetch' die gesammelten Systeminfos beim Starten einer Shell an. Sobald die GPU sich verabschiedet hat und man dann wie erwähnt per SSH auf das System zugreift, hängt er nach dem Login beim Starten der Shell an der Stelle, bei der regulär die Werte zum "Display" angezeigt werden würden.

Zur Veranschaulichung:
1788893194575.png


Hier hängt er dann an der Stelle nach "Shell", wie gesagt also beim Auslesen der Informationen zum Display. Das kann man dann zwar via [Ctrl]+[C] überspringen, ist aber ein weiteres Anzeichen dafür, dass seitens GPU etwas gravierend im Argen liegt.

Weitere Details:
  1. Keine weiteren Anzeichen vorhanden (Geräusche, Temperatur, Artefakte, etc.)
    • Ich habe zu keinem Zeitpunkt vor dem Auftreten des Problems andere Anzeichen, dass es ein Problem gibt. Somit keine abweichende Geräuschkulisse (also bspw. plötzliches Auftreten oder komplettes Verschwinden des Spulenfiepens, Temperaturanstieg/-abfall, Grafikfehler/Artefakte oder dergleichen).
    • Sobald das Problem allerdings aufgetreten ist, hört bspw. schlagartig das Spulenfiepen auf.
  2. Problem vorrangig (aber nicht zu 100% nur) unter Last
    • Wenn ich ausschließlich auf dem Desktop unterwegs bin (mit leichter Browserlast, sprich keine Videos), braucht es sehr lange (teilweise mehrere Stunden), bis einen die GPU verlässt - sofern es überhaupt passiert.
    • Wenn Videos involviert sind (YouTube, Prime App, etc.) kann es innerhalb weniger Minuten passieren oder etwas länger dauern. Aber es ist absehbar, dass es passiert.
    • Sobald "richtig" Last auf der GPU anliegt (wahlweise zum Beispiel UE5 Projekte / Spiel / OCCT), kann man die Minuten an zwei Händen abzählen, bis es dunkel wird.



3. Welche Schritte hast du bereits unternommen/versucht, um das Problem zu lösen und was hat es gebracht?
  1. Test mit zwei unterschiedlichen Betriebssystemen
    • Keine Veränderung, das Problem besteht weiterhin bzw. sowohl in Linux als auch Windows.
  2. Direktverbindung zum Monitor (ohne AVR dazwischen)
    • Keine Veränderung, hätte ich aber auch nicht anders erwartet. Trotzdem gemacht, einfach um hier den Punkt als Ursache auszuschließen.
  3. G-Sync aus
    • Keine Veränderung, das Verhalten zeigt sich mit und ohne aktivem G-Sync.
  4. Refresh Rate auf 60 Hz runtergesetzt
    • Keine Veränderung, das Verhalten zeigt sich bei allen statisch konfigurierten Werten von 60-120 Hz.



Warum habe ich dieses Thema erstellt?

Ich hoffe in erster Linie, dass ihr mir bei der weiteren Fehlersuche helfen könnt.

Auch wenn ich mir unterbewusst gerne weiter einreden würde, dass ich das Problem "so" gelöst bekomme: Allein schon die Tatsache, dass unter Linux und Windows das gleiche Verhalten zu beobachten ist, lässt stark darauf schließen, dass sich hardwaretechnisch bei meinem System was verabschiedet hat.
  • Mein Gefühl geht aktuell noch sehr stark in Richtung GPU selbst. Ein oder mehrere VRMs/MOSFETs wären für das Fehlerbild (soweit ich das beurteilen würde) nicht ganz untypisch.
  • Theoretisch könnte es aber auch das Netzteil sein. Meiner Erfahrung nach spricht da aber das nach dem Black Screen ansonsten weiterlaufende Gesamtsystem dagegen - ich würde hier bei PSU-Problemen erwarten, dass sich hier mehr verabschiedet und ich nicht noch einwandfrei per SSH auf dem System alles machen kann.
Das Thema ist nur, dass nicht zuletzt aufgrund der Custom Loop es nicht mit "mal eben" umbauen getan ist.

Um den eh schon maximal bescheidenen Kosten- und Umbauaufwand also irgendwie noch niedriger zu halten, wäre es mega, wenn ihr mir ein paar Tipps geben könntet bzgl. Eingrenzung und Troubleshooting (also konkret bspw. ob ich über 'dmesg' nach bestimmten Einträgen suchen kann) und/oder eure Einschätzungen mitteilen würdet.

Der Mist kommt echt zur Unzeit, vor allem zeitlich - aber markttechnisch natürlich auch grad die beste Zeit (</s>) für Ersatzhardware ausgesucht.

So oder so, für Hilfe in der Not wäre ich sehr dankbar! 🙂
 
Könnte auch Board oder CPU sein.
Die Karte im anderen PCIe Slot montieren wird vermutlich nicht möglich sein wegen der Wakü?
 
Mojo1987 schrieb:
Karte im anderen PCIe Slot montieren wird vermutlich nicht möglich sein wegen der Wakü?
Leider genau das, richtig... 😞

Mojo1987 schrieb:
Könnte auch Board oder CPU sein.
Bei dem übrigen Verhalten oder eher Nicht-Verhalten (sprich: "Es läuft alles andere weiter als wäre nichts gewesen.") würdest du die zwei Komponenten tatsächlich auch noch als Ursache sehen? 😳

Nicht falsch verstehen, gerne her mit deinen/euren Eindrücken. Aber das wäre schon ziemlich krass, würde ich so absolut nicht erwarten.
 
Display Port statt HDMI mal probiert mit dem Monitor direkt?
Die anderen HDMI Ports auch probiert?
 
Tornhoof schrieb:
Display Port statt HDMI mal probiert mit dem Monitor direkt?
Der OLED (bzw. genauer die dazugehörige Connect Box) hat keinen DisplayPort, das fällt also leider raus.

Tornhoof schrieb:
Die anderen HDMI Ports auch probiert?
Das habe ich tatsächlich noch nicht versucht und kann ich nachholen.
 
Leider nein, kann nur direkt an den OLED oder halt - wie normal - über den AVR.

An demselben HDMI-Kanal (OLED-seitig) hängt per AVR aber ein Notebook dran, also Signal ist sofort verfügbar, sobald ich das Notebook umschalte bzw. umstecke.
 
Auch wenn eine Custom Wakü verbaut ist würde ich doch einmal hier Temperaturen unter Last posten, HWInfo 64, mal Furmark 2 anschmeißen. Und ggf. auch das Netzteil als Fehlerquelle in Betracht ziehen.

älteren Treiber probieren.
 
Viper1982 schrieb:
Auch wenn eine Custom Wakü verbaut ist würde ich doch einmal hier Temperaturen unter Last posten
Hätte ich oben schon genauer beschreiben können, ich hatte es nur angerissen, sorry.

GPU liegt unter Stresstest (OCCT) zum bzw. kurz vor dem Black-Screen-Zeitpunkt bei
  • ~48 °C (Chip)
  • ~52 °C (VRM)
  • ~63 °C (VRAM Junc.)
Bei der CPU sind wir bei ~67 °C (Tctl/Tdie) und RAM bei ~43 °C.

Rest (also Board/VRMs/etc.) ist ebenfalls analog dazu unauffällig.

Viper1982 schrieb:
ggf. auch das Netzteil als Fehlerquelle in Betracht ziehen
Jupp, ist wie gesagt auch in meiner Shortlist.

Viper1982 schrieb:
älteren Treiber probieren
Lief unter Windows sogar noch unter dem letzten 5xx Treiber, habe im Zuge der Probleme erst gestern aktualisiert - leider also auch das schon berücksichtigt.
 
"Diese Situation lässt sich bisher ausschließlich über einen kompletten Neustart des Systems beheben."
Dieser Satz ist vermutlich falsch. Du würdest einen Neustart machen und das Problem wäre weg.
Es kommt doch wieder. Ist also nicht behoben.

Ok. Alles was überflüssig ist erstmal abmachen (Notebook). Auch den AVC.

Das ein Wechsel der Graka nicht geht, halte ich auch für fragwürdig. Vermutlich ist es Dir zu aufwendig.

Alles spricht für ein Hitzeproblem.

CPUs und Boards eher unanfälliger.

GPUs und Netzteile eher anfällig. Ich würde mit dem Netzteil anfangen (alle Steckverbindungen kontrolliert).
Dann ne andere GPU. Musst Du alles zerlegen und ohne Gehäuse aufbauen. Das ist ne Menge Arbeit.
Vielleicht hast Du Glück und es ist das NT.
 
Danke für deinen Post. 👍

mannefix schrieb:
Dieser Satz ist vermutlich falsch.
mannefix schrieb:
Es kommt doch wieder. Ist also nicht behoben.
Der Teil ist aber jetzt schon etwas kleinlich. 😉

Ich behebe - wie in dem Abschnitt beschrieben - die spontan entstandene Situation, dass das System bzw. die GPU kein Signal mehr liefert, durch einen Neustart. Da steht nichts davon, dass ich das Problem "löse".

mannefix schrieb:
Alles was überflüssig ist erstmal abmachen (Notebook). Auch den AVC.
Richtig - das ist wie im Fragebogen unter Punkt 3 geschrieben auch schon passiert, da ich das ebenfalls sicher ausschließen wollte.

mannefix schrieb:
Das ein Wechsel der Graka nicht geht, halte ich auch für fragwürdig. Vermutlich ist es Dir zu aufwendig.
Da geht's weiter. 😐 Auch das stimmt nicht mit dem überein, was ich geschrieben habe (ganz abgesehen von der dezenten Unterstellung).

Ich habe nur beiläufig erwähnt, dass es bei einer Custom Loop durchaus problematischer ist, "mal eben" bspw. eine GPU zu tauschen, die komplett in den Kreislauf eingebunden ist. Diejenigen, die hier über eine vollständige Wasserkühlung der Marke Eigenbau verfügen, wissen, wie der Satz gemeint ist. 😉

Aber allgemein bzw. für dich: GPU aus einem integrierten Loop rausholen heißt bei anderer GPU entweder
a) Ersatz-GPU zusätzlich mit passendem Waterblock ausstatten (was bei einigen nicht ohne Garantieverlust geht und Online-Händler als Teilelager zu missbrauchen bzw. "geplante Retoure" bin ich absolut kein Freund von) oder​
b) kompletten Loop aufbrechen und Schläuche neu routen für den Testlauf.​

Der Satz "es geht nicht mal eben so" hat also Bestand, bedeutet zeitgleich aber nicht, dass es mir zu aufwendig ist (was ich nirgends behauptet habe). Von "Wechsel der Graka geht nicht" habe ich ebenso nichts geschrieben.

Jedenfalls hoffe ich hier vor allem auf weitere Einschätzungen und Brainstorming zur besseren Isolation des Problems. 🙂

mannefix schrieb:
Alles spricht für ein Hitzeproblem.
Was genau von dem beschriebenen Verhalten spricht für dich für ein Hitzeproblem? (ernst gemeinte Frage)

Die Temperaturen (s. auch Ergänzung in Post #9) liegen allesamt deutlich unterhalb jeglichem kritischen Bereich.

mannefix schrieb:
GPUs und Netzteile eher anfällig.
So auch meine bisherige Erfahrung und Einschätzung in dem konkreten Fall. Daher war auch meine Frage an die Community hier, welche Wege es evtl. noch gibt, das ganze noch weiter einzugrenzen.

mannefix schrieb:
Ich würde mit dem Netzteil anfangen (alle Steckverbindungen kontrolliert).
Ich interpretiere deinen Satz so, dass du den Fehler primär bei einem gelösten Steckkontakt und nicht bei einem Defekt des Netzteil siehst, richtig? Hier sprichst du von den Steckverbindungen.

mannefix schrieb:
Vielleicht hast Du Glück und es ist das NT.
Denn hier meinst du dann (so lese ich es), dass es das Netzteil sein könnte, also doch ein Defekt, korrekt?

Jedenfalls sehe ich das auch als eine Möglichkeit, die zudem auch nicht bedeuten würde, dass ich sofort den Loop aufbrechen muss. Bevor ich jedoch auch "nur" das Netzteil angehe, wollte ich trotzdem auf die guten Erfahrungen vieler Leute hier warten.
 
Ich würde ein neues Netzteil testen und falls es das Problem nicht behebt, es eben wieder zurück schicken.
 
würde auch Netzteil sagen, aber vielleicht auch mal nen älteren Treiber testen falls nicht schon getan
 
Moin, kannst du die Karte ziehen und hängen lassen ohne den lopp zu öffnen? Dann könnte man noch testen ob die igpu auch zicken macht.

Ich tippe aber auf Karte, slot oder ggf CPU hat ne PCIe Thema.
 
Joah, also mal den PC direkt an den OLed stecken ohne AVR oder was dazwischen.

Ein anderes Kabel zu versuchen kann auch nicht schaden.

mal den PCIE Modus auf 4.0 / 3.0 stellen
 
Die Temperaturen sind es nicht und der Monitor auch nicht. Er hats ja mit AVR dazwischen versucht, letztlich agiert der wie ein (zweiter) Monitor.

Was scheinbar passiert nach den vorliegenden Infos ist das die Karte schlichtweg "ausgeworfen" wird im laufenden Betrieb. Deshalb auch mein Hinweis auf Board und CPU, das könnte auch ein PCIe Thema sein und das wäre auch nicht der erste X3D der vllt. am sterben ist.

Fakt ist aber auch, ohne Komponententests und Austauschhardware kann man das schlichtweg nicht sicher sagen, dazu fehlt es der Hardware selbst an entsprechenden Diagnostik Möglichkeiten.

Das einfachste im Moment wäre es, ein anderes NT zu testen und das ggf. auszuschließen. Danach bleibt dir aber nix anderes übrig als den Custom Loop zu öffnen um weiter verfahren zu können.

Ich würde dann schauen ob ich irgendwo eine GPU geliehen bekommen, am wahrscheinlichsten ist ein defekt dieser selbst.
 
  • Gefällt mir
Reaktionen: Drahminedum
iSource schrieb:
Hätte ich oben schon genauer beschreiben können, ich hatte es nur angerissen, sorry.

GPU liegt unter Stresstest (OCCT) zum bzw. kurz vor dem Black-Screen-Zeitpunkt bei
  • ~48 °C (Chip)
  • ~52 °C (VRM)
  • ~63 °C (VRAM Junc.)
Bei der CPU sind wir bei ~67 °C (Tctl/Tdie) und RAM bei ~43 °C.

Rest (also Board/VRMs/etc.) ist ebenfalls analog dazu unauffällig.
iSource schrieb:
Sobald "richtig" Last auf der GPU anliegt (wahlweise zum Beispiel UE5 Projekte / Spiel / OCCT), kann man die Minuten an zwei Händen abzählen, bis es dunkel wird.
Das Verhalten was du beschreibst kenne ich bzw. erlebe ich selbst gerade.
Mein Patient ist aber eine 6800XT. Die Probleme fingen im Juni an, vorher lief die Karte seit Ende 2022 völlig problemlos vor sich hin.

Die Symptome sind fast die gleichen. Wenn ich im Furmark GPU und CPU Stresstest nacheinander laufen lasse stürzt das System ab. Bildschirm wird schwarz --> nach ein paar Sekunden Reboot oder ich muss manuell nachhelfen.
Im Windoof Ereignis Log steht zwar das immer wieder das ein anderer CPU Kern die Probleme macht (WHEA Log) aber nachdem ich aus meinem anderen System die 6700XT verbaut habe ist Ruhe im Karton.
Vorher habe ich alle möglichen Faktoren ausgeschlossen.
  • BIOS Reset (BIOS ist aktuell)
  • Undervolting von der CPU entfernt
  • RAM von 3600 auf 3200 gesetzt
  • Netzteil getauscht
  • Grafikkarte ohne OC laufen lassen (auch das Silent Bios aktiviert)
  • Windoof komplett neu installiert.

Das Fehlerbild ist immer das gleiche. Bekommt die Karte Last folgt der Reboot (mit Blackscreen) mal nach 5 Minuten oder 20 Minuten. Temperaturen der CPU und GPU sind unauffällig.
Verbaue ich aber die 6700XT und "quäle" diese passiert gar nichts. Mein System kann 24/7 laufen ohne Abstürze und der gleichen. Das die 6700XT etwas weniger Leistung als die 6800XT hat ist mir klar.
Ich bin vor ein paar Tagen auf den Youtube Kanal von LetsFix gestoßen.
Ich überlege ob ich meine 6800XT einschicke und durchprüfen lasse. Nur so als Gedanke.....
 
Hatte mal ein ähnliches Problem. Bei mir lag es am Netzteil. Die 12 V Schiene der GPU ist da immer mal eingebrochen und die GPU hat abgeschaltet, während der restliche PC weiter lief. Das ganze war lastunabhängig. Hatte immer den Treiber im verdacht, da ne neue Windows Installation gefühlt Abhilfe verschafft hatte. Das Problem trat aber immer wieder auf. Hatte mir dann einfach mal ein neues Netzteil geholt und es damit dann versucht und Schwupps trat das Problem nicht mehr auf. Altes Netzteil zu Bequiet geschickt und die haben mir das dann mit der 12V Spannungsversorgung der GPU erklärt. Hab dann ein neues von Bequiet bekommen und seit dem ist ruhe.
 
Ich wünsche Dir, dass es das NT ist.

Was Du mal checken kannst, wären die Ereignislogs unter WIN und dort ganz konkret nach hinweisen zu USB Port Unterbrechungen.
Erfahrungsgemäß sind die USB Lanes die ersten, die es bei Unterversorgungen erwischt und damit einen Blackscreen verursachen könnten.
Jag' doch am besten den Event Log mal durch ein KI Deiner Wahl.
 
Sapphire Forum
Zurück
Oben