Raid1 Fehlermeldung beim Booten

darkcheesy

Ensign
Registriert
Nov. 2010
Beiträge
158
Servus zusammen =)

Wie bereits im Titel erwähnt erhalte ich beim Starten meines PC eine Fehlermeldung. Was bedeutet diese für mich und was kann ich tun? Habe die letzten Wochen keine Umbauten oder Basteleien unternommen.

System:
CPU: Phenom II X4 955BE @ 3.6 @ Freezer Xtreme
Board: AM3A780GXH/128M
Ram: 4x2 GB OCZ XTC Platinum 1333
Grafik: Sapphire 6850 Crossfire
Win 7 Home Premium 64bit
Gehäuse: NZXT Phantom
Netzteil: Thermaltake Toughpower 750W

Festplatten an Board angeschlossen (onboard raid) - Siehe Bild im Anhang
Samsung HD322HJ (320GB)
Samsung HD154UI (1500GB) - Raid 1 wurden im 12/2010 verbaut

zusätzlicher Festplatten Controller incl. USB 3 (Asus U3S6) - kein Raid
2x Samsung HD204UI 2000GB

Fettes Danke im Vorraus

Cheesy

http://www7.pic-upload.de/16.05.11/jt2v7spgxo7w.jpg
 
Das sagt dir, dass dein Raid 1 degraded ist und ein Rebuild braucht.
Entweder hat sich eine der HD154UI verabschiedet und arbeitet nicht mehr oder wurde ausgebaut.
Du solltest keine Raids betreiben ohne zu wissen wie man damit umgeht, das mal am Rande!
 
Eine von den Samsung 1500GB Platten macht mist (Kabel locker oder defekt).
Da es ein Raid 1 ist einfach Platte ausbauen testen evtl. ersetzen Raid rebuild fertig.
 
sieht ja klar danach aus, als wenn eine deiner beiden platten im raid 1 versagt hat...
was soll man dazu mehr sagen?
 
Kann meinen Vorredner nur zustimmen.
Eine der Platten ist scheinbar defekt oder nicht mehr richtig angeschlossen. Mal ins Controller BIOS gehen und gucken an welchem Port sie hängt und Kabel prüfen. Wenn alles ok ist, Platte austauschen da defekt.

Ein bischen Wissen über RAID wäre schon praktisch ;)
 
Hi,

viel interessanter ist der Fakt das sich die interne Fehlerkorrektur der Desktop Festplatten mitlerweile nicht mehr deaktivieren lässt. Das führt bei einem "billig" Raid ganz schnell dazu das mal eine Platte die einen Sektorfehler hat aus dem Raid fliegt.

Das ist einer der Gründe wieso man kein Raid mit solchen Festplatten bauen sollte.
Anders sieht es bei einem reinen Software Raid aus bei dem die Logik die Fehlerkorrektur der Festplatte abwartet.

Ein Hardware Raid Controller degraded ein Raid in der Regel nach 7-15 Sekunden wenn die Festplatte bis dahin den Fehler nicht korrigieren konnte. Ein Hardware Raid Controller übernimmt die Fehlerkorrektur die sich bei den teuren HDD's abschalten lässt.

Wie lang hat dieses Raid1 bei dir bislang gehalten?
Ich wette das passiert dir häufiger, was extrem nervig sein kann wenn der Verbund groß ist ;)


Gruß X23
 
Zuletzt bearbeitet:
Wer lesen kannist auch im Vorteil. Es steht ja genau in der Beschreibung was passiert ist. Les mal bei Wiki zum Thema Raid nach bevor Du hier völlig zerlegt wirst.
 
Hi,

Nitewing schrieb:
Wer lesen kannist auch im Vorteil. Es steht ja genau in der Beschreibung was passiert ist. Les mal bei Wiki zum Thema Raid nach bevor Du hier völlig zerlegt wirst.

du hast keinen Plan:

Time Limited Error Recovery (TLER) für sicherere RAID Systeme mit Consumer HDDs

Western Digital Information Sheet (http://www.wdc.com/en/library/sata/2579-001098.pdf)

Entsprechende ähnliche Technologien der Mitbewerber:
Seagate: Error Recovery Control (ERC)
Samsung, Hitachi: Command Completion Time Limit (CCTL) (http://www.samsung.com/global/busine...urce_CCTL.html)

Im folgenden nenne ich gewöhnliche Festplatten wie sie aus PCs bekannt sind der Einfachkeit halber "ConsumerHDDs" und solche für Servereinsatz "EnterpriseHDDs". Ich beziehe mich in diesem Post nur auf Western Digital. Ob es ähnliche Möglichkeiten für Seagate, Samsung oder Hitachi gibt ist mir nicht bekannt.


Sinn, Zusammenfassung (gilt für alle o.a. Technologien)

in Kurzform:
Grundsätzlich gibt es ConsumerHDDs und EnterpriseHDDs. Sie unterscheiden sich in einigen Punkten voneinander, u.a. auch in der Art wie Schreib/Lese- Fehler korrigiert werden.

RAID Systeme, wie sie in Servern verwendet werden speichern Daten redundant, deswegen werden bei einem festgestellten Plattenfehler die Daten anderweitig rekonstruiert und der Fehler zu einem beliebigen späteren Zeitpunkt behoben. Die EnterpriseHDDs haben deswegen nur rudimentäre eigene Fehlerkorrekturen implementiert (der RAID Controller kümmert sich darum). Wichtig ist hier, die Daten auch in diesem Fall schnell bereit zu stellen.

Normale PCs verfügen nicht über RAID Systeme, wenn hier ein Fehler der ConsumerHDD vorliegt muss diese selbst für Korrektur sorgen. Wichtig ist hier die Daten zu erhalten, egal wie lange es dauert (Fehlerkorrekturen können hier Minuten dauern!).

Konfliktpotential ergibt sich bei Verwendung von ConsumerHDDs zusammen mit RAID Controllern, die einen Reparaturversuch als Totalversagen der Festplatte interpretieren, wenn eine gewisse Timeout Zeit überschritten wird (i.d.R. 7-15s). Die entsprechende Festplatte wird als defekt markiert und aus dem RAID Verbund entfernt (was mindestens zu größeren Unannehmlichkeiten führt, im schlimmsten Fall zum Datenverlust).

Der Sinn von TLER (und den o.a. Technologien der Mitbewerber) ist nun, bei Festplatten die internen Korrekturversuche nach einer bestimmten Zeit abzubrechen, damit die Festplatte nicht aus dem RAID Verbund ausgegliedert wird.


Und hier das Ganze nochmals in etwas ausführlicherer Form:
Ein wesentlicher Unterschied zwischen ConsumerHDDs und EnterpriseHDDs liegt darin, dass EnterpriseHDDs praktisch ausschließlich an RAID Controllern im RAID Verbund benutzt werden (RAID 1,5,10... und auch RAID 0, obwohl es streng genommen kein RAID ist).

RAID Controller besitzen Strategien, wie mit Schreib/Lese- Fehlern umgegangen wird. Sie übernehmen i.d.R. die Korrektur auftretender Fehler. Sie sind daher wenig "geduldig", wenn eine Festplatte in einer bestimmten Zeit nicht antwortet. Die Zeit, ab welcher ein RAID Controller eine Festplatte bei nicht eintreffender Antwort als defekt einstuft liegt zwischen 7 und 15 Sekunden.

EnterpriseHDDs brechen eigene Korrekturversuche deswegen auch nach kürzerer Zeit ab (der RAID Controller wird den Defekt später reparieren). Die gewünschten Daten sind im RAID Verbund (ausser RAID 0) redundant vorhanden und werden vom Controller anderweitig besorgt. Der aufgetretene Fehler der entsprechenden Festplatte wird protokolliert und zu gegebener Zeit (unter geringeren Lastzuständen) vom Controller repariert.

Zu einem unschönen Effekt kann es kommen, wenn ConsumerHDDs im RAID Verbund gruppiert werden, was ja angesichts der sinkenden Preise immer häufiger vorkommt. Diese Festplatten versuchen nach wie vor, auftretende Schreib/Lese- Fehler selbst zu korrigieren. Da im typischen Anwendungsgebiet der ConsumerHDDs nicht von einer Datenredundanz ausgegangen werden kann, sind die Strategien dieser ConsumerHDDs gründlicher und ausführlicher (zeitraubender), eben um das Risiko verlorener Daten zu vermindern.

Dabei kann aber auch viel mehr Zeit verbraucht werden als die oben genannten 7 Sekunden.

Die Konsequenz daraus ist, dass ein RAID Controller, der mit ConsumerHDDs zusammen betrieben wird, den intern bei einer ConsumerHDD gestarteten Korrekturversuch bei einem Schreib/Lese- Fehler als Ausfall dieser Festplatte interpretiert (wenn sie länger als 7 Sekunden nicht reagiert) und die betreffende Festplatte aus dem RAID Verbund ausgliedert.

Die Folge ist im schlimmsten Fall ein vollkommen zerstörtes RAID oder eben die Notwendigkeit, die vermeintlich defekte Festplatte wieder in das RAID zu integrieren (was je nach Festplattengröße viele Stunden dauern kann). Wird während dieser Zeit weiterhin mit dem RAID Verbund nebenbei gearbeitet, so steigt die Wahrscheinlichkeit, dass genau in dieser Integrationsphase ein weiterer Fehler stattfindet stark an (ein RAID 5 verkraftet z.B. nur den Ausfall einer Festplatte, danach sind die Daten verloren).

Man kann diesem Problem natürlich aus dem Weg gehen, indem man nur die entsprechenden EnterpriseHDDs bzw. RAID-Editions der Festplattenhersteller kauft. Allerdings sind sich wohl die wenigsten Anwender dieses Problems überhaupt bewusst. Zudem werden EnterpriseHDDs bzw. die RAID-Editions der ConsumerHDDs zu höheren Preisen verkauft. Die EnterpriseHDDs unterscheiden sich zwar noch in weiteren Kriterien von den ConsumerHDDs, aber zum stabilen Betrieb in einem RAID 1 oder 5 ist das Unterbinden der ausführlichen Fehlerkorrekturen wohl die beste Maßnahme und das ist der Sinn der TLER Technologie (und der ähnlichen Technologien der Mitbewerber).


Abhilfe ist bei einigen Western Digital ConsumerHDDs möglich:

nach meiner Recherche sind diese Typen mit der TLER Technik ausgestattet, diese ist jedoch deaktiviert, da die Platten als Consumer HDDs ausgelegt sind:


WD3200KS
WD5000KS
WD10EACS
WD6400AAKS
WD7500AACS
WD1001FALS
WD5000AAKS

...na dann zerleg mich mal!
oder schreib lieber was mit Argumenten...


Gruß X23
 
Zuletzt bearbeitet:
X23^Piracy schrieb:
viel interessanter ist der Fakt das sich die interne Fehlerkorrektur der Desktop Festplatten mitlerweile nicht mehr deaktivieren lässt. Das führt bei einem "billig" Raid ganz schnell dazu das mal eine Platte die einen Sektorfehler hat aus dem Raid fliegt.

Das war auch meine Vermutung, Stichwort TLER. Die Platte hat 7 Sekunden Zeit um einen Fehler zu korrigieren und meldet es dann an den Controller um Hilfe zu erhalten. Wenn kein TLER aktiv ist, dann rödelt die fleissig weiter, reagiert aus Sicht des Controllers nicht und fliegt dann aus dem Array.

Technisch hat das aber (jetzt) keine Bedeutung mehr, außer das man die "ausgefallene" Platte mal an nem anderen Rechner testen und dann vielleicht das Array darauf rebuilden kann.
Mit dem Risiko, dass das während des Rebuilds nochmal passiert. Das Spiel kann man bei einem Raid 1 aber zum Glück so lange gefahrlos treiben wie die erste Platte noch einwandfrei läuft :)

Achja, wenn du dir mal die Timestamps von deinem und von nitewings Post anschaust, dann wirst du feststellen, dass er vermutlich nicht dich meinte ;)
 
Hi,

DunklerRabe schrieb:
Achja, wenn du dir mal die Timestamps von deinem und von nitewings Post anschaust, dann wirst du feststellen, dass er vermutlich nicht dich meinte ;)

dann kann meine soeben noch vorhandene angepisstheit übersehen werden :)

DunklerRabe schrieb:
Technisch hat das aber (jetzt) keine Bedeutung mehr, außer das man die "ausgefallene" Platte mal an nem anderen Rechner testen und dann vielleicht das Array darauf rebuilden kann.
Mit dem Risiko, dass das während des Rebuilds nochmal passiert. Das Spiel kann man bei einem Raid 1 aber zum Glück so lange gefahrlos treiben wie die erste Platte noch einwandfrei läuft :)

Das soll nur eine Warnung sein ein Raid mit Desktopfestplatten zu betreiben bei denen es nicht möglich ist die Fehlerkorrektur an oder aus zuschalten.

Ein Raid soll Sicherheit bieten und nicht weil man einen groben Fehler aus Unwissenheit macht ständig auseinanderfliegen.

Die Festplattenhersteller haben ja erkannt das Desktopfestplatten bei denen man genau das tun kann sehr attraktiv sind um ein günstiges Raid zu bauen, dem wird ja seit einiger Zeit ein Riegel vorgeschoben damit die User zu den doppelt so teuren Enterprise HDD's greifen müssen.

Ich hatte aus unwissenheit vor 3 Jahren doch genau den selben Mist mein Raid 1 mit 250GB WD Festplatten ist regelmäßig degraded... irgendwann wußte ich dann warum ;)

Unser Hilfesuchender Unglücksrabe sollte mal prüfen ob er bei seinen Festplatten die Fehlerkorrektur noch manipulieren bzw. die FW flashen kann.

EDIT:

Mit deinen Samsung Festplatten kann man an CCTL rumspielen (setzt englisch Kenntnisse vorraus):
http://forums.storagereview.com/index.php/topic/28333-tler-cctl/page__view__findpost__p__260008


Gruß X23
 
Zuletzt bearbeitet:
Alternate 1
Zurück
Oben