SMART Warnung, ATA error count increased

KrawallKurt

Cadet 2nd Year
Registriert
Okt. 2017
Beiträge
29
Hallo,
ich habe einen Backup Server, der nur sporadisch läuft und wirklich kaum Stunden auf dem Tacho hat. Beim letzten Backup gab es Fehler und eine Mail von smartd. Woran kann es liegen? Kann die Festplatte mit gerade mal 486 Betriebsstunden schon hin sein?

Code:
=== START OF INFORMATION SECTION ===
Model Family:     Crucial/Micron Client SSDs
Device Model:     Micron_1100_MTFDDAK256TBN
Serial Number:    1712165A6B65
LU WWN Device Id: 5 00a075 1165a6b65
Firmware Version: M0MA001
User Capacity:    256,060,514,304 bytes [256 GB]
Sector Size:      512 bytes logical/physical
Rotation Rate:    Solid State Device
Form Factor:      2.5 inches
TRIM Command:     Available, deterministic, zeroed
Device is:        In smartctl database 7.3/6293
ATA Version is:   ACS-3 T13/2161-D revision 5
SATA Version is:  SATA 3.2, 6.0 Gb/s (current: 6.0 Gb/s)
Local Time is:    Mon Sep 28 13:04:49 2026 CEST
SMART support is: Available - device has SMART capability.
SMART support is: Enabled
AAM feature is:   Unavailable
APM level is:     254 (maximum performance)
Rd look-ahead is: Enabled
Write cache is:   Enabled
DSN feature is:   Unavailable
ATA Security is:  Disabled, frozen [SEC2]
Wt Cache Reorder: Enabled

=== START OF READ SMART DATA SECTION ===
SMART overall-health self-assessment test result: PASSED

General SMART Values:
Offline data collection status:  (0x00)    Offline data collection activity
                    was never started.
                    Auto Offline Data Collection: Disabled.
Self-test execution status:      (   0)    The previous self-test routine completed
                    without error or no self-test has ever
                    been run.
Total time to complete Offline
data collection:         (  678) seconds.
Offline data collection
capabilities:              (0x7b) SMART execute Offline immediate.
                    Auto Offline data collection on/off support.
                    Suspend Offline collection upon new
                    command.
                    Offline surface scan supported.
                    Self-test supported.
                    Conveyance Self-test supported.
                    Selective Self-test supported.
SMART capabilities:            (0x0003)    Saves SMART data before entering
                    power-saving mode.
                    Supports SMART auto save timer.
Error logging capability:        (0x01)    Error logging supported.
                    General Purpose Logging supported.
Short self-test routine
recommended polling time:      (   2) minutes.
Extended self-test routine
recommended polling time:      (   4) minutes.
Conveyance self-test routine
recommended polling time:      (   3) minutes.
SCT capabilities:            (0x0035)    SCT Status supported.
                    SCT Feature Control supported.
                    SCT Data Table supported.

SMART Attributes Data Structure revision number: 16
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAGS    VALUE WORST THRESH FAIL RAW_VALUE
  1 Raw_Read_Error_Rate     POSR-K   100   100   000    -    112
  5 Reallocate_NAND_Blk_Cnt -O--CK   098   098   010    -    47
  9 Power_On_Hours          -O--CK   100   100   000    -    486
 12 Power_Cycle_Count       -O--CK   100   100   000    -    600
171 Program_Fail_Count      -O--CK   100   100   000    -    3
172 Erase_Fail_Count        -O--CK   100   100   000    -    0
173 Ave_Block-Erase_Count   -O--CK   097   097   000    -    45
174 Unexpect_Power_Loss_Ct  -O--CK   100   100   000    -    26
183 SATA_Interfac_Downshift -O--CK   100   100   000    -    0
184 Error_Correction_Count  -O--CK   100   100   000    -    0
187 Reported_Uncorrect      -O--CK   100   100   000    -    91
194 Temperature_Celsius     -O---K   068   047   000    -    32 (Min/Max 15/53)
196 Reallocated_Event_Count -O--CK   100   100   000    -    47
197 Current_Pending_ECC_Cnt -O--CK   100   100   000    -    0
198 Offline_Uncorrectable   ----CK   100   100   000    -    3
199 UDMA_CRC_Error_Count    -O--CK   100   100   000    -    0
202 Percent_Lifetime_Remain ----CK   097   097   001    -    3
206 Write_Error_Rate        -OSR--   100   100   000    -    3
246 Total_LBAs_Written      -O--CK   100   100   000    -    10764840728
247 Host_Program_Page_Count -O--CK   100   100   000    -    338298886
248 FTL_Program_Page_Count  -O--CK   100   100   000    -    203983082
180 Unused_Reserve_NAND_Blk PO--CK   000   000   000    -    1996
210 Success_RAIN_Recov_Cnt  -O--CK   100   100   000    -    170
                            ||||||_ K auto-keep
                            |||||__ C event count
                            ||||___ R error rate
                            |||____ S speed/performance
                            ||_____ O updated online
                            |______ P prefailure warning
 
Ka ob ich blind bin aber in den SMART Werten sehe ich nix von dem ATA Error. Ansonsten, das klingt eher nach Kabel, also das mal tauschen.
 
Ist die Firmware der SSD aktuell?
Wie oft ist der Server in Betrieb, wie lange bleibt der dann aktiv und wie lange sind die Pausen ohne Betrieb?
 
Zuletzt bearbeitet: (E: FW-Version müsste recherchiert werden, laut Kommentaren unter dem Artikel steht was von MOMUxx für SATA und MOMAxx für NVME)
naja, sieht schon nicht optimal aus...
uncorrectable errors, relocated nand, write und program errors...

muss jetzt nichts schlimmes sein, aber normal is das erstmal nicht
 
Mojo1987 schrieb:
Ka ob ich blind bin aber in den SMART Werten sehe ich nix von dem ATA Error. Ansonsten, das klingt eher nach Kabel, also das mal tauschen.
Ich habe eine Mail bekommen in der das stand:
Device: /dev/sdb [SAT], ATA error count increased from 18 to 91
Es geht um den Wert 187.
Kabel tauschen werde ich heute abend mal ausprobieren und dann nochmal einen SMART Self Test laufen lassen

Denniss schrieb:
Wie oft ist der Server in Betrieb, wie lange bleibt der dann aktiv und wie lange sind die Pausen ohne Betrieb?
etwa alle 2 Wochen für vielleicht 2-3h. Je nach dem, wie viele Daten in der Zeit zusammen kommen.
 
KrawallKurt schrieb:
etwa alle 2 Wochen für vielleicht 2-3h. Je nach dem, wie viele Daten in der Zeit zusammen kommen.
Laut den Smartwerten lief die SSD 486h, wurde aber 600 mal an/aus geschaltet.

Wenn du Kabel prüfst, prüfe Stromstecker auch gleich mit (also von der SSD).
 
Da war sicher auch viel rumprobieren dabei bei der Anzahl an Einschaltungen, aber auch 600x einschalten sollte doch normal noch lange kein Problem sein
 
KrawallKurt schrieb:
Kann die Festplatte mit gerade mal 486 Betriebsstunden schon hin sein?
Das Laufwerk ist der Meinung 5,1TB geschrieben zu haben, also etwa 20mal voll beschreiben. Gleichzeitig gibt das Laufwerk im Schnitt jeden Block 45x gelöscht zu haben. An sich sollte eine SSD das abkönnen, aber ein Block_Ereas_Cnt der der Schreibleistung derart vorauseilt deutet auf immense Writeamplification hin.

187 Reported_Uncorrect -O--CK 100 100 000 - 91

Das ist kein ATA fehler, sondern das Laufwerk vermeldet, dass es Daten vom Flash gelesen, als fehlerhaft erkannt hat und nicht korrigieren konnte. Es sind also mehrere Bits gekippt. Hier sind Daten verloren gegangen. Das Laufwerk ist damit unzuverlässig, das Einzige was jetzt ansteht ist die Daten zu sichern, das Laufwerk zu entsorgen. Die gesicherten Daten sollten dringend(!) aus Plausibilität geprüft werden.
Datensicherung in Form eines Images des Laufwerkes, in der Hoffnung, dass du ein Dateisystem verwendest, welches robust genug ist um beschädigte Daten zu erkennen.

Die UDMA Fehler stehen auf Null, der Wert würde eskalieren, wenn Sata-Kabel bzw. Sata Controller sich putzig verhalten würden.

Ansonsten sind die 26 Powerloss auffällig, Stromausfall beim Schreiben sorgt auch für nicht korrigierbare Fehler. Ich würde aber nicht darauf vertrauen, dass das Laufwerk sich mit neuer Verkabelung grundlegend anders verhält.


Edit: 210 Rain Recovery.. Dein Laufwerk vermeldet, dass es intern noch viel mehr Fehler gefunden hat, aber in der Lage war die Daten mit internen Redundanzen zu rekonstruieren.


Es würde mich wundern, wenn deine Logfiles nicht ein paar Warnung bis Errors in Sachen Dateisystem, Blockdevice haben.
 
  • Gefällt mir
Reaktionen: GTrash81, platzhalter0815 und Asghan
KrawallKurt schrieb:
Da war sicher auch viel rumprobieren dabei bei der Anzahl an Einschaltungen
Das meinte ich damit auch nicht, sondern wenn die SSD 2-3h am Stück arbeitet laut deiner Aussage, aber 600 power-cycles existieren, dann läuft die SSD am Stück aber nur 48 Minuten, wenn du dann noch 27 powerloss da reinrechnest, dann könnte da einfach irgendwo ein Wackler sein. Selbst wenn du am Anfang viel experimentiert hast, ist das Verhältnis + power loss ggf. ein hinweis auf einen Wackler.
 
Tu dir einen Gefallen und sicher die Daten und werf das Ding weg. Percent_Lifetime_Remain ist eh bei 3 Prozent. Also hat die SSD laut Herstellerberechnungen ihr Leben hinter sich. Auch die anderen SMART Werte sehen nicht rosig aus...
 
@floklo4 das sollten doch 97℅ sein, 3℅ sind verbraucht

@KrawallKurt kannst ja mal nen extended smart self test machen und schauen was passiert...
 
@KrawallKurt und @Mr. Poe

Percent_Lifetime_Remain (S.M.A.R.T.-Attribut ID 202 bei vielen Herstellern wie Crucial/Micron) gibt an, wie viel Prozent der geschätzten Lebensdauer einer SSD (Solid State Drive) noch übrig sind.

Ihr dürft das nicht mit Percentage_Lifetime_Used verwechseln ;) Da würde euer Ansatz stimmen.
 
@floklo4
huh, dann sind ja meine zwei ssds schon lange tot, 98℅ used bei 26k stunden bei der mx500 und 96℅ bei 58k stunden bei der mx300

bin der meinung der wert war bei 100℅ am anfang und geht richtung 0℅...

edit:
ich schau bei VALUE, nicht beim rohwert. value zeigt aktuell bei TE 97℅.
 
Zuletzt bearbeitet:
@Mr. Poe
Samsung: Percentage Used: 16%

Der Used Wert geht nach oben (bis 255). Ab 100 wird einen Critical Error 0x04 angezeigt und smartmontools meint, dass die SSD defekt ist. Die ist jedoch nicht defekt, sondern 0x04 heißt nur, dass keine Garantie mehr gilt. Toshibas zeigen auch den Used Wert an, aber kein 0x04 ab 100.

Bei Crucial/Micron ist es aber eben nicht Used, sondern Remain. Was noch übrig ist, einfach übersetzen.
 
Also unkorrigierbare Fehler kannst du theoretisch auch ohne einen Schaden der SSD haben - einfach durch Bit Rot mit der Zeit. Hier liegen aber einerseits schon relativ viele solche Fehler vor und wiederum keine korrigierten Fehler, und außerdem gibt es eben die Wiederzuweisungsereignisse.

Trauen würde ich der SSD nicht mehr wirklich; für ein Backup schon mal gar nicht.
 
  • Gefällt mir
Reaktionen: 7bb11
Ich hatte kürzlich mit einer Micron 1100 mit dem gleichen Fehlerbild zu tun. Die SSD hat erkannt, dass es Sektoren gibt, die nicht mehr gelesen werden können (Attribut 198) und schon NAND Blöcke als defekt erkannt und ersetzt (Attribut 5). Wenn du einen Selbsttest laufen lässt, wird er fehlschlagen mit einem Lesefehler und die Sektornummer mitteilen. Ich würde der SSD nicht mehr trauen, weil du nicht weißt, wie viele Blöcke schon kaputt sind. Die 3 nicht lesbaren Sektoren sind wahrscheinlich nur die Spitze des Eisbergs. Bei der SSD, mit der ich zu tun hatte, waren letztlich hunderte NAND Blöcke kaputt!

Deshalb ist das Wichtigste: Daten sichern. Falls wichtige Dateien nicht mehr lesbar sind, hast du noch eine zweite Chance, wenn du es nach dem Firmwareupdate (siehe #4) nochmal probierst.
 
Ja, genau. Smart Selbsttest schlägt einfach fehl. Habe jetzt eine Ersatz Platte bestellt und werde die dann tauschen. Es sind wirklich nur Backups auf der Platte, die müssen nicht gerettet werden sondern einfach neu gemacht werden
 
Alternate 1
Zurück
Oben