Záchrana dát
RAID sa po výmene disku prestaval na nesprávny člen: čo sa ešte dá zachrániť
Rebuild na zlý disk prepisuje to, z čoho by sa dalo pole zrekonštruovať. Ako rebuild zastaviť, prečo je najcennejší práve omylom vybratý disk a čo žiadať od laboratória písomne.
10 min čítania
Obsah článku
- Rebuild práve beží: pole čo najskôr zastavte
- Čo vlastne znamená „rebuild na zlý disk“
- Prečo sa to stáva aj skúseným
- Čo sa dá po chybnom rebuilde zachrániť
- Čo po chybe určite neskúšať
- Ako prebieha bezpečná obnova poľa
- Má zmysel domáci pokus cez ddrescue
- Koľko obnova RAID stojí a čo má byť v ponuke
- Ako spoznať pracovisko, ktoré RAID naozaj vie
- Čo pripraviť k diagnostike
- Zhrnutie
- Časté otázky
- Mám nechať rozbehnutý rebuild dobehnúť?
- Môžem pôvodný disk jednoducho vrátiť do jeho pozície?
- Vie Synology alebo QNAP chybný rebuild vrátiť späť?
- Sú dáta na novom cieľovom disku ešte použiteľné?
- Musím do laboratória priviezť celý NAS?
Výmena disku v poli je rutina, kým sa nepomýlite v pozícii. Potom sa z rutiny stane preteky s časom: radič práve dopočítava obsah nového disku z členov, ktoré na to nemajú dosť podkladov, a každý zapísaný blok uberá z toho, čo by sa ešte dalo zrekonštruovať.
Médiá na záchranu dát preberáme v Považskej Bystrici a spracúvame vo vlastnom laboratóriu v Brne. Tento scenár prichádza obvykle v podobe telefonátu: rebuild je na 40 %, hlásenia sú červené a niekto sa pýta, či to má nechať dobehnúť. Nemá.
Rebuild práve beží: pole čo najskôr zastavte
Nečakajte, či sa pole po dokončení „chytí“. Nechytí sa samo a medzitým sa prepisuje cieľový disk.
- Zastavte aplikácie, databázy a prístup používateľov k úložisku.
- Poznačte si, kam až rebuild došiel, aké chyby sa zobrazili a ako sú disky označené.
- Odfoťte poradie diskov, čísla pozícií aj hlásenia v administrácii.
- Vypnite celý NAS alebo server. Za chodu už žiadny ďalší disk nevyťahujte.
- Žiadny disk neinicializujte, neformátujte a nespúšťajte nový rebuild.
Ak zariadenie nereaguje, pokračujúci zápis býva väčšie riziko než vynútené vypnutie. Pri produkčnom serveri sa oplatí rozhodnutie rýchlo prebrať s niekým, kto RAID obnovuje zo sektorových kópií — ozvite sa nám skôr, než spustíte čokoľvek ďalšie.
Čo vlastne znamená „rebuild na zlý disk“
Rebuild nie je návrat k staršej verzii dát. Radič vezme obsah dostupných členov a podľa svojej aktuálnej konfigurácie dopočíta, čo patrí na náhradný disk. Verí pritom tomu, čo mu členovia vrátia — nekontroluje, či je to pravda.
Typický sled vyzerá takto:
- RAID 5 upozorní na problémový disk — varovanie, občasné chyby čítania, rastúce SMART hodnoty — ale radič ho ešte nevyradil a stále ho používa ako plnohodnotného člena.
- Obsluha medzitým vyberie iný, stále zdravý disk a na jeho miesto vloží náhradu.
- Pole prejde do degradovaného stavu a spustí rebuild, pri ktorom číta aj z nestabilného pôvodného člena.
- Ten disk má nečitateľné sektory, vracia neúplné dáta alebo sa opakovane odpája.
- Radič z takých podkladov dopočíta obsah nového disku.
- Rebuild môže skončiť ako „úspešný“, a pritom je súborový systém nekonzistentný a súbory poškodené.
Ak radič chybný disk už predtým naozaj vyradil, vyňatie ďalšieho zdravého člena znamená pri RAID 5 dva chýbajúce disky naraz. Rebuild sa vtedy obvykle vôbec nespustí — pole zostane nedostupné alebo si vyžiada núdzové zostavenie. Aj to je dôvod prestať a zdokumentovať stav, nie skúšať iné poradie diskov.
Pri RAID 5 vyčerpá všetku redundanciu jediný chýbajúci člen. Ak potom ďalší disk pri čítaní zlyhá, radič už nemá z čoho správne dopočítavať. RAID 6 znesie dve poruchy, ale ani tam nesprávne zvolený člen alebo pomýlená konfigurácia nezaručí správny výsledok. Pri RAID 10 navyše záleží, z ktorej zrkadlenej dvojice disky pochádzajú — dva výpadky v tej istej dvojici bežne spôsobia zlyhanie poľa a obnovu výrazne skomplikujú, zatiaľ čo dva v rôznych dvojiciach môže pole prežiť.
Rovnaká situácia nastáva v Synology DSM so SHR, v QNAP NAS, v linuxovom mdadm aj na radičoch Broadcom/LSI MegaRAID, Dell PERC či HPE Smart Array. Líšia sa metadátami a spôsobom prestavby, nie základným rizikom.
Prečo sa to stáva aj skúseným
Šachty na čelnom paneli sú číslované inak než disky v administrácii. NAS eviduje člena podľa sériového čísla, obsluha podľa pozície zľava — a keď je v poli päť rovnakých kusov toho istého modelu, kontrola podľa štítku odpadá.
Druhý zdroj omylov je čas. Chybný disk sa často neodhlási naraz: najprv rastú hodnoty ako Reallocated Sector Count a Current Pending Sector, potom sa predlžujú časy čítania a až nakoniec radič člena vyhodí. Pole medzitým beží degradovane týždne a pôvodné hlásenie o chybe je dávno preklikané.
Tretí dôvod je záťaž. Rebuild prečíta všetky zostávajúce disky od začiatku do konca — často je to prvé súvislé plné čítanie za roky. Taká záťaž môže odhaliť dosiaľ skryté problémy ďalšieho disku, najmä ak boli členy nasadené naraz a majú podobný počet prevádzkových hodín.
Čo sa dá po chybnom rebuilde zachrániť
Dokončený rebuild automaticky neznamená stratu všetkého. Rozhoduje, ktoré disky zostali zachované a čo sa s nimi po chybe dialo.
| Situácia | Čo môže pomôcť pri obnove |
|---|---|
| Rebuild bol zastavený včas | Časť cieľového disku ešte nie je prepísaná a zdrojové disky môžu držať použiteľnú generáciu dát |
| Pôvodný vybratý disk zostal odložený | Môže obsahovať starší, ale konzistentný stav poľa spred rebuildu |
| Rebuild dobehol, ale na pole sa už nezapisovalo | Dá sa porovnať metadáta, parita a obsah súborového systému bez ďalších zmien |
| Jeden člen má nečitateľné sektory alebo vypadáva | Najprv sa z neho robí sektorový obraz a čítanie sa riadi |
| Po rebuilde bežala ďalej databáza alebo bežná prevádzka | Nové zápisy mohli prepísať bloky potrebné na rekonštrukciu; šanca sa posudzuje súbor po súbore |
| Pôvodný disk bol naformátovaný alebo použitý v inom poli | Obnova je zložitejšia a závisí od rozsahu nových zápisov |
| Pôvodný disk prešiel bezpečným mazaním | Prepísané dáta z neho už obnoviť nemožno |
Najcennejším nosičom býva prekvapivo ten disk, ktorý obsluha vybrala omylom. Aj so starším počítadlom udalostí môže predstavovať poslednú konzistentnú kópiu príslušných stripe blokov. Preto ho nevracajte do NAS naslepo — systém ho môže označiť za zastaraný, prepísať mu metadáta alebo naň spustiť ďalšiu synchronizáciu.
Pri poli zo SSD je situácia prísnejšia. Rebuild na cieľové SSD zapisuje nové bloky a interná správa flash pamäte môže predchádzajúci obsah rýchlo zneprístupniť. Podľa konkrétneho radiča, RAID implementácie a súborového systému môže situáciu ďalej ovplyvniť aj TRIM. O to viac záležia nedotknutí pôvodní členovia a externá záloha. Špecifiká flash pamäte rozoberá samostatný text o záchrane dát zo SSD.
Čo po chybe určite neskúšať
Niektoré bežné servisné kroky sú pri samostatnom disku prijateľné, na poškodenom poli však situáciu zhoršia.
Nespúšťajte:
- ďalší rebuild s iným poradím diskov,
- inicializáciu poľa alebo vytvorenie nového zväzku,
chkdsk,fsckani automatickú opravu Btrfs,- „clear foreign configuration“ či import cudzej konfigurácie bez toho, aby ste ju najprv zdokumentovali,
- TestDisk alebo PhotoRec priamo nad jednotlivými členmi,
- aktualizáciu DSM, QTS, QuTS hero ani firmvéru radiča,
- zápisové testy, secure erase či kontrolu povrchu so zápisom,
- obnovu zálohy späť na tie isté disky.
TestDisk nepozná správny obsah súborového systému, kým nie je pole virtuálne zostavené. Nad jedným členom RAID 5 vidí len striedavo svoje a cudzie stripe bloky, takže nájde fragmenty a zdanlivé oddiely — nie použiteľné súbory.
A neprehadzujte disky metódou pokus-omyl. Pozície, sériové čísla, metadáta a časová postupnosť udalostí sú súčasťou diagnostiky, nie prekážkou.
Ako prebieha bezpečná obnova poľa
Správny postup nezačína opravou poľa, ale zaistením všetkých dostupných verzií dát.
Každý disk sa najprv zaeviduje podľa sériového čísla a pôvodnej pozície. Kontroluje sa, či nemá mechanickú poruchu, chybné hlavy, nestabilnú elektroniku alebo rastúci počet nečitateľných sektorov. Cvakajúci či odpájajúci sa disk sa nemá opakovane spúšťať v NAS — prečo je téma na samostatný text.
Z použiteľných členov sa potom robia sektorové kópie na iné nosiče. Pri nestabilnom disku sa čítanie riadi tak, aby sa najprv získali ľahko dostupné oblasti a zariadenie sa netrápilo opakovaním jedného zlého miesta. Originály zostávajú bez zmeny.
Z kópií sa zisťuje:
- pôvodné poradie diskov,
- úroveň RAID alebo SHR,
- veľkosť stripu či chunku,
- rotácia parity,
- počiatočný offset dát,
- počítadlá udalostí jednotlivých členov,
- okamih, kedy bol ktorý disk vyradený alebo prestavaný.
Až potom sa pole zostavuje virtuálne. Slúžia na to metadáta mdadm, informácie z radiča a nástroje ako UFS Explorer, R-Studio Technician alebo ReclaiMe Pro. Nástroj sám ale nerozhodne, ktorá generácia diskov je tá správna — to sa overuje porovnaním parity, štruktúry adresárov, databáz a konkrétnych prioritných súborov.
Pri Synology býva nad RAID ešte LVM a súborový systém ext4 alebo Btrfs. QNAP môže pridávať ďalšiu vrstvu správy zväzkov, šifrovanie a snapshoty. Uhádnuť poradie diskov teda nestačí.
Má zmysel domáci pokus cez ddrescue
Iba vtedy, keď všetky disky spoľahlivo čítajú, máte dosť ďalších úložísk na úplné obrazy a rozumiete konfigurácii poľa. GNU ddrescue vytvorí sektorovú kópiu s mapovacím súborom, ale nevyrieši nesprávne poradie diskov, rotáciu parity ani voľbu správnej generácie poľa.
Obrazy nekopírujte na žiadneho pôvodného člena. Cieľový nosič musí byť aspoň taký veľký ako zdroj a celý postup musí prebehnúť bez jediného zápisu na originály.
Len čo niektorý disk cvaká, mizne zo systému, hlási nulovú kapacitu alebo výrazne spomalí, domáce čítanie ukončite. Opakované pokusy môžu pri mechanicky alebo elektronicky nestabilnom disku stav zhoršiť a znížiť rozsah čitateľných dát. Ak si na obrazy netrúfate alebo nemáte kam ich uložiť, pošlite nám zostavu a obrazy urobíme my — na originály sa pri tom nezapisuje.
Koľko obnova RAID stojí a čo má byť v ponuke
Pri chybnom rebuilde sa konečná cena nedá poctivo určiť podľa kapacity NAS. Rozhoduje počet členov, ich fyzický stav, typ radiča, šifrovanie, súborový systém a rozsah potrebného zobrazovania diskov. Logická rekonštrukcia štyroch čitateľných diskov je iná práca než osem diskov, z ktorých dva potrebujú riešiť fyzickú poruchu. Cenové položky rozoberá samostatný článok o cene záchrany dát; pri RAID má prednosť diagnostika konkrétnej zostavy.
Pred objednávkou si písomne vyžiadajte odpoveď na toto:
- či diagnostika mení obsah originálnych diskov,
- či cena zahŕňa vytvorenie obrazov všetkých potrebných členov,
- ako bude definovaný úspešný výsledok,
- či dostanete zoznam alebo ukážku obnoviteľných dát,
- čo zaplatíte, ak sa prioritné firemné dáta obnoviť nepodarí,
- či sú v cene výstupné disky, doprava a prípadný expresný režim.
Pre firmu nie je podstatný počet nájdených súborov. Určite si priority dopredu: účtovná databáza, projektová dokumentácia, e-maily, výrobné podklady, zákaznícke zložky. Tisíce obnovených náhľadov nenahradia jednu funkčnú databázu.
Ako spoznať pracovisko, ktoré RAID naozaj vie
Pýtajte sa na postup, nie na percento údajnej úspešnosti. Dobrá diagnostika vie vysvetliť, ako ochráni originálne disky a ako odlíši stav poľa pred rebuildom od stavu po ňom.
Varovným signálom je:
- sľub stopercentnej obnovy ešte pred prevzatím diskov,
- požiadavka spustiť ďalší rebuild „na overenie“,
- práca priamo na origináloch bez sektorových kópií,
- neochota evidovať sériové čísla a pozície,
- cena bez vymedzenia, čo sa považuje za úspech,
- tlak na okamžité rozhodnutie bez diagnostického záveru.
Čistý priestor je podstatný pri otváraní mechanicky poškodeného HDD, nie ako náhrada za znalosť RAID metadát. Pri čisto logickom probléme rozhoduje práca s obrazmi, správna rekonštrukcia geometrie a kontrola obsahu.
Pobočka v Považskej Bystrici (Slovenských partizánov 1093/13) preberie celú zostavu aj jednotlivo označené disky; odtiaľ putujú do nášho vlastného laboratória v Brne, kde je bezprašné pracovisko aj vybavenie na prácu s poškodenými členmi poľa. Prepravu medzi pobočkou a laboratóriom hradíme my. Zo vzdialenejších miest sa dajú poslať kuriérom — každý disk zabaľte samostatne a priložte schému pôvodného poradia; ako na to, opisuje návod na bezpečné odoslanie disku.
Čo pripraviť k diagnostike
Spolu s diskami dodajte čo najpresnejšiu časovú os:
- model NAS, servera alebo RAID radiča,
- pôvodnú úroveň RAID a počet diskov,
- výrobcu, model, kapacitu a sériové číslo každého člena,
- pôvodnú pozíciu každého disku,
- prvé chybové hlásenie,
- ktorý disk ste vybrali a ktorý vložili,
- kam až rebuild dobehol,
- čo sa s poľom dialo potom,
- kľúč alebo heslo, ak bol zväzok šifrovaný.
Nezáleží na tom, či ide o WD Red, Seagate IronWolf, Toshiba N300 alebo inú radu. Značka následky chybného rebuildu neodstráni. Pre obnovu je dôležitý skutočný stav konkrétneho kusu a jeho úloha v poli.
Zhrnutie
Rebuild RAID na nesprávny disk sa niekedy dá zachrániť — najmä ak zostal zachovaný pôvodný, omylom vybratý člen a po chybe sa na pole už nezapisovalo. Rebuild okamžite zastavte, vypnite celé zariadenie a všetky disky nechajte v pôvodnom stave pre sektorové kópie.
Časté otázky
Mám nechať rozbehnutý rebuild dobehnúť?
Nie. Dokončovanie rebuildu môže ďalej prepisovať použiteľnú verziu dát. Zastavte prístup používateľov, zdokumentujte stav a vypnite celé zariadenie bez vyťahovania ďalších diskov za chodu.
Môžem pôvodný disk jednoducho vrátiť do jeho pozície?
Nie naslepo. Radič ho môže označiť za zastaraný, inicializovať alebo naň spustiť ďalšiu synchronizáciu. Bezpečnejšie je najprv urobiť jeho sektorovú kópiu a pôvodnú zostavu rekonštruovať virtuálne.
Vie Synology alebo QNAP chybný rebuild vrátiť späť?
Bežná správa NAS tlačidlo na vrátenie rebuildu nemá. Snapshot pomôže so staršou verziou súborov iba vtedy, ak je zväzok stále konzistentný a snapshot sa nepoškodil spolu s ním.
Sú dáta na novom cieľovom disku ešte použiteľné?
Môžu byť, ale závisí to od toho, kam rebuild došiel a z ktorých členov počítal. Disk sa nesmie formátovať ani samostatne prehľadávať — hodnotí sa spolu so všetkými ostatnými členmi.
Musím do laboratória priviezť celý NAS?
Ideálne je dodať zariadenie aj všetky disky, ak to prevádzka dovolí. Keď posielate len disky, označte ich presné pozície, priložte fotografie zostavy, model radiča a časovú os chybného rebuildu.
Ďalšie články
- Záchrana dát NAS nevidí zväzok alebo z poľa vypadol disk: čo robiť, kým je pole ešte čitateľné Synology hlási Degraded alebo Crashed, QNAP Not Active? Skôr než spustíte opravu, zachráňte to, čo sa ešte dá prečítať. Postup pre prvé minúty, čo v DSM a QTS nepotvrdzovať a kedy NAS vypnúť.
- Záchrana dát Ransomware v slovenskej firme: povinnosti podľa zákona č. 69/2018 a čo sa ešte dá zachrániť Prvých 30 minút po zašifrovaní rozhoduje o tom, čo sa dá obnoviť. Čo urobiť hneď, kto musí incident hlásiť cez JISKB, kedy platí 72-hodinová lehota podľa GDPR a odkiaľ sa dáta reálne vracajú.
- Záchrana dát Zlyhal disk s účtovníctvom: ako zachrániť dáta z Omegy a ALFA plus od KROSu Archív z Omegy aj ALFA plus často končí na tom istom disku ako databáza. Čo to znamená pri havárii disku, kedy pomôže hotline KROSu a kedy už len laboratórium.