Záchrana dát
Virtuálny server nenabehne: záchrana dát z VMware, Hyper-V a Proxmoxu
Hypervízor hlási, že virtuálny disk sa nedá otvoriť? Skôr než zmažete snapshot alebo spustíte merge, zastavte zápis. Čo rozhoduje o obnove dát z VMDK, VHDX a qcow2 a kedy už ide o disky pod nimi.
12 min čítania
Obsah článku
- Prvá otázka: zapisuje ešte niekto na úložisko?
- Čo vám napovedia príznaky
- Čo urobiť počas prvej hodiny
- Prečo nestačí skopírovať najväčší VMDK alebo VHDX
- Čo nerobiť, aj keď server musí ísť hore ihneď
- Čo si odložiť, kým sa dá čítať
- Čo sa dá z poškodeného virtuálneho disku reálne dostať
- Koľko to stojí a za čo platíte
- Ako spoznáte kvalitný postup
- Ako odovzdať prípad z celého Slovenska
- Krátka odpoveď
- Časté otázky
- Môžem VMDK alebo VHDX pripojiť k novému virtuálnemu stroju?
- Stačí poslať najväčší súbor virtuálneho disku?
- Je snapshot záloha firemného servera?
- Dajú sa obnoviť dáta zo šifrovaného virtuálneho disku?
- Musí sa obnoviť celý server?
Na jednom fyzickom serveri beží účtovníctvo, sieťové priečinky aj databáza. V pondelok ráno sa virtuálny stroj nespustí a konzola hypervízora hlási, že súbor disku sa nedá otvoriť. Firma stojí celá naraz — a vedľa toho stojí niekto, kto to chce za pár minút „skúsiť opraviť“.
Médiá na záchranu dát preberáme v Považskej Bystrici a spracúvame ich vo vlastnom laboratóriu v Brne. Prípady okolo virtuálnych serverov k nám chodia v dvoch podobách. Prvá: adresár virtuálneho stroja sa ešte dá celý prečítať a niekto zavolá skôr, než začne mazať snapshoty. Druhá: checkpoint už bol zmazaný „na skúšku“, zlúčenie sa zastavilo v polovici a pod tým všetkým vypadáva disk z RAID poľa.
Hranica medzi nimi je jednoduchá. Kým sa dá celý adresár virtuálneho stroja bezchybne skopírovať na iné úložisko, máte čas aj z čoho robiť pokusy. Keď sa kopírovanie zasekne, systémový denník sa plní I/O chybami alebo pole hlási degradovaný stav, prestáva ísť o virtualizáciu a začína ísť o fyzické disky pod ňou.
K tomu sa pridáva zmena licencovania VMware pod Broadcomom: po prechode na predplatné a konci trvalých licencií presunula časť menších firiem svoje stroje na Proxmox alebo Hyper-V. Práve rozbehnutá migrácia býva častou chvíľou havárie — polovica strojov už beží na novom hypervízore, úložisko zdieľa staré aj nové prostredie a snapshoty z konverzie V2V visia neuzavreté. Preto tu ide o všetky tri platformy naraz, nie o jednu.
Text sa týka VMware vSphere a ESXi, Microsoft Hyper-V a Proxmoxu VE — teda súborov .vmdk, .vhdx a .avhdx, obrazov qcow2 a blokových zväzkov pod nimi. Nie je to návod na dešifrovanie disku bez kľúča ani na obnovu zabudnutého hesla.
Prvá otázka: zapisuje ešte niekto na úložisko?
Každý ďalší pokus o štart nie je nulová operácia. VMware pri zapnutí virtuálneho stroja zakladá odkladací súbor a zapisuje do vmware.log, Hyper-V píše do najnovšej vrstvy .avhdx, qcow2 pri zápise alokuje nové clustre a mení svoje mapovacie tabuľky. A keď sa systém vo vnútri predsa len rozbehne, Windows prehrá NTFS žurnál $LogFile a prípadne si sám spustí kontrolu disku — takže kópia, ktorú urobíte o hodinu, už nebude obrazom pôvodného stavu.
Ak navyše zlyháva fyzické médium, každé opakovanie znamená ďalšie zaťaženie práve toho miesta, ktoré sa nedá prečítať. Táto jediná otázka preto rozhoduje o poradí všetkých ďalších krokov.
Čo vám napovedia príznaky
| Čo sa deje | Čo to obvykle znamená | Bezpečný prvý krok |
|---|---|---|
| ESXi hlási The parent virtual disk has been modified since the child was created | nesúlad CID a parentCID v descriptore — reťaz snapshotov sa nedá zložiť | v .vmdk nič neprepisovať, zachovať všetky vrstvy vrátane descriptorov |
| Virtuálny stroj sa nespustí s Failed to lock the file | disk drží iný proces: registrácia na druhom hostiteľovi, bežiaca záloha alebo zostatkový zámok | nespúšťať dokola, najprv zistiť, kto súbor drží |
| vSphere píše Virtual machine disks consolidation is needed | po zálohovaní zostali delta súbory a reťaz sa neuzavrela | konsolidáciu nespúšťať na plnom ani na chybujúcom datastore |
| Hyper-V hlási porušenú reťaz virtuálnych diskov alebo nesúlad identifikátorov rodiča a diferenčného disku | chýbajúci, premenovaný či presunutý rodičovský VHDX, prípadne neúplné zlúčenie | zachovať všetky .avhdx s pôvodnými názvami aj časovými značkami |
| Virtuálny stroj v Hyper-V spadol do stavu Paused-critical | na zväzku došlo miesto a dynamický VHDX nemá kam rásť | miesto uvoľniť inde, nemazať .avhdx |
| Proxmox hlási Could not open backing file | qcow2 stratil backing file — presun, premenovanie alebo iné úložisko | nespúšťať qemu-img rebase ani commit na origináli |
| Thin pool v LVM-thin je na 100 %, zápisy do virtuálneho stroja zamrzli | vyčerpané dáta alebo metadáta poolu pri prealokovanom úložisku | virtuálny stroj nespúšťať, miesto riešiť mimo poolu |
zpool status hlási degradovaný alebo pozastavený pool a v dmesg pribúdajú I/O chyby | fyzické disky, kabeláž, radič alebo napájanie | server vypnúť, nespúšťať scrub ani resilver |
| RAID radič po výmene disku ponúka import foreign configuration alebo pole zostalo degradované | nesprávne poradie členov poľa — rebuild vie prepísať paritu | import nepotvrdzovať naslepo |
Hlásenie hypervízora samo osebe teda nehovorí nič o stave diskov. Stav posudzujte podľa toho, čo píše vmware.log v adresári virtuálneho stroja, denník Hyper-V-VMMS alebo dmesg a journalctl na Proxmoxe — nie podľa jednej vety v konzole. A ak sa to celé začalo výmenou disku v poli, samostatne rozoberáme, čo sa dá zachrániť, keď sa RAID prestaval na nesprávny disk.
Čo urobiť počas prvej hodiny
- Zastavte opakované pokusy o spustenie a vypnite všetko, čo štart skúša automaticky — HA, watchdog, plánované zálohy aj monitoring, ktorý službu „oživuje“.
- Odfoťte presné znenie hlásenia. Poznačte si, kedy virtuálny stroj naposledy bežal a čo sa vtedy dialo: aktualizácia, výpadok prúdu, plný datastore, výmena disku.
- Nezakladajte nový snapshot ani checkpoint a nespúšťajte konsolidáciu, merge ani commit.
- Overte voľné miesto na datastore alebo zväzku. Plné úložisko je najčastejšia príčina zaseknutej konsolidácie a ďalší zásah ho už len dorazí.
- Pozrite stav fyzických diskov a poľa — hodnoty SMART, denník radiča, prípadné vypadnuté členy. Ak niečo cvaká, mizne zo systému alebo hlási I/O chyby, server vypnite.
- Ak je úložisko stabilné, skopírujte celý adresár virtuálneho stroja na iné zdravé úložisko. Nie iba najväčší súbor. Originál potom odložte a nič na ňom neupravujte.
- Ak potrebujete disk pripojiť inde, pripájajte ho výhradne na čítanie — v Správe diskov cez Pripojiť VHD so zaškrtnutým Iba na čítanie, na Linuxe cez
qemu-nbd --read-only. A nikdy nepotvrdzujte ponuku Windowsu inicializovať disk, ktorý sa hlási ako neznámy alebo RAW; inicializácia prepíše tabuľku oddielov.
CHKDSK ani fsck neopravujú obsah účtovnej databázy, opravujú štruktúru súborového systému — a to, čo nedokážu zaradiť, presunú do priečinka nájdených fragmentov bez pôvodných názvov. Na disku, ktorý zlyháva fyzicky, navyše obe znamenajú desiatky minút intenzívneho čítania práve tam, kde to bolí.
Prečo nestačí skopírovať najväčší VMDK alebo VHDX
Virtuálny disk spravidla nie je jeden súbor.
Pri VMware býva samotný .vmdk iba textový descriptor s veľkosťou pár stoviek bajtov. Dáta ležia v -flat.vmdk. Po vytvorení snapshotu sa nové zápisy ukladajú do ďalšej vrstvy — -000001-delta.vmdk v staršom formáte VMFSsparse, alebo -000001-sesparse.vmdk vo formáte SEsparse, ktorý sa používa na VMFS6 a pri veľkých diskoch. Aktuálny stav firmy je v poslednej vrstve reťaze. Kto skopíruje len ten veľký -flat súbor, odnesie si stav spred vzniku snapshotu — a nemusí si to všimnúť skôr než po nábehu do účtovníctva.
Každý descriptor nesie identifikátory CID a parentCID, ktorými sa reťaz drží pokope. Keď sa rozídu, ESXi rodiča s potomkom už nespojí. Konzistenciu reťaze vie ESXi skontrolovať aj bez zásahu, cez vmkfstools -e — ručné prepisovanie identifikátorov je naopak presne ten krok, po ktorom sa z opraviteľného prípadu stáva laboratórna práca.
Hyper-V rieši to isté cez súbory AVHDX, ktoré obsahujú iba zmeny voči rodičovi. Väzbu vypíše Get-VHD v položke ParentPath. Odstránenie checkpointu spúšťa zlúčenie do rodiča a pri neúplnej alebo nesprávne zoradenej reťazi to nie je upratovanie, ale nevratná operácia. Zachovať treba aj konfiguráciu: od Windows Servera 2016 je binárna (.vmcx a .vmrs), takže sa nedá dodatočne dopísať ako staré XML.
Pri qcow2 plní úlohu rodiča backing file a mapovanie dát drží dvojica tabuliek plus refcount vrstva. Poškodenie tejto metadátovej vrstvy urobí obraz neotvoriteľným, aj keď sú samotné dáta na disku celé. Reťaz iba vypíše qemu-img info --backing-chain; príkazy commit, rebase a check -r už zapisujú priamo do obrazu a to, čo pri nekonzistentných metadátach vyhodnotia ako opravu, sa bez kópie nedá vrátiť. Čo presne jednotlivé príkazy robia, popisuje dokumentácia QEMU k qemu-img.
A pri Proxmoxe často nie je čo kopírovať v zmysle súboru: LVM-thin zväzok, ZFS zvol ani Ceph RBD nie sú súbory v priečinku. Obraz sa musí čítať na blokovej úrovni a pri distribuovanom úložisku sa jednotlivý disk nevyberá bez posúdenia stavu celého klastra.
Čo nerobiť, aj keď server musí ísť hore ihneď
Časový tlak zvádza k zásahom, ktoré menia originál. Bez overenej kópie preto nerobte nič z tohto:
- nemažte snapshot ani checkpoint „na skúšku“;
- nespúšťajte konsolidáciu, merge, commit ani rebase na origináli;
- neupravujte ručne
CID,parentCID, názov rodiča ani cestu k backing file; - nespúšťajte
chkdsk /f,fsckani automatickú opravu qcow2; - neinicializujte disk, ktorý sa hlási ako neznámy alebo RAW;
- nevytvárajte nový VMDK ani VHDX s rovnakým názvom v tom istom adresári;
- neobnovujte zálohu späť cez poškodený datastore — obnovujte inam;
- nezapínajte server dokola, keď disky hlásia I/O chyby.
Pri firemnom serveri sa oplatí oddeliť dve veci: obnovu prevádzky a záchranu dát. Prevádzku vie zachrániť aj rýchle provizórium na inom železe, dáta má len ten jeden originál. Ak si na to netrúfate alebo server nemôže stáť, napíšte nám, čo sa deje, a poradíme, čo odpojiť a čo zachovať ešte predtým, než sa niečoho dotknete.
Čo si odložiť, kým sa dá čítať
Ak je úložisko stabilné, zachovajte celý adresár virtuálneho stroja aj s cestou, z ktorej pochádza.
Pri VMware to znamená všetky súbory .vmdk vrátane descriptorov a vrstiev -flat, -delta či -sesparse, konfiguráciu .vmx, súbory snapshotov a vmware.log.
Pri Hyper-V základný VHDX, všetky AVHDX v pôvodných názvoch, konfiguráciu virtuálneho stroja a export udalostí z denníka Hyper-V-VMMS.
Pri Proxmoxe konfiguráciu z /etc/pve/qemu-server/<VMID>.conf, konfiguráciu úložísk a zoznam zväzkov. Ak virtuálny stroj beží na LVM-thin, ZFS alebo Ceph, spôsob vytvorenia obrazu radšej dopredu konzultujte.
Pri RAID poli disky očíslujte podľa pozície v serveri a zapojenie odfoťte. Poradie členov je pri rekonštrukcii poľa rovnako dôležité ako samotné dáta.
Čo sa dá z poškodeného virtuálneho disku reálne dostať
Výsledok nie je len „server funguje“ alebo „dáta sú preč“. Medzi tým je celá škála:
- spustiteľný virtuálny stroj v pôvodnej podobe;
- opravený samostatný virtuálny disk;
- pripojiteľný obraz oddielu;
- adresárová štruktúra so zachovanými názvami;
- vybrané databázy, dokumenty a účtovné dáta;
- pri ťažkom poškodení jednotlivé súbory bez názvov a bez priečinkov.
Firme spravidla viac pomôže rýchlo získať databázu a dokumenty než čakať na nábeh celého operačného systému. Pri Microsoft SQL Serveri sú prioritou .mdf, .ndf a .ldf — pozor, aj keď sa všetky prečítajú, databáza po havárii nemusí byť aplikačne konzistentná. Kde majú svoje dáta jednotlivé účtovné programy, popisujeme v článku o tom, ako zachrániť dáta, keď zlyhá disk s účtovníctvom.
Technické hranice sú tri: prepísané bloky, chýbajúca vrstva reťaze a šifrovanie. Pri BitLockeri, LUKS, šifrovaní virtuálneho stroja vo vSphere alebo virtuálnom TPM v Hyper-V treba dodať obnovovací kľúč, heslo alebo prístup k pôvodnej kľúčovej infraštruktúre. Bez kľúča sa dá opraviť médium, obsah sa dešifrovať nedá — a žiadne laboratórium na svete to neobíde.
Koľko to stojí a za čo platíte
Virtuálny server sa nedá poctivo naceniť podľa prípony súboru. Rozhoduje počet a kapacita diskov, počet snapshotových vrstiev, stav fyzických médií a poľa, typ úložiska (VMFS, NTFS, LVM-thin, ZFS, Ceph), šifrovanie, rozsah požadovaných dát a termín.
Preto sa začína diagnostikou a až po nej sa dá povedať, čo je reálne obnoviteľné a za akú cenu. Rozsah diagnostiky, jej cenu, cenu samotnej záchrany aj to, čo platíte, ak sa požadované dáta obnoviť nepodarí, si dohodneme vopred ku konkrétnej zákazke — pýtajte si to písomne ešte pred začatím prác. Čo všetko cenu tvorí, rozpisujeme v článku koľko stojí záchrana dát.
Pri porovnávaní ponúk sa nepýtajte len na cenu za terabajt. Podstatné je, či je v nej aj rekonštrukcia RAID poľa, reťaze snapshotov a súborového systému — a kontrola, že požadované firemné dáta sa naozaj otvoria.
Ako spoznáte kvalitný postup
Pred odovzdaním servera alebo diskov sa opýtajte:
- Bude sa pracovať z obrazu alebo kópie, nie priamo na origináli?
- Dostanete pred opravou popis poruchy a pevnú cenu?
- Zvládne pracovisko fyzické disky, RAID aj virtuálnu vrstvu?
- Skontroluje celú reťaz, nie iba posledný súbor?
- Môžete vopred určiť prioritné priečinky a databázy?
- Dostanete zoznam alebo ukážku obnoviteľných dát?
- Ako budú chránené osobné údaje a účtovníctvo, dá sa uzavrieť NDA?
- Čo zaplatíte, ak sa požadované dáta nepodarí obnoviť?
Sľub stopercentnej obnovy pred diagnostikou je varovný signál. Pri chýbajúcej vrstve, prepísaných blokoch alebo šifrovaní bez kľúča existujú hranice, ktoré sa obísť nedajú.
Ako odovzdať prípad z celého Slovenska
Do prvého dopytu napíšte platformu, názov virtuálneho stroja, presné hlásenie, typ úložiska, kedy naposledy úspešne naštartoval a v akom stave sú zálohy. A hlavne to, ktoré dáta potrebujete ako prvé — poradie priorít mení postup.
Ak zlyháva fyzické úložisko, neposielajte náhodne vybraný disk z poľa. Najprv si telefonicky dohodnite, či treba všetky členy RAID, samostatné médiá alebo celý server.
Médiá môžete po predchádzajúcej dohode doručiť osobne do laboratória v Považskej Bystrici alebo poslať kuriérom. Presnú adresu, otváracie hodiny aj aktuálne podmienky prepravy nájdete na stránke kontaktu — overte si ich ešte pred odoslaním. Disky pred prepravou očíslujte a zabaľte samostatne — ako na to, píšeme v návode, ako bezpečne poslať disk na záchranu dát kuriérom.
A keď je po všetkom: server, ktorý nikto pravidelne nesleduje, spadne znova. Stav poľa, voľné miesto na datastore a overené obnovenie zálohy sú tri veci, ktoré rozhodujú o tom, či bude nabudúce z čoho obnovovať — a staráme sa o ne firmám aj priebežne.
Krátka odpoveď
Obnova dát z virtuálneho disku VMDK alebo VHDX je možná, ak zostal čitateľný základný disk a potrebné vrstvy snapshotov. Virtuálny stroj ďalej nespúšťajte, nemažte snapshoty ani checkpointy a nerobte merge na origináli. Zachovajte celú reťaz, konfiguráciu aj stav fyzického úložiska — a ak disky hlásia I/O chyby, server vypnite.
Časté otázky
Môžem VMDK alebo VHDX pripojiť k novému virtuálnemu stroju?
Iba pracovnú kópiu a iba vtedy, keď viete, ktorý súbor je aktuálnym koncom reťaze. Pripojenie základného disku ukáže starý stav a spustenie systému doň zapíše ďalšie zmeny.
Stačí poslať najväčší súbor virtuálneho disku?
Zvyčajne nie. Potrebné bývajú descriptory, všetky delta alebo AVHDX vrstvy, konfigurácia virtuálneho stroja a pri fyzickej poruche aj ostatné členy RAID poľa.
Je snapshot záloha firemného servera?
Nie. Snapshot závisí od rodičovského disku a najčastejšie leží na tom istom fyzickom úložisku. Keď zlyhá datastore alebo chýba jedna vrstva reťaze, sám o sebe nezachráni nič.
Dajú sa obnoviť dáta zo šifrovaného virtuálneho disku?
Áno, ak je dostupný správny kľúč, heslo, virtuálny TPM alebo pôvodná kľúčová infraštruktúra. Bez kľúča vieme opraviť médium, ale obsah zostane nečitateľný.
Musí sa obnoviť celý server?
Nie. Ak firma potrebuje pokračovať v práci hneď, dá sa najprv vytiahnuť účtovná databáza, dokumenty a aplikačné zálohy. Rozsah aj poradie priorít určíme pri analýze.
Ďalšie články
- Záchrana dát Počítač nevidí externý disk a nehlási ho ani BIOS: čo skúsiť skôr, než ho dáte na záchranu dát Externý disk sa neobjaví v Prieskumníkovi ani v Správe diskov? Jedno kolo kontroly kábla, portu a napájania má zmysel. Ukážeme, kde presne prestať, aby ste si dáta nedorazili.
- Záchrana dát OneDrive alebo Google Drive zmazal súbory na všetkých zariadeniach: dokedy sa dajú vrátiť Súbory zmizli z notebooku, mobilu aj z cloudu naraz? Najprv pozastavte synchronizáciu a otvorte webový kôš. Dokedy sa dá vrátiť OneDrive a Google Drive a kedy má zmysel laboratórium.
- Záchrana dát Disk hlási chybu S.M.A.R.T. alebo hroziace zlyhanie: koľko času máte a čo kopírovať ako prvé CrystalDiskInfo svieti Caution, BIOS hlási Backup and Replace? Presný čas do zlyhania nezistíte. Čo zastaviť, čo skopírovať ako prvé, kedy namiesto kopírovania robiť klon a kedy disk vypnúť.