سرور بالا نمیآید، آرایهٔ RAID در وضعیت Degraded یا Failed است، Volume روی NAS «Crashed» شده یا بعد از Rebuild اطلاعات در دسترس نیست؟ در این لحظه، کارهایی که در یک ساعت اول انجام میشود بیشترین اثر را روی نتیجهٔ بازیابی دارد. این راهنما توضیح میدهد RAID چگونه از کار میافتد، چه اقداماتی امن است و چه اشتباههایی بازیابی را سخت یا ناممکن میکند.
جواب کوتاه: سرور یا RAID از کار افتاده؛ اول چه کنیم؟
هیچ تغییری در آرایه ایجاد نکنید. Rebuild را دستی شروع نکنید، آرایه را از نو نسازید (Create یا Initialize)، ترتیب دیسکها را عوض نکنید و ابزار تعمیر فایلسیستم را اجرا نکنید. ترتیب قرارگیری دیسکها را با برچسب مشخص کنید، از تنظیمات و پیغامهای کنترلر یا NAS عکس بگیرید و اگر دیسکی صدای غیرعادی میدهد سیستم را خاموش کنید. اطلاعات RAID تقریباً همیشه قابل بازسازیتر از آن است که به نظر میرسد، به شرطی که روی دیسکها چیزی نوشته نشود.
هشدار
ساختن دوبارهٔ آرایه با گزینهٔ Create یا Initialize، یا شروع Rebuild با دیسک اشتباه، میتواند اطلاعات همهٔ دیسکها را بازنویسی کند. این شایعترین علت از دست رفتن دائمی اطلاعات RAID است.
RAID چگونه اطلاعات را نگه میدارد؟
در RAID اطلاعات بین چند دیسک تقسیم میشود. هیچ دیسکی بهتنهایی کل فایلها را ندارد (بهجز RAID 1) و برای خواندن اطلاعات، ترتیب دیسکها، اندازهٔ هر قطعه (Stripe) و روش توزیع Parity باید دقیقاً معلوم باشد.

| نوع RAID | تحمل خرابی | نکتهٔ مهم در بازیابی |
|---|---|---|
| RAID 0 | هیچ | با خرابی یک دیسک کل آرایه از دسترس خارج میشود؛ همهٔ دیسکها لازماند |
| RAID 1 | یک دیسک از هر جفت | هر دیسک کپی کامل است؛ اما دیسک سالم را نباید تحت فشار گذاشت |
| RAID 5 | یک دیسک | در وضعیت Degraded، خرابی دیسک دوم یا خطای خواندن هنگام Rebuild کل آرایه را از کار میاندازد |
| RAID 6 | دو دیسک | ایمنتر از RAID 5، اما Rebuild طولانی و پرفشار است |
| RAID 10 | یک دیسک از هر جفت آینه | خرابی هر دو دیسک یک جفت، آرایه را از کار میاندازد |
RAID جایگزین نسخهٔ پشتیبان نیست. RAID فقط در برابر خرابی تعدادی از دیسکها مقاومت میکند؛ حذف اشتباه فایل، باجافزار، خرابی کنترلر یا خطای انسانی را پوشش نمیدهد.
سناریوهای رایج از کار افتادن سرور و RAID
۱. یک دیسک خراب شده و آرایه Degraded است
آرایه هنوز کار میکند، اما هیچ حاشیهٔ امنی ندارد. در این وضعیت، قبل از هر تعویض و Rebuild، از اطلاعات مهم نسخهٔ پشتیبان بگیرید. دیسکهایی که همزمان خریداری شدهاند معمولاً در زمان نزدیک به هم فرسوده میشوند و فشار Rebuild ممکن است دیسک دوم را هم از کار بیندازد.
۲. Rebuild نیمهکاره متوقف شده یا شکست خورده
در Rebuild، کنترلر باید تمام سطح دیسکهای باقیمانده را بخواند. اگر در این مدت روی یکی از آنها بدسکتور پیدا شود، Rebuild متوقف میشود و آرایه ممکن است Failed شود. شروع دوبارهٔ Rebuild بدون بررسی، ممکن است اطلاعات نیمهبازسازیشده را بازنویسی کند.
۳. خرابی کنترلر RAID
وقتی خود کنترلر خراب میشود، دیسکها سالماند اما آرایه دیده نمیشود. نصب کنترلر جدید و ایمپورت نادرست پیکربندی، یا ساختن آرایهٔ جدید با همان دیسکها، اطلاعات را در خطر میاندازد.
۴. Volume روی NAS «Crashed» یا «Inaccessible» شده
در دستگاههای NAS، روی آرایه لایههای دیگری مثل LVM و فایلسیستمهایی مثل ext4 یا Btrfs قرار دارند. پیغام خرابی Volume ممکن است از هر کدام از این لایهها باشد. گزینههای «Repair» یا ساختن Storage Pool جدید را بدون اطمینان از علت اجرا نکنید.
۵. پاک شدن اشتباه، بازنصب سیستمعامل یا Initialize اشتباه
گاهی مدیر سیستم برای رفع یک مشکل، به اشتباه آرایه را از نو میسازد یا سیستمعامل را روی آن نصب میکند. هرچه اطلاعات جدید کمتری نوشته شده باشد، شانس بازیابی بیشتر است؛ پس سیستم را فوراً متوقف کنید.
۶. باجافزار (Ransomware)
در حملهٔ باجافزار، فایلها رمزگذاری شدهاند و ممکن است نسخههای پشتیبان متصل به شبکه هم آسیب دیده باشند. سرور را از شبکه جدا کنید، فایلهای رمزشده و یادداشت باج را پاک نکنید و سیستم را فرمت یا بازنصب نکنید تا بررسی انجام شود.
۷. خرابی ماشین مجازی یا دیتاستور
روی سرورهای مجازیسازی، فایلهای دیسک مجازی بزرگ روی دیتاستور قرار دارند. خرابی آرایه یا فایلسیستم دیتاستور میتواند چند ماشین مجازی را همزمان از دسترس خارج کند. در این حالت هم قانون اصلی یکی است: قبل از هر تعمیر، از دیسکها کپی گرفته شود.
اقدامات امن در ساعت اول

- سیستم را از ادامهٔ نوشتن بازدارید. سرویسهایی را که روی آرایه مینویسند متوقف کنید؛ اگر دیسکی صدای غیرعادی میدهد، سرور را بهصورت کنترلشده خاموش کنید.
- ترتیب دیسکها را ثبت کنید. روی هر دیسک شمارهٔ اسلات را بنویسید و از جلوی سرور یا NAS عکس بگیرید.
- از پیغامها و تنظیمات عکس بگیرید. صفحهٔ کنترلر RAID، لاگهای NAS، مدل کنترلر، نوع RAID و تعداد دیسکها را ثبت کنید.
- تاریخچه را بنویسید. چه اتفاقی افتاد، کدام دیسک اول خطا داد، آیا Rebuild یا تعویض دیسک انجام شده و چه کسی چه تغییری داده است.
- دیسکها را با هم نگه دارید. حتی دیسکی که خراب اعلام شده ممکن است برای بازسازی آرایه لازم باشد؛ آن را دور نیندازید یا با دیسک دیگری جابهجا نکنید.
نکته
دیسکی که کنترلر آن را «Failed» اعلام کرده، گاهی اطلاعاتی دارد که دیسکهای دیگر ندارند؛ بهخصوص اگر زودتر از بقیه از آرایه خارج شده باشد. تشخیص اینکه کدام دیسکها برای بازسازی مناسبترند، بخش مهمی از کار بازیابی است.
چه کارهایی را انجام ندهیم؟
- آرایه را با گزینههای Create، Initialize یا Clear Configuration از نو نسازید.
- Rebuild را با دیسک جدید شروع نکنید تا از وضعیت دیسکهای باقیمانده مطمئن شوید.
- ترتیب یا اسلات دیسکها را عوض نکنید.
- ابزارهای chkdsk، fsck یا «Repair» را روی Volume آسیبدیده اجرا نکنید.
- همزمان چند دیسک را تعویض نکنید.
- سیستمعامل را روی همان آرایه دوباره نصب نکنید.
- دیسکها را جداگانه به کامپیوتر ویندوزی وصل نکنید و پیشنهاد Initialize یا فرمت را تأیید نکنید.
بازیابی اطلاعات RAID چگونه انجام میشود؟
بازیابی تخصصی RAID روی خود دیسکهای اصلی انجام نمیشود؛ هدف این است که هیچ تغییری روی آنها ایجاد نشود:
- بررسی سختافزاری هر دیسک: وضعیت برد، هد و سطح هر عضو آرایه بررسی میشود.
- تهیهٔ کپی کامل از هر دیسک: از همهٔ اعضای آرایه، سکتور به سکتور، کپی گرفته میشود. دیسکهای آسیبدیده ابتدا در آزمایشگاه به وضعیت قابل خواندن میرسند.
- بازسازی مجازی آرایه: ترتیب دیسکها، اندازهٔ Stripe، جهت چرخش Parity و نقطهٔ شروع دادهها از روی محتوای کپیها تشخیص داده میشود و آرایه بهصورت مجازی ساخته میشود.
- بازسازی فایلسیستم و استخراج اطلاعات: فایلسیستم (NTFS، ext4، Btrfs، XFS یا دیتاستور مجازیسازی) بازخوانی و فایلها، پایگاهدادهها یا ماشینهای مجازی استخراج میشوند.
- کنترل صحت و تحویل: فایلهای مهم باز و بررسی میشوند و اطلاعات روی حافظهٔ جدید تحویل داده میشود.
امکان بازیابی و زمان آن به نوع آرایه، تعداد دیسکهای آسیبدیده و اقداماتی که پس از خرابی انجام شده بستگی دارد و فقط پس از بررسی فنی مشخص میشود.
برای سازمانها و شرکتها، صفحهٔ خدمات سازمانی و برای روند کلی بازیابی، صفحهٔ بازیابی تخصصی اطلاعات را ببینید. اگر دستگاه ضبط تصاویر دوربینها دچار مشکل شده، راهنمای هارد دوربین مداربسته خراب شده؛ تعمیر یا بازیابی تصاویر؟ را بخوانید.
چطور جلوی تکرار را بگیریم؟
- نسخهٔ پشتیبان جدا از سرور داشته باشید: حداقل یک نسخه خارج از شبکهٔ اصلی و یک نسخه در محل دیگر.
- هشدارهای کنترلر و NAS را فعال کنید تا خرابی اولین دیسک همان روز دیده شود.
- دیسک یدک (Hot Spare) در نظر بگیرید و دیسک خراب را زود تعویض کنید؛ اما فقط بعد از گرفتن نسخهٔ پشتیبان.
- برای آرایههای بزرگ، RAID 6 یا RAID 10 را در نظر بگیرید تا Rebuild طولانی، کل آرایه را در خطر نیندازد.
- سلامت دیسکها را دورهای بررسی کنید و وضعیت SMART را زیر نظر داشته باشید.
- سرور را به UPS وصل کنید و خاموش شدن کنترلشده را تنظیم کنید.
جمعبندی
وقتی سرور یا RAID از کار میافتد، مهمترین کار این است که کاری روی دیسکها انجام نشود: نه Rebuild عجولانه، نه ساختن آرایهٔ جدید، نه تعمیر فایلسیستم. ترتیب دیسکها و پیغامها را ثبت کنید، سیستم را متوقف کنید و بازیابی را به بررسی تخصصی بسپارید؛ جایی که از هر دیسک کپی گرفته میشود و آرایه بدون دست زدن به دیسکهای اصلی بازسازی میشود.
سرور یا آرایهٔ RAID شما از دسترس خارج شده است؟ درخواست سازمانی ثبت کنید.
ثبت درخواست سازمانی





