رفتن به محتوای اصلی
RAID و NAS

بازیابی اطلاعات سرور و RAID؛ اولین اقدام درست

آرایهٔ RAID در وضعیت Degraded یا Failed است یا Volume روی NAS از دسترس خارج شده؟ کارهایی که در ساعت اول باید و نباید انجام دهید تا اطلاعات سرور قابل بازیابی بماند.

راهروی رک‌های سرور در دیتاسنتر
فهرست مطالب

سرور بالا نمی‌آید، آرایهٔ RAID در وضعیت Degraded یا Failed است، Volume روی NAS «Crashed» شده یا بعد از Rebuild اطلاعات در دسترس نیست؟ در این لحظه، کارهایی که در یک ساعت اول انجام می‌شود بیشترین اثر را روی نتیجهٔ بازیابی دارد. این راهنما توضیح می‌دهد RAID چگونه از کار می‌افتد، چه اقداماتی امن است و چه اشتباه‌هایی بازیابی را سخت یا ناممکن می‌کند.

جواب کوتاه: سرور یا RAID از کار افتاده؛ اول چه کنیم؟

هیچ تغییری در آرایه ایجاد نکنید. Rebuild را دستی شروع نکنید، آرایه را از نو نسازید (Create یا Initialize)، ترتیب دیسک‌ها را عوض نکنید و ابزار تعمیر فایل‌سیستم را اجرا نکنید. ترتیب قرارگیری دیسک‌ها را با برچسب مشخص کنید، از تنظیمات و پیغام‌های کنترلر یا NAS عکس بگیرید و اگر دیسکی صدای غیرعادی می‌دهد سیستم را خاموش کنید. اطلاعات RAID تقریباً همیشه قابل بازسازی‌تر از آن است که به نظر می‌رسد، به شرطی که روی دیسک‌ها چیزی نوشته نشود.

هشدار

ساختن دوبارهٔ آرایه با گزینهٔ Create یا Initialize، یا شروع Rebuild با دیسک اشتباه، می‌تواند اطلاعات همهٔ دیسک‌ها را بازنویسی کند. این شایع‌ترین علت از دست رفتن دائمی اطلاعات RAID است.

RAID چگونه اطلاعات را نگه می‌دارد؟

در RAID اطلاعات بین چند دیسک تقسیم می‌شود. هیچ دیسکی به‌تنهایی کل فایل‌ها را ندارد (به‌جز RAID 1) و برای خواندن اطلاعات، ترتیب دیسک‌ها، اندازهٔ هر قطعه (Stripe) و روش توزیع Parity باید دقیقاً معلوم باشد.

نمای انواع RAID 0، 1، 5، 6 و 10 و میزان تحمل خرابی
انواع RAID و میزان تحمل خرابی هر کدام
نوع RAID تحمل خرابی نکتهٔ مهم در بازیابی
RAID 0 هیچ با خرابی یک دیسک کل آرایه از دسترس خارج می‌شود؛ همهٔ دیسک‌ها لازم‌اند
RAID 1 یک دیسک از هر جفت هر دیسک کپی کامل است؛ اما دیسک سالم را نباید تحت فشار گذاشت
RAID 5 یک دیسک در وضعیت Degraded، خرابی دیسک دوم یا خطای خواندن هنگام Rebuild کل آرایه را از کار می‌اندازد
RAID 6 دو دیسک ایمن‌تر از RAID 5، اما Rebuild طولانی و پرفشار است
RAID 10 یک دیسک از هر جفت آینه خرابی هر دو دیسک یک جفت، آرایه را از کار می‌اندازد

RAID جایگزین نسخهٔ پشتیبان نیست. RAID فقط در برابر خرابی تعدادی از دیسک‌ها مقاومت می‌کند؛ حذف اشتباه فایل، باج‌افزار، خرابی کنترلر یا خطای انسانی را پوشش نمی‌دهد.

سناریوهای رایج از کار افتادن سرور و RAID

۱. یک دیسک خراب شده و آرایه Degraded است

آرایه هنوز کار می‌کند، اما هیچ حاشیهٔ امنی ندارد. در این وضعیت، قبل از هر تعویض و Rebuild، از اطلاعات مهم نسخهٔ پشتیبان بگیرید. دیسک‌هایی که هم‌زمان خریداری شده‌اند معمولاً در زمان نزدیک به هم فرسوده می‌شوند و فشار Rebuild ممکن است دیسک دوم را هم از کار بیندازد.

۲. Rebuild نیمه‌کاره متوقف شده یا شکست خورده

در Rebuild، کنترلر باید تمام سطح دیسک‌های باقی‌مانده را بخواند. اگر در این مدت روی یکی از آن‌ها بدسکتور پیدا شود، Rebuild متوقف می‌شود و آرایه ممکن است Failed شود. شروع دوبارهٔ Rebuild بدون بررسی، ممکن است اطلاعات نیمه‌بازسازی‌شده را بازنویسی کند.

۳. خرابی کنترلر RAID

وقتی خود کنترلر خراب می‌شود، دیسک‌ها سالم‌اند اما آرایه دیده نمی‌شود. نصب کنترلر جدید و ایمپورت نادرست پیکربندی، یا ساختن آرایهٔ جدید با همان دیسک‌ها، اطلاعات را در خطر می‌اندازد.

۴. Volume روی NAS «Crashed» یا «Inaccessible» شده

در دستگاه‌های NAS، روی آرایه لایه‌های دیگری مثل LVM و فایل‌سیستم‌هایی مثل ext4 یا Btrfs قرار دارند. پیغام خرابی Volume ممکن است از هر کدام از این لایه‌ها باشد. گزینه‌های «Repair» یا ساختن Storage Pool جدید را بدون اطمینان از علت اجرا نکنید.

۵. پاک شدن اشتباه، بازنصب سیستم‌عامل یا Initialize اشتباه

گاهی مدیر سیستم برای رفع یک مشکل، به اشتباه آرایه را از نو می‌سازد یا سیستم‌عامل را روی آن نصب می‌کند. هرچه اطلاعات جدید کمتری نوشته شده باشد، شانس بازیابی بیشتر است؛ پس سیستم را فوراً متوقف کنید.

۶. باج‌افزار (Ransomware)

در حملهٔ باج‌افزار، فایل‌ها رمزگذاری شده‌اند و ممکن است نسخه‌های پشتیبان متصل به شبکه هم آسیب دیده باشند. سرور را از شبکه جدا کنید، فایل‌های رمزشده و یادداشت باج را پاک نکنید و سیستم را فرمت یا بازنصب نکنید تا بررسی انجام شود.

۷. خرابی ماشین مجازی یا دیتاستور

روی سرورهای مجازی‌سازی، فایل‌های دیسک مجازی بزرگ روی دیتاستور قرار دارند. خرابی آرایه یا فایل‌سیستم دیتاستور می‌تواند چند ماشین مجازی را هم‌زمان از دسترس خارج کند. در این حالت هم قانون اصلی یکی است: قبل از هر تعمیر، از دیسک‌ها کپی گرفته شود.

اقدامات امن در ساعت اول

چک‌لیست کارهای مجاز و ممنوع در ساعت اول خرابی RAID
چک‌لیست ساعت اول خرابی سرور یا RAID
  1. سیستم را از ادامهٔ نوشتن بازدارید. سرویس‌هایی را که روی آرایه می‌نویسند متوقف کنید؛ اگر دیسکی صدای غیرعادی می‌دهد، سرور را به‌صورت کنترل‌شده خاموش کنید.
  2. ترتیب دیسک‌ها را ثبت کنید. روی هر دیسک شمارهٔ اسلات را بنویسید و از جلوی سرور یا NAS عکس بگیرید.
  3. از پیغام‌ها و تنظیمات عکس بگیرید. صفحهٔ کنترلر RAID، لاگ‌های NAS، مدل کنترلر، نوع RAID و تعداد دیسک‌ها را ثبت کنید.
  4. تاریخچه را بنویسید. چه اتفاقی افتاد، کدام دیسک اول خطا داد، آیا Rebuild یا تعویض دیسک انجام شده و چه کسی چه تغییری داده است.
  5. دیسک‌ها را با هم نگه دارید. حتی دیسکی که خراب اعلام شده ممکن است برای بازسازی آرایه لازم باشد؛ آن را دور نیندازید یا با دیسک دیگری جابه‌جا نکنید.

نکته

دیسکی که کنترلر آن را «Failed» اعلام کرده، گاهی اطلاعاتی دارد که دیسک‌های دیگر ندارند؛ به‌خصوص اگر زودتر از بقیه از آرایه خارج شده باشد. تشخیص اینکه کدام دیسک‌ها برای بازسازی مناسب‌ترند، بخش مهمی از کار بازیابی است.

چه کارهایی را انجام ندهیم؟

  • آرایه را با گزینه‌های Create، Initialize یا Clear Configuration از نو نسازید.
  • Rebuild را با دیسک جدید شروع نکنید تا از وضعیت دیسک‌های باقی‌مانده مطمئن شوید.
  • ترتیب یا اسلات دیسک‌ها را عوض نکنید.
  • ابزارهای chkdsk، fsck یا «Repair» را روی Volume آسیب‌دیده اجرا نکنید.
  • هم‌زمان چند دیسک را تعویض نکنید.
  • سیستم‌عامل را روی همان آرایه دوباره نصب نکنید.
  • دیسک‌ها را جداگانه به کامپیوتر ویندوزی وصل نکنید و پیشنهاد Initialize یا فرمت را تأیید نکنید.

بازیابی اطلاعات RAID چگونه انجام می‌شود؟

بازیابی تخصصی RAID روی خود دیسک‌های اصلی انجام نمی‌شود؛ هدف این است که هیچ تغییری روی آن‌ها ایجاد نشود:

  1. بررسی سخت‌افزاری هر دیسک: وضعیت برد، هد و سطح هر عضو آرایه بررسی می‌شود.
  2. تهیهٔ کپی کامل از هر دیسک: از همهٔ اعضای آرایه، سکتور به سکتور، کپی گرفته می‌شود. دیسک‌های آسیب‌دیده ابتدا در آزمایشگاه به وضعیت قابل خواندن می‌رسند.
  3. بازسازی مجازی آرایه: ترتیب دیسک‌ها، اندازهٔ Stripe، جهت چرخش Parity و نقطهٔ شروع داده‌ها از روی محتوای کپی‌ها تشخیص داده می‌شود و آرایه به‌صورت مجازی ساخته می‌شود.
  4. بازسازی فایل‌سیستم و استخراج اطلاعات: فایل‌سیستم (NTFS، ext4، Btrfs، XFS یا دیتاستور مجازی‌سازی) بازخوانی و فایل‌ها، پایگاه‌داده‌ها یا ماشین‌های مجازی استخراج می‌شوند.
  5. کنترل صحت و تحویل: فایل‌های مهم باز و بررسی می‌شوند و اطلاعات روی حافظهٔ جدید تحویل داده می‌شود.

امکان بازیابی و زمان آن به نوع آرایه، تعداد دیسک‌های آسیب‌دیده و اقداماتی که پس از خرابی انجام شده بستگی دارد و فقط پس از بررسی فنی مشخص می‌شود.

برای سازمان‌ها و شرکت‌ها، صفحهٔ خدمات سازمانی و برای روند کلی بازیابی، صفحهٔ بازیابی تخصصی اطلاعات را ببینید. اگر دستگاه ضبط تصاویر دوربین‌ها دچار مشکل شده، راهنمای هارد دوربین مداربسته خراب شده؛ تعمیر یا بازیابی تصاویر؟ را بخوانید.

چطور جلوی تکرار را بگیریم؟

  1. نسخهٔ پشتیبان جدا از سرور داشته باشید: حداقل یک نسخه خارج از شبکهٔ اصلی و یک نسخه در محل دیگر.
  2. هشدارهای کنترلر و NAS را فعال کنید تا خرابی اولین دیسک همان روز دیده شود.
  3. دیسک یدک (Hot Spare) در نظر بگیرید و دیسک خراب را زود تعویض کنید؛ اما فقط بعد از گرفتن نسخهٔ پشتیبان.
  4. برای آرایه‌های بزرگ، RAID 6 یا RAID 10 را در نظر بگیرید تا Rebuild طولانی، کل آرایه را در خطر نیندازد.
  5. سلامت دیسک‌ها را دوره‌ای بررسی کنید و وضعیت SMART را زیر نظر داشته باشید.
  6. سرور را به UPS وصل کنید و خاموش شدن کنترل‌شده را تنظیم کنید.

جمع‌بندی

وقتی سرور یا RAID از کار می‌افتد، مهم‌ترین کار این است که کاری روی دیسک‌ها انجام نشود: نه Rebuild عجولانه، نه ساختن آرایهٔ جدید، نه تعمیر فایل‌سیستم. ترتیب دیسک‌ها و پیغام‌ها را ثبت کنید، سیستم را متوقف کنید و بازیابی را به بررسی تخصصی بسپارید؛ جایی که از هر دیسک کپی گرفته می‌شود و آرایه بدون دست زدن به دیسک‌های اصلی بازسازی می‌شود.

سرور یا آرایهٔ RAID شما از دسترس خارج شده است؟ درخواست سازمانی ثبت کنید.

ثبت درخواست سازمانی
اشتراک‌گذاری این مقاله
تلگرامواتس‌اپ

پرسش‌های پرتکرار

در RAID 5 یک دیسک خراب شده؛ دیسک جدید بگذارم و Rebuild کنم؟

اگر از همهٔ اطلاعات مهم نسخهٔ پشتیبان جدا دارید، تعویض و Rebuild روش معمول است. اگر ندارید، اول از اطلاعات نسخهٔ پشتیبان بگیرید؛ چون فشار Rebuild ممکن است دیسک دیگری را هم از کار بیندازد و آرایه Failed شود.

آیا بدون کنترلر RAID اصلی می‌توان اطلاعات را بازیابی کرد؟

بله. در بازیابی تخصصی، از هر دیسک کپی گرفته می‌شود و پارامترهای آرایه مثل ترتیب دیسک‌ها و اندازهٔ Stripe از روی خود داده‌ها تشخیص داده می‌شود؛ بنابراین نیازی به کنترلر اصلی نیست.

دیسک‌های RAID را جداگانه به کامپیوتر وصل کنم تا ببینم چه دارند؟

خیر. هر دیسک فقط بخشی از داده‌ها را دارد و ویندوز معمولاً پیشنهاد Initialize یا فرمت می‌دهد. تأیید این پیغام‌ها ساختار آرایه را خراب می‌کند.

Volume روی NAS «Crashed» شده؛ گزینهٔ Repair را بزنم؟

تا علت مشخص نشده، خیر. Repair ممکن است روی دیسک‌ها بنویسد و وضعیت را بدتر کند. از پیغام‌ها و لاگ‌ها عکس بگیرید و دستگاه را بدون تغییر نگه دارید.

بعد از حملهٔ باج‌افزار چه کار کنیم؟

سرور را از شبکه جدا کنید، فایل‌های رمزشده و یادداشت باج را پاک نکنید و سیستم را فرمت یا بازنصب نکنید. وضعیت نسخه‌های پشتیبان را هم بدون اتصال به شبکهٔ آلوده بررسی کنید.

بازیابی اطلاعات RAID چقدر زمان می‌برد؟

زمان به تعداد و ظرفیت دیسک‌ها، نوع RAID و وضعیت فیزیکی هر دیسک بستگی دارد، چون ابتدا باید از همهٔ دیسک‌ها کپی کامل گرفته شود. برآورد زمان و هزینه پس از بررسی فنی اعلام می‌شود.

هارد شما صدای غیرعادی می‌دهد؟

پیش از هر اقدامی، وضعیت هارد را کارشناسان IranHDD بررسی کنند. نتیجهٔ بررسی و هزینه پیش از شروع کار به شما اعلام می‌شود.

ثبت درخواست بررسیتماس با کارشناس

هنوز مطمئن نیستید مشکل هارد چیست؟ثبت درخواست بررسی