اگر سرور HP شما ناگهان خاموش شده، بوت نمیشود یا با هشدار سختافزاری مواجه شده است، قبل از تعویض قطعه باید مشخص شود خطا از کدام بخش سرور ایجاد شده است. مشکلات پاور و خنککننده، حافظه RAM، ذخیرهسازی، Firmware یا تنظیمات مدیریتی از مهمترین بخشهایی هستند که باید بررسی شوند.
اولین قدم در عیبیابی سرور HPE ProLiant، بررسی لاگهای iLO و بخش Integrated Management Log یا IML است. این لاگها اطلاعات مربوط به رویدادهای سیستم، وضعیت سختافزار و زمان وقوع بسیاری از خطاها را در اختیار مدیر شبکه قرار میدهند. در نسلهایی که از Active Health System پشتیبانی میکنند، بررسی AHS Log نیز میتواند اطلاعات بیشتری برای تشخیص علت مشکل ارائه دهد.
خاموشی ناگهانی، روشن نشدن سرور، هشدار Health LED، خطاهای POST یا ثبت پیامهای وضعیت بحرانی در iLO میتوانند نشانه وجود مشکل در یکی از اجزای سختافزاری، Firmware یا تنظیمات سیستم باشند.
نکته مهم این است که قبل از تعویض آزمایشی قطعات، ابتدا پیام خطا و لاگهای سرور بررسی شوند؛ زیرا تعویض قطعه بدون تشخیص علت میتواند هم زمانبر باشد و هم هزینه عیبیابی را افزایش دهد.
در این راهنما، خطاهای رایج سرورهای HP و HPE ProLiant را در بخشهایی مانند حافظه، پردازنده، پاور، سیستم خنککننده، ذخیرهسازی و Firmware بررسی میکنیم و مسیر اولیه عیبیابی هرکدام را توضیح میدهیم.
شناسایی خطای سرور HP
قبل از بررسی کدهای خطا، بهتر است ابتدا مشخص شود سرور از چه طریقی وضعیت خود را اعلام میکند. در سرورهای HPE ProLiant، چراغهای وضعیت، پیامهای POST و اطلاعات ثبتشده در iLO از مهمترین منابع برای تشخیص اولیه مشکل هستند.
چراغهای وضعیت سرور
چراغ Health LED روی پنل جلوی بسیاری از سرورهای HPE ProLiant وضعیت کلی سیستم را نشان میدهد.
- سبز ثابت: وضعیت سیستم عادی است.
- نارنجی چشمکزن: سیستم در وضعیت Degraded قرار دارد و یکی از اجزا یا بخشهای سختافزاری نیاز به بررسی دارد.
- قرمز چشمکزن: وضعیت سیستم Critical است و علت خطا باید از طریق iLO و IML بررسی شود.
رنگ و رفتار دقیق LED ممکن است میان مدلها و نسلهای مختلف تفاوت داشته باشد؛ بنابراین بهتر است در وضعیت Degraded یا Critical علاوه بر چراغ پنل، پیامهای ثبتشده در iLO نیز بررسی شوند.
پیامهای POST و کدهای خطا
هنگام روشن شدن سرور، فرآیند Power-On Self-Test یا POST وضعیت اولیه سختافزار را بررسی میکند.
اگر مشکلی وجود داشته باشد، ممکن است پیام یا کد خطا روی نمایشگر، کنسول مدیریتی یا iLO ثبت شود.
وجود یک پیام POST بهتنهایی همیشه برای تشخیص قطعه معیوب کافی نیست. بهتر است کد نمایشدادهشده همراه با IML و وضعیت سختافزار بررسی شود.
بررسی لاگهای HPE iLO
یکی از دقیقترین روشها برای بررسی علت خطا، مراجعه به HPE iLO و بخش Integrated Management Log یا IML است.
در این قسمت میتوان رویدادهای سختافزاری، زمان وقوع خطا و پیامهای مرتبط با وضعیت سیستم را مشاهده کرد.
اگر Health LED وضعیت Degraded یا Critical را نشان میدهد، بررسی IML و System Health یکی از اولین اقدامات مناسب برای عیبیابی است.
عیبیابی سریع کدهای رایج خطای سرور HP
بعضی از خطاها در نسلها و مدلهای مختلف ممکن است پیام متفاوتی داشته باشند؛ بنابراین همیشه متن کامل خطا و مستندات همان مدل را نیز بررسی کنید.
| کد یا پیام خطا | علت احتمالی | اقدام اولیه |
|---|---|---|
| 101-ROM Error | مشکل یا ناسازگاری ROM یا Firmware | بررسی Firmware و قطعات توسعه |
| 102-System Board Failure | خطای مرتبط با System Board در برخی نسلها | بررسی IML و عیبیابی مادربرد |
| 17xx | خطاهای مرتبط با ذخیرهسازی یا کنترلر در برخی نسلها | بررسی Storage و SSA |
| Fan Solution Not Redundant | کاهش افزونگی فن یا مشکل یکی از فنها | بررسی Fan Status در iLO |
| Invalid Memory | RAM ناسازگار، نصب نادرست یا خرابی DIMM | بررسی IML، اسلات و نوع حافظه |
خطاهای سختافزاری حافظه و پردازنده در سرور HP
خطاهای مربوط به حافظه، پردازنده و مادربرد میتوانند باعث ناپایداری، توقف فرآیند Boot یا ثبت پیامهای Critical شوند.
برای تشخیص دقیق این خطاها بهتر است علاوه بر نشانههای ظاهری، پیامهای POST و رویدادهای ثبتشده در HPE iLO و IML نیز بررسی شوند.
خطاهای حافظه و HPE SmartMemory
سرورهای HPE ProLiant از ماژولهای حافظه مشخص و سازگار با هر مدل و نسل پشتیبانی میکنند.
در بسیاری از این سرورها از HPE SmartMemory استفاده میشود و قابلیتهایی مانند Advanced ECC یا Online Spare نیز بسته به مدل و پیکربندی در دسترس هستند.
استفاده از DIMM ناسازگار، خرابی ماژول حافظه یا نصب نادرست RAM میتواند باعث ایجاد خطا شود.
نشانههای احتمالی خطای RAM شامل این موارد است:
- ثبت Correctable یا Uncorrectable Memory Error در IML
- نمایش پیام مربوط به DIMM هنگام POST
- شناسایی نشدن یکی از ماژولهای حافظه
- خارج شدن DIMM معیوب از دسترس سیستم در برخی شرایط
- نمایش هشدار مرتبط با حافظه در iLO
راهکار: ابتدا شماره DIMM و پیام ثبتشده در IML را بررسی کنید. سپس نصب صحیح ماژول، سازگاری RAM با مدل سرور و وضعیت Firmware را کنترل کنید.
اگر خطا روی یک DIMM مشخص بهصورت مکرر ثبت میشود، باید براساس راهنمای همان مدل، ماژول حافظه و اسلات مربوط به آن بررسی شود.
خطاهای پردازنده و مادربرد
خطاهای مربوط به CPU و System Board میتوانند باعث توقف POST، روشن نشدن کامل سرور یا ثبت پیام خطا در iLO شوند.
یکی از پیامهای شناختهشده در برخی نسلهای قدیمیتر ProLiant، خطای 102-System Board Failure است که به وجود مشکل در بخشی از System Board اشاره میکند.
در چنین شرایطی نباید صرفاً براساس بوق، تصویر ندادن یا خاموش شدن سرور نتیجه گرفت که CPU یا مادربرد خراب است.
نشانههای احتمالی عبارتاند از:
- متوقف شدن فرآیند POST
- روشن شدن سرور بدون تکمیل Boot
- ثبت خطای CPU یا System Board در iLO
- ریست یا خاموش شدن غیرمنتظره
- شناسایی نشدن پردازنده در برخی شرایط
راهکار: ابتدا کد خطا، IML و وضعیت سختافزار را بررسی کنید و سپس براساس مدل و نسل سرور از ابزارهای تشخیصی مناسب همان پلتفرم استفاده کنید.
اگر مشکل به مادربرد یا CPU مربوط باشد، قبل از تعویض قطعه بهتر است هزینه تعمیر، قیمت قطعه، نسل سرور و ارزش ادامه استفاده از دستگاه نیز بررسی شود.
خطاهای پاور، دما و سیستم خنککننده در سرور HP
مشکلات مربوط به منبع تغذیه، فن و افزایش دمای داخلی میتوانند باعث هشدار سختافزاری، از دست رفتن حالت Redundant یا حتی خاموشی ناگهانی سرور شوند.
در چنین شرایطی بهتر است ابتدا وضعیت پاورها، فنها و سنسورهای دما از طریق HPE iLO و IML بررسی شود.
خطاهای منبع تغذیه
بسیاری از سرورهای سازمانی HPE میتوانند با دو منبع تغذیه Redundant پیکربندی شوند.
اگر یکی از پاورها از مدار خارج شود، بهدرستی در شاسی قرار نگرفته باشد یا برق ورودی آن قطع شود، ممکن است افزونگی منبع تغذیه از بین برود و هشدار مربوط به Power Supply یا Power Redundancy در iLO ثبت شود.
نشانههای احتمالی:
- تغییر وضعیت Power Supply در iLO
- ثبت هشدار Power Redundancy Lost
- خاموش یا هشداردهنده شدن LED پاور
- خارج شدن سیستم از حالت Redundant
راهکار: ابتدا کابل برق، محل قرارگیری PSU و وضعیت هر پاور در iLO بررسی شود.
اگر زیرساخت برق مجموعه امکان آن را دارد، برای حفظ افزونگی واقعی بهتر است پاورهای Redundant از مسیرهای برق مستقل تغذیه شوند تا خرابی یک منبع برق، هر دو پاور را همزمان از دسترس خارج نکند.
تعویض پاور بهصورت Hot-Plug نیز فقط زمانی انجام شود که مدل سرور، نوع PSU و پیکربندی فعلی از این قابلیت پشتیبانی کند.
خطاهای سیستم خنککننده و افزایش دما
خرابی فن، انسداد مسیر جریان هوا یا افزایش دمای داخلی میتواند باعث ایجاد هشدار Thermal شود.
در شرایط بحرانی، سرور ممکن است برای محافظت از سختافزار خاموش شود.
نشانههای احتمالی:
- ثبت هشدار Thermal در iLO یا IML
- افزایش دور فنها
- هشدار خرابی یا کاهش افزونگی فن
- افزایش دمای یکی از سنسورها
- خاموش شدن سرور در وضعیت حرارتی بحرانی
راهکار: در iLO وضعیت Temperature Sensors، Fan و System Health را بررسی کنید.
همچنین مطمئن شوید فنها بهدرستی نصب شدهاند و مسیر ورود و خروج هوا مسدود نیست.
دمای ورودی سرور باید در محدوده مجاز اعلامشده برای همان مدل و کانفیگ نگه داشته شود؛ زیرا محدوده مناسب ممکن است میان مدلها و پیکربندیهای مختلف متفاوت باشد.
خطاهای Firmware و تنظیمات نرمافزاری سرور
همه خطاهای سرور منشأ سختافزاری ندارند. Firmware قدیمی، درایور ناسازگار یا تنظیمات نامناسب BIOS/UEFI نیز میتواند باعث ناپایداری یا ایجاد خطا در عملکرد برخی اجزای سرور شود.
ناسازگاری Firmware و درایورها
نسخه Firmware کنترلر RAID، کارت شبکه، System ROM و سایر اجزای سرور باید با نسل دستگاه و سیستمعامل مورد استفاده سازگار باشد. استفاده از نسخههای قدیمی یا نامناسب میتواند باعث بروز خطا در عملکرد تجهیزات یا سیستمعامل شود.
برای بهروزرسانی سرورهای HPE میتوان از Service Pack for ProLiant یا SPP متناسب با نسل سرور استفاده کرد.
این بسته مجموعهای از Firmware، Driver و اجزای نرمافزاری مرتبط با سرورهای HPE را در اختیار مدیر سیستم قرار میدهد.
راهکار: قبل از بهروزرسانی، نسخه SPP، نسل سرور و سیستمعامل پشتیبانیشده را بررسی کنید و Release Notes همان نسخه را مطالعه کنید.
تنظیمات BIOS و رفتار سرور پس از قطع برق
تنظیمات BIOS/UEFI مربوط به Power Management، Thermal و رفتار سرور پس از بازگشت برق باید متناسب با نیاز زیرساخت تنظیم شوند.
در برخی سرورها میتوان تعیین کرد دستگاه پس از بازگشت برق روشن شود، خاموش بماند یا به وضعیت قبل از قطع برق بازگردد.
راهکار: تنظیمات مربوط به بازگشت برق را براساس نوع سرویس و سیاست زیرساخت سازمان انتخاب کنید.
برای برخی سرویسها روشن شدن خودکار سرور مناسب است؛ اما در بعضی محیطها ممکن است لازم باشد ابتدا Storage یا سایر تجهیزات وابسته در دسترس قرار گیرند.
چگونه از خاموش شدن ناگهانی سرور HP جلوگیری کنیم؟
برای کاهش احتمال خاموشی ناگهانی سرور، بهتر است وضعیت سختافزار، دما، ذخیرهسازی و برق بهصورت منظم بررسی شود. انجام چند اقدام ساده میتواند بسیاری از مشکلات را پیش از تبدیل شدن به خطای جدی مشخص کند.
- مانیتورینگ با HPE iLO: وضعیت System Health، پاورها، فنها و سنسورهای دما را بهصورت دورهای بررسی کنید. در صورت پشتیبانی مدل و تنظیمات iLO، هشدارهای مهم را برای مدیر شبکه فعال کنید.
- بررسی سلامت هارد و RAID: با استفاده از HPE Smart Storage Administrator یا SSA وضعیت هاردها، کنترلر و آرایه RAID را بررسی کنید. اگر خطای مربوط به Drive یا RAID مشاهده شد، قبل از خرابی کامل دیسک برای بررسی و در صورت نیاز تعویض آن برنامهریزی کنید.
- کنترل دما و جریان هوا: دمای ورودی سرور را در محدوده توصیهشده برای همان مدل نگه دارید و مطمئن شوید مسیر ورود و خروج هوا مسدود نیست. همچنین وضعیت فنها، رک و سیستم تهویه بهصورت دورهای بررسی شود.
- استفاده از UPS مناسب: برای کاهش اثر قطع برق و نوسانات، از UPS متناسب با توان مصرفی سرور و تجهیزات وابسته استفاده کنید.
- بهروزرسانی Firmware و درایورها: نسخه Firmware و Driverهای اصلی سرور را براساس مدل، نسل و سیستمعامل بررسی کنید و بهروزرسانیها را پس از بررسی سازگاری انجام دهید.
تعمیر سرور یا تعویض آن؟
اگر سرور بهطور مکرر با خطاهای سختافزاری جدی مانند 102-System Board Failure مواجه میشود، نسل دستگاه قدیمی است یا هزینه تأمین قطعات و تعمیرات آن افزایش پیدا کرده، بهتر است علاوه بر تعمیر، گزینه جایگزینی سرور نیز بررسی شود.
تصمیم مناسب به عواملی مانند سن سرور، هزینه تعمیر، دسترسی به قطعات، نوع سرویسهای در حال اجرا و نیاز آینده مجموعه بستگی دارد.
چه زمانی جایگزینی سرور را بررسی کنیم؟
جایگزینی سرور میتواند زمانی مطرح شود که:
- خطاهای سختافزاری مهم بهصورت مکرر تکرار شوند.
- قطعات موردنیاز بهسختی تأمین شوند.
- هزینه نگهداری دستگاه افزایش پیدا کرده باشد.
- نسل سرور پاسخگوی سیستمعامل یا نرمافزار موردنیاز نباشد.
- ظرفیت پردازشی، حافظه یا ذخیرهسازی فعلی برای توسعه زیرساخت کافی نباشد.
تعمیر سرور بهصرفه است یا تعویض؟
اگر درباره تعمیر یا جایگزینی سرور مطمئن نیستید، کارشناسان شبکه ارغوان میتوانند وضعیت دستگاه، نیاز سختافزاری و بودجه مجموعه شما را بررسی کنند و گزینه مناسب را پیشنهاد دهند.
برای مشاهده مدلهای موجود و استعلام قیمت میتوانید صفحه خرید سرور HP را ببینید یا با شماره 02141902 تماس بگیرید.
درپایان
برای عیبیابی خطاهای سرور HP، بهتر است قبل از تعویض قطعات، وضعیت iLO، لاگهای IML، پیامهای POST و سلامت بخشهایی مانند RAM، پاور، فن، ذخیرهسازی و Firmware بررسی شود.
نوع خطا و روش رفع آن میتواند بسته به مدل و نسل سرور متفاوت باشد؛ بنابراین بررسی پیام دقیق خطا و مراجعه به اطلاعات همان مدل اهمیت زیادی دارد.
در سرورهایی که خطاهای سختافزاری بهصورت مکرر تکرار میشوند، علاوه بر تعمیر باید هزینه تأمین قطعه، عمر دستگاه و نیاز آینده زیرساخت نیز بررسی شود تا مشخص شود ادامه تعمیر منطقیتر است یا جایگزینی سرور.
سوالات متداول درباره خطاهای سرور HP
اولین قدم برای پیدا کردن علت خاموش شدن سرور HP چیست؟
بهتر است ابتدا وضعیت HPE iLO، بخش Integrated Management Log یا IML و System Health بررسی شود. این بخشها میتوانند اطلاعات مربوط به بسیاری از رویدادهای سختافزاری و زمان وقوع آنها را نمایش دهند.
آیا قدیمی بودن Firmware میتواند باعث ناپایداری سرور شود؟
بله. Firmware یا Driver نامناسب میتواند در برخی شرایط باعث ناسازگاری و ناپایداری شود. قبل از بهروزرسانی، نسخه مناسب برای نسل سرور و سیستمعامل را بررسی کنید.
چگونه بفهمیم سرور به دلیل افزایش دما خاموش شده است؟
در iLO وضعیت Temperature Sensors و IML را بررسی کنید. اگر رویداد Thermal یا هشدار مرتبط با افزایش دما ثبت شده باشد، باید وضعیت فنها، جریان هوا و دمای ورودی سرور بررسی شود.
چرا با وجود دو پاور Redundant، سرور ممکن است خاموش شود؟
وجود دو پاور بهتنهایی به معنی افزونگی کامل مسیر برق نیست. اگر هر دو PSU از یک منبع برق مشترک تغذیه شوند، خرابی همان مسیر میتواند هر دو را همزمان تحت تأثیر قرار دهد.
همچنین باید وضعیت خود پاورها، کابلها و ظرفیت تأمین توان نیز بررسی شود.
برای کاهش خطاهای تکراری سرور HP چه اقداماتی انجام دهیم؟
مانیتورینگ منظم از طریق iLO، بررسی IML، کنترل دما و فنها، بررسی سلامت Storage، استفاده از برق و UPS مناسب و بهروزرسانی کنترلشده Firmware از مهمترین اقدامات پیشگیرانه هستند.
برای بررسی خطای سرور HP نیاز به راهنمایی دارید؟
اگر پس از بررسی iLO، IML، وضعیت پاور، حافظه، ذخیرهسازی و سیستم خنککننده هنوز علت مشکل مشخص نشده است، کارشناسان شبکه ارغوان میتوانند در بررسی وضعیت سرور و انتخاب مسیر مناسب برای تعمیر یا جایگزینی دستگاه به شما کمک کنند.
برای مشاوره فنی میتوانید با شماره 02141902 تماس بگیرید.
