دسته‌ها
سرور

خطاهای سرور HP؛ راهنمای عیب‌یابی و رفع خطاهای HPE ProLiant

اگر سرور HP شما ناگهان خاموش شده، بوت نمی‌شود یا با هشدار سخت‌افزاری مواجه شده است، قبل از تعویض قطعه باید مشخص شود خطا از کدام بخش سرور ایجاد شده است. مشکلات پاور و خنک‌کننده، حافظه RAM، ذخیره‌سازی، Firmware یا تنظیمات مدیریتی از مهم‌ترین بخش‌هایی هستند که باید بررسی شوند.

اولین قدم در عیب‌یابی سرور HPE ProLiant، بررسی لاگ‌های iLO و بخش Integrated Management Log یا IML است. این لاگ‌ها اطلاعات مربوط به رویدادهای سیستم، وضعیت سخت‌افزار و زمان وقوع بسیاری از خطاها را در اختیار مدیر شبکه قرار می‌دهند. در نسل‌هایی که از Active Health System پشتیبانی می‌کنند، بررسی AHS Log نیز می‌تواند اطلاعات بیشتری برای تشخیص علت مشکل ارائه دهد.

خاموشی ناگهانی، روشن نشدن سرور، هشدار Health LED، خطاهای POST یا ثبت پیام‌های وضعیت بحرانی در iLO می‌توانند نشانه وجود مشکل در یکی از اجزای سخت‌افزاری، Firmware یا تنظیمات سیستم باشند.

نکته مهم این است که قبل از تعویض آزمایشی قطعات، ابتدا پیام خطا و لاگ‌های سرور بررسی شوند؛ زیرا تعویض قطعه بدون تشخیص علت می‌تواند هم زمان‌بر باشد و هم هزینه عیب‌یابی را افزایش دهد.

در این راهنما، خطاهای رایج سرورهای HP و HPE ProLiant را در بخش‌هایی مانند حافظه، پردازنده، پاور، سیستم خنک‌کننده، ذخیره‌سازی و Firmware بررسی می‌کنیم و مسیر اولیه عیب‌یابی هرکدام را توضیح می‌دهیم.

فهرست مقاله

Toggle

شناسایی خطای سرور HP

قبل از بررسی کدهای خطا، بهتر است ابتدا مشخص شود سرور از چه طریقی وضعیت خود را اعلام می‌کند. در سرورهای HPE ProLiant، چراغ‌های وضعیت، پیام‌های POST و اطلاعات ثبت‌شده در iLO از مهم‌ترین منابع برای تشخیص اولیه مشکل هستند.

چراغ‌های وضعیت سرور

چراغ Health LED روی پنل جلوی بسیاری از سرورهای HPE ProLiant وضعیت کلی سیستم را نشان می‌دهد.

  • سبز ثابت: وضعیت سیستم عادی است.
  • نارنجی چشمک‌زن: سیستم در وضعیت Degraded قرار دارد و یکی از اجزا یا بخش‌های سخت‌افزاری نیاز به بررسی دارد.
  • قرمز چشمک‌زن: وضعیت سیستم Critical است و علت خطا باید از طریق iLO و IML بررسی شود.

رنگ و رفتار دقیق LED ممکن است میان مدل‌ها و نسل‌های مختلف تفاوت داشته باشد؛ بنابراین بهتر است در وضعیت Degraded یا Critical علاوه بر چراغ پنل، پیام‌های ثبت‌شده در iLO نیز بررسی شوند.

پیام‌های POST و کدهای خطا

هنگام روشن شدن سرور، فرآیند Power-On Self-Test یا POST وضعیت اولیه سخت‌افزار را بررسی می‌کند.

اگر مشکلی وجود داشته باشد، ممکن است پیام یا کد خطا روی نمایشگر، کنسول مدیریتی یا iLO ثبت شود.

وجود یک پیام POST به‌تنهایی همیشه برای تشخیص قطعه معیوب کافی نیست. بهتر است کد نمایش‌داده‌شده همراه با IML و وضعیت سخت‌افزار بررسی شود.

بررسی لاگ‌های HPE iLO

یکی از دقیق‌ترین روش‌ها برای بررسی علت خطا، مراجعه به HPE iLO و بخش Integrated Management Log یا IML است.

در این قسمت می‌توان رویدادهای سخت‌افزاری، زمان وقوع خطا و پیام‌های مرتبط با وضعیت سیستم را مشاهده کرد.

اگر Health LED وضعیت Degraded یا Critical را نشان می‌دهد، بررسی IML و System Health یکی از اولین اقدامات مناسب برای عیب‌یابی است.

عیب‌یابی سریع کدهای رایج خطای سرور HP

بعضی از خطاها در نسل‌ها و مدل‌های مختلف ممکن است پیام متفاوتی داشته باشند؛ بنابراین همیشه متن کامل خطا و مستندات همان مدل را نیز بررسی کنید.

کد یا پیام خطا علت احتمالی اقدام اولیه
101-ROM Error مشکل یا ناسازگاری ROM یا Firmware بررسی Firmware و قطعات توسعه
102-System Board Failure خطای مرتبط با System Board در برخی نسل‌ها بررسی IML و عیب‌یابی مادربرد
17xx خطاهای مرتبط با ذخیره‌سازی یا کنترلر در برخی نسل‌ها بررسی Storage و SSA
Fan Solution Not Redundant کاهش افزونگی فن یا مشکل یکی از فن‌ها بررسی Fan Status در iLO
Invalid Memory RAM ناسازگار، نصب نادرست یا خرابی DIMM بررسی IML، اسلات و نوع حافظه

خطاهای سخت‌افزاری حافظه و پردازنده در سرور HP

خطاهای مربوط به حافظه، پردازنده و مادربرد می‌توانند باعث ناپایداری، توقف فرآیند Boot یا ثبت پیام‌های Critical شوند.

برای تشخیص دقیق این خطاها بهتر است علاوه بر نشانه‌های ظاهری، پیام‌های POST و رویدادهای ثبت‌شده در HPE iLO و IML نیز بررسی شوند.

خطاهای حافظه و HPE SmartMemory

سرورهای HPE ProLiant از ماژول‌های حافظه مشخص و سازگار با هر مدل و نسل پشتیبانی می‌کنند.

در بسیاری از این سرورها از HPE SmartMemory استفاده می‌شود و قابلیت‌هایی مانند Advanced ECC یا Online Spare نیز بسته به مدل و پیکربندی در دسترس هستند.

استفاده از DIMM ناسازگار، خرابی ماژول حافظه یا نصب نادرست RAM می‌تواند باعث ایجاد خطا شود.

نشانه‌های احتمالی خطای RAM شامل این موارد است:

  • ثبت Correctable یا Uncorrectable Memory Error در IML
  • نمایش پیام مربوط به DIMM هنگام POST
  • شناسایی نشدن یکی از ماژول‌های حافظه
  • خارج شدن DIMM معیوب از دسترس سیستم در برخی شرایط
  • نمایش هشدار مرتبط با حافظه در iLO

راهکار: ابتدا شماره DIMM و پیام ثبت‌شده در IML را بررسی کنید. سپس نصب صحیح ماژول، سازگاری RAM با مدل سرور و وضعیت Firmware را کنترل کنید.

اگر خطا روی یک DIMM مشخص به‌صورت مکرر ثبت می‌شود، باید براساس راهنمای همان مدل، ماژول حافظه و اسلات مربوط به آن بررسی شود.

خطاهای پردازنده و مادربرد

خطاهای مربوط به CPU و System Board می‌توانند باعث توقف POST، روشن نشدن کامل سرور یا ثبت پیام خطا در iLO شوند.

یکی از پیام‌های شناخته‌شده در برخی نسل‌های قدیمی‌تر ProLiant، خطای 102-System Board Failure است که به وجود مشکل در بخشی از System Board اشاره می‌کند.

در چنین شرایطی نباید صرفاً براساس بوق، تصویر ندادن یا خاموش شدن سرور نتیجه گرفت که CPU یا مادربرد خراب است.

نشانه‌های احتمالی عبارت‌اند از:

  • متوقف شدن فرآیند POST
  • روشن شدن سرور بدون تکمیل Boot
  • ثبت خطای CPU یا System Board در iLO
  • ریست یا خاموش شدن غیرمنتظره
  • شناسایی نشدن پردازنده در برخی شرایط

راهکار: ابتدا کد خطا، IML و وضعیت سخت‌افزار را بررسی کنید و سپس براساس مدل و نسل سرور از ابزارهای تشخیصی مناسب همان پلتفرم استفاده کنید.

اگر مشکل به مادربرد یا CPU مربوط باشد، قبل از تعویض قطعه بهتر است هزینه تعمیر، قیمت قطعه، نسل سرور و ارزش ادامه استفاده از دستگاه نیز بررسی شود.

خطاهای پاور، دما و سیستم خنک‌کننده در سرور HP

مشکلات مربوط به منبع تغذیه، فن و افزایش دمای داخلی می‌توانند باعث هشدار سخت‌افزاری، از دست رفتن حالت Redundant یا حتی خاموشی ناگهانی سرور شوند.

در چنین شرایطی بهتر است ابتدا وضعیت پاورها، فن‌ها و سنسورهای دما از طریق HPE iLO و IML بررسی شود.

خطاهای منبع تغذیه

بسیاری از سرورهای سازمانی HPE می‌توانند با دو منبع تغذیه Redundant پیکربندی شوند.

اگر یکی از پاورها از مدار خارج شود، به‌درستی در شاسی قرار نگرفته باشد یا برق ورودی آن قطع شود، ممکن است افزونگی منبع تغذیه از بین برود و هشدار مربوط به Power Supply یا Power Redundancy در iLO ثبت شود.

نشانه‌های احتمالی:

  • تغییر وضعیت Power Supply در iLO
  • ثبت هشدار Power Redundancy Lost
  • خاموش یا هشداردهنده شدن LED پاور
  • خارج شدن سیستم از حالت Redundant

راهکار: ابتدا کابل برق، محل قرارگیری PSU و وضعیت هر پاور در iLO بررسی شود.

اگر زیرساخت برق مجموعه امکان آن را دارد، برای حفظ افزونگی واقعی بهتر است پاورهای Redundant از مسیرهای برق مستقل تغذیه شوند تا خرابی یک منبع برق، هر دو پاور را هم‌زمان از دسترس خارج نکند.

تعویض پاور به‌صورت Hot-Plug نیز فقط زمانی انجام شود که مدل سرور، نوع PSU و پیکربندی فعلی از این قابلیت پشتیبانی کند.

خطاهای سیستم خنک‌کننده و افزایش دما

خرابی فن، انسداد مسیر جریان هوا یا افزایش دمای داخلی می‌تواند باعث ایجاد هشدار Thermal شود.

در شرایط بحرانی، سرور ممکن است برای محافظت از سخت‌افزار خاموش شود.

نشانه‌های احتمالی:

  • ثبت هشدار Thermal در iLO یا IML
  • افزایش دور فن‌ها
  • هشدار خرابی یا کاهش افزونگی فن
  • افزایش دمای یکی از سنسورها
  • خاموش شدن سرور در وضعیت حرارتی بحرانی

راهکار: در iLO وضعیت Temperature Sensors، Fan و System Health را بررسی کنید.

همچنین مطمئن شوید فن‌ها به‌درستی نصب شده‌اند و مسیر ورود و خروج هوا مسدود نیست.

دمای ورودی سرور باید در محدوده مجاز اعلام‌شده برای همان مدل و کانفیگ نگه داشته شود؛ زیرا محدوده مناسب ممکن است میان مدل‌ها و پیکربندی‌های مختلف متفاوت باشد.

خطاهای Firmware و تنظیمات نرم‌افزاری سرور

همه خطاهای سرور منشأ سخت‌افزاری ندارند. Firmware قدیمی، درایور ناسازگار یا تنظیمات نامناسب BIOS/UEFI نیز می‌تواند باعث ناپایداری یا ایجاد خطا در عملکرد برخی اجزای سرور شود.

ناسازگاری Firmware و درایورها

نسخه Firmware کنترلر RAID، کارت شبکه، System ROM و سایر اجزای سرور باید با نسل دستگاه و سیستم‌عامل مورد استفاده سازگار باشد. استفاده از نسخه‌های قدیمی یا نامناسب می‌تواند باعث بروز خطا در عملکرد تجهیزات یا سیستم‌عامل شود.

برای به‌روزرسانی سرورهای HPE می‌توان از Service Pack for ProLiant یا SPP متناسب با نسل سرور استفاده کرد.

این بسته مجموعه‌ای از Firmware، Driver و اجزای نرم‌افزاری مرتبط با سرورهای HPE را در اختیار مدیر سیستم قرار می‌دهد.

راهکار: قبل از به‌روزرسانی، نسخه SPP، نسل سرور و سیستم‌عامل پشتیبانی‌شده را بررسی کنید و Release Notes همان نسخه را مطالعه کنید.

تنظیمات BIOS و رفتار سرور پس از قطع برق

تنظیمات BIOS/UEFI مربوط به Power Management، Thermal و رفتار سرور پس از بازگشت برق باید متناسب با نیاز زیرساخت تنظیم شوند.

در برخی سرورها می‌توان تعیین کرد دستگاه پس از بازگشت برق روشن شود، خاموش بماند یا به وضعیت قبل از قطع برق بازگردد.

راهکار: تنظیمات مربوط به بازگشت برق را براساس نوع سرویس و سیاست زیرساخت سازمان انتخاب کنید.

برای برخی سرویس‌ها روشن شدن خودکار سرور مناسب است؛ اما در بعضی محیط‌ها ممکن است لازم باشد ابتدا Storage یا سایر تجهیزات وابسته در دسترس قرار گیرند.

چگونه از خاموش شدن ناگهانی سرور HP جلوگیری کنیم؟

برای کاهش احتمال خاموشی ناگهانی سرور، بهتر است وضعیت سخت‌افزار، دما، ذخیره‌سازی و برق به‌صورت منظم بررسی شود. انجام چند اقدام ساده می‌تواند بسیاری از مشکلات را پیش از تبدیل شدن به خطای جدی مشخص کند.

  • مانیتورینگ با HPE iLO: وضعیت System Health، پاورها، فن‌ها و سنسورهای دما را به‌صورت دوره‌ای بررسی کنید. در صورت پشتیبانی مدل و تنظیمات iLO، هشدارهای مهم را برای مدیر شبکه فعال کنید.
  • بررسی سلامت هارد و RAID: با استفاده از HPE Smart Storage Administrator یا SSA وضعیت هاردها، کنترلر و آرایه RAID را بررسی کنید. اگر خطای مربوط به Drive یا RAID مشاهده شد، قبل از خرابی کامل دیسک برای بررسی و در صورت نیاز تعویض آن برنامه‌ریزی کنید.
  • کنترل دما و جریان هوا: دمای ورودی سرور را در محدوده توصیه‌شده برای همان مدل نگه دارید و مطمئن شوید مسیر ورود و خروج هوا مسدود نیست. همچنین وضعیت فن‌ها، رک و سیستم تهویه به‌صورت دوره‌ای بررسی شود.
  • استفاده از UPS مناسب: برای کاهش اثر قطع برق و نوسانات، از UPS متناسب با توان مصرفی سرور و تجهیزات وابسته استفاده کنید.
  • به‌روزرسانی Firmware و درایورها: نسخه Firmware و Driverهای اصلی سرور را براساس مدل، نسل و سیستم‌عامل بررسی کنید و به‌روزرسانی‌ها را پس از بررسی سازگاری انجام دهید.

تعمیر سرور یا تعویض آن؟

اگر سرور به‌طور مکرر با خطاهای سخت‌افزاری جدی مانند 102-System Board Failure مواجه می‌شود، نسل دستگاه قدیمی است یا هزینه تأمین قطعات و تعمیرات آن افزایش پیدا کرده، بهتر است علاوه بر تعمیر، گزینه جایگزینی سرور نیز بررسی شود.

تصمیم مناسب به عواملی مانند سن سرور، هزینه تعمیر، دسترسی به قطعات، نوع سرویس‌های در حال اجرا و نیاز آینده مجموعه بستگی دارد.

چه زمانی جایگزینی سرور را بررسی کنیم؟

جایگزینی سرور می‌تواند زمانی مطرح شود که:

  • خطاهای سخت‌افزاری مهم به‌صورت مکرر تکرار شوند.
  • قطعات موردنیاز به‌سختی تأمین شوند.
  • هزینه نگهداری دستگاه افزایش پیدا کرده باشد.
  • نسل سرور پاسخ‌گوی سیستم‌عامل یا نرم‌افزار موردنیاز نباشد.
  • ظرفیت پردازشی، حافظه یا ذخیره‌سازی فعلی برای توسعه زیرساخت کافی نباشد.

تعمیر سرور به‌صرفه است یا تعویض؟

اگر درباره تعمیر یا جایگزینی سرور مطمئن نیستید، کارشناسان شبکه ارغوان می‌توانند وضعیت دستگاه، نیاز سخت‌افزاری و بودجه مجموعه شما را بررسی کنند و گزینه مناسب را پیشنهاد دهند.

برای مشاهده مدل‌های موجود و استعلام قیمت می‌توانید صفحه خرید سرور HP را ببینید یا با شماره 02141902 تماس بگیرید.

مشاوره تعمیر یا تعویض سرور

درپایان

برای عیب‌یابی خطاهای سرور HP، بهتر است قبل از تعویض قطعات، وضعیت iLO، لاگ‌های IML، پیام‌های POST و سلامت بخش‌هایی مانند RAM، پاور، فن، ذخیره‌سازی و Firmware بررسی شود.

نوع خطا و روش رفع آن می‌تواند بسته به مدل و نسل سرور متفاوت باشد؛ بنابراین بررسی پیام دقیق خطا و مراجعه به اطلاعات همان مدل اهمیت زیادی دارد.

در سرورهایی که خطاهای سخت‌افزاری به‌صورت مکرر تکرار می‌شوند، علاوه بر تعمیر باید هزینه تأمین قطعه، عمر دستگاه و نیاز آینده زیرساخت نیز بررسی شود تا مشخص شود ادامه تعمیر منطقی‌تر است یا جایگزینی سرور.

سوالات متداول درباره خطاهای سرور HP

اولین قدم برای پیدا کردن علت خاموش شدن سرور HP چیست؟

بهتر است ابتدا وضعیت HPE iLO، بخش Integrated Management Log یا IML و System Health بررسی شود. این بخش‌ها می‌توانند اطلاعات مربوط به بسیاری از رویدادهای سخت‌افزاری و زمان وقوع آن‌ها را نمایش دهند.

آیا قدیمی بودن Firmware می‌تواند باعث ناپایداری سرور شود؟

بله. Firmware یا Driver نامناسب می‌تواند در برخی شرایط باعث ناسازگاری و ناپایداری شود. قبل از به‌روزرسانی، نسخه مناسب برای نسل سرور و سیستم‌عامل را بررسی کنید.

چگونه بفهمیم سرور به دلیل افزایش دما خاموش شده است؟

در iLO وضعیت Temperature Sensors و IML را بررسی کنید. اگر رویداد Thermal یا هشدار مرتبط با افزایش دما ثبت شده باشد، باید وضعیت فن‌ها، جریان هوا و دمای ورودی سرور بررسی شود.

چرا با وجود دو پاور Redundant، سرور ممکن است خاموش شود؟

وجود دو پاور به‌تنهایی به معنی افزونگی کامل مسیر برق نیست. اگر هر دو PSU از یک منبع برق مشترک تغذیه شوند، خرابی همان مسیر می‌تواند هر دو را هم‌زمان تحت تأثیر قرار دهد.

همچنین باید وضعیت خود پاورها، کابل‌ها و ظرفیت تأمین توان نیز بررسی شود.

برای کاهش خطاهای تکراری سرور HP چه اقداماتی انجام دهیم؟

مانیتورینگ منظم از طریق iLO، بررسی IML، کنترل دما و فن‌ها، بررسی سلامت Storage، استفاده از برق و UPS مناسب و به‌روزرسانی کنترل‌شده Firmware از مهم‌ترین اقدامات پیشگیرانه هستند.

برای بررسی خطای سرور HP نیاز به راهنمایی دارید؟

اگر پس از بررسی iLO، IML، وضعیت پاور، حافظه، ذخیره‌سازی و سیستم خنک‌کننده هنوز علت مشکل مشخص نشده است، کارشناسان شبکه ارغوان می‌توانند در بررسی وضعیت سرور و انتخاب مسیر مناسب برای تعمیر یا جایگزینی دستگاه به شما کمک کنند.

برای مشاوره فنی می‌توانید با شماره 02141902 تماس بگیرید.

مشاوره عیب‌یابی سرور HP

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

خروج از نسخه موبایل