بازگشت به اخبار
مرکز داده

پنل تخصصی «چارچوب تاب‌آوری عملیاتی مراکز داده در شرایط بحران واقعی»

۱۴۰۵/۶/۲۴
پنل تخصصی «چارچوب تاب‌آوری عملیاتی مراکز داده در شرایط بحران واقعی»

مدیرعامل طوبی امید راهبر در نمایشگاه الکامپ: «بحران در دیتاسنتر از خرابی تجهیزات آغاز نمی‌شود؛ از نبود آمادگی سازمان آغاز می‌شود»

حمیدرضا شاهرخی، مدیرعامل شرکت طوبی امید راهبر، در پنل تخصصی «چارچوب تاب‌آوری عملیاتی مراکز داده در شرایط بحران واقعی» که در نمایشگاه بین‌المللی الکامپ 1405 برگزار شد، به تشریح رویکرد این شرکت در مواجهه با بحران و ارتقای تاب‌آوری مراکز داده پرداخت.

مرز میان Incident و Crisis

به گفته شاهرخی، هر خرابی در دیتاسنتر لزوماً به معنای بحران نیست. اگر یک UPS از مدار خارج شود اما سیستم Redundancy بتواند بدون اختلال بار را پوشش دهد، همچنان با یک Incident روبه‌رو هستیم؛ اما زمانی که حادثه از ظرفیت کنترل عادی خارج شود و تداوم سرویس، ایمنی یا کسب‌وکار را تهدید کند، وارد شرایط Crisis شده‌ایم. او تأکید کرد: «هر Incident الزاماً Crisis نیست، اما اگر به‌درستی مدیریت نشود، می‌تواند به Crisis تبدیل شود.»

Redundancy با Resilience یکی نیست

مدیرعامل طوبی امید راهبر با مثال‌هایی از برق و سرمایش نشان داد که وجود تجهیزات افزونه به‌تنهایی تاب‌آوری را تضمین نمی‌کند. چهار ژنراتور که همه به یک سیستم سوخت‌رسانی مشترک وابسته باشند، یا دو مسیر برق که در بخشی از مسیر از یک تابلو یا اتاق مشترک عبور کنند، نمونه‌هایی از «نقطه شکست مشترک» (Common Point of Failure) پنهان در دل یک طراحی به‌ظاهر افزونه هستند. به گفته او، ارزیابی تاب‌آوری باید فراتر از شمارش تجهیزات برود و وابستگی‌های پنهان در برق، سرمایش، شبکه، سوخت، سیستم‌های کنترلی، قطعات یدکی، تأمین‌کنندگان و حتی نیروی انسانی را شناسایی کند.

فرماندهی بحران و آمادگی عملیاتی

شاهرخی بر ضرورت مشخص‌بودن زنجیره فرماندهی پیش از وقوع بحران تأکید کرد: اینکه چه کسی بحران را اعلام می‌کند، چه کسی تصمیم می‌گیرد و چه کسی مسئول ارتباط با مدیریت و مشتریان است. او همچنین گفت داشتن سند مدیریت بحران کافی نیست؛ این سند باید به Procedure، EOP، Runbook و Checklist تبدیل و به‌طور منظم تمرین شود. برای نمونه، در سناریوی قطع برق شهر و روشن‌نشدن یک ژنراتور، آنچه تفاوت واقعی ایجاد می‌کند، مشخص‌بودن مسئولیت‌ها، اختیار Load Shedding و مسیر Escalation از پیش تمرین‌شده است.

جمع‌بندی: Design – Preparedness – Command

او چارچوب تاب‌آوری مراکز داده را در سه کلمه خلاصه کرد: طراحی زیرساخت برای حذف نقاط شکست پنهان (Design)، آمادگی از طریق تمرین سناریوها (Preparedness) و شفافیت در تصمیم‌گیری و ارتباطات در لحظه بحران (Command). وی در پایان این بخش گفت: «بحران در دیتاسنتر از لحظه خرابی یک تجهیز شروع نمی‌شود؛ بحران زمانی شروع می‌شود که سازمان برای آن خرابی آماده نباشد.»

دیتاسنتر طوبی در دوران بحران‌های اخیر

شاهرخی در بخش دوم سخنان خود به وضعیت مراکز داده در دوران جنگ و بحران‌های اخیر اشاره کرد و پنج عامل مؤثر در کیفیت پایدار سرویس‌های دیتاسنتر طوبی را برشمرد:

۱. ایجاد ساختار سازمانی برای پیش‌بینی و پیشگیری از بحران
۲. بهره‌گیری از راهکارهای برآمده از ارزیابی و ممیزی دوره‌ای نقاط ضعف و قوت دیتاسنتر
۳. آموزش کارکنان و برگزاری مانورهای تخصصی
۴. استفاده از ابزارها و تجهیزات تحلیل داده مانند DCIM برای رسیدن به پیش‌بینی و پیشگیری
۵. ایجاد لایه‌های تصمیم‌گیری و تفویض اختیار متناسب با هر سناریو در سطوح مختلف سازمان

سوالی دارید؟

تیم ما آماده است تا به سوالات شما پاسخ دهد و راهنمایی‌های لازم را ارائه کند.