نبردی برای پایداری سرویس‌ها زیر سایه جنگ

نبردی برای پایداری سرویس‌ها زیر سایه جنگ

پیش از آغاز جنگ چهل‌روزه، وقتی هر روز خبرهایی از احتمال ازسرگیری دوباره جنگ منتشر می‌شد، برای ما که مسئولیت پایداری سرویس‌های حیاتی را برعهده داشتیم، موضوع فراتر ابعاد عمومی بود. بر همین اساس تجربه حملات سایبری و وابستگی روزافزون کسب‌وکارها و کاربران به سرویس‌های دیجیتال باعث شده بود که از مدت‌ها پبش از آغاز جنگ چهل‎‌روزه سناریوهای مختلف بحران را مرور کنیم.

از شوک اولیه تا آماده‌باش عملیاتی

با آغاز جنگ، پس از گذار از شوک و ابهام اولیه خیلی زود ذهن‌ها از اخبار و نگرانی‌های لحظه‌ای فاصله گرفت و بسوی گمانه‌زنی‌های درباره سناریوهای مدیریت بحران رفت که اگر ارتباطات محدود شوند یا اگر زیرساخت‌های حیاتی هدف قرار بگیرند، چگونه سرویس‌ها را پایدار نگه داریم؟ برای تیم دواپس، آغاز جنگ به معنای آغاز یک دوره آماده‌باش عملیاتی بود.

اهمیت این مسئولیت زمانی بیشتر مشخص می‌شود که بدانیم شبکه پاد، که زیرساخت، بهره‌برداری و پشتیبانی آن توسط فناپ زیرساخت انجام می‌شود، میزبان بخش مهمی از خدمات بانک پاسارگاد است و حدود ۶۰ درصد تراکنش‌های این بانک از طریق این بستر پردازش می‌شود. هرگونه اختلال در این سرویس‌ها می‌توانست تأثیر مستقیمی بر خدمات بانکی و تجربه مشتریان داشته باشد. به همین دلیل، پایداری سرویس‌ها در آن روزها فقط یک مسئولیت فنی نبود، بلکه بخشی از تداوم خدمت به میلیون‌ها کاربر محسوب می‌شد.

ساعاتی پس از آغاز درگیری‌ها، تیم‌های عملیاتی وارد وضعیت آماده‌باش شدند. برخلاف بسیاری از فعالیت‌ها که در شرایط بحرانی ممکن است متوقف یا محدود شوند، برای تیم دواپس بحران دقیقاً زمانی است که حجم مسئولیت‌ها چند برابر می‌شود.

در همان روزهای نخست، پایش مداوم سرویس‌ها، زیرساخت‌ها، سامانه‌های مانیتورینگ و زنجیره‌های استقرار به اولویت اصلی تیم دواپس تبدیل شد. شرایط بگونه‌ای بود که کوچک‌ترین اختلال می‌توانست پیامدهای گسترده‌ای داشته باشد. به همین دلیل بسیاری از اعضای تیم ساعت‌های طولانی وضعیت سرویس‌ها، منابع پردازشی، سلامت کلاسترها (مجموعه سرورهای مستقل که بصورت هماهنگ و یکپارچه با یکدیگر کار می‌کنند)، وضعیت پایگاه‌های داده و شاخص‌های عملکردی را زیر نظر داشتند تا هرگونه نشانه از اختلال در سریع‌ترین زمان ممکن شناسایی و برطرف شود.

راه‌اندازی سرویس‌ها در سایت بحران

یکی از مهم‌ترین مأموریت‌های آن روزها، آماده‌سازی و راه‌اندازی سرویس‌ها در سایت دیزستر (سایت بحران) بود. در شرایط بحران، صرف آماده بودن تجهیزات و زیرساخت کافی نیست؛ اپلیکیشن‌ها، سرویس‌های میانی، پایگاه‌های داده و فرایندهای استقرار نیز باید آماده باشند تا در صورت نیاز بتوانند در سایت جایگزین به فعالیت ادامه دهند.

بخش قابل توجهی از زمان تیم دواپس به بررسی وابستگی سرویس‌ها، بازبینی فرایندهای استقرار، همگام‌سازی تنظیمات محیط‌ها و اطمینان از قابلیت راه‌اندازی سامانه‌ها در سایت بحران معطوف شد. بسیاری از اپلیکیشن‌ها و سرویس‌های حیاتی بصورت آزمایشی در سایت دیزستر مستقر و راه‌اندازی شدند تا اطمینان حاصل شود در صورت وقوع هرگونه رخداد پیش‌بینی‌نشده، امکان ادامه ارائه خدمت با حداقل زمان توقف وجود خواهد داشت.

در کنار این اقدامات، سناریوهای مختلف بازیابی سرویس‌ها، جابه‌جایی بار کاری و فعال‌سازی سایت جایگزین نیز بارها مورد بازبینی و ارزیابی قرار گرفت. هدف این بود که اگر بدترین سناریو رخ داد، کاربران کمترین تأثیر را احساس کنند.

تداوم خدمت در شرایط محدودیت ارتباطی

بسیاری از سامانه‌های مدرن وابستگی‌هایی دارند که در شرایط عادی کمتر به چشم می‌آیند، اما در زمان بحران می‌توانند به نقاط حساس تبدیل شوند، در همین زمینه با محدودیت‌های احتمالی اینترنت و دسترسی به سرویس‌ها و منابع خارجی، بسیاری از فرایندهایی که در شرایط عادی بصورت خودکار انجام می‌شدند، دیگر به سادگی گذشته در دسترس نبودند. دریافت برخی وابستگی‌های نرم‌افزاری، به‌روزرسانی‌ها و بسته‌های مورد نیاز با دشواری همراه شده بود و در مواردی لازم بود فرایند دریافت، انتقال، بیلد و انتشار نسخه‌ها بصورت دستی انجام شود تا سرویس‌ها بدون وقفه به فعالیت خود ادامه دهند.

بنابراین تیم دواپس افزون بر حفظ سرویس‌های جاری، روی سناریوهای ارائه خدمت در شرایط محدود یا آفلاین نیز تمرکز داشت. بخشی از تلاش‌ها صرف این شد که سرویس‌های حیاتی حتی در صورت محدودیت‌های ارتباطی بتوانند به فعالیت خود ادامه دهند و وابستگی به منابع بیرونی تا حد امکان کاهش یابد. این موضوع در برخی موارد نیازمند تغییر رویه‌های عملیاتی، اجرای فرایندهای دستی و هماهنگی نزدیک با تیم‌های زیرساخت، شبکه و امنیت بود؛ اقداماتی که شاید در روزهای عادی کمتر مورد توجه قرار بگیرند اما در شرایط بحران نقش تعیین‌کننده‌ای دارند.

سناریوهایی برای روزهای نامعلوم

شاید دشوارترین بخش ماجرا، آماده شدن برای اتفاقاتی بود که امیدوار بودیم هرگز رخ ندهند. جلسات متعددی برای بررسی سناریوهای بحران برگزار می‌شد؛ از قطعی گسترده ارتباطات گرفته تا اختلال در سرویس‌های حیاتی، از دسترس خارج شدن برخی زیرساخت‌ها یا نیاز به انتقال سرویس‌ها به سایت جایگزین.

بخش مهمی از فعالیت‌های تیم صرف بازنگری برنامه‌های بازیابی، بررسی نقاط شکست احتمالی و آماده‌سازی راهکارهای جایگزین شد. در بسیاری از مواقع باید تصمیم‌هایی گرفته می‌شد که تجربه مستقیمی برای آن وجود نداشت و تنها می‌شد بر پایه تحلیل، تجربه فنی و سناریوهای احتمالی پیش رفت.

در آن روزها هشدارهای مانیتورینگ، جلسات بحران، استقرارهای اضطراری و پیگیری وضعیت سرویس‌ها بخشی از زندگی روزمره ما شده بود. گاهی ساعت‌ها پشت سیستم می‌نشستیم و همزمان اخبار جنگ را دنبال می‌کردیم. در گروه‌های کاری، مکالمه‌ها دیگر فقط درباره سرویس‌ها نبود:

وضعیت سرویس‌ها پایدار است؟

دسترسی‌ها برقرارند؟

بچه‌ها همه خوبین؟

همان تماس‌ها و پیام‌های روزانه، افزون بر هماهنگی فنی، به بخشی از روحیه دادن به یکدیگر تبدیل شده بود.

وقتی مسئولیت فراتر از شرح وظایف می‌شود

در میان تمام فشارها و نگرانی‌ها، چیزی که بیش از هر چیز به چشم می‌آمد حس مسئولیتی بود که میان اعضای تیم جریان داشت. همه می‌دانستند که پایداری سرویس‌ها تنها به ابزارها، کلاسترها یا فرایندهای استقرار وابسته نیست؛ بلکه به آدم‌هایی وابسته است که در سخت‌ترین شرایط کنار یکدیگر می‌مانند و مسئولیت مشترکی را برعهده می‌گیرند.

در آن روزها بسیاری از تصمیم‌ها تنها بر اساس وظایف سازمانی گرفته نمی‌شد. دغدغه اصلی این بود که اگر مشکلی پیش آمد، بار اضافه‌ای بر دوش همکار دیگری قرار نگیرد و سرویسی که مردم به آن وابسته‌اند دچار اختلال نشود.

شاید همین حس مسئولیت جمعی بود که باعث شد با وجود تمام نگرانی‌ها، آماده‌باش‌های طولانی و شرایط نامطمئن، سرویس‌ها همچنان پایدار باقی بمانند.

پایداری در روزهای ناآرام

وقتی به آن روزها نگاه می‌کنیم، جنگ را فقط با صدای انفجارها به یاد نمی‌آوریم. برای ما، جنگ با هشدارهای مانیتورینگ، استقرارهای اضطراری، راه‌اندازی سایت دیزستر، بررسی سلامت سرویس‌ها، انتشار نسخه‌ها در شرایط محدودیت ارتباطی و تلاش شبانه‌روزی برای حفظ پایداری سامانه‌ها گره خورده است.

در روزهایی که کشور با شرایطی کم‌سابقه روبه‌رو بود، مأموریت ما این بود که سرویس‌ها متوقف نشوند، کاربران بتوانند از خدمات مورد نیاز خود استفاده کنند و کسب‌وکارها با کمترین اختلال به فعالیت خود ادامه دهند.

شاید مهم‌ترین دستاورد آن روزها همین باشد؛ اینکه در میان تمام نگرانی‌ها و عدم قطعیت‌ها، توانستیم با اتکا به دانش فنی، همکاری و حس مسئولیت‌پذیری، سهم خود را در حفظ تداوم خدمات ایفا کنیم.

سعید فلاح
مسئول فنی مهندسی عملیات توسعه (دواپس)

 

 

مقالات مرتبط
پاسخ دهید

آدرس ایمیل شما منتشر نخواهد شد.فیلد های الزامی علامت گذاری شده اند *