Понимание прогрессирующего обрушения: как избежать каскадного сбоя
InfoQ
0:00 / 0:00
Понимание прогрессирующего обрушения: как избежать каскадного сбоя
2 492 просмотра · 8 дн. назад
InfoQ
234 тыс. подписчиков
2 492 просмотра · 8 дн. назад
Когда микросервисы и облачные архитектуры дают сбой, это не просто обрушение — это каскадный процесс. Сэм Ньюман исследует, как концепция «прогрессирующего обрушения» в гражданском строительстве напрямую применима к современным распределенным системам, анализируя реальные примеры аварийных ситуаций, от обрушения башни в Ронан-Пойнт до крупных сбоев в работе регионов AWS.
Узнайте, почему традиционные решения по обеспечению безопасности не работают в сложных средах и как применять три основных архитектурных подхода к смягчению последствий: снижение рисков, усиление компонентов и разделение взаимосвязей.
⏱️ Временные метки видео (для навигации)
0:00 - Чему нас учит гражданское строительство о каскадах систем
1:20 - Объяснение обрушения башни Ронан-Пойнт
3:10 - Сбой AWS us-east-1: как небольшая ошибка DNS привела к отключению облака
5:45 - Сайт подержанных автомобилей: насыщение потоков и зависания в нисходящем потоке
7:30 - Миф о единственной «первопричине» системных сбоев
9:15 - Меры по смягчению последствий №1: снижение опасности и сброс нагрузки
11:00 - Меры по смягчению последствий №2: усиление компонентов (многорегиональные компромиссы)
13:40 - Меры по смягчению последствий №3: снижение взаимосвязи и пример Monzo
15:50 - Парадокс сложности: почему меры по смягчению последствий могут привести к сбоям
18:30 - ИИ, молодые специалисты и возвращение технических дисциплин QA/SRE
🔗 Транскрипт и слайды доступны на InfoQ: https://bit.ly/4A5W0mM
#АрхитектураПрограммногоОбразования #РаспределенныеСистемы #ИнженернаяУстойчивость #InfoQ #Микросервисы