Перейти к содержимому

Понимание прогрессирующего обрушения: как избежать каскадного сбоя

InfoQ

0:00 / 0:00

Понимание прогрессирующего обрушения: как избежать каскадного сбоя

2 492 просмотра · 8 дн. назад
InfoQ
234 тыс. подписчиков
2 492 просмотра · 8 дн. назад
Когда микросервисы и облачные архитектуры дают сбой, это не просто обрушение — это каскадный процесс. Сэм Ньюман исследует, как концепция «прогрессирующего обрушения» в гражданском строительстве напрямую применима к современным распределенным системам, анализируя реальные примеры аварийных ситуаций, от обрушения башни в Ронан-Пойнт до крупных сбоев в работе регионов AWS. Узнайте, почему традиционные решения по обеспечению безопасности не работают в сложных средах и как применять три основных архитектурных подхода к смягчению последствий: снижение рисков, усиление компонентов и разделение взаимосвязей. ⏱️ Временные метки видео (для навигации) 0:00 - Чему нас учит гражданское строительство о каскадах систем 1:20 - Объяснение обрушения башни Ронан-Пойнт 3:10 - Сбой AWS us-east-1: как небольшая ошибка DNS привела к отключению облака 5:45 - Сайт подержанных автомобилей: насыщение потоков и зависания в нисходящем потоке 7:30 - Миф о единственной «первопричине» системных сбоев 9:15 - Меры по смягчению последствий №1: снижение опасности и сброс нагрузки 11:00 - Меры по смягчению последствий №2: усиление компонентов (многорегиональные компромиссы) 13:40 - Меры по смягчению последствий №3: снижение взаимосвязи и пример Monzo 15:50 - Парадокс сложности: почему меры по смягчению последствий могут привести к сбоям 18:30 - ИИ, молодые специалисты и возвращение технических дисциплин QA/SRE 🔗 Транскрипт и слайды доступны на InfoQ: https://bit.ly/4A5W0mM #АрхитектураПрограммногоОбразования #РаспределенныеСистемы #ИнженернаяУстойчивость #InfoQ #Микросервисы