Представляем Synadia Insights: находите сбои в NATS, о которых другие системы молчат
Synadia
0:00 / 0:00
Представляем Synadia Insights: находите сбои в NATS, о которых другие системы молчат
249 просмотров · 1 месяц назад
Synadia
7,07 тыс. подписчиков
249 просмотров · 1 месяц назад
Некоторые сбои никогда не приводят к ошибке. Ни оповещения, ни записи в логе, все проверки работоспособности пройдены успешно — и результат всё равно неверный. Реальный ущерб наносится в промежутке между моментом сбоя и моментом, когда его замечают, и большее количество панелей мониторинга его не устранит.
Это наше введение в Synadia Insights. Чтобы показать, что она делает, мы намеренно прерываем поток JetStream, ищем причину сбоя с помощью обычных инструментов, а затем направляем Insights на тот же кластер.
Что вы узнаете:
Что такое Insights: один исполняемый файл, который каждую минуту запрашивает состояние вашего кластера, записывает его, проверяет и предоставляет ответы.
Как это работает: пять этапов, снимки эпохи вместо выборок метрик и 142 проверки, которые поставляются вместе с ним.
Почему результаты прикрепляются к сущностям и сохраняются дольше, чем симптом, так что доказательства сохраняются после перезапуска, который их скрывает.
Где CLI исчерпывает свои возможности: «Lost 0» и «Unprocessed 2000» — оба значения верны и вводят в заблуждение.
Во сколько на самом деле обходится обнаружение этого в Prometheus: флаг jsz=all, запрос, который никто не поставляет, и панель мониторинга, которой нет в хабе Grafana.
Реальные заявки клиентов, которые он бы обнаружил: зеркало ключ-значение, зависшее на несколько недель, поток зеркал, который незаметно перестал продвигаться.
Пример ошибки: поток, ограниченный 2000 сообщениями, обрезается прямо мимо закладки остановленного потребителя. 10 000 сообщений уничтожено, ничего не зафиксировано, никто не уведомлен. Журнал событий имеет ограничение — закладки — нет.
Это первое видео. Далее мы подробнее рассмотрим аналитику.
-- Временные метки --
0:00 Разрыв между поломкой и её обнаружением
0:52 Почему CLI отвечает только на ваши вопросы
1:42 Сбой: 10 000 сообщений, ноль ошибок
2:15 Три термина: поток, потребитель, ограничение на хранение
3:39 Настройка: один сервер, один поток, две закладки
4:58 Остановка ANALYTICS с кодом выхода 0
5:39 Публикация 12 000 сообщений, наблюдение за ограничением
6:48 Демонстрация CLI: информация о потоке, отчет о потоке, отчет о потребителе
9:21 Prometheus и Grafana на одном и том же сбое
11:50 Пользовательская панель мониторинга, которая действительно это показывает
14:43 Архитектура Insights: один бинарный файл, пять этапов
17:14 Insights отслеживает сбой в режиме реального времени
20:35 Сравнение трех инструментов и реальные обращения клиентов
-- Ресурсы --
Документация NATS: https://docs.nats.io
NATS GitHub: https://github.com/nats-io
Synadia: https://www.synadia.com
Insights: https://www.synadia.com/insights
#NATS #JetStream #Observability #DistributedSystems #Prometheus #CloudNative