Перейти к содержимому

Представляем Synadia Insights: находите сбои в NATS, о которых другие системы молчат

Synadia

0:00 / 0:00

Представляем Synadia Insights: находите сбои в NATS, о которых другие системы молчат

249 просмотров · 1 месяц назад
Synadia
7,07 тыс. подписчиков
249 просмотров · 1 месяц назад
Некоторые сбои никогда не приводят к ошибке. Ни оповещения, ни записи в логе, все проверки работоспособности пройдены успешно — и результат всё равно неверный. Реальный ущерб наносится в промежутке между моментом сбоя и моментом, когда его замечают, и большее количество панелей мониторинга его не устранит. Это наше введение в Synadia Insights. Чтобы показать, что она делает, мы намеренно прерываем поток JetStream, ищем причину сбоя с помощью обычных инструментов, а затем направляем Insights на тот же кластер. Что вы узнаете: Что такое Insights: один исполняемый файл, который каждую минуту запрашивает состояние вашего кластера, записывает его, проверяет и предоставляет ответы. Как это работает: пять этапов, снимки эпохи вместо выборок метрик и 142 проверки, которые поставляются вместе с ним. Почему результаты прикрепляются к сущностям и сохраняются дольше, чем симптом, так что доказательства сохраняются после перезапуска, который их скрывает. Где CLI исчерпывает свои возможности: «Lost 0» и «Unprocessed 2000» — оба значения верны и вводят в заблуждение. Во сколько на самом деле обходится обнаружение этого в Prometheus: флаг jsz=all, запрос, который никто не поставляет, и панель мониторинга, которой нет в хабе Grafana. Реальные заявки клиентов, которые он бы обнаружил: зеркало ключ-значение, зависшее на несколько недель, поток зеркал, который незаметно перестал продвигаться. Пример ошибки: поток, ограниченный 2000 сообщениями, обрезается прямо мимо закладки остановленного потребителя. 10 000 сообщений уничтожено, ничего не зафиксировано, никто не уведомлен. Журнал событий имеет ограничение — закладки — нет. Это первое видео. Далее мы подробнее рассмотрим аналитику. -- Временные метки -- 0:00 Разрыв между поломкой и её обнаружением 0:52 Почему CLI отвечает только на ваши вопросы 1:42 Сбой: 10 000 сообщений, ноль ошибок 2:15 Три термина: поток, потребитель, ограничение на хранение 3:39 Настройка: один сервер, один поток, две закладки 4:58 Остановка ANALYTICS с кодом выхода 0 5:39 Публикация 12 000 сообщений, наблюдение за ограничением 6:48 Демонстрация CLI: информация о потоке, отчет о потоке, отчет о потребителе 9:21 Prometheus и Grafana на одном и том же сбое 11:50 Пользовательская панель мониторинга, которая действительно это показывает 14:43 Архитектура Insights: один бинарный файл, пять этапов 17:14 Insights отслеживает сбой в режиме реального времени 20:35 Сравнение трех инструментов и реальные обращения клиентов -- Ресурсы -- Документация NATS: https://docs.nats.io NATS GitHub: https://github.com/nats-io Synadia: https://www.synadia.com Insights: https://www.synadia.com/insights #NATS #JetStream #Observability #DistributedSystems #Prometheus #CloudNative