Мониторинг и поддержка

Состояние системы в реальном времени

Живая сводка по инцидентам, узлам и нагрузке. Всё, что нужно команде поддержки, — на одном экране: от первого предупреждения до полного восстановления.

Обновление каждые 30 сек Алерты в Telegram и Slack Webhook по каждому инциденту
Панель мониторинга SnapApi: карта узлов, задержка и счётчик активных запросов
38 мс средняя задержка API

Панель текущих инцидентов

Что происходит прямо сейчас

Активные и недавно закрытые инциденты по всем сервисам. Статус обновляется автоматически и дублируется в ленте уведомлений.

Восстановлено · REST API

Деградация задержки на узле eu-west-2. Средняя задержка выросла с 38 до 112 мс с 14:02 до 14:19. Трафик перенаправлен на eu-west-1, сервис полностью восстановлен в 14:21 UTC.

Идёт работа · Webhooks

Ределивери на очередь webhooks-eu. Часть отправлений дублируется из-за повторных попыток. Команда обновляет лимиты очередей — ожидается стабилизация к 16:00 UTC.

Запланировано · База данных

Плановое обновление кластера Postgres на us-east-1. Окно: 22:00–23:00 UTC, 18 июня. Кратковременные паузы подключений до 5 секунд; чтение будет доступно.

Состояние серверов

Узлы и их загрузка

Семь узлов в четырёх регионах. Все критические сервисы работают, один узел переведён в режим обслуживания.

eu-west-1 · Амстердам

Работает. Загрузка 62%, задержка 34 мс. Основной регион для Европы, принимает 48% всего трафика.

eu-west-2 · Франкфурт

Восстановлен. Загрузка 41%, задержка 37 мс. Возвращён в баланс после инцидента от 14:21 UTC, деградация не повторяется.

us-east-1 · Ашбурн

Работает. Загрузка 55%, задержка 41 мс. Клантер Postgres готовится к плановому обновлению 18 июня.

ap-south-1 · Мумбаи

Работает. Загрузка 28%, задержка 46 мс. Резервный узел для Азии, подключается при превышении 70% на основном.

sa-east-1 · Сан-Паулу

Обслуживание. Загрузка 0%, задержка —. Узел выведен из ротации для замены дисковой подсистемы до 19 июня.

Сеть и CDN

Работает. Задержка маршрутизации 9 мс, кэш-хиты 94%. Все 214 точек присутствия отвечают в пределах норматива.

Статистика запросов

Нагрузка за последние 24 часа

4,2 млнзапросов API за сутки
38 мсмедианная задержка (p50)
0,14%доля ответов 5xx
99,98%доступность за 30 дней

История инцидентов

Что происходило за последние 30 дней

Полный журнал инцидентов с хронологией, причиной и временем восстановления. Каждый закрытый инцидент сопровождается публичным разбором.

12 июня · Деградация задержки REST API

Узел eu-west-2: задержка выросла до 112 мс. Причина — повышенная нагрузка и устаревшая прошивка сетевого коммутатора. Восстановлено за 19 минут, прошивка обновлена на всех узлах.

4 июня · Простой очереди Webhooks

Webhooks-eu: потеря 3 200 отправлений на 6 минут. Причина — исчерпание лимитов очереди после всплеска от клиентов. Введён автоскейлинг очередей и предупреждение при 80% заполнения.

28 мая · Плановое обновление CDN

CDN: кратковременное снижение кэш-хитов до 81% на 12 минут. Плановая замена правил кэширования. Восстановлено в рамках окна, без влияния на доступность API.

Получать уведомления

Пусть система сообщает о себе первой

Подключите алерты по каждому инциденту — и команда поддержки узнаёт о деградации раньше, чем клиенты.

Настраиваете каналы за пару кликов: Telegram, Slack, email или собственный webhook. Для каждого типа инцидента задаёте порог и список получателей — от дежурного разработчика до всего отдела.

Кроме алертов, мы шлём еженедельный дайджест доступности и углеродный отчёт по вашим проектам, чтобы вы видели и скорость, и экологический след в одном письме.

Получите доступ к статусу вашего проекта

Создайте аккаунт и откройте персональную страницу состояния: узлы, задержка, инциденты и алерты — всё по вашему API.

Вопросы

Частые вопросы о мониторинге

Не нашли ответ — напишите в поддержку, отвечаем в течение рабочего дня.

Метрики и статус узлов обновляются каждые 30 секунд. Инциденты и их статусы — мгновенно, как только дежурный подтверждает изменение. API статуса отдаёт данные без кэша.
Да. Поддерживаются Telegram, Slack, email и произвольный webhook. Для каждого типа инцидента можно задать порог, список получателей и формат сообщения — включая JSON с метриками.
Инцидент — это непредвиденное снижение доступности или деградация задержки за норматив. Плановые работы (обновления, замена оборудования) заранее анонсируются в календаре и не считаются инцидентами.
В течение 48 часов после восстановления публикуем разбор: хронология, корневая причина и меры, чтобы инцидент не повторился. Разборы доступны на этой странице и в личном кабинете.