
Maxim
18.11.2016
11:01:36
вот такая хрень выходит
прямая линия - это экспортер отдает последнее значение, которое служба обновит через свой интервал
в этом вся и загвоздка, как сказать экспортеру не отдавать последнее значение, если оно не менялось, например, пару секунд

Vladimir
18.11.2016
11:04:30
Мне так помнится, что идеологически там counter

Google

Vladimir
18.11.2016
11:04:40
И совет авторов делать всегда counter
Даже для response time
И на этапе построения графиков уже делать rate

Maxim
18.11.2016
11:06:27
типа того? c.inc(1.6) , c.inc(0.111)

Vladimir
18.11.2016
11:08:16
Если что я Прометей не юзал, но общался с одним из разработчиков
Как раз по этому поводу

Maxim
18.11.2016
11:08:49
хотя rate не даст точных значений же ( будет пересчитано все к интервалу [1m]
который ты укажешь
инструмент, похоже, не тот просто выбрал, надо что-то еще посмотреть

Vladimir
18.11.2016
11:12:57
Если тебе нужно событийное что то - вероятно придется самому писать

Maxim
18.11.2016
11:17:27

Google

Vladimir
18.11.2016
11:17:47
А по секундам. Не?

Maxim
18.11.2016
11:18:25
не, там рейту секунду не поставить

Vladimir
18.11.2016
11:19:15

Maxim
18.11.2016
11:20:07

Vladimir
18.11.2016
11:20:26
Я уверен что то что ты хочешь - делается

Maxim
18.11.2016
11:21:04

Viktor
19.11.2016
09:45:55
Уважаемые доны
подскажите куда копать в сторону аналитики мониторинга?
поиск флуктуаций, корреляций и т.д.
может есть что-то что можно подключить к ELK или что-то независимое
кто-то занимался таким?

Старый
19.11.2016
09:46:40
Уважаемые доны
боюсь я сейчас этим частично занят, точнее схему этого делаю

Serge
19.11.2016
09:54:37
А вообще, мат статистика и вперед
Можно рассмотреть язык R, как инструмент. Хотя, Python и numpy, scipy тоже ок

Старый
19.11.2016
09:58:51
icinga+ elasticsearch+ Kibana+graphite+grafana+ Fluentd+system nspawn+PostgreSQL
как такая связка под мониторинг?
что она упустит

Google

Serge
19.11.2016
09:59:14
В такой формулировке, упустит всё
Инструмент неважен, пока не сформулирована задача

Старый
19.11.2016
10:00:05
Что мы имеем, 4 дата центра, предположим 2 дц имеет 400 железных серверов и 60 свитчей по 36 портов для линейной схемы подключения 350 серверов там сделаны под приложения, ещё 50 под хранения информации, управление vm, сетью и частично сторенджами, в нашем случае с glusterfs происходит через openstack, ещё 2 дц 40 серверов и 6 свитчей, 35 под приложения и 5 под данные. Между дц сделано 3 канала связи, с разными провайдерами.
основной софт

Serge
19.11.2016
10:00:34
Что мы имеем, 4 дата центра, предположим 2 дц имеет 400 железных серверов и 60 свитчей по 36 портов для линейной схемы подключения 350 серверов там сделаны под приложения, ещё 50 под хранения информации, управление vm, сетью и частично сторенджами, в нашем случае с glusterfs происходит через openstack, ещё 2 дц 40 серверов и 6 свитчей, 35 под приложения и 5 под данные. Между дц сделано 3 канала связи, с разными провайдерами.
Я не хочу решать за кого-то его задачи, честно говоря

Старый
19.11.2016
10:05:07
тут основная проблема кол-во вещей, у которых можно брать статистику, логи и делать из этого графики

Serge
19.11.2016
10:05:31

Kirill
19.11.2016
10:06:08

Старый
19.11.2016
10:06:10
ну статику тоже, например у новы кол-во инсталяйций

Kirill
19.11.2016
10:06:35

Serge
19.11.2016
10:06:39

Старый
19.11.2016
10:07:51

Serge
19.11.2016
10:08:09
Начни с малого, научись собирать метрики в одно место, например, в Prometheus. Потом, начни отображать, например, в Grafana

Старый
19.11.2016
10:08:39
я недавно делал связку icinga(nagios)+graphite+grafana

Serge
19.11.2016
10:08:42
Смотри в Prometheus:) Icinga выше транспортного уровня большого смысла не имеет
Да и то node exporter решает почти всё, что она может

Старый
19.11.2016
10:10:43
а прометеус же не умеет хранить данные в дб другой, чтобы потом графики делать за месяц, 3, 6 12 24

Google

Serge
19.11.2016
10:10:54
У неё из коробки поддержка прома, как источника данных
Прома пусть собирает, от него не надо больше ничего почти. Ну, алертинг можно ещё его использовать, но можно и другой намутить

Viktor
19.11.2016
10:12:40
Анализ не ручками

Admin
ERROR: S client not available

Viktor
19.11.2016
10:13:42
В ручном режиме не продуктивно

Старый
19.11.2016
10:58:49
☹️ блин не врубаюсь, как из 5 прометев получиться статистика для 1 веб интерфейса графана

Paul
19.11.2016
10:58:50
коллеги-метрологи - внезапный вопрос. Чем может быть спровоцирована пилообразность графика в схеме collectd -> collectd-export -> prometeus? нагрузка эталонная и равномерная (известно точно), среднее арифметическое соответствует нагрузке.

Vladimir
19.11.2016
11:06:04

Dmitry
19.11.2016
12:00:59
по-хорошему счетчики нужно нормировать на разброс времени

Serge
19.11.2016
12:40:31

Старый
19.11.2016
12:41:21
чтобы если по каким либо причинам 1-2 умерли. другие продолжали давать данные
вот честно, пока балансировщик на логи и мониторинги делать не приходилось никогда

Serge
19.11.2016
12:43:27
А вот оттуда уже да, haproxy на них и всё

Vladimir
19.11.2016
12:45:09

Google

Старый
19.11.2016
12:45:21
? 20 тб логов, в больших 2 дц и 2 тб логов в мелких, и ещё по реплике

Serge
19.11.2016
12:45:48

Vladimir
19.11.2016
12:46:06

Serge
19.11.2016
12:46:31

Старый
19.11.2016
12:46:43
160 тб логов при репликах, это ебануться

Vladimir
19.11.2016
12:47:53

Serge
19.11.2016
12:49:15

Старый
19.11.2016
12:49:33
вы мне лучше скажите, 160 тб логов, это это 27 дисков по 6 тб, и это только минимальное кол-во их
особенно всопминая сколько срёт nginx php

Serge
19.11.2016
12:49:55

Старый
19.11.2016
12:50:31

Serge
19.11.2016
12:50:44

Старый
19.11.2016
12:50:50
и то и то

Serge
19.11.2016
12:50:56
Ок
Не собирай логи

Старый
19.11.2016
12:51:08
логи нужны для разбора ошибок