
fstpk
13.12.2016
11:23:18
или что у него там в потрохах

yopp
13.12.2016
12:49:18
жава, да.
у меня такой вопрос: можно ли в графане положить колонками несколько отчётов рядом?
Есть у меня например набор из 12 графиков, по графику на строку. Хочу сделать 3 колонки, но поменять там значения переменных

Google

fstpk
13.12.2016
12:51:50
span + height?

yopp
13.12.2016
12:52:20
Не, я не хочу делать руками копии графиков
Я хочу вставить в колонку целиком отчёт

Дмитрий
13.12.2016
12:59:16
Можно скопировать JSON графика и вставить в новый

yopp
13.12.2016
12:59:47
:(
И потом менять каждый раз?

Дмитрий
13.12.2016
13:15:07
Можно самому заполнять grafana.db, если надо автоматизировано собирать дашборды.

Антон
13.12.2016
13:33:44
не знаете как удалить лишние time series по instance или group через https://prometheus.io/docs/querying/api/ , как я понимаю можно удалить все только по job ?
а во нашел как удалять лишние time series в prometheus через API , может кому понадобиться
curl -XDELETE -g 'http://localhost:9090/api/v1/series?match[]={job="node",group="testing"}'

Виталий
14.12.2016
07:26:49
наконец-то разобрался как в новом телеграфе собрать cisco-cbqos. по сравнению со старым стало немного сложнее, но логичнее. и да, в influxdb

Nick
14.12.2016
09:10:59
народ как правильно называется и с помощью чего сделать логирвоание времени появления события в различных частях системы? Например приходит сообщение, я задаю ему uuid и везде в логах при обработке пишу этот uuid, вот как мне собрать графики по отдельным этапам обработки?
интересует как собирать и внутри одного модуля, так и в другом модуле, например после передачи через очереди

Антон
14.12.2016
09:20:25
привет, кто нибудь настраивал tls_config для prometheus?

Google

Kateryna
14.12.2016
09:33:33
я настраивала, просто указывала cert_file и key_file
и insecure_skip_verify

Антон
14.12.2016
09:34:01
ок, я тоже так сделал, но не работает

Kateryna
14.12.2016
09:34:38
У меня работает)

Антон
14.12.2016
09:34:47
tls_config идет для job_name , у меня например в job_name несколько targets , получается сертификаты эти настроиваются отдельно на каждый endpoint?
или это должны быть сертификаты, которые например в нгинкc указаны для сервера prometheus?

Kateryna
14.12.2016
09:38:15
Насчет нескольких target не проверяла, у меня в каждой job один target только

Антон
14.12.2016
09:39:49
да, но я так понимаю что сертификаты то должны указываться для endpoint те на те хосты которые в targets прописаны, если сертификаты разные то тогда они наверно должны разделется по job_name и должен быть 1 target
у меня prometheus в targets пишет следущее:
Get https://yourhostname:443/metrics: x509: certificate signed by unknown authority
при этом insecure_skip_verify: true
локальный node_exporter пишет
Get https://localhost:9090/metrics: http: server gave HTTP response to HTTPS client

Kateryna
14.12.2016
09:43:35
у менч также insecure_skip_verify: true, и еще вот scheme: https

Антон
14.12.2016
09:49:09
а nginx используется?

Kateryna
14.12.2016
09:54:54
нет

Антон
14.12.2016
09:55:28
во у меня заработало )

Maxim
14.12.2016
12:09:55
https://localhost? но зачем?

Антон
14.12.2016
12:28:03
а для чего нужно :
labels:
group: 'example'
в prometheus?

Виталий
15.12.2016
05:17:18
со всем недостатками нового snmp плагина для телеграфа я очень доволен в итоге. получилось лучше, проще, быстрее чем все мои предыдущие попытки мониторить cbqos. ниже картинка мониторинга класса video на циске. класс висит в нескольких политиках на нескольких интерфейсах. по политикам группировка.

yopp
15.12.2016
10:37:48
Метриканы, а какой подход считается рассово верным когда у меня есть очень много источников метрик? (сервера/коллекции в монге/ и всё такое). Что прометей, что графана не очень хорошо переживают когда ты пытаешься сразу всё на одном дешборде показать (10 графиков в итоге показывают около 500 метрик).
Я тут сейчас сам с собой поговорю, корочи.

Google

yopp
15.12.2016
10:39:25
Начать наверное надо с вопроса нахуя оно всё надо, да?
Логично что график должен показать условно насколько всё хорошо (лучше, как обычно, хуже).
И как следствие дать быстро понять кто именно стал причиной того что «хорошесть» метрики изменилась.

Sergey
15.12.2016
10:41:31
В целом согласен
Но и даши тогда надо делать такими, чтобы регистрировались именно отклонения

yopp
15.12.2016
10:42:24
Да-да.

Sergey
15.12.2016
10:42:55
Эдакий визуальный алертинг

yopp
15.12.2016
10:43:35
Вот теперь на примере. У меня есть 12 серваков, на них шуршит субд. Мне важно знать что? Сколько есть памяти, какое давление на память, какое давление на цпу, сколько места на хранилище, сколько гоняют данных в сторадж в байтах, сколько в иопсах.
Что с сетью
Но теперь смешное: на каждый из серверов у меня на каждую метрику уже будет алерт
Тоесть если кто-то конркретно насрал, я об этом узнаю с именем и мне не надо смотреть на графики.
Зачем мне тогда смотреть на графики?

Sergey
15.12.2016
10:44:41
А это не смешно. Просто агент может быть совмещенным
И графики лишь дополняют алерты

yopp
15.12.2016
10:45:17
А вот зачем: пришел алерт что в субд что-то не так. Например просел qps
И больше ничего.
И тут начинается игра: почему тормозит субд.

Антон
15.12.2016
10:45:57
игра ))

yopp
15.12.2016
10:46:07
Ну а чо. Детективный роман. Найди пидора

Антон
15.12.2016
10:46:21
это помойму уже другой вопрос почему тормозит субд

Google

yopp
15.12.2016
10:46:31
На этот вопрос мне графики и должны помочь найти ответ.
Иначе нахуя они нужны?
Например если мы мониторим queries per second, то тут есть несколько векторов развития событий:
1) Выросла нагрузка, мы упёрлись в ресурсы, всё встало раком
2) Нагрузка упала сама по себе

Sergey
15.12.2016
10:48:07
Именно. Графики фактически помогут понять, какой из влертов не сработал

yopp
15.12.2016
10:48:09
Первое что всегда надо исключать это 2). Потому что это могли катануть кривой релиз
Начались проблемы в приложении, как следствие нагрузка на субд упала, потому что приложение лежит.
Или не лежит ;)

Sergey
15.12.2016
10:49:35
Тут, наверное, должен быть алерт по нулевой нагрузке?

Admin
ERROR: S client not available

Антон
15.12.2016
10:51:34

yopp
15.12.2016
10:52:04

Sergey
15.12.2016
10:52:09
Этр уже из девопсовских практик

yopp
15.12.2016
10:52:14
Потом тесты тоже люди пишут, это всё хуйня.
Быват что катают новую фичу, а там кнопку подвинули и пользователи её не видят теперь. И всё.

Антон
15.12.2016
10:52:35

yopp
15.12.2016
10:52:51
Это чёрный ящик. Зачем мне его колупать отвёрткой?

Sergey
15.12.2016
10:53:09
Prod-like staging хорошее подспорье

Антон
15.12.2016
10:53:54
ну да я имел ввиду тесты проходят где нить на стейдже , если есть косяки то в прод ничего не идет и разработчик или кто там изменения делал это увидит

Sergey
15.12.2016
10:54:28
И по аналогии с черным ящиком скорее напрашивается запихивание в него всякой дряни

Google

yopp
15.12.2016
10:54:37
Вы это, чот наивные очень
Когда всё хорошо работает, никому мониторинг не нужен.
Мониторинг нужен когда всё пошло по пизде, чтоб быстро найти что именно пошло по пизде. Закон мёрфи же.
Всё делают люди, у вас могут быть какие угодно процедуры, но с вероятностью 100% у вас что-то пойдёт по пизде

Sergey
15.12.2016
10:55:44
А алертинг для чего тогда?

yopp
15.12.2016
10:55:53
Алертинг тебе скажет: пошло по пизде

Sergey
15.12.2016
10:56:19
Он же должен сказать, что именно. Иначе ему грош цена

yopp
15.12.2016
10:56:19
А почему пошло-то?
Окей, трафик пошел по пизде.
Как тебе алертинг причину скажет?
Никак не скажет.
По крайней мере сейчас. Через года полтора ML будет точно говорить почему.
Простой пример с dyn. У тебя просто нет больше днс :)

Антон
15.12.2016
10:58:07
что то не понимаю я связи алертинга с тем что ты хочешь

yopp
15.12.2016
10:58:19
Я не алертинг хочу, я хочу понять что надо на графиках рисовать

Sergey
15.12.2016
10:58:29
Хмык. Очень абстрактно, на мой вкус. Алертинг следит за входами и выходами каждого компонента.

Антон
15.12.2016
10:58:30
возьми готовые дашборды

Vladimir
15.12.2016
10:58:32

yopp
15.12.2016
10:58:36
Алертинг это другая история совсем, с ним @tnt4brain почему-то лезет

Sergey
15.12.2016
10:59:09
Ибо ты его задачи натягиваешь на мониторинг

yopp
15.12.2016
10:59:18