
Dmitry
17.11.2016
08:15:58
упаришься без discovery

Виталий
17.11.2016
08:16:56
с чего-то надо начинать. до этого телеграф вообще нельзя было использовать.

Semyon
17.11.2016
08:17:26

Виталий
17.11.2016
08:17:55
и еще такой момент, что конфигов можно несколько нагенерить.

Google

Виталий
17.11.2016
08:18:18
:/etc/telegraf/telegraf.d# ls
cisco3850.conf switch1.conf

Михаил
17.11.2016
08:18:32

Semyon
17.11.2016
08:19:07
Но зачем?
окей, если не будет говорить, тогда что?
есть простой вариант?

Михаил
17.11.2016
08:23:08

Semyon
17.11.2016
08:23:28
я думал может у тебя какие предложения есть :)
в смысле конкретный тул посоветуешь

Vladimir
17.11.2016
09:59:37
накидайте подводных граблей
Оператор может лежать, давать задержку сообщений и ваще если все упало и тебе нужно отправить 1000 смс - можно попасть на деньги
Да, еще если это гейт хттп, то может лежать сеть в дц или еще что и он быть недоступен

Semyon
17.11.2016
10:00:19
я ж описывал задачку, звонков мало, смс тоже :)

Vladimir
17.11.2016
10:02:49
И чтобы оно говорило, а не звонки были
Впрочем со звонками - VoIP, text to speech и тоже будет работать как то. Но как - надо реализовывать и смотреть. Опять же минус в том что телефония может сдохнуть

Google

yopp
17.11.2016
14:47:30
поцоны
вобщем пишу свой экспортер для прометея. Экспортер один, но он собирает метрики с кучи серверов. Как поступить с instance?
Я сейчас адрес ноды с которой экспортер собирает метрики положил в лейбл node
Я вижу два варианта: 1) оставить в node и дать всем желающим сделать relable в instance 2) сразу писать в instance
В доке они пишут что Each exporter should monitor exactly one instance application

Serge
17.11.2016
15:36:00
instance - это про экспортер, имхо
а вдруг я решу поставить его два, на всякий случай и иметь два инстанса экспортера, каждый про все ноды?
для redundancy

Maxim
17.11.2016
15:52:52
Так родной push_gateway делает, например

Maxim
17.11.2016
16:37:51
хай народ!
подскажите с реализацией, как лучше сделать
есть приложение, которое выполняет таски. надо отмониторить количество их по времени
думал в прометей слать просто статус, что задачка выполнена, типа task:1
только не знаю, может ли прометей агрегировать сумму как-нибудь

Алексей
17.11.2016
16:41:02
Увеличивайте счетчик успешно выполненных
Чтобы не случилось увеличивайте счетчик

Maxim
17.11.2016
16:42:49
хм. а каким образом мне это потом показать? rate юзать?

Maxim
17.11.2016
16:43:50
Что показать?

Maxim
17.11.2016
16:44:22
графики. типа вечером вот сколько задач выполнилось

Google

Maxim
17.11.2016
16:44:25
утром столько

Maxim
17.11.2016
16:45:49
Количество задач в единицу времени - rate() или irate()
Количество задач с трех до пяти - changes()

Maxim
17.11.2016
16:47:47
понял, спасибо!
попробую

Maxim
17.11.2016
17:26:19
changes(metric[2h])

Maxim
17.11.2016
17:29:55
?

Alexey
17.11.2016
17:38:50
Зато они и чинить могли сами, если что. Или по протоколу ssh-over-cellphone

Алексей
17.11.2016
17:40:21
специально обученые люди — добро. отлично скриптуются.
понимают намеки и могут позвонить другому если чувствуют что ты в дрова

Maxim
17.11.2016
18:07:23
а есть какая-нибудь функция, которая бы в ноль обрубала график если не было изменений, но при этом не пересчитывала значения?

Maxim
17.11.2016
18:08:43
всмысле?

Maxim
17.11.2016
18:11:07
ну вот есть, например, метрика времени ответа сервиса, обновляется на каждый запрос
когда запросы прекращаются, то график застывает на последнем значении
и рисует прямую

Kirill
17.11.2016
18:12:14
в чём хранится?

Maxim
17.11.2016
18:12:46
rate(service_response_time[1m]) будет рисовать прямую на нуле, если за минуту ничего не случилось

Maxim
17.11.2016
18:12:51
прометей, Gauge

Maxim
17.11.2016
18:13:05
и пересчитывать там будет нечего тоже

Google

Maxim
17.11.2016
18:13:37

Kirill
17.11.2016
18:14:40
а почему gauge?

Maxim
17.11.2016
18:14:53
потому что респонс_тайм
как ты туда каунтер приделаешь?

Maxim
17.11.2016
18:16:34

Kirill
17.11.2016
18:16:36
а, в проме каунтеры неубывают..

Admin
ERROR: S client not available

Maxim
17.11.2016
18:16:52
было 1.38, стало 0.00205

Maxim
17.11.2016
18:17:53
ну показывай только два знака после запятой

Maxim
17.11.2016
18:19:19
да не, на графике отображается 0.00205, хотя ответ был за 1.38
а если два знака только показывать, то вообще нули

Maxim
18.11.2016
09:31:51
https://pracucci.com/prometheus-understanding-the-delays-on-alerting.html

Виталий
18.11.2016
10:06:03
случайно получилась инвентаризация цисок новым snmp плагином телеграфа
[[inputs.snmp]]
interval = "1h"
agents = [ "A", "B", ..]
version = 2
community = "public"
[[inputs.snmp.field]]
name = "hostname"
oid = "RFC1213-MIB::sysName.0"
is_tag = true
[[inputs.snmp.table]]
name = "inventory"
inherit_tags = [ "hostname" ]
oid = "ENTITY-MIB::entPhysicalTable"
[[inputs.snmp.table.field]]
name = "entPhysicalSerialNum"
oid = "ENTITY-MIB::entPhysicalSerialNum"
is_tag = true

Maxim
18.11.2016
10:12:20
в общем, не нашел я ничего подходящего в доках. а можно как-то прометей клиенту (самописный экспортер) сказать чтобы он следил за данными и обнулял по условию?

Maxim
18.11.2016
10:14:06
экспортер ничего на сервере обнулить не может
он же даже не знает, что где-то там есть какой-то сервер

Maxim
18.11.2016
10:15:49
это понятно, но вот когда ты через клиента задаешь какое-то значение, то у тебя оно не меняется до того времени, пока ты новое значение туда не запишешь
что-то типа ttl можно выставить? типа VAR.labels(lab).set(value).ttl(2s)

Maxim
18.11.2016
10:19:38
нет

Maxim
18.11.2016
10:20:14
жаль. а как такую ситуацию правильнее разрулить?

Google

Maxim
18.11.2016
10:44:41
чот я затрудняюсь ответить
а в чем вообще цель?
ну, зачем такое поведение?

Maxim
18.11.2016
10:48:33
хочется видеть реальное время ответа определенных апишек. только вот службы, которые дергают их, не всегда выполняются, а с какой-то периодичностью
соответственно когда службы не выполняются, то по идее в метрике должен быть 0
а не предыдущее значение
либо я не правильно прометей юзаю

Maxim
18.11.2016
10:50:43
ну так если там последнюю минуту был ноль, то и rate(...[1m]) вернет ноль, нет?

Maxim
18.11.2016
10:52:45
вернет, только он значения в графике пересчитывает
по своей формуле

Maxim
18.11.2016
10:52:52
или ты хочешь получить среднее значение за, например, час, по всем ненулевым значениям?

Maxim
18.11.2016
10:53:40
нет, в данном случае хочется абсолютные значения
неудобство, в общем
получается это надо в либо в экспортере реализовывать обнулятор, либо в сервисе отправлять нули, если нет запросов

Maxim
18.11.2016
10:57:49
можно попробовать сделать rule, в котором объявить еще одну метрику, в которую писать только ненулевые значения из этой
https://prometheus.io/docs/querying/rules/

Maxim
18.11.2016
10:59:25
да не ) экспортер же запоминает у себя последнее значение, и там будет какой-то response time