@metrics_ru

Страница 62 из 681
Dmitry
17.11.2016
08:15:58
упаришься без discovery

Виталий
17.11.2016
08:16:56
с чего-то надо начинать. до этого телеграф вообще нельзя было использовать.

Виталий
17.11.2016
08:17:55
и еще такой момент, что конфигов можно несколько нагенерить.

Google
Виталий
17.11.2016
08:18:18
:/etc/telegraf/telegraf.d# ls cisco3850.conf switch1.conf

Михаил
17.11.2016
08:18:32
Semyon
17.11.2016
08:19:07
Но зачем?
окей, если не будет говорить, тогда что?

есть простой вариант?

Михаил
17.11.2016
08:23:08
окей, если не будет говорить, тогда что?
Да пусть просто звонит. Пиздецовых алертов то 1-2

Semyon
17.11.2016
08:23:28
я думал может у тебя какие предложения есть :)

в смысле конкретный тул посоветуешь

Vladimir
17.11.2016
09:59:37
накидайте подводных граблей
Оператор может лежать, давать задержку сообщений и ваще если все упало и тебе нужно отправить 1000 смс - можно попасть на деньги

Да, еще если это гейт хттп, то может лежать сеть в дц или еще что и он быть недоступен

Semyon
17.11.2016
10:00:19
я ж описывал задачку, звонков мало, смс тоже :)

Vladimir
17.11.2016
10:02:49
я ж описывал задачку, звонков мало, смс тоже :)
А... Ну подводные грабли я про смс могу сказать. Про говорение вот не знаю. По-моему ту проще написать приложение под андроид в которое впихнуть ттс

И чтобы оно говорило, а не звонки были

Впрочем со звонками - VoIP, text to speech и тоже будет работать как то. Но как - надо реализовывать и смотреть. Опять же минус в том что телефония может сдохнуть

Google
yopp
17.11.2016
14:47:30
поцоны

вобщем пишу свой экспортер для прометея. Экспортер один, но он собирает метрики с кучи серверов. Как поступить с instance?

Я сейчас адрес ноды с которой экспортер собирает метрики положил в лейбл node

Я вижу два варианта: 1) оставить в node и дать всем желающим сделать relable в instance 2) сразу писать в instance

В доке они пишут что Each exporter should monitor exactly one instance application

Serge
17.11.2016
15:36:00
instance - это про экспортер, имхо

а вдруг я решу поставить его два, на всякий случай и иметь два инстанса экспортера, каждый про все ноды?

для redundancy

Maxim
17.11.2016
15:52:52
Так родной push_gateway делает, например

Maxim
17.11.2016
16:37:51
хай народ!

подскажите с реализацией, как лучше сделать

есть приложение, которое выполняет таски. надо отмониторить количество их по времени

думал в прометей слать просто статус, что задачка выполнена, типа task:1

только не знаю, может ли прометей агрегировать сумму как-нибудь

Алексей
17.11.2016
16:41:02
Увеличивайте счетчик успешно выполненных

Чтобы не случилось увеличивайте счетчик

Maxim
17.11.2016
16:42:49
хм. а каким образом мне это потом показать? rate юзать?

Maxim
17.11.2016
16:43:50
Что показать?

Maxim
17.11.2016
16:44:22
графики. типа вечером вот сколько задач выполнилось

Google
Maxim
17.11.2016
16:44:25
утром столько

Maxim
17.11.2016
16:45:49
Количество задач в единицу времени - rate() или irate() Количество задач с трех до пяти - changes()

Maxim
17.11.2016
16:47:47
понял, спасибо!

попробую

Количество задач в единицу времени - rate() или irate() Количество задач с трех до пяти - changes()
а подскажи еще, как этот changes() юзать, не пойму чет вот этого changes(v range-vector)

Maxim
17.11.2016
17:26:19
changes(metric[2h])

Maxim
17.11.2016
17:29:55
?

Alexey
17.11.2016
17:38:50
Котаны, а кто чем делает алерты по телефону?
У нас специально обученные люди были:)

Зато они и чинить могли сами, если что. Или по протоколу ssh-over-cellphone

Алексей
17.11.2016
17:40:21
специально обученые люди — добро. отлично скриптуются.

понимают намеки и могут позвонить другому если чувствуют что ты в дрова

Maxim
17.11.2016
18:07:23
а есть какая-нибудь функция, которая бы в ноль обрубала график если не было изменений, но при этом не пересчитывала значения?

Maxim
17.11.2016
18:08:43
всмысле?

Maxim
17.11.2016
18:11:07
ну вот есть, например, метрика времени ответа сервиса, обновляется на каждый запрос

когда запросы прекращаются, то график застывает на последнем значении

и рисует прямую

Kirill
17.11.2016
18:12:14
в чём хранится?

Maxim
17.11.2016
18:12:46
rate(service_response_time[1m]) будет рисовать прямую на нуле, если за минуту ничего не случилось

Maxim
17.11.2016
18:12:51
прометей, Gauge

Maxim
17.11.2016
18:13:05
и пересчитывать там будет нечего тоже

Google
Kirill
17.11.2016
18:14:40
а почему gauge?

Maxim
17.11.2016
18:14:53
потому что респонс_тайм

как ты туда каунтер приделаешь?

Maxim
17.11.2016
18:16:34
Kirill
17.11.2016
18:16:36
а, в проме каунтеры неубывают..

Admin
ERROR: S client not available

Maxim
17.11.2016
18:16:52
было 1.38, стало 0.00205

Maxim
17.11.2016
18:17:53
ну показывай только два знака после запятой

Maxim
17.11.2016
18:19:19
да не, на графике отображается 0.00205, хотя ответ был за 1.38

а если два знака только показывать, то вообще нули

Maxim
18.11.2016
09:31:51
https://pracucci.com/prometheus-understanding-the-delays-on-alerting.html

Виталий
18.11.2016
10:06:03
случайно получилась инвентаризация цисок новым snmp плагином телеграфа [[inputs.snmp]] interval = "1h" agents = [ "A", "B", ..] version = 2 community = "public" [[inputs.snmp.field]] name = "hostname" oid = "RFC1213-MIB::sysName.0" is_tag = true [[inputs.snmp.table]] name = "inventory" inherit_tags = [ "hostname" ] oid = "ENTITY-MIB::entPhysicalTable" [[inputs.snmp.table.field]] name = "entPhysicalSerialNum" oid = "ENTITY-MIB::entPhysicalSerialNum" is_tag = true

Maxim
18.11.2016
10:12:20
в общем, не нашел я ничего подходящего в доках. а можно как-то прометей клиенту (самописный экспортер) сказать чтобы он следил за данными и обнулял по условию?

Maxim
18.11.2016
10:14:06
экспортер ничего на сервере обнулить не может

он же даже не знает, что где-то там есть какой-то сервер

Maxim
18.11.2016
10:15:49
это понятно, но вот когда ты через клиента задаешь какое-то значение, то у тебя оно не меняется до того времени, пока ты новое значение туда не запишешь

что-то типа ttl можно выставить? типа VAR.labels(lab).set(value).ttl(2s)

Maxim
18.11.2016
10:19:38
нет

Maxim
18.11.2016
10:20:14
жаль. а как такую ситуацию правильнее разрулить?

Google
Maxim
18.11.2016
10:44:41
чот я затрудняюсь ответить

а в чем вообще цель?

ну, зачем такое поведение?

Maxim
18.11.2016
10:48:33
хочется видеть реальное время ответа определенных апишек. только вот службы, которые дергают их, не всегда выполняются, а с какой-то периодичностью

соответственно когда службы не выполняются, то по идее в метрике должен быть 0

а не предыдущее значение

либо я не правильно прометей юзаю

Maxim
18.11.2016
10:50:43
ну так если там последнюю минуту был ноль, то и rate(...[1m]) вернет ноль, нет?

Maxim
18.11.2016
10:52:45
вернет, только он значения в графике пересчитывает

по своей формуле

Maxim
18.11.2016
10:52:52
или ты хочешь получить среднее значение за, например, час, по всем ненулевым значениям?

Maxim
18.11.2016
10:53:40
нет, в данном случае хочется абсолютные значения

неудобство, в общем

получается это надо в либо в экспортере реализовывать обнулятор, либо в сервисе отправлять нули, если нет запросов

Maxim
18.11.2016
10:57:49
можно попробовать сделать rule, в котором объявить еще одну метрику, в которую писать только ненулевые значения из этой

https://prometheus.io/docs/querying/rules/

Maxim
18.11.2016
10:59:25
да не ) экспортер же запоминает у себя последнее значение, и там будет какой-то response time

Страница 62 из 681