
Александр
16.12.2016
10:15:30

ptchol
16.12.2016
10:16:14
можно и так
но это будет гемор потому что нада будет маппить process name \ pid

Александр
16.12.2016
10:16:55
Нее, это не вариант, слишком много процессов пишет/читает.. ебанешься

Google

ptchol
16.12.2016
10:16:57
а systemd тебе сигруппу автоматом запиливает с именем сервиса
ну top сделать просто не получится
всё равно придётся всё собирать как бы
либо тупо написать скрипт который будет запускать iotop и top10 статы собират ьи кидать

Александр
16.12.2016
10:18:38
Пробовать всё равно придётся. Спасибо, буду думать.

Anton
16.12.2016
10:20:12

Александр
16.12.2016
10:20:37
А какие ещё помимо collectd есть сборщики?

ptchol
16.12.2016
10:21:20
diamond

Александр
16.12.2016
10:21:46
cacti из той же оперы?

fstpk
16.12.2016
10:22:04
fluentd, елкшные *beat

Александр
16.12.2016
10:22:31
Ага, спасибо, пойду их тоже гляну, может есть из коробки чего

Anton
16.12.2016
10:23:14
а ещё там axes Right Y перестал вообще что показывать :(

Vsevolod
16.12.2016
11:10:06
запилил пост о том что такое метрики https://ctrlok.com/post/Сбор%20и%20агрегирование%20метрик-%20statsd/

Google

Andrey
16.12.2016
11:16:11
если я правильно понял обсуждение
https://github.com/aplsms/atop-graph
ещё есть экспортер в prometheus

Виталий
16.12.2016
12:42:25
Средствами nprobe с win серверов трафик кто-нибудь собирает/анализирует?

Maxim
16.12.2016
12:43:09

Виталий
16.12.2016
12:44:45
Смысл в том, чтобы описать взаимодействие виртуалок к примеру. До свича со span'ом может не дойти.
Или так https://www.plixer.com/blog/network-traffic-analysis/how-to-enable-netflow-on-a-vmware-esx/

Roman
16.12.2016
15:07:00
Здравствуйте

Denis 災 nobody
16.12.2016
15:30:57
с iotop
В системд видел sar, посмотри его

Roman
16.12.2016
15:41:00
Причем тут systemd?

Алексей
16.12.2016
18:30:23
http://grafana.org/blog/2016/12/12/grafana-4.0-stable-release/
ну вот тепереь таки да

Maxim
16.12.2016
18:30:46
резкие ребята

Serge
16.12.2016
19:37:56

Vladimir
16.12.2016
21:04:20
в принципе его довольно просто переконвертить в любой другой json

Виталий
17.12.2016
06:50:59
С span и minspan в графане 4.0.2 а акая-то беда. Нажимаю dublicate и все графики ужимаются в строку, а выставленные значения сбрасываются

Maxim
19.12.2016
07:46:31
всем привет
а расскажите плиз, как правильно настроить алертинг в прометее

Google

Maxim
19.12.2016
07:47:31
чтобы вот когда срабатывал firing, то оповещение сразу было, а не через какое-то время
ну и когда resolve случался, то тоже сразу

Denis 災 nobody
20.12.2016
13:50:53
Уязвимость в системе мониторинга Nagios позволяет осуществлять повышение привилегий
https://goo.gl/9cwlMr

Виталий
21.12.2016
08:17:17
осилил continuous queries в инфлюксе. вообще тема.
репорты по ошибкам всяким за сутки.
без cq всё умирает.

Алексей
21.12.2016
08:22:34
выполнение cq сильно нагружает influx ?

Виталий
21.12.2016
08:24:06
чем мерить?
по cpu и памяти не вижу разницы

Алексей
21.12.2016
08:24:54
нет, давай не так. много железяк ?

Александр
21.12.2016
08:25:14
А больше нет ни каких параметров ? ?

Алексей
21.12.2016
08:25:29
график по потреблению iops, cpu, mem есть ?


Виталий
21.12.2016
08:29:54
diskio тут какой параметр показать?
70 железок 6.6к портов. опрашиваются 32бит iftable и dot3stat раз в час , 64бит iftable раз в 5 минут. короче все ошибки раз в час, а таблицы в итоге за сутки.
CREATE CONTINUOUS QUERY "cq_dot3StatsFCSErrors" ON "telegraf" RESAMPLE EVERY 1h FOR 1d BEGIN SELECT non_negative_derivative(last("dot3StatsFCSErrors"), 1d) INTO "report_dot3StatsFCSErrors" FROM dot3Stats GROUP BY time(1d), "ifDescr", "agent_host" END
SELECT last("non_negative_derivative") FROM /^$report_errors$/ WHERE "non_negative_derivative" > 0 AND $timeFilter GROUP BY time($interval), "agent_host", "ifDescr" fill(null)
сама таблица
если бы так без cq делал, то influx помер бы сразу
памяти 2 гига в виртуалке.
да и не сделать так без cq. там выводились вообще все значения в т.ч. нулевые, которые не нужны.
https://docs.influxdata.com/influxdb/v1.1/query_language/continuous_queries/ Substituting for a HAVING Clause

Google

Виталий
21.12.2016
08:46:36
любят они пчел в пример приводить.. ;)
какое-же все-таки барахло c3750X. буферы ниочем, куча дропов.

Maxim
21.12.2016
09:46:03
есть правило
ALERT service_down
IF up == 0
FOR 10s
LABELS { severity = "critical" }
ANNOTATIONS {
summary = "Monitor service {{$labels.instance}} non-operational",
description = "Service {{$labels.instance}} is down.",
}
все нормально работает, но иногда прилетают странные сообщения такого вида [FIRING:4] service_down (critical) [RESOLVED] service_down (critical) , кто-нибудь знает что это может быть?

Алексей
21.12.2016
20:41:57
http://grafana.org/blog/2016/12/21/grafana-4.1-beta-release/
внезапность

Admin
ERROR: S client not available

Andrey
21.12.2016
20:43:14
Только 4.0.2 поставил!

Vladimir
21.12.2016
21:17:50
Круто. У нас народ как раз ждет поддержку эластика пятого

Andrey
21.12.2016
21:27:43
ну вот в бете

Виталий
22.12.2016
07:12:51
забавное про cq. выполняются они последовательно и т.о. не грузят цпу. но как-то получилось, что в measurement писать они перестали, а данные все стали только в telegraf.<rp_name>.<measurement_name> быть доступны. удаление measurement_name удаляет и в т.ч. telegraf.<rp>.<measurement_name>
еще небольшая проблема с графаной похоже при запросе в cq
сама cq делает вот такой запрос WHERE time >= '2016-12-22T00:00:00Z' AND time < '2016-12-23T00:00:00Z' и в таблицу пишет время 1482364800000000000 date —date @1482364800
Чт дек 22 07:00:00 +07 2016
т.е. нормально. а вот графана..
> select sum("non_negative_derivative") from a_week.report_dot3StatsMultipleCollisionFrames where agent_host = 'cs-twr-5-13-3750'
name: report_dot3StatsMultipleCollisionFrames
time sum
---- ---
0 28
сообразил. с группировкой по времени не надо, поэтому так придется обходится.


Антон
23.12.2016
07:36:24
привет, а alertmanager стоит ставить отдельно от prometheus или можно вместе, мониторить хостов 50-100 ?

Vladimir
23.12.2016
08:56:21
https://github.com/facebookincubator/beringei

Semyon
23.12.2016
08:56:32
шо, опять?

Vladimir
23.12.2016
08:58:27
шо, опять?
почему опять? Выложили имплементацию гориллы
свою

Semyon
23.12.2016
09:00:27
Я к тому, что за полследние пол года какое-то нереальное количество ts(db?) релизится
я уже сбиваться начал

Google

Dmitry
23.12.2016
09:01:26
in-memory - жестко как-то

Алексей
23.12.2016
09:02:32
на конференции прометея они создатель движка прома сравнивал свой движок как раз с горилой

Vladimir
23.12.2016
09:06:04
и то что выложили это тоже не горилла, а скорее референсная имплементация

Антон
23.12.2016
09:21:25
почему тут http://demo.robustperception.io:9090/flags alertmanager.url определяется как http://localhost:9093, у меня при запущенном alertmanager ничего не видит и обратиться я к нему не могу по http://localhost:9093 говорит нет там ничего, в логах все ок , как к этому alertmanager обратиться?

Maxim
23.12.2016
09:23:25
потому что в конфиге так прописали
http://demo.robustperception.io:9093/#/alerts

Vladimir
23.12.2016
09:23:48

Антон
23.12.2016
09:31:19
level=info msg="Listening on :9093" source="main.go:250"

Maxim
23.12.2016
09:37:39
./prometheus -config.file=prometheus.yml -alertmanager.url http://localhost:9093

Антон
23.12.2016
09:50:31

emik0
23.12.2016
09:53:19
Привет! Кто-нибудь заморачивался по-серьезке logparser.grok с telegraf?

Антон
23.12.2016
09:54:27

Magistr
23.12.2016
09:55:25
ресолвер добавь

Антон
23.12.2016
10:02:38
405