@metrics_ru

Страница 72 из 681
ptchol
16.12.2016
10:16:14
можно и так

но это будет гемор потому что нада будет маппить process name \ pid

Александр
16.12.2016
10:16:55
Нее, это не вариант, слишком много процессов пишет/читает.. ебанешься

Google
ptchol
16.12.2016
10:16:57
а systemd тебе сигруппу автоматом запиливает с именем сервиса

ну top сделать просто не получится

всё равно придётся всё собирать как бы

либо тупо написать скрипт который будет запускать iotop и top10 статы собират ьи кидать

Александр
16.12.2016
10:18:38
Пробовать всё равно придётся. Спасибо, буду думать.

Anton
16.12.2016
10:20:12
дашборд сохраненный
поставь на не рефрешить, сохрани, ctrl +f5 и поменяй на сколько надо

Александр
16.12.2016
10:20:37
А какие ещё помимо collectd есть сборщики?

ptchol
16.12.2016
10:21:20
diamond

Александр
16.12.2016
10:21:46
cacti из той же оперы?

fstpk
16.12.2016
10:22:04
fluentd, елкшные *beat

Александр
16.12.2016
10:22:31
Ага, спасибо, пойду их тоже гляну, может есть из коробки чего

Anton
16.12.2016
10:23:14
а ещё там axes Right Y перестал вообще что показывать :(

Vsevolod
16.12.2016
11:10:06
запилил пост о том что такое метрики https://ctrlok.com/post/Сбор%20и%20агрегирование%20метрик-%20statsd/

Google
Andrey
16.12.2016
11:16:11
Дак я и пишу, что прикрутить(((
atop вроде то что ты ищешь....

если я правильно понял обсуждение

https://github.com/aplsms/atop-graph

ещё есть экспортер в prometheus

Виталий
16.12.2016
12:42:25
Средствами nprobe с win серверов трафик кто-нибудь собирает/анализирует?

Maxim
16.12.2016
12:43:09
Виталий
16.12.2016
12:44:45
Смысл в том, чтобы описать взаимодействие виртуалок к примеру. До свича со span'ом может не дойти.

Или так https://www.plixer.com/blog/network-traffic-analysis/how-to-enable-netflow-on-a-vmware-esx/

Roman
16.12.2016
15:07:00
Здравствуйте

Denis 災 nobody
16.12.2016
15:30:57
с iotop
В системд видел sar, посмотри его

Roman
16.12.2016
15:41:00
Причем тут systemd?

Алексей
16.12.2016
18:30:23
http://grafana.org/blog/2016/12/12/grafana-4.0-stable-release/

ну вот тепереь таки да

Maxim
16.12.2016
18:30:46
резкие ребята

Serge
16.12.2016
19:37:56
http://grafana.org/blog/2016/12/12/grafana-4.0-stable-release/
Крутяк. А вот не написано поддерживает ли оно алерты на CloudWatch

Vladimir
16.12.2016
21:04:20
в принципе его довольно просто переконвертить в любой другой json

Виталий
17.12.2016
06:50:59
С span и minspan в графане 4.0.2 а акая-то беда. Нажимаю dublicate и все графики ужимаются в строку, а выставленные значения сбрасываются

Maxim
19.12.2016
07:46:31
всем привет

а расскажите плиз, как правильно настроить алертинг в прометее

Google
Maxim
19.12.2016
07:47:31
чтобы вот когда срабатывал firing, то оповещение сразу было, а не через какое-то время

ну и когда resolve случался, то тоже сразу

Denis 災 nobody
20.12.2016
13:50:53
Уязвимость в системе мониторинга Nagios позволяет осуществлять повышение привилегий https://goo.gl/9cwlMr

Виталий
21.12.2016
08:17:17
осилил continuous queries в инфлюксе. вообще тема.

репорты по ошибкам всяким за сутки.

без cq всё умирает.

Алексей
21.12.2016
08:22:34
выполнение cq сильно нагружает influx ?

Виталий
21.12.2016
08:24:06
чем мерить?

по cpu и памяти не вижу разницы

Алексей
21.12.2016
08:24:54
нет, давай не так. много железяк ?

Александр
21.12.2016
08:25:14
А больше нет ни каких параметров ? ?

Алексей
21.12.2016
08:25:29
график по потреблению iops, cpu, mem есть ?

Виталий
21.12.2016
08:29:54
diskio тут какой параметр показать?

70 железок 6.6к портов. опрашиваются 32бит iftable и dot3stat раз в час , 64бит iftable раз в 5 минут. короче все ошибки раз в час, а таблицы в итоге за сутки.

CREATE CONTINUOUS QUERY "cq_dot3StatsFCSErrors" ON "telegraf" RESAMPLE EVERY 1h FOR 1d BEGIN SELECT non_negative_derivative(last("dot3StatsFCSErrors"), 1d) INTO "report_dot3StatsFCSErrors" FROM dot3Stats GROUP BY time(1d), "ifDescr", "agent_host" END

SELECT last("non_negative_derivative") FROM /^$report_errors$/ WHERE "non_negative_derivative" > 0 AND $timeFilter GROUP BY time($interval), "agent_host", "ifDescr" fill(null) сама таблица

если бы так без cq делал, то influx помер бы сразу

памяти 2 гига в виртуалке.

да и не сделать так без cq. там выводились вообще все значения в т.ч. нулевые, которые не нужны.

https://docs.influxdata.com/influxdb/v1.1/query_language/continuous_queries/ Substituting for a HAVING Clause

Google
Виталий
21.12.2016
08:46:36
любят они пчел в пример приводить.. ;)

какое-же все-таки барахло c3750X. буферы ниочем, куча дропов.

Maxim
21.12.2016
09:46:03
есть правило ALERT service_down IF up == 0 FOR 10s LABELS { severity = "critical" } ANNOTATIONS { summary = "Monitor service {{$labels.instance}} non-operational", description = "Service {{$labels.instance}} is down.", } все нормально работает, но иногда прилетают странные сообщения такого вида [FIRING:4] service_down (critical) [RESOLVED] service_down (critical) , кто-нибудь знает что это может быть?

Алексей
21.12.2016
20:41:57
http://grafana.org/blog/2016/12/21/grafana-4.1-beta-release/

внезапность

Admin
ERROR: S client not available

Andrey
21.12.2016
20:43:14
Только 4.0.2 поставил!

Vladimir
21.12.2016
21:17:50
Круто. У нас народ как раз ждет поддержку эластика пятого

Andrey
21.12.2016
21:27:43
ну вот в бете

Виталий
22.12.2016
07:12:51
забавное про cq. выполняются они последовательно и т.о. не грузят цпу. но как-то получилось, что в measurement писать они перестали, а данные все стали только в telegraf.<rp_name>.<measurement_name> быть доступны. удаление measurement_name удаляет и в т.ч. telegraf.<rp>.<measurement_name>

еще небольшая проблема с графаной похоже при запросе в cq

сама cq делает вот такой запрос WHERE time >= '2016-12-22T00:00:00Z' AND time < '2016-12-23T00:00:00Z' и в таблицу пишет время 1482364800000000000 date —date @1482364800 Чт дек 22 07:00:00 +07 2016 т.е. нормально. а вот графана..

> select sum("non_negative_derivative") from a_week.report_dot3StatsMultipleCollisionFrames where agent_host = 'cs-twr-5-13-3750' name: report_dot3StatsMultipleCollisionFrames time sum ---- --- 0 28 сообразил. с группировкой по времени не надо, поэтому так придется обходится.

Антон
23.12.2016
07:36:24
привет, а alertmanager стоит ставить отдельно от prometheus или можно вместе, мониторить хостов 50-100 ?

Vladimir
23.12.2016
08:56:21
https://github.com/facebookincubator/beringei

Semyon
23.12.2016
08:56:32
шо, опять?

Vladimir
23.12.2016
08:58:27
шо, опять?
почему опять? Выложили имплементацию гориллы

свою

Semyon
23.12.2016
09:00:27
Я к тому, что за полследние пол года какое-то нереальное количество ts(db?) релизится

я уже сбиваться начал

Google
Dmitry
23.12.2016
09:01:26
in-memory - жестко как-то

Алексей
23.12.2016
09:02:32
на конференции прометея они создатель движка прома сравнивал свой движок как раз с горилой

Vladimir
23.12.2016
09:06:04
и то что выложили это тоже не горилла, а скорее референсная имплементация

Антон
23.12.2016
09:21:25
почему тут http://demo.robustperception.io:9090/flags alertmanager.url определяется как http://localhost:9093, у меня при запущенном alertmanager ничего не видит и обратиться я к нему не могу по http://localhost:9093 говорит нет там ничего, в логах все ок , как к этому alertmanager обратиться?

Maxim
23.12.2016
09:23:25
потому что в конфиге так прописали

http://demo.robustperception.io:9093/#/alerts

Антон
23.12.2016
09:31:19
потому что в конфиге так прописали
в каком конфиге, у меня через curl ничего не дает по http://localhost:9093, хотя сервис пишет что слушает порт 9093

level=info msg="Listening on :9093" source="main.go:250"

Maxim
23.12.2016
09:37:39
./prometheus -config.file=prometheus.yml -alertmanager.url http://localhost:9093

Антон
23.12.2016
09:50:31
./prometheus -config.file=prometheus.yml -alertmanager.url http://localhost:9093
О спасибо, я то не заметил что этот параметр нужно в сервис prometheus добавлять, я его делал наоборот для alertmanager . Теперь все появилось , но я все равно не могу понять как мне обратиться к alertmanager интерфейсу... у меня редирект на https стоит в nginx и я не знаю какой мне url прописывать в proxy_pass.

emik0
23.12.2016
09:53:19
Привет! Кто-нибудь заморачивался по-серьезке logparser.grok с telegraf?

Антон
23.12.2016
09:54:27
./prometheus -config.file=prometheus.yml -alertmanager.url http://localhost:9093
те если прописываю в nginx location /alertmanager { proxy_pass http://localhost:9093; } он по этому адресу возвращает 404

Magistr
23.12.2016
09:55:25
ресолвер добавь

Антон
23.12.2016
10:02:38
405

Страница 72 из 681