@metrics_ru

Страница 71 из 681
yopp
15.12.2016
10:59:46
Ибо ты его задачи натягиваешь на мониторинг
Моя задача узнать не что пошло по пизде, а причину, почему всё пошло по пизде.

Антон
15.12.2016
10:59:50
Я не алертинг хочу, я хочу понять что надо на графиках рисовать
http://pmmdemo.percona.com/graph/dashboard/db/pmm-demo вот посмотри примеры

Vladimir
15.12.2016
10:59:52
просто думай логически - у тебя есть 100500 источников метрики - что тебе интересно?

сумма, какие-то топы, или что еще?

Google
Vladimir
15.12.2016
11:00:08
отношение к прошлому месяцу там или прошлому часу

и это, я могу ошибаться

yopp
15.12.2016
11:00:45
и это, я могу ошибаться
мы все можем ошибаться!

и ошибаемся!

Vladimir
15.12.2016
11:01:06
Просто мне с тем что я мониторю, пока highestAverage и отношения к прошлому давали наиболее вменяемый результат

yopp
15.12.2016
11:01:11
Вот случилось: как мне теперь узнать почему?

Vladimir
15.12.2016
11:01:16
если достаточно данных можно перцентили делать

Вот случилось: как мне теперь узнать почему?
делать разбивку по дашбордами дальше

метрики по ролям, по хостам там

yopp
15.12.2016
11:02:21
по серверам разбивку?

Vladimir
15.12.2016
11:02:27
а так без надписей и цифр я даже не представляю что ты меряешь

yopp
15.12.2016
11:02:46
а так без надписей и цифр я даже не представляю что ты меряешь
Это я пример из перконовского дешборда взял

Google
Vladimir
15.12.2016
11:02:47
по серверам разбивку?
ну у нас есть в графане дашборд где можно по ролям выбрать сервера

yopp
15.12.2016
11:02:53
это типа CPU usage

Vladimir
15.12.2016
11:02:55
и по ним посмотреть статистику по базовым параметрам

например

Vladimir
15.12.2016
11:03:16
yopp
15.12.2016
11:03:22
:(

Антон
15.12.2016
11:05:09
Вот случилось: как мне теперь узнать почему?
ну это график CPU Usage , смотри какие процессы работают, что именно загружает.

Vladimir
15.12.2016
11:05:35
не все дешево собирать, да

ptchol
15.12.2016
11:17:08
:(
мы сделали очень "низкий" семплинг и очень короткие периоды для таких дашбородов.

чтобы суммарно было мало точек н одной странице

Антон
15.12.2016
11:17:22
Кто нибудь знает, где указывать опции для node_exporter ?

yopp
15.12.2016
11:17:24
низкий семплинг это сколько?

ptchol
15.12.2016
11:17:34
быстро упёрлись в диски, потому что это всё равно читается, и теперь ждём дисков.

yopp
15.12.2016
11:17:50
Я ещё ничо делать не начал, у меня уже 100к точек только с монги :(

ptchol
15.12.2016
11:17:57
5минут, графики все за 1 час

yopp
15.12.2016
11:18:16
5 минут, ага.

ptchol
15.12.2016
11:18:21
получается по десятку точек на график

точнее на полосочку

Google
yopp
15.12.2016
11:18:31
Ага.

ptchol
15.12.2016
11:18:48
и пришлось ещё мучится с тем что рисуем на avg а всякие там min \ max

иначе эти 5минут всё съедают

yopp
15.12.2016
11:19:56
ладно, я вас услышал!

ptchol
15.12.2016
11:22:20
на страничке со всех графиков порядка 1.5к полосочек.

посмотрел сейчас.

ну вот на основной странице которая у саппорта открыта, сильно меньше, там порядка 600

ладно, я вас услышал!
там же есть какие то скриптед борды, может они сделают твои волосы шелковистыми ?

Антон
15.12.2016
11:28:50
что никто не знает как передать параметры для node_exporter под systemd? Там есть $NODE_EXPORTER_OPTS

Serge
15.12.2016
11:39:14
ну да я имел ввиду тесты проходят где нить на стейдже , если есть косяки то в прод ничего не идет и разработчик или кто там изменения делал это увидит
а как в с тейдже найдешь косяки? по хер где мерить же. ну и вот на стейдже не было нагрузки, была меньше база. идемпотентности не бывает же. иначе вообще можно не мерять прод.

Serge
15.12.2016
11:46:32
что никто не знает как передать параметры для node_exporter под systemd? Там есть $NODE_EXPORTER_OPTS
я его в докере запускаю. вот рецепт для ansible - name: run node exporter container docker_service: project_name: node_exporter restarted: true definition: version: '2' services: node_exporter: image: prom/node-exporter:0.12.0 restart: always ports: - 9100:9100 volumes: - /proc:/host/proc - /sys:/host/sys - /:/rootfs network_mode: host command: -collector.procfs /host/proc -collector.sysfs /host/sys -collector.filesystem.ignored-mount-points "^/(sys|proc|dev|host|etc)($$|/)"

Антон
15.12.2016
12:17:51
да как раз collectors мне и надо указать -collectors.enabled="diskstats,filefd,filesystem,loadavg,meminfo,netdev,stat,time,uname,vmstat" . Только я не использую докер, у меня на виртуалке настроено. Как вариант напрямую в сервисе добавить , но я не понимаю как передать в $NODE_EXPORTER_OPTS

там есть еще файл с окружением пустой, если туда collectors добавить , и перезапустить то ничего не меняется [Service] EnvironmentFile=-/etc/default/node_exporter User=prometheus ExecStart=/usr/bin/node_exporter $NODE_EXPORTER_OPTS Restart=on-failure

Serge
15.12.2016
12:24:38
EnvironmentFile=-/etc/default/node_exporter здесь - зачем?

Semyon
15.12.2016
12:25:29
ммм, а не ты в хенгопсе несколько дней назад про это спрашивал?

говорят, что эта штука позволяет игнорировать ошибки

типа если файла нет, то и хрен с ним

Serge
15.12.2016
12:26:27
кто мешает в ExecStart добавить -collectors.enabled? подозреваю, что правильно с одним минусомм. надо код посомтреть их

Google
Serge
15.12.2016
12:26:49
Антон
15.12.2016
13:16:35
EnvironmentFile=-/etc/default/node_exporter здесь - зачем?
это по дефолту шло, сам пакет ставится из этого репо https://github.com/lest/prometheus-rpm

ptchol
15.12.2016
15:20:48
мне кажется там поведение как в баше, вот этот файл, иначе нихрена

примерно как в баше

Cate
15.12.2016
23:16:24
Поздравляем с днем рождения Сашу Чистякова! Желаю только вперед и вверх!

Square
16.12.2016
03:32:15
Емае, он чо вездесущ? А как про риман спросить - не у кого

Semyon
16.12.2016
05:14:50
Правда он работает себе как-то сам

Square
16.12.2016
07:20:19
Правда он работает себе как-то сам
Опиши юзкейс? Чо льёте? Есть ли бекенд?

Admin
ERROR: S client not available

Square
16.12.2016
07:23:48
Я вообще домохозяйка в делах мониторинга

Semyon
16.12.2016
07:48:20
У меня юзкейз просто как палка

есть риман (одна штука), в нем есть код для алертов и стриминг в influxdb

все метрики пишутся прямо в риман с collectd на линуксовых нодах и через graphite powershell functions на виндовых нодах

в фейковый графитный сервер в римане

Льём много чего, стандартные метрики и всякие хитрые метрики вроде результат выполнения теста со дескрипшеном

Square
16.12.2016
07:53:59
О, огонь, прям то что нужно! Спасибо коллега

Zon
16.12.2016
08:58:41
Cate
16.12.2016
09:04:28
В рамках метрик вверх не всегда хорошо...
главное чтоб все хорошо было.

fstpk
16.12.2016
09:11:25
Google
Александр
16.12.2016
09:43:04
Господа, у меня вопрос, есть график, хочу понять что жрёт io и почему.. Что может мне помочь в этом?

На сколько я знаю, есть что-то, что снимает метрики по данному направлению, только вот плохо, когда забыл..:(

Александр
16.12.2016
10:04:24
collectd > graphite > grafana

Можно что нибудь ещё прикрутить проблемы нет, вопрос чем снять..

yopp
16.12.2016
10:08:33
во

а как вы решаете проблему с метриками из виртуалок/конейнеров, когда нужны метрики хоста?

Uncel
16.12.2016
10:12:54
collectd > graphite > grafana
Colletcd per process не умеет

Александр
16.12.2016
10:13:07
Colletcd per process не умеет
Дак я и пишу, что прикрутить(((

Т.е. спрашиваю

fstpk
16.12.2016
10:13:24
можешь какой-нибуль filecount-plugin поставить

посмотреть куда больше всего пишется

такое

ptchol
16.12.2016
10:13:59
iotop запусти на тачке )

Uncel
16.12.2016
10:14:04
Скриптоту обходящую https://git.kernel.org/cgit/linux/kernel/git/torvalds/linux.git/tree/Documentation/filesystems/proc.txt?id=v4.1#n1486

С экспортом

Александр
16.12.2016
10:14:22
iotop запусти на тачке )
Мне нужно в график, не хочу потом ебстись с поиском таймайлнов и т.п., кароч не оч идея.

График пробовал строить, но получалась хуйня

с iotop

ptchol
16.12.2016
10:14:38
а вобще, если у тебя все сервисы запускаются через systemd то проще всего врубить аккаунтинг в systemd и запилит ьскриптики который из сигруп данные собирает и шлёт тебе

помоему в свежих systemd шщ accounting есть

Страница 71 из 681