Nagios em rede GRANDE, BEM GRANDE.
Everton Pestana <[email protected]> Sat, 21 Aug 2010 11:33:56 -0300
| Newsgroups | gmane.network.nagios.user.brazil |
|---|---|
| Message-ID | <[email protected]> |
Prezadas e prezados, Trabalho numa empresa grande, e tenho um grande parque de servidores e serviços a serem monitorados. Preciso de de uma ajuda pois o nagios esta tendo um comportamento muito estranho. Hoje estou rodando o nagios com um único no de processamento com 2GB de Ram. Com aproximadamente 3000 hosts e 6000 serviços. Estatisticas: Services Actively Checked: Time FrameServices Checked <= 1 minute:147 (2.6%)<= 5 minutes:5574 (99.5%) <= 15 minutes:5574 (99.5%)<= 1 hour: 5574 (99.5%)Since program start: 5574 (99.5%) MetricMin.Max.Average Check Execution Time: 0.00 sec23.26 sec0.402 sec Check Latency:0.00 sec402.97 sec0.872 sec Percent State Change:0.00% 6.12%0.01% Check Statistics: TypeLast 1 MinLast 5 MinLast 15 Min Active Scheduled Service Checks22526008 18041 O que tem acontecido com o nagios, em determinados momento parece que a maquina fica totalmente inativa, caem absurdamente os trafegos das interfaces (quase zerando) e o load consequentemente cai tb. Nesse momento observei que o nagios continua rodando, mas nenhum processo filho é executado mais, a maquina parece morta. Se eu der um reload no nagios tudo volta ao normal, mas depois de algumas horas depois acontece novamente o mesmo problema.Normalmente aconteceu as vezes que percebi as 4h da manha. Olhei todos os logs do nagios e de sistema possíveis e imaginaveis, e não ache nenhum erro nada que pudesse apontar tal comportamento. Desde já muito obrigado pela ajuda. Abs. Everton Pestana ------------------------------------------------------------------------------ This SF.net email is sponsored by Make an app they can't live without Enter the BlackBerry Developer Challenge http://p.sf.net/sfu/RIM-dev2dev -- [email protected] mailing list https://lists.sourceforge.net/lists/listinfo/nagios-users-br Wiki: http://nagios-br.sf.net/wiki