Quarta de manhã, 9:47. No #incident alguém escreve "prod tá lento". Você ssh-a e congela por um instante tentando lembrar se top ordena por CPU em Shift+M ou Shift+P, se iostat é em MB/s ou em setores por padrão, se ss -s mostra mesmo o que você quer. Não precisa lembrar disso tudo. Cinco perguntas te dão a foto.
1. Top por CPU
$ clai quais 10 processos estão usando mais CPU agora→ ps -eo pid,user,%cpu,%mem,comm --sort=-%cpu | head -11PID USER %CPU %MEM COMMAND8821 app 84.2 12.4 java8901 app 31.1 3.2 node
Uma amostra só não é evangelho — mas é um snapshot instantâneo, e em 95% dos casos aponta o processo certo.
2. Top por RSS
$ clai top 10 processos por memória residente→ ps -eo pid,user,rss,%mem,comm --sort=-rss | head -11PID USER RSS %MEM COMMAND8821 app 1985432 12.4 java4567 app 1180224 7.2 node
%MEM é porcentagem; RSS são os kilobytes realmente residentes. Para "quem come memória", quer RSS.
3. I/O de disco numa janela de 10 segundos
$ clai mostra I/O de disco por dispositivo a cada segundo, 10 vezes→ iostat -dx 1 10Device r/s w/s rkB/s wkB/s %utilsda 12.0 340.2 192.0 18432.0 87.4
%util em 87% significa que esse disco é o gargalo agora. Sem iostat -x essa coluna não aparece.
4. Memória em unidades humanas
$ clai mostra uso de memória em formato legível→ free -h total used free shared buff/cache availableMem: 15Gi 12Gi 428Mi 32Mi 2.7Gi 2.6GiSwap: 2.0Gi 1.2Gi 820Mi
-h dá unidades legíveis. available é a coluna que realmente responde tenho memória? — não free, que pode mostrar um número enganosamente baixo.
5. Conexões de rede abertas
$ clai mostre todas as conexões established com nome do processo→ ss -tnp state establishedESTAB 10.0.1.12:54322 10.0.1.50:5432 users:(("app",pid=8821))ESTAB 10.0.1.12:51002 17.253.144.10:443 users:(("clai",pid=4012))
A forma da triagem
Cinco perguntas, dois minutos, você já tem a foto: qual processo, qual recurso, qual dispositivo, qual conexão. Frequentemente você roda duas ou três em sequência — top por CPU pra achar o suspeito, top por RSS pra confirmar memória, iostat pra descartar disco. Mais rápido que vasculhar atalhos do htop.
Veja também
- Matar processo na porta — continuação natural depois de identificar o suspeito.
- Triagem de rede — quando o gargalo acaba sendo a rede, não o host.