Flowbix · AWS RDS & Aurora · Bancos
CADA BANCO NO AR, UMA SÓ TELA.
Monitoramento de bancos Amazon RDS e Aurora em tempo real — CPU, conexões e memória, IOPS e latência, storage e burst, replica lag e o coração do Aurora (buffer cache, commit latency, deadlocks). De MySQL/PostgreSQL a clusters Aurora, consolidado numa única sala de operação sobre Zabbix (CloudWatch).
99,95%
Disponibilidade · bancos RDS/Aurora
/ INSTÂNCIAS
AVAILABLE
38/38
MySQL · PostgreSQL22
Aurora16
/ CPU MÉDIA
AO VIVO
Média42%
>85% · créd. baixo2 · 1
/ CONEXÕES
OK
1.842
Máx configurado3.000
Uso61%
/ IOPS · LATÊNCIA
AO VIVO
8,4 k
Latência r/w2,1 / 3,4 ms
Burst baixo1
/ AURORA
CLUSTER
0,8 s
Buffer cache hit99,9%
Deadlocks0
/ ALARMES
ATENÇÃO
5
Em ALARM1
Eventos RDS 24h3
Sala de operação de bancos
RDS & Aurora em tempo real
38
Instâncias
99,95%
Disponibilidade
1.842
Conexões
8,4k
IOPS
24×7
Monitoramento
01/09
Frota AWS RDS & Aurora38 bancos · 1 sala
RDS · PostgreSQL 1514 inst
RDS · MySQL 812 inst
Aurora · PostgreSQL8 inst
Aurora · MySQL4 inst
via CloudWatch
NOC Cloud · Flowbix
RDS · Aurora · CloudWatch — 6 painéis numa sala, ao vivo
Índice de saúde da frota97,2/100
38/38
Bancos ativos · 26 RDS · 12 Aurora
42%
CPU média frota · pico 88%
1.842
Conexões ativas · máx 2.480
8,4k
IOPS total r+w · lat 2,1 ms
99,9%
Aurora buffer hit · 12 clusters
5
Alarmes ativos · 1 em ALARM
01 · InstânciasONLINE
Instâncias & Visão
38 bancos RDS/Aurora · 4 engines · classe e storage.
Ativas38/38
Multi-AZ22
Engines4
Classe topdb.r6g.xl
Instâncias por engine38 total
38/38 ativas · 22 Multi-AZ · 0 em manutenção
02 · CPU / Conex.ATENÇÃO
CPU · Conexões · Mem.
Utilização, conexões e memória livre por instância.
CPU média42%
Conexões1.842
Mem. livre8,2 GB
Swap0 MB
CPU · % · 24 hmáx 88
−24 h−12 hagora
db-prod-07 em 88% · média 42% · 0 swap
03 · IOPS / StorageSAUDÁVEL
IOPS · Latência · Disco
IOPS read/write, latência de disco e espaço livre.
IOPS r+w8,4k
Lat. r/w1,8/2,4 ms
Storage livre62%
Burst bal.100%
IOPS · total · 24 hmáx 11,2k
−24 h−12 hagora
8,4k IOPS · fila 0,7 · burst 100%
04 · Aurora ClusterAO VIVO
Aurora Cluster
Buffer cache, commit latency, deadlocks e replica lag.
Buffer cache99,9%
Commit lat.3,1 ms
Deadlocks0
Replica lag18 ms
Commit latency · ms · 24 hmáx 5,4
−24 h−12 hagora
12 clusters · 99,9% cache · 0 deadlocks
05 · ReplicaçãoEM SINCRONIA
Replicação & Eventos
Réplicas, replica lag e eventos RDS por categoria.
Réplicas8/8
Lag máx42 ms
Eventos 24 h12
Failovers0
Eventos RDS · 16 bins 1,5 h3 backup/maint
8/8 réplicas · lag máx 42 ms · 12 eventos
06 · Alarmes5 ATIVOS
Alarmes & Saúde
Alarmes CloudWatch por estado e health checks.
Ativos5
Em ALARM1
Insuff. dados0
Health checks4/4
Alarmes ativos por severidade1 crítico
5 ativos · 1 em ALARM · 153 alarmes OK
Flowbix · AWS RDS & Aurora · 6 dashboards numa sessão
02 / 09
Instâncias38/38 up
38/38
38 available · 0 stopped · 0 modifying
Engines4 famílias
4
Aurora 14 · PG 11 · MySQL 9 · MariaDB 4
Multi-AZHA 58%
22/38
16 single-AZ · failover < 60 s
Read replicasassíncronas
9
6 cross-AZ · 3 cross-região · lag máx 148 ms
Storage provisionadogp3 · io2
41,6 TB
usado 28,3 TB (68%) · livre 13,3 TB · autoscale 12 instâncias
CPU da frota de bancos · 24hmáx 82% · alerta 85%
100,0 %80,0 %60,0 %40,0 %20,0 %
00h04h08h12h16h20h24h
Média frota 47%Máx instância 82% · db-prod-03% CPU util · - - alerta 85%
Por engine & classe38 instâncias
Storage provisionado41,6 TB
Usado · livre28,3 TB · 13,3 TB (32%)
Volume · gp3 / io232 gp3 · 6 io2
Maior volumedb-prod-03 · 4,8 TB
Instâncias · frota RDS / Aurora38 inst · 2 em atenção
| DB identifier | Engine · versão | Classe | St | CPU | Conex. | Free stor. | M-AZ |
|---|---|---|---|---|---|---|---|
| aurora-cluster-a | Aurora PostgreSQL 15.4 | db.r6g.2xlarge | 54% | 428 | auto | Sim | |
| aurora-cluster-a-r1 | Aurora PostgreSQL 15.4 | db.r6g.2xlarge | 41% | 236 | auto | Sim | |
| db-prod-01 | PostgreSQL 15.4 | db.r6g.xlarge | 61% | 312 | 842 GB | Sim | |
| db-prod-02 | MySQL 8.0.35 | db.r6g.xlarge | 47% | 268 | 1,2 TB | Sim | |
| db-prod-03 | Aurora MySQL 3.05 | db.r6g.4xlarge | 82% | 604 | auto | Sim | |
| db-prod-05 | MySQL 8.0.35 | db.r5.xlarge | 71% | 388 | 92 GB | Sim | |
| db-prod-04 | PostgreSQL 14.11 | db.r6g.large | 33% | 142 | 388 GB | Não | |
| db-stage-01 | MariaDB 10.11 | db.t4g.large | 22% | 64 | 210 GB | Não |
Distribuição da frota38 instâncias
Por engineAur 14 · PG 11 · MySQL 9 · Maria 4
Por classer6g 26 · t4g 7 · r5 5
Storage total41,6 TB · usado 68%
Backup / PITR38/38 · ret. 14 d
Criptografia (KMS)38/38 · TLS enforce
Flowbix · Instâncias RDS · engine, classe, storage e status
03 / 09
CPU média · frotaestável
42,3%
pico frota 78% · meta < 85%
Instâncias > 85%2 críticas
2/24
db-prod-03 91% · db-prod-07 87%
Conexões ativas · agregado16% do limite
1.842 conex.
de 11.420 máx agregado · pico 24h 2.147 · líder db-prod-01 528 · db-prod-08 a 85% do limite
Freeable mem · míndb-prod-07
0,7 GB
18% da RAM · agreg. 142 GB
Swap · total frota3 instâncias
612 MB
máx 296 MB · db-prod-03
CPU & conexões · 24hpico frota 78% · conex. 2.147
100,0 %75,0 %50,0 %25,0 %0,0 %
2.4001.8001.2006000
00h04h08h12h16h20h24h
CPU % média da frota · conexões agregadasâmbar % · ciano conex. (esc. dir.) · - - limite 85%
Conexões por instânciatop · uso de max_connections
Total ativas / capacidade agregada1.842 / 11.420 · 16%
Instâncias > 80% do limite1 · db-prod-08
Maior contagem absolutadb-prod-01 · 528
Conexões recusadas · 24h0
Recursos por instância2 acima de 85% CPU
| Instância · classe · engine | CPU | Conex. | Freeable | Swap | Créd. CPU | Status |
|---|---|---|---|---|---|---|
| db-prod-03 · t4g.large · PostgreSQL 15.4 | 91% | 118 | 1,4 GB | 296 MB | 38 | CPU+mem |
| db-prod-07 · t3.medium · MySQL 8.0 | 87% | 96 | 0,7 GB | 198 MB | 44 | CPU+swap |
| db-prod-01 · r6g.xlarge · MySQL 8.0 | 66% | 528 | 6,2 GB | 0 | — | Normal |
| aurora-cluster-a · writer · r6g.2xlarge · PG 15.4 | 58% | 412 | 12,8 GB | 0 | — | Normal |
| db-prod-05 · m6g.large · MySQL 8.0 | 51% | 264 | 1,1 GB | 118 MB | — | Mem/swap |
| aurora-cluster-a · reader-1 · r6g.xlarge · PG 15.4 | 34% | 208 | 9,1 GB | 0 | — | Normal |
| db-prod-08 · t3.small · MySQL 8.0 | 44% | 128 | 1,6 GB | 0 | 62 | Conex 85% |
| +17 instâncias · frota restante | méd 31% | 968 | — | 0 | ok | Normal |
24 instâncias · CPU méd 42,3% · 2 acima de 85% (T-family sob carga sustentada) · 3 com swap · créditos CPU só em T-family — R/M sem burst
Memória & créditos · sob pressãoT-family drenando
Uso de memória (top)
Swap em uso · créditos CPU (T-family)
db-prod-03 · swap296 MB
db-prod-07 · swap198 MB
db-prod-05 · swap118 MB
créditos CPU · db-prod-03 / 0738 / 44
Σ swap frota · limite crédito612 MB · < 50 crít.
Flowbix · CPU, conexões e memória por instância
04 / 09
IOPS r/w · agoraprovis. 63%
8,4k/s
leitura 5,1k · escrita 3,3k · pico 24h 12,7k · io2+Aurora 47% do total
Latência leituraSLA ok
2,1ms
p95 4,8 · meta < 5 ms
Latência escritapico 9,1
3,4ms
p95 6,2 · meta < 8 ms
Free storage míndb-prod-03
8,4%
42 GB de 500 · autoscale < 10%
Burst balance míngp2
17%
db-stage-02 · limite 20%
IOPS & latência · 24h
lat leituralat escritaSLA 8 ms
12,0 ms9,0 ms6,0 ms3,0 ms0,0 ms
00h04h08h12h16h20h24h
IOPS leitura5,1k/s
IOPS escrita3,3k/s
p95 lat. leitura4,8ms
p95 lat. escrita6,2ms
Storage por instância · usado / livre1 < 10% livre
db-prod-03 · gp3 · 500 GB91,6% · 42 GB livre
db-prod-01 · gp3 · 512 GB74,0% · 133 GB livre
db-prod-02 · gp3 · 256 GB68,0% · 82 GB livre
db-analytics-01 · io2 · 2 TB47,0% · 1,06 TB livre
db-prod-04 · gp3 · 512 GB55,0% · 230 GB livre
marcador = gatilho de autoscale (10% livre · 90% usado)
db-prod-03 · autoscale armado+50 GB < 10% · máx 1 TB
Aurora · storage compartilhado (auto)1,28 TB · +10 GB incrementos
I/O por instância8 instâncias · 1 alerta
| Instância | R IOPS | W IOPS | R lat | W lat | Queue | Burst |
|---|---|---|---|---|---|---|
| aurora-cluster-a writer · PG 15.4 | 1.420 | 1.180 | 1,2 | 2,4 | 0,8 | — |
| aurora-cluster-a reader-1 | 1.680 | 20 | 1,1 | 1,8 | 0,4 | — |
| db-analytics-01 io2 · PG 15.4 | 980 | 210 | 2,0 | 3,1 | 1,4 | — |
| db-prod-01 gp3 · PG 15.4 | 420 | 610 | 2,6 | 3,8 | 1,1 | 100% |
| db-prod-02 gp3 · MySQL 8.0 | 310 | 540 | 3,1 | 4,6 | 1,6 | 100% |
| db-prod-03 gp3 · PG 15.4 | 190 | 380 | 3,8 | 5,2 | 2,1 | 100% |
| db-stage-02 gp2 · PG 15.4 | 90 | 160 | 5,4 | 9,1 | 3,2 | 17% |
| db-prod-04 gp3 · MySQL 8.0 | 20 | 210 | 2,2 | 3,4 | 0,6 | 100% |
Storage & burst1 crítico
Free storage crítico
db-prod-03 · gp342 GB · 8,4%
db-stage-02 · gp237 GB · 37%
Burst balance · gp2 (< 20% alerta)
EBS balance & throughput r/w
EBS byte balance %100%
EBS IO balance % · db-stage-0261%
Throughput leitura418 MB/s
Throughput escrita276 MB/s
Flowbix · IOPS, latência r/w, storage e burst balance
05 / 09
Clusters Aurora16/16 up
16/16
34 nós · 16 writer + 18 reader
Buffer cache hit≥ 99%
99,9%
mín 98,9% · meta ≥ 99,0%
Commit latencySLO 6 ms
3,2ms
p95 8,4 ms · pico 24h 9,1
Deadlocks/s0/s agora
0/s
24h 1 · row-lock 2,1 ms
Aurora replica lag1 em atenção
18ms
p95 · média 7 ms · máx 22 ms · 18 réplicas · meta < 20 ms
Commit latency & buffer cache hit · 24hSLO ok
3,2 msCommit lat · agora
99,9 %Buffer cache hit
18,9k/sCommit throughput
2,1 msRow lock time
8,0 ms6,0 ms4,0 ms2,0 ms0,0 ms
00h04h08h12h16h20h24h
commit latency (média)buffer cache hitms · - - SLO 6 ms · cache 98,5–100% (eixo dir.)
DML · latência por operação18,9k ops/s
Operaçãomsops/s
SELECT0,42ms12,4k/s
INSERT1,10ms3,8k/s
UPDATE1,80ms2,1k/s
DELETE2,40ms620/s
Commit throughput 18,9k/sDDL latência 6,2 ms · select thr. dominante
Clusters Aurora2 em atenção
| Cluster | Engine | Nós (w/r) | Cache | Commit | Deadlk 24h | Lag |
|---|---|---|---|---|---|---|
| aurora-cluster-core | PostgreSQL 15.4 | 1w / 3r | 99,9% | 3,1 ms | 0 | 5 ms |
| aurora-cluster-a | PostgreSQL 15.4 | 1w / 2r | 99,9% | 2,8 ms | 0 | 6 ms |
| aurora-cluster-catalog | MySQL 8.0.36 | 1w / 1r | 99,9% | 2,2 ms | 0 | 4 ms |
| aurora-cluster-b | MySQL 8.0.36 | 1w / 1r | 99,8% | 3,4 ms | 0 | 9 ms |
| aurora-cluster-ledger | PostgreSQL 14.9 | 1w / 2r | 99,7% | 4,6 ms | 0 | 12 ms |
| aurora-cluster-billing | PostgreSQL 15.4 | 1w / 2r | 99,4% | 5,8 ms | 1 | 14 ms |
| aurora-cluster-analytics | MySQL 8.0.36 | 1w / 2r | 98,9% | 7,2 ms | 0 | 22 ms |
| +9 clusters · média | PostgreSQL / MySQL | 9w / 5r | 99,9% | 3,0 ms | 0 | 7 ms |
Transações & lockssnapshot agora
Transações ativas342
Transações bloqueadas1
Row lock time (médio)2,1 ms
Rollback / history list len1.842
Queries/s (agregado)21,4k/s
Aborted connections3 /min
Max used txn IDs (PG)412M / 2,1B
Flowbix · Aurora · buffer cache, commit latency e deadlocks
06 / 09
Read replicas5 available
5
3 origens · aurora + rds · 0 rebooting
Replica lag máx> meta 20 s
34s
db-prod-01-rr2 · média 11 s
Réplicas fora de lag1 acima
1/5
4 dentro da meta (20 s)
Binary log usage30%
2,4/8 GiB
purga auto · +0,3 GiB/24h
Eventos RDS · 24h14 eventos · LLD
14 ev
1 failover · 6 backup · 4 config · 2 manut. · 1 falha
Replica lag · 24h por réplica1 acima da meta
aurora-replica-aaurora-replica-bdb-prod-01-rr2meta 20 s
40,0 s30,0 s20,0 s10,0 s0,0 s
00h04h08h12h16h20h24h
lag de replicação · 3 réplicas · pico 12h30 (db-prod-01-rr2)s · - - meta 20 s
Réplicas por instância origem5 réplicas · 3 origens
Lag médio / máx · 5 réplicas11 s / 34 s
Réplicas dentro da meta (20 s)4 / 5
Aurora replica lag (mín/máx)0,9 / 34 s
Eventos RDS · 24h14 eventos · LLD por categoria
| Categoria | Source | Mensagem | Data / hora |
|---|---|---|---|
| falha | db-prod-01-rr2 | Replica lag 34 s acima da meta · replicação reiniciada | 11:18:33 |
| manut. | aurora-cluster-b | Manutenção agendada · minor 15.4 → 15.5 em 13/07 02:00 | 09:22:05 |
| backup | aurora-cluster-a | Backup contínuo (PITR) ativo · retenção 7 d | 06:45:00 |
| config | db-prod-01 | Storage autoscaling · 320 → 384 GiB | 05:03:21 |
| failover | aurora-cluster-a | Failover concluído p/ réplica AZ-b em 28 s | 03:12:47 |
| backup | db-prod-01 | Snapshot automático concluído · 312 GB | 02:00:14 |
| config | db-prod-02 | Parameter group aplicado · max_connections 500 | ontem 21:40 |
Replicação5 available
Read replica state5 available · 0 reboot
Replication slot lag (PG)db-prod-02 · 12 MB
Checkpoint lag (PG)1,8 s
Aurora replica lag mín/máx0,9 / 34 s
Máx used transaction IDs6% · OK
Flowbix · Replicação & eventos · replica lag e RDS events
07 / 09
Alarmes · 24hbase 214
5/24h
1 ativo · 4 recuperados · 212 OK
Em ALARMativo
1
db-prod-01 · CPU 91,4% · há 18 min
Insufficient datasem dados
1
aurora-b · reader-1 · FreeableMemory · gap 6 min
Coleta CloudWatch4/4 checks
OK
resp API 214 ms · última há 24 s
Instâncias monitoradas6 clusters Aurora
38 inst
RDS 21 · Aurora 17 · 34 Multi-AZ · classes db.r6g / m6g · 212 alarmes em OK · 2 não-OK
Estado dos alarmes · instância × 24hbins de 2h
OKdisparou / recuperouem ALARMinsufficient / sem dados
000204060810121416182022
db-prod-01
db-prod-02
aurora-a · writer
aurora-a · reader-1
aurora-a · reader-2
aurora-b · writer
aurora-b · reader-1
db-analytics-01
db-legacy-mysql-1
db-stg-01
+28 inst · OK
Por estado & serviço214 alarmes
212OK · 99,1%
1ALARM
1Insufficient
1 ALARM em RDS PostgreSQL (db-prod-01 · CPUUtilization) · 1 INSUFFICIENT em Aurora PostgreSQL (aurora-b reader · gap de coleta). Namespace AWS/RDS · dims DBInstanceIdentifier / DBClusterIdentifier.
Alarmes ativos & recentes · 24h1 ALARM · 1 insuff. · 4 recup.
| Alarme | Instância | Métrica | Estado | Razão | Idade |
|---|---|---|---|---|---|
| cpu-utilization-high | db-prod-01 | CPUUtilization · 91,4% | ALARM | ≥ 85% por 15 min (3/3 pts) | 18 min |
| freeable-memory-low | aurora-b · reader-1 | FreeableMemory · — | INSUFF. | sem métrica há 6 min · gap CloudWatch | 6 min |
| db-connections-high | db-prod-02 | DatabaseConnections · 1.284 | OK | recuperado · pico 1,4k (limite 1,5k) | 1 h 12 |
| burst-balance-low | db-analytics-01 | BurstBalance · 24% | OK | recuperado · gp2 recompondo créditos | 3 h 40 |
| aurora-replica-lag-high | aurora-a · reader-2 | AuroraReplicaLag · 820 ms | OK | recuperado · pós-failover do writer | 5 h 02 |
| read-latency-high | db-legacy-mysql-1 | ReadLatency · 42 ms | OK | recuperado · janela de backup 00–02h | 9 h 33 |
| free-storage-low | db-prod-01 | FreeStorageSpace · 38% | OK | OK · em observação (queda ~2%/dia) | estável |
| deadlocks-detected | aurora-a · writer | Deadlocks · 0/s | OK | OK · sem eventos nas últimas 24h | estável |
Saúde da coleta · HTTP→CloudWatchoperacional
metrics.check341/342 · 1 gap
instance_info.checkOK · 38 inst.
alarms.checkOK · 214 alarmes
events.checkOK · 12 eventos/24h
Response time · API214 ms · p95 410 ms
Throttling · GetMetricData0 · 1,2k req/min
Intervalo / lookback60 s · janela 5 min
Última coleta / próximahá 24 s · em 36 s
endpoint monitoring.sa-east-1.amazonaws.com · IAM role read-only (cloudwatch:GetMetricData, DescribeAlarms) · sem throttling nas últimas 24h · template AWS RDS by HTTP.
Flowbix · Alarmes CloudWatch & saúde da coleta
08 / 09
Próximo passo
Vamos centralizar?
Agende uma demo da Missão Crítica Flowbix, fale com o time comercial e traga energia, no-break, gerador, CFTV e controle de acesso dos seus sites críticos para uma única sala de operação.
service
FLOWBIX
Comercial · Flowbix ✓
Conta verificada
Escaneie para iniciar uma conversa
Flowbix
·
Missão Crítica · Monitoramento de Sites Críticos
09 / 09