Observabilidade que mente: health-checks que não validam dependências
Monitoramento verde e cliente vendo erro? O culpado pode ser um health-check que não valida dependências. Um caso real de RCA em produção.
Technical notes on architecture, scale and the engineering decisions behind good products.
Monitoramento verde e cliente vendo erro? O culpado pode ser um health-check que não valida dependências. Um caso real de RCA em produção.
Por que um gateway de LLM (roteamento, fallback, cache, rate limit e custo por token) é o que separa um POC de um sistema de IA confiável.
Por que "mergeou, subiu" não basta em escala: canário, análise automática por métrica e error budget, e rollback sem humano no meio da noite.
Timeout, retry com jitter, circuit breaker, bulkhead e fallback: os padrões de resiliência e a decisão de arquitetura de "dizer não" a tempo.
Quando eventos ajudam a desacoplar times e quando eles só escondem acoplamento atrás de uma fila. Um guia prático de trade-offs.
Um mergulho prático em cold starts o que os causa, como medir o impacto real e quais otimizações valem o esforço.