Hiper experienced a minor incident on September 2, 2026 affecting Hiper Gestão, lasting 51m. The incident has been resolved; the full update timeline is below.
Affected components
Update timeline
- investigating Sep 02, 2026, 07:28 PM UTC
Neste momento estamos passando por uma instabilidade no sistema causando lentidão em parte dos fluxos. A investigação da causa raiz já está em andamento e em breve traremos novas informações.
- monitoring Sep 02, 2026, 07:43 PM UTC
Após a instabilidade na infraestrutura ser mitigada com upscale da carga, validamos que o ambiente normalizou. Estamos acompanhando e monitorando o ambiente para garantir a estabilidade do mesmo
- resolved Sep 02, 2026, 08:20 PM UTC
Continuamos monitorando após a normalização do ambiente e não identificamos mais nenhum impacto proveniente do incidente. Dessa forma, estamos encerrando a tratativa deste incidente.
- postmortem Sep 18, 2026, 03:02 PM UTC
Esta publicação tem por objetivo detalhar os eventos que envolveram o incidente do dia 02/09/2026 afetando a experiência de uso e ocasionando intermitência no acesso ao Hiper Gestão. No decorrer do relatório serão apresentadas informações gerais do incidente, causas, ações de remediação e próximos passos. **Código:** 2026090201 **Data:** 02/09/2026, quarta-feira **Horário de início:** 16h02 \(horário de Brasília\) **Horário de resolução:** 16h37 \(horário de Brasília\) **Tempo total de impacto:** 35 minutos **Impacto:** degradação de performance seguido de intermitência no acesso ao Hiper Gestão **Detalhamento do incidente** Foi identificado um aumento no consumo de CPU em todas as instâncias do _cluster_ principal de hospedagem do Hiper Gestão simultaneamente. Durante o incidente todas as instâncias do _cluster_ principal apresentaram alto consumo de CPU, reduzindo a performance das requisições processadas por estas instâncias e causando intermitência no acesso ao Hiper Gestão. Pelo fato de todas as instâncias apresentarem alto consumo de CPU simultaneamente, nosso time atuou de forma proativa para reduzir a janela de impacto, provisionando novas instâncias e desativando as instâncias problemáticas. A tentativa inicial buscou provisionar as novas instâncias no _cluster_ principal, no entanto, foi identificada uma falha na alocação de recursos na Azure, aumentando drasticamente o tempo para que as instâncias estivessem prontas. Para mitigar o impacto, nosso time realizou o provisionamento das instâncias em um _cluster_ secundário, redirecionando o tráfego conforme as instâncias estivessem prontas. Enquanto o processo de provisionamento ocorria, houve intermitência no acesso ao Hiper Gestão. A causa raiz do alto consumo de CPU não foi identificada, pois o consumo abrupto de CPU impossibilitou a coleta de dados dos processos em execução. Analisando os _logs_ de aplicação também não foi possível identificar a causa raiz do incidente. Como próximos passos, nosso time implantou uma automação para coleta do _dump_ de memória RAM, logo após o incidente, possibilitando que em ocorrências futuras sejam coletadas informações que contribuam para a análise da causa raiz. Outra ação tomada pelo time foi o aumento de seis para oito servidores em execução durante o horário comercial no _cluster_ principal do Hiper Gestão. Esta ação tem como objetivo mitigar o risco de o incidente ocorrer devido à saturação geral do _cluster_ em momentos de alto consumo, bem como melhorar a distribuição de carga até que a causa raiz seja identificada e corrigida.