GitHub llegó a un nuevo pico de tráfico y por eso se cayó el lunes ↗
Nuestra investigación determinó que la interrupción comenzó cuando el tráfico alcanzó un nuevo pico y un componente de infraestructura crítico en nuestro centro de datos del centro de EE. UU. no pudo escalar al mismo ritmo. La presión de capacidad resultante se propagó a través de nuestros sistemas, provocando fallas de autenticación y afectando múltiples servicios de GitHub.
La recuperación requirió varias acciones coordinadas. Los equipos redirigieron el tráfico, aislaron la infraestructura afectada y restauraron los servicios por etapas. La mayoría de los servicios de GitHub se recuperaron ese mismo día, pero algunos servicios de Copilot tomaron más tiempo. Los errores en dichos servicios desencadenaron un bucle de reintentos en el lado del cliente que incrementó el tráfico durante la recuperación. Tuvimos que mitigar ese comportamiento antes de poder restablecer el tráfico de forma segura. El análisis de causa raíz completo incluye una cronología técnica detallada.
Ninguna de las interrupciones fue causada por un cambio de código o de configuración. Ambos incidentes fueron, en esencia, fallas de capacidad. No logramos escalar los componentes críticos antes de que la demanda superara su capacidad. Desde abril, los commits mensuales han crecido de 1400 millones a 2900 millones. Dicho crecimiento explica la presión sobre nuestros sistemas, pero no justifica estas interrupciones.
Comparto enlaces y analisis como este regularmente. Recíbelos por correo.