Actualmente estoy ejecutando un proceso en un servidor ec2 que necesita ejecutarse de manera consistente en segundo plano. Intenté iniciar sesión en el servidor y sigo recibiendo un mensaje de error de red: se agotó el tiempo de conexión. Cuando reviso la instancia, recibo el siguiente mensaje:
La verificación de accesibilidad de la instancia falló el 22 de febrero de 2020 a las 11:15:00 p. m. UTC-5 (hace 1 día, 13 horas y 34 minutos)
Para solucionar el problema, intenté reiniciar el servidor, pero eso no solucionó el problema. ¿Cómo corrijo esto y también evito que vuelva a suceder?
Una falla en la verificación del estado de la instancia indica un problema con la instancia, como:
Puede consultar lo siguiente para solucionar problemas https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/TroubleshootingInstancesStopping.html
Para futuros informes y recuperación automática, puede crear una alarma de CloudWatch
para la segunda parte
No puede hacer nada para detener su ocurrencia, pero para el tiempo de actividad y la disponibilidad SÍ, puede crear otro EC2 y agregar ALB en la parte superior de ambas instancias que verifica el estado de la instancia, para que sus usuarios/clientes/servicio puedan estar disponibles durante tiempo de recuperación (desde segunda instancia). Puede aumentar el número de instancias tanto como desee para obtener una alta disponibilidad (obviamente, implica un costo)
he pasado por el mismo problema
y luego, una vez que miró el tablero de EC2, pudo ver que algo no estaba bien con él
pero para mí reiniciar
y esperando 2-3 minutos lo resolvió y luego pude SSH a la instancia sin problemas
Si eso se convierte en un problema recurrente, seguiré el consejo de Jeremy Thompson.
... coloque los EC2 en un grupo de Auto Scaling. El ALB realiza una verificación de estado y falla, ya no enrutará el tráfico a ese EC2, luego el ASG enviará una verificación de estado y sacará de rotación al servidor que no responde.