Empresas
Empleos
  • Sobre nosotros
  • Soluciones
    • Publicación de vacantes
      Publica tu vacante y recibe candidatos calificados en 48h.
    • Evaluación de candidatos
      500+ pruebas técnicas y psicológicas, más anti-fraude.
    • Headhunting
      Búsqueda ejecutiva a la medida de principio a fin.
    • Nómina + EOR
      Dispersión de nómina y EOR en más de 15 países de LATAM.
  • Precios
  • Empleos

0

245
Vistas
Error de AWS EKS + Fargate después de múltiples reinicios de OOMKill

TL;RD

Tengo problemas con un clúster de AWS EKS que ejecuta módulos de aplicaciones sobre nodos sin servidor de Fargate.

Aquí los pasos para reproducirlo:

  • Crear un clúster de EKS
  • Cree un perfil de Fargate para el espacio de nombres default
  • Ejecute dos pods en el espacio de nombres default
  • Haz que el segundo pod haga ping al primero y déjalo ahí.
  • En el primer pod, use toda la memoria disponible
    • Es más fácil cuando tiene Python instalado: python3 -c "bytearray(512000000)"
    • K8s lo OOMKill, y debe reiniciarse automáticamente
  • Repita los pasos anteriores hasta que vea que el ping en el segundo pod deja de funcionar

Este es el manifiesto del pod que estoy usando, pero puede ser cualquier pod:

 apiVersion: v1 kind: Pod metadata: name: root-shell spec: containers: - command: ["sh", "-c"] args: - sleep infinity image: docker.io/library/alpine # Make two files and pick a different name for the second pod name: root-shell resources: limits: memory: 64Mi cpu: 50m

Descripción larga

Mi problema apareció esta semana cuando uno de los pods perdió la configuración de red por completo. Después de un poco de depuración, me di cuenta de que el pod estaba usando más memoria de la que se le había asignado. Esto provocó que k8s OOM lo matara y reiniciara el pod. Después de dos o tres reinicios, el pod perdió la configuración de red. nslookup u otras solicitudes al exterior no funcionaron, mientras que todos los demás pods en el clúster funcionaron bien. Noté que hacer ping al nodo Fargate también dejó de funcionar, por lo que asumo que podría haber algo mal con el reinicio del módulo en el mismo nodo Fargate. Si elimino manualmente el pod, k8s volverá a programar un nuevo pod en un nuevo nodo Fargate donde las cosas funcionan como se supone.

¡cualquier pista es bienvenida!

over 4 years ago · Santiago Trujillo
1 Respuestas
Responde la pregunta

0

No tengo una respuesta (fuera de mi cabeza) para el problema de reinicio (lo investigaré e intentaré recrear el problema). Sin embargo, quería señalar que leemos las "solicitudes" para dimensionar el pod y no los "límites". Ver aquí

over 4 years ago · Santiago Trujillo Denunciar
Responde la pregunta
Encuentra empleos remotos

¡Descubre la nueva forma de encontrar empleo!

Top de empleos
Top categorías de empleo
Empresas
Publicar vacante Precios Comercial
Legal
Términos y condiciones Política de privacidad
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomiéndame algunas ofertas
Necesito ayuda