Empresas
Empregos
  • Sobre nós
  • Soluções
    • Publicação de vagas
      Publique sua vaga e receba candidatos qualificados em 48h.
    • Avaliações de candidatos
      Mais de 500 testes técnicos e psicológicos, mais anti-fraude.
    • Headhunting
      Busca executiva personalizada do início ao fim.
    • Folha de Pagamento + EOR
      Dispersão de folha e EOR em mais de 15 países da LATAM.
  • Preços
  • Empregos

0

243
Visualizações
Error de AWS EKS + Fargate después de múltiples reinicios de OOMKill

TL;RD

Tengo problemas con un clúster de AWS EKS que ejecuta módulos de aplicaciones sobre nodos sin servidor de Fargate.

Aquí los pasos para reproducirlo:

  • Crear un clúster de EKS
  • Cree un perfil de Fargate para el espacio de nombres default
  • Ejecute dos pods en el espacio de nombres default
  • Haz que el segundo pod haga ping al primero y déjalo ahí.
  • En el primer pod, use toda la memoria disponible
    • Es más fácil cuando tiene Python instalado: python3 -c "bytearray(512000000)"
    • K8s lo OOMKill, y debe reiniciarse automáticamente
  • Repita los pasos anteriores hasta que vea que el ping en el segundo pod deja de funcionar

Este es el manifiesto del pod que estoy usando, pero puede ser cualquier pod:

 apiVersion: v1 kind: Pod metadata: name: root-shell spec: containers: - command: ["sh", "-c"] args: - sleep infinity image: docker.io/library/alpine # Make two files and pick a different name for the second pod name: root-shell resources: limits: memory: 64Mi cpu: 50m

Descripción larga

Mi problema apareció esta semana cuando uno de los pods perdió la configuración de red por completo. Después de un poco de depuración, me di cuenta de que el pod estaba usando más memoria de la que se le había asignado. Esto provocó que k8s OOM lo matara y reiniciara el pod. Después de dos o tres reinicios, el pod perdió la configuración de red. nslookup u otras solicitudes al exterior no funcionaron, mientras que todos los demás pods en el clúster funcionaron bien. Noté que hacer ping al nodo Fargate también dejó de funcionar, por lo que asumo que podría haber algo mal con el reinicio del módulo en el mismo nodo Fargate. Si elimino manualmente el pod, k8s volverá a programar un nuevo pod en un nuevo nodo Fargate donde las cosas funcionan como se supone.

¡cualquier pista es bienvenida!

over 4 years ago · Santiago Trujillo
1 Respostas
Responde à pergunta

0

No tengo una respuesta (fuera de mi cabeza) para el problema de reinicio (lo investigaré e intentaré recrear el problema). Sin embargo, quería señalar que leemos las "solicitudes" para dimensionar el pod y no los "límites". Ver aquí

over 4 years ago · Santiago Trujillo Relatório
Responde à pergunta
Encontrar trabalhos remotos

Descubra a nova forma de encontrar um emprego!

melhores empregos
Principais categorias de trabalho
Empresas
Postar vaga Preços Comercial
Jurídico
Termos e Condições Política de privacidade
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Recomende algumas ofertas para mim
Preciso de ajuda