Business
Jobs
  • About Us
  • Solutions
    • Job Postings
      Post your job and receive qualified candidates in 48h.
    • Candidate Assessments
      500+ technical and psychological tests, plus anti-fraud.
    • Headhunting
      Tailor-made executive search from start to finish.
    • Payroll + EOR
      Payroll dispersal and EOR across 15+ LATAM countries.
  • Pricing
  • Jobs

0

261
Views
Error de AWS EKS + Fargate después de múltiples reinicios de OOMKill

TL;RD

Tengo problemas con un clúster de AWS EKS que ejecuta módulos de aplicaciones sobre nodos sin servidor de Fargate.

Aquí los pasos para reproducirlo:

  • Crear un clúster de EKS
  • Cree un perfil de Fargate para el espacio de nombres default
  • Ejecute dos pods en el espacio de nombres default
  • Haz que el segundo pod haga ping al primero y déjalo ahí.
  • En el primer pod, use toda la memoria disponible
    • Es más fácil cuando tiene Python instalado: python3 -c "bytearray(512000000)"
    • K8s lo OOMKill, y debe reiniciarse automáticamente
  • Repita los pasos anteriores hasta que vea que el ping en el segundo pod deja de funcionar

Este es el manifiesto del pod que estoy usando, pero puede ser cualquier pod:

 apiVersion: v1 kind: Pod metadata: name: root-shell spec: containers: - command: ["sh", "-c"] args: - sleep infinity image: docker.io/library/alpine # Make two files and pick a different name for the second pod name: root-shell resources: limits: memory: 64Mi cpu: 50m

Descripción larga

Mi problema apareció esta semana cuando uno de los pods perdió la configuración de red por completo. Después de un poco de depuración, me di cuenta de que el pod estaba usando más memoria de la que se le había asignado. Esto provocó que k8s OOM lo matara y reiniciara el pod. Después de dos o tres reinicios, el pod perdió la configuración de red. nslookup u otras solicitudes al exterior no funcionaron, mientras que todos los demás pods en el clúster funcionaron bien. Noté que hacer ping al nodo Fargate también dejó de funcionar, por lo que asumo que podría haber algo mal con el reinicio del módulo en el mismo nodo Fargate. Si elimino manualmente el pod, k8s volverá a programar un nuevo pod en un nuevo nodo Fargate donde las cosas funcionan como se supone.

¡cualquier pista es bienvenida!

over 4 years ago · Santiago Trujillo
1 answers
Answer question

0

No tengo una respuesta (fuera de mi cabeza) para el problema de reinicio (lo investigaré e intentaré recrear el problema). Sin embargo, quería señalar que leemos las "solicitudes" para dimensionar el pod y no los "límites". Ver aquí

over 4 years ago · Santiago Trujillo Report
Answer question
Find remote jobs

Discover the new way to find a job!

Top jobs
Top job categories
Business
Post vacancy Pricing Sales
Legal
Terms and conditions Privacy policy
© 2026 PeakU Inc. All Rights Reserved.
Andres GPT
Show me some job opportunities
There's an error!