Estamos ejecutando Airflow 1.10.12, con KubernetesExecutor y KubernetesPodOperator. En los últimos días, hemos visto que las tareas se atascan en el estado de cola durante mucho tiempo (para ser honesto, a menos que reiniciemos el programador, permanecerá atascado en ese estado), las tareas nuevas del mismo DAG se programan correctamente .
Lo único que ayuda es borrarlo manualmente o reiniciar el servicio del programador
Por lo general, vemos que sucede cuando ejecutamos nuestras pruebas E2E, lo que genera ~20 ejecuciones de DAG para cada uno de nuestros 3 DAG, debido al paralelismo limitado, algunos estarán en cola (lo cual está bien para nosotros)
Estos son nuestros parámetros de paralelismo en airflow.cfg
parallelism = 32 dag_concurrency = 16 max_active_runs_per_dag = 16 2 de nuestros DAG, sobrescriba the max_active_runs y configúrelo en 10
¿Alguna idea de qué podría estar causándolo?