Tengo un servicio aws ecs con 2 tareas ejecutándose en t2.xlarge. El servicio está detrás del balanceador de carga de la aplicación.
El servicio contiene una API http implementada con gunicorn + uvicorn + fastapi (4 trabajadores) que toma una imagen de tamaño 112 * 112 * 3 como entrada y usa el modelo tf lite para predecir. Este procesamiento tarda menos de 200 ms, mientras que el tiempo de respuesta completo de la API es de más de 12 segundos. ¿Alguien puede sugerir cómo se puede mejorar este tiempo?