Estoy consultando datos de mongodb en fragmentos que tienen más de 100 millones de registros en total. Y luego desea procesar esos registros dentro de una función.
mi consulta
cursor = collection.find({'facial_task':False}).sort("_id", -1).skip(1000000).limit(10000) Cuando itero sobre el cursor , toma demasiado tiempo y se atasca mucho, incluso limito la cantidad de resultados a 10. Incluso recuperé los resultados usando el tamaño del lote pero al procesar el bucle sobre él; Eso toma demasiado tiempo.
Mi bucle es así
for dd in cursor: ab = threading.Thread(target=insert_func, args=(dd,)) ab.start() main_threads.append(ab) if len(main_threads) >= 5000: print("****Joining Main Thread***") for ii in main_threads: ii.join() main_threads = []Si la desaceleración ocurre desde la primera iteración, entonces debe tener que ver con el propio cursor.
El cursor Mongodb no es como una lista 'chachada' de toda la colección; consulta el db un fragmento a la vez a medida que itera sobre él. Puede intentar convertir ese cursor en una lista y ver si la iteración muestra una aceleración significativa.