Estoy usando el paquete cloudscraper ( PyPI , Github ) para solicitudes web en un sitio que está protegido con Cloudflare .
Soy muy consciente de que hay desafíos que aún no se pueden resolver con este paquete, en particular los "desafíos v2" con recaptchas, etc.
Sin embargo, para mí, el paquete parece no funcionar en absoluto. Cuando hago una solicitud GET con
s.get(my_url)donde s es un objeto de sesión de Cloudscraper, a menudo obtengo una página HTML con este título: "¡Se requiere atención! | Cloudflare" . Este es el desafío estándar de Cloudflare Javascript, que solo verifica si el navegador es compatible con JS .
No sé por qué sucede esto. me asegure de que
Tengo un conjunto de agentes de usuario 'realista', con Chrome configurado como argumento del navegador en el
constructor de rascador de nubes.CloudScraper().
las solicitudes son cronometradas y no demasiado rápidas, espero entre solicitudes
Tengo todos los requisitos del paquete instalados, es decir, además de Cloudcraper, Requests, Requests-Toolbelt y js2py como motor .
No hay una sección de problemas en el repositorio de Github.
La verificación de Javascript es el desafío más simple que Cloudflare puede lanzarnos. Aún así, este paquete, que tiene el único propósito de resolver algunos desafíos de Cloudflare, ni siquiera supera esta simple verificación.
¿Qué estoy pasando por alto? Cloudflare hace que la automatización web sea una pesadilla...
EDITAR: Además, la página de Cloudflare dice "Habilite las cookies y vuelva a cargar la página". aunque normalmente las cookies son aceptadas automáticamente por el RequestsCookieJar de la sesión de solicitud.