Tengo un web scraper de Python usando el módulo HTMLParser. El sitio web que desecha es http://consulta.siiau.udg.mx/wco/sspseca.consulta_oferta?ciclop=202120&cup=D&mostrarp=100000&ordenp=2
Ahora necesito hacer lo mismo, pero basado en el navegador web usando javascript, así que intenté obtener el HTML sin formato usando axios pero sigo recibiendo 'El acceso a XMLHttpRequest ha sido bloqueado por la política CORS' .
Lo que he probado es
axios.post('http://consulta.siiau.udg.mx/wco/sspseca.consulta_oferta', { ciclop: '202120', cup: 'D', mostrarp: 10000, ordennp: 2, }) .then((response) => { console.log(response) })Y
axios.get('http://consulta.siiau.udg.mx/wco/sspseca.consulta_oferta?ciclop=202120&cup=D&mostrarp=100000&ordenp=2', { crossdomain: true } ) .then((response) => { console.log(response) })Soy consciente de que en javascript normalmente usan un navegador sin cabeza como el que está dentro de Puppeteer, pero como este proyecto es un sitio web, no puedo usar los módulos de Node.js.
En este momento, la solución que implementé es tener un servidor que ejecute una Flask API que maneje la obtención de html y luego la envíe de vuelta al cliente para su procesamiento, pero sería un alivio para el rendimiento de mi servidor si el cliente pudiera hacer esto por su parte. .
En resumen, no puede usar la API de búsqueda o XMLHTTPRequest para acceder a recursos que no están permitidos por la política de origen cruzado del navegador.
Por razones de seguridad, los navegadores restringen las solicitudes HTTP iniciadas desde scripts. Una aplicación web solo puede solicitar recursos del mismo origen desde el que se cargó la aplicación, a menos que la respuesta de otros orígenes incluya los encabezados CORS correctos.
Puede usar un navegador sin cabeza (titiritero) para acceder a una página web, por ejemplo usando:
await page.goto('https://example.com'); Esto es equivalente a poner http://example.com en la barra del navegador y presionar ENTER. Todos los scripts de esa página están sujetos a las mismas restricciones de origen cruzado que antes. Sin embargo, decirle al navegador que visite http://example.com no es una solicitud de origen cruzado en sí misma.