Estoy tratando de extraer el enlace de descarga del plan de estudios de este sitio web: https://www.simplilearn.com/big-data-and-analytics/python-for-data-science-training
El enlace no está disponible en la fuente de la página y no pude ver nada en la pestaña de red. Pero si hacemos clic en el enlace, el enlace se abre en una pestaña diferente.
Lo sé, es posible extraer usando selenio, pero ¿podemos extraer sin selenio?
el enlace está oculto con '#' en la fuente de la página.
Así que no estoy seguro de cómo extraer los enlaces. Sé que no podré extraer usando xpath o css. ¿Alguien me puede ayudar?
En este caso particular,
El enlace URL está codificado en base64 en el div con id = "DownloadSyllabus2", en su atributo data-url (justo encima del a href que está mencionando):
aHR0cHM6Ly93d3cuc2ltcGxpbGVhcm4uY29tL2ljZTkvcGRmcy9hZ2VuZGEvb25saW5lL0RhdGElMjBTY2llbmNlJTIwd2l0aCUyMFB5dGhvbi5wZGY=
Debe decodificarlo usando base64 y obtendrá la URL deseada: https://www.simplilearn.com/ice9/pdfs/agenda/online/Data%20Science%20with%20Python.pdf
Esta no es una solución mágica para todos los casos como este, pero funciona para este sitio web y es la mejor solución aquí.
Por lo tanto, la extracción de datos no siempre se trata de las soluciones, sino de poder aplicar ingeniería inversa a la lógica del sitio web.
Feliz raspado :)