Quiero buscar este sitio
https://www.film-fish.com/modern-mindless-action
para obtener los ID de IMDB de todas las películas enumeradas allí. El problema es que la página carga todas las películas enumeradas allí justo después de desplazarse hacia abajo. Entonces, un wget simple no funciona.
Incluso si me desplazo hasta la parte inferior de la página y veo el código fuente, no veo la última película de la lista (Hard Kill (2020)).
Entonces, el problema parece ser que el contenido se crea a través de JavaScript.
¿Alguien tiene un consejo sobre cómo lograr eso?
Entonces, el problema parece ser que el contenido se crea a través de un script js. ¿Alguien tiene un consejo sobre cómo lograr eso?
De hecho, la ejecución de código JavaScript está más allá del alcance de GNU Wget. Necesitaría una herramienta de automatización del navegador . Si conoce algo de Node.js o JavaScript, le sugiero que eche un vistazo a PhantomJS Quick Start , Page Automation . Mire el primer ejemplo en el segundo enlace, probablemente debería poder volver a trabajar según sus necesidades, es decir, indique a la página que se desplace hacia abajo usando JavaScript y luego extraiga lo que necesita usando JavaScript.