Actualmente estoy trabajando en un proyecto que raspa las páginas de las tiendas de comestibles en busca de datos dados una consulta de búsqueda (es decir, cereal) y los muestra en una vista de Spinner. Sin embargo, tengo algunas dificultades para encontrar una forma de eliminar los datos de las páginas. Intenté usar Jsoup ya que ese era el consenso en línea, pero eso no es compatible con JavaScript.
El problema radica en que la mayoría, si no todos, los sitios como estos usan el almacenamiento DOM para listas y precios de acciones actualizados. Es por eso que las bibliotecas como Jsoup no funcionarán, ya que devolverán el HTML sin JavaScript. Actualmente tengo un prototipo que muestra la página a través de WebView pero no veo forma de obtener los datos.
Traté de investigar cómo solucionar esto, pero es bastante confuso para ser honesto encontrar una solución elegante, si es que existe.
Si alguien puede ayudarme, o al menos indicarme la dirección correcta, ¡sería muy apreciado! Gracias ^_^
Selenium sería una buena opción para web scraping. https://www.selenium.dev/ Básicamente tiene acceso al DOM del sitio web. En experiencias pasadas, una página web generada dinámicamente puede ser difícil de raspar. RegExp será tu amigo. https://regexone.com/