Esta página tiene una URL https://www.example.com
<html> <body> <button id="button1" onclick=func1()> <button id="button2" onclick=func2()> </body> <script> function func1(){ open("/doubt?s=AAAB_BCCCDD"); } function func2(){ open("/doubt?s=AABB_CCDDEE"); } //something like that, it is working .... </script> </html>AAAB_BCCCDD y AABB_CCDDEE - ambos son tokens...
quiero obtener el primer token en la página con python
mi codigo python -
import requests r = requests.get("https://www.example.com") s = r.text if "/doubt?s=" in s: # After this i can' understand anything ... # i want to get the first token here as a variablepor favor, ayúdame ....
Por lo general, después de obtener el contenido de texto sin procesar del sitio web, primero analizaría el HTML usando una biblioteca como BeautifulSoup . Creará un árbol de modelo de objeto de documento (DOM), que luego puede consultar para los elementos que necesita.
Sin embargo, esto no leerá ni interpretará el código JavaScript. Para su problema, puede usar expresiones regulares para extraer la información necesaria del texto sin formato.
Ejemplo:
import re import requests r = requests.get("https://www.example.com") s = r.text pattern = re.compile('/doubt\\?s=(?P<token>\\w+)') matches = pattern.findall(s) if len(matches) > 0: print(matches[0])