Bootstrap

使用selenium爬取腾讯热点新闻

     在爬取之前我一直都陷入了一个误区,我认为只用selenium就可以实现这个工作,事实上它确实是可以,只不过selenium是自动化测试工具,可以驱动浏览器(有界面,无界面)来执行特定的操作,可以模仿人的点击下拉等各种基本操作,对于js加密的信息的抓取非常有效。它更适用于动态和交互。所以在提取信息得时候结合bs4或者xpath更方便一点。经过大佬指点,这里强推xpath.
     ![在这里插入图片描述](https://img-blog.csdnimg.cn/20200427094746986.png)

打开网址会发现页面默认加载10条信息,随着页面向下滚动,页面是自动加载的。
这里借用某大佬的思想:

  1. 调用 window.srollBy’执行页面滚动。
  2. 利用random对单次滚动距离、滚动时间进行选取,模拟人工操作。
import random
for i in range(20):
    pixel = random.randint(800,1000)
    driver.execute_script(f'window.scrollBy(0,{pixel})')
    time.sleep(random.random
;