Scrapy 爬虫框架四 —— 动态网页及其 Splash 渲染

动态页面:HTML文档中的部分是由客户端运行JS脚本生成的,即服务器生成部分HTML文档内容,其余的再由客户端生成

静态页面:整个HTML文档是在服务器端生成的,即服务器生成好了,再发送给我们客户端

scrapy爬虫框架没有提供页面 js 渲染服务,所以我们获取不到信息,所以我们需要一个渲染引擎来为我们提供渲染服务—这就是Splash渲染引擎(大侠出场了)

1、Splash渲染引擎简介

Splash是为Scrapy爬虫框架提供渲染javascript代码的引擎,它有如下功能:

(1)为用户返回渲染好的html页面 (2)并发渲染多个页面

(3)关闭图片加载,加速渲染 (4)执行用户自定义的js代码

(5)执行用户自定义的lua脚步,类似于无界面浏览器phantomjs

2、Splash渲染引擎工作原理:(类比例子如下)

假定有三个小伙伴:(1–懒惰的我 , 2 –提供外卖服务的小哥,3—本人喜欢吃的家味道餐饮点)

今天正好天气不好,1呆在宿舍睡了一早上起来,发现肚子饿了,它就想

Original: https://blog.csdn.net/smilejiasmile/article/details/120045315
Author: smilejiasmile
Title: Scrapy 爬虫框架四 —— 动态网页及其 Splash 渲染

原创文章受到原创版权保护。转载请注明出处:https://www.johngo689.com/790279/

转载文章受原作者版权保护。转载请注明原作者出处!

(0)

大家都在看

亲爱的 Coder【最近整理,可免费获取】👉 最新必读书单  | 👏 面试题下载  | 🌎 免费的AI知识星球