Python爬虫之request +re

Wu13241454771 2020-06-04 原文

什么是爬虫？

它是指向网站发起请求，获取资源后分析并提取有用数据的程序；

爬虫的步骤：

1、发起请求

使用http库向目标站点发起请求，即发送一个Request

Request包含：请求头、请求体等

2、获取响应内容

如果服务器能正常响应，则会得到一个Response

Response包含：html，json，图片，视频等

3、解析内容

解析html数据：正则表达式（RE模块），第三方解析库如Beautifulsoup，pyquery等

解析json数据：json模块

解析二进制数据：以wb的方式写入文件

4、保存数据

数据库（MySQL，Mongdb、Redis）文件

废话不多说，直接上代码截图(本文以抓取猫眼网站电影数据为示例)：

以下是执行后输出的结果：

说明：代码截图中有详细的注释信息，所以不在文中再来说明代码中的用法。

备注：我的个人公众号已正式开通，致力于测试技术的分享，包含：大数据测试、功能测试，测试开发，API接口自动化、测试运维、UI自动化测试等，微信搜索公众号：“无量测试之道”，或扫描下方二维码：

添加关注，一起共同成长吧。

本文链接：https://www.cnblogs.com/Wu13241454771/p/13044071.html

一、什么是爬虫？它是指向网站发起请求，获取资源后分析并提取有用数据的程序；爬虫的步骤： 1、发起请求使用h […]...

摘要：深度理解JS事件循环！！！原文：JavaScript是如何工作的:事件循环和异步编程的崛起+ 5种使 […]...

JDK8 Stream 是一个支持泛型和函数式数据流，使用起来非常强大方便。最近在学习 go 语言我就用 go […]...

一个完整的jmeter APP登录接口测试实例本人主要做一个知识的归类与记录，如是转载类文章，居首都会备注原 […]...

使用谷歌浏览器截图整个网页一、方法一二、方法二一、方法一 1、首先打开想要截图的网页，按键盘快捷键F12 […]...

绪　　最近想要整理自己代码封装成库，也十分想把自己的设计思路贴出来让大家指正，奈何时间真的不随人意。　　想 […]...

1、上线后，bug 一大堆的时候 2、敲代码，调 bug 的你 3、管理员给了我 root 访问权后 4、此刻 […]...

线性表线性表可以看作是一种线性结构（可以分为顺序线性结构，离散线性结构） 1. 线性表的种类：顺序表元素 […]...

一、REST 在互联网中，我们会通过请求url来对网络上的资源做增删改查等动作，这里的请求包含两部分：动词，主 […]...

Python爬虫之request +re的更多相关文章