Python爬虫总结——常见的报错、问题及解决方案

WoLykos 2019-12-25 原文

在爬虫开发时，我们时常会遇到各种BUG各种问题，下面是我初步汇总的一些报错和解决方案。
在以后的学习中，如果遇到其他问题，我也会在这里进行更新。
各位如有什么补充，欢迎评论区留言~~~

问题：

IP被封，或者因访问频率太高被拦截？？？

解决方案之一：

使用代理IP即可。

问题：

正确使用XPath之后并没有输出？？？

解决方案之一：

XPath只能提取未注释的代码，改用正则表达式即可。

问题：

容易被反爬搞死？？？

解决方案之一：

headers中都要带上User-Agent，而Cookie能不带则不带。

报错：

在这里插入图片描述
UTF-8不能处理字节？？？

解决方案之一：

在headers中加入Cookie即可输出正常的HTML。

报错：

在这里插入图片描述
‘ gbk ’不能处理‘ \xa0 ’ ？？？

解决方案之一：

with open('%s.html' % title, 'w', encoding='utf-8') as f:
    f.write(rep)

问题：

在这里插入图片描述
输出结果是字节类型，json对象无法正常显示？？？

解决方案之一：

使用json.loads方法即可。

问题：

url = 'https://tieba.baidu.com/f?kw=%E8%8B%B1%E9%9B%84%E8%81%94%E7%9B%9F&ie=utf-8&pn=0'

网址复制到py文件中，却变成了“乱码”？？？

解决方案之一：

调用urllib.parse.unquote进行URL解码即可。

问题：

在这里插入图片描述
URL地址不规范？？？

解决方案之一：

分析URL时，我们一般从第二页开始分析，而不是第一页。

问题：

不想Cookie中携带自身账号内容？？？

解决方案之一：

利用浏览器的无痕窗口功能，进入网页再取Cookie即可。

报错：

解决方案之一：

报错：

解决方案之一：

未完待续哦~~~~

为我心爱的女孩~~

本文链接：https://www.cnblogs.com/WoLykos/p/12095277.html

早上用百度搜了一下“颜色识别”，多少有了一点大致的概念，还是老办法，动手做，多实验，往前走，还请各位老师多多指 […]...

表单验证

//HTML部分，随意写个输入框<div id="div1"> <input type="u […]...

XML详解

XML 文档头部一个标准的XML 文档由两大部分组成：文档头部（序言）和文档主体（文档元素）。 XML 文档 […]...

KDtree浅谈

KDtree浅谈 1.对KDtree的理解　　首先要知道$KDtree$的用处，$KDtree$是用来进行多 […]...

数据挖掘_多线程抓取

在这一篇文章中，我们主要来介绍多线程抓取数据。多线程是以并发的方式执行的，在这里要注意，Python的多 […]...

记一次项目中lambda函数的应用

记一次项目中lambda函数的应用 lambda函数也叫做匿名函数，它允许我们快速定义，并且让代码更简洁 de […]...

LinearLayout和RelativeLayout

LinearLayout android:orientation注意：当 android:orientation="vertical" 时，只有水平方向的设置才起作用，垂直方向的设置不起作用。即：left，right，center...

【技术贴】虚拟机 VMware win7 win8网卡驱动下载解决虚拟机不识别网卡没有本地连接

解决虚拟机VMware7.0下虚拟win7 win8找不到网卡，不能识别网卡。没有本地连接。（本篇文章只适合虚 […]...

Python爬虫总结——常见的报错、问题及解决方案

问题：

解决方案之一：

问题：

解决方案之一：

问题：

解决方案之一：

报错：

解决方案之一：

报错：

解决方案之一：

问题：

解决方案之一：

问题：

解决方案之一：

问题：

解决方案之一：

问题：

解决方案之一：

报错：

解决方案之一：

报错：

解决方案之一：

Python爬虫总结——常见的报错、问题及解决方案的更多相关文章

随机推荐

热门专题

目录导航