python爬虫解决网页重定向问题

凌云客

2019-06-28

笔者编写的搜索引擎爬虫在爬取页面时遇到了网页被重定向的情况，所谓重定向(Redirect)就是通过各种方法
（本文提到的为3种）将各种网络请求重新转到其它位置（URL）。
每个网站主页是网站资源的入口，当重定向发生在网站主页时，如果不能正确处理就很有可能会错失这整个网站的内容。

以下列出遇到的3种重定向情况（使用python2.7+requests编写爬虫）：

1.服务器端重定向

在服务器端完成，一般来说爬虫可以自适应，是不需要特别处理的，如响应代码301（永久重定向）、302（暂时重定向）等。具体来说，可以通过requests请求得到的response对象中的url、status_code两个属性来判断。当status_code为301、302或其他代表重定向的代码时，表示原请求被重定向；当response对象的url属性与发送请求时的链接不一致时，也说明了原请求被重定向且已经自动处理。

2.meta refresh

即网页中的<meta>标签声明了网页重定向的链接，这种重定向由浏览器完成，需要编写代码进行处理。例如，某一重定向如下面的html代码第三行中的注释所示，浏览器能够自动跳转，但爬虫只能得到跳转前的页面，不能自动跳转。

<html>
<head>
<meta http-equiv="refresh" content="0.1;url=http://www.redirectedtoxxx.com/"><!--本网页会在0.1秒内refresh为url所指的网页-->
</head>
</html>

解决办法是通过得到跳转前的页面源码，从中提取出重定向url信息（上述代码第三行中的url属性值）。
具体的操作：使用xpath('//meta[@http-equiv="refresh" and @content]/@content')提取出content的值或者使用正则表达式提取出重定向的url值。

3.js 重定向

通过JavaScript代码形式进行重定向。如下面JavaScript代码

<script language=javascript>window.location.href='http://www.redirectedtoxxx.com'</script>

对于这种方式的跳转，由于可以实现该功能的JavaScript语句有多种形式，不能再使用正则表达式提取url，只能考虑加载JavaScript代码来进行解决，例如使用selenium 无头浏览器phantomJS 模拟浏览器操作
关于phantomJS的一些简单操作语法可以在我这篇phantomJS中看下

重定向 python爬虫 javascript url phantomjs python url重定向

安科网

python爬虫解决网页重定向问题

凌云客

1.服务器端重定向

2.meta refresh

3.js 重定向

凌云客

相关推荐

小程序定制开发WEB服务器-设置网站301全站跳转(域名301重定向)

Nginx的location匹配规则-根据url 路径重定向到不同的IP

Flask 重定向问题：若没有对URL进行安全验证

6张图带你学懂 Kubernetes Ingress

CentOS 8 Apache 安装后 SSL 重定向提示证书错误

Linux后台执行命令：&与nohup的用法

Web项目的WEB-INF目录使用说明以及重定向与转发

linux重定向及nohup不输出的方法

Linux重定向用法详解

shell其他

第十一节：IdentityServer4授权码模式介绍和代码实操演练

shell脚本在后台运行以及日志重定向输出

【Windows学习】解决python无法访问win64系统drivers目录重定向文件问题

django 之redirect()函数全解

linux 重定向

Linux nohup命令原理及实例解析

Linux就该这么学丨必备Linux命令（二）

阿里P8架构师谈：数据库、JVM、缓存、SQL等性能调优方法和原则

把GCC的编译信息重定向到一个文件

测试公开课资料系列01--Fiddler之AutoResponse在线调试利器

凌云客