IP代理中间件和user-agent中间件的编写

发布时间:2020-08-03 15:19:13 作者:NewFate1
来源:网络 阅读:280

在制作爬虫的时候需要对我们的爬虫进行伪装,有两种伪装的方式:第一种是通过代理IP,第二种是通过修改user-agent。

一、代理IP

    IP代理中间件和user-agent中间件的编写

    IP代理中间件和user-agent中间件的编写

    IP代理中间件和user-agent中间件的编写

二、user-agent

    import random
    # user agent 列表
    USER_AGENT_LIST = [
        'MSIE (MSIE 6.0; X11; Linux; i686) Opera 7.23',
        'Opera/9.20 (Macintosh; Intel Mac OS X; U; en)',
        'Opera/9.0 (Macintosh; PPC Mac OS X; U; en)',
        'iTunes/9.0.3 (Macintosh; U; Intel Mac OS X 10_6_2; en-ca)',
        'Mozilla/4.76 [en_jp] (X11; U; SunOS 5.8 sun4u)',
        'iTunes/4.2 (Macintosh; U; PPC Mac OS X 10.2)',
        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:5.0) Gecko/20100101 Firefox/5.0',
        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.6; rv:9.0) Gecko/20100101 Firefox/9.0',
        'Mozilla/5.0 (Macintosh; Intel Mac OS X 10.8; rv:16.0) Gecko/20120813 Firefox/16.0',
        'Mozilla/4.77 [en] (X11; I; IRIX;64 6.5 IP30)',
        'Mozilla/4.8 [en] (X11; U; SunOS; 5.7 sun4u)'
       ]
    # 随机生成user agent
    USER_AGENT = random.choice(USER_AGENT_LIST)

--------------------- 


    IP代理中间件和user-agent中间件的编写

    IP代理中间件和user-agent中间件的编写

    IP代理中间件和user-agent中间件的编写

    注意事项:

        1、中间件定义完要在settings文件内启用

        2、爬虫文件名和爬虫名称不能相同,spider目录内不能存在相同爬虫名称的项目文件

        3、做一个文明守法的好网民,不要爬取公民的隐私数据,不要给对方系统带来不必要的麻烦。


推荐阅读:
  1. Django中间件
  2. express中间件和路由教程

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

爬虫框架 scrapy age

上一篇:从零开始PHP之HTML(三)

下一篇:python中urllib2的使用方法

相关阅读

您好,登录后才能下订单哦!

密码登录
登录注册
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》