首页 > 资讯 > 后端开发 > Python >Python：黑板课爬虫闯关第三关

435

分享到

Python：黑板课爬虫闯关第三关

爬虫黑板第三关 2023-01-30 22:01:38 435人浏览安东尼

Python 官方文档：入门教程 => 点击学习

摘要

第三关开始才算是进入正题了。输入网址 Http://www.heibanke.com/lesson/crawler_ex02/，直接跳转到了 http://www.heibanke.com/accounts/login/?next=/l

第三关开始才算是进入正题了。

输入网址 Http://www.heibanke.com/lesson/crawler_ex02/，直接跳转到了 http://www.heibanke.com/accounts/login/?next=/lesson/crawler_ex02/，显示如下

仔细看一下这个网址，显然，这是一个登陆网址，next参数应该是登录成功后跳转网页的地址。注册登录后，显示第三关：

　　首先可以肯定的是，必须要先登录，并保持登录状态，否则是爬不过关的。界面提示有两层保护，这应该就是第一层。

　　先注册了一个账号，然后用代码尝试登录，post 用户名密码之后，print 一下响应的 html，发现并不是我看到的第三关的内容，说明登录没有成功。看一下里面有一句话：You are seeing this message because this site requires a CSRF cookie when submitting fORMs. This cookie is required for security reasons, to ensure that your browser is not being hijacked by third parties.

　　简单的说，就是为了防止CSRF攻击（其实就是黑板课设的障碍），需要一个cookie。

　　退出登录，回到登录界面，打开开发者工具（我用的是谷歌浏览器），追踪一下网络请求，发现登录的时候，除了用户名密码，还有一个 csrfmiddlewaretoken 参数，而 csrfmiddlewaretoken 参数来自于 cookie 中的 csrftoken。

先 get 一下登录页面，从返回的 session 中获取 cookie 值中获取 csrftoken 值，连同用户名密码一起 post，print 响应的 html，结果正确。

然后就是跟第二关一样，暴力破解密码了。保险起见，也追踪了下请求，发现机制跟登录是一样的，也需要csrfmiddlewaretoken 参数，一样处理就好了。

这样思路就理清了，每次 post 用户名密码之前，先 get 请求一下，从服务器发给你的 cookie 中获取 csrftoken 的值作为 post 时的 csrfmiddlewaretoken 参数即可。

代码如下：

import re
import requests
import time


def main():
    url_login = 'http://www.heibanke.com/accounts/login/?next=/lesson/crawler_ex02/'
    url = 'http://www.heibanke.com/lesson/crawler_ex02/'
    session = requests.Session()
    # 获取cookie
    session.get(url_login)
    token = session.cookies['csrftoken']
    # 登录
    session.post(url_login, data={'csrfmiddlewaretoken': token, 'username': '', 'passWord': ''})
    for psd in range(30):
        print(f'test password {psd}')
        session.get(url)
        token = session.cookies['csrftoken']
        r = session.post(url, data={'csrfmiddlewaretoken': token, 'username': 'aa', 'password': psd})
        html = r.text
        if '密码错误' not in html:
            m = re.search('(?<=\<h3\>).*?(?=\</h3\>)', html)
            print(m.group())
            m = re.search('(\<).*?href="([^"]*?)".*?(\>下一关\</a\>)', html)
            print(f'下一关 http://www.heibanke.com{m.group(2)}')
            return
        else:
            time.sleep(1)


if __name__ == '__main__':
    main()

您可能感兴趣的文档:

--结束END--

本文标题: Python：黑板课爬虫闯关第三关

本文链接: https://lsjlt.com/news/179615.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

Python：黑板课爬虫闯关第三关

Python：黑板课爬虫闯关第三关

Python：黑板课爬虫闯关第二关

python爬虫scrapy项目详解（关

MySQL第三课函数以及时间相关问题

关于Python网络爬虫框架scrapy

Python爬虫相关工具有哪些

python网络爬虫方向的第三方库有哪些

python网络爬虫方向的第三方库是什么

Python爬虫：通过关键字爬取百度图片

python爬虫+数据可视化项目（关注、

关于Python网络爬虫requests库的介绍

关于Python爬虫种类、法律、轮子的

关于python爬虫应用urllib库作用分析

关于python简单的爬虫操作(requests和etree)

Python Requests爬虫中如何求取关键词页面

Python学习教程：关于Scrapy爬虫项目运行和调试的小技巧-第一讲

关于python中第三方库交叉编译的问题

关于python的第三方库下载与更改方式

Python使用Beautiful Soup包编写爬虫时的一些关键点

100天精通Python丨黑科技篇 —— 24、英雄属性面板分析 ①掌握爬虫技术；②Python数据可视化

python分析数据的方法是什么

如何使用Python实现抽奖小程序

python copy函数的作用是什么

python ffmpeg模块怎么安装和使用

python进程池创建队列的方法是什么

python无法运行文件的原因有哪些

python can't open file报错怎么解决

python keyerror错误怎么解决

python字符串处理与应用的方法有哪些

python全局变量如何定义