Python爬虫
Python爬虫
第一个小测试,认识爬虫
1 | # 爬虫:通过编写程序来获取到互联网上的资源 |
Web请求剖析
1 | # 1. 服务器渲染:在服务器那边直接把数据和html整合在一起,同意返回给浏览器 |
HTTP协议
- User-Agent:请求载体的身份标识用啥发送的请求
- Referer防盗捱(这次请求是从哪个页面来的?反爬会用到3. cookie:本地字符串数据信息(用户登录信息,反爬的token)
- 响应头中一些重要的内容:
- cockie:本地字符串数据信忌(用户登录信忌,反贬的token
- 各种神奇的莫名其妙的字符串{这个需要经验了.一般都是token字样.防止各种攻击和反吗)
- 请求方式:
- get
- post
requests 模块
入门
1 | # 安装requests |
1 | import requests |
抓取豆瓣,某些数据
1 | import requests |
数据解析
- re解析
- bs4解析
- xpath解析
re模块
1 | # re模块 |
案例
豆瓣top250抓取信息
1 | # 手忍豆瓣排行榜 |
bs4解析 - HTML编码
- 安装
- pip install bs4 -i
搞搞菜价 – 北京新发地
1 | # bs4 |
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来自 Ming OR Fang KINESPHERE!
评论










