爬虫(一)：爬虫简介

最新推荐文章于 2025-07-17 21:20:52 发布

王二空间

最新推荐文章于 2025-07-17 21:20:52 发布

阅读量793

点赞数 1

CC 4.0 BY-SA版权

分类专栏： Python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_38140936/article/details/103551859

本文介绍了爬虫的基本概念，包括爬虫是什么、工作原理、发送请求、接收响应以及解析网页。详细讲解了请求报文的组成部分，如请求行、请求头、空行和请求体，并阐述了响应报文的结构。最后讨论了如何提取链接和资源，为初学者提供了爬虫入门的知识框架。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

1. 爬虫简介

1.1 爬虫是什么？

什么是爬虫，以下是百度百科上的解析：

很多人都将互联网比喻成一张非常大的网，将世界连接起来。如果说互联网是一张网，那么爬虫就像在网上爬的小虫子，通过网页的链接地址来寻找网页，通过特定的搜索算法来确定路线，通常从网站的某一个页面开始，读取该网页的内容，找到该网页中的其他链接地址，然后通过这些链接地址寻找下一个网页，就这样一直循环下去，直到将该网站的所有网页全部抓取为止。

1.2 爬虫原理

发起请求：
使用http库向目标站点发起请求，即发送一个Request
Request包含：请求头、请求体等

接收响应：
如果服务器能正常响应，则会得到一个Response
Response包含：html，json，图片，视频等

解析网页：
解析html数据：正则表达式，第三方解析库如Beautifulsoup，pyquery等
解析json数据：json模块
解析二进制数据:以b的方式写入文件

存储资源：
数据库

最低0.47元/天解锁文章

200万优质内容无限畅学

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。