Python3使用requests包抓取并保存网页源码的方法_Python

Python3使用requests包抓取并保存网页源码的方法

2020-08-16 12:22小谈博客 Python

这篇文章主要介绍了Python3使用requests包抓取并保存网页源码的方法,实例分析了Python3环境下requests模块的相关使用技巧,需要的朋友可以参考下

本文实例讲述了Python3使用requests包抓取并保存网页源码的方法。分享给大家供大家参考，具体如下：

使用Python 3的requests模块抓取网页源码并保存到文件示例：

				?

									import requests

									html = requests.get("http://www.baidu.com")

									with open('test.txt','w',encoding='utf-8') as f:

									 f.write(html.text)

这是一个基本的文件保存操作，但这里有几个值得注意的问题：

1.安装requests包，命令行输入pip install requests即可自动安装。很多人推荐使用requests，自带的urllib.request也可以抓取网页源码

2.open方法encoding参数设为utf-8，否则保存的文件会出现乱码。

3.如果直接在cmd中输出抓取的内容，会提示各种编码错误，所以保存到文件查看。

4.with open方法是更好的写法，可以自动操作完毕后释放资源。

另一个例子：

				?

									import requests

									ff = open('testt.txt','w',encoding='utf-8')

									with open('test.txt',encoding="utf-8") as f:

									 for line in f:

									 ff.write(line)

									ff.close()