分类导航

PHP教程|ASP.NET教程|Java教程|ASP教程|编程技术|正则表达式|C/C++|IOS|C#|Swift|Android|VB|R语言|JavaScript|易语言|vb.net|

服务器之家 - 编程语言 - 编程技术 - 如何用最快的方式发送 10 万个 HTTP 请求

如何用最快的方式发送 10 万个 HTTP 请求

2021-08-26 23:18Python七号somenzz 编程技术

假如有一个文件，里面有 10 万个 url，需要对每个 url 发送 http 请求，并打印请求结果的状态码，如何编写代码尽可能快的完成这些任务呢?

如何用最快的方式发送 10 万个 HTTP 请求

假如有一个文件，里面有 10 万个 url，需要对每个 url 发送 http 请求，并打印请求结果的状态码，如何编写代码尽可能快的完成这些任务呢?

Python 并发编程有很多方法，多线程的标准库 threading，concurrency，协程 asyncio，当然还有 grequests 这种异步库，每一个都可以实现上述需求，下面一一用代码实现一下，本文的代码可以直接运行，给你以后的并发编程作为参考：

队列+多线程

定义一个大小为 400 的队列，然后开启 200 个线程，每个线程都是不断的从队列中获取 url 并访问。

主线程读取文件中的 url 放入队列中，然后等待队列中所有的元素都被接收和处理完毕。代码如下：

from threading import Thread
import sys
from queue import Queue
import requests
concurrent = 200
def doWork():
while True:
url = q.get()
status, url = getStatus(url)
doSomethingWithResult(status, url)
q.task_done()
def getStatus(ourl):
try:
res = requests.get(ourl)
return res.status_code, ourl
except:
return "error", ourl
def doSomethingWithResult(status, url):
print(status, url)
q = Queue(concurrent * 2)
for i in range(concurrent):
t = Thread(target=doWork)
t.daemon = True
t.start()
try:
for url in open("urllist.txt"):
q.put(url.strip())
q.join()
except KeyboardInterrupt:
sys.exit(1)

运行结果如下：

如何用最快的方式发送 10 万个 HTTP 请求

有没有 get 到新技能?

线程池

如果你使用线程池，推荐使用更高级的 concurrent.futures 库：

import concurrent.futures
import requests
out = []
CONNECTIONS = 100
TIMEOUT = 5
urls = []
with open("urllist.txt") as reader:
for url in reader:
urls.append(url.strip())
def load_url(url, timeout):
ans = requests.get(url, timeout=timeout)
return ans.status_code
with concurrent.futures.ThreadPoolExecutor(max_workers=CONNECTIONS) as executor:
future_to_url = (executor.submit(load_url, url, TIMEOUT) for url in urls)
for future in concurrent.futures.as_completed(future_to_url):
try:
data = future.result()
except Exception as exc:
data = str(type(exc))
finally:
out.append(data)
print(data)

协程 + aiohttp

协程也是并发非常常用的工具了：

import asyncio
from aiohttp import ClientSession, ClientConnectorError
async def fetch_html(url: str, session: ClientSession, **kwargs) -> tuple:
try:
resp = await session.request(method="GET", url=url, **kwargs)
except ClientConnectorError:
return (url, 404)
return (url, resp.status)
async def make_requests(urls: set, **kwargs) -> None:
async with ClientSession() as session:
tasks = []
for url in urls:
tasks.append(
fetch_html(url=url, session=session, **kwargs)
)
results = await asyncio.gather(*tasks)
for result in results:
print(f'{result[1]} - {str(result[0])}')
if __name__ == "__main__":
import sys
assert sys.version_info >= (3, 7), "Script requires Python 3.7+."
with open("urllist.txt") as infile:
urls = set(map(str.strip, infile))
asyncio.run(make_requests(urls=urls))

grequests[1]

这是个第三方库，目前有 3.8K 个星，就是 Requests + Gevent[2]，让异步 http 请求变得更加简单。Gevent 的本质还是协程。

使用前：

pip install grequests

使用起来那是相当的简单：

import grequests
urls = []
with open("urllist.txt") as reader:
for url in reader:
urls.append(url.strip())
rs = (grequests.get(u) for u in urls)
for result in grequests.map(rs):
print(result.status_code, result.url)

注意 grequests.map(rs) 是并发执行的。运行结果如下：

如何用最快的方式发送 10 万个 HTTP 请求

也可以加入异常处理：

>>> def exception_handler(request, exception):
... print("Request failed")
>>> reqs = [
... grequests.get('http://httpbin.org/delay/1', timeout=0.001),
... grequests.get('http://fakedomain/'),
... grequests.get('http://httpbin.org/status/500')]
>>> grequests.map(reqs, exception_handler=exception_handler)
Request failed
Request failed
[None, None, <Response [500]>]

最后的话

今天分享了并发 http 请求的几种实现方式，有人说异步(协程)性能比多线程好，其实要分场景看的，没有一种方法适用所有的场景，笔者就曾做过一个实验，也是请求 url，当并发数量超过 500 时，协程明显变慢。

原文链接：https://mp.weixin.qq.com/s/tacsqShnGNFHO3DpuxOMPA

延伸 · 阅读

2022-03-10HTTP缓存协议实战
2022-03-10Node.js之http模块的用法
2022-03-09springboot如何接收application/x-www-form-urlencoded类型的
2022-03-07SpringMVC框架中使用Filter实现请求日志打印方式
2022-03-06解决RestTemplate第一次请求响应速度较慢的问题
2022-03-03如何在CocosCreator中使用http和WebSocket

精彩推荐

编程技术

解决Fiddler在win7系统下的安全证书问题

今天小编就为大家分享一篇关于解决Fiddler在win7系统下的安全证书问题，小编觉得内容挺不错的，现在分享给大家，具有很好的参考价值，需要的朋友一起...

回忆不说话5062020-08-18
编程技术

在地址栏里显示logo的实现方法

在地址栏里显示logo，其实大家可以看一些网站的头部里面，下面的方法讲的更仔细。...

编程技术网4162020-07-11
编程技术

面试官：说说你对堆的理解？如何实现？应用场景？

在计算机科学中，图是一种抽象的数据类型，在图中的数据元素通常称为结点，V是所有顶点的集合，E是所有边的集合。...

JS每日一题9532021-09-29
编程技术

拿高薪的程序员，都学习了什么编程语言？

人的一生从来不是从出生那一刻就注定的，总是会因为我们的选择不断的发生改变，小到一件衣服的色彩，大到未来人生的规划！选错一件衣服可以重来，...

职坐标在线11932021-04-08
编程技术

如何成为专业的恶意软件研究员

当今社会，不管任何一门技术，或者你从事任何一种职业，都需要掌握相关的知识，现代的技术其实就是以前称的“手艺”，大多数的手艺的学习和入门其...

安全分析与研究13092021-02-21
编程技术

TIOBE4月编程语言排行榜出炉！涨幅最大的语言竟然是它？

TIOBE 近日发布的4 月编程语言排行榜。前十榜单中，C、Java、Python 仍分别占据前三位。涨幅最大的语言是Python。...

QIKU6672021-04-09
编程技术

IT工程师都需要掌握的容器技术之DockerCompose

今天我们继续来学习Docker技术之Docker Compose，本篇文章将是我们容器技术系列的最后一篇文章，读过我们容器技术全系列文章的小伙伴肯定有疑问，整个系...

今日头条6242020-11-25
编程技术

Python“王者”地位不保！Julia和Swift后来居上

在过去的十年里，Python 一直统治着数据科学和机器学习，但是 Julia 和 Swift 后来居上，正准备超越Python。...

今日头条4822020-09-22