当前位置:首页 > 技术 > 正文内容

使用PyCurl分析HTTP请求生命周期与各阶段耗时

访客 技术 2026年7月20日 3

环境准备与依赖安装

在Python生态中,pycurl 是对底层 libcurl 库的封装,能够提供极其详尽的网络请求底层指标。首先需要安装该库:

pip install pycurl

对于 macOS 用户,由于系统默认的 SSL 后端可能与 libcurl 编译时的配置冲突,通常需要显式指定 OpenSSL 路径以避免 ImportError: pycurl: libcurl link-time ssl backends... 异常:

export PYCURL_SSL_LIBRARY=openssl
export LDFLAGS="-L$(brew --prefix openssl)/lib"
export CPPFLAGS="-I$(brew --prefix openssl)/include"
pip install --no-cache-dir --compile pycurl

获取基础请求耗时指标

通过配置 pycurl.Curl 实例并调用 getinfo 方法,我们可以轻松提取请求生命周期中的关键时间节点。以下代码展示了如何捕获这些基础数据:

import pycurl
from io import BytesIO

def analyze_request_timings(target_url: str):
    buffer = BytesIO()
    client = pycurl.Curl()
    
    # 配置请求参数
    client.setopt(pycurl.URL, target_url)
    client.setopt(pycurl.WRITEDATA, buffer)
    client.setopt(pycurl.NOPROGRESS, 1)
    
    # 执行请求
    client.perform()
    
    # 提取并打印耗时数据(单位:秒)
    metrics = {
        "HTTP Status": client.getinfo(pycurl.RESPONSE_CODE),
        "DNS Resolution": client.getinfo(pycurl.NAMELOOKUP_TIME),
        "TCP Connection": client.getinfo(pycurl.CONNECT_TIME),
        "Pre-Transfer": client.getinfo(pycurl.PRETRANSFER_TIME),
        "Time to First Byte (TTFB)": client.getinfo(pycurl.STARTTRANSFER_TIME),
        "Total Duration": client.getinfo(pycurl.TOTAL_TIME),
        "Redirect Duration": client.getinfo(pycurl.REDIRECT_TIME)
    }
    
    client.close()
    
    for key, value in metrics.items():
        print(f"{key:<25}: {value:.6f}")

if __name__ == "__main__":
    analyze_request_timings("https://httpbin.org/get")

构建可视化的请求时间线

为了更直观地观察网络请求的性能瓶颈,我们可以模仿 httpstat 工具的输出格式,将各个阶段的耗时转化为可视化的文本图表。下面的实现将响应体保存至本地,并以毫秒为单位计算和渲染各阶段耗时:

import os
import pycurl
import math

def render_http_timeline(url: str, save_path: str = "response_body.bin"):
    curl_session = pycurl.Curl()
    
    # 设置响应体和响应头的处理回调
    with open(save_path, 'wb') as f:
        curl_session.setopt(pycurl.URL, url)
        curl_session.setopt(pycurl.WRITEDATA, f)
        curl_session.setopt(pycurl.HEADERFUNCTION, lambda x: print(x.decode('utf-8', errors='ignore').strip()))
        
        curl_session.perform()
        
    print(f"\n[Info] Response body saved to: {os.path.abspath(save_path)}\n")
    
    # 获取时间数据并转换为毫秒
    t_dns = curl_session.getinfo(pycurl.NAMELOOKUP_TIME) * 1000
    t_conn = curl_session.getinfo(pycurl.CONNECT_TIME) * 1000
    t_pre = curl_session.getinfo(pycurl.PRETRANSFER_TIME) * 1000
    t_ttfb = curl_session.getinfo(pycurl.STARTTRANSFER_TIME) * 1000
    t_total = curl_session.getinfo(pycurl.TOTAL_TIME) * 1000
    
    curl_session.close()
    
    # 计算各阶段独立耗时
    phases = {
        "DNS Lookup": math.ceil(t_dns),
        "TCP Connection": math.ceil(t_conn - t_dns),
        "TLS Handshake": math.ceil(t_pre - t_conn),
        "Server Processing": math.ceil(t_ttfb - t_pre),
        "Content Transfer": math.ceil(t_total - t_ttfb)
    }
    
    # 渲染表头和数据行
    headers = list(phases.keys())
    values = [f"{v}ms" for v in phases.values()]
    
    col_width = 20
    separator = "|"
    
    # 打印阶段名称
    print(" " + " ".join([f"{h:^{col_width}}" for h in headers]))
    # 打印耗时数据
    print("[" + separator.join([f"{v:^{col_width}}" for v in values]) + "]")
    
    # 打印累积时间轴
    timeline_points = [
        ("namelookup", t_dns),
        ("connect", t_conn),
        ("pretransfer", t_pre),
        ("starttransfer", t_ttfb),
        ("total", t_total)
    ]
    
    for idx, (name, time_ms) in enumerate(timeline_points):
        padding_left = (col_width + 1) * idx
        label = f"{name}:{int(time_ms)}ms"
        print(" " * padding_left + f"{label:<{col_width}}")

render_http_timeline("https://http2.pro/api/v1")

PyCurl 性能与状态指标字典

除了上述使用的时间指标外,pycurl 还提供了大量用于分析请求细节的常量。以下是常用的 getinfo 参数分类汇总:

分类 常量名称 说明
时间与速度 NAMELOOKUP_TIME DNS 解析耗时
CONNECT_TIME 建立 TCP 连接耗时
STARTTRANSFER_TIME 接收到首个字节的时间 (TTFB)
SPEED_DOWNLOAD / SPEED_UPLOAD 平均下载 / 上传速度
TOTAL_TIME 请求总耗时
数据大小 SIZE_DOWNLOAD / SIZE_UPLOAD 实际下载 / 上传的字节数
CONTENT_LENGTH_DOWNLOAD 响应头中声明的下载内容长度
HEADER_SIZE 接收到的响应头总大小
REQUEST_SIZE 发送的请求头总大小
状态与路由 RESPONSE_CODE HTTP 响应状态码
REDIRECT_COUNT 发生的重定向次数
EFFECTIVE_URL 最后一次实际请求的 URL(包含重定向后的地址)
标签: PyCurl

相关文章

Linux crontab 详解

1) crontab 是什么cron 是 Linux 的定时任务守护进程;crontab 是用来编辑/查看“按时间周期执行命令”的表(cron table)。常见两类:用户 crontab:每个用户一份(crontab -e 编辑)系统级 crontab / cron.d:可指定执行用户(/etc/crontab、/etc/cron.d/*)2) crontab 时间...

富文本里可以允许的 HTML 属性

一、所有标签默认允许的安全属性(极少)class        (可选)id           (通常建议禁用)title️ 注意:id 容易被滥用做锚点注入,很多系统直接禁用class 允许的话最好只允许固定前缀(如 editor-*)二、a 标签允许属性<a href="" t...

Dom\HTML_NO_DEFAULT_NS 的副作用:自动加闭合标签

在使用Dom\HTMLDocument时,Dom\HTML_NO_DEFAULT_NS 将禁止在解析过程中设置元素的命名空间, 此设置是为了与DOMDocument向后兼容而存在的。当使用它时,已知的一个副作用就是:自动加闭合标签例如 </img> 为什么会这样?当你使用:Dom\HTML_NO_DEFAULT_NS文档会变成 无命名空间模式,此时内部更接近 XML...

Laravel 事件和监听器创建

在 Laravel 中,使用 Artisan 命令创建 Events(事件) 和 Listeners(监听器) 是非常高效的。你可以通过以下几种方式来实现:1. 手动创建单个 Event如果你只想创建一个事件类,可以使用 make:event 命令:Bashphp artisan make:event UserRegistered执行后,文件将生成在 app/Even...

自定义域名解析神器 dnsmasq

什么是 dnsmasq?dnsmasq 是一个轻量级、功能强大的网络服务工具,专为小型和中等规模网络设计。它是一个综合的网络基础设施解决方案[1]。dnsmasq 能做什么?功能说明应用场景DNS 转发与缓存将 DNS 查询转发到上游服务器(ISP、Google DNS 等),并在本地缓存结果加快 DNS 查询速度,减少外部 DNS 流量本地 DNS解析本地网络设备的主机名,无需编辑&n...

linux screen 用法详情 (nohup 的替代方案)

一、screen 是什么?能干嘛?screen 是一个终端复用器,可以:在一个 SSH 会话中开多个“虚拟终端”SSH 断线后,程序仍然在后台运行随时重新连接到原来的会话特别适合:nohup 的替代方案跑脚本 / 爬虫 / 训练模型运维、远程开发二、安装 screen# CentOS / Rocky / Almayum install -y screen# Debian / Ubuntuapt i...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。