深度神经网络推理时间正确测量方法
背景
网络延迟是深度学习模型部署到生产环境时的关键指标之一。实际应用通常要求毫秒级甚至亚秒级的推理速度。然而,准确测量神经网络推理时间并非易事,即使经验丰富的开发者也可能因常见错误导致测量结果不准确,进而引发决策失误和额外成本。
本文梳理了正确测量推理时间需注意的核心问题,包括GPU的异步执行机制和预热过程。同时,提供了PyTorch示例代码演示如何在GPU上精确计时,并总结了测量时常见的误区。
异步执行机制
GPU执行具有异步特性:当调用GPU函数时,操作被排入设备队列但不会阻塞其他设备,这使得CPU和GPU可并行执行计算。例如,在批量推理时,GPU处理第一批数据的同时CPU可预处理第二批数据。这种异步性对深度学习至关重要,能显著缩短运行时间。
然而,异步执行对计时带来挑战。使用Python的time库计时时,时间记录在CPU上执行,而GPU操作可能尚未完成,导致计时不准确。下文将说明如何在此机制下正确测量时间。
GPU预热
现代GPU存在多种电源状态。闲置且未启用持久模式时,GPU会降低功耗状态(甚至完全关闭)。当程序调用GPU时,驱动需加载并初始化硬件(如内存、计算核心),该过程可能耗时长达3秒(因纠错码扫描)。若直接测量推理时间,这部分初始化延迟会污染结果。生产环境中GPU通常已处于工作状态,因此预热是消除该误差的关键步骤。
正确测量推理时间
以下PyTorch代码展示了如何规避上述问题:
model = EfficientNet.from_pretrained('efficientnet-b0')
device = torch.device("cuda")
model.to(device)
dummy_input = torch.randn(1, 3, 224, 224, dtype=torch.float).to(device)
# 初始化计时器
starter, ender = torch.cuda.Event(enable_timing=True), torch.cuda.Event(enable_timing=True)
repetitions = 300
timings = np.zeros((repetitions, 1))
# GPU预热
for _ in range(10):
_ = model(dummy_input)
# 正式测量
with torch.no_grad():
for rep in range(repetitions):
starter.record()
_ = model(dummy_input)
ender.record()
torch.cuda.synchronize() # 同步GPU和CPU
curr_time = starter.elapsed_time(ender)
timings[rep] = curr_time
mean_syn = np.sum(timings) / repetitions
std_syn = np.std(timings)
print(mean_syn)
要点说明:
- 预热阶段:通过多次运行虚拟输入初始化GPU,避免电源状态切换干扰。
- GPU计时器:使用
torch.cuda.Event记录时间而非CPU的time.time()。 - 同步操作:
torch.cuda.synchronize()确保CPU等待GPU任务完成后再记录时间,解决异步执行问题。
常见计时误区
- 包含数据迁移时间:若输入张量在CPU创建后传输至GPU,则内存拷贝时间被计入推理过程。正确做法应预先将数据分配至GPU。
- 跳过GPU预热:首次调用GPU会触发初始化(可达3秒),直接测量会严重高估实际耗时。
- 使用CPU计时器:如下代码忽略异步机制,导致计时过早结束:
s = time.time()
_ = model(dummy_input)
curr_time = (time.time() - s) * 1000
- 单次测量:神经网络前向传播存在随机波动,应测量多次(如300次)并取平均值。
吞吐量测量
吞吐量定义为设备在单位时间内可处理的最大样本数。计算方法:
- 确定最优批大小:通过二分查找或逐次递增找到不引发OOM的最大批处理量。
- 计算吞吐量:处理多批数据后代入公式:
吞吐量 = (批次数 × 批大小) / 总耗时(秒)
示例代码:
model = EfficientNet.from_pretrained('efficientnet-b0')
device = torch.device("cuda")
model.to(device)
dummy_input = torch.randn(optimal_batch_size, 3, 224, 224, dtype=torch.float).to(device)
repetitions = 100
total_time = 0
with torch.no_grad():
for rep in range(repetitions):
starter, ender = torch.cuda.Event(enable_timing=True), torch.cuda.Event(enable_timing=True)
starter.record()
_ = model(dummy_input)
ender.record()
torch.cuda.synchronize()
curr_time = starter.elapsed_time(ender) / 1000
total_time += curr_time
throughput = (repetitions * optimal_batch_size) / total_time
print('Final Throughput:', throughput)
准确测量推理时间需要全面理解GPU执行原理。预热、同步操作及统计方法缺一不可。针对吞吐量测量,需结合最优批处理与批量测试,避免被初始化阶段或单次波动误导。