01
cudaStream_t batch, online;02
batchKernel<<<largeGrid, block, 0, batch>>>(archive);03
// request arrives while batchKernel is active04
infer<<<smallGrid, block, 0, online>>>(request);05
cudaStreamSynchronize(online);两个工作负载等待提交0 / 8 TICKS