01
for (int chunk = 0; chunk < 3; chunk++) {02
cudaMemcpy(device, host, H2D);03
filter<<<grid, block>>>(device);04
cudaMemcpy(host, device, D2H);05
}DEFAULT STREAM READY0 / 9