BACK TO MAIN PATHPARALLEL HORIZONS
LESSON 02TASK CONCURRENCY
READ
  1. 01TRACE
  2. 02SPLIT
  3. 03OVERLAP
  4. 04COMPLETE

STEP 01 · TRACE

THE KERNEL IS FAST. THE QUEUE KEEPS WAITING.

The program must process three independent chunks. The default Stream lines up input copy, Kernel, and result copy; only one kind of resource works at a time.
SINGLE-QUEUE PIPELINEDEFAULT STREAM · 3 CHUNKS
01for (int chunk = 0; chunk < 3; chunk++) {
02cudaMemcpy(device, host, H2D);
03filter<<<grid, block>>>(device);
04cudaMemcpy(host, device, D2H);
05}
DEFAULT STREAM READY0 / 9
DEVICE TIMELINE9 TASKS RUN IN SEQUENCE