BACK TO MAIN PATHPARALLEL HORIZONS
LESSON 01MEMORY HIERARCHY
READ
  1. 01OBSERVE
  2. 02COALESCE
  3. 03STAGE
  4. 04COMPLETE

STEP 01 · OBSERVE

THE THREADS LEFT. THE DATA DIDN'T ARRIVE.

Lesson 00 created 256 Threads. Now every Warp reads memory with a stride: compute is ready while scattered data is still in flight.
CURRENT KERNEL256 THREADS · STRIDE 16
01__global__ void transform(float* input) {
02int i = blockIdx.x * blockDim.x + threadIdx.x;
03float value = input[(i * 16) % 256];
04output[i] = value * 2.0f;
05}
GPU READY
WARP 00 · MEMORY REQUESTS32 THREADS TOUCH 16 SCATTERED REGIONS
ACTIVE THREADS32 / WARP
REGIONS TOUCHED16
WAIT STATEMEMORY STALL