返回主线PARALLEL HORIZONS
课程 01内存层次
阅读材料
  1. 01观察
  2. 02合并
  3. 03暂存
  4. 04完成

步骤 01 · 观察

线程已经出发,数据却还没到。

Lesson 00 创建了 256 个线程。现在每个 Warp 都在跨步读取内存:计算资源已经就绪,却要等待分散的数据返回。
当前 KERNEL256 THREADS · STRIDE 16
01__global__ void transform(float* input) {
02int i = blockIdx.x * blockDim.x + threadIdx.x;
03float value = input[(i * 16) % 256];
04output[i] = value * 2.0f;
05}
GPU READY
WARP 00 · 内存请求32 个线程访问 16 个分散区域
活跃线程32 / WARP
触及区域16 个
等待状态MEMORY STALL