返回主线PARALLEL HORIZONS
课程 04张量计算
阅读材料
  1. 01分析
  2. 02分块
  3. 03精度
  4. 04完成

步骤 01 · 分析

线程很多,矩阵乘法仍在重复同一种小操作。

每个线程负责输出矩阵的一个元素,却要在 K 维上顺序完成 16 次乘加。程序是正确的,但没有把矩阵结构表达给硬件。
标量矩阵乘法256 OUTPUT THREADS · K = 16
01int row = blockIdx.y * blockDim.y + threadIdx.y;
02int col = blockIdx.x * blockDim.x + threadIdx.x;
03float sum = 0.0f;
04for (int k = 0; k < 16; k++) {
05sum += A[row][k] * B[k][col];
06}
07C[row][col] = sum;
SCALAR KERNEL READY0 / 256
输出 TILE C16 × 16 ELEMENTS
每个输出的乘加16输出线程256矩阵形状16³

动画只显示计算结构,不表示真实时钟、吞吐或固定性能倍数。