返回主线PARALLEL HORIZONS
课程 05资源隔离
阅读材料
  1. 01争用
  2. 02隔离
  3. 03喂入
  4. 04完成

步骤 01 · 争用

在线请求到了,GPU 却被大批任务占着。

离线任务正在追求吞吐,在线推理却必须在延迟预算内返回。它们已放进两个 CUDA Stream,但仍在共享同一组计算与内存资源。
共享 GPU · 两类工作负载2 STREAMS · 1 RESOURCE POOL
01cudaStream_t batch, online;
02batchKernel<<<largeGrid, block, 0, batch>>>(archive);
03// request arrives while batchKernel is active
04infer<<<smallGrid, block, 0, online>>>(request);
05cudaStreamSynchronize(online);
两个工作负载等待提交0 / 8 TICKS
资源占用追踪CONCEPTUAL SCHEDULE
在线延迟预算≤ 4 TICKS观察到的完成时间

TICK 和 24 个格子都是教学单位,只表示先后关系与资源争用,不是硬件 SM 数量、毫秒延迟或性能测量。