Skip to content

张量编译 / 算子编译方向(AI 编译一句话概览)

若你投 AI Infra 内的 “infra SDK/AI 编译器/TVM 方向” 岗位,会顺带问张量/算子编译。这里给对话级覆盖,深挖可另开专题。

常见路线词汇(能定义就有分)

  • TVM / MLIR / Triton:ai 编译器框架;把算子 DSL 代码映射到多种硬件(CUDA/CPU)。
  • DSL:写 kernel 的高级语言(Triton 的 block 语法、TVM script);配自动 tile/向量化/内存布局变换。
  • 内核融合(kernel fusion):多个 elementwise 是否合并成一次 kernel 省数据往返(算并取)。基准看它是不是 memory-bound。
  • 算子 / GEMM 内核降级:tile → registers → SIMD/FMA,多级 tiling 缓存复用。
  • 调度与代码生成:给特定 shape/hw 选 tile+unroll,生成本身也是“模板元编程/代码生成”在跑。
  • bfloat16/fp16/int8 精度在带宽受限场景提速

一道高频方向题

「为什么 elementwise 算子耗时与计算几乎无关?」—— memory-bound:每元素只做一次读一次写,DRAM 带宽上界主导,ALU 空转。解法:融合减少往返 + 块大 batch 摊薄 + vectorized 宽 load。

关键技能影响(提醒)

即便你主要在宿主侧,能讲:性能内核 = 访存(tiling/合并)+ 并行(occupancy/SIMD)+ 精度(fp16);用到 C++ 模板生成多 shape 变体 —— 把你上面元编程、SIMD、performance 三套知识串起来,正是 AI 编译器要的 DNA。

C++ 面试八股 · VitePress 版