From TIRx-lite source to generated code

Schematic. Click a source line to see the code it becomes.

TIRx-lite source

Generated CUDA

__global__ void vector_add_kernel(...) { int i = blockIdx.x * 128 + threadIdx.x; if (i < n) { asm("ld.global.f32 %0, [%1];" ...); asm("add.f32 %0, %1, %2;" ...); asm("st.global.f32 [%0], %1;" ...);