API Start (ns),API Dur (ns),Queue Start (ns),Queue Dur (ns),Kernel Start (ns),Kernel Dur (ns),Total Dur (ns),PID,TID,DevId,API Function,GridXYZ,BlockXYZ,Kernel Name 7267792,13408,,,7275376,2144,13408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7290064,5728,,,7292688,2816,5728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 7303328,5504,,,7305872,3392,5936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7312624,3072,,,7313232,1088,3072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7320240,3056,,,7320496,1088,3056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7326912,2624,,,7326704,1056,2624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 7332464,2944,,,7332624,2080,2944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7339552,2752,,,7339504,1824,2752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7354064,6960,,,7357872,2752,6960,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7368368,6496,,,7370736,5728,8096,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7381248,2672,,,7381104,1120,2672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7392128,4000,,,7392976,1984,4000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BUnaryFunctor>, std::array>(int, T2, T3)" 7416896,3616,,,7417616,38432,39152,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7457216,5488,,,7459632,48832,51248,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7471440,6608,7478048,31952,7510000,71520,110080,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7645392,5456,,,7647600,4915936,4918144,73,73,0,cuLaunchKernel,2336 3 1, 256 1 1,void cutlass::Kernel2(T1::Params) 7660272,3168,7663440,4902048,12565488,5035136,9940352,73,73,0,cudaLaunchKernel,195804 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7680208,3104,7683312,9918336,17601648,3808,9925248,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7749040,5552,7754592,9853168,17607760,44096,9902816,73,73,0,cuLaunchKernel, 56 6 1, 128 1 1,void cutlass::Kernel2(T1::Params) 7760960,2784,7763744,9890000,17653744,30368,9923152,73,73,0,cudaLaunchKernel,2174 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7789584,14368,7803952,9881536,17685488,3744,9899648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7808960,2624,7811584,9880144,17691728,1792,9884560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7816096,3040,7819136,9876944,17696080,1344,9881328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 7822960,3856,7826816,9873264,17700080,2048,9879168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7830640,4176,7834816,9869456,17704272,1536,9875168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7838288,3408,7841696,9866672,17708368,1280,9871360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7846032,2512,7848544,9863824,17712368,1376,9867712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 7851344,3104,7854448,9862112,17716560,2080,9867296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7884416,5552,7889968,9830432,17720400,2848,9838832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnOther_add, std::array>(int, T2, T3)" 17749936,2864,,,17749968,1024,2864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnOther_add, std::array>(int, T2, T3)" 17804720,6544,,,17807664,3766816,3769760,73,73,0,cudaLaunchKernel,1536 3 1, 128 1 1,"void at::native::::CatArrayBatchedCopy_alignedK_contig::OpaqueType<(unsigned int)2>, unsigned int, (int)2, (int)128, (int)1, (int)8>(T1 *, at::native::::CatArrInputTensorMetadata, at::native::::TensorSizeStride, int, T2)" 26357072,19776,,,26372208,8192,23328,73,73,0,cudaLaunchKernel, 222 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 26411856,6864,,,26413968,27680,29792,73,73,0,cudaLaunchKernel,7090 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 26448080,6096,,,26449776,52384,54080,73,73,0,cudaLaunchKernel, 96 3 1, 512 1 1,"void at::native::::CatArrayBatchedCopy::OpaqueType<(unsigned int)4>, unsigned int, (int)2, (int)64, (int)64>(T1 *, at::native::::CatArrInputTensorMetadata, at::native::::TensorSizeStride, int, T2)" 26467520,8432,26475952,27200,26503152,31872,67504,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::cos_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 26485712,7200,26492912,43104,26536016,39456,89760,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::sin_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 26503344,7696,26511040,66864,26577904,39712,114272,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 26524576,5744,26530320,88544,26618864,873696,967984,73,73,0,cudaLaunchKernel,1536 4 1, 128 1 1,"void at::native::::CatArrayBatchedCopy_alignedK_contig::OpaqueType<(unsigned int)4>, unsigned int, (int)3, (int)128, (int)1, (int)16>(T1 *, at::native::::CatArrInputTensorMetadata, at::native::::TensorSizeStride, int, T2)" 26542304,3824,26546128,949280,27495408,217120,1170224,73,73,0,cudaLaunchKernel,7090 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 26580608,5376,26585984,1128560,27714544,2240,1136176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 26596912,4336,26601248,1117488,27718736,1536,1123360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 26610752,7728,26618480,1104256,27722736,3424,1115408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 26623808,10192,26634000,1094848,27728848,3168,1108208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 26644832,6224,26651056,1082016,27733072,3136,1091376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 26750464,31104,26781568,955920,27737488,4736,991760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 26817168,16720,26833888,909616,27743504,1088,927424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 26842128,5984,26848112,899456,27747568,1632,907072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 26881584,13776,26895360,856176,27751536,1504,871456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 26933984,31456,26965440,790320,27755760,2016,823792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 27338800,37296,27376096,383760,27759856,30048,451104,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 27606992,42304,27649296,143072,27792368,3544672,3730048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 27744576,4640,27749216,3589264,31338480,2464,3596368,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 27753472,3216,27756688,3585888,31342576,1984,3591088,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 27834368,7616,27841984,3504688,31346672,49568,3561872,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 27856400,16064,27872464,3526432,31398896,3452992,6995488,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 27875376,14016,27889392,6964448,34853840,2912,6981376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 27895376,18464,27913840,6944128,34857968,2466752,9429344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 28438432,12560,28450992,8875072,37326064,1920,8889552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 28955424,19216,28974640,8355520,37330160,24059776,32434512,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 29491888,43168,29535056,31856160,61391216,11842304,43741632,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 29793040,28320,29821360,43430944,73252304,2395136,45854400,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 29899920,23168,29923088,45726176,75649264,4001984,49751328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 29971760,19104,29990864,49663008,79653872,3999008,53681120,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 30031744,16336,30048080,53606784,83654864,5297792,58920912,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 30084848,13088,30097936,58857152,88955088,5731328,64601568,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 30238096,12496,30250592,64438928,94689520,240315488,304766912,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 30402032,15632,30417664,304589328,335006992,2176224,306781184,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 30424080,12784,30436864,306748144,337185008,1952,306762880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 30460496,9984,30470480,306718624,337189104,1376,306729984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 30491344,5984,30497328,306695872,337193200,1504,306703360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 30616272,10752,30627024,306570272,337197296,40608,306621632,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 30657360,27824,30685184,306555088,337240272,2775488,309358400,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 30757632,9776,30767408,309249984,340017392,1888,309261648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 30860752,10288,30871040,309150448,340021488,7702240,316862976,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 31210832,13904,31224736,316500304,347725040,5461056,321975264,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 31254736,8192,31262928,321925152,353188080,3717632,325650976,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 31305920,8032,31313952,325593296,356907248,5856,325607184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 31319328,5072,31324400,325591040,356915440,3776,325599888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 31353824,3712,31357536,325564048,356921584,60928,325628688,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 31360320,3296,31363616,325620432,356984048,4091840,329715568,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 31364384,3520,31367904,329710064,361077968,1952,329715536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 31368512,3872,31372384,329709712,361082096,2437024,332150608,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 31411328,3808,31415136,332105296,363520432,1920,332111024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 31464768,3056,31467824,332056512,363524336,34563520,366623088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 31511392,3584,31514976,366574512,398089488,140224,366718320,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 31517360,5072,31522432,366709360,398231792,11923520,378637952,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 31522864,2624,31525488,378631808,410157296,2464,378636896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 31526352,4816,31531168,378630224,410161392,10756480,389391520,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 31555888,2864,31558752,389361808,420920560,1920,389366592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 31570192,4048,31574240,389350416,420924656,3040,389357504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 31658144,4288,31662432,389267344,420929776,16202336,405473968,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 31696912,2832,31699744,405433840,437133584,5455232,410891904,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 31715264,4176,31719440,410871008,442590448,1984,410877168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 31725792,3056,31728848,410865696,442594544,1440,410870192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 31733712,3488,31737200,410861440,442598640,1376,410866304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 31742144,3552,31745696,410857040,442602736,3168,410863760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 31751328,3232,31754560,410854288,442608848,1344,410858864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 31768288,4032,31772320,410840720,442613040,4608,410849360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 31778848,3312,31782160,410836832,442618992,1120,410841264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 31786592,2992,31789584,410833632,442623216,1632,410838256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 31795744,2992,31798736,410828576,442627312,1472,410833040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 31806144,3264,31809408,410822000,442631408,1248,410826512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 31882768,3856,31886624,410748880,442635504,29472,410782208,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 31913904,2912,31916816,410749440,442666256,3479584,414231936,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 31933664,2976,31936640,414212208,446148848,2368,414217552,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 31940592,2832,31943424,414209520,446152944,2112,414214464,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 31960448,2640,31963088,414193952,446157040,48416,414245008,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 31965232,2880,31968112,414240128,446208240,3449888,417692896,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 31968512,2416,31970928,417689216,449660144,4032,417695664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 31971488,2752,31974240,417692048,449666288,2435424,420130224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 32013936,2976,32016912,420087520,452104432,1888,420092384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 32061952,2944,32064896,420043632,452108528,25770432,445817008,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 32179824,4736,32184560,445697024,477881584,11819968,457521728,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 32218688,3456,32222144,457482480,489704624,2346688,459832624,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 32238848,3584,32242432,459811312,492053744,3809824,463624720,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 32246832,2832,32249664,463615408,495865072,3947776,467566016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 32258208,3104,32261312,467554352,499815664,5406624,472964080,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 32269968,3104,32273072,472951360,505224432,5664096,478618560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 32286592,3648,32290240,478601008,510891248,240444576,719049232,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 32323632,3488,32327120,719011648,751338768,2172448,721187584,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 32327984,3088,32331072,721181584,753512656,1952,721186624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 32338128,3184,32341312,721175472,753516784,2912,721181568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 32346992,3056,32350048,721170928,753520976,1536,721175520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 32372752,2944,32375696,721149312,753525008,46304,721198560,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 32388960,3136,32392096,721180976,753573072,2749568,723933680,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 32420640,3104,32423744,723900848,756324592,1920,723905872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 32463184,3280,32466464,723862192,756328656,7743936,731609408,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 32507568,2832,32510400,731563888,764074288,5461696,737028416,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 32524576,3072,32527648,737010608,769538256,3462944,740476624,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 32542416,3168,32545584,740456896,773002480,2304,740462368,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 32549600,2704,32552304,740454272,773006576,1984,740458960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 32568224,2784,32571008,740439664,773010672,46624,740489072,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 32572784,2864,32575648,740483152,773058800,3966080,744452096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 32576096,2512,32578608,744449216,777027824,1952,744453680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 32579200,2528,32581728,744450192,777031920,2729952,747182672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 32612736,2864,32615600,747148352,779763952,1856,747153072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 32654352,3184,32657536,747110512,779768048,33135360,780249056,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 32685936,2784,32688720,780216992,812905712,186080,780405856,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 32690304,3744,32694048,780400048,813094096,12695904,793099696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 32694496,2816,32697312,793094416,825791728,2176,793099408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 32697712,2880,32700592,793095328,825795920,10475328,803573536,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 32715072,2736,32717808,803554720,836272528,2176,803559632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 32724256,2976,32727232,803549232,836276464,832,803553040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 32758416,2864,32761280,803517072,836278352,15614944,819134880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 32788016,2768,32790784,819103792,851894576,5572000,824678560,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 32803040,3536,32806576,824662592,857469168,2336,824668464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 32812352,3120,32815472,824657792,857473264,3104,824664016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 32819408,2592,32822000,824657408,857479408,3264,824663264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 32826160,2928,32829088,824656464,857485552,11680,824671072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 32833712,3520,32837232,824662624,857499856,6144,824672288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 32853184,3360,32856544,824652816,857509360,5600,824661776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 32861760,3376,32865136,824651136,857516272,2368,824656880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 32869712,3088,32872800,824647568,857520368,3360,824654016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 32877088,2624,32879712,824646800,857526512,2944,824652368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 32885056,3264,32888320,824642416,857530736,8192,824653872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 32952736,3216,32955952,824584896,857540848,56608,824644720,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 32981504,2896,32984400,824615840,857600240,3673856,828292592,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 32999120,2944,33002064,828273312,861275376,2464,828278720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 33006048,2736,33008784,828270656,861279440,2048,828275440,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 33024304,2640,33026944,828256592,861283536,48960,828308192,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 33028848,2640,33031488,828303248,861334736,3813056,832118944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 33031888,2800,33034688,832115472,865150160,3776,832122048,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 33035216,2496,33037712,832118592,865156304,2434944,834556032,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 33080784,2976,33083760,834509696,867593456,1888,834514560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 33125728,3296,33129024,834468560,867597584,23937632,858409488,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 33213920,4080,33218000,858319648,891537648,12480864,870804592,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 33245472,3360,33248832,870772624,904021456,2345600,873121584,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 33263808,3408,33267216,873102048,906369264,3709440,876814896,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 33270080,2816,33272896,876807312,910080208,3724512,880534640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 33280032,2736,33282768,880524800,913807568,5534656,886062192,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 33290304,2768,33293072,886050432,919343504,5795488,891848688,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 33303040,3056,33306096,891835136,925141232,239349632,1131187824,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 33336304,3424,33339728,1131153472,1164493200,2170784,1133327680,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 33340192,4048,33344240,1133321696,1166665936,1920,1133327664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 33350944,2816,33353760,1133316304,1166670064,2912,1133322032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 33358672,3152,33361824,1133312464,1166674288,1504,1133317120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 33381392,2912,33384304,1133293984,1166678288,47104,1133344000,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 33396976,3360,33400336,1133328064,1166728400,2757664,1136089088,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 33428064,2976,33431040,1136058096,1169489136,1952,1136063024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 33468256,3136,33471392,1136021840,1169493232,7799744,1143824720,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 33509632,3280,33512912,1143782208,1177295120,5451936,1149237424,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 33523600,3088,33526688,1149222192,1182748880,3475680,1152700960,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 33539920,3248,33543168,1152684272,1186227440,2400,1152689920,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 33547248,3136,33550384,1152681120,1186231504,2080,1152686336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 33565648,2736,33568384,1152667216,1186235600,46016,1152715968,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 33570064,2768,33572832,1152710064,1186282896,3462240,1156175072,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 33573280,2640,33575920,1156171008,1189746928,1984,1156175632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 33576480,2656,33579136,1156171856,1189750992,2452064,1158626576,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 33616560,2800,33619360,1158585168,1192204528,1888,1158589856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 33656784,2640,33659424,1158549200,1192208624,34645696,1193197536,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 33687520,2704,33690224,1193166560,1226856784,139968,1193309232,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 33691632,3184,33694816,1193304208,1226999024,12761440,1206068832,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 33695344,2784,33698128,1206065056,1239763184,1920,1206069760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 33698672,3184,33701856,1206065424,1239767280,10456096,1216524704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 33715008,2704,33717712,1216507680,1250225392,1952,1216512336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 33724112,2832,33726944,1216502512,1250229456,864,1216506208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 33752400,2656,33755056,1216476576,1250231632,15792128,1232271360,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 33780528,2448,33782976,1232243792,1266026768,5824160,1238070400,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 33794848,3312,33798160,1238054112,1271852272,1952,1238059376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 33803584,2864,33806448,1238049920,1271856368,1408,1238054192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 33810304,2768,33813072,1238047360,1271860432,2848,1238052976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 33817328,3200,33820528,1238044032,1271864560,3200,1238050432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 33824592,3104,33827696,1238043008,1271870704,1376,1238047488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 33836384,3024,33839408,1238035392,1271874800,4416,1238042832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 33844304,2688,33846992,1238033920,1271880912,1120,1238037728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 33851264,2640,33853904,1238031136,1271885040,1600,1238035376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 33858224,2944,33861168,1238027968,1271889136,1472,1238032384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 33866544,3312,33869856,1238023344,1271893200,1280,1238027936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 33931712,2992,33934704,1237962688,1271897392,26016,1237991696,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 33958256,2912,33961168,1237964800,1271925968,3545984,1241513696,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 33976368,2912,33979280,1241493952,1275473232,2496,1241499360,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 33983168,2576,33985744,1241491488,1275477232,2112,1241496176,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 34001264,3040,34004304,1241477024,1275481328,47552,1241527616,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 34006352,2992,34009344,1241521424,1275530768,4259520,1245783936,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 34009760,2672,34012432,1245780992,1279793424,3712,1245787376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 34012944,2608,34015552,1245783984,1279799536,2444704,1248231296,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 34050960,3472,34054432,1248191440,1282245872,1824,1248196736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 34103904,2752,34106656,1248143280,1282249936,24882560,1273028592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 34187600,3696,34191296,1272943952,1307135248,12475168,1285422816,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 34216080,3328,34219408,1285393248,1319612656,2339296,1287735872,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 34233888,2992,34236880,1287717664,1321954544,3722080,1291442736,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 34239456,2528,34241984,1291436848,1325678832,3736032,1295175408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 34248800,2864,34251664,1295164768,1329416432,5150368,1300318000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 34259200,2592,34261792,1300307408,1334569200,5873152,1306183152,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 34270608,2880,34273488,1306170400,1340443888,238904576,1545077856,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 34302512,3696,34306208,1545045104,1579351312,2158912,1547207712,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 34306752,2560,34309312,1547203600,1581512912,1984,1547208144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 34315600,2880,34318480,1547198560,1581517040,2880,1547204320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 34323536,9296,34332832,1547188368,1581521200,1536,1547199200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 34351312,2768,34354080,1547171056,1581525136,54208,1547228032,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 34366992,3264,34370256,1547210368,1581580624,2747456,1549961088,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 34396800,2800,34399600,1549930336,1584329936,1920,1549935056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 34436816,2784,34439600,1549894464,1584334064,7804864,1557702112,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 34475856,2848,34478704,1557662368,1592141072,5612512,1563277728,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 34489264,3056,34492320,1563263312,1597755632,3661824,1566928192,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 34505120,3200,34508320,1566911184,1601419504,2400,1566916784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 34512384,2848,34515232,1566908336,1601423568,2112,1566913296,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 34529744,2720,34532464,1566895232,1601427696,46240,1566944192,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 34534256,3040,34537296,1566938528,1601475824,3859104,1570800672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 34537760,2592,34540352,1570796976,1605337328,1952,1570801520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 34540848,2416,34543264,1570798192,1605341456,2438848,1573239456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 34571760,2848,34574608,1573208032,1607782640,1920,1573212800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 34610608,2720,34613328,1573173408,1607786736,34043744,1607219872,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 34641248,2688,34643936,1607187888,1641831824,139840,1607330416,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 34645392,2848,34648240,1607324704,1641972944,12366720,1619694272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 34648656,2384,34651040,1619690832,1654341872,1920,1619695136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 34651472,2992,34654464,1619691504,1654345968,10667840,1630362336,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 34667152,2928,34670080,1630345968,1665016048,1984,1630350880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 34676304,3024,34679328,1630340816,1665020144,2560,1630346400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 34702592,2608,34705200,1630319040,1665024240,15704512,1646026160,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 34729936,2912,34732848,1645997504,1680730352,5454720,1651455136,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 34743968,3360,34747328,1651439152,1686186480,1952,1651444464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 34752832,2992,34755824,1651433920,1686189744,1440,1651438352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 34759696,2672,34762368,1651431024,1686193392,1312,1651435008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 34766368,3120,34769488,1651428000,1686197488,3264,1651434384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 34773616,2736,34776352,1651427248,1686203600,1344,1651431328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 34784832,3008,34787840,1651419888,1686207728,4640,1651427536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 34792688,2544,34795232,1651418640,1686213872,1088,1651422272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 34799952,2784,34802736,1651415232,1686217968,1632,1651419648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 34806848,2704,34809552,1651412608,1686222160,1504,1651416816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 34814544,2896,34817440,1651408720,1686226160,1280,1651412896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 34878832,3136,34881968,1651348288,1686230256,27264,1651378688,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 34907072,3184,34910256,1651348672,1686258928,3493056,1654844912,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 34928800,3280,34932080,1654821792,1689753872,2464,1654827536,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 34936064,2816,34938880,1654819056,1689757936,2016,1654823888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 34954144,2720,34956864,1654805168,1689762032,47456,1654855344,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 34958784,2800,34961584,1654849568,1689811152,3918208,1658770576,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 34962064,2448,34964512,1658766544,1693731056,3392,1658772384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 34964976,2544,34967520,1658769680,1693737200,2845728,1661617952,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 35000496,3072,35003568,1661582400,1696585968,1856,1661587328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 35048800,6928,35055728,1661534368,1696590096,25301536,1686842832,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 35154928,5136,35160064,1686734032,1721894096,11901664,1698640832,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 35184208,5216,35189424,1698608960,1733798384,2551328,1701165504,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 35203680,2864,35206544,1701145440,1736351984,3738560,1704886864,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 35208960,2960,35211920,1704880704,1740092624,3951712,1708835376,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 35218672,4384,35223056,1708823264,1744046320,5119744,1713947392,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 35230784,5216,35236000,1713931344,1749167344,5697824,1719634384,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 35244976,3472,35248448,1719619472,1754867920,240193088,1959816032,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 35284608,3456,35288064,1959774480,1995062544,2167328,1961945264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 35288640,2688,35291328,1961941040,1997232368,1920,1961945648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 35298272,3152,35301424,1961935008,1997236432,2944,1961941104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 35306416,4000,35310416,1961930240,1997240656,1504,1961935744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 35329728,3936,35333664,1961910960,1997244624,47296,1961962192,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 35346480,3856,35350336,1961943472,1997293808,2750016,1964697344,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 35377088,3360,35380448,1964665840,2000046288,1952,1964671152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 35421120,4240,35425360,1964625056,2000050416,7806304,1972435600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 35465136,4736,35469872,1972389600,2007859472,5472288,1977866624,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 35480464,3872,35484336,1977850432,2013334768,3708736,1981563040,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 35498128,3440,35501568,1981544144,2017045712,6624,1981554208,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 35505536,3952,35509488,1981544448,2017053936,2144,1981550544,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 35524032,3344,35527376,1981530624,2017058000,47936,1981581904,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 35529584,3696,35533280,1981573936,2017107216,4063680,1985641312,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 35533744,4272,35538016,1985635472,2021173488,1952,1985641696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 35538640,4144,35542784,1985634800,2021177584,2438432,1988077376,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 35575616,3312,35578928,1988038848,2023617776,1920,1988044080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 35615008,3456,35618464,1988003408,2023621872,34049568,2022056432,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 35655808,3200,35659008,2022014960,2057673968,139872,2022158032,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 35660464,3520,35663984,2022152288,2057816272,11888096,2034043904,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 35664912,6000,35670912,2034035024,2069705936,1984,2034043008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 35671344,3808,35675152,2034034912,2069710064,10741088,2044779808,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 35689952,3264,35693216,2044760656,2080453872,1952,2044765872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 35698960,3104,35702064,2044755904,2080457968,2496,2044761504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 35726064,3472,35729536,2044732528,2080462064,16236448,2060972448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 35754320,3344,35757664,2060942960,2096700624,5467584,2066413888,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 35771184,4720,35775904,2066394928,2102170832,1952,2066401600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 35782272,3152,35785424,2066389536,2102174960,1440,2066394128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 35789024,2768,35791792,2066387264,2102179056,1312,2066391344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 35795968,2832,35798800,2066383104,2102181904,3456,2066389392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 35803104,3072,35806176,2066381072,2102187248,1344,2066385488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 35815392,3456,35818848,2066372432,2102191280,4608,2066380496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 35823776,2896,35826672,2066370816,2102197488,1088,2066374800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 35831184,2976,35834160,2066367360,2102201520,1632,2066371968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 35838464,11024,35849488,2066356192,2102205680,1728,2066368944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 35856272,3136,35859408,2066350368,2102209776,1280,2066354784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 35920992,3344,35924336,2066289504,2102213840,26368,2066319216,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 35950704,3280,35953984,2066288560,2102242544,3495232,2069787072,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 35970352,3616,35973968,2069766560,2105740528,2496,2069772672,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 35978512,5664,35984176,2069760448,2105744624,1984,2069768096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 35999808,3184,36002992,2069745728,2105748720,47232,2069796144,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 36005040,3312,36008352,2069789488,2105797840,3515456,2073308256,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 36009264,4784,36014048,2073302256,2109316304,3360,2073310400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 36015072,4448,36019520,2073302960,2109322480,2434016,2075741424,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 36053872,3184,36057056,2075701520,2111758576,1888,2075706592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 36107056,3776,36110832,2075651840,2111762672,25849184,2101504800,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 36190640,5216,36195856,2101418752,2137614608,11818912,2113242880,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 36218672,3776,36222448,2113214272,2149436720,2354816,2115572864,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 36235920,3504,36239424,2115553488,2151792912,3750336,2119307328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 36241808,3184,36244992,2119299792,2155544784,4064384,2123367360,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 36251648,4896,36256544,2123355568,2159612112,5416480,2128776944,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 36264336,3504,36267840,2128763312,2165031152,5667744,2134434560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 36276400,3280,36279680,2134420496,2170700176,242080160,2376503936,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 36308848,4816,36313664,2376469200,2412782864,2159488,2378633504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 36314336,4656,36318992,2378625504,2414944496,1952,2378632112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 36328336,3696,36332032,2378616560,2414948592,2944,2378623200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 36337120,3536,36340656,2378611904,2414952560,1504,2378616944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 36358736,4160,36362896,2378592416,2414955312,49536,2378646112,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 36375328,3776,36379104,2378627824,2415006928,2752224,2381383824,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 36407392,4912,36412304,2381348192,2417760496,1888,2381354992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 36451232,3680,36454912,2381309648,2417764560,7814080,2389127408,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 36492672,3088,36495760,2389085056,2425580816,5456192,2394544336,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 36507072,18896,36525968,2394512704,2431038672,3483520,2398015120,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 36542272,3568,36545840,2397978784,2434524624,6336,2397988688,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 36549792,3424,36553216,2397979376,2434532592,36384,2398019184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 36567776,3184,36570960,2398000544,2434571504,54208,2398057936,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 36572704,3856,36576560,2398052288,2434628848,4283872,2402340016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 36577008,3680,36580688,2402333568,2438914256,1952,2402339200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 36581296,2848,36584144,2402334240,2438918384,2440160,2404777248,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 36620784,6128,36626912,2404733712,2441360624,1888,2404741728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 36668480,3504,36671984,2404692736,2441364720,33763776,2438460016,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 36703360,3552,36706912,2438424336,2475131248,139488,2438567376,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 36708528,3024,36711552,2438560880,2475272432,12292416,2450856320,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 36712096,2912,36715008,2450852560,2487567568,2176,2450857648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 36715456,3760,36719216,2450852512,2487571728,10786304,2461642576,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 36733264,3184,36736448,2461624112,2498360560,1920,2461629216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 36742272,8800,36751072,2461613584,2498364656,832,2461623216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 36777024,3056,36780080,2461586688,2498366768,15820672,2477410416,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 36803984,3600,36807584,2477382992,2514190576,5490432,2482877024,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 36820768,3200,36823968,2482859376,2519683344,2272,2482864848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 36829504,4096,36833600,2482853840,2519687440,1408,2482859344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 36837408,3936,36841344,2482850160,2519691504,3712,2482857808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 36845664,3024,36848688,2482848960,2519697648,8064,2482860048,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 36852736,4016,36856752,2482851104,2519707856,1568,2482856688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 36865424,3648,36869072,2482842848,2519711920,8096,2482854592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 36873712,2848,36876560,2482845664,2519722224,6880,2482855392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 36880880,3072,36883952,2482846432,2519730384,1632,2482851136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 36888176,3216,36891392,2482843120,2519734512,14048,2482860384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 36896080,3040,36899120,2482851776,2519750896,3648,2482858464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 36960640,3008,36963648,2482793392,2519757040,93376,2482889776,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 36987088,3056,36990144,2482863120,2519853264,3592384,2486458560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 37012352,4400,37016752,2486431808,2523448560,2912,2486439120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 37020624,3760,37024384,2486428336,2523452720,2240,2486434336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 37039008,4400,37043408,2486413344,2523456752,47712,2486465456,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 37045504,3424,37048928,2486456976,2523505904,3622240,2490082640,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 37049360,2816,37052176,2490077632,2527129808,4000,2490084448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 37052672,2880,37055552,2490080432,2527135984,2437120,2492520432,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 37098880,4256,37103136,2492473072,2529576208,1856,2492479184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 37145296,3792,37149088,2492431184,2529580272,25405312,2517840288,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 37232240,4576,37236816,2517750048,2554986864,12071296,2529825920,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 37259696,4160,37263856,2529798144,2567062000,2347552,2532149856,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 37277456,3328,37280784,2532130048,2569410832,3711616,2535844992,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 37283104,2512,37285616,2535838208,2573123824,4098912,2539939632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 37292432,3168,37295600,2539928384,2577223984,5356480,2545288032,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 37302816,2704,37305520,2545276992,2582582512,5691456,2550971152,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 37313312,3648,37316960,2550960048,2588277008,239531264,2790494960,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 37344224,3120,37347344,2790462720,2827810064,2158528,2792624368,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 37347904,2576,37350480,2792620160,2829970640,1984,2792624720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 37356720,3328,37360048,2792614720,2829974768,2720,2792620768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 37364784,4608,37369392,2792609472,2829978864,1504,2792615584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 37393408,2928,37396336,2792586592,2829982928,46080,2792635600,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 37409136,3120,37412256,2792619824,2830032080,2749120,2795372064,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 37439296,2944,37442240,2795341360,2832783600,1920,2795346224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 37479072,2704,37481776,2795305920,2832787696,7819616,2803128240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 37516160,3232,37519392,2803090640,2840610032,5449728,2808543600,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 37532224,3216,37535440,2808527392,2846062832,3479168,2812009776,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 37549472,3072,37552544,2811990864,2849543408,2336,2811996272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 37556528,3008,37559536,2811987968,2849547504,1984,2811992960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 37573568,3168,37576736,2811974864,2849551600,46464,2812024496,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 37578480,3008,37581488,2812019232,2849600720,3413024,2815435264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 37581936,2864,37584800,2815430992,2853015792,1984,2815435840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 37585360,2768,37588128,2815431760,2853019888,2757152,2818191680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 37617264,4032,37621296,2818158240,2855779536,1856,2818164128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 37659664,3504,37663168,2818120464,2855783632,33791744,2851915712,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 37691024,2912,37693936,2851882784,2889576720,141536,2852027232,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 37695328,2832,37698160,2852022912,2889721072,12811136,2864836880,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 37698544,2608,37701152,2864833200,2902534352,2208,2864838016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 37701600,2752,37704352,2864834128,2902538480,10362432,2875199312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 37716720,2576,37719296,2875184112,2912903408,1952,2875188640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 37724768,2944,37727712,2875179760,2912907472,864,2875183568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 37749280,2768,37752048,2875157568,2912909616,15744352,2890904688,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 37775392,3920,37779312,2890877312,2928656624,5465664,2896346896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 37791264,3024,37794288,2896330464,2934124752,1984,2896335472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 37799824,3520,37803344,2896325568,2934128912,1408,2896330496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 37807136,3280,37810416,2896322560,2934132976,3680,2896329520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 37814592,3632,37818224,2896320896,2934139120,3488,2896328016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 37822464,3120,37825584,2896319552,2934145136,1344,2896324016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 37834608,3552,37838160,2896309568,2934147728,4608,2896317728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 37842928,3200,37846128,2896308224,2934154352,1120,2896312544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 37850432,3408,37853840,2896304736,2934158576,1632,2896309776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 37858000,3136,37861136,2896301536,2934162672,1472,2896306144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 37866208,3088,37869296,2896297472,2934166768,1280,2896301840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 37929552,2752,37932304,2896238560,2934170864,25920,2896267232,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 37955648,3056,37958704,2896240832,2934199536,3495488,2899739376,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 37973808,2992,37976800,2899719696,2937696496,2528,2899725216,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 37980720,2896,37983616,2899716944,2937700560,1920,2899721760,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 37998832,2784,38001616,2899703040,2937704656,48864,2899754688,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 38003584,2944,38006528,2899748336,2937754864,3453632,2903204912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 38006944,2448,38009392,2903201440,2941210832,3808,2903207696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 38009872,2736,38012608,2903204400,2941217008,2435392,2905642528,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 38055008,2928,38057936,2905596224,2943654160,1888,2905601040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 38108384,2928,38111312,2905546912,2943658224,24871360,2930421200,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 38195520,3904,38199424,2930332752,2968532176,12473728,2942810384,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 38223248,4864,38228112,2942781504,2981009616,2342880,2945129248,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 38242272,2864,38245136,2945109472,2983354608,3711520,2948823856,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 38247584,2784,38250368,2948817264,2987067632,3730304,2952550352,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 38257152,2576,38259728,2952540384,2990800112,5451680,2957994640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 38267296,2592,38269888,2957983504,2996253392,5726816,2963712912,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 38277792,2768,38280560,2963702656,3001983216,240209920,3203915344,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 38309616,3088,38312704,3203883536,3242196240,2180576,3206067200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 38313152,2448,38315600,3206063776,3244379376,1984,3206068208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 38322912,3104,38326016,3206057488,3244383504,2752,3206063344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 38330832,2832,38333664,3206053872,3244387536,1504,3206058208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 38351760,2896,38354656,3206037008,3244391664,45632,3206085536,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 38367104,3072,38370176,3206068560,3244438736,2899360,3208970992,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 38396480,3024,38399504,3208941280,3247340784,2016,3208946320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 38437408,2688,38440096,3208904752,3247344848,8260608,3217168048,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 38475872,2560,38478432,3217130128,3255608560,5606272,3222738960,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 38489328,2960,38492288,3222724752,3261217040,3532864,3226260576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 38505936,3264,38509200,3226242624,3264751824,2528,3226248416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 38513008,2928,38515936,3226239984,3264755920,1984,3226244896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 38530208,3168,38533376,3226226672,3264760048,46304,3226276144,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 38535184,3664,38538848,3226269296,3264808144,3517760,3229790720,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 38539344,3440,38542784,3229784880,3268327664,2144,3229790464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 38543360,2480,38545840,3229785920,3268331760,2417696,3232206096,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 38574352,2848,38577200,3232174272,3270751472,1888,3232179008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 38613264,2800,38616064,3232139504,3270755568,34255616,3266397920,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 38645744,3136,38648880,3266364672,3305013552,141536,3266509344,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 38650320,3040,38653360,3266504512,3305157872,12819968,3279327520,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 38653936,2960,38656896,3279322448,3317979344,2464,3279327872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 38657648,3616,38661264,3279322208,3317983472,10346848,3289672672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 38675312,3488,38678800,3289654240,3328333040,2144,3289659872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 38684480,4000,38688480,3289648656,3328337136,864,3289653520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 38711056,3552,38714608,3289624672,3328339280,15735488,3305363712,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 38737776,2624,38740400,3305336640,3344077040,5454016,3310793280,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 38752544,3856,38756400,3310776512,3349532912,2016,3310782384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 38764400,3424,38767824,3310769184,3349537008,1408,3310774016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 38771568,3488,38775056,3310766048,3349541104,1312,3310770848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 38778976,3232,38782208,3310762992,3349545200,3456,3310769680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 38786480,3280,38789760,3310761584,3349551344,1312,3310766176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 38798528,3984,38802512,3310753056,3349555568,4224,3310761264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 38807280,2832,38810112,3310751408,3349561520,1088,3310755328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 38814272,2928,38817200,3310748480,3349565680,1632,3310753040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 38821696,3744,38825440,3310744304,3349569744,1504,3310749552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 38830464,3072,38833536,3310740336,3349573872,1280,3310744688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 38913568,3008,38916576,3310661360,3349577936,26720,3310691088,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 38942128,3168,38945296,3310661344,3349606640,3496640,3314161152,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 38965424,3504,38968928,3314135824,3353104752,2400,3314141728,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 38972752,2912,38975664,3314133056,3353108720,2112,3314138080,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 38991056,2992,38994048,3314118768,3353112816,47680,3314169440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 38996160,3120,38999280,3314163680,3353162960,3506560,3317673360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 38999728,2464,39002192,3317670016,3356672208,3680,3317676160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 39002720,2512,39005232,3317673120,3356678352,2438752,3320114384,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 39040000,2816,39042816,3320076784,3359119600,1888,3320081488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 39094368,2976,39097344,3320026320,3359123664,24909184,3344938480,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 39177216,3904,39181120,3344854448,3384035568,12198048,3357056400,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 39203856,3760,39207616,3357029168,3396236784,2509216,3359542144,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 39221088,3152,39224240,3359523232,3398747472,3777248,3363303632,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 39226560,2752,39229312,3363296688,3402526000,3770368,3367069808,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 39236096,2992,39239088,3367060256,3406299344,5082752,3372146000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 39246496,2816,39249312,3372135248,3411384560,5710464,3377848528,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 39256992,3488,39260480,3377837424,3417097904,240101408,3617942320,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 39290672,3024,39293696,3617907216,3657200912,2166688,3620076928,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 39294160,2768,39296928,3620073808,3659370736,1920,3620078496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 39303136,3152,39306288,3620068544,3659374832,2528,3620074224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 39310944,3008,39313952,3620064944,3659378896,1536,3620069488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 39330736,2976,39333712,3620049184,3659382896,45856,3620098016,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 39345776,3440,39349216,3620081904,3659431120,2762624,3622847968,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 39375168,5648,39380816,3622815104,3662195920,1920,3622822672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 39418000,2976,39420976,3622779040,3662200016,8099264,3630881280,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 39456784,2592,39459376,3630841600,3670300976,5523968,3636368160,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 39469776,3200,39472976,3636353472,3675826448,3822336,3640179008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 39486640,3344,39489984,3640160080,3679650064,2528,3640165952,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 39493872,3344,39497216,3640156912,3679654128,2080,3640162336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 39511136,3280,39514416,3640143808,3679658224,46624,3640193712,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 39516128,3728,39519856,3640187488,3679707344,3806144,3643997360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 39520288,3552,39523840,3643990928,3683514768,1920,3643996400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 39524400,4752,39529152,3643989552,3683518704,2444096,3646438400,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 39558256,2864,39561120,3646403920,3685965040,1920,3646408704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 39597840,3616,39601456,3646367680,3685969136,34983616,3681354912,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 39630896,3184,39634080,3681320080,3720954160,139744,3681463008,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 39635648,3440,39639088,3681456320,3721095408,12296512,3693756272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 39639504,2592,39642096,3693752544,3733394640,9696,3693764832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 39642576,2624,39645200,3693761760,3733406960,10774656,3704539040,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 39667072,3872,39670944,3704513616,3744184560,7232,3704524720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 39676736,3872,39680608,3704514320,3744194928,3328,3704521520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 39703200,2864,39706064,3704494912,3744200976,15784672,3720282448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 39729776,2608,39732384,3720254608,3759986992,5478976,3725736192,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 39744400,3600,39748000,3725720400,3765468400,1952,3725725952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 39753696,3280,39756976,3725715520,3765472496,1440,3725720240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 39760768,3296,39764064,3725712528,3765476592,1280,3725717104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 39767872,3264,39771136,3725709520,3765480656,3456,3725716240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 39775184,3504,39778688,3725708112,3765486800,1312,3725712928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 39787168,4032,39791200,3725699600,3765490800,4448,3725708080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 39795856,3600,39799456,3725697584,3765497040,1312,3725702496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 39803984,3072,39807056,3725692672,3765499728,1632,3725697376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 39811120,3008,39814128,3725689088,3765503216,1472,3725693568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 39818976,3296,39822272,3725685040,3765507312,1280,3725689616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 39883376,3584,39886960,3725624448,3765511408,24768,3725652800,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 39910752,3136,39913888,3725624144,3765538032,3497504,3729124784,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 39929792,3168,39932960,3729104080,3769037040,2464,3729109712,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 39936864,3872,39940736,3729100400,3769041136,2016,3729106288,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 39955568,3680,39959248,3729085984,3769045232,48544,3729138208,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 39961248,3008,39964256,3729131120,3769095376,3424864,3732558992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 39964912,3120,39968032,3732554736,3772522768,3552,3732561408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 39968656,3120,39971776,3732557136,3772528912,2510688,3735070944,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 40005600,3392,40008992,3735032784,3775041776,1888,3735038064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 40050128,3184,40053312,3734992560,3775045872,24845056,3759840800,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 40142992,3632,40146624,3759746608,3799893232,11830912,3771581152,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 40169056,3440,40172496,3771553984,3811726480,2388928,3773946352,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 40185728,3184,40188912,3773928704,3814117616,3942304,3777874192,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 40191168,3056,40194224,3777867808,3818062032,3950304,3781821168,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 40201120,3424,40204544,3781810192,3822014736,5234368,3787047984,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 40211856,3824,40215680,3787034736,3827250416,5660672,3792699232,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 40223504,3312,40226816,3792686320,3832913136,240325056,4033014688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 40257104,3344,40260448,4032980400,4073240848,2157632,4035141376,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 40260928,2688,40263616,4035136784,4075400400,1952,4035141424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 40270096,3296,40273392,4035131104,4075404496,2560,4035136960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 40278304,3280,40281584,4035127040,4075408624,1504,4035131824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 40298560,2992,40301552,4035111232,4075412784,50400,4035164624,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 40313952,3136,40317088,4035148848,4075465936,2760608,4037912592,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 40342080,3616,40345696,4037882160,4078227856,1952,4037887728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 40382288,2880,40385168,4037846624,4078231792,7826784,4045676288,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 40427632,2976,40430608,4045630720,4086061328,5463200,4051096896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 40440912,3392,40444304,4051082048,4091526352,3570432,4054655872,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 40458800,3744,40462544,4054636640,4095099184,2336,4054642720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 40466544,3232,40469776,4054633408,4095103184,2208,4054638848,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 40484256,3184,40487440,4054619872,4095107312,48384,4054671440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 40489216,3200,40492416,4054665072,4095157488,4305856,4058974128,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 40492944,2896,40495840,4058969616,4099465456,1920,4058974432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 40496384,3168,40499552,4058970032,4099469584,2451072,4061424272,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 40530736,3024,40533760,4061389328,4101923088,1856,4061394208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 40570688,3232,40573920,4061353200,4101927120,33911744,4095268176,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 40602272,4112,40606384,4095234624,4135841008,206816,4095445552,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 40607856,2976,40610832,4095440096,4136050928,12091680,4107534752,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 40611248,2736,40613984,4107530352,4148144336,2208,4107535296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 40614416,2848,40617264,4107531200,4148148464,10751008,4118285056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 40629648,2832,40632480,4118270032,4158902512,1920,4118274784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 40637920,2672,40640592,4118266016,4158906608,3328,4118272016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 40663168,3264,40666432,4118246320,4158912752,15259232,4133508816,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 40689488,4000,40693488,4133480160,4174173648,5466400,4138950560,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 40706640,4048,40710688,4138931984,4179642672,1920,4138937952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 40715904,3392,40719296,4138927408,4179646704,1440,4138932240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 40723024,2944,40725968,4138924800,4179650768,1312,4138929056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 40729808,3264,40733072,4138921824,4179654896,3072,4138928160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 40737152,3280,40740432,4138920608,4179661040,1312,4138925200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 40749472,3264,40752736,4138912304,4179665040,4800,4138920368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 40757424,2800,40760224,4138911024,4179671248,1120,4138914944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 40764736,2992,40767728,4138907584,4179675312,1632,4138912208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 40771824,2960,40774784,4138904688,4179679472,1568,4138909216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 40779488,3328,40782816,4138900720,4179683536,1248,4138905296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 40844480,3120,40847600,4138840096,4179687696,28672,4138871888,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 40869664,3360,40873024,4138845360,4179718384,3498816,4142347536,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 40890320,3984,40894304,4142324176,4183218480,2432,4142330592,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 40898320,3280,40901600,4142320912,4183222512,2112,4142326304,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 40917184,3712,40920896,4142305680,4183226576,48096,4142357488,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 40923136,3152,40926288,4142350464,4183276752,3518400,4145872016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 40926736,2864,40929600,4145866864,4186796464,3456,4145873184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 40930064,2896,40932960,4145869488,4186802448,2435904,4148308288,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 40967040,3232,40970272,4148270288,4189240560,1888,4148275408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 41011104,2800,41013904,4148230752,4189244656,26090176,4174323728,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 41102608,4128,41106736,4174230464,4215337200,12096896,4186331488,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 41130176,3280,41133456,4186303552,4227437008,2347104,4188653936,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 41146768,3696,41150464,4188636400,4229786864,3730976,4192371072,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 41152720,3984,41156704,4192362608,4233519312,4067328,4196433920,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 41168160,3184,41171344,4196417344,4237588688,5428096,4201848624,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 41178784,2928,41181712,4201837312,4243019024,5745408,4207585648,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 41189504,2800,41192304,4207574400,4248766704,242399936,4449977136,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 41222176,3840,41226016,4449942032,4491168048,2168800,4452114672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 41226608,2656,41229264,4452109632,4493338896,1920,4452114208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 41235472,3184,41238656,4452104304,4493342960,2880,4452110368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 41243360,2976,41246336,4452100848,4493347184,1504,4452105328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 41263632,5136,41268768,4452082416,4493351184,46592,4452134144,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 41281440,3328,41284768,4452114480,4493399248,2748320,4454866128,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 41311552,3232,41314784,4454834960,4496149744,1952,4454840144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 41351648,3280,41354928,4454798944,4496153872,7929856,4462732080,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 41396240,3328,41399568,4462687008,4504086576,5458016,4468148352,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 41410160,3456,41413616,4468133120,4509546736,3492480,4471629056,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 41428480,3344,41431824,4471609920,4513041744,2400,4471615664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 41435856,3264,41439120,4471606592,4513045712,1984,4471611840,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 41453632,3040,41456672,4471593168,4513049840,47232,4471643440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 41458464,2768,41461232,4471638784,4513100016,4172256,4475813808,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 41461792,2768,41464560,4475809248,4517273808,1984,4475814000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 41465120,3056,41468176,4475809760,4517277936,2537024,4478349840,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 41497568,5216,41502784,4478313648,4519816432,1888,4478320752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 41538912,2960,41541872,4478278688,4519820560,33533088,4511814736,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 41568368,3408,41571776,4511783760,4553355536,157600,4511944768,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 41573200,3056,41576256,4511938992,4553515248,12645408,4524587456,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 41576672,2544,41579216,4524583424,4566162640,2432,4524588400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 41579616,2624,41582240,4524584528,4566166768,10464160,4535051312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 41597904,2864,41600768,4535031440,4576632208,2400,4535036704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 41606352,3200,41609552,4535026592,4576636144,2208,4535032000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 41631648,5152,41636800,4535003440,4576640240,15692288,4550700880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 41660768,2880,41663648,4550670416,4592334064,5631424,4556304720,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 41675808,3024,41678832,4556289280,4597968112,2560,4556294864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 41684272,3296,41687568,4556284640,4597972208,1440,4556289376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 41691328,2960,41694288,4556281984,4597976272,1472,4556286416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 41699664,3056,41702720,4556277648,4597980368,3680,4556284384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 41706768,2784,41709552,4556276928,4597986480,3136,4556282848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 41718288,3824,41722112,4556270576,4597992688,6432,4556280832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 41727056,2976,41730032,4556270848,4598000880,1280,4556275104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 41734256,3424,41737680,4556267296,4598004976,7072,4556277792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 41741776,2768,41744544,4556268880,4598013424,11168,4556282816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 41749424,3360,41752784,4556274720,4598027504,1248,4556279328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 41813760,3216,41816976,4556214624,4598031600,71488,4556289328,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 41839776,3104,41842880,4556262416,4598105296,3607424,4559872944,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 41857984,2992,41860976,4559853024,4601714000,2464,4559858480,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 41864976,3152,41868128,4559849872,4601718000,2080,4559855104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 41883168,2768,41885936,4559836160,4601722096,48672,4559887600,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 41887840,3056,41890896,4559881408,4601772304,3869632,4563754096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 41891296,3440,41894736,4563750272,4605645008,4032,4563757744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 41895280,2944,41898224,4563752928,4605651152,2434688,4566190560,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 41940368,4848,41945216,4566142064,4608087280,1856,4566148768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 41986240,3168,41989408,4566102000,4608091408,25006880,4591112048,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 42064880,11392,42076272,4591024256,4633100528,12395104,4603430752,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 42098816,3264,42102080,4603396976,4645499056,2352544,4605752784,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 42115104,2848,42117952,4605736368,4647854320,3720192,4609459408,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 42120208,3216,42123424,4609454160,4651577584,3872096,4613329472,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 42130048,2976,42133024,4613319472,4655452496,5580512,4618902960,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 42140336,3216,42143552,4618890736,4661034288,5712640,4624606592,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 42151568,2848,42154416,4624594752,4666749168,241404896,4866002496,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 42184416,3072,42187488,4865968688,4908156176,2166912,4868138672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 42188048,4256,42192304,4868132672,4910324976,2016,4868138944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 42198960,3168,42202128,4868126944,4910329072,2912,4868133024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 42207552,3536,42211088,4868122176,4910333264,1536,4868127248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 42228352,3328,42231680,4868105584,4910337264,48064,4868156976,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 42243984,3664,42247648,4868140784,4910388432,2752704,4870897152,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 42273360,3472,42276832,4870866160,4913142992,1920,4870871552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 42313360,2880,42316240,4870830880,4913147120,7930720,4878764480,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 42351024,2784,42353808,4878725344,4921079152,5452960,4884181088,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 42365344,3120,42368464,4884166432,4926534896,3469120,4887638672,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 42381936,3200,42385136,4887621216,4930006352,2464,4887626880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 42389376,3136,42392512,4887617808,4930010320,2016,4887622960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 42407104,3024,42410128,4887604320,4930014448,46528,4887653872,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 42412112,2880,42414992,4887648608,4930063600,3409568,4891061056,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 42415504,2912,42418416,4891057120,4933475536,1952,4891061984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 42418944,2592,42421536,4891058128,4933479664,2424224,4893484944,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 42450368,2896,42453264,4893452256,4935905520,1888,4893457040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 42490640,4240,42494880,4893414768,4935909648,33606624,4927025632,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 42523328,3088,42526416,4926992960,4969519376,139712,4927135760,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 42527904,2960,42530864,4927130816,4969661680,12773024,4939906800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 42531376,2512,42533888,4939902192,4982436080,2176,4939906880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 42534288,2912,42537200,4939902976,4982440176,10351520,4950257408,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 42549168,3008,42552176,4950240800,4992792976,1920,4950245728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 42557632,3136,42560768,4950236144,4992796912,832,4950240112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 42582272,4560,42586832,4950212224,4992799056,15773088,4965989872,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 42610448,2688,42613136,4965961600,5008574736,5499680,4971463968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 42624080,3872,42627952,4971448704,5014076656,2496,4971455072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 42633792,3760,42637552,4971443200,5014080752,1440,4971448400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 42641376,3296,42644672,4971440176,5014084848,3712,4971447184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 42648848,11888,42660736,4971430256,5014090992,3584,4971445728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 42664816,3616,42668432,4971428576,5014097008,1344,4971433536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 42678416,3136,42681552,4971419840,5014101392,4544,4971427520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 42686544,2944,42689488,4971417920,5014107408,1088,4971421952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 42693952,3616,42697568,4971413904,5014111472,1600,4971419120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 42701728,3088,42704816,4971410720,5014115536,1920,4971415728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 42709776,3056,42712832,4971406832,5014119664,1248,4971411136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 42774272,3312,42777584,4971346144,5014123728,26144,4971375600,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 42800128,3248,42803376,4971349120,5014152496,3804640,4975157008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 42818640,3056,42821696,4975136944,5017958640,22080,4975162080,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 42825472,3040,42828512,4975154672,5017983184,32192,4975189904,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 42843696,2976,42846672,4975171360,5018018032,47840,4975222176,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 42848704,2736,42851440,4975216736,5018068176,3836736,4979056208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 42851872,2672,42854544,4979051712,5021906256,3744,4979058128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 42855056,2752,42857808,4979054528,5021912336,2440928,4981498208,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 42891168,3120,42894288,4981460288,5024354576,1856,4981465264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 42934592,3792,42938384,4981420256,5024358640,24941184,5006365232,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 43012032,3600,43015632,5006285568,5049301200,12450592,5018739760,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 43037520,3328,43040848,5018714496,5061755344,2347648,5021065472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 43053808,2832,43056640,5021048560,5064105200,3717760,5024769152,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 43058816,2960,43061776,5024762688,5067824464,3725984,5028491632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 43077152,2800,43079952,5028471744,5071551696,5502592,5033977136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 43087168,3392,43090560,5033965168,5077055728,5676000,5039644560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 43098672,3280,43101952,5039632912,5082734864,240707424,5280343616,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 43131232,3136,43134368,5280310128,5323444496,2169536,5282482800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 43134784,2784,43137568,5282477744,5325615312,1952,5282482480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 43144112,3472,43147584,5282471856,5325619440,2880,5282478208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 43152112,2928,43155040,5282468560,5325623600,1536,5282473024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 43171808,2768,43174576,5282453056,5325627632,47104,5282502928,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 43187280,3328,43190608,5282486144,5325676752,2767680,5285257152,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 43218224,3136,43221360,5285225344,5328446704,1920,5285230400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 43258944,4080,43263024,5285187776,5328450800,8481312,5293673168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 43297584,3776,43301360,5293632288,5336933648,5526464,5299162528,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 43311920,3280,43315200,5299146992,5342462192,3485760,5302636032,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 43330368,4160,43334528,5302615408,5345949936,2400,5302621968,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 43338352,2992,43341344,5302612688,5345954032,1984,5302617664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 43355344,2992,43358336,5302599792,5345958128,46688,5302649472,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 43360288,2992,43363280,5302642944,5346006224,3422112,5306068048,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 43363728,3616,43367344,5306063296,5349430640,1952,5306068864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 43368000,3360,43371360,5306063216,5349434576,2419200,5308485776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 43401296,3168,43404464,5308450880,5351855344,1888,5308455936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 43447696,3296,43450992,5308408416,5351859408,34284960,5342696672,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 43479520,2848,43482368,5342664720,5386147088,139712,5342807280,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 43484000,4368,43488368,5342801024,5386289392,12727072,5355532464,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 43488864,2992,43491856,5355526848,5399018704,1984,5355531824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 43492304,2896,43495200,5355527664,5399022864,10358368,5365888928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 43507552,2944,43510496,5365873200,5409383696,1920,5365878064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 43516336,2816,43519152,5365868608,5409387760,832,5365872256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 43540528,2896,43543424,5365846448,5409389872,15717632,5381566976,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 43566800,3376,43570176,5381540080,5425110256,5460384,5387003840,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 43581664,3664,43585328,5386986912,5430572240,1952,5386992528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 43590800,5296,43596096,5386980272,5430576368,1440,5386987008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 43599648,3680,43603328,5386977136,5430580464,1312,5386982128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 43607376,3168,43610544,5386974016,5430584560,3392,5386980576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 43614384,3504,43617888,5386972784,5430590672,1376,5386977664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 43627120,3712,43630832,5386963968,5430594800,4256,5386971936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 43635568,3712,43639280,5386961696,5430600976,1088,5386966496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 43643600,3984,43647584,5386957456,5430605040,1600,5386963040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 43651664,3360,43655024,5386954080,5430609104,1504,5386958944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 43659968,3760,43663728,5386949600,5430613328,1248,5386954608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 43724128,2992,43727120,5386890176,5430617296,25312,5386918480,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 43749936,3456,43753392,5386890560,5430643952,3500224,5390394240,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 43771760,3200,43774960,5390371104,5434146064,2496,5390376800,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 43781168,3520,43784688,5390365504,5434150192,2112,5390371136,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 43799360,3232,43802592,5390351632,5434154224,49952,5390404816,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 43804544,3648,43808192,5390398256,5434206448,4299072,5394700976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 43808624,2944,43811568,5394696704,5438508272,3648,5394703296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 43812224,2912,43815136,5394699280,5438514416,2441600,5397143792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 43848848,3424,43852272,5397106432,5440958704,1888,5397111744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 43892688,4320,43897008,5397065792,5440962800,24888224,5421958336,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 43978688,3840,43982528,5421869808,5465852336,12351616,5434225264,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 44004944,3200,44008144,5434205792,5478213936,2420480,5436629472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 44021312,3184,44024496,5436612160,5480636656,3707936,5440323280,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 44026976,2896,44029872,5440316704,5484346576,3735616,5444055216,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 44036448,2768,44039216,5444044960,5488084176,5065568,5449113296,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 44047552,2672,44050224,5449101760,5493151984,5827808,5454932240,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 44057952,3200,44061152,5454920464,5498981616,241799776,5696723440,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 44096032,3168,44099200,5696683696,5740782896,2166496,5698853360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 44099648,2768,44102416,5698848448,5742950864,1984,5698853200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 44108928,2864,44111792,5698842912,5742954704,2912,5698848688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 44116624,2832,44119456,5698839472,5742958928,1536,5698843840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 44136320,3392,44139712,5698823184,5742962896,46112,5698872688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 44152480,3328,44155808,5698856240,5743012048,2754048,5701613616,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 44186144,2880,44189024,5701579664,5745768688,1920,5701584464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 44226496,3056,44229552,5701543200,5745772752,7818272,5709364528,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 44267568,2928,44270496,5709322608,5753593104,5449504,5714775040,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 44281088,3328,44284416,5714760400,5759044816,3466176,5718229904,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 44298464,3984,44302448,5718209856,5762512304,2304,5718216144,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 44306352,3072,44309424,5718206784,5762516208,1952,5718211808,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 44323712,4112,44327824,5718192480,5762520304,47168,5718243760,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 44329552,2576,44332128,5718237328,5762569456,3411264,5721651168,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 44332576,2672,44335248,5721648192,5765983440,1952,5721652816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 44335776,2576,44338352,5721649216,5765987568,2425440,5724077232,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 44370160,2992,44373152,5724042352,5768415504,1888,5724047232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 44409296,3216,44412512,5724007056,5768419568,34226240,5758236512,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 44439248,2928,44442176,5758206800,5802648976,140032,5758349760,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 44443744,3120,44446864,5758344288,5802791152,11884448,5770231856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 44447280,2704,44449984,5770226896,5814676880,1920,5770231520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 44450496,2864,44453360,5770227488,5814680848,10341376,5780571728,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 44465360,4704,44470064,5780555200,5825025264,1984,5780561888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 44475600,3792,44479392,5780549968,5825029360,2560,5780556320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 44501312,2688,44504000,5780529456,5825033456,15733664,5796265808,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 44527440,2752,44530192,5796238208,5840768400,5464736,5801705696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 44542064,3776,44545840,5801688576,5846234416,1920,5801694272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 44550864,2816,44553680,5801684800,5846238480,1408,5801689024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 44557152,2976,44560128,5801682384,5846242512,1312,5801686672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 44564160,4992,44569152,5801677456,5846246608,3072,5801685520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 44573088,2736,44575824,5801676928,5846252752,1344,5801681008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 44584048,3360,44587408,5801669472,5846256880,4864,5801677696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 44591984,2880,44594864,5801668192,5846263056,1088,5801672160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 44599088,3312,44602400,5801664752,5846267152,1664,5801669728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 44606464,3824,44610288,5801660896,5846271184,1504,5801666224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 44615008,3696,44618704,5801656608,5846275312,1280,5801661584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 44679024,3312,44682336,5801597040,5846279376,25952,5801626304,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 44706848,2944,44709792,5801598288,5846308080,3495520,5805096752,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 44727696,3312,44731008,5805075024,5849806032,2368,5805080704,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 44734896,4432,44739328,5805070800,5849810128,2112,5805077344,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 44754048,3200,44757248,5805056976,5849814224,48096,5805108272,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 44759184,3328,44762512,5805101920,5849864432,3438592,5808543840,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 44762976,2896,44765872,5808540192,5853306064,3424,5808546512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 44766416,4032,44770448,5808541920,5853312368,2821952,5811367904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 44803920,3072,44806992,5811329472,5856136464,1856,5811334400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 44847104,3072,44850176,5811290352,5856140528,25366272,5836659696,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 44932048,4240,44936288,5836572880,5881509168,11847616,5848424736,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 44958528,3408,44961936,5848398304,5893360240,2496864,5850898576,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 44975088,2880,44977968,5850881472,5895859440,3826176,5854710528,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 44980352,2576,44982928,5854705344,5899688272,3904192,5858612112,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 44989552,3024,44992576,5858602128,5903594704,5218816,5863823968,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 44999552,2656,45002208,5863812880,5908815088,5683744,5869499280,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 45009792,3008,45012800,5869487536,5914500336,241798560,6111289104,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 45041408,3248,45044656,6111256928,6156301584,2171424,6113431600,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 45045120,2832,45047952,6113427552,6158475504,1984,6113432368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 45054720,3248,45057968,6113421632,6158479600,2912,6113427792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 45062864,15456,45078320,6113405472,6158483792,1536,6113422464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 45095600,2976,45098576,6113389216,6158487792,48224,6113440416,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 45111360,2992,45114352,6113424608,6158538960,2755936,6116183536,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 45139568,2976,45142544,6116155104,6161297648,1952,6116160032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 45178976,2816,45181792,6116119920,6161301712,7908928,6124031664,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 45217472,3008,45220480,6123992720,6169213200,5461504,6129457232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 45230960,3536,45234496,6129442704,6174677200,3478752,6132924992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 45249680,3312,45252992,6132904816,6178157808,2304,6132910432,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 45256880,4208,45261088,6132900816,6178161904,2016,6132907040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 45275440,2896,45278336,6132887664,6178166000,45856,6132936416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 45280112,3344,45283456,6132930672,6178214128,3426912,6136360928,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 45283920,2768,45286688,6136356784,6181643472,1984,6136361536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 45287168,2848,45290016,6136357584,6181647600,2425184,6138785616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 45319184,3152,45322336,6138753168,6184075504,1888,6138758208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 45359376,3840,45363216,6138716384,6184079600,34891392,6173611616,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 45390320,3296,45393616,6173578816,6218972432,141280,6173723392,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 45395152,4240,45399392,6173717392,6219116784,11920992,6185642624,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 45399808,3120,45402928,6185637312,6231040240,1952,6185642384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 45403504,3584,45407088,6185637248,6231044336,10766528,6196407360,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 45419680,3792,45423472,6196390272,6241813744,2144,6196396208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 45428880,2832,45431712,6196386128,6241817840,832,6196389792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 45453056,3504,45456560,6196363392,6241819952,16326752,6212693648,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 45479728,2768,45482496,6212666096,6258148592,5467264,6218136128,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 45493872,3264,45497136,6218120640,6263617776,1984,6218125888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 45502512,2768,45505280,6218116624,6263621904,1408,6218120800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 45508992,2928,45511920,6218114048,6263625968,1312,6218118288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 45515936,3072,45519008,6218111056,6263630064,3264,6218117392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 45522928,2848,45525776,6218110432,6263636208,1440,6218114720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 45533888,4496,45538384,6218101920,6263640304,4704,6218111120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 45543088,2736,45545824,6218100656,6263646480,1088,6218104480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 45550000,2688,45552688,6218097856,6263650544,1600,6218102144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 45556608,2880,45559488,6218095152,6263654640,1472,6218099504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 45564208,13216,45577424,6218081312,6263658736,1280,6218095808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 45638752,3008,45641760,6218021072,6263662832,26688,6218050768,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 45666032,2832,45668864,6218022640,6263691504,3502624,6221528096,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 45690176,3312,45693488,6221502144,6267195632,2400,6221507856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 45697472,3152,45700624,6221499072,6267199696,1984,6221504208,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 45715520,3536,45719056,6221484512,6267203568,47584,6221535632,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 45721232,3152,45724384,6221529616,6267254000,3522112,6225054880,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 45724816,2768,45727584,6225051024,6270778608,3968,6225057760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 45728112,3392,45731504,6225053248,6270784752,2439168,6227495808,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 45767856,3760,45771616,6227455376,6273226992,1888,6227461024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 45813360,3168,45816528,6227414560,6273231088,25829856,6253247584,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 45893152,3840,45896992,6253165520,6299062512,11811904,6264981264,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 45918736,3424,45922160,6264955168,6310877328,2378688,6267337280,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 45934992,2944,45937936,6267319616,6313257552,3908832,6271231392,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 45940288,2832,45943120,6271224832,6317167952,3972352,6275200016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 45949744,2768,45952512,6275190960,6321143472,5239040,6280432768,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 45959552,2736,45962288,6280422752,6326385040,5665728,6286091216,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 45970176,3600,45973776,6286078944,6332052720,240203808,6526286352,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 46001904,3280,46005184,6526254416,6572259600,2177760,6528435456,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 46005776,2704,46008480,6528431184,6574439664,1952,6528435840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 46015264,3520,46018784,6528424944,6574443728,2976,6528431440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 46023680,3216,46026896,6528421088,6574447984,1504,6528425808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 46043904,3088,46046992,6528404928,6574451920,48864,6528456880,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 46059200,3680,46062880,6528439312,6574502192,2758368,6531201360,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 46096784,3168,46099952,6531162880,6577262832,1920,6531167968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 46137232,2784,46140016,6531126912,6577266928,7814496,6538944192,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 46175328,4000,46179328,6538904848,6585084176,5459264,6544368112,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 46190976,3280,46194256,6544351904,6590546160,3478464,6547833648,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 46207680,3472,46211152,6547814752,6594025904,2400,6547820624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 46215216,2944,46218160,6547811648,6594029808,2112,6547816704,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 46232528,2624,46235152,6547798752,6594033904,47328,6547848704,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 46236912,2944,46239856,6547843168,6594083024,3426688,6551272800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 46240352,2880,46243232,6551269200,6597512432,1952,6551274032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 46243920,2640,46246560,6551269968,6597516528,2426080,6553698688,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 46276864,2928,46279792,6553664672,6599944464,1856,6553669456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 46316976,2912,46319888,6553628640,6599948528,33846624,6587478176,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 46349280,3312,46352592,6587445280,6633797872,172064,6587620656,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 46354064,3120,46357184,6587615760,6633972944,12456320,6600075200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 46357584,3136,46360720,6600071232,6646431952,2208,6600076576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 46361200,2928,46364128,6600071952,6646436080,10598688,6610673568,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 46376480,2832,46379312,6610657344,6657036656,1952,6610662128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 46384752,3520,46388272,6610652384,6657040656,864,6610656768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 46410256,2736,46412992,6610629840,6657042832,15399488,6626032064,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 46442944,3472,46446416,6625998240,6672444656,5615488,6631617200,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 46459536,4016,46463552,6631597904,6678061456,2016,6631603936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 46469792,4016,46473808,6631591648,6678065456,1664,6631597328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 46477456,3120,46480576,6631589168,6678069744,1312,6631593600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 46484752,3232,46487984,6631585600,6678073584,3648,6631592480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 46492128,3088,46495216,6631584480,6678079696,1344,6631588912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 46503712,3120,46506832,6631576992,6678083824,11104,6631591216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 46511520,2768,46514288,6631581920,6678096208,1856,6631586544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 46518816,3056,46521872,6631578336,6678100208,2080,6631583472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 46525936,2704,46528640,6631575664,6678104304,4032,6631582400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 46533408,3984,46537392,6631573056,6678110448,1504,6631578544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 46601728,3792,46605520,6631509024,6678114544,62208,6631575024,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 46628592,3440,46632032,6631546960,6678178992,3617312,6635167712,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 46648448,3280,46651728,6635147200,6681798928,2560,6635153040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 46655872,2816,46658688,6635144336,6681803024,2080,6635149232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 46673568,3632,46677200,6635129856,6681807056,48160,6635181648,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 46679248,2912,46682160,6635175104,6681857264,3838528,6639016544,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 46683024,3328,46686352,6639011936,6685698288,4000,6639019264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 46686960,3136,46690096,6639014336,6685704432,2440192,6641457664,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 46723408,4752,46728160,6641418512,6688146672,1920,6641425184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 46768544,3616,46772160,6641378608,6688150768,26015712,6667397936,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 46856448,3904,46860352,6667309232,6714169584,12030144,6679343280,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 46882336,3312,46885648,6679318336,6726203984,2354880,6681676528,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 46898928,3200,46902128,6681658752,6728560880,3711456,6685373408,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 46904528,4048,46908576,6685366352,6732274928,3963872,6689334272,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 46915360,3296,46918656,6689323216,6736241872,5437760,6694764272,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 46925888,3024,46928912,6694752448,6741681360,5725024,6700480496,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 46936784,3664,46940448,6700468176,6747408624,239633120,6940104960,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 46968976,3360,46972336,6940071776,6987044112,2163136,6942238272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 46972944,2816,46975760,6942233024,6989208784,1952,6942237792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 46981776,4736,46986512,6942226432,6989212944,2688,6942233856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 46991440,2864,46994304,6942222736,6989217040,1504,6942227104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 47011248,3120,47014368,6942206736,6989221104,46848,6942256704,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 47026912,3472,47030384,6942239968,6989270352,2756896,6945000336,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 47057792,2976,47060768,6944968112,6992028880,1952,6944973040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 47106496,3168,47109664,6944923376,6992033040,7841664,6952768208,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 47147552,2928,47150480,6952725568,6999876048,5460608,6958189104,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 47160704,3664,47164368,6958174496,7005338864,3489408,6961667568,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 47178480,3328,47181808,6961648896,7008830704,2496,6961654720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 47186000,3536,47189536,6961645232,7008834768,1984,6961650752,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 47211248,3024,47214272,6961624592,7008838864,46144,6961673760,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 47216032,3008,47219040,6961667952,7008886992,3410336,6965081296,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 47219488,2800,47222288,6965077696,7012299984,1952,6965082448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 47222912,2784,47225696,6965078416,7012304112,2667616,6967748816,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 47256576,3376,47259952,6967714496,7014974448,3712,6967721584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 47298000,4288,47302288,6967678560,7014980848,34079488,7001762336,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 47334512,3328,47337840,7001724864,7049062704,139456,7001867648,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 47339248,3456,47342704,7001861248,7049203952,12768992,7014633696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 47343248,3936,47347184,7014628064,7061975248,1984,7014633984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 47347664,4256,47351920,7014627456,7061979376,10367616,7024999328,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 47365296,3888,47369184,7024979312,7072348496,1920,7024985120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 47374768,4288,47379056,7024973440,7072352496,864,7024978592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 47402384,2704,47405088,7024949552,7072354640,15705376,7040657632,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 47428528,2752,47431280,7040630400,7088061680,5511744,7046144896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 47443024,3280,47446304,7046128656,7093574960,2272,7046134208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 47451792,3952,47455744,7046123248,7093578992,1408,7046128608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 47459664,3392,47463056,7046120032,7093583088,3680,7046127104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 47467568,4512,47472080,7046117120,7093589200,3616,7046125248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 47476176,2976,47479152,7046116096,7093595248,1408,7046120480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 47487248,3360,47490608,7046108864,7093599472,4448,7046116672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 47495664,2592,47498256,7046107360,7093605616,1088,7046111040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 47502976,2848,47505824,7046103920,7093609744,1664,7046108432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 47509968,3104,47513072,7046100736,7093613808,1472,7046105312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 47517648,3184,47520832,7046097104,7093617936,1280,7046101568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 47582576,4016,47586592,7046035408,7093622000,26848,7046066272,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 47610544,3280,47613824,7046036816,7093650640,3741248,7049781344,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 47632480,3600,47636080,7049758336,7097394416,13184,7049775120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 47640096,2944,47643040,7049766096,7097409136,13472,7049782512,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 47657824,3104,47660928,7049764208,7097425136,97696,7049865008,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 47662976,3776,47666752,7049858736,7097525488,3970560,7053833072,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 47667184,3152,47670336,7053828240,7101498576,3552,7053834944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 47670816,2976,47673792,7053830960,7101504752,2437920,7056271856,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 47707648,3632,47711280,7056233664,7103944944,1888,7056239184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 47752112,5072,47757184,7056191856,7103949040,24860704,7081057632,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 47833824,3712,47837536,7080974192,7128811728,12400832,7093378736,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 47859888,3712,47863600,7093351776,7141215376,2338976,7095694464,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 47877008,2992,47880000,7095677328,7143557328,3707360,7099387680,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 47882272,3328,47885600,7099381680,7147267280,3739648,7103124656,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 47892112,3472,47895584,7103113392,7151008976,5512160,7108629024,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 47902800,4768,47907568,7108614848,7156522416,5684192,7114303808,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 47916352,4000,47920352,7114289200,7162209552,242227488,7356520688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 47955696,3872,47959568,7356479328,7404438896,2180384,7358663584,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 47960080,2544,47962624,7358658256,7406620880,1952,7358662752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 47969216,3056,47972272,7358652704,7406624976,2560,7358658320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 47976928,2752,47979680,7358649392,7406629072,1536,7358653680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 47996096,3248,47999344,7358633856,7406633200,45024,7358682128,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 48011680,3824,48015504,7358664800,7406680304,2751680,7361420304,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 48040928,3072,48044000,7361389840,7409433840,1856,7361394768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 48088768,3936,48092704,7361345232,7409437936,7852832,7369202000,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 48127616,2480,48130096,7369161984,7417292080,5460768,7374625232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 48140272,3568,48143840,7374611216,7422755056,3467584,7378082368,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 48157952,3584,48161536,7378063856,7426225392,2368,7378069808,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 48165648,4000,48169648,7378059840,7426229488,2112,7378065952,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 48183984,3280,48187264,7378046352,7426233616,45408,7378095040,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 48189056,2848,48191904,7378089808,7426281712,3408320,7381500976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 48192384,2816,48195200,7381496400,7429691600,1952,7381501168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 48195728,2512,48198240,7381497488,7429695728,2422752,7383922752,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 48227520,3168,48230688,7383890896,7432121584,1856,7383895920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 48267808,2784,48270592,7383855056,7432125648,34878368,7418736208,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 48298304,2928,48301232,7418703840,7467005072,142560,7418849328,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 48302704,3760,48306464,7418844112,7467150576,11880896,7430728768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 48307056,2720,48309776,7430723296,7479033072,1952,7430727968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 48310240,3904,48314144,7430723024,7479037168,10359680,7441086608,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 48326832,2960,48329792,7441069296,7489399088,6624,7441078880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 48335312,3488,48338800,7441068416,7489407216,1568,7441073472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 48361296,2944,48364240,7441047072,7489411312,15720800,7456770816,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 48387760,2720,48390480,7456744384,7505134864,5521792,7462268896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 48405280,3264,48408544,7462250768,7510659312,3904,7462257936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 48414048,3120,48417168,7462248256,7510665424,1440,7462252816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 48420864,2912,48423776,7462245776,7510669552,3008,7462251696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 48427840,3168,48431008,7462244688,7510675696,3520,7462251376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 48435056,2992,48438048,7462243728,7510681776,2048,7462248768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 48447040,5072,48452112,7462233824,7510685936,6688,7462245584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 48456896,3600,48460496,7462233632,7510694128,2848,7462240080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 48464656,4368,48469024,7462229264,7510698288,1600,7462235232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 48473168,3184,48476352,7462225968,7510702320,2304,7462231456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 48481088,3184,48484272,7462222144,7510706416,2240,7462227568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 48545280,2880,48548160,7462162352,7510710512,29504,7462194736,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 48573248,2992,48576240,7462165056,7510741296,3520864,7465688912,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 48592848,2864,48595712,7465669392,7514265104,5600,7465677856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 48599600,2864,48602464,7465669520,7514271984,1952,7465674336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 48617440,3008,48620448,7465655504,7514275952,52032,7465710544,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 48622416,3472,48625888,7465704528,7514330416,4260224,7469968224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 48626368,2960,48629328,7469962880,7518592208,1984,7469967824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 48629824,3136,48632960,7469963376,7518596336,2447712,7472414224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 48670864,3104,48673968,7472372832,7521046800,1856,7472377792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 48723920,3072,48726992,7472323616,7521050608,25226208,7497552896,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 48804096,3680,48807776,7497470320,7546278096,12453792,7509927792,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 48831328,3248,48834576,7509900896,7558735472,2351712,7512255856,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 48848192,3264,48851456,7512238832,7561090288,3714304,7515956400,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 48853744,2640,48856384,7515950992,7564807376,3786336,7519739968,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 48863008,2768,48865776,7519730400,7568596176,5154144,7524887312,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 48873008,2720,48875728,7524877344,7573753072,5813440,7530693504,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 48883664,3088,48886752,7530681616,7579568368,240922976,7771607680,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 48918176,3008,48921184,7771571888,7820493072,2156896,7773731792,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 48921664,2784,48924448,7773727216,7822651664,1952,7773731952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 48931216,3200,48934416,7773721312,7822655728,3360,7773727872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 48939184,3024,48942208,7773719632,7822661840,1568,7773724224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 48958992,2896,48961888,7773703984,7822665872,51264,7773758144,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 48974352,3440,48977792,7773741392,7822719184,2771712,7776516544,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 49003200,2976,49006176,7776485968,7825492144,1952,7776490896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 49042816,4128,49046944,7776449360,7825496304,7849312,7784302800,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 49090640,3392,49094032,7784253312,7833347344,5451136,7789707840,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 49104256,4160,49108416,7789691824,7838800240,3479136,7793175120,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 49122672,3456,49126128,7793154528,7842280656,2368,7793160352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 49130368,3104,49133472,7793151280,7842284752,2144,7793156528,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 49148048,2976,49151024,7793137856,7842288880,47424,7793188256,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 49152784,3008,49155792,7793183264,7842339056,3417600,7796603872,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 49156272,3008,49159280,7796598880,7845758160,2016,7796603904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 49159808,3152,49162960,7796599328,7845762288,2423840,7799026320,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 49193792,2928,49196720,7798992448,7848189168,1888,7798997264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 49235024,3184,49238208,7798954800,7848193008,34270688,7833228672,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 49265936,2944,49268880,7833196672,7882465552,140768,7833340384,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 49270336,3232,49273568,7833334288,7882607856,11865984,7845203504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 49274224,3792,49278016,7845197104,7894475120,2464,7845203360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 49278608,2928,49281536,7845197552,7894479088,10348864,7855549344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 49293728,4224,49297952,7855532752,7904830704,1952,7855538928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 49303280,2912,49306192,7855528608,7904834800,2656,7855534176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 49329184,3088,49332272,7855506624,7904838896,15733856,7871243568,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 49355536,2560,49358096,7871217632,7920575728,5463552,7876683744,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 49370032,3536,49373568,7876668272,7926041840,1920,7876673728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 49378896,3088,49381984,7876663920,7926045904,1440,7876668448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 49385776,4128,49389904,7876660096,7926050000,1312,7876665536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 49393696,2992,49396688,7876657408,7926054096,3520,7876663920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 49400864,2912,49403776,7876656496,7926060272,1344,7876660752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 49412160,4224,49416384,7876647984,7926064368,4992,7876657200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 49421152,2960,49424112,7876646528,7926070640,1120,7876650608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 49428624,2992,49431616,7876643024,7926074640,1632,7876647648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 49435632,2832,49438464,7876640240,7926078704,1504,7876644576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 49443168,3296,49446464,7876636336,7926082800,1216,7876640848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 49516688,3232,49519920,7876566976,7926086896,25632,7876595840,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 49541744,2992,49544736,7876570832,7926115568,3505824,7880079648,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 49562112,2960,49565072,7880058720,7929623792,2432,7880064112,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 49569008,2848,49571856,7880056032,7929627888,1920,7880060800,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 49587456,3328,49590784,7880041200,7929631984,47648,7880092176,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 49592704,11806400,61399104,7868282032,7929681136,3448928,7883537360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 61399680,11859920,73259600,7859873440,7933133040,4032,7871737392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 73260240,3024,73263264,7859875984,7933139248,2809952,7862688960,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 73307664,2350480,75658144,7860293968,7935952112,1856,7862646304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 75703072,3960864,79663936,7856292336,7935956272,25293632,7885546832,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 79746944,3917648,83664592,7877587488,7961252080,11798880,7893304016,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 88963632,5733888,94697520,7878357152,7973054672,2382432,7886473472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 94711456,240306272,335017728,7640421872,7975439600,3919904,7884648048,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 335024416,2168400,337192816,7642169728,7979362544,3922944,7648261072,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 337203344,3712,337207056,7646080448,7983287504,5215584,7651299744,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 337215072,2800,337217872,7651287936,7988505808,5690784,7656981520,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 337230096,3168,337233264,7656967392,7994200656,241148000,7898118560,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 337294976,6464,337301440,7898049872,8235351312,2184512,7900240848,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 337301936,2723280,340025216,7897513296,8237538512,1984,7900238560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 340035552,4928,340040480,7897502160,8237542640,3040,7897510128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 340045936,7686896,347732832,7889815920,8237548752,1568,7897504384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 347761408,5435120,353196528,7884356256,8237552784,52064,7889843440,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 353214192,3701616,356915808,7880690320,8237606128,2756640,7887148576,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 356948160,4160,356952320,7883413488,8240365808,1888,7883419536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 356996944,3296,357000240,7883369664,8240369904,7952640,7891325600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 357046496,5888,357052384,7891271984,8248324368,5449216,7896727088,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 357064880,4020800,361085680,7892689408,8253775088,3472800,7900183008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 361106736,3728,361110464,7896139056,8257249520,2400,7896145184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 361114448,2413456,363527904,7893725712,8257253616,1984,7896141152,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 363545184,5984,363551168,7893706544,8257257712,45696,7893758224,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 363553104,34544576,398097680,7859208160,8257305840,3431232,7897183968,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 398098240,141808,398240048,7862499232,8260739280,1952,7862642992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 398240656,11924096,410164752,7850578720,8260743472,2425536,7864928352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 410204272,4128,410208400,7852962912,8263171312,1888,7852968928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 410248736,10679792,420928528,7842246880,8263175408,34385728,7887312400,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 420958736,4240,420962976,7876599472,8297562448,140160,7876743872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 420964432,4400,420968832,7876736880,8297705712,11916032,7888657312,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 420969408,16172368,437141776,7872482272,8309624048,2432,7888657072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 437142592,5455488,442598080,7867030064,8309628144,10800032,7883285584,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 442612544,3056,442615600,7877814720,8320430320,1920,7877819696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 442622224,2896,442625120,7877809296,8320434416,832,7877813024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 442652112,3360,442655472,7877781152,8320436624,16112576,7893897088,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 442684560,5488,442690048,7893861104,8336551152,5465952,7899332544,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 442708112,3952,442712064,7899307248,8342019312,1952,7899313152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 442718272,3408,442721680,7899301760,8342023440,1440,7899306608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 442728144,5200,442733344,7899294192,8342027536,1312,7899300704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 442738480,6032,442744512,7899287088,8342031600,3680,7899296800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 442749424,4256,442753680,7899284096,8342037776,1312,7899289664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 442768256,7120,442775376,7899266432,8342041808,4896,7899278448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 442784720,4832,442789552,7899258432,8342047984,1088,7899264352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 442793920,3362736,446156656,7895895424,8342052080,1632,7899259792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 446161632,3696,446165328,7895890848,8342056176,1472,7895896016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 446172096,3840,446175936,7895884336,8342060272,1248,7895889424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 446247728,3776,446251504,7895812864,8342064368,26112,7895842752,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 446277584,3390880,449668464,7892424576,8342093040,3493632,7899309088,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 449690320,3728,449694048,7895893904,8345587952,2560,7895900192,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 449698016,2414112,452112128,7893479888,8345592016,1984,7895895984,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 452128752,4144,452132896,7893463248,8345596144,47840,7893515232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 452135120,25754352,477889472,7867756848,8345646320,3444576,7896955776,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 477889952,11822032,489711984,7859380224,8349092208,4096,7871206352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 489712736,5920,489718656,7859379568,8349098224,2448192,7861833680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 489767792,2294704,492062496,7859486160,8351548656,1888,7861782752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 492114336,3760928,495875264,7855677520,8351552784,25738272,7885176720,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 495967680,3856864,499824544,7877471088,8377295632,11891808,7893219760,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 505233904,5665120,510899024,7878291168,8389190192,2346944,7886303232,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 510913488,240436896,751350384,7640188544,8391538928,3761664,7884387104,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 751355552,2164752,753520304,7641782848,8395303152,4026528,7647974128,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 753528464,3264,753531728,7645799808,8399331536,5417472,7651220544,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 753539184,3008,753542192,7651209408,8404751600,5663296,7656875712,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 753552496,3328,753555824,7656860544,8410416368,241593728,7898457600,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 753597488,7360,753604848,7898406944,8652011792,2164960,7900579264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 753605360,2726944,756332304,7897846240,8654178544,1920,7900575104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 756341584,6816,756348400,7897834240,8654182640,2976,7897844032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 756353632,7728624,764082256,7890104640,8654186896,1536,7897834800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 764105344,5441520,769546864,7884643968,8654190832,48416,7890133904,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 769561696,3448912,773010608,7881231424,8654242032,2752160,7887432496,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 773041040,4144,773045184,7883950384,8656995568,1888,7883956416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 773088336,5424,773093760,7883905904,8656999664,7942144,7891853472,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 773132160,3328,773135488,7891808432,8664943920,5458208,7897269968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 773146880,3889008,777035888,7893368960,8670404848,3475616,7900733584,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 777056048,3504,777059552,7896823824,8673883376,4320,7896831648,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 777063680,2707872,779771552,7894118128,8673889680,19776,7896845776,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 779787840,3856,779791696,7894120320,8673912016,52288,7894176464,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 779793584,33119872,812913456,7861053856,8673967312,4322208,7898495936,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 812914032,187792,813101824,7865189872,8678291696,1952,7865379616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 813102480,12696720,825799200,7852496560,8678295760,2444640,7867637920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 825834960,5632,825840592,7854902560,8680743152,1920,7854910112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 825881168,10399248,836280416,7844466832,8680747248,34577664,7889443744,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 836312144,3328,836315472,7879011232,8715326704,141088,7879155648,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 836317184,3008,836320192,7879148880,8715469072,12382976,7891534864,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 836320688,15581440,851902128,7875951264,8727853392,1984,7891534688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 851902672,5573968,857476640,7870380720,8727857360,10443584,7886398272,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 857490592,3136,857493728,7880809488,8738303216,1952,7880814576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 857499872,2736,857502608,7880804704,8738307312,2592,7880810032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 857525312,2944,857528256,7880783152,8738311408,15308832,7896094928,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 857554704,2960,857557664,7896064592,8753622256,5479104,7901546656,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 857569936,3104,857573040,7901529664,8759102704,1952,7901534720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 857578896,2768,857581664,7901525136,8759106800,1408,7901529312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 857585392,2784,857588176,7901522720,8759110896,3648,7901529152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 857592800,3616,857596416,7901520624,8759117040,3072,7901527312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 857600800,2976,857603776,7901519408,8759123184,1376,7901523760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 857616288,10272,857626560,7901500624,8759127184,4640,7901515536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 857631712,6768,857638480,7901494976,8759133456,1152,7901502896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 857644512,3638560,861283072,7897854192,8759137264,1600,7901494352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 861287728,3328,861291056,7897850528,8759141584,1472,7897855328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 861296528,3264,861299792,7897845920,8759145712,1248,7897850432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 861370064,3376,861373440,7897776336,8759149776,25216,7897804928,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 861398816,3758960,865157776,7894018656,8759176432,3694624,7901472240,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 865177456,3296,865180752,7897693344,8762874096,2400,7897699040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 865184752,2416176,867600928,7895277328,8762878256,2176,7897695680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 867617840,3488,867621328,7895260960,8762882288,50528,7895314976,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 867623760,23921488,891545248,7871389232,8762934480,3638240,7898948960,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 891545968,12482496,904028464,7862546336,8766574800,1952,7875030784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 904029136,4048,904033184,7862545744,8766578928,2442912,7864992704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 904078192,2298928,906377120,7862647248,8769024368,1920,7864948096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 906426704,3665792,910092496,7858935872,8769028368,25552160,7888153824,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 910192640,3624192,913816832,7880765456,8794582288,12077248,7896466896,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 919352704,5796848,925149552,7881512544,8806662096,2352160,7889661552,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 925163920,239341408,1164505328,7644510240,8809015568,3721376,7887573024,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1164510912,2162880,1166673792,7646064976,8812738768,4098432,7652326288,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1166682640,3280,1166685920,7650153968,8816839888,5346304,7655503552,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1166693600,2816,1166696416,7655492848,8822189264,5725184,7661220848,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1166708128,3216,1166711344,7661205184,8827916528,241606016,7902814416,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 1166759440,8128,1166767568,7902757696,9069525264,2174688,7904940512,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 1166768208,2728592,1169496800,7902205520,9071702320,1952,7904936064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 1169508624,4384,1169513008,7902193376,9071706384,2720,7902200480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 1169518000,7785488,1177303488,7894406928,9071710416,1536,7902193952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 1177330704,5426464,1182757168,7888957344,9071714512,47232,7894431040,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1182776848,3458304,1186235152,7885528512,9071763664,2758720,7891745536,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 1186266928,4224,1186271152,7888253248,9074524400,1952,7888259424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1186319216,3120,1186322336,7888206160,9074528496,7921504,7896130784,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1186364320,3824,1186368144,7896083200,9082451344,5461920,7901548944,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 1186381648,3372992,1189754640,7898160608,9087915248,3486688,7905020288,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 1189775840,4432,1189780272,7901624768,9091405040,2400,7901631600,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1189784432,2427904,1192212336,7899196800,9091409136,2080,7901626784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1192229088,4480,1192233568,7899179632,9091413200,46048,7899230160,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1192235504,34629104,1226864608,7864597744,9091462352,3874528,7903101376,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 1226865184,142416,1227007600,7868331648,9095339248,1952,7868476016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 1227008240,12762544,1239770784,7855572560,9095343344,2624832,7870959936,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 1239810080,4960,1239815040,7858155888,9097970928,1856,7858162704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1239856560,10376672,1250233232,7847741792,9097975024,33697120,7891815584,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1250265872,4592,1250270464,7881404432,9131674896,139840,7881548864,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1250272576,4880,1250277456,7881539744,9131817200,11919712,7893464336,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 1250278192,15756848,1266035040,7877704560,9143739600,1952,7893463360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 1266036336,5823472,1271859808,7871883952,9143743760,10381664,7888089088,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 1271875280,3280,1271878560,7882250384,9154128944,1952,7882255616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1271885296,2800,1271888096,7882245008,9154133104,1824,7882249632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1271915792,4544,1271920336,7882215968,9154136304,15711680,7897932192,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1271948400,6048,1271954448,7897896160,9169850608,5507136,7903409344,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 1271974016,3888,1271977904,7903381824,9175359728,1920,7903387632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 1271984176,6096,1271990272,7903373552,9175363824,1568,7903381216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 1271994864,4976,1271999840,7903368080,9175367920,3168,7903376224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 1272004384,6688,1272011072,7903363024,9175374096,3392,7903373104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 1272016304,7840,1272024144,7903356000,9175380144,1344,7903365184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 1272038832,8480,1272047312,7903337024,9175384336,4928,7903350432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 1272054176,5904,1272060080,7903330656,9175390736,1120,7903337680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 1272064336,3417328,1275481664,7899912784,9175394448,1632,7903331744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 1275486768,4320,1275491088,7899907552,9175398640,1696,7899913568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 1275498016,3408,1275501424,7899901344,9175402768,7616,7899912368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1275572976,3696,1275576672,7899836304,9175412976,26336,7899866336,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 1275602496,4198528,1279801024,7895640496,9175441520,3844544,7903683568,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 1279823024,3424,1279826448,7899461344,9179287792,2336,7899467104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1279830320,2423072,1282253392,7897038496,9179291888,2048,7899463616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1282270336,4432,1282274768,7897021216,9179295984,48768,7897074416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1282276992,24866304,1307143296,7872203888,9179347184,3828800,7900898992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 1307143776,12477136,1319620912,7863557056,9183177968,4032,7876038224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 1319621712,3808,1319625520,7863558592,9183184112,2423808,7865986208,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 1319668752,2294880,1321963632,7863647392,9185611024,1888,7865944160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1322013136,3678496,1325691632,7859923424,9185615056,24620416,7888222336,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1325793664,3633296,1329426960,7880811232,9210238192,12466528,7896911056,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 1334578096,5874496,1340452592,7882255168,9222707760,2350880,7890480544,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 1340468096,238892736,1579360832,7645700784,9225061616,3725056,7888318576,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1579364448,2156080,1581520528,7647267424,9228787952,3735968,7653159472,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1581528416,3232,1581531648,7650993872,9232525520,5525984,7656523088,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1581539200,2416,1581541616,7656511488,9238053104,5802432,7662316336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1581551008,2944,1581553952,7662304176,9243858128,242206816,7904513936,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 1581587376,5152,1581592528,7904474432,9486066960,2168960,7906648544,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 1581592960,2744896,1584337856,7903899984,9488237840,2016,7906646896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 1584346400,4112,1584350512,7903891392,9488241904,2944,7903898448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 1584355856,7793680,1592149536,7896096592,9488246128,1536,7903891808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 1592172256,5592352,1597764608,7890485488,9488250096,45504,7896123344,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1597779344,3648176,1601427520,7886869648,9488297168,2763104,7893280928,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 1601457584,5504,1601463088,7889599936,9491063024,1920,7889607360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1601502528,3136,1601505664,7889561456,9491067120,7944544,7897509136,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1601544480,2784,1601547264,7897467152,9499014416,5450496,7902920432,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 1601558800,3786304,1605345104,7899121088,9504466192,3475360,7906382752,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 1605362560,3504,1605366064,7902576736,9507942800,2368,7902582608,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1605370032,2420304,1607790336,7900156400,9507946736,2048,7902578752,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1607806608,3264,1607809872,7900140960,9507950832,47552,7900191776,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1607811776,34027600,1641839376,7866160608,9507999984,3421152,7903609360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 1641840048,140432,1641980480,7869443792,9511424272,1952,7869586176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 1641981120,12368192,1654349312,7857079024,9511428336,2483008,7871930224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 1654384384,4352,1654388736,7859523920,9513912656,2368,7859530640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1654430064,10593680,1665023744,7848893104,9513916848,34376960,7893863744,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1665054544,4224,1665058768,7883237696,9548296464,139616,7883381536,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1665060400,4352,1665064752,7883374016,9548438768,12796832,7896175200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 1665065200,15672688,1680737888,7880499824,9561237712,2240,7896174752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 1680738400,5455632,1686194032,7875047808,9561241840,10357696,7890861136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 1686208144,3024,1686211168,7885390480,9571601648,1920,7885395424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1686217616,3264,1686220880,7885384864,9571605744,832,7885388960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1686244048,3008,1686247056,7885360800,9571607856,15753632,7901117440,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1686273504,4832,1686278336,7901084720,9587363056,5458112,7906547664,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 1686296208,4416,1686300624,7906522400,9592823024,1984,7906528800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 1686306352,4080,1686310432,7906516784,9592827216,1408,7906522272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 1686314784,4704,1686319488,7906511728,9592831216,1312,7906517744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 1686323696,4992,1686328688,7906506624,9592835312,3296,7906514912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 1686333600,4336,1686337936,7906503520,9592841456,1344,7906509200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 1686348208,6320,1686354528,7906490928,9592845456,4448,7906501696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 1686360256,5248,1686365504,7906486160,9592851664,1088,7906492496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 1686370368,3391328,1689761696,7903094000,9592855696,1632,7906486960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 1689766336,3504,1689769840,7903090048,9592859888,1472,7903095024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 1689775344,5264,1689780608,7903083376,9592863984,1280,7903089920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1689847168,3584,1689850752,7903017328,9592868080,25184,7903046096,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 1689876800,3862112,1693738912,7899155792,9592894704,3628416,7906646320,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 1693766128,3248,1693769376,7902764528,9596533904,17728,7902785504,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1693773536,2819920,1696593456,7899961024,9596554480,11680,7902792624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 1696610752,4016,1696614768,7899954080,9596568848,69088,7900027184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 1696616848,25285088,1721901936,7874737536,9596639472,4118272,7904140896,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 1721902592,11903024,1733805616,7866954400,9600760016,3840,7878861264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 1733806272,2928,1733809200,7866957024,9600766224,2419840,7869379792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 1733851440,2508640,1736360080,7866827872,9603187952,1888,7869338400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 1736407728,3696624,1740104352,7863087696,9603192048,24930496,7891714816,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 1740194480,3860432,1744054912,7884069488,9628124400,12466368,7900396288,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 1749176464,5699216,1754875680,7885718000,9640593680,2350944,7893768160,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 1754890528,240183200,1995073728,7647873104,9642946832,3729024,7891785328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1995079392,2160912,1997240304,7649437920,9646678224,3748576,7655347408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1997248592,3360,1997251952,7653176160,9650428112,5354496,7658534016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1997259936,3008,1997262944,7658521776,9655784720,5783808,7664308592,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 1997272656,3040,1997275696,7664295616,9661571312,241193152,7905491808,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 1997309504,8512,1997318016,7905448368,9902766384,2168640,7907625520,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 1997318640,2735392,2000054032,7904883168,9904937200,1952,7907620512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 2000062368,5552,2000067920,7904873376,9904941296,2944,7904881872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2000073360,7796944,2007870304,7897075216,9904945520,1568,7904873728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2007892000,5452368,2013344368,7891605088,9904949456,47232,7897104688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2013360384,3693200,2017053584,7887945056,9904998640,2753088,7894391344,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 2017085744,3984,2017089728,7890664496,9907754224,1888,7890670368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2017130592,3728,2017134320,7890624000,9907758320,7844192,7898471920,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2017175040,4112,2017179152,7898426112,9915605264,5462816,7903893040,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 2017191040,3990144,2021181184,7899889168,9921070352,3466848,7907346160,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 2021201840,3728,2021205568,7903334064,9924539632,2304,7903340096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2021209680,2415488,2023625168,7900918560,9924543728,2048,7903336096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2023641696,4512,2023646208,7900901584,9924547792,47456,7900953552,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2023648080,34033792,2057681872,7866915072,9924596944,3416192,7904365056,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 2057682416,142256,2057824672,7870191440,9928016112,1952,7870335648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2057825312,11888304,2069713616,7858306592,9928020208,2424832,7872619728,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 2069748688,5904,2069754592,7860693520,9930448112,1856,7860701280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2069796128,10665632,2080461760,7849990448,9930452208,34503808,7895159888,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2080493008,6576,2080499584,7884458384,9964957968,140736,7884605696,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2080501376,6864,2080508240,7884593024,9965101264,12747232,7897347120,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 2080508704,16200080,2096708784,7881141312,9977850096,2208,7897343600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2096709632,5469088,2102178720,7875675472,9977854192,10374624,7891519184,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 2102194704,3648,2102198352,7886033056,9988231408,1920,7886038624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2102204848,2896,2102207744,7886027760,9988235504,2528,7886033184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2102235472,3760,2102239232,7886000368,9988239600,15701312,7901705440,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2102284000,6896,2102290896,7901652768,10003943664,5469120,7907128784,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 2102310128,6272,2102316400,7907098496,10009414896,1920,7907106688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2102324864,4672,2102329536,7907089456,10009418992,1408,7907095536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 2102336016,5248,2102341264,7907081824,10009423088,1376,7907088448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2102346512,6240,2102352752,7907074432,10009427184,3136,7907083808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2102357472,6080,2102363552,7907069776,10009433328,1344,7907077200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 2102377168,8256,2102385424,7907052000,10009437424,6720,7907066976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 2102391616,6864,2102398480,7907047136,10009445616,1088,7907055088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 2102403520,3344960,2105748480,7903701232,10009449712,1600,7907047792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 2105753712,3840,2105757552,7903696256,10009453808,1472,7903701568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2105763920,3536,2105767456,7903690448,10009457904,1312,7903695296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2105835568,3552,2105839120,7903622880,10009462000,27584,7903654016,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 2105865296,3458736,2109324032,7900168656,10009492688,3491904,7907119296,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 2109346016,3472,2109349488,7903638176,10012987664,2528,7903644176,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2109353424,2412672,2111766096,7901225728,10012991824,2016,7903640416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2111782944,3744,2111786688,7901209136,10012995824,48352,7901261232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2111788880,25833712,2137622592,7875423408,10013046000,4232896,7905490016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 2137623056,11820816,2149443872,7867837360,10017281232,4096,7879662272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2149444448,3232,2149447680,7867839696,10017287376,2498976,7870341904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 2149496496,2304640,2151801136,7867987904,10019789040,1952,7870294496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2151852384,3701232,2155553616,7864239488,10019793104,24911776,7892852496,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2155687008,3934192,2159621200,7885085856,10044707056,12388768,7901408816,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 2165039888,5668176,2170708064,7886394224,10057102288,2363744,7894426144,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 2170723840,242069584,2412793424,7646675648,10059469072,3784768,7892530000,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2412799152,2153008,2414952160,7648303632,10063255792,3747296,7654203936,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2414960832,3536,2414964368,7652040000,10067004368,5073216,7657116752,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2414972144,2704,2414974848,7657105808,10072080656,5698400,7662806912,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2414986000,3376,2414989376,7662790960,10077780336,242541280,7905335616,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 2415037552,9376,2415046928,7905276032,10320322960,2168832,7907454240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 2415048112,2720096,2417768208,7904725472,10322493680,1920,7907447488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 2417778112,5248,2417783360,7904714416,10322497776,2944,7904722608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2417788816,7801120,2425589936,7896912096,10322502032,1536,7904714752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2425616288,5431392,2431047680,7891458288,10322505968,49696,7896939376,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2431064576,3467776,2434532352,7888024880,10322557232,2751232,7894243888,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 2434563984,3520,2434567504,7890743200,10325310704,1952,7890748672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2434608336,11424,2434619760,7890695040,10325314800,7992640,7898699104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2434661104,4656,2434665760,7898644528,10333310288,5463872,7904113056,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 2434678064,4243856,2438921920,7899853488,10338775408,3477760,7907575104,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 2438941040,3680,2438944720,7903310112,10342254832,2368,7903316160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2438948816,2419296,2441368112,7900890816,10342258928,2048,7903312160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2441384912,5664,2441390576,7900872448,10342263024,46048,7900924160,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2441392720,33746240,2475138960,7867173216,10342312176,3447488,7904366944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 2475139568,141456,2475281024,7870481008,10345762032,1952,7870624416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2475281680,12293504,2487575184,7858190944,10345766128,2423296,7872907744,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 2487613072,7264,2487620336,7860571648,10348191984,1920,7860580832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2487661520,10706656,2498368176,7849827904,10348196080,34563424,7895097984,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2498399600,5312,2498404912,7884357376,10382762288,140576,7884503264,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2498406576,3440,2498410016,7884495632,10382905648,12654624,7897153696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 2498410816,15788176,2514198992,7881363200,10395562192,2688,7897154064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2514199536,5491632,2519691168,7875875152,10395566320,10480992,7891847776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 2519705616,2976,2519708592,7886341440,10406050032,1920,7886346336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2519715168,2944,2519718112,7886335984,10406054096,1088,7886340016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2519741632,2944,2519744576,7886312080,10406056656,15701088,7902016112,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2519773408,4144,2519777552,7901982688,10421760240,5465056,7907451888,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 2519790416,3824,2519794240,7907434192,10427228432,1920,7907439936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2519800800,2880,2519803680,7907428816,10427232496,1408,7907433104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 2519807424,2880,2519810304,7907426288,10427236592,1280,7907430448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2519814960,3104,2519818064,7907422624,10427240688,3232,7907428960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2519822432,2736,2519825168,7907421696,10427246864,1344,7907425776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 2519833776,3104,2519836880,7907414048,10427250928,4832,7907421984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 2519842208,19840,2519862048,7907394992,10427257040,1120,7907415952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 2519866368,3589920,2523456288,7903804944,10427261232,1632,7907396496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 2523460880,3008,2523463888,7903801376,10427265264,1472,7903805856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2523469232,3648,2523472880,7903796480,10427269360,1280,7903801408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2523542000,3472,2523545472,7903727984,10427273456,25920,7903757376,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 2523570768,3566720,2527137488,7900164640,10427302128,3508896,7907240256,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 2527159872,3264,2527163136,7903649008,10430812144,2464,7903654736,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2527167136,2416960,2529584096,7901232400,10430816496,2016,7903651376,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2529601088,3776,2529604864,7901215728,10430820592,48512,7901268016,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2529607056,25387232,2554994288,7875877504,10430871792,3516544,7904781280,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 2554994816,12074240,2567069056,7867322224,10434391280,4384,7879400848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2567069680,3744,2567073424,7867324000,10434397424,2736736,7870064480,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 2567117872,2300880,2569418752,7867717872,10437136624,1888,7870020640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2569464176,3672864,2573137040,7864003680,10437140720,25314144,7892990688,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2573239264,3993840,2577233104,7885223072,10462456176,12035712,7901252624,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 2582592704,5692160,2588284864,7886212496,10474497360,2454048,7894358704,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 2588300928,239518224,2827819152,7649134688,10476953840,3817408,7892470320,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2827823696,2154608,2829978304,7650795056,10480773360,3902560,7656852224,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2829986400,3600,2829990000,7654688928,10484678928,5091520,7659784048,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2829997936,2992,2830000928,7659771344,10489772272,5706880,7665481216,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 2830012576,3152,2830015728,7665466368,10495482096,242566784,7908036304,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 2830050096,6160,2830056256,7907995088,10738051344,2171840,7910173088,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 2830056720,2734512,2832791232,7907435024,10740226256,1984,7910171520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 2832799776,4880,2832804656,7907425728,10740230384,3104,7907433712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2832810096,7807648,2840617744,7899618752,10740236496,1536,7907427936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2840638672,5434064,2846072736,7894167792,10740240528,47072,7899648928,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2846088784,3462528,2849551312,7890738464,10740289776,2751712,7896952704,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 2849582400,4832,2849587232,7893456080,10743043312,1888,7893462800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2849627280,3936,2849631216,7893416192,10743047408,7940800,7901360928,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2849670288,2944,2849673232,7901316352,10750989584,5517184,7906836480,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 2849684752,3338896,2853023648,7903485264,10756508912,3821792,7910645952,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 2853043536,3520,2853047056,7907285440,10760332496,2496,7907291456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2853051120,2736096,2855787216,7904549504,10760336720,2048,7907287648,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2855803920,3024,2855806944,7904533776,10760340720,46816,7904583616,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2855808912,33775376,2889584288,7870804528,10760388816,3812448,7908392352,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 2889584848,143824,2889728672,7874475600,10764204272,1920,7874621344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2889729328,12812560,2902541888,7861666448,10764208336,2426976,7876905984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 2902578064,3920,2902581984,7864055312,10766637296,1888,7864061120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2902622992,10288288,2912911280,7853730112,10766641392,34306016,7898324416,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2912943696,3824,2912947520,7888001968,10800949488,140000,7888145792,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2912949200,3328,2912952528,7888139296,10801091824,12269024,7900411648,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 2912953056,15712128,2928665184,7884697232,10813362416,5312,7900414672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2928665776,5466656,2934132432,7879238176,10813370608,10774496,7895479328,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 2934147376,2928,2934150304,7889996880,10824147184,4960,7890004768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2934156816,2976,2934159792,7889993632,10824153424,7264,7890003872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2934182864,3328,2934186192,7889977376,10824163568,15771104,7905751808,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2934215312,6400,2934221712,7905714272,10839935984,5466784,7911187456,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 2934240464,3840,2934244304,7911161120,10845405424,1920,7911166880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2934250496,3472,2934253968,7911155648,10845409616,1440,7911160560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 2934257936,4272,2934262208,7911151440,10845413648,3168,7911158880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 2934266864,5664,2934272528,7911147232,10845419760,3168,7911156064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2934276992,4288,2934281280,7911144528,10845425808,1312,7911150128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 2934293232,5344,2934298576,7911131424,10845430000,4544,7911141312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 2934304944,5024,2934309968,7911126176,10845436144,1088,7911132288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 2934314352,3390096,2937704448,7907735824,10845440272,1632,7911127552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 2937709184,3520,2937712704,7907731632,10845444336,1472,7907736624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 2937718192,3728,2937721920,7907726480,10845448400,1312,7907731520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2937789344,3808,2937793152,7907659376,10845452528,26560,7907689744,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 2937818272,3400384,2941218656,7904262544,10845481200,3503456,7911166384,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 2941239440,3504,2941242944,7907744464,10848987408,2368,7907750336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2941246800,2415072,2943661872,7905329600,10848991472,2016,7907746688,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 2943678448,4080,2943682528,7905313040,10848995568,48320,7905365440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 2943684752,24855152,2968539904,7880505808,10849045712,3440576,7908801536,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 2968540400,12476560,2981016960,7871470608,10852487568,4032,7883951200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 2981017792,3344,2981021136,7871472448,10852493584,2674176,7874149968,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 2981071056,2291840,2983362896,7871807392,10855170288,1920,7874101152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 2983408976,3667232,2987076208,7868098208,10855174416,25492928,7897258368,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 2987171408,3637776,2990809184,7889859728,10880668912,11806688,7905304192,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 2996262768,5728256,3001991024,7890487904,10892478928,2395648,7898611808,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 3002006256,240199456,3242205712,7652670176,10894875888,3943904,7896813536,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3242210576,2176672,3244387248,7654434080,10898821328,3916544,7660527296,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3244395360,3216,3244398576,7658341600,10902740176,5236320,7663581136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3244406384,3088,3244409472,7663568464,10907977936,5662944,7669234496,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3244420688,3776,3244424464,7669218272,10913642736,242114368,7911336416,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 3244467104,5552,3244472656,7911286752,11155759408,2167616,7913459920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 3244473312,2875520,3247348832,7910579504,11157928336,1920,7913456944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 3247358544,4768,3247363312,7910569088,11157932400,2912,7910576768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 3247368800,8248896,3255617696,7902320752,11157938448,1504,7910571152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 3255642128,5584384,3261226512,7896715872,11157942384,47264,7902347520,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3261242768,3517104,3264759872,7893231760,11157991632,2756704,7899505568,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 3264791280,4240,3264795520,7895955792,11160751312,1984,7895962016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3264837248,4128,3264841376,7895914096,11160755472,7890016,7903808240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3264880768,3056,3264883824,7903763648,11168647472,5505440,7909272144,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 3264895408,3440192,3268335600,7905818912,11174154512,3673952,7912933056,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 3268354400,3568,3268357968,7909472672,11177830640,2592,7909478832,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3268362096,2397056,3270759152,7907075552,11177834704,2048,7909474656,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3270775536,3584,3270779120,7907062752,11177841872,55936,7907122272,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3270781040,34240064,3305021104,7872878112,11177899216,4036064,7911154240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 3305021632,143952,3305165584,7876772288,11181937872,1984,7876918224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 3305166720,12820208,3317986928,7863955072,11181942000,2423648,7879198928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 3318023456,4704,3318028160,7866339696,11184367856,1888,7866346288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3318069632,10271136,3328340768,7856031184,11184371952,34814112,7901116432,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3328373232,4432,3328377664,7890810352,11219188016,140544,7890955328,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3328379472,4208,3328383680,7890947632,11219331312,11914592,7902866432,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 3328384240,15700800,3344085040,7887163552,11231248592,1952,7902866304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 3344085840,5454672,3349540512,7881712208,11231252720,10789568,7897956448,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 3349554960,3584,3349558544,7892485088,11242043632,2112,7892490784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3349565104,3088,3349568192,7892479504,11242047696,960,7892483552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3349591824,3424,3349595248,7892454720,11242049968,16312800,7908770944,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3349623040,4640,3349627680,7908737488,11258365168,5469024,7914211152,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 3349646640,6560,3349653200,7914182272,11263835472,2144,7914190976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 3349659152,3408,3349662560,7914177936,11263840496,1408,7914182752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 3349666688,4032,3349670720,7914173872,11263844592,1280,7914179184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 3349676000,9264,3349685264,7914163456,11263848720,3296,7914176016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 3349690080,4416,3349694496,7914160368,11263854864,1440,7914166224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 3349706848,6080,3349712928,7914146000,11263858928,4320,7914156400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 3349720000,3776,3349723776,7914141296,11263865072,1120,7914146192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 3349728608,3384080,3353112688,7910756480,11263869168,1600,7914142160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 3353117456,3856,3353121312,7910751952,11263873264,1504,7910757312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 3353126912,3968,3353130880,7910746480,11263877360,1248,7910751696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3353199920,3456,3353203376,7910678048,11263881424,25120,7910706624,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 3353229040,3450912,3356679952,7907228128,11263908080,3509536,7914188576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 3356698576,3504,3356702080,7910717264,11267419344,2432,7910723200,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3356706080,2420976,3359127056,7908296416,11267423472,1984,7910719376,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3359144912,3536,3359148448,7908279120,11267427568,48000,7908330656,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3359150528,24892992,3384043520,7883433424,11267476944,3441024,7911767440,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 3384044016,12199824,3396243840,7874676592,11270920432,3776,7886880192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 3396244448,4320,3396248768,7874677808,11270926576,2436416,7877118544,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 3396289552,2466112,3398755664,7874609056,11273364720,1856,7877077024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3398800160,3738544,3402538704,7870830112,11273368816,25923936,7900492592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3402629616,3678928,3406308544,7892986928,11299295472,11797920,7908463776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 3411393344,5711936,3417105280,7893990704,11311095984,2385056,7902087696,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 3417120208,240089808,3657210016,7656274000,11313484016,3934176,7900297984,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3657213696,2164704,3659378400,7658042896,11317421296,3955424,7664163024,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3659386144,3040,3659389184,7661990352,11321379536,5190528,7667183920,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3659396960,2752,3659399712,7667172016,11326571728,5673920,7672848688,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 3659410928,3568,3659414496,7672833296,11332247792,242693856,7915530720,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 3659450432,6176,3659456608,7915487408,11574944016,2174560,7917668144,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 3659457056,2746608,3662203664,7914917312,11577120976,1984,7917665904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 3662211552,4016,3662215568,7914909536,11577125104,2752,7914916304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 3662221200,8087248,3670308448,7906820720,11577129168,1536,7914909504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 3670332848,5503296,3675836144,7901297120,11577133264,45664,7906846080,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3675853648,3804288,3679657936,7897522432,11577180368,2752608,7904079328,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 3679689168,5072,3679694240,7900241712,11579935952,1920,7900248704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3679736720,4640,3679741360,7900198688,11579940048,7985536,7908188864,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3679780544,2752,3679783296,7908145072,11587928368,5481344,7913629168,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 3679794624,3727696,3683522320,7909888896,11593411216,3706112,7917322704,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 3683541008,3632,3683544640,7913575088,11597119728,2560,7913581280,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3683548608,2423984,3685972592,7911151264,11597123856,2336,7913577584,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3685988768,3808,3685992576,7911135344,11597127920,47072,7911186224,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3685994432,34967904,3720962336,7876215760,11597178096,4002432,7915186096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 3720962912,140064,3721102976,7880079984,11601182960,1952,7880222000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 3721103632,12298432,3733402064,7867784736,11601186800,2423616,7882506784,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 3733435888,3968,3733439856,7870172032,11603611888,1888,7870177888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3733481504,10711008,3744192512,7859423472,11603615984,34343840,7904478320,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3744224464,3200,3744227664,7893734336,11637962000,140544,7893878080,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3744229264,2976,3744232240,7893873088,11638105328,11934080,7905810144,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 3744232656,15762384,3759995040,7890046032,11650041072,2144,7905810560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 3759995584,5480448,3765476032,7884569136,11650045168,10771616,7900821200,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 3765491776,3520,3765495296,7895324400,11660819696,2016,7895329936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3765501904,2816,3765504720,7895319072,11660823792,1056,7895322944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3765538512,3344,3765541856,7895286032,11660827888,16033728,7911323104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3765569888,4064,3765573952,7911289776,11676863728,5465600,7916759440,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 3765591072,3968,3765595040,7916735856,11682330896,1952,7916741776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 3765603472,5520,3765608992,7916726000,11682334992,1440,7916732960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 3765614896,6048,3765620944,7916716992,11682337936,1312,7916724352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 3765627056,7904,3765634960,7916706112,11682341072,3296,7916717312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 3765640384,3440,3765643824,7916703424,11682347248,1312,7916708176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 3765659920,7776,3765667696,7916683552,11682351248,4576,7916695904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 3765674848,6608,3765681456,7916676032,11682357488,1088,7916683728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 3765685936,3358880,3769044816,7913316768,11682361584,1632,7916677280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 3769050176,3632,3769053808,7913311872,11682365680,1472,7913316976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 3769061072,3280,3769064352,7913305424,11682369776,1280,7913309984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3769136304,3712,3769140016,7913233856,11682373872,26848,7913264416,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 3769165856,3364704,3772530560,7909871984,11682402544,3503616,7916740304,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 3772551552,3536,3772555088,7913353632,11685908720,2496,7913359664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3772559088,2490416,3775049504,7910863280,11685912784,1984,7913355680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 3775066480,3248,3775069728,7910847184,11685916912,47392,7910897824,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 3775071872,24828896,3799900768,7886065296,11685966064,3441888,7914336080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 3799901280,11832448,3811733728,7877676016,11689409744,3264,7889511728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 3811734336,5424,3811739760,7877676160,11689415920,2435552,7880117136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 3811784416,2342080,3814126496,7877726576,11691853072,1856,7880070512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 3814172640,3902688,3818075328,7873781808,11691857136,26544096,7904228592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 3818183280,3840704,3822023984,7896380352,11718404336,11803168,7912024224,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 3827260368,5660896,3832921264,7897288928,11730210192,2344192,7905294016,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 3832936320,240313328,4073249648,7659306432,11732556080,3879392,7903499152,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4073255056,2152864,4075407920,7661030080,11736438000,3889536,7667072480,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4075416160,3232,4075419392,7664910800,11740330192,5382944,7670296976,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4075427264,2672,4075429936,7670284480,11745714416,5676192,7675963344,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4075441104,3552,4075444656,7675947872,11751392528,241273408,7917224832,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 4075479744,9200,4075488944,7917178496,11992667440,2164000,7919351696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 4075489440,2746432,4078235872,7916598256,11994834128,1952,7919346640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 4078244656,5488,4078250144,7916588112,11994838256,2848,7916596448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 4078258080,7811200,4086069280,7908774096,11994843376,1536,7916586832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 4086093296,5441424,4091534720,7903312624,11994847344,47232,7908801280,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4091551328,3555632,4095106960,7899789632,11994896592,2758016,7906103280,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 4095136960,4832,4095141792,7902515536,11997657328,2080,7902522448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4095182592,3664,4095186256,7902475136,11997661392,7871520,7910350320,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4095227344,3392,4095230736,7910305312,12005536048,5454944,7915763648,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 4095243456,4229696,4099473152,7911520752,12010993904,3469600,7919220048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 4099493856,3792,4099497648,7914967616,12014465264,2304,7914973712,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4099501888,2428768,4101930656,7912538704,12014469360,2080,7914969552,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4101949888,4288,4101954176,7912519280,12014473456,46176,7912569744,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4101956112,33892784,4135848896,7878673712,12014522608,3422656,7915989152,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 4135849648,208800,4136058448,7881888416,12017946864,1952,7882099168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 4136059264,12093008,4148152272,7869798688,12017950960,2425152,7884316848,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 4148192720,4048,4148196768,7872182096,12020378864,1888,7872188032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4148240304,10670112,4158910416,7861472576,12020382992,34162048,7906304736,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4158945024,4144,4158949168,7895598528,12054547696,139200,7895741872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4158951024,5744,4158956768,7895731504,12054688272,12332832,7908070080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 4158958112,15223056,4174181168,7892842944,12067024112,1952,7908067952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 4174181744,5468592,4179650336,7887377872,12067028208,10806528,7903652992,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 4179667904,3488,4179671392,7898166160,12077837552,1920,7898171568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4179678432,3264,4179681696,7898159920,12077841616,3072,7898166256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4179717152,4320,4179721472,7898126320,12077847792,15536672,7913667312,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4179750768,5344,4179756112,7913630912,12093387024,5629920,7919266176,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 4179774608,5312,4179779920,7919239072,12099018992,1920,7919246304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 4179789488,6352,4179795840,7919227312,12099023152,1408,7919235072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 4179800672,4768,4179805440,7919221744,12099027184,1472,7919227984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 4179810976,4736,4179815712,7919215568,12099031280,3360,7919223664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 4179823728,8208,4179831936,7919204464,12099036400,1312,7919213984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 4179846576,8448,4179855024,7919185472,12099040496,4448,7919198368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 4179863792,6400,4179870192,7919176448,12099046640,1184,7919184032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 4179877024,3349632,4183226656,7915824048,12099050704,1824,7919175504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 4183232528,4288,4183236816,7915818016,12099054832,1632,7915823936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 4183244512,5040,4183249552,7915809376,12099058928,1280,7915815696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4183326688,3440,4183330128,7915732896,12099063024,25696,7915762032,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 4183356880,3447152,4186804032,7912287664,12099091696,3543520,7919278336,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 4186825936,3488,4186829424,7915807360,12102636784,2464,7915813312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4186833568,2415376,4189248944,7913391936,12102640880,2304,7915809616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4189265776,3760,4189269536,7913375408,12102644944,63616,7913442784,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4189271600,26073328,4215344928,7887365552,12102710480,3828128,7917267008,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 4215345536,12098864,4227444400,7879096896,12106541296,3296,7891199056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 4227445392,4864,4227450256,7879097184,12106547440,2443872,7881545920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 4227496960,2298288,4229795248,7879198528,12108993776,1888,7881498704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4229841008,3687968,4233528976,7875468896,12108997872,24936000,7904092864,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4233627648,3970032,4237597680,7896337664,12133935344,11814080,7912121776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 4243030608,5744480,4248775088,7896978208,12145753296,2352896,7905075584,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 4248791040,242388480,4491179520,7656927952,12148107472,3725216,7903041648,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4491195760,2151120,4493346880,7658487952,12151834832,3740704,7664379776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4493356256,3280,4493359536,7662219040,12155578576,5090944,7667313264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4493367232,3248,4493370480,7667301504,12160671984,5663328,7672968080,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4493387248,3792,4493391040,7672946736,12166337776,241822912,7914773440,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 4493462000,9328,4493471328,7914691280,12408162608,2157568,7916858176,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 4493473152,2684160,4496157312,7914165872,12410323184,1952,7916851984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 4496167824,5088,4496172912,7914154368,12410327280,2976,7914162432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 4496181040,7913696,4504094736,7906236832,12410331568,1504,7914152032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 4504123424,5432384,4509555808,7900779408,12410335216,50112,7906261904,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4509576144,3473344,4513049488,7897337216,12410386704,2750304,7903560864,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 4513081040,5680,4513086720,7900052464,12413139184,1920,7900060064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4513130544,4320,4513134864,7900008416,12413143280,7919840,7907932576,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4513173744,2880,4513176624,7907888352,12421064976,5455904,7913347136,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 4513190224,4091328,4517281552,7909242336,12426523888,3468640,7916802304,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 4517301936,3584,4517305520,7912689728,12429995248,2368,7912695680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4517309664,2514256,4519823920,7910175424,12429999344,1984,7912691664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4519840912,4208,4519845120,7910158288,12430003408,48128,7910210624,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4519847008,33516368,4553363376,7876691264,12430054640,3424576,7913632208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 4553364000,159136,4553523136,7879958832,12433481968,1952,7880119920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 4553523808,12646384,4566170192,7867315904,12433486096,2426240,7882388528,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 4566207952,4416,4566212368,7869701600,12435913968,1856,7869707872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4566256128,10383984,4576640112,7859277952,12435918064,33735648,7903397584,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4576672448,4336,4576676784,7892980064,12469656848,140768,7893125168,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4576678800,4368,4576683168,7893115984,12469799152,12803680,7905924032,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 4576684032,15657696,4592341728,7890262608,12482604336,2176,7905922480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 4592342448,5633152,4597975600,7884632768,12482608368,10379136,7900645056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 4597989904,3024,4597992928,7894996752,12492989680,1952,7895001728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4597999840,2912,4598002752,7894991024,12492993776,864,7894994800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4598031824,3056,4598034880,7894961040,12492995920,15888288,7910852384,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4598061184,3136,4598064320,7910822960,12508887280,5504480,7916330576,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 4598081296,5824,4598087120,7916306208,12514393328,2112,7916314144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 4598093584,2992,4598096576,7916300848,12514397424,1408,7916305248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 4598100944,2544,4598103488,7916298032,12514401520,1280,7916301856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 4598108304,3696,4598112000,7916293616,12514405616,3744,7916301056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 4598116576,3968,4598120544,7916291184,12514411728,1344,7916296496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 4598130640,9424,4598140064,7916274480,12514414544,4896,7916288800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 4598150000,5136,4598155136,7916266768,12514421904,1088,7916272992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 4598160384,3561408,4601721792,7912704304,12514426096,1632,7916267344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 4601727440,3792,4601731232,7912698960,12514430192,1760,7912704512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 4601738416,3520,4601741936,7912692352,12514434288,1248,7912697120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4601816720,3664,4601820384,7912617968,12514438352,34208,7912655840,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 4601846720,3805840,4605652560,7908822688,12514475248,3824608,7916453136,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 4605672624,3472,4605676096,7912626864,12518302960,2528,7912632864,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4605680192,2414656,4608094848,7910212208,12518307056,2016,7912628880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4608112192,3792,4608115984,7910195168,12518311152,47136,7910246096,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4608118208,24990336,4633108544,7885251728,12518360272,3841696,7914083760,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 4633109008,12397152,4645506160,7876697184,12522203344,3968,7889098304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 4645506720,3888,4645510608,7876698944,12522209552,2437024,7879139856,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 4645554736,2307552,4647862288,7876786400,12524648688,1888,7879095840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4647908688,3681936,4651590624,7873062192,12524652816,24963488,7901707616,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4651699728,3762032,4655461760,7894156144,12549617904,12417312,7910335488,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 4661047072,5710176,4666757248,7895281008,12562038256,2346336,7903337520,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 4666774192,241392784,4908166976,7656220080,12564387056,3717536,7901330400,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4908174112,2158544,4910332656,7657773568,12568106224,3741536,7663673648,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4910340992,3536,4910344528,7661504512,12571849040,5525152,7667033200,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4910352144,2864,4910355008,7667021488,12577376496,5689024,7672713376,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 4910367232,3424,4910370656,7672696208,12583066864,242627456,7915327088,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 4910413088,8464,4910421552,7915274080,12825695632,2167232,7917449776,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 4910422000,2728704,4913150704,7914714624,12827865328,1984,7917445312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 4913160768,4720,4913165488,7914703968,12827869456,2976,7914711664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 4913172560,7916720,4921089280,7906784464,12827873744,1504,7914702688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 4921117184,5426288,4926543472,7901334144,12827877616,47264,7906807696,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4926560624,3453472,4930014096,7897912640,12827926736,2752640,7904118752,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 4930044928,4496,4930049424,7900631904,12830681328,1952,7900638352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4930092096,4160,4930096256,7900589168,12830685424,7922240,7908515568,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4930135168,2944,4930138112,7908472080,12838610192,5462688,7913937712,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 4930149472,3333648,4933483120,7910591072,12844074192,3470944,7917395664,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 4933504144,3568,4933507712,7914038896,12847546608,2432,7914044896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4933511808,2401376,4935913184,7911637520,12847550704,2112,7914041008,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 4935929376,4480,4935933856,7911620944,12847554800,47168,7911672592,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4935935808,33591248,4969527056,7878077920,12847604976,3418752,7915087920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 4969527616,142640,4969670256,7881354880,12851025136,1952,7881499472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 4969670896,12772720,4982443616,7868585616,12851029232,2467008,7883825344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 4982479424,3920,4982483344,7871014752,12853498096,2080,7871020752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 4982524816,10275824,4992800640,7860701552,12853502192,34443328,7905420704,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 4992833440,3744,4992837184,7895111376,12887948560,140224,7895255344,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 4992838928,4864,4992843792,7895248096,12888091888,11968896,7907221856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 4992844512,15738864,5008583376,7891480064,12900063440,2208,7907221136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5008584112,5500080,5014084192,7885983344,12900067536,10367680,7901851104,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 5014099904,2976,5014102880,7896333712,12910436592,1952,7896338640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5014109104,2928,5014112032,7896328656,12910440688,832,7896332416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5014138880,4560,5014143440,7896299360,12910442800,15742528,7912046448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5014169856,5792,5014175648,7912012112,12926187760,5472992,7917490896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 5014195104,4288,5014199392,7917462640,12931662032,1984,7917468912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5014206288,6832,5014213120,7917453040,12931666160,1440,7917461312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 5014217936,4896,5014222832,7917447424,12931670256,3712,7917456032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5014228768,7920,5014236688,7917439712,12931676400,3456,7917451088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5014241648,5712,5014247360,7917435088,12931682448,1344,7917442144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 5014260144,7968,5014268112,7917418528,12931686640,4352,7917430848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 5014275904,3952,5014279856,7917412928,12931692784,1120,7917418000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 5014285120,3681328,5017966448,7913730432,12931696880,1664,7917413424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 5017971200,19552,5017990752,7913710224,12931700976,1504,7913731280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5017996416,30144,5018026560,7913678576,12931705136,1280,7913710000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5018098800,5344,5018104144,7913605024,12931709168,25920,7913636288,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 5018135168,3778832,5021914000,7909823936,12931737936,3556960,7917159728,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 5021935264,3312,5021938576,7913358688,12935297264,2464,7913364464,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5021942544,2419392,5024361936,7910939424,12935301360,2208,7913361024,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5024378496,3200,5024381696,7910923760,12935305456,48480,7910975440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5024383824,24925392,5049309216,7886046544,12935355760,4213088,7915185024,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 5049309856,12452640,5061762496,7877808976,12939571472,3584,7890265200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5061763120,4320,5061767440,7877810144,12939577584,2431296,7880245760,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 5061808784,2304256,5064113040,7877897600,12942010640,1888,7880203744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5064163072,3670128,5067833200,7874181504,12942014704,24939456,7902791088,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5067937424,3624112,5071561536,7895394736,12966956272,12481600,7911500448,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 5077065152,5677552,5082742704,7896699168,12979441872,2345504,7904722224,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 5082758608,240696032,5323454640,7658335296,12981789936,3715584,7902746912,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5323463456,2159600,5325623056,7659883968,12985507024,3743616,7665787184,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5325632224,3456,5325635680,7663617168,12989252848,5140192,7668760816,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5325643632,3312,5325646944,7668748432,12994395376,5886496,7674638240,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5325659968,4432,5325664400,7674620064,13000284464,243240192,7917864688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 5325716768,7872,5325724640,7917802832,13243527472,2167936,7919978640,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 5325725424,2729152,5328454576,7917243712,13245698288,1952,7919974816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 5328466304,5568,5328471872,7917230480,13245702352,2784,7917238832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5328479744,8462464,5336942208,7908764272,13245706480,1536,7917228272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5336973168,5499136,5342472304,7903238272,13245710576,47040,7908784448,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5342492176,3465536,5345957712,7899803008,13245760720,2864192,7906132736,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 5345988320,3984,5345992304,7902634624,13248626928,1888,7902640496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5346036992,3856,5346040848,7902590176,13248631024,7919136,7910513168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5346082384,2992,5346085376,7910466320,13256551696,5460800,7915930112,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 5346104944,3333264,5349438208,7912575600,13262013808,3467264,7919376128,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 5349460272,3504,5349463776,7916019216,13265482992,2336,7916025056,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5349467888,2395360,5351863248,7913623808,13265487056,2080,7916021248,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5351880144,4112,5351884256,7913606928,13265491184,46144,7913657184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5351887056,34268032,5386155088,7879385248,13265540336,3419168,7917072448,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 5386155776,141552,5386297328,7882665184,13268962512,1984,7882808720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5386298912,12727552,5399026464,7869940176,13268966640,2430464,7885098192,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 5399061632,4512,5399066144,7872333520,13271399664,1888,7872339920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5399110544,10280832,5409391376,7862012384,13271403760,34480480,7906773696,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5409425840,4128,5409429968,7896457024,13305886992,140800,7896601952,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5409431760,3632,5409435392,7896594672,13306030064,11942176,7908540480,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 5409435904,15682784,5425118688,7892855536,13317974224,2464,7908540784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5425119232,5460704,5430579936,7887398416,13317978352,10435040,7903294160,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 5430594704,3392,5430598096,7897816864,13328414960,1920,7897822176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5430605152,2912,5430608064,7897811120,13328419184,896,7897814928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5430637760,2992,5430640752,7897782432,13328423184,15770560,7913555984,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5430669296,5296,5430674592,7913522288,13344196880,5478400,7919005984,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 5430692608,4752,5430697360,7918980960,13349678320,1920,7918987632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5430704592,6064,5430710656,7918971760,13349682416,1440,7918979264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 5430716704,6592,5430723296,7918963184,13349686480,1344,7918971120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5430729232,5712,5430734944,7918955632,13349690576,3424,7918964768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5430740016,8624,5430748640,7918948112,13349696752,1344,7918958080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 5430765264,8048,5430773312,7918927536,13349700848,4288,7918939872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 5430782160,4480,5430786640,7918920352,13349706992,1088,7918925920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 5430790880,3363024,5434153904,7915557184,13349711088,1632,7918921840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 5434159440,3440,5434162880,7915552304,13349715184,1472,7915557216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5434173248,3232,5434176480,7915542832,13349719312,1440,7915547504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5434249024,3952,5434252976,7915470368,13349723344,25152,7915499472,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 5434278272,4237712,5438515984,7911234016,13349750000,3505472,7918977200,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 5438536720,3536,5438540256,7914716944,13353257200,2432,7914722912,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5438544240,2422000,5440966240,7912295056,13353261296,1984,7914719040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5440982816,4608,5440987424,7912277936,13353265360,47424,7912329968,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5440990144,24870544,5465860688,7887453824,13353314512,4290496,7916614864,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 5465861488,12359840,5478221328,7879388448,13357609776,5088,7891753376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5478221968,3504,5478225472,7879391920,13357617392,2470944,7881866368,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 5478268192,2376608,5480644800,7879446576,13360091376,1920,7881825104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5480692928,3666048,5484358976,7875736496,13360095472,24951584,7904354128,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5484459744,3633120,5488092864,7896955472,13385048336,12361888,7912950480,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 5493161744,5827744,5498989488,7898424448,13397413936,2352704,7906604896,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 5499004528,241787904,5740792432,7658976896,13399769328,3794400,7904559200,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5740797952,2160816,5742958768,7660607552,13403566320,3743264,7666511632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5742967360,3296,5742970656,7664340400,13407311056,5097024,7669440720,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5742978192,3040,5742981232,7669428448,13412409680,5794272,7675225760,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 5742993344,3616,5742996960,7675209488,13418206448,242996160,7918209264,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 5743037280,5984,5743043264,7918162512,13661205776,2172704,7920341200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 5743043904,2732480,5745776384,7917604304,13663380688,1984,7920338768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 5745785808,5056,5745790864,7917593952,13663384816,2752,7917601760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5745797776,7804032,5753601808,7909787104,13663388912,1536,7917592672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5753628240,5424576,5759052816,7904340192,13663393008,45984,7909810752,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5759069728,3450272,5762520000,7900920240,13663440240,2770784,7907141296,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 5762553232,3936,5762557168,7903655904,13666213072,2016,7903661856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5762599360,4016,5762603376,7903613888,13666217264,7897696,7911515600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5762642464,3136,5762645600,7911470768,13674116368,5469888,7916943792,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 5762656896,3334304,5765991200,7913596336,13679587536,3478528,7920409168,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 5766011552,3504,5766015056,7917053088,13683068144,2336,7917058928,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5766019104,2404016,5768423120,7914649216,13683072336,2176,7917055408,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5768439936,4720,5768444656,7914631872,13683076528,47104,7914683696,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5768446528,34209936,5802656464,7880469120,13683125584,3417632,7918096688,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 5802656992,142672,5802799664,7883744928,13686544592,1952,7883889552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5802800960,11883568,5814684528,7871864192,13686548720,2435296,7886183056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 5814721504,4272,5814725776,7874260096,13688985872,1920,7874266288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5814767856,10265264,5825033120,7863956784,13688989904,35071936,7909293984,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5825065312,4000,5825069312,7898994736,13724064048,140832,7899139568,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5825071040,4032,5825075072,7899131248,13724206320,11934080,7911069360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 5825075664,15700928,5840776592,7895366592,13736143184,2208,7911069728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5840777408,5464496,5846241904,7889905280,13736147184,10473696,7905843472,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 5846256736,3344,5846260080,7900363648,13746623728,1920,7900368912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5846266816,3264,5846270080,7900357712,13746627792,864,7900361840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5846293536,4256,5846297792,7900332144,13746629936,15780192,7916116592,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5846323424,5328,5846328752,7916083008,13762411760,5487200,7921575536,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 5846348960,4640,5846353600,7921547920,13767901520,2016,7921554576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5846359328,3696,5846363024,7921542592,13767905616,1440,7921547728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 5846367536,4176,5846371712,7921537904,13767909616,1312,7921543392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 5846376480,4560,5846381040,7921532768,13767913808,3488,7921540816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5846386128,5248,5846391376,7921528480,13767919856,1312,7921535040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 5846403792,7792,5846411584,7921512368,13767923952,4704,7921524864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 5846418752,4800,5846423552,7921506640,13767930192,1120,7921512560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 5846428176,3385728,5849813904,7918120320,13767934224,1632,7921507680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 5849818608,3216,5849821824,7918116560,13767938384,1536,7918121312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 5849829808,3296,5849833104,7918109376,13767942480,1312,7918113984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5849901344,3584,5849904928,7918041552,13767946480,26112,7918071248,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 5849930176,3383456,5853313632,7914661520,13767975152,3522240,7921567216,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 5853333744,3632,5853337376,7918162352,13771499728,2336,7918168320,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5853341488,2802640,5856144128,7915359728,13771503856,1984,7918164352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 5856160656,4048,5856164704,7915343248,13771507952,47360,7915394656,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 5856166800,25350048,5881516848,7890040640,13771557488,3504160,7918894848,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 5881517440,11849744,5893367184,7881696128,13775063312,3200,7893549072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 5893367776,4416,5893372192,7881697264,13775069456,2750464,7884452144,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 5893412624,2454832,5895867456,7881954672,13777822128,1888,7884411392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 5895914592,3785808,5899700400,7878125632,13777826032,25831808,7907743248,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 5899793728,3810016,5903603744,7900055792,13803659536,12180320,7916046128,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 5908824880,5683632,5914508512,7901334544,13815843056,2370304,7909388480,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 5914523360,241787536,6156310896,7661904768,13818215664,3851904,7907544208,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6156321488,2161648,6158483136,7663586864,13822070000,3824896,7669573408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6158492016,3632,6158495648,7667402032,13825897680,5097152,7672502816,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6158503184,2768,6158505952,7672490256,13830996208,5708416,7678201440,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6158519168,3440,6158522608,7678184544,13836707152,243821344,7922009328,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 6158575856,6992,6158582848,7921947856,14080530704,2179040,7924133888,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 6158583328,2722128,6161305456,7921406304,14082711760,1920,7924130352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 6161317328,5680,6161323008,7921392976,14082715984,2752,7921401408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 6161330256,7891632,6169221888,7913498224,14082720112,1632,7921391488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 6169252832,5433936,6174686768,7908037312,14082724080,49440,7913520688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6174705776,3459968,6178165744,7904609536,14082775280,2768608,7910838112,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 6178198160,5280,6178203440,7907341760,14085545200,1888,7907348928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6178250704,3232,6178253936,7907295360,14085549296,8041856,7915340448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6178300896,2896,6178303792,7915289088,14093592880,5523488,7920815472,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 6178317616,3333600,6181651216,7917468096,14099119312,3508768,7924310464,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 6181672848,3808,6181676656,7920953056,14102629712,2336,7920959200,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6181680736,2402320,6184083056,7918550656,14102633712,2016,7920954992,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6184102592,3936,6184106528,7918531408,14102637936,45984,7918581328,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6184108640,34871584,6218980224,7883705712,14102685936,3415424,7921992720,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 6218980960,143328,6219124288,7886979728,14106104016,1952,7887125008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 6219125776,11922048,6231047824,7875060320,14106108144,2435424,7889417792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 6231086784,6128,6231092912,7877453376,14108546288,1888,7877461392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6231138784,10682672,6241821456,7866728928,14108550384,34749824,7912161424,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6241855760,4672,6241860432,7901442496,14143302928,139584,7901586752,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6241862224,4896,6241867120,7901577056,14143444176,12637024,7914218976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 6241868016,16289184,6258157200,7897926240,14156083440,2208,7914217632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 6258157968,5467376,6263625344,7892462192,14156087536,10553792,7908483360,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 6263640080,3472,6263643552,7903000400,14166643952,1920,7903005792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6263650832,3136,6263653968,7902994080,14166648048,2944,7903000160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6263684368,3520,6263687888,7902964384,14166652272,15802976,7918770880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6263715600,5712,6263721312,7918735216,14182456528,5484832,7924225760,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 6263739840,4832,6263744672,7924198480,14187943152,1952,7924205264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 6263751232,6320,6263757552,7924189696,14187947248,1440,7924197456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 6263763392,4016,6263767408,7924184032,14187951440,1632,7924189680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 6263772704,5136,6263777840,7924177600,14187955440,3232,7924185968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 6263783808,3840,6263787648,7924174096,14187961744,1376,7924179312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 6263798496,9376,6263807872,7924157904,14187965776,4896,7924172176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 6263817712,4112,6263821824,7924150160,14187971984,1344,7924155616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 6263826240,3377216,6267203456,7920772560,14187976016,1632,7924151408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 6267209088,3664,6267212752,7920767232,14187979984,1504,7920772400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 6267218640,4224,6267222864,7920761248,14187984112,1280,7920766752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6267296848,3312,6267300160,7920688272,14187988432,28864,7920720448,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 6267327648,3458704,6270786352,7917232576,14188018928,3517408,7924208688,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 6270807888,3360,6270811248,7920727264,14191538512,2496,7920733120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6270815232,2419168,6273234400,7918308112,14191542512,1952,7920729232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6273251424,3968,6273255392,7918291312,14191546704,49504,7918344784,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6273257600,25812640,6299070240,7892528688,14191598928,3880416,7922221744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 6299070752,11813744,6310884496,7884596320,14195480816,3968,7896414032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 6310885152,3616,6310888768,7884598192,14195486960,2623360,7887225168,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 6310931472,2333712,6313265184,7884847408,14198112592,1888,7887183008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6313309840,3870912,6317180752,7880935840,14198116592,25732096,7910538848,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6317275360,3877552,6321152912,7902697824,14223850736,12178304,7918753680,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 6326395024,5665520,6332060544,7903971952,14236032496,2502656,7912140128,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 6332076240,240197056,6572273296,7666264448,14238537744,3782816,7910244320,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6572279072,2168256,6574447328,7667875312,14242322640,3773120,7673816688,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6574455952,3248,6574459200,7671637904,14246097104,5226624,7676867776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6574466752,2752,6574469504,7676856176,14251325680,5718816,7682577744,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6574481376,3120,6574484496,7682561312,14257045808,245704832,7928269264,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 6574522064,10048,6574532112,7928220544,14502752656,2174368,7930404960,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 6574532720,2738048,6577270768,7927658720,14504929488,1984,7930398752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 6577279504,5376,6577284880,7927648736,14504933616,2944,7927657056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 6577291696,7802224,6585093920,7919843952,14504937872,1536,7927647712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 6585118576,5435712,6590554288,7914387520,14504941808,47296,7919870528,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6590571168,3462848,6594034016,7910956912,14504990928,2773440,7917193200,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 6594063712,4176,6594067888,7913698208,14507766096,1952,7913704336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6594110608,5904,6594116512,7913653712,14507770224,8355648,7922015264,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6594154912,3600,6594158512,7921970624,14516129136,5595744,7927569968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 6594169920,3350304,6597520224,7924207024,14521727248,3582016,7931139344,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 6597539136,3600,6597542736,7927768448,14525311184,2336,7927774384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6597546848,2405184,6599952032,7925363280,14525315312,2016,7927770480,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6599969152,4560,6599973712,7925345792,14525319504,45600,7925395952,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6599975584,33829888,6633805472,7891561072,14525366544,3429056,7928820016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 6633806032,175568,6633981600,7894816432,14528798032,1984,7894993984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 6633982224,12457280,6646439504,7882362528,14528802032,2428384,7897248192,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 6646481008,5088,6646486096,7884745888,14531231984,1984,7884752960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6646528112,10516608,6657044720,7874191392,14531236112,34769312,7919477312,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6657077248,3440,6657080688,7908926432,14566007120,140896,7909070768,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6657082320,7184,6657089504,7909060976,14566150480,12833760,7921901920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 6657089936,15362736,6672452672,7906534544,14578987216,1952,7921899232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 6672453664,5615440,6678069104,7900922240,14578991344,10459904,7916997584,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 6678083760,3360,6678087120,7911365472,14589452592,1952,7911370784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6678095232,3056,6678098288,7911358336,14589456624,864,7911362256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6678121552,2880,6678124432,7911334688,14589459120,15787264,7927124832,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6678150000,3376,6678153376,7927095376,14605248752,5485600,7932584352,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 6678165232,3792,6678169024,7932567472,14610736496,1952,7932573216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 6678174992,3008,6678178000,7932562464,14610740464,1472,7932566944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 6678181984,3264,6678185248,7932559408,14610744656,1312,7932563984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 6678189792,4400,6678194192,7932554560,14610748752,3552,7932562512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 6678198608,3456,6678202064,7932552736,14610754800,1344,7932557536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 6678211984,5968,6678217952,7932541040,14610758992,4800,7932551808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 6678223552,3360,6678226912,7932538160,14610765072,1120,7932542640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 6678231568,3575024,6681806592,7928962640,14610769232,1632,7932539296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 6681811456,3120,6681814576,7928958752,14610773328,1472,7928963344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 6681819888,4432,6681824320,7928953008,14610777328,1376,7928958816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6681888832,5104,6681893936,7928887584,14610781520,27456,7928920144,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 6681918944,3786976,6685705920,7925104336,14610810256,3513824,7932405136,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 6685728432,4176,6685732608,7928594000,14614326608,2656,7928600832,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6685736672,2417456,6688154128,7926176480,14614330608,1952,7928595888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 6688170768,4112,6688174880,7926159920,14614334800,54208,7926218240,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 6688177056,26000224,6714177280,7900214768,14614392048,4344608,7930559600,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 6714178192,12033536,6726211728,7892526240,14618737968,4000,7904563776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 6726212416,5840,6726218256,7892525888,14618744144,2452704,7894984432,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 6726263280,2307232,6728570512,7892628096,14621198608,1856,7894937184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 6728619216,3665136,6732284352,7888918320,14621202672,25020704,7917604160,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 6732387152,3863344,6736250496,7909974608,14646225104,12401824,7926239776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 6741690912,5725680,6747416592,7911213216,14658629808,2358784,7919297680,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 6747431696,239621136,6987052832,7673938384,14660991216,3720512,7917280032,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6987056704,2159792,6989216496,7675497056,14664713552,3752288,7681409136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6989224736,3392,6989228128,7679239280,14668467408,5166208,7684408880,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6989235808,2688,6989238496,7684398192,14673636688,5912992,7690313872,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 6989248816,3344,6989252160,7690300080,14679552240,243265760,7933569184,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 6989288528,5952,6989294480,7933525408,14922819888,2181408,7935712768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 6989294992,2741440,6992036432,7932966592,14925003024,1984,7935710016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 6992044784,4256,6992049040,7932958048,14925007088,2944,7932965248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 6992056096,7828240,6999884336,7925127008,14925011344,1504,7932956752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 6999907424,5439088,7005346512,7919668768,14925015280,45504,7925153360,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7005362304,3476224,7008838528,7916224848,14925063376,2772544,7922473616,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 7008867744,4288,7008872032,7918966416,14927838448,1888,7918972592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7008912544,3632,7008916176,7918926336,14927842512,7908448,7926838416,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7008956144,2752,7008958896,7926794208,14935753104,5470688,7932267648,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 7008970896,3336768,7012307664,7928918560,14941226224,3486752,7935742080,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 7012328992,3440,7012332432,7932383680,14944716112,2336,7932389456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7012336384,2645664,7014982048,7929738064,14944720112,1952,7932385680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7014998224,3168,7015001392,7929722912,14944724304,46944,7929773024,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7015003200,34067136,7049070336,7895704240,14944774576,3429888,7933201264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 7049070928,140496,7049211424,7898994416,14948205840,1952,7899136864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7049212080,12770800,7061982880,7886226992,14948209872,2433824,7901431616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 7062019248,4304,7062023552,7888621456,14950645008,1856,7888627616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7062063792,10292352,7072356144,7878293024,14950649168,34601024,7923186400,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7072387568,4080,7072391648,7912860496,14985252144,140448,7913005024,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7072393312,4112,7072397424,7912996992,14985394416,12787328,7925788432,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 7072398064,15671552,7088069616,7910113504,14998183120,1952,7925787008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7088070432,5512912,7093583344,7904603904,14998187248,10507648,7920624464,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 7093596752,3088,7093599840,7915097744,15008697584,1920,7915102752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7093606128,2880,7093609008,7915092800,15008701808,832,7915096512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7093631696,4848,7093636544,7915067664,15008704208,15794528,7930867040,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7093661840,5856,7093667696,7930833280,15024500976,5490432,7936329568,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 7093686384,7424,7093693808,7936298912,15029992720,2080,7936308416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7093699696,3312,7093703008,7936293808,15029996816,1440,7936298560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7093706912,5824,7093712736,7936288176,15030000912,3392,7936297392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7093717552,5248,7093722800,7936284224,15030007024,3488,7936292960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7093727600,4640,7093732240,7936280928,15030013168,1312,7936286880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 7093742736,5232,7093747968,7936269296,15030017264,4608,7936279136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 7093753216,4880,7093758096,7936265280,15030023376,1120,7936271280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 7093762704,3639856,7097402560,7932624944,15030027504,1664,7936266464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 7097407264,9408,7097416672,7932614928,15030031600,1472,7932625808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7097422384,10256,7097432640,7932603056,15030035696,1280,7932614592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7097497648,36288,7097533936,7932505856,15030039792,26944,7932569088,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 7097558368,3947872,7101506240,7928562224,15030068464,3510464,7936020560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 7101528944,3520,7101532464,7932048288,15033580752,2432,7932054240,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7101536592,2415824,7103952416,7929632432,15033584848,2016,7932050272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7103970496,4240,7103974736,7929614208,15033588944,47936,7929666384,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7103979248,24840160,7128819408,7904819744,15033639152,4327456,7933987360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 7128820160,12402896,7141223056,7896745600,15037968656,3584,7909152080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7141223824,4192,7141228016,7896746784,15037974800,2438464,7899189440,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 7141276752,2292016,7143568768,7896847216,15040415984,1856,7899141088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7143623120,3653136,7147276256,7893143824,15040420080,24980000,7921776960,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7147384720,3633232,7151017952,7914383760,15065401712,12355584,7930372576,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 7156533776,5683504,7162217280,7915544240,15077761520,2391040,7923618784,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 7162232272,242216400,7404448672,7675706800,15080155472,3754496,7921677696,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7404462752,2165984,7406628736,7677283664,15083912400,3751616,7683201264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7406639280,3456,7406642736,7681022656,15087665392,5103328,7686129440,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7406651376,3200,7406654576,7686115424,15092770000,5872896,7691991520,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7406674176,3472,7406677648,7691967168,15098644816,243853824,7935824464,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 7406792976,12672,7406805648,7935694464,15342500112,2173248,7937880384,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 7406806112,2635568,7409441680,7935233344,15344675024,1920,7937870832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 7409455984,5824,7409461808,7935217344,15344679152,2944,7935226112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7409472464,7827936,7417300400,7927382976,15344683376,1504,7935212416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7417356112,5407488,7422763600,7921923744,15344687344,45984,7927377216,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7422789296,3443936,7426233232,7918501408,15344734640,2776768,7924722112,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 7426270432,4496,7426274928,7921237792,15347512720,1888,7921244176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7426330976,3552,7426334528,7921182128,15347516656,7939712,7929125392,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7426389472,3984,7426393456,7929065408,15355458864,5468864,7934538256,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 7426407904,3291648,7429699552,7931229456,15360929008,3482720,7938003824,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 7429720096,3600,7429723696,7934690016,15364413712,2432,7934696048,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7429727952,2401216,7432129168,7932288608,15364417776,2144,7934691968,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7432147600,3952,7432151552,7932270320,15364421872,46048,7932320320,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7432154192,34858752,7467012944,7897457056,15364470000,3435008,7935750816,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 7467013632,144624,7467158256,7900748288,15367906544,1920,7900894832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7467159168,11881472,7479040640,7888870000,15367910640,2439200,7903190672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 7479081632,4208,7479085840,7891266016,15370351856,1920,7891272144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7479132288,10274656,7489406944,7880949008,15370355952,34622048,7925845712,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7489441600,4000,7489445600,7915534928,15404980528,142464,7915681392,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7489447312,5312,7489452624,7915672320,15405124944,12814048,7928491680,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 7489453088,15689456,7505142544,7912798688,15417941232,1984,7928490128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7505143104,5524048,7510667152,7907278176,15417945328,10463552,7923265776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 7510683168,3072,7510686240,7917724464,15428410704,1952,7917729488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7510694448,3184,7510697632,7917717168,15428414800,864,7917721216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7510737328,4672,7510742000,7917676832,15428418832,15803776,7933485280,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7510774336,5184,7510779520,7933445744,15444225264,5480064,7938930992,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 7510797568,9520,7510807088,7938900768,15449707856,1920,7938912208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7510818192,6000,7510824192,7938887760,15449711952,1472,7938895232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7510834160,5776,7510839936,7938876016,15449715952,1312,7938883104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7510845088,6992,7510852080,7938868064,15449720144,3552,7938878608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7510858656,5680,7510864336,7938861856,15449726192,1344,7938868880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 7510891344,8096,7510899440,7938830848,15449730288,4480,7938843424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 7510912320,8656,7510920976,7938815616,15449736592,1088,7938825360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 7510926112,3347008,7514273120,7935467376,15449740496,1632,7938816016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 7514278400,3488,7514281888,7935462960,15449744848,1504,7935467952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7514289168,4960,7514294128,7935454688,15449748816,1280,7935460928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7514381488,3344,7514384832,7935367984,15449752816,25952,7935397280,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 7514411104,4188768,7518599872,7931181616,15449781488,3512480,7938882864,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 7518622256,3328,7518625584,7934670368,15453295952,2400,7934676096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7518629680,2424736,7521054416,7932245504,15453299920,2176,7934672416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7521071216,4288,7521075504,7932228640,15453304144,47104,7932280032,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7521078000,25207904,7546285904,7907068352,15453354256,4206304,7936482560,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 7546286944,12455456,7558742400,7898820496,15457562896,3264,7911279216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7558743184,4384,7558747568,7898821472,15457569040,2482784,7901308640,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 7558793792,2305520,7561099312,7898955040,15460054352,1888,7901262448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7561151488,3665216,7564816704,7895241744,15460058448,24982208,7923889168,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7564912816,3691568,7568604384,7916437552,15485041936,12379232,7932508352,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 7573762864,5813600,7579576464,7917848864,15497425328,2372352,7926034816,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 7579591184,240910720,7820501904,7679297888,15499799792,3764256,7923972864,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7820506720,2152560,7822659280,7680906752,15503566032,3745824,7686805136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7822667424,3248,7822670672,7684644224,15507314896,5102048,7689749520,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7822678816,3232,7822682048,7689736592,15512418640,5740512,7695480336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 7822694960,3328,7822698288,7695463616,15518161904,243390656,7938857600,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 7822740064,10224,7822750288,7938803584,15761553872,2179552,7940993360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 7822750768,2749296,7825500064,7938235696,15763735760,1984,7940986976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 7825508544,4608,7825513152,7938226736,15763739888,2848,7938234192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7825519424,7836528,7833355952,7930388096,15763744048,1504,7938226128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7833387808,5421408,7838809216,7924938832,15763748048,46464,7930406704,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7838825824,3462656,7842288480,7921507824,15763796304,2774592,7927745072,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 7842318608,3872,7842322480,7924250816,15766573296,1920,7924256608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7842364000,3024,7842367024,7924210368,15766577392,7937408,7932150800,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7842406240,3232,7842409472,7932108080,15774517552,5466464,7937577776,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 7842421040,3344848,7845765888,7934219760,15779985648,3486240,7941050848,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 7845786992,3920,7845790912,7937683600,15783474512,2400,7937689920,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7845795104,2401632,7848196736,7935281872,15783478608,2016,7937685520,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7848213376,4752,7848218128,7935264480,15783482608,45856,7935315088,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7848220272,34252944,7882473216,7901057648,15783530864,3417632,7938728224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 7882473856,141408,7882615264,7904334576,15786949840,1952,7904477936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7882616224,11866480,7894482704,7892471264,15786953968,2433792,7906771536,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 7894523184,5408,7894528592,7894861472,15789390064,1856,7894868736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7894571744,10267072,7904838816,7884555344,15789394160,34660288,7929482704,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7904871072,4368,7904875440,7919182176,15824057616,140576,7919327120,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7904877040,2960,7904880000,7919320944,15824200944,12779424,7932103328,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 7904880432,15702960,7920583392,7916399088,15836982480,2496,7932104544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7920583920,5465408,7926049328,7910937280,15836986608,10441280,7926843968,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 7926063744,3600,7926067344,7921362112,15847429456,2016,7921367728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7926074176,3344,7926077520,7921356032,15847433552,2912,7921362288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7926107760,4560,7926112320,7921327280,15847439600,15823232,7937155072,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7926141568,6848,7926148416,7937116080,15863264496,5483136,7942606064,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 7926164704,4656,7926169360,7942580832,15868750192,1920,7942587408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7926176912,5136,7926182048,7942572112,15868754160,1440,7942578688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 7926187376,6320,7926193696,7942564656,15868758352,3424,7942574400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 7926199664,5360,7926205024,7942559344,15868764368,3296,7942568000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7926209904,5856,7926215760,7942554880,15868770640,1344,7942562080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 7926229792,7264,7926237056,7942537712,15868774768,4416,7942549392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 7926244224,5024,7926249248,7942531600,15868780848,1088,7942537712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 7926254416,3377264,7929631680,7939153328,15868785008,1632,7942532224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 7929636672,3216,7929639888,7939149088,15868788976,1504,7939153808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 7929645696,3840,7929649536,7939143536,15868793072,1280,7939148656,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7929720336,3296,7929723632,7939073664,15868797296,26336,7939103296,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 7929749328,3391392,7933140720,7935685120,15868825840,3516480,7942592992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 7933163216,3584,7933166800,7939178528,15872345328,2336,7939184448,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7933170800,2789456,7935960256,7936389168,15872349424,2016,7939180640,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 7935976976,4352,7935981328,7936372192,15872353520,47872,7936424416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 7935983584,25276112,7961259696,7911143040,15872402736,3900736,7940319888,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 7961260192,11802160,7973062352,7903242880,15876305232,1952,7915046992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 7973063280,4688,7973067968,7903241264,15876309232,2704032,7905949984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 7973112496,2335808,7975448304,7903566304,15879014608,2208,7905904320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 7975495376,3880560,7979375936,7899642800,15879018736,25014784,7928538144,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 7979476720,3819504,7983296224,7920739824,15904036048,12223424,7936782752,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 7988515152,5693456,7994208608,7922053392,15916262000,2486112,7930232960,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 7994223696,241138400,8235362096,7683388864,15918750960,3770784,7928298048,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8235370144,2176288,8237546432,7684977968,15922524400,3784096,7690938352,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8237554832,3264,8237558096,7688753056,15926311152,5109984,7693866304,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8237566352,3024,8237569376,7693854608,15931423984,5723136,7699580768,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8237581904,3296,8237585200,7699563968,15937149168,243361312,7942928576,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 8237633664,4848,8237638512,7942874528,16180513040,2178944,7945058320,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 8237639888,2733536,8240373424,7942320800,16182694224,1952,7945056288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 8240384176,4528,8240388704,7942309616,16182698320,3200,7942317344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 8240397328,7935408,8248332736,7934371632,16182704368,1536,7942308576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 8248367040,5417088,8253784128,7928924432,16182708560,49120,7934390640,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8253802752,3455024,8257257776,7925502976,16182760752,2770976,7931728976,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 8257290112,4432,8257294544,7928240192,16185534736,1920,7928246544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8257339472,3344,8257342816,7928196080,16185538896,8428352,7936627776,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8257388256,3888,8257392144,7936576480,16193968624,5499328,7942079696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 8257404752,3342272,8260747024,7938722400,16199469424,3676128,7945740800,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 8260768720,3616,8260772336,7942375168,16203147504,2496,7942381280,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8260776544,2402544,8263179088,7939972512,16203151600,2080,7942377136,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8263195904,4000,8263199904,7939955760,16203155664,47648,7940007408,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8263201840,34368272,8297570112,7905634768,16203204880,4130240,7944133280,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 8297571328,144064,8297715392,7909621424,16207336816,1952,7909767440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 8297716032,11915616,8309631648,7897709136,16207340784,2429920,7912054672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 8309669232,4608,8309673840,7900099936,16209773776,1888,7900106432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8309714416,10723856,8320438272,7889339728,16209778000,34611488,7934675072,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8320471904,3680,8320475584,7923915600,16244391184,139936,7924059216,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8320477888,4960,8320482848,7924049616,16244532464,12928448,7936983024,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 8320483296,16076352,8336559648,7920903856,16257463504,2208,7936982416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 8336560496,5466480,8342026976,7915440656,16257467632,10450016,7931357152,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 8342042368,3248,8342045616,7925873984,16267919600,1920,7925879152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8342052832,3360,8342056192,7925867600,16267923792,832,7925871792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8342086032,3280,8342089312,7925836976,16267926288,15834848,7941675104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8342119504,5264,8342124768,7941638224,16283762992,5478816,7947122304,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 8342142512,7440,8342149952,7947094448,16289244400,1952,7947103840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 8342158736,7728,8342166464,7947082032,16289248496,1408,7947091168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 8342172144,6608,8342178752,7947072848,16289251600,1472,7947080928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 8342184496,5200,8342189696,7947064912,16289254608,3456,7947073568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 8342196320,6192,8342202512,7947058272,16289260784,1376,7947065840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 8342216496,7984,8342224480,7947040400,16289264880,4800,7947053184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 8342233840,4896,8342238736,7947032256,16289270992,1088,7947038240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 8342243904,3351936,8345595840,7943679280,16289275120,1600,7947032816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 8345600784,3824,8345604608,7943674608,16289279216,1504,7943679936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 8345610944,4336,8345615280,7943668032,16289283312,1280,7943673648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8345686176,3408,8345689584,7943597824,16289287408,26624,7943627856,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 8345715600,3385056,8349100656,7940215424,16289316080,3510240,7947110720,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 8349121792,3408,8349125200,7943704320,16292829520,2432,7943710160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8349129184,2427120,8351556304,7941277184,16292833488,2048,7943706352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8351573168,4368,8351577536,7941260080,16292837616,48736,7941313184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8351579824,25721168,8377300992,7915586768,16292887760,4145728,7945453664,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 8377301472,11895872,8389197344,7907838704,16297036048,3808,7919738384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 8389197968,4896,8389202864,7907839328,16297042192,2516704,7910360928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 8389252016,2295872,8391547888,7908012320,16299560208,1888,7910310080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8391595104,3716848,8395311952,7904252320,16299564272,25347424,7933316592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8395413040,3928512,8399341552,7925572864,16324914416,12396480,7941897856,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 8404761968,5662512,8410424480,7926890032,16337314512,2354336,7934906880,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 8410439184,241582832,8652022016,7687649264,16339671280,3785536,7933017632,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8652028000,2158448,8654186448,7689272608,16343459056,3750080,7695181136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8654194800,4688,8654199488,7693012464,16347211952,5090848,7698108000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8654207312,3184,8654210496,7698093872,16352304368,5793280,7703890336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 8654222832,3456,8654226288,7703872960,16358099248,242750816,7946627232,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 8654273888,5520,8654279408,7946572736,16600852144,2176192,7948754448,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 8654280384,2722736,8657003120,7946027744,16603030864,1984,7948752464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 8657011872,3952,8657015824,7946019040,16603034864,3008,7946026000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 8657021584,7930096,8664951680,7938089328,16603041008,1536,7946020960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 8664975728,5437824,8670413552,7932631520,16603045072,48992,7938118336,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8670429312,3462016,8673891328,7929204944,16603096272,2770880,7935437840,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 8673920864,4016,8673924880,7931944416,16605869296,2016,7931950448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8673966160,2928,8673969088,7931904304,16605873392,8377760,7940284992,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8674009696,2912,8674012608,7940241200,16614253808,5504512,7945748624,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 8674023520,4275808,8678299328,7941460528,16619759856,3685984,7949422320,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 8678317424,3664,8678321088,7945126288,16623447376,2432,7945132384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8678325168,2425520,8680750688,7942700656,16623451344,2176,7945128352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8680767632,3904,8680771536,7942684032,16623455568,47456,7942735392,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8680773552,34560976,8715334528,7908170096,16623504624,3658144,7946389216,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 8715335296,142624,8715477920,7911687504,16627165424,1952,7911832080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 8715479152,12381840,8727860992,7899308528,16627169520,2434048,7914124416,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 8727906576,5472,8727912048,7901693568,16629605616,1920,7901700960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8727973776,10337424,8738311200,7891298512,16629609712,34581888,7936217824,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8738354352,4528,8738358880,7925834416,16664193296,141376,7925980320,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8738361280,5024,8738366304,7925970288,16664336592,12743040,7938718352,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 8738366992,15264272,8753631264,7923451056,16677082320,2208,7938717536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 8753632368,5478080,8759110448,7917975968,16677086416,10444640,7933898688,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 8759129936,3248,8759133184,7928399152,16687532336,1952,7928404352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8759141696,3280,8759144976,7928391392,16687536368,928,7928395600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8759228944,3824,8759232768,7928305808,16687538576,15807712,7944117344,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8759289824,7104,8759296928,7944052080,16703349008,5580608,7949639792,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 8759350048,13664,8759363712,7949568112,16708931824,1920,7949583696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 8759388112,8912,8759397024,7949539056,16708936080,1440,7949549408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 8759409616,6704,8759416320,7949523760,16708940080,1312,7949531776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 8759427408,13856,8759441264,7949504736,16708946000,22080,7949540672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 8759448880,9792,8759458672,7949597888,16709056560,1344,7949609024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 8759519552,14720,8759534272,7949525552,16709059824,5952,7949546224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 8759566176,13888,8759580064,7949487952,16709068016,1120,7949502960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 8759586224,3295552,8762881776,7946190464,16709072240,6144,7949492160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 8762888848,4368,8762893216,7946317488,16709210704,1952,7946323808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 8762906064,4656,8762910720,7946304752,16709215472,1248,7946310656,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8763025376,7440,8763032816,7946186720,16709219536,38432,7946232592,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 8763074480,3508112,8766582592,7942676912,16709259504,3551520,7949736544,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 8766605088,3552,8766608640,7946204112,16712812752,5216,7946212880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8766612528,2419360,8769031888,7943789056,16712820944,2432,7946210848,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 8769052480,3536,8769056016,7943769056,16712825072,49920,7943822512,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 8769058256,25532576,8794590832,7918286464,16712877296,4215904,7948034944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 8794591296,12078096,8806669392,7910426752,16717096144,4128,7922508976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 8806669952,3792,8806673744,7910428576,16717102320,2539872,7912972240,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 8806732176,2291728,8809023904,7910620080,16719643984,1856,7912913664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 8809081648,3666432,8812748080,7906899872,16719647952,24050080,7934616384,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 8812959120,3891648,8816850768,7926848960,16743699728,12171808,7942912416,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 8822205072,5719472,8827924544,7927950800,16755875344,2411200,7936081472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 8827943840,241592832,9069536672,7688767760,16758304432,3849120,7934209712,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9069554896,2155264,9071710160,7690445088,16762155248,3791648,7696392000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9071720080,3136,9071723216,7694225920,16765949136,5113664,7699342720,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9071732128,3104,9071735232,7699329936,16771065168,5721440,7705054480,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9071757200,4832,9071762032,7705027200,16776789232,243282592,7948314624,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 9071845504,10688,9071856192,7948218160,17020074352,2181056,7950409904,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 9071858192,2674176,9074532368,7947725088,17022257456,1952,7950401216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 9074542976,6144,9074549120,7947712368,17022261488,2752,7947721264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 9074559056,7900928,9082459984,7939805696,17022265680,1536,7947708160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 9082503840,5420400,9087924240,7934344608,17022268848,47200,7939812208,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9087949744,3463008,9091412752,7930905024,17022317776,2768704,7937136736,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 9091444400,4592,9091448992,7933639056,17025088048,1888,7933645536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9091490976,3984,9091494960,7933596864,17025091824,7918304,7941519152,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9091536800,3008,9091539808,7941472688,17033012496,5477536,7946953232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 9091552896,3793872,9095346768,7943146240,17038493008,3490304,7950430416,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 9095367760,3648,9095371408,7946613344,17041984752,2592,7946619584,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9095375568,2602960,9097978528,7944010320,17041988848,1952,7946615232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9097995936,5056,9098000992,7943991952,17041992944,47552,7944044560,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9098002944,33679648,9131682592,7910360496,17042043088,3416192,7947456336,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 9131683136,142512,9131825648,7913635552,17045461200,2048,7913780112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 9131826304,11921232,9143747536,7901717792,17045465328,2434656,7916073680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 9143785760,4032,9143789792,7904112784,17047902576,1920,7904118736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9143834640,10302048,9154136688,7893769824,17047906512,34610912,7938682784,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9154172848,4192,9154177040,7928341792,17082518832,140352,7928486336,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9154178848,5216,9154184064,7928477072,17082661136,11964480,7940446768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 9154184528,15674288,9169858816,7924769840,17094628656,2208,7940446336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 9169860304,5507232,9175367536,7919265120,17094632656,10482784,7935255136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 9175383552,3328,9175386880,7929730896,17105117776,1920,7929736144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9175394576,4544,9175399120,7929722432,17105121552,864,7929727840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9175444112,3168,9175447280,7929676416,17105123696,15782656,7945462240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9175485568,3120,9175488688,7945419840,17120908528,5489472,7950912432,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 9175508704,8800,9175517504,7950882736,17126400240,1984,7950893520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 9175532896,7136,9175540032,7950864304,17126404336,1440,7950872880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 9175546720,6784,9175553504,7950855344,17126408848,3520,7950865648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 9175560832,8544,9175569376,7950845168,17126414544,3456,7950857168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 9175575952,7424,9175583376,7950837440,17126420816,1344,7950846208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 9175621088,13728,9175634816,7950790000,17126424816,4448,7950808176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 9175694400,6576,9175700976,7950730080,17126431056,1120,7950737776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 9175707424,3588192,9179295616,7947139568,17126435184,1632,7950729392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 9179301920,5056,9179306976,7947132176,17126439152,1472,7947138704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 9179315984,4032,9179320016,7947123360,17126443376,1248,7947128640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9179415840,3936,9179419776,7947027664,17126447440,26944,7947058544,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 9179454496,3731184,9183185680,7943290400,17126476080,3512928,7950534512,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 9183207680,3312,9183210992,7946780512,17129991504,2400,7946786224,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9183215088,2403584,9185618672,7944376832,17129995504,2080,7946782496,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9185636640,4256,9185640896,7944358928,17129999824,47872,7944411056,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9185643280,24602576,9210245856,7919804272,17130050128,3447936,7947854784,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 9210246512,12468592,9222715104,7910784624,17133499728,3616,7923256832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 9222715968,3536,9222719504,7910786368,17133505872,2833664,7913623568,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 9222764704,2305392,9225070096,7911271136,17136341232,1888,7913578416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9225121152,3679872,9228801024,7907544400,17136345424,25380896,7936605168,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9228948704,3587632,9232536336,7929192896,17161729232,11852064,7944632592,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 9238067328,5798816,9243866144,7929718480,17173584624,2479616,7937996912,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 9243884080,242194624,9486078704,7689988608,17176067312,3863872,7936047104,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9486095072,2150672,9488245744,7691687168,17179932912,3950816,7697788656,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9488255824,3488,9488259312,7695626208,17183885520,5209696,7700839392,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9488268208,2720,9488270928,7700825856,17189096784,5707104,7706535680,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9488297024,4944,9488301968,7706503520,17194805488,243530720,7950039184,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 9488395376,9120,9488404496,7949933824,17438338320,2179584,7952122528,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 9488405392,2665456,9491070848,7949449552,17440520400,2048,7952117056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 9491082384,5840,9491088224,7949436304,17440524528,2752,7949444896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 9491098944,7923936,9499022880,7941505712,17440528592,1536,7949431184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 9499066240,5412928,9504479168,7936053520,17440532688,45664,7941512112,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9504498704,3451984,9507950688,7932630160,17440580848,2772320,7938854464,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 9507981856,4192,9507986048,7935368816,17443354864,1888,7935374896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9508032496,3776,9508036272,7935322688,17443358960,7933664,7943260128,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9508079104,2880,9508081984,7943211952,17451293936,5481440,7948696272,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 9508095536,3336592,9511432128,7945345296,17456777424,3490848,7952172736,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 9511454736,3664,9511458400,7948811920,17460270320,2304,7948817888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9511462736,2457488,9513920224,7946354192,17460274416,2176,7948813856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9513936960,3600,9513940560,7946337984,17460278544,46048,7946387632,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9513942480,34361680,9548304160,7912023600,17460327760,3426208,7949811488,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 9548304704,141440,9548446144,7915310864,17463757008,1952,7915454256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 9548447904,12797392,9561245296,7902515840,17463761136,2438752,7917751984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 9561282800,3856,9561286656,7904915696,17466202352,1888,7904921440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9561328784,10280688,9571609472,7894596976,17466206448,34688000,7939565664,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9571644000,3888,9571647888,7929248640,17500896528,140192,7929392720,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9571650112,3968,9571654080,7929385776,17501039856,12220320,7941610064,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 9571654816,15716592,9587371408,7925890144,17513261552,2016,7941608752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 9587372464,5458352,9592830816,7920434608,17513265424,10986432,7936879392,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 9592846560,3472,9592850032,7931403904,17524253936,1952,7931409328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9592857264,3232,9592860496,7931397536,17524258032,896,7931401664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9592901568,8208,9592909776,7931350432,17524260208,15775616,7947134256,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9592938608,2976,9592941584,7947096288,17540037872,5476288,7952575552,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 9592960784,5904,9592966688,7952549584,17545516272,1952,7952557440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 9592976752,5360,9592982112,7952538256,17545520368,1440,7952545056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 9592990256,4864,9592995120,7952529344,17545524464,1280,7952535488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 9593001168,6512,9593007680,7952520880,17545528560,3040,7952530432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 9593014720,5296,9593020016,7952514688,17545534704,1440,7952521424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 9593034496,9632,9593044128,7952493264,17545537392,4672,7952507568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 9593052880,4080,9593056960,7952487056,17545544016,1088,7952492224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 9593061488,3480256,9596541744,7949006272,17545548016,1600,7952488128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 9596547472,14992,9596562464,7948989648,17545552112,1504,7949006144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 9596568416,8112,9596576528,7948979808,17545556336,1248,7948989168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9596657552,3232,9596660784,7948899520,17545560304,25984,7948928736,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 9596690480,4077072,9600767552,7944821424,17545588976,3520064,7952418560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 9600790032,3152,9600793184,7948317328,17549110512,2688,7948323168,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9600797136,2398464,9603195600,7945919008,17549114608,2016,7948319488,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9603214272,5344,9603219616,7945899056,17549118672,49440,7945953840,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9603222352,24909936,9628132288,7921037616,17549169904,3445856,7949393408,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 9628132960,12467968,9640600928,7912016880,17552617808,3680,7924488528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 9640601840,4032,9640605872,7912017952,17552623824,2677920,7914699904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 9640649808,2305344,9642955152,7912348608,17555303760,1888,7914655840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9643007808,3679280,9646687088,7908620768,17555307856,25633504,7937933552,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9646813632,3625584,9650439216,7930504416,17580943632,11815744,7945945744,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 9655795904,5783504,9661579408,7931183424,17592762832,2383392,7939350320,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 9661594736,241181248,9902775984,7692371520,17595147504,3935872,7937488640,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9902783600,2161168,9904944768,7694141040,17599085808,3919136,7700221344,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9904952944,3200,9904956144,7698050560,17603006704,5242336,7703296096,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9904964352,2960,9904967312,7703283392,17608250704,5685216,7708971568,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 9904979552,4192,9904983744,7708955184,17613938928,243162464,7952121840,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 9905031312,8000,9905039312,7952063808,17857103120,2174272,7954246080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 9905039824,2722080,9907761904,7951518240,17859280144,1920,7954242240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 9907771376,5648,9907777024,7951507184,17859284208,2624,7951515456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 9907783040,7830512,9915613552,7943674720,17859288272,1536,7951506768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 9915639008,5440768,9921079776,7938212624,17859292400,45184,7943698576,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9921096624,3450848,9924547472,7934792000,17859339472,2773504,7941016352,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 9924577200,4256,9924581456,7937532800,17862114256,1920,7937538976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9924621872,3040,9924624912,7937493760,17862118672,7919360,7945416160,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9924664912,2704,9924667616,7945372848,17870040464,5467552,7950843104,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 9924678944,3344800,9928023744,7947486736,17875510480,3489920,7954321456,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 9928041984,3536,9928045520,7950957920,17879003440,2400,7950963856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9928049728,2406000,9930455728,7948551808,17879007536,1952,7950959760,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 9930472160,5056,9930477216,7948534352,17879011568,47104,7948586512,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9930479312,34486272,9964965584,7914096160,17879061744,3419008,7952001440,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 9964966112,146560,9965112672,7917369392,17882482064,1984,7917517936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 9965114944,12742720,9977857664,7904628432,17882486096,2434304,7919805456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 9977892880,4832,9977897712,7907025408,17884923120,1920,7907032160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 9977939488,10299984,9988239472,7896687744,17884927216,34663328,7941651056,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 9988272720,3760,9988276480,7931315408,17919591888,140288,7931459456,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 9988278528,5072,9988283600,7931451424,17919735024,11913600,7943370096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 9988284160,15667456,10003951616,7927698640,17931650256,2176,7943368272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10003952288,5470336,10009422624,7922231760,17931654384,10436992,7938139088,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 10009437376,3328,10009440704,7932653360,17942094064,1920,7932658608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10009446992,2944,10009449936,7932648256,17942098192,2720,7932653920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10009475088,4896,10009479984,7932622304,17942102288,15837408,7948464608,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10009506448,4896,10009511344,7948430144,17957941488,5479968,7953915008,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 10009529888,6080,10009535968,7953886992,17963422960,1920,7953894992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10009542304,3728,10009546032,7953881120,17963427152,1408,7953886256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 10009549984,4960,10009554944,7953876304,17963431248,1312,7953882576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10009560416,5664,10009566080,7953869136,17963435216,3104,7953877904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10009571136,4320,10009575456,7953866032,17963441488,1376,7953871728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 10009590912,5104,10009596016,7953849472,17963445488,4480,7953859056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 10009602768,4240,10009607008,7953844464,17963451472,1088,7953849792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 10009611632,3383936,10012995568,7950458784,17963454352,1632,7953844352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 10013000288,4400,10013004688,7950454112,17963458800,1472,7950459984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10013010256,4128,10013014384,7950448512,17963462896,1280,7950453920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10013081440,3632,10013085072,7950381920,17963466992,25376,7950410928,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 10013114832,4174096,10017288928,7946204720,17963493648,3513056,7953891872,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 10017309120,3376,10017312496,7949695520,17967008016,2592,7949701488,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10017316448,2480320,10019796768,7947215312,17967012080,1984,7949697616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10019813408,4352,10019817760,7947198416,17967016176,48640,7947251408,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10019819968,24896064,10044716032,7922351344,17967067376,3444384,7950691792,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 10044716608,12393200,10057109808,7913404480,17970514288,3840,7925801520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10057110592,6272,10057116864,7913403472,17970520336,2452608,7915862352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 10057165088,2312480,10059477568,7913497296,17972974864,1856,7915811632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10059523488,3740880,10063264368,7909714560,17972978928,25941344,7939396784,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10063367760,3646448,10067014208,7931908784,17998922992,11825184,7947380416,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 10072089968,5698240,10077788208,7932963072,18010751280,2374368,7941035680,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 10077802720,242529136,10320331856,7692796064,18013127920,3870592,7939195792,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10320338112,2163248,10322501360,7694499360,18017000720,3897536,7700560144,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10322510048,3520,10322513568,7698386512,18020900080,5456384,7703846416,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10322521440,2912,10322524352,7703833648,18026358000,5682784,7709519344,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10322536160,3152,10322539312,7709503904,18032043216,243159328,7952666384,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 10322586624,6128,10322592752,7952612768,18275205520,2185664,7954804560,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 10322593184,2725120,10325318304,7952075312,18277393616,1984,7954802416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 10325327632,4896,10325332528,7952065216,18277397744,2976,7952073088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10325341008,7976736,10333317744,7944084256,18277402000,1536,7952062528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10333346592,5436928,10338783520,7938622416,18277405936,50944,7944110288,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10338800832,3461888,10342262720,7935195440,18277458160,2771296,7941428624,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 10342294256,4528,10342298784,7937933360,18280232144,1856,7937939744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10342343488,4128,10342347616,7937888656,18280236272,7895424,7945788208,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10342387984,3056,10342391040,7945742352,18288133392,5527488,7951272896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 10342403744,3366192,10345769936,7947892992,18293662928,3679488,7954938672,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 10345789488,3632,10345793120,7951552144,18297345264,2752,7951558528,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10345797184,2402448,10348199632,7949149696,18297349328,2240,7951554384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10348216320,4144,10348220464,7949132960,18297353424,48032,7949185136,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10348222432,34547792,10382770224,7914633760,18297403984,4093952,7953275504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 10382770800,142192,10382912992,7918587696,18301500688,1920,7918731808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10382913600,12656032,10395569632,7905935152,18301504784,2438080,7921029264,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 10395606256,5072,10395611328,7908333616,18303944944,1888,7908340576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10395651008,10406832,10406057840,7897891200,18303949040,34779168,7943077200,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10406089488,4448,10406093936,7932637344,18338731280,141376,7932783168,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10406095440,4544,10406099984,7932775712,18338875696,11911488,7944691744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 10406100768,15667616,10421768384,7929020432,18350788816,2272,7944690320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10421769648,5466464,10427236112,7923556832,18350792944,10935616,7939958912,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 10427250736,3472,10427254208,7934477104,18361731312,7584,7934488160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10427260624,3056,10427263680,7934491280,18361754960,8672,7934503008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10427291888,4336,10427296224,7934470000,18361766224,16098720,7950573056,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10427326640,4480,10427331120,7950536384,18377867504,5481952,7956022816,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 10427349184,4992,10427354176,7955997936,18383352112,1952,7956004880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10427360864,6576,10427367440,7955988704,18383356144,1440,7955996720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 10427371968,4992,10427376960,7955983344,18383360304,1312,7955989648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10427382512,5408,10427387920,7955976416,18383364336,3648,7955985472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10427392432,5312,10427397744,7955972736,18383370480,1312,7955979360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 10427411216,7392,10427418608,7955955936,18383374544,4896,7955968224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 10427426336,6000,10427432336,7955948384,18383380720,1120,7955955504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 10427437232,3383152,10430820384,7952563056,18383383440,1632,7955947840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 10430825344,4096,10430829440,7952558448,18383387888,1472,7952564016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10430834912,3536,10430838448,7952553632,18383392080,1472,7952558640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10430906208,4352,10430910560,7952485616,18383396176,26816,7952516784,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 10430937888,3461120,10434399008,7949025744,18383424752,3515712,7956002576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 10434421152,3232,10434424384,7952518928,18386943312,2400,7952524560,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10434428384,2715872,10437144256,7949803120,18386947376,2048,7952521040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10437161424,3840,10437165264,7949786144,18386951408,49056,7949839040,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10437167840,25295920,10462463760,7924538848,18387002608,3425184,7953259952,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 10462464224,12040320,10474504544,7915925488,18390430032,3808,7927969616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10474505904,3648,10474509552,7915926496,18390436048,2433728,7918363872,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 10474558016,2404080,10476962096,7915909184,18392871280,1856,7918315120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10477007616,3774624,10480782240,7912093008,18392875248,25886688,7941754320,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10480880432,3807488,10484687920,7934077120,18418765040,11822752,7949707360,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 10489782672,5707328,10495490000,7935100416,18430590416,2358144,7943165888,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 10495504576,242555424,10738060000,7694891536,18432951536,3870208,7941317168,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10738064944,2168880,10740233824,7696590480,18436824304,3901312,7702660672,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10740242016,3424,10740245440,7700482448,18440727888,5449536,7705935408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10740253232,3200,10740256432,7705922368,18446178800,5678048,7711603616,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 10740267424,3536,10740270960,7711588736,18451859696,244356320,7955948592,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 10740309120,7584,10740316704,7955902224,18696218928,2190848,7958100656,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 10740317328,2733648,10743050976,7955360240,18698411216,1952,7958095840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 10743059760,5200,10743064960,7955350480,18698415440,2944,7955358624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10743071280,7926752,10750998032,7947423456,18698421488,1536,7955351744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10751021888,5496224,10756518112,7941907472,18698425584,49888,7947453584,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10756533936,3806368,10760340304,7938137600,18698477904,2770112,7944714080,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 10760370896,4336,10760375232,7940874640,18701249872,1888,7940880864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10760416384,4608,10760420992,7940832624,18701253616,8399808,7949237040,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10760459952,3376,10760463328,7949191472,18709654800,5519104,7954713952,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 10760475296,3736560,10764211856,7950964448,18715176304,3799840,7958500848,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 10764230432,3392,10764233824,7954744464,18718978288,4928,7954752784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10764237888,2407200,10766645088,7952339504,18718984592,2112,7954748816,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10766661584,3248,10766664832,7952323696,18718988528,46272,7952373216,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10766666720,34290256,10800956976,7918079648,18719036624,3862208,7956232112,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 10800957488,141824,10801099312,7921801920,18722901232,1952,7921945696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10801100576,12269712,10813370288,7909535040,18722905328,2437024,7924241776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 10813405408,3552,10813408960,7911934704,18725343664,1888,7911940144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10813449504,10705472,10824154976,7901192624,18725347600,34519392,7946417488,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10824185456,4800,10824190256,7935679488,18759869744,140416,7935824704,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10824191840,4736,10824196576,7935816464,18760013040,11940640,7947761840,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 10824196976,15747040,10839944016,7932010912,18771954928,2400,7947760352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10839944912,5468144,10845413056,7926546064,18771959120,11079968,7943094176,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 10845427776,2992,10845430768,7937609984,18783040752,2496,7937615472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10845436992,3232,10845440224,7937604624,18783044848,2144,7937610000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10845463472,3664,10845467136,7937581808,18783048944,15949184,7953534656,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10845493456,5712,10845499168,7953500624,18798999792,5503712,7959010048,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 10845518640,4272,10845522912,7958981904,18804504816,1920,7958988096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10845528528,3024,10845531552,7958977488,18804509040,1440,7958981952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 10845535536,4240,10845539776,7958973328,18804513104,1312,7958978880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 10845544752,4768,10845549520,7958967584,18804517104,3456,7958975808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10845553792,4704,10845558496,7958964848,18804523344,1440,7958970992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 10845570800,8176,10845578976,7958948368,18804527344,4800,7958961344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 10845584320,5568,10845589888,7958943824,18804533712,1088,7958950480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 10845594880,3400304,10848995184,7955542496,18804537680,1632,7958944432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 10848999600,3200,10849002800,7955538848,18804541648,1504,7955543552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 10849008000,3136,10849011136,7955533424,18804544560,1280,7955537840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10849078496,3600,10849082096,7955466080,18804548176,25920,7955495600,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 10849106608,3388640,10852495248,7952081312,18804576560,3549088,7959019040,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 10852515584,3328,10852518912,7955609840,18808128752,2400,7955615568,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10852522816,2655088,10855177904,7952955008,18808132912,2176,7955612272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 10855194528,2912,10855197440,7952939504,18808136944,48352,7952990768,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 10855199632,25476928,10880676560,7927510560,18808187120,3443040,7956430528,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 10880677024,11809264,10892486288,7919145536,18811631824,3840,7930958640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 10892487120,3728,10892490848,7919147152,18811638000,2447008,7921597888,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 10892535344,2348800,10894884144,7919203264,18814087408,1920,7921553984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 10894930432,3903680,10898834112,7915257488,18814091600,25021376,7944182544,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 10898926080,3822512,10902748592,7936367552,18839116144,11827520,7952017584,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 10907988240,5662752,10913650992,7937296576,18850947568,2414464,7945373792,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 10913665552,242102864,11155768416,7697596656,18853365072,3933056,7943632576,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11155775632,2160320,11157935952,7699365248,18857301200,3838272,7705363840,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11157944656,3344,11157948000,7703193200,18861141200,5452544,7708649088,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11157955712,2976,11157958688,7708636368,18866595056,5752064,7714391408,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11157970944,3360,11157974304,7714374640,18872348944,242752640,7957130640,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 11158029168,8016,11158037184,7957067376,19115104560,2175072,7959250464,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 11158037792,2721248,11160759040,7956522480,19117281520,1952,7959245680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 11160772176,5584,11160777760,7956507952,19117285712,2976,7956516512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 11160785152,7870928,11168656080,7948635648,19117291728,1632,7956508208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 11168688352,5474944,11174163296,7943132528,19117295824,49280,7948656752,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11174181136,3657488,11177838624,7939508400,19117347024,2774432,7945940320,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 11177872496,4000,11177876496,7942246624,19120123120,1888,7942252512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11177920672,4176,11177924848,7942202368,19120127216,7918048,7950124592,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11177967232,2656,11177969888,7950078000,19128047888,5545440,7955626096,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 11177981296,3964352,11181945648,7951650240,19133595888,3704416,7959319008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 11181967776,3856,11181971632,7955330112,19137301744,6656,7955340624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11181975712,2399984,11184375696,7952934240,19137309936,5088,7955339312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11184393456,4064,11184397520,7952920576,19137318096,75392,7953000032,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11184399440,34796224,11219195664,7918199264,19137394928,3973760,7956969248,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 11219196320,145248,11219341568,7922029552,19141371120,1952,7922176752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 11219343280,11913056,11231256336,7910118880,19141375216,2437984,7924469920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 11231293280,4416,11231297696,7912516880,19143814576,1888,7912523184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11231338640,10712864,11242051504,7901766976,19143818480,34589248,7947069088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11242089488,4624,11242094112,7936315120,19178409232,140128,7936459872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11242096160,6704,11242102864,7936448672,19178551536,11918368,7948373744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 11242103264,16270064,11258373328,7932098560,19190471888,2176,7948370800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 11258374400,5468704,11263843104,7926632880,19190475984,10877600,7942979184,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 11263859136,3056,11263862192,7937492896,19201355088,2048,7937498000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11263869040,3264,11263872304,7937486784,19201359088,864,7937490912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11263901008,4784,11263905792,7937455440,19201361232,16805760,7954265984,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11263933664,8880,11263942544,7954226528,19218169072,5480000,7959715408,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 11263959952,4384,11263964336,7959686208,19223650544,1952,7959692544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 11263973296,5600,11263978896,7959675744,19223654640,1408,7959682752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 11263984384,5648,11263990032,7959668704,19223658736,3744,7959678096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 11263995600,6832,11264002432,7959662416,19223664848,3456,7959672704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 11264006688,3792,11264010480,7959660576,19223671056,1344,7959665712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 11264026688,6864,11264033552,7959641568,19223675120,4448,7959652880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 11264040016,6224,11264046240,7959635024,19223681264,1088,7959642336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 11264050960,3376224,11267427184,7956258144,19223685328,1664,7959636032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 11267432240,3552,11267435792,7956253664,19223689456,1472,7956258688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 11267441520,3376,11267444896,7956248656,19223693552,1280,7956253312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11267518640,3456,11267522096,7956174464,19223696560,27104,7956205024,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 11267548304,3379696,11270928000,7952798320,19223726320,3516032,7959694048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 11270947936,3376,11270951312,7956293472,19227244784,2400,7956299248,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11270955440,2416896,11273372336,7953876544,19227248880,2016,7956295456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11273389664,4256,11273393920,7953859088,19227253008,48160,7953911504,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11273396192,25907280,11299303472,7927999776,19227303248,3527936,7957434992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 11299304000,11798912,11311102912,7919730992,19230833904,3616,7931533520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 11311103744,5120,11311108864,7919731184,19230840048,2491008,7922227312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 11311153232,2338816,11313492048,7919840416,19233332464,1856,7922181088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11313539664,3894880,11317434544,7915902016,19233336560,26017728,7945814624,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11317517952,3871856,11321389808,7937966592,19259356400,11800000,7953638448,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 11326581024,5674672,11332255696,7938904576,19271160272,2401824,7946981072,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 11332270880,242682720,11574953600,7698609776,19273563376,3883328,7945175824,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11574957984,2170528,11577128512,7700319920,19277448432,3884192,7706374640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11577137088,3376,11577140464,7704194464,19281334928,5423936,7709621776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11577148000,2960,11577150960,7709609728,19286760688,5687360,7715300048,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11577163440,2768,11577166208,7715284848,19292451056,241628288,7956915904,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 11577206880,5952,11577212832,7956869488,19534082320,2169824,7959045264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 11577213936,2729776,11579943712,7956310480,19536254192,1952,7959042208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 11579952896,5344,11579958240,7956300048,19536258288,2944,7956308336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 11579964608,7972592,11587937200,7948325312,19536262512,1536,7956299440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 11587962352,5457488,11593419840,7942846640,19536266480,46432,7948350560,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11593435824,3691792,11597127616,7939187984,19536315600,2777056,7945656832,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 11597158368,4160,11597162528,7941933264,19539095792,1920,7941939344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11597202656,3680,11597206336,7941893552,19539099888,7852032,7949749264,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11597245680,2880,11597248560,7949706432,19546954992,5480384,7955189696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 11597260208,3930336,11601190544,7951247968,19552438512,3482688,7958660992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 11601209328,3520,11601212848,7954711456,19555924304,2336,7954717312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11601216976,2402512,11603619488,7952309008,19555928496,2048,7954713568,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11603636736,3792,11603640528,7952291968,19555932496,47680,7952343440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11603642784,34326752,11637969536,7918012016,19555981552,3432384,7955771152,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 11637970176,143776,11638113952,7921302096,19559416048,1952,7921447824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 11638115056,11933456,11650048512,7909371696,19559420208,2433024,7923738176,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 11650082816,4144,11650086960,7911768352,19561855312,1888,7911774384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11650129216,10698336,11660827552,7901031888,19561859440,34484864,7946215088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11660863120,3504,11660866624,7935478992,19596345616,140064,7935622560,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11660868192,3600,11660871792,7935616128,19596487920,12103776,7947723504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 11660872400,15999776,11676872176,7931721536,19608593712,2048,7947723360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 11676872672,5466016,11682338688,7926259056,19608597744,10852384,7942577456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 11682352992,3248,11682356240,7937095904,19619452144,2048,7937101200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11682362192,3056,11682365248,7937090992,19619456240,832,7937094880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11682388928,4496,11682393424,7937065056,19619458480,15941600,7953011152,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11682419952,6288,11682426240,7952976752,19635402992,5533120,7958516160,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 11682443648,5520,11682449168,7958488544,19640937712,2560,7958496624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 11682455824,5056,11682460880,7958480928,19640941808,1440,7958487424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 11682465232,3248,11682468480,7958477680,19640946160,1312,7958482240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 11682472800,4880,11682477680,7958472352,19640950032,9408,7958486640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 11682482416,4144,11682486560,7958475760,19640962320,1408,7958481312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 11682498624,3600,11682502224,7958464160,19640966384,4544,7958472304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 11682508304,5520,11682513824,7958458800,19640972624,1088,7958465408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 11682518144,3398384,11685916528,7955060096,19640976624,11488,7958469968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 11685921136,3328,11685924464,7955066464,19640990928,10656,7955080448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 11685929936,3680,11685933616,7955069632,19641003248,1760,7955075072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11686002608,3376,11686005984,7955001488,19641007472,34688,7955039552,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 11686030896,3386544,11689417440,7951627888,19641045328,3517632,7958532064,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 11689438448,3376,11689441824,7955122896,19644564720,2368,7955128640,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11689445776,2414896,11691860672,7952708240,19644568912,2080,7955125216,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 11691877680,4256,11691881936,7952690976,19644572912,50432,7952745664,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 11691884112,26528176,11718412288,7926212848,19644625136,3448832,7956189856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 11718413040,11804784,11730217824,7917858192,19648076016,3360,7929666336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 11730218672,4704,11730223376,7917858784,19648082160,2457216,7920320704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 11730265552,2299376,11732564928,7917977008,19650541936,1888,7920278272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 11732612032,3838608,11736450640,7914095264,19650545904,25767264,7943701136,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 11736546400,3792736,11740339136,7935976752,19676315888,11886144,7951655632,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 11745724080,5676432,11751400512,7936804080,19688204592,2350784,7944831296,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 11751415552,241260960,11992676512,7697880176,19690556688,3769696,7942910832,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11992681040,2160784,11994841824,7699487344,19694329168,4067488,7705715616,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11994850016,3008,11994853024,7703546544,19698399568,5439008,7708988560,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11994860672,2880,11994863552,7708977552,19703841104,5761760,7714742192,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 11994874528,3184,11994877712,7714726432,19709604144,241841472,7956571088,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 11994912496,5472,11994917968,7956529344,19951447312,2185280,7958720096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 11994918576,2746912,11997665488,7955970176,19953635664,1952,7958719040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 11997674384,5056,11997679440,7955960224,19953639664,2976,7955968256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 11997687744,7856496,12005544240,7948099776,19953644016,1536,7955957808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12005566864,5437184,12011004048,7942643904,19953647952,47104,7948128192,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12011021168,3452400,12014473568,7939224432,19953698000,2773376,7945450208,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 12014504912,4416,12014509328,7941964768,19956474096,1856,7941971040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12014549744,3712,12014553456,7941924736,19956478192,7878016,7949806464,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12014592256,3232,12014595488,7949763440,19964358928,5479584,7955246256,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 12014607344,3347184,12017954528,7951885936,19969840464,3491872,7958724992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 12017973440,3424,12017976864,7955358384,19973335248,2624,7955364432,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12017980944,2405552,12020386496,7952952848,19973339344,2048,7955360448,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12020402704,3312,12020406016,7952937424,19973343440,46688,7952987424,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12020407984,34147376,12054555360,7918836240,19973391600,4083584,7957067200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 12054555920,139792,12054695712,7922781680,19977477392,2336,7922923808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12054696320,12335264,12067031584,7910449968,19977481552,2549760,7925334992,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 12067067616,3856,12067071472,7912961792,19980033264,1888,7912967536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12067111744,10733504,12077845248,7902192112,19980037360,34247328,7947172944,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12077877424,3456,12077880880,7936406240,20014287120,146144,7936555840,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12077882448,3552,12077886000,7936548512,20014434512,12350112,7948902176,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 12077886416,15508976,12093395392,7933391664,20026787056,2208,7948902848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12093396160,5630592,12099026752,7927764400,20026791152,10440128,7943835120,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 12099041312,3008,12099044320,7938188592,20037232912,1920,7938193520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12099050880,3088,12099053968,7938183008,20037236976,3008,7938189104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12099080688,4080,12099084768,7938158352,20037243120,14879520,7953041952,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12099116992,5808,12099122800,7953002112,20052124912,5635680,7958643600,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 12099140368,4576,12099144944,7958617056,20057762000,1984,7958623616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12099151600,5888,12099157488,7958608640,20057766128,1440,7958615968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 12099164048,5232,12099169280,7958600976,20057770256,1440,7958607648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12099175600,6880,12099182480,7958591840,20057774320,3072,7958601792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12099187920,3568,12099191488,7958588976,20057780464,1792,7958594336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 12099205584,7216,12099212800,7958571888,20057784688,4544,7958583648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 12099220304,4240,12099224544,7958566160,20057790704,7584,7958577984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 12099229024,3415696,12102644720,7955156224,20057800944,1952,7958573872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 12102649600,3664,12102653264,7955151744,20057805008,2016,7955157424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12102658976,4032,12102663008,7955147312,20057810320,1248,7955152592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12102731760,3472,12102735232,7955078000,20057813232,25632,7955107104,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 12102763296,3785712,12106549008,7951292896,20057841904,3676192,7958754800,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 12106572432,3456,12106575888,7954945248,20061521136,2400,7954951104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12106579968,2421376,12109001344,7952523984,20061525328,2240,7954947600,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12109018240,3632,12109021872,7952507616,20061529488,49472,7952560720,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12109024048,24918976,12133943024,7927638528,20061581552,3885408,7956442912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 12133943968,11816512,12145760480,7919708144,20065468624,3648,7931528304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12145761104,4224,12145765328,7919709568,20065474896,2445824,7922159616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 12145810624,2315536,12148126160,7919797024,20067923184,1888,7922114448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12148175264,3673040,12151848304,7916078944,20067927248,25171104,7944923088,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12151958496,3630304,12155588800,7937512464,20093101264,12445568,7953588336,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 12160681776,5663968,12166345744,7939203744,20105549488,2355424,7947223136,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 12166361456,241810560,12408172016,7699734688,20107906704,3719296,7945264544,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12408177200,2153840,12410331040,7701296560,20111627600,3800608,7707251008,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12410339888,3392,12410343280,7705087328,20115430608,5700544,7710791264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12410351024,2608,12410353632,7710779760,20121133392,5727296,7716509664,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12410366496,3360,12410369856,7716493808,20126863664,242556320,7959053488,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 12410411216,6880,12410418096,7959003520,20369421616,2181824,7961192224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 12410419024,2727760,12413146784,7958458032,20371604816,1952,7961187744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 12413155968,5920,12413161888,7958446928,20371608816,2976,7958455824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12413169136,7904880,12421074016,7950539056,20371613072,1504,7958445440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12421097872,5436560,12426534432,7945082544,20371616976,53440,7950572544,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12426550144,3452976,12430003120,7941670208,20371673328,2776864,7947900048,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 12430033024,4512,12430037536,7944413936,20374451472,1888,7944420336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12430079024,3456,12430082480,7944373056,20374455536,7782656,7952159168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12430125088,2960,12430128048,7952111968,20382240016,5478016,7957592944,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 12430139296,3350496,12433489792,7954230640,20387720432,3498272,7961079408,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 12433513184,3440,12433516624,7957703840,20391220464,2336,7957709616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12433520752,2400656,12435921408,7955303248,20391224656,2208,7957706112,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12435937824,3424,12435941248,7955287248,20391228496,46560,7955337232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12435943104,33721472,12469664576,7921613232,20391277808,3830208,7959164912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 12469665200,141584,12469806784,7925303824,20395110608,2208,7925447616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12469807456,12804480,12482611936,7912502800,20395114736,2680512,7927987792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 12482648128,4336,12482652464,7915144096,20397796560,1888,7915150320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12482692832,10304464,12492997296,7904803712,20397801008,33924352,7949032528,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12493029600,3376,12493032976,7938693920,20431726896,141056,7938838352,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12493034512,3376,12493037888,7938831312,20431869200,11924128,7950758816,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 12493038432,15858064,12508896496,7934899296,20443795792,1952,7950759312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12508896992,5503856,12514400848,7929398976,20443799824,10514592,7945417424,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 12514415408,3296,12514418704,7939897600,20454316304,1920,7939902816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12514425024,3168,12514428192,7939892176,20454320368,864,7939896208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12514452112,3264,12514455376,7939867232,20454322608,15693888,7955564384,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12514481248,5584,12514486832,7955531456,20470018288,5522272,7961059312,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 12514509200,4832,12514514032,7961028736,20475542768,2080,7961035648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12514520832,3648,12514524480,7961022384,20475546864,1408,7961027440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 12514528256,3232,12514531488,7961019472,20475550960,1312,7961024016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12514536496,4928,12514541424,7961013632,20475555056,10752,7961029312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12514546144,4448,12514550592,7961016752,20475567344,1376,7961022576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 12514563296,5936,12514569232,7961002208,20475571440,4672,7961012816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 12514575376,5872,12514581248,7960996400,20475577648,1312,7961003584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 12514586752,3723968,12518310720,7957270992,20475581712,1632,7960996592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 12518315392,3584,12518318976,7957266800,20475585776,1600,7957271984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12518324480,3152,12518327632,7957262432,20475590064,1312,7957266896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12518398784,3600,12518402384,7957191584,20475593968,31712,7957226896,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 12518427728,3783232,12522210960,7953417792,20475628752,3834528,7961035552,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 12522234160,3424,12522237584,7957228224,20479465808,2688,7957234336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12522241712,2414944,12524656656,7954814144,20479470800,2144,7957231232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12524673184,4112,12524677296,7954797600,20479474896,49376,7954851088,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12524679424,24946320,12549625744,7929900384,20479526128,3812864,7958659568,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 12549626384,12419104,12562045488,7921295040,20483340528,3968,7933718112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12562046160,3536,12562049696,7921296976,20483346672,2433376,7923733888,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 12562093424,2301408,12564394832,7921387936,20485782768,1888,7923691232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12564442960,3677760,12568120720,7917666112,20485786832,25033120,7946376992,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12568221584,3636768,12571858352,7938963264,20510821616,12471040,7955071072,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)" 12577385360,5689472,12583074832,7940221088,20523295920,2368672,7948279232,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)" 12583089648,242614848,12825704496,7699963072,20525667568,3739904,7946317824,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12825708976,2163952,12827872928,7701536336,20529409264,3745888,7707446176,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12827881296,3200,12827884496,7705272608,20533157104,5564416,7710840224,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12827891888,2816,12827894704,7710828928,20538723632,5812416,7716644160,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)" 12827905632,3408,12827909040,7716628800,20544537840,240774464,7957406672,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)" 12827945040,6240,12827951280,7957363008,20785314288,2176096,7959545344,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)" 12827951728,2737424,12830689152,7956804176,20787493328,1920,7959543520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_warp_kernel(const float *, float *, long, float)" 12830697568,4224,12830701792,7956795504,20787497296,3328,7956803056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12830708192,7910528,12838618720,7948884592,20787503312,1664,7956796784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12838639392,5443872,12844083264,7943424272,20787507536,47328,7948915472,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12844098448,3455904,12847554352,7940003232,20787557584,2772384,7946231520,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)" 12847584192,4192,12847588384,7942743376,20790331760,1856,7942749424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12847631904,3968,12847635872,7942699888,20790335760,7745440,7950449296,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12847674080,3232,12847677312,7950407056,20798084368,5472320,7955882608,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 12847688656,3344160,12851032816,7952525824,20803558640,3491552,7959361536,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 12851052560,3424,12851055984,7955996544,20807052528,2336,7956002304,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12851060032,2446080,12853506112,7953550704,20807056816,2112,7955998896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12853522048,4080,12853526128,7953534592,20807060720,47616,7953586288,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12853527984,34428288,12887956272,7919153568,20807109840,3424352,7957006208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void ::partial_absmax_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)" 12887956832,142624,12888099456,7922436720,20810536176,1920,7922581264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12888100144,11970816,12900070960,7910469312,20810540272,2456224,7924896352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void ::quantize_nvfp4_modulated_bf16_kernel(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)" 12900106576,4160,12900110736,7912887136,20812997872,2112,7912893408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12900151856,10292608,12910444464,7902557504,20813001968,34352224,7947202336,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12910477072,3488,12910480560,7936876640,20847357200,142208,7937022336,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12910482112,3440,12910485552,7937016096,20847501648,12776704,7949796240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)" 12910485968,15710112,12926196080,7934083936,20860280016,2208,7949796256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"::final_scale_bf16_compat_kernel(const float *, float *, long, float)" 12926196896,5472784,12931669680,7928614560,20860284240,10460288,7944547632,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)" 12931683824,3296,12931687120,7939059232,20870746352,1920,7939064448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor>, std::array>(int, T2, T3)" 12931693424,3040,12931696464,7939053984,20870750448,832,7939057856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor, std::array>(int, T2, T3)" 12931720272,4896,12931725168,7939027424,20870752592,15672768,7954705088,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu 12931751360,5600,12931756960,7954670928,20886427888,5476768,7960153296,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel 12931794720,5296,12931800016,7960106272,20891906288,1952,7960113520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12931813504,5104,12931818608,7960091776,20891910384,1440,7960098320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 12931822944,4992,12931827936,7960086544,20891914480,3648,7960095184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 12931834912,3584,12931838496,7960082096,20891920592,3456,7960089136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12931843712,6256,12931849968,7960076800,20891926768,1344,7960084400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array>(int, T2, T3)" 12931863456,6016,12931869472,7960061392,20891930864,4512,7960071920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 12931874880,6160,12931881040,7960055968,20891937008,1120,7960063248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 12931885456,3419808,12935305264,7956635872,20891941136,1632,7960057312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef, c10::ArrayRef, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)" 12935310032,3440,12935313472,7956631760,20891945232,1760,7956636960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 12935319248,3824,12935323072,7956626224,20891949296,1280,7956631328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12935393616,3472,12935397088,7956556272,20891953360,4640,7956564384,73,73,0,cudaLaunchKernel, 336 1 1, 2 32 1,"std::enable_if::type internal::gemvx::kernel, cublasGemvTensorStridedBatched, cublasGemvTensorStridedBatched, float>>(T13)" 12935413344,4165712,12939579056,7952380480,20891959536,3591232,7960137424,73,73,0,cudaLaunchKernel,37296 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 12939595600,4528,12939600128,7955952624,20895552752,1952,7955959104,73,73,0,cudaLaunchKernel, 6 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 12939605488,2413968,12942019456,7953537392,20895556848,5457248,7961408608,73,73,0,cudaLaunchKernel,391608 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12942027328,8912,12942036240,7958979552,20901015792,6822208,7965810672,73,73,0,cudaLaunchKernel,783216 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12942048464,24916112,12966964576,7940876176,20907840752,45056,7965837344,73,73,0,cudaLaunchKernel, 414 1 1, 32 4 1,"void at::native::::vectorized_layer_norm_kernel(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)" 12966971264,12477936,12979449200,7928438656,20907887856,6688,7940923280,73,73,0,cudaLaunchKernel, 6 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 12979453504,3792,12979457296,7928438880,20907896176,51296,7928493968,73,73,0,cudaLaunchKernel,4347 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12979463552,2335072,12981798624,7926151792,20907950416,61632,7928548496,73,73,0,cudaLaunchKernel,8694 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 12981866240,3651664,12985517904,7922496928,20908014832,4410976,7930559568,73,73,0,cudaLaunchKernel, 2 583 1, 8 16 1,"void magma_sgemmEx_kernel(int, int, int, Tensor, int, Tensor, int, Tensor, int, Tensor, int, int, int, const T1 *, const T1 *, T1, T1, int, cublasLtEpilogue_t, int, const void *, long)" 12985629840,3632144,12989261984,7923166384,20912428368,99968,7926898496,73,73,0,cuLaunchKernel, 13 1 3, 128 1 1,void cutlass::Kernel2(T1::Params) 12989265920,5139376,12994405296,7918125376,20912530672,4000,7923268752,73,73,0,cudaLaunchKernel, 1 26 1, 32 16 1,"void cublasLt::splitKreduce_kernel<(int)32, (int)16, int, float, float, float, float, (bool)0, float, float, float, (bool)1, (bool)1, (bool)0, (bool)0>(cublasLt::cublasSplitKParams, const T4 *, const T10 *, T9 *, T5 *, const T6 *, const T6 *, const T11 *, const T4 *, T11 *, void *, long, T6 *, int *, T6 *, T6 *, const T6 *, const T6 *, const T6 *, const T6 *, const T6 *)" 12994440912,5851392,13000292304,7912244512,20912536816,59776,7918155680,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 13000296656,243250816,13243547472,7669051776,20912599248,62272,7912364864,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 13243557840,2148320,13245706160,7666956672,20912662832,1280,7669106272,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 13245724144,3328,13245727472,7666939392,20912666864,100448,7667043168,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 13245743984,7392,13245751376,7667018016,20912769392,86400,7667111808,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 13245758144,2816,13245760960,7667096464,20912857424,1856,7667101136,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 13245765808,5008,13245770816,7667090608,20912861424,1472,7667097088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 13245781872,2852800,13248634672,7664230944,20912865616,5600,7667089344,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 13248646240,7456,13248653696,7664220016,20912873712,1312,7664228784,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 13248661136,7898176,13256559312,7656318592,20912877904,1536,7664218304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)" 13256563984,5458160,13262022144,7650859920,20912882064,1216,7656319296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add, std::array>(int, T2, T3)" 13262026592,3464144,13265490736,7647395264,20912886000,1376,7650860784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array>(int, T2, T3)" 13265503696,6336,13265510032,7647380288,20912890320,1664,7647388288,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 9)]::operator ()() const::[lambda(c10::BFloat16) (instance 1)], std::array>(int, T2, T3)" 13265514416,3440,13265517856,7647376432,20912894288,3360,7647383232,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 13265525680,22896,13265548576,7647351760,20912900336,4128,7647378784,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 13265553728,3416288,13268970016,7643936560,20912906576,2272,7647355120,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)" 13268977488,7328,13268984816,7643925760,20912910576,72864,7644005952,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 13268990016,2419488,13271409504,7641576048,20912985552,162432,7644157968,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add, std::array>(int, T2, T3)" 13271413136,3360,13271416496,7641732736,20913149232,2240,7641738336,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 13271419776,34474656,13305894432,7607258832,20913153264,2016,7641735504,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add, std::array>(int, T2, T3)" 13305926784,118912,13306045696,7607111376,20913157072,2848,7607233136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel::CompareEqFunctor>, std::array, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)" 20913225648,18000,,,20913239056,159936,173344,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add, std::array>(int, T2, T3)" 20913311408,35360,20913346768,53984,20913400752,83872,173216,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 20913363152,18032,20913381184,105616,20913486800,1184,124832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)" 20913400864,6560,20913407424,81584,20913489008,88064,176208,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 20913431520,11424,20913442944,135248,20913578192,172960,319632,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add, std::array>(int, T2, T3)" 20913495840,13200,20913509040,244000,20913753040,1824,259024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel::CompareEqFunctor>, std::array, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)" 20913773120,2928,,,20913773072,2336,2928,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add, std::array>(int, T2, T3)" 20913780720,3216,,,20913782096,3904,5280,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 20913787184,3296,20913790480,4544,20913795024,4928,12768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel, std::array, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)" 20913793584,2976,20913796560,4544,20913801104,27520,35040,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)" 20913800032,2736,20913802768,28128,20913830896,1600,32464,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add, std::array>(int, T2, T3)" 20913857440,4672,,,20913858544,1120,4672,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor>, std::array>(int, T2, T3)"