h3-blackwell-runtime/benchmarks/gb10-post-fc2-warmed-step-stats_cuda_kern_exec_trace.csv

2746 lines
940 KiB
CSV
Raw Permalink Normal View History

2026-08-26 16:14:12 +07:00
API Start (ns),API Dur (ns),Queue Start (ns),Queue Dur (ns),Kernel Start (ns),Kernel Dur (ns),Total Dur (ns),PID,TID,DevId,API Function,GridXYZ,BlockXYZ,Kernel Name
7267792,13408,,,7275376,2144,13408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7290064,5728,,,7292688,2816,5728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7303328,5504,,,7305872,3392,5936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7312624,3072,,,7313232,1088,3072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7320240,3056,,,7320496,1088,3056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7326912,2624,,,7326704,1056,2624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7332464,2944,,,7332624,2080,2944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7339552,2752,,,7339504,1824,2752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7354064,6960,,,7357872,2752,6960,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7368368,6496,,,7370736,5728,8096,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7381248,2672,,,7381104,1120,2672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7392128,4000,,,7392976,1984,4000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7416896,3616,,,7417616,38432,39152,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7457216,5488,,,7459632,48832,51248,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 12)]::operator ()() const::[lambda(c10::BFloat16) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7471440,6608,7478048,31952,7510000,71520,110080,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7645392,5456,,,7647600,4915936,4918144,73,73,0,cuLaunchKernel,2336 3 1, 256 1 1,void cutlass::Kernel2<cutlass_80_simt_sgemm_256x128_8x4_tn_align1>(T1::Params)
7660272,3168,7663440,4902048,12565488,5035136,9940352,73,73,0,cudaLaunchKernel,195804 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7680208,3104,7683312,9918336,17601648,3808,9925248,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7749040,5552,7754592,9853168,17607760,44096,9902816,73,73,0,cuLaunchKernel, 56 6 1, 128 1 1,void cutlass::Kernel2<cutlass_80_simt_sgemm_128x64_8x5_tt_align1>(T1::Params)
7760960,2784,7763744,9890000,17653744,30368,9923152,73,73,0,cudaLaunchKernel,2174 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7789584,14368,7803952,9881536,17685488,3744,9899648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7808960,2624,7811584,9880144,17691728,1792,9884560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7816096,3040,7819136,9876944,17696080,1344,9881328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7822960,3856,7826816,9873264,17700080,2048,9879168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7830640,4176,7834816,9869456,17704272,1536,9875168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7838288,3408,7841696,9866672,17708368,1280,9871360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7846032,2512,7848544,9863824,17712368,1376,9867712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7851344,3104,7854448,9862112,17716560,2080,9867296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7884416,5552,7889968,9830432,17720400,2848,9838832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnOther_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
17749936,2864,,,17749968,1024,2864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnOther_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
17804720,6544,,,17807664,3766816,3769760,73,73,0,cudaLaunchKernel,1536 3 1, 128 1 1,"void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unnamed>::OpaqueType<(unsigned int)2>, unsigned int, (int)2, (int)128, (int)1, (int)8>(T1 *, at::native::<unnamed>::CatArrInputTensorMetadata<T1, T2, T4, T5>, at::native::<unnamed>::TensorSizeStride<T2, (unsigned int)4>, int, T2)"
26357072,19776,,,26372208,8192,23328,73,73,0,cudaLaunchKernel, 222 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
26411856,6864,,,26413968,27680,29792,73,73,0,cudaLaunchKernel,7090 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
26448080,6096,,,26449776,52384,54080,73,73,0,cudaLaunchKernel, 96 3 1, 512 1 1,"void at::native::<unnamed>::CatArrayBatchedCopy<at::native::<unnamed>::OpaqueType<(unsigned int)4>, unsigned int, (int)2, (int)64, (int)64>(T1 *, at::native::<unnamed>::CatArrInputTensorMetadata<T1, T2, T4, T5>, at::native::<unnamed>::TensorSizeStride<T2, (unsigned int)4>, int, T2)"
26467520,8432,26475952,27200,26503152,31872,67504,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::cos_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
26485712,7200,26492912,43104,26536016,39456,89760,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::sin_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
26503344,7696,26511040,66864,26577904,39712,114272,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
26524576,5744,26530320,88544,26618864,873696,967984,73,73,0,cudaLaunchKernel,1536 4 1, 128 1 1,"void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unnamed>::OpaqueType<(unsigned int)4>, unsigned int, (int)3, (int)128, (int)1, (int)16>(T1 *, at::native::<unnamed>::CatArrInputTensorMetadata<T1, T2, T4, T5>, at::native::<unnamed>::TensorSizeStride<T2, (unsigned int)4>, int, T2)"
26542304,3824,26546128,949280,27495408,217120,1170224,73,73,0,cudaLaunchKernel,7090 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
26580608,5376,26585984,1128560,27714544,2240,1136176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
26596912,4336,26601248,1117488,27718736,1536,1123360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
26610752,7728,26618480,1104256,27722736,3424,1115408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
26623808,10192,26634000,1094848,27728848,3168,1108208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
26644832,6224,26651056,1082016,27733072,3136,1091376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
26750464,31104,26781568,955920,27737488,4736,991760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
26817168,16720,26833888,909616,27743504,1088,927424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
26842128,5984,26848112,899456,27747568,1632,907072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
26881584,13776,26895360,856176,27751536,1504,871456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
26933984,31456,26965440,790320,27755760,2016,823792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
27338800,37296,27376096,383760,27759856,30048,451104,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
27606992,42304,27649296,143072,27792368,3544672,3730048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
27744576,4640,27749216,3589264,31338480,2464,3596368,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
27753472,3216,27756688,3585888,31342576,1984,3591088,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
27834368,7616,27841984,3504688,31346672,49568,3561872,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
27856400,16064,27872464,3526432,31398896,3452992,6995488,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
27875376,14016,27889392,6964448,34853840,2912,6981376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
27895376,18464,27913840,6944128,34857968,2466752,9429344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
28438432,12560,28450992,8875072,37326064,1920,8889552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
28955424,19216,28974640,8355520,37330160,24059776,32434512,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
29491888,43168,29535056,31856160,61391216,11842304,43741632,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
29793040,28320,29821360,43430944,73252304,2395136,45854400,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
29899920,23168,29923088,45726176,75649264,4001984,49751328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
29971760,19104,29990864,49663008,79653872,3999008,53681120,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
30031744,16336,30048080,53606784,83654864,5297792,58920912,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
30084848,13088,30097936,58857152,88955088,5731328,64601568,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
30238096,12496,30250592,64438928,94689520,240315488,304766912,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
30402032,15632,30417664,304589328,335006992,2176224,306781184,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
30424080,12784,30436864,306748144,337185008,1952,306762880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
30460496,9984,30470480,306718624,337189104,1376,306729984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
30491344,5984,30497328,306695872,337193200,1504,306703360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
30616272,10752,30627024,306570272,337197296,40608,306621632,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
30657360,27824,30685184,306555088,337240272,2775488,309358400,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
30757632,9776,30767408,309249984,340017392,1888,309261648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
30860752,10288,30871040,309150448,340021488,7702240,316862976,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
31210832,13904,31224736,316500304,347725040,5461056,321975264,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
31254736,8192,31262928,321925152,353188080,3717632,325650976,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
31305920,8032,31313952,325593296,356907248,5856,325607184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
31319328,5072,31324400,325591040,356915440,3776,325599888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
31353824,3712,31357536,325564048,356921584,60928,325628688,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
31360320,3296,31363616,325620432,356984048,4091840,329715568,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
31364384,3520,31367904,329710064,361077968,1952,329715536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
31368512,3872,31372384,329709712,361082096,2437024,332150608,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
31411328,3808,31415136,332105296,363520432,1920,332111024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
31464768,3056,31467824,332056512,363524336,34563520,366623088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
31511392,3584,31514976,366574512,398089488,140224,366718320,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
31517360,5072,31522432,366709360,398231792,11923520,378637952,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
31522864,2624,31525488,378631808,410157296,2464,378636896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
31526352,4816,31531168,378630224,410161392,10756480,389391520,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
31555888,2864,31558752,389361808,420920560,1920,389366592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
31570192,4048,31574240,389350416,420924656,3040,389357504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
31658144,4288,31662432,389267344,420929776,16202336,405473968,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
31696912,2832,31699744,405433840,437133584,5455232,410891904,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
31715264,4176,31719440,410871008,442590448,1984,410877168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
31725792,3056,31728848,410865696,442594544,1440,410870192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
31733712,3488,31737200,410861440,442598640,1376,410866304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
31742144,3552,31745696,410857040,442602736,3168,410863760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
31751328,3232,31754560,410854288,442608848,1344,410858864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
31768288,4032,31772320,410840720,442613040,4608,410849360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
31778848,3312,31782160,410836832,442618992,1120,410841264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
31786592,2992,31789584,410833632,442623216,1632,410838256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
31795744,2992,31798736,410828576,442627312,1472,410833040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
31806144,3264,31809408,410822000,442631408,1248,410826512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
31882768,3856,31886624,410748880,442635504,29472,410782208,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
31913904,2912,31916816,410749440,442666256,3479584,414231936,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
31933664,2976,31936640,414212208,446148848,2368,414217552,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
31940592,2832,31943424,414209520,446152944,2112,414214464,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
31960448,2640,31963088,414193952,446157040,48416,414245008,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
31965232,2880,31968112,414240128,446208240,3449888,417692896,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
31968512,2416,31970928,417689216,449660144,4032,417695664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
31971488,2752,31974240,417692048,449666288,2435424,420130224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
32013936,2976,32016912,420087520,452104432,1888,420092384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
32061952,2944,32064896,420043632,452108528,25770432,445817008,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
32179824,4736,32184560,445697024,477881584,11819968,457521728,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
32218688,3456,32222144,457482480,489704624,2346688,459832624,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
32238848,3584,32242432,459811312,492053744,3809824,463624720,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
32246832,2832,32249664,463615408,495865072,3947776,467566016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
32258208,3104,32261312,467554352,499815664,5406624,472964080,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
32269968,3104,32273072,472951360,505224432,5664096,478618560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
32286592,3648,32290240,478601008,510891248,240444576,719049232,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
32323632,3488,32327120,719011648,751338768,2172448,721187584,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
32327984,3088,32331072,721181584,753512656,1952,721186624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
32338128,3184,32341312,721175472,753516784,2912,721181568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
32346992,3056,32350048,721170928,753520976,1536,721175520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
32372752,2944,32375696,721149312,753525008,46304,721198560,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
32388960,3136,32392096,721180976,753573072,2749568,723933680,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
32420640,3104,32423744,723900848,756324592,1920,723905872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
32463184,3280,32466464,723862192,756328656,7743936,731609408,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
32507568,2832,32510400,731563888,764074288,5461696,737028416,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
32524576,3072,32527648,737010608,769538256,3462944,740476624,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
32542416,3168,32545584,740456896,773002480,2304,740462368,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
32549600,2704,32552304,740454272,773006576,1984,740458960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
32568224,2784,32571008,740439664,773010672,46624,740489072,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
32572784,2864,32575648,740483152,773058800,3966080,744452096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
32576096,2512,32578608,744449216,777027824,1952,744453680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
32579200,2528,32581728,744450192,777031920,2729952,747182672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
32612736,2864,32615600,747148352,779763952,1856,747153072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
32654352,3184,32657536,747110512,779768048,33135360,780249056,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
32685936,2784,32688720,780216992,812905712,186080,780405856,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
32690304,3744,32694048,780400048,813094096,12695904,793099696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
32694496,2816,32697312,793094416,825791728,2176,793099408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
32697712,2880,32700592,793095328,825795920,10475328,803573536,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
32715072,2736,32717808,803554720,836272528,2176,803559632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
32724256,2976,32727232,803549232,836276464,832,803553040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
32758416,2864,32761280,803517072,836278352,15614944,819134880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
32788016,2768,32790784,819103792,851894576,5572000,824678560,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
32803040,3536,32806576,824662592,857469168,2336,824668464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
32812352,3120,32815472,824657792,857473264,3104,824664016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
32819408,2592,32822000,824657408,857479408,3264,824663264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
32826160,2928,32829088,824656464,857485552,11680,824671072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
32833712,3520,32837232,824662624,857499856,6144,824672288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
32853184,3360,32856544,824652816,857509360,5600,824661776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
32861760,3376,32865136,824651136,857516272,2368,824656880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
32869712,3088,32872800,824647568,857520368,3360,824654016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
32877088,2624,32879712,824646800,857526512,2944,824652368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
32885056,3264,32888320,824642416,857530736,8192,824653872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
32952736,3216,32955952,824584896,857540848,56608,824644720,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
32981504,2896,32984400,824615840,857600240,3673856,828292592,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
32999120,2944,33002064,828273312,861275376,2464,828278720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
33006048,2736,33008784,828270656,861279440,2048,828275440,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
33024304,2640,33026944,828256592,861283536,48960,828308192,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
33028848,2640,33031488,828303248,861334736,3813056,832118944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
33031888,2800,33034688,832115472,865150160,3776,832122048,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
33035216,2496,33037712,832118592,865156304,2434944,834556032,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
33080784,2976,33083760,834509696,867593456,1888,834514560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
33125728,3296,33129024,834468560,867597584,23937632,858409488,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
33213920,4080,33218000,858319648,891537648,12480864,870804592,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
33245472,3360,33248832,870772624,904021456,2345600,873121584,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
33263808,3408,33267216,873102048,906369264,3709440,876814896,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
33270080,2816,33272896,876807312,910080208,3724512,880534640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
33280032,2736,33282768,880524800,913807568,5534656,886062192,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
33290304,2768,33293072,886050432,919343504,5795488,891848688,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
33303040,3056,33306096,891835136,925141232,239349632,1131187824,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
33336304,3424,33339728,1131153472,1164493200,2170784,1133327680,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
33340192,4048,33344240,1133321696,1166665936,1920,1133327664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
33350944,2816,33353760,1133316304,1166670064,2912,1133322032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
33358672,3152,33361824,1133312464,1166674288,1504,1133317120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
33381392,2912,33384304,1133293984,1166678288,47104,1133344000,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
33396976,3360,33400336,1133328064,1166728400,2757664,1136089088,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
33428064,2976,33431040,1136058096,1169489136,1952,1136063024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
33468256,3136,33471392,1136021840,1169493232,7799744,1143824720,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
33509632,3280,33512912,1143782208,1177295120,5451936,1149237424,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
33523600,3088,33526688,1149222192,1182748880,3475680,1152700960,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
33539920,3248,33543168,1152684272,1186227440,2400,1152689920,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
33547248,3136,33550384,1152681120,1186231504,2080,1152686336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
33565648,2736,33568384,1152667216,1186235600,46016,1152715968,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
33570064,2768,33572832,1152710064,1186282896,3462240,1156175072,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
33573280,2640,33575920,1156171008,1189746928,1984,1156175632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
33576480,2656,33579136,1156171856,1189750992,2452064,1158626576,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
33616560,2800,33619360,1158585168,1192204528,1888,1158589856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
33656784,2640,33659424,1158549200,1192208624,34645696,1193197536,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
33687520,2704,33690224,1193166560,1226856784,139968,1193309232,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
33691632,3184,33694816,1193304208,1226999024,12761440,1206068832,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
33695344,2784,33698128,1206065056,1239763184,1920,1206069760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
33698672,3184,33701856,1206065424,1239767280,10456096,1216524704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
33715008,2704,33717712,1216507680,1250225392,1952,1216512336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
33724112,2832,33726944,1216502512,1250229456,864,1216506208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
33752400,2656,33755056,1216476576,1250231632,15792128,1232271360,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
33780528,2448,33782976,1232243792,1266026768,5824160,1238070400,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
33794848,3312,33798160,1238054112,1271852272,1952,1238059376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
33803584,2864,33806448,1238049920,1271856368,1408,1238054192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
33810304,2768,33813072,1238047360,1271860432,2848,1238052976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
33817328,3200,33820528,1238044032,1271864560,3200,1238050432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
33824592,3104,33827696,1238043008,1271870704,1376,1238047488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
33836384,3024,33839408,1238035392,1271874800,4416,1238042832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
33844304,2688,33846992,1238033920,1271880912,1120,1238037728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
33851264,2640,33853904,1238031136,1271885040,1600,1238035376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
33858224,2944,33861168,1238027968,1271889136,1472,1238032384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
33866544,3312,33869856,1238023344,1271893200,1280,1238027936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
33931712,2992,33934704,1237962688,1271897392,26016,1237991696,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
33958256,2912,33961168,1237964800,1271925968,3545984,1241513696,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
33976368,2912,33979280,1241493952,1275473232,2496,1241499360,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
33983168,2576,33985744,1241491488,1275477232,2112,1241496176,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
34001264,3040,34004304,1241477024,1275481328,47552,1241527616,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
34006352,2992,34009344,1241521424,1275530768,4259520,1245783936,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
34009760,2672,34012432,1245780992,1279793424,3712,1245787376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
34012944,2608,34015552,1245783984,1279799536,2444704,1248231296,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
34050960,3472,34054432,1248191440,1282245872,1824,1248196736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
34103904,2752,34106656,1248143280,1282249936,24882560,1273028592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
34187600,3696,34191296,1272943952,1307135248,12475168,1285422816,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
34216080,3328,34219408,1285393248,1319612656,2339296,1287735872,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
34233888,2992,34236880,1287717664,1321954544,3722080,1291442736,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
34239456,2528,34241984,1291436848,1325678832,3736032,1295175408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
34248800,2864,34251664,1295164768,1329416432,5150368,1300318000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
34259200,2592,34261792,1300307408,1334569200,5873152,1306183152,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
34270608,2880,34273488,1306170400,1340443888,238904576,1545077856,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
34302512,3696,34306208,1545045104,1579351312,2158912,1547207712,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
34306752,2560,34309312,1547203600,1581512912,1984,1547208144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
34315600,2880,34318480,1547198560,1581517040,2880,1547204320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
34323536,9296,34332832,1547188368,1581521200,1536,1547199200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
34351312,2768,34354080,1547171056,1581525136,54208,1547228032,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
34366992,3264,34370256,1547210368,1581580624,2747456,1549961088,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
34396800,2800,34399600,1549930336,1584329936,1920,1549935056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
34436816,2784,34439600,1549894464,1584334064,7804864,1557702112,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
34475856,2848,34478704,1557662368,1592141072,5612512,1563277728,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
34489264,3056,34492320,1563263312,1597755632,3661824,1566928192,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
34505120,3200,34508320,1566911184,1601419504,2400,1566916784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
34512384,2848,34515232,1566908336,1601423568,2112,1566913296,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
34529744,2720,34532464,1566895232,1601427696,46240,1566944192,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
34534256,3040,34537296,1566938528,1601475824,3859104,1570800672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
34537760,2592,34540352,1570796976,1605337328,1952,1570801520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
34540848,2416,34543264,1570798192,1605341456,2438848,1573239456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
34571760,2848,34574608,1573208032,1607782640,1920,1573212800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
34610608,2720,34613328,1573173408,1607786736,34043744,1607219872,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
34641248,2688,34643936,1607187888,1641831824,139840,1607330416,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
34645392,2848,34648240,1607324704,1641972944,12366720,1619694272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
34648656,2384,34651040,1619690832,1654341872,1920,1619695136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
34651472,2992,34654464,1619691504,1654345968,10667840,1630362336,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
34667152,2928,34670080,1630345968,1665016048,1984,1630350880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
34676304,3024,34679328,1630340816,1665020144,2560,1630346400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
34702592,2608,34705200,1630319040,1665024240,15704512,1646026160,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
34729936,2912,34732848,1645997504,1680730352,5454720,1651455136,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
34743968,3360,34747328,1651439152,1686186480,1952,1651444464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
34752832,2992,34755824,1651433920,1686189744,1440,1651438352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
34759696,2672,34762368,1651431024,1686193392,1312,1651435008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
34766368,3120,34769488,1651428000,1686197488,3264,1651434384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
34773616,2736,34776352,1651427248,1686203600,1344,1651431328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
34784832,3008,34787840,1651419888,1686207728,4640,1651427536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
34792688,2544,34795232,1651418640,1686213872,1088,1651422272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
34799952,2784,34802736,1651415232,1686217968,1632,1651419648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
34806848,2704,34809552,1651412608,1686222160,1504,1651416816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
34814544,2896,34817440,1651408720,1686226160,1280,1651412896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
34878832,3136,34881968,1651348288,1686230256,27264,1651378688,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
34907072,3184,34910256,1651348672,1686258928,3493056,1654844912,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
34928800,3280,34932080,1654821792,1689753872,2464,1654827536,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
34936064,2816,34938880,1654819056,1689757936,2016,1654823888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
34954144,2720,34956864,1654805168,1689762032,47456,1654855344,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
34958784,2800,34961584,1654849568,1689811152,3918208,1658770576,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
34962064,2448,34964512,1658766544,1693731056,3392,1658772384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
34964976,2544,34967520,1658769680,1693737200,2845728,1661617952,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
35000496,3072,35003568,1661582400,1696585968,1856,1661587328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
35048800,6928,35055728,1661534368,1696590096,25301536,1686842832,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
35154928,5136,35160064,1686734032,1721894096,11901664,1698640832,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
35184208,5216,35189424,1698608960,1733798384,2551328,1701165504,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
35203680,2864,35206544,1701145440,1736351984,3738560,1704886864,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
35208960,2960,35211920,1704880704,1740092624,3951712,1708835376,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
35218672,4384,35223056,1708823264,1744046320,5119744,1713947392,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
35230784,5216,35236000,1713931344,1749167344,5697824,1719634384,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
35244976,3472,35248448,1719619472,1754867920,240193088,1959816032,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
35284608,3456,35288064,1959774480,1995062544,2167328,1961945264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
35288640,2688,35291328,1961941040,1997232368,1920,1961945648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
35298272,3152,35301424,1961935008,1997236432,2944,1961941104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
35306416,4000,35310416,1961930240,1997240656,1504,1961935744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
35329728,3936,35333664,1961910960,1997244624,47296,1961962192,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
35346480,3856,35350336,1961943472,1997293808,2750016,1964697344,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
35377088,3360,35380448,1964665840,2000046288,1952,1964671152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
35421120,4240,35425360,1964625056,2000050416,7806304,1972435600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
35465136,4736,35469872,1972389600,2007859472,5472288,1977866624,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
35480464,3872,35484336,1977850432,2013334768,3708736,1981563040,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
35498128,3440,35501568,1981544144,2017045712,6624,1981554208,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
35505536,3952,35509488,1981544448,2017053936,2144,1981550544,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
35524032,3344,35527376,1981530624,2017058000,47936,1981581904,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
35529584,3696,35533280,1981573936,2017107216,4063680,1985641312,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
35533744,4272,35538016,1985635472,2021173488,1952,1985641696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
35538640,4144,35542784,1985634800,2021177584,2438432,1988077376,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
35575616,3312,35578928,1988038848,2023617776,1920,1988044080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
35615008,3456,35618464,1988003408,2023621872,34049568,2022056432,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
35655808,3200,35659008,2022014960,2057673968,139872,2022158032,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
35660464,3520,35663984,2022152288,2057816272,11888096,2034043904,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
35664912,6000,35670912,2034035024,2069705936,1984,2034043008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
35671344,3808,35675152,2034034912,2069710064,10741088,2044779808,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
35689952,3264,35693216,2044760656,2080453872,1952,2044765872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
35698960,3104,35702064,2044755904,2080457968,2496,2044761504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
35726064,3472,35729536,2044732528,2080462064,16236448,2060972448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
35754320,3344,35757664,2060942960,2096700624,5467584,2066413888,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
35771184,4720,35775904,2066394928,2102170832,1952,2066401600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
35782272,3152,35785424,2066389536,2102174960,1440,2066394128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
35789024,2768,35791792,2066387264,2102179056,1312,2066391344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
35795968,2832,35798800,2066383104,2102181904,3456,2066389392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
35803104,3072,35806176,2066381072,2102187248,1344,2066385488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
35815392,3456,35818848,2066372432,2102191280,4608,2066380496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
35823776,2896,35826672,2066370816,2102197488,1088,2066374800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
35831184,2976,35834160,2066367360,2102201520,1632,2066371968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
35838464,11024,35849488,2066356192,2102205680,1728,2066368944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
35856272,3136,35859408,2066350368,2102209776,1280,2066354784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
35920992,3344,35924336,2066289504,2102213840,26368,2066319216,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
35950704,3280,35953984,2066288560,2102242544,3495232,2069787072,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
35970352,3616,35973968,2069766560,2105740528,2496,2069772672,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
35978512,5664,35984176,2069760448,2105744624,1984,2069768096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
35999808,3184,36002992,2069745728,2105748720,47232,2069796144,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
36005040,3312,36008352,2069789488,2105797840,3515456,2073308256,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
36009264,4784,36014048,2073302256,2109316304,3360,2073310400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
36015072,4448,36019520,2073302960,2109322480,2434016,2075741424,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
36053872,3184,36057056,2075701520,2111758576,1888,2075706592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
36107056,3776,36110832,2075651840,2111762672,25849184,2101504800,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
36190640,5216,36195856,2101418752,2137614608,11818912,2113242880,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
36218672,3776,36222448,2113214272,2149436720,2354816,2115572864,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
36235920,3504,36239424,2115553488,2151792912,3750336,2119307328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
36241808,3184,36244992,2119299792,2155544784,4064384,2123367360,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
36251648,4896,36256544,2123355568,2159612112,5416480,2128776944,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
36264336,3504,36267840,2128763312,2165031152,5667744,2134434560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
36276400,3280,36279680,2134420496,2170700176,242080160,2376503936,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
36308848,4816,36313664,2376469200,2412782864,2159488,2378633504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
36314336,4656,36318992,2378625504,2414944496,1952,2378632112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
36328336,3696,36332032,2378616560,2414948592,2944,2378623200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
36337120,3536,36340656,2378611904,2414952560,1504,2378616944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
36358736,4160,36362896,2378592416,2414955312,49536,2378646112,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
36375328,3776,36379104,2378627824,2415006928,2752224,2381383824,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
36407392,4912,36412304,2381348192,2417760496,1888,2381354992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
36451232,3680,36454912,2381309648,2417764560,7814080,2389127408,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
36492672,3088,36495760,2389085056,2425580816,5456192,2394544336,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
36507072,18896,36525968,2394512704,2431038672,3483520,2398015120,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
36542272,3568,36545840,2397978784,2434524624,6336,2397988688,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
36549792,3424,36553216,2397979376,2434532592,36384,2398019184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
36567776,3184,36570960,2398000544,2434571504,54208,2398057936,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
36572704,3856,36576560,2398052288,2434628848,4283872,2402340016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
36577008,3680,36580688,2402333568,2438914256,1952,2402339200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
36581296,2848,36584144,2402334240,2438918384,2440160,2404777248,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
36620784,6128,36626912,2404733712,2441360624,1888,2404741728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
36668480,3504,36671984,2404692736,2441364720,33763776,2438460016,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
36703360,3552,36706912,2438424336,2475131248,139488,2438567376,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
36708528,3024,36711552,2438560880,2475272432,12292416,2450856320,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
36712096,2912,36715008,2450852560,2487567568,2176,2450857648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
36715456,3760,36719216,2450852512,2487571728,10786304,2461642576,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
36733264,3184,36736448,2461624112,2498360560,1920,2461629216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
36742272,8800,36751072,2461613584,2498364656,832,2461623216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
36777024,3056,36780080,2461586688,2498366768,15820672,2477410416,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
36803984,3600,36807584,2477382992,2514190576,5490432,2482877024,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
36820768,3200,36823968,2482859376,2519683344,2272,2482864848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
36829504,4096,36833600,2482853840,2519687440,1408,2482859344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
36837408,3936,36841344,2482850160,2519691504,3712,2482857808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
36845664,3024,36848688,2482848960,2519697648,8064,2482860048,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
36852736,4016,36856752,2482851104,2519707856,1568,2482856688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
36865424,3648,36869072,2482842848,2519711920,8096,2482854592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
36873712,2848,36876560,2482845664,2519722224,6880,2482855392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
36880880,3072,36883952,2482846432,2519730384,1632,2482851136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
36888176,3216,36891392,2482843120,2519734512,14048,2482860384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
36896080,3040,36899120,2482851776,2519750896,3648,2482858464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
36960640,3008,36963648,2482793392,2519757040,93376,2482889776,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
36987088,3056,36990144,2482863120,2519853264,3592384,2486458560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
37012352,4400,37016752,2486431808,2523448560,2912,2486439120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
37020624,3760,37024384,2486428336,2523452720,2240,2486434336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
37039008,4400,37043408,2486413344,2523456752,47712,2486465456,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
37045504,3424,37048928,2486456976,2523505904,3622240,2490082640,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
37049360,2816,37052176,2490077632,2527129808,4000,2490084448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
37052672,2880,37055552,2490080432,2527135984,2437120,2492520432,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
37098880,4256,37103136,2492473072,2529576208,1856,2492479184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
37145296,3792,37149088,2492431184,2529580272,25405312,2517840288,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
37232240,4576,37236816,2517750048,2554986864,12071296,2529825920,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
37259696,4160,37263856,2529798144,2567062000,2347552,2532149856,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
37277456,3328,37280784,2532130048,2569410832,3711616,2535844992,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
37283104,2512,37285616,2535838208,2573123824,4098912,2539939632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
37292432,3168,37295600,2539928384,2577223984,5356480,2545288032,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
37302816,2704,37305520,2545276992,2582582512,5691456,2550971152,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
37313312,3648,37316960,2550960048,2588277008,239531264,2790494960,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
37344224,3120,37347344,2790462720,2827810064,2158528,2792624368,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
37347904,2576,37350480,2792620160,2829970640,1984,2792624720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
37356720,3328,37360048,2792614720,2829974768,2720,2792620768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
37364784,4608,37369392,2792609472,2829978864,1504,2792615584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
37393408,2928,37396336,2792586592,2829982928,46080,2792635600,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
37409136,3120,37412256,2792619824,2830032080,2749120,2795372064,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
37439296,2944,37442240,2795341360,2832783600,1920,2795346224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
37479072,2704,37481776,2795305920,2832787696,7819616,2803128240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
37516160,3232,37519392,2803090640,2840610032,5449728,2808543600,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
37532224,3216,37535440,2808527392,2846062832,3479168,2812009776,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
37549472,3072,37552544,2811990864,2849543408,2336,2811996272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
37556528,3008,37559536,2811987968,2849547504,1984,2811992960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
37573568,3168,37576736,2811974864,2849551600,46464,2812024496,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
37578480,3008,37581488,2812019232,2849600720,3413024,2815435264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
37581936,2864,37584800,2815430992,2853015792,1984,2815435840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
37585360,2768,37588128,2815431760,2853019888,2757152,2818191680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
37617264,4032,37621296,2818158240,2855779536,1856,2818164128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
37659664,3504,37663168,2818120464,2855783632,33791744,2851915712,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
37691024,2912,37693936,2851882784,2889576720,141536,2852027232,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
37695328,2832,37698160,2852022912,2889721072,12811136,2864836880,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
37698544,2608,37701152,2864833200,2902534352,2208,2864838016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
37701600,2752,37704352,2864834128,2902538480,10362432,2875199312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
37716720,2576,37719296,2875184112,2912903408,1952,2875188640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
37724768,2944,37727712,2875179760,2912907472,864,2875183568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
37749280,2768,37752048,2875157568,2912909616,15744352,2890904688,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
37775392,3920,37779312,2890877312,2928656624,5465664,2896346896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
37791264,3024,37794288,2896330464,2934124752,1984,2896335472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
37799824,3520,37803344,2896325568,2934128912,1408,2896330496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
37807136,3280,37810416,2896322560,2934132976,3680,2896329520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
37814592,3632,37818224,2896320896,2934139120,3488,2896328016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
37822464,3120,37825584,2896319552,2934145136,1344,2896324016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
37834608,3552,37838160,2896309568,2934147728,4608,2896317728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
37842928,3200,37846128,2896308224,2934154352,1120,2896312544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
37850432,3408,37853840,2896304736,2934158576,1632,2896309776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
37858000,3136,37861136,2896301536,2934162672,1472,2896306144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
37866208,3088,37869296,2896297472,2934166768,1280,2896301840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
37929552,2752,37932304,2896238560,2934170864,25920,2896267232,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
37955648,3056,37958704,2896240832,2934199536,3495488,2899739376,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
37973808,2992,37976800,2899719696,2937696496,2528,2899725216,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
37980720,2896,37983616,2899716944,2937700560,1920,2899721760,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
37998832,2784,38001616,2899703040,2937704656,48864,2899754688,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
38003584,2944,38006528,2899748336,2937754864,3453632,2903204912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
38006944,2448,38009392,2903201440,2941210832,3808,2903207696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
38009872,2736,38012608,2903204400,2941217008,2435392,2905642528,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
38055008,2928,38057936,2905596224,2943654160,1888,2905601040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
38108384,2928,38111312,2905546912,2943658224,24871360,2930421200,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
38195520,3904,38199424,2930332752,2968532176,12473728,2942810384,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
38223248,4864,38228112,2942781504,2981009616,2342880,2945129248,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
38242272,2864,38245136,2945109472,2983354608,3711520,2948823856,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
38247584,2784,38250368,2948817264,2987067632,3730304,2952550352,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
38257152,2576,38259728,2952540384,2990800112,5451680,2957994640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
38267296,2592,38269888,2957983504,2996253392,5726816,2963712912,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
38277792,2768,38280560,2963702656,3001983216,240209920,3203915344,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
38309616,3088,38312704,3203883536,3242196240,2180576,3206067200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
38313152,2448,38315600,3206063776,3244379376,1984,3206068208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
38322912,3104,38326016,3206057488,3244383504,2752,3206063344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
38330832,2832,38333664,3206053872,3244387536,1504,3206058208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
38351760,2896,38354656,3206037008,3244391664,45632,3206085536,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
38367104,3072,38370176,3206068560,3244438736,2899360,3208970992,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
38396480,3024,38399504,3208941280,3247340784,2016,3208946320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
38437408,2688,38440096,3208904752,3247344848,8260608,3217168048,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
38475872,2560,38478432,3217130128,3255608560,5606272,3222738960,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
38489328,2960,38492288,3222724752,3261217040,3532864,3226260576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
38505936,3264,38509200,3226242624,3264751824,2528,3226248416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
38513008,2928,38515936,3226239984,3264755920,1984,3226244896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
38530208,3168,38533376,3226226672,3264760048,46304,3226276144,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
38535184,3664,38538848,3226269296,3264808144,3517760,3229790720,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
38539344,3440,38542784,3229784880,3268327664,2144,3229790464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
38543360,2480,38545840,3229785920,3268331760,2417696,3232206096,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
38574352,2848,38577200,3232174272,3270751472,1888,3232179008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
38613264,2800,38616064,3232139504,3270755568,34255616,3266397920,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
38645744,3136,38648880,3266364672,3305013552,141536,3266509344,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
38650320,3040,38653360,3266504512,3305157872,12819968,3279327520,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
38653936,2960,38656896,3279322448,3317979344,2464,3279327872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
38657648,3616,38661264,3279322208,3317983472,10346848,3289672672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
38675312,3488,38678800,3289654240,3328333040,2144,3289659872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
38684480,4000,38688480,3289648656,3328337136,864,3289653520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
38711056,3552,38714608,3289624672,3328339280,15735488,3305363712,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
38737776,2624,38740400,3305336640,3344077040,5454016,3310793280,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
38752544,3856,38756400,3310776512,3349532912,2016,3310782384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
38764400,3424,38767824,3310769184,3349537008,1408,3310774016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
38771568,3488,38775056,3310766048,3349541104,1312,3310770848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
38778976,3232,38782208,3310762992,3349545200,3456,3310769680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
38786480,3280,38789760,3310761584,3349551344,1312,3310766176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
38798528,3984,38802512,3310753056,3349555568,4224,3310761264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
38807280,2832,38810112,3310751408,3349561520,1088,3310755328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
38814272,2928,38817200,3310748480,3349565680,1632,3310753040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
38821696,3744,38825440,3310744304,3349569744,1504,3310749552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
38830464,3072,38833536,3310740336,3349573872,1280,3310744688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
38913568,3008,38916576,3310661360,3349577936,26720,3310691088,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
38942128,3168,38945296,3310661344,3349606640,3496640,3314161152,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
38965424,3504,38968928,3314135824,3353104752,2400,3314141728,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
38972752,2912,38975664,3314133056,3353108720,2112,3314138080,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
38991056,2992,38994048,3314118768,3353112816,47680,3314169440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
38996160,3120,38999280,3314163680,3353162960,3506560,3317673360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
38999728,2464,39002192,3317670016,3356672208,3680,3317676160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
39002720,2512,39005232,3317673120,3356678352,2438752,3320114384,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
39040000,2816,39042816,3320076784,3359119600,1888,3320081488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
39094368,2976,39097344,3320026320,3359123664,24909184,3344938480,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
39177216,3904,39181120,3344854448,3384035568,12198048,3357056400,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
39203856,3760,39207616,3357029168,3396236784,2509216,3359542144,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
39221088,3152,39224240,3359523232,3398747472,3777248,3363303632,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
39226560,2752,39229312,3363296688,3402526000,3770368,3367069808,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
39236096,2992,39239088,3367060256,3406299344,5082752,3372146000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
39246496,2816,39249312,3372135248,3411384560,5710464,3377848528,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
39256992,3488,39260480,3377837424,3417097904,240101408,3617942320,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
39290672,3024,39293696,3617907216,3657200912,2166688,3620076928,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
39294160,2768,39296928,3620073808,3659370736,1920,3620078496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
39303136,3152,39306288,3620068544,3659374832,2528,3620074224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
39310944,3008,39313952,3620064944,3659378896,1536,3620069488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
39330736,2976,39333712,3620049184,3659382896,45856,3620098016,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
39345776,3440,39349216,3620081904,3659431120,2762624,3622847968,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
39375168,5648,39380816,3622815104,3662195920,1920,3622822672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
39418000,2976,39420976,3622779040,3662200016,8099264,3630881280,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
39456784,2592,39459376,3630841600,3670300976,5523968,3636368160,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
39469776,3200,39472976,3636353472,3675826448,3822336,3640179008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
39486640,3344,39489984,3640160080,3679650064,2528,3640165952,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
39493872,3344,39497216,3640156912,3679654128,2080,3640162336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
39511136,3280,39514416,3640143808,3679658224,46624,3640193712,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
39516128,3728,39519856,3640187488,3679707344,3806144,3643997360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
39520288,3552,39523840,3643990928,3683514768,1920,3643996400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
39524400,4752,39529152,3643989552,3683518704,2444096,3646438400,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
39558256,2864,39561120,3646403920,3685965040,1920,3646408704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
39597840,3616,39601456,3646367680,3685969136,34983616,3681354912,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
39630896,3184,39634080,3681320080,3720954160,139744,3681463008,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
39635648,3440,39639088,3681456320,3721095408,12296512,3693756272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
39639504,2592,39642096,3693752544,3733394640,9696,3693764832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
39642576,2624,39645200,3693761760,3733406960,10774656,3704539040,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
39667072,3872,39670944,3704513616,3744184560,7232,3704524720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
39676736,3872,39680608,3704514320,3744194928,3328,3704521520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
39703200,2864,39706064,3704494912,3744200976,15784672,3720282448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
39729776,2608,39732384,3720254608,3759986992,5478976,3725736192,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
39744400,3600,39748000,3725720400,3765468400,1952,3725725952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
39753696,3280,39756976,3725715520,3765472496,1440,3725720240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
39760768,3296,39764064,3725712528,3765476592,1280,3725717104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
39767872,3264,39771136,3725709520,3765480656,3456,3725716240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
39775184,3504,39778688,3725708112,3765486800,1312,3725712928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
39787168,4032,39791200,3725699600,3765490800,4448,3725708080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
39795856,3600,39799456,3725697584,3765497040,1312,3725702496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
39803984,3072,39807056,3725692672,3765499728,1632,3725697376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
39811120,3008,39814128,3725689088,3765503216,1472,3725693568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
39818976,3296,39822272,3725685040,3765507312,1280,3725689616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
39883376,3584,39886960,3725624448,3765511408,24768,3725652800,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
39910752,3136,39913888,3725624144,3765538032,3497504,3729124784,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
39929792,3168,39932960,3729104080,3769037040,2464,3729109712,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
39936864,3872,39940736,3729100400,3769041136,2016,3729106288,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
39955568,3680,39959248,3729085984,3769045232,48544,3729138208,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
39961248,3008,39964256,3729131120,3769095376,3424864,3732558992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
39964912,3120,39968032,3732554736,3772522768,3552,3732561408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
39968656,3120,39971776,3732557136,3772528912,2510688,3735070944,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
40005600,3392,40008992,3735032784,3775041776,1888,3735038064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
40050128,3184,40053312,3734992560,3775045872,24845056,3759840800,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
40142992,3632,40146624,3759746608,3799893232,11830912,3771581152,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
40169056,3440,40172496,3771553984,3811726480,2388928,3773946352,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
40185728,3184,40188912,3773928704,3814117616,3942304,3777874192,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
40191168,3056,40194224,3777867808,3818062032,3950304,3781821168,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
40201120,3424,40204544,3781810192,3822014736,5234368,3787047984,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
40211856,3824,40215680,3787034736,3827250416,5660672,3792699232,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
40223504,3312,40226816,3792686320,3832913136,240325056,4033014688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
40257104,3344,40260448,4032980400,4073240848,2157632,4035141376,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
40260928,2688,40263616,4035136784,4075400400,1952,4035141424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
40270096,3296,40273392,4035131104,4075404496,2560,4035136960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
40278304,3280,40281584,4035127040,4075408624,1504,4035131824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
40298560,2992,40301552,4035111232,4075412784,50400,4035164624,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
40313952,3136,40317088,4035148848,4075465936,2760608,4037912592,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
40342080,3616,40345696,4037882160,4078227856,1952,4037887728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
40382288,2880,40385168,4037846624,4078231792,7826784,4045676288,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
40427632,2976,40430608,4045630720,4086061328,5463200,4051096896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
40440912,3392,40444304,4051082048,4091526352,3570432,4054655872,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
40458800,3744,40462544,4054636640,4095099184,2336,4054642720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
40466544,3232,40469776,4054633408,4095103184,2208,4054638848,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
40484256,3184,40487440,4054619872,4095107312,48384,4054671440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
40489216,3200,40492416,4054665072,4095157488,4305856,4058974128,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
40492944,2896,40495840,4058969616,4099465456,1920,4058974432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
40496384,3168,40499552,4058970032,4099469584,2451072,4061424272,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
40530736,3024,40533760,4061389328,4101923088,1856,4061394208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
40570688,3232,40573920,4061353200,4101927120,33911744,4095268176,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
40602272,4112,40606384,4095234624,4135841008,206816,4095445552,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
40607856,2976,40610832,4095440096,4136050928,12091680,4107534752,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
40611248,2736,40613984,4107530352,4148144336,2208,4107535296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
40614416,2848,40617264,4107531200,4148148464,10751008,4118285056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
40629648,2832,40632480,4118270032,4158902512,1920,4118274784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
40637920,2672,40640592,4118266016,4158906608,3328,4118272016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
40663168,3264,40666432,4118246320,4158912752,15259232,4133508816,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
40689488,4000,40693488,4133480160,4174173648,5466400,4138950560,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
40706640,4048,40710688,4138931984,4179642672,1920,4138937952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
40715904,3392,40719296,4138927408,4179646704,1440,4138932240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
40723024,2944,40725968,4138924800,4179650768,1312,4138929056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
40729808,3264,40733072,4138921824,4179654896,3072,4138928160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
40737152,3280,40740432,4138920608,4179661040,1312,4138925200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
40749472,3264,40752736,4138912304,4179665040,4800,4138920368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
40757424,2800,40760224,4138911024,4179671248,1120,4138914944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
40764736,2992,40767728,4138907584,4179675312,1632,4138912208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
40771824,2960,40774784,4138904688,4179679472,1568,4138909216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
40779488,3328,40782816,4138900720,4179683536,1248,4138905296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
40844480,3120,40847600,4138840096,4179687696,28672,4138871888,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
40869664,3360,40873024,4138845360,4179718384,3498816,4142347536,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
40890320,3984,40894304,4142324176,4183218480,2432,4142330592,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
40898320,3280,40901600,4142320912,4183222512,2112,4142326304,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
40917184,3712,40920896,4142305680,4183226576,48096,4142357488,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
40923136,3152,40926288,4142350464,4183276752,3518400,4145872016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
40926736,2864,40929600,4145866864,4186796464,3456,4145873184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
40930064,2896,40932960,4145869488,4186802448,2435904,4148308288,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
40967040,3232,40970272,4148270288,4189240560,1888,4148275408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
41011104,2800,41013904,4148230752,4189244656,26090176,4174323728,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
41102608,4128,41106736,4174230464,4215337200,12096896,4186331488,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
41130176,3280,41133456,4186303552,4227437008,2347104,4188653936,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
41146768,3696,41150464,4188636400,4229786864,3730976,4192371072,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
41152720,3984,41156704,4192362608,4233519312,4067328,4196433920,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
41168160,3184,41171344,4196417344,4237588688,5428096,4201848624,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
41178784,2928,41181712,4201837312,4243019024,5745408,4207585648,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
41189504,2800,41192304,4207574400,4248766704,242399936,4449977136,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
41222176,3840,41226016,4449942032,4491168048,2168800,4452114672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
41226608,2656,41229264,4452109632,4493338896,1920,4452114208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
41235472,3184,41238656,4452104304,4493342960,2880,4452110368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
41243360,2976,41246336,4452100848,4493347184,1504,4452105328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
41263632,5136,41268768,4452082416,4493351184,46592,4452134144,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
41281440,3328,41284768,4452114480,4493399248,2748320,4454866128,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
41311552,3232,41314784,4454834960,4496149744,1952,4454840144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
41351648,3280,41354928,4454798944,4496153872,7929856,4462732080,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
41396240,3328,41399568,4462687008,4504086576,5458016,4468148352,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
41410160,3456,41413616,4468133120,4509546736,3492480,4471629056,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
41428480,3344,41431824,4471609920,4513041744,2400,4471615664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
41435856,3264,41439120,4471606592,4513045712,1984,4471611840,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
41453632,3040,41456672,4471593168,4513049840,47232,4471643440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
41458464,2768,41461232,4471638784,4513100016,4172256,4475813808,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
41461792,2768,41464560,4475809248,4517273808,1984,4475814000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
41465120,3056,41468176,4475809760,4517277936,2537024,4478349840,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
41497568,5216,41502784,4478313648,4519816432,1888,4478320752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
41538912,2960,41541872,4478278688,4519820560,33533088,4511814736,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
41568368,3408,41571776,4511783760,4553355536,157600,4511944768,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
41573200,3056,41576256,4511938992,4553515248,12645408,4524587456,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
41576672,2544,41579216,4524583424,4566162640,2432,4524588400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
41579616,2624,41582240,4524584528,4566166768,10464160,4535051312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
41597904,2864,41600768,4535031440,4576632208,2400,4535036704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
41606352,3200,41609552,4535026592,4576636144,2208,4535032000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
41631648,5152,41636800,4535003440,4576640240,15692288,4550700880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
41660768,2880,41663648,4550670416,4592334064,5631424,4556304720,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
41675808,3024,41678832,4556289280,4597968112,2560,4556294864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
41684272,3296,41687568,4556284640,4597972208,1440,4556289376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
41691328,2960,41694288,4556281984,4597976272,1472,4556286416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
41699664,3056,41702720,4556277648,4597980368,3680,4556284384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
41706768,2784,41709552,4556276928,4597986480,3136,4556282848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
41718288,3824,41722112,4556270576,4597992688,6432,4556280832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
41727056,2976,41730032,4556270848,4598000880,1280,4556275104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
41734256,3424,41737680,4556267296,4598004976,7072,4556277792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
41741776,2768,41744544,4556268880,4598013424,11168,4556282816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
41749424,3360,41752784,4556274720,4598027504,1248,4556279328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
41813760,3216,41816976,4556214624,4598031600,71488,4556289328,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
41839776,3104,41842880,4556262416,4598105296,3607424,4559872944,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
41857984,2992,41860976,4559853024,4601714000,2464,4559858480,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
41864976,3152,41868128,4559849872,4601718000,2080,4559855104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
41883168,2768,41885936,4559836160,4601722096,48672,4559887600,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
41887840,3056,41890896,4559881408,4601772304,3869632,4563754096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
41891296,3440,41894736,4563750272,4605645008,4032,4563757744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
41895280,2944,41898224,4563752928,4605651152,2434688,4566190560,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
41940368,4848,41945216,4566142064,4608087280,1856,4566148768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
41986240,3168,41989408,4566102000,4608091408,25006880,4591112048,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
42064880,11392,42076272,4591024256,4633100528,12395104,4603430752,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
42098816,3264,42102080,4603396976,4645499056,2352544,4605752784,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
42115104,2848,42117952,4605736368,4647854320,3720192,4609459408,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
42120208,3216,42123424,4609454160,4651577584,3872096,4613329472,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
42130048,2976,42133024,4613319472,4655452496,5580512,4618902960,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
42140336,3216,42143552,4618890736,4661034288,5712640,4624606592,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
42151568,2848,42154416,4624594752,4666749168,241404896,4866002496,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
42184416,3072,42187488,4865968688,4908156176,2166912,4868138672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
42188048,4256,42192304,4868132672,4910324976,2016,4868138944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
42198960,3168,42202128,4868126944,4910329072,2912,4868133024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
42207552,3536,42211088,4868122176,4910333264,1536,4868127248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
42228352,3328,42231680,4868105584,4910337264,48064,4868156976,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
42243984,3664,42247648,4868140784,4910388432,2752704,4870897152,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
42273360,3472,42276832,4870866160,4913142992,1920,4870871552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
42313360,2880,42316240,4870830880,4913147120,7930720,4878764480,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
42351024,2784,42353808,4878725344,4921079152,5452960,4884181088,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
42365344,3120,42368464,4884166432,4926534896,3469120,4887638672,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
42381936,3200,42385136,4887621216,4930006352,2464,4887626880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
42389376,3136,42392512,4887617808,4930010320,2016,4887622960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
42407104,3024,42410128,4887604320,4930014448,46528,4887653872,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
42412112,2880,42414992,4887648608,4930063600,3409568,4891061056,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
42415504,2912,42418416,4891057120,4933475536,1952,4891061984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
42418944,2592,42421536,4891058128,4933479664,2424224,4893484944,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
42450368,2896,42453264,4893452256,4935905520,1888,4893457040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
42490640,4240,42494880,4893414768,4935909648,33606624,4927025632,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
42523328,3088,42526416,4926992960,4969519376,139712,4927135760,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
42527904,2960,42530864,4927130816,4969661680,12773024,4939906800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
42531376,2512,42533888,4939902192,4982436080,2176,4939906880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
42534288,2912,42537200,4939902976,4982440176,10351520,4950257408,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
42549168,3008,42552176,4950240800,4992792976,1920,4950245728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
42557632,3136,42560768,4950236144,4992796912,832,4950240112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
42582272,4560,42586832,4950212224,4992799056,15773088,4965989872,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
42610448,2688,42613136,4965961600,5008574736,5499680,4971463968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
42624080,3872,42627952,4971448704,5014076656,2496,4971455072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
42633792,3760,42637552,4971443200,5014080752,1440,4971448400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
42641376,3296,42644672,4971440176,5014084848,3712,4971447184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
42648848,11888,42660736,4971430256,5014090992,3584,4971445728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
42664816,3616,42668432,4971428576,5014097008,1344,4971433536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
42678416,3136,42681552,4971419840,5014101392,4544,4971427520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
42686544,2944,42689488,4971417920,5014107408,1088,4971421952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
42693952,3616,42697568,4971413904,5014111472,1600,4971419120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
42701728,3088,42704816,4971410720,5014115536,1920,4971415728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
42709776,3056,42712832,4971406832,5014119664,1248,4971411136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
42774272,3312,42777584,4971346144,5014123728,26144,4971375600,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
42800128,3248,42803376,4971349120,5014152496,3804640,4975157008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
42818640,3056,42821696,4975136944,5017958640,22080,4975162080,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
42825472,3040,42828512,4975154672,5017983184,32192,4975189904,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
42843696,2976,42846672,4975171360,5018018032,47840,4975222176,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
42848704,2736,42851440,4975216736,5018068176,3836736,4979056208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
42851872,2672,42854544,4979051712,5021906256,3744,4979058128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
42855056,2752,42857808,4979054528,5021912336,2440928,4981498208,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
42891168,3120,42894288,4981460288,5024354576,1856,4981465264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
42934592,3792,42938384,4981420256,5024358640,24941184,5006365232,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
43012032,3600,43015632,5006285568,5049301200,12450592,5018739760,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
43037520,3328,43040848,5018714496,5061755344,2347648,5021065472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
43053808,2832,43056640,5021048560,5064105200,3717760,5024769152,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
43058816,2960,43061776,5024762688,5067824464,3725984,5028491632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
43077152,2800,43079952,5028471744,5071551696,5502592,5033977136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
43087168,3392,43090560,5033965168,5077055728,5676000,5039644560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
43098672,3280,43101952,5039632912,5082734864,240707424,5280343616,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
43131232,3136,43134368,5280310128,5323444496,2169536,5282482800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
43134784,2784,43137568,5282477744,5325615312,1952,5282482480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
43144112,3472,43147584,5282471856,5325619440,2880,5282478208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
43152112,2928,43155040,5282468560,5325623600,1536,5282473024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
43171808,2768,43174576,5282453056,5325627632,47104,5282502928,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
43187280,3328,43190608,5282486144,5325676752,2767680,5285257152,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
43218224,3136,43221360,5285225344,5328446704,1920,5285230400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
43258944,4080,43263024,5285187776,5328450800,8481312,5293673168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
43297584,3776,43301360,5293632288,5336933648,5526464,5299162528,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
43311920,3280,43315200,5299146992,5342462192,3485760,5302636032,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
43330368,4160,43334528,5302615408,5345949936,2400,5302621968,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
43338352,2992,43341344,5302612688,5345954032,1984,5302617664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
43355344,2992,43358336,5302599792,5345958128,46688,5302649472,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
43360288,2992,43363280,5302642944,5346006224,3422112,5306068048,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
43363728,3616,43367344,5306063296,5349430640,1952,5306068864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
43368000,3360,43371360,5306063216,5349434576,2419200,5308485776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
43401296,3168,43404464,5308450880,5351855344,1888,5308455936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
43447696,3296,43450992,5308408416,5351859408,34284960,5342696672,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
43479520,2848,43482368,5342664720,5386147088,139712,5342807280,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
43484000,4368,43488368,5342801024,5386289392,12727072,5355532464,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
43488864,2992,43491856,5355526848,5399018704,1984,5355531824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
43492304,2896,43495200,5355527664,5399022864,10358368,5365888928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
43507552,2944,43510496,5365873200,5409383696,1920,5365878064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
43516336,2816,43519152,5365868608,5409387760,832,5365872256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
43540528,2896,43543424,5365846448,5409389872,15717632,5381566976,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
43566800,3376,43570176,5381540080,5425110256,5460384,5387003840,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
43581664,3664,43585328,5386986912,5430572240,1952,5386992528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
43590800,5296,43596096,5386980272,5430576368,1440,5386987008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
43599648,3680,43603328,5386977136,5430580464,1312,5386982128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
43607376,3168,43610544,5386974016,5430584560,3392,5386980576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
43614384,3504,43617888,5386972784,5430590672,1376,5386977664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
43627120,3712,43630832,5386963968,5430594800,4256,5386971936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
43635568,3712,43639280,5386961696,5430600976,1088,5386966496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
43643600,3984,43647584,5386957456,5430605040,1600,5386963040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
43651664,3360,43655024,5386954080,5430609104,1504,5386958944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
43659968,3760,43663728,5386949600,5430613328,1248,5386954608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
43724128,2992,43727120,5386890176,5430617296,25312,5386918480,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
43749936,3456,43753392,5386890560,5430643952,3500224,5390394240,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
43771760,3200,43774960,5390371104,5434146064,2496,5390376800,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
43781168,3520,43784688,5390365504,5434150192,2112,5390371136,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
43799360,3232,43802592,5390351632,5434154224,49952,5390404816,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
43804544,3648,43808192,5390398256,5434206448,4299072,5394700976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
43808624,2944,43811568,5394696704,5438508272,3648,5394703296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
43812224,2912,43815136,5394699280,5438514416,2441600,5397143792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
43848848,3424,43852272,5397106432,5440958704,1888,5397111744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
43892688,4320,43897008,5397065792,5440962800,24888224,5421958336,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
43978688,3840,43982528,5421869808,5465852336,12351616,5434225264,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
44004944,3200,44008144,5434205792,5478213936,2420480,5436629472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
44021312,3184,44024496,5436612160,5480636656,3707936,5440323280,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
44026976,2896,44029872,5440316704,5484346576,3735616,5444055216,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
44036448,2768,44039216,5444044960,5488084176,5065568,5449113296,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
44047552,2672,44050224,5449101760,5493151984,5827808,5454932240,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
44057952,3200,44061152,5454920464,5498981616,241799776,5696723440,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
44096032,3168,44099200,5696683696,5740782896,2166496,5698853360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
44099648,2768,44102416,5698848448,5742950864,1984,5698853200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
44108928,2864,44111792,5698842912,5742954704,2912,5698848688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
44116624,2832,44119456,5698839472,5742958928,1536,5698843840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
44136320,3392,44139712,5698823184,5742962896,46112,5698872688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
44152480,3328,44155808,5698856240,5743012048,2754048,5701613616,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
44186144,2880,44189024,5701579664,5745768688,1920,5701584464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
44226496,3056,44229552,5701543200,5745772752,7818272,5709364528,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
44267568,2928,44270496,5709322608,5753593104,5449504,5714775040,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
44281088,3328,44284416,5714760400,5759044816,3466176,5718229904,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
44298464,3984,44302448,5718209856,5762512304,2304,5718216144,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
44306352,3072,44309424,5718206784,5762516208,1952,5718211808,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
44323712,4112,44327824,5718192480,5762520304,47168,5718243760,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
44329552,2576,44332128,5718237328,5762569456,3411264,5721651168,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
44332576,2672,44335248,5721648192,5765983440,1952,5721652816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
44335776,2576,44338352,5721649216,5765987568,2425440,5724077232,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
44370160,2992,44373152,5724042352,5768415504,1888,5724047232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
44409296,3216,44412512,5724007056,5768419568,34226240,5758236512,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
44439248,2928,44442176,5758206800,5802648976,140032,5758349760,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
44443744,3120,44446864,5758344288,5802791152,11884448,5770231856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
44447280,2704,44449984,5770226896,5814676880,1920,5770231520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
44450496,2864,44453360,5770227488,5814680848,10341376,5780571728,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
44465360,4704,44470064,5780555200,5825025264,1984,5780561888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
44475600,3792,44479392,5780549968,5825029360,2560,5780556320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
44501312,2688,44504000,5780529456,5825033456,15733664,5796265808,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
44527440,2752,44530192,5796238208,5840768400,5464736,5801705696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
44542064,3776,44545840,5801688576,5846234416,1920,5801694272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
44550864,2816,44553680,5801684800,5846238480,1408,5801689024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
44557152,2976,44560128,5801682384,5846242512,1312,5801686672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
44564160,4992,44569152,5801677456,5846246608,3072,5801685520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
44573088,2736,44575824,5801676928,5846252752,1344,5801681008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
44584048,3360,44587408,5801669472,5846256880,4864,5801677696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
44591984,2880,44594864,5801668192,5846263056,1088,5801672160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
44599088,3312,44602400,5801664752,5846267152,1664,5801669728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
44606464,3824,44610288,5801660896,5846271184,1504,5801666224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
44615008,3696,44618704,5801656608,5846275312,1280,5801661584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
44679024,3312,44682336,5801597040,5846279376,25952,5801626304,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
44706848,2944,44709792,5801598288,5846308080,3495520,5805096752,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
44727696,3312,44731008,5805075024,5849806032,2368,5805080704,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
44734896,4432,44739328,5805070800,5849810128,2112,5805077344,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
44754048,3200,44757248,5805056976,5849814224,48096,5805108272,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
44759184,3328,44762512,5805101920,5849864432,3438592,5808543840,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
44762976,2896,44765872,5808540192,5853306064,3424,5808546512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
44766416,4032,44770448,5808541920,5853312368,2821952,5811367904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
44803920,3072,44806992,5811329472,5856136464,1856,5811334400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
44847104,3072,44850176,5811290352,5856140528,25366272,5836659696,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
44932048,4240,44936288,5836572880,5881509168,11847616,5848424736,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
44958528,3408,44961936,5848398304,5893360240,2496864,5850898576,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
44975088,2880,44977968,5850881472,5895859440,3826176,5854710528,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
44980352,2576,44982928,5854705344,5899688272,3904192,5858612112,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
44989552,3024,44992576,5858602128,5903594704,5218816,5863823968,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
44999552,2656,45002208,5863812880,5908815088,5683744,5869499280,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
45009792,3008,45012800,5869487536,5914500336,241798560,6111289104,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
45041408,3248,45044656,6111256928,6156301584,2171424,6113431600,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
45045120,2832,45047952,6113427552,6158475504,1984,6113432368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
45054720,3248,45057968,6113421632,6158479600,2912,6113427792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
45062864,15456,45078320,6113405472,6158483792,1536,6113422464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
45095600,2976,45098576,6113389216,6158487792,48224,6113440416,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
45111360,2992,45114352,6113424608,6158538960,2755936,6116183536,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
45139568,2976,45142544,6116155104,6161297648,1952,6116160032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
45178976,2816,45181792,6116119920,6161301712,7908928,6124031664,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
45217472,3008,45220480,6123992720,6169213200,5461504,6129457232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
45230960,3536,45234496,6129442704,6174677200,3478752,6132924992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
45249680,3312,45252992,6132904816,6178157808,2304,6132910432,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
45256880,4208,45261088,6132900816,6178161904,2016,6132907040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
45275440,2896,45278336,6132887664,6178166000,45856,6132936416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
45280112,3344,45283456,6132930672,6178214128,3426912,6136360928,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
45283920,2768,45286688,6136356784,6181643472,1984,6136361536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
45287168,2848,45290016,6136357584,6181647600,2425184,6138785616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
45319184,3152,45322336,6138753168,6184075504,1888,6138758208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
45359376,3840,45363216,6138716384,6184079600,34891392,6173611616,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
45390320,3296,45393616,6173578816,6218972432,141280,6173723392,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
45395152,4240,45399392,6173717392,6219116784,11920992,6185642624,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
45399808,3120,45402928,6185637312,6231040240,1952,6185642384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
45403504,3584,45407088,6185637248,6231044336,10766528,6196407360,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
45419680,3792,45423472,6196390272,6241813744,2144,6196396208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
45428880,2832,45431712,6196386128,6241817840,832,6196389792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
45453056,3504,45456560,6196363392,6241819952,16326752,6212693648,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
45479728,2768,45482496,6212666096,6258148592,5467264,6218136128,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
45493872,3264,45497136,6218120640,6263617776,1984,6218125888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
45502512,2768,45505280,6218116624,6263621904,1408,6218120800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
45508992,2928,45511920,6218114048,6263625968,1312,6218118288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
45515936,3072,45519008,6218111056,6263630064,3264,6218117392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
45522928,2848,45525776,6218110432,6263636208,1440,6218114720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
45533888,4496,45538384,6218101920,6263640304,4704,6218111120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
45543088,2736,45545824,6218100656,6263646480,1088,6218104480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
45550000,2688,45552688,6218097856,6263650544,1600,6218102144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
45556608,2880,45559488,6218095152,6263654640,1472,6218099504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
45564208,13216,45577424,6218081312,6263658736,1280,6218095808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
45638752,3008,45641760,6218021072,6263662832,26688,6218050768,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
45666032,2832,45668864,6218022640,6263691504,3502624,6221528096,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
45690176,3312,45693488,6221502144,6267195632,2400,6221507856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
45697472,3152,45700624,6221499072,6267199696,1984,6221504208,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
45715520,3536,45719056,6221484512,6267203568,47584,6221535632,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
45721232,3152,45724384,6221529616,6267254000,3522112,6225054880,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
45724816,2768,45727584,6225051024,6270778608,3968,6225057760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
45728112,3392,45731504,6225053248,6270784752,2439168,6227495808,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
45767856,3760,45771616,6227455376,6273226992,1888,6227461024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
45813360,3168,45816528,6227414560,6273231088,25829856,6253247584,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
45893152,3840,45896992,6253165520,6299062512,11811904,6264981264,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
45918736,3424,45922160,6264955168,6310877328,2378688,6267337280,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
45934992,2944,45937936,6267319616,6313257552,3908832,6271231392,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
45940288,2832,45943120,6271224832,6317167952,3972352,6275200016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
45949744,2768,45952512,6275190960,6321143472,5239040,6280432768,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
45959552,2736,45962288,6280422752,6326385040,5665728,6286091216,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
45970176,3600,45973776,6286078944,6332052720,240203808,6526286352,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
46001904,3280,46005184,6526254416,6572259600,2177760,6528435456,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
46005776,2704,46008480,6528431184,6574439664,1952,6528435840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
46015264,3520,46018784,6528424944,6574443728,2976,6528431440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
46023680,3216,46026896,6528421088,6574447984,1504,6528425808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
46043904,3088,46046992,6528404928,6574451920,48864,6528456880,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
46059200,3680,46062880,6528439312,6574502192,2758368,6531201360,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
46096784,3168,46099952,6531162880,6577262832,1920,6531167968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
46137232,2784,46140016,6531126912,6577266928,7814496,6538944192,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
46175328,4000,46179328,6538904848,6585084176,5459264,6544368112,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
46190976,3280,46194256,6544351904,6590546160,3478464,6547833648,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
46207680,3472,46211152,6547814752,6594025904,2400,6547820624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
46215216,2944,46218160,6547811648,6594029808,2112,6547816704,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
46232528,2624,46235152,6547798752,6594033904,47328,6547848704,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
46236912,2944,46239856,6547843168,6594083024,3426688,6551272800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
46240352,2880,46243232,6551269200,6597512432,1952,6551274032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
46243920,2640,46246560,6551269968,6597516528,2426080,6553698688,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
46276864,2928,46279792,6553664672,6599944464,1856,6553669456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
46316976,2912,46319888,6553628640,6599948528,33846624,6587478176,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
46349280,3312,46352592,6587445280,6633797872,172064,6587620656,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
46354064,3120,46357184,6587615760,6633972944,12456320,6600075200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
46357584,3136,46360720,6600071232,6646431952,2208,6600076576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
46361200,2928,46364128,6600071952,6646436080,10598688,6610673568,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
46376480,2832,46379312,6610657344,6657036656,1952,6610662128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
46384752,3520,46388272,6610652384,6657040656,864,6610656768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
46410256,2736,46412992,6610629840,6657042832,15399488,6626032064,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
46442944,3472,46446416,6625998240,6672444656,5615488,6631617200,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
46459536,4016,46463552,6631597904,6678061456,2016,6631603936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
46469792,4016,46473808,6631591648,6678065456,1664,6631597328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
46477456,3120,46480576,6631589168,6678069744,1312,6631593600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
46484752,3232,46487984,6631585600,6678073584,3648,6631592480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
46492128,3088,46495216,6631584480,6678079696,1344,6631588912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
46503712,3120,46506832,6631576992,6678083824,11104,6631591216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
46511520,2768,46514288,6631581920,6678096208,1856,6631586544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
46518816,3056,46521872,6631578336,6678100208,2080,6631583472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
46525936,2704,46528640,6631575664,6678104304,4032,6631582400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
46533408,3984,46537392,6631573056,6678110448,1504,6631578544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
46601728,3792,46605520,6631509024,6678114544,62208,6631575024,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
46628592,3440,46632032,6631546960,6678178992,3617312,6635167712,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
46648448,3280,46651728,6635147200,6681798928,2560,6635153040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
46655872,2816,46658688,6635144336,6681803024,2080,6635149232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
46673568,3632,46677200,6635129856,6681807056,48160,6635181648,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
46679248,2912,46682160,6635175104,6681857264,3838528,6639016544,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
46683024,3328,46686352,6639011936,6685698288,4000,6639019264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
46686960,3136,46690096,6639014336,6685704432,2440192,6641457664,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
46723408,4752,46728160,6641418512,6688146672,1920,6641425184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
46768544,3616,46772160,6641378608,6688150768,26015712,6667397936,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
46856448,3904,46860352,6667309232,6714169584,12030144,6679343280,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
46882336,3312,46885648,6679318336,6726203984,2354880,6681676528,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
46898928,3200,46902128,6681658752,6728560880,3711456,6685373408,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
46904528,4048,46908576,6685366352,6732274928,3963872,6689334272,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
46915360,3296,46918656,6689323216,6736241872,5437760,6694764272,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
46925888,3024,46928912,6694752448,6741681360,5725024,6700480496,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
46936784,3664,46940448,6700468176,6747408624,239633120,6940104960,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
46968976,3360,46972336,6940071776,6987044112,2163136,6942238272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
46972944,2816,46975760,6942233024,6989208784,1952,6942237792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
46981776,4736,46986512,6942226432,6989212944,2688,6942233856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
46991440,2864,46994304,6942222736,6989217040,1504,6942227104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
47011248,3120,47014368,6942206736,6989221104,46848,6942256704,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
47026912,3472,47030384,6942239968,6989270352,2756896,6945000336,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
47057792,2976,47060768,6944968112,6992028880,1952,6944973040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
47106496,3168,47109664,6944923376,6992033040,7841664,6952768208,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
47147552,2928,47150480,6952725568,6999876048,5460608,6958189104,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
47160704,3664,47164368,6958174496,7005338864,3489408,6961667568,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
47178480,3328,47181808,6961648896,7008830704,2496,6961654720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
47186000,3536,47189536,6961645232,7008834768,1984,6961650752,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
47211248,3024,47214272,6961624592,7008838864,46144,6961673760,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
47216032,3008,47219040,6961667952,7008886992,3410336,6965081296,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
47219488,2800,47222288,6965077696,7012299984,1952,6965082448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
47222912,2784,47225696,6965078416,7012304112,2667616,6967748816,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
47256576,3376,47259952,6967714496,7014974448,3712,6967721584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
47298000,4288,47302288,6967678560,7014980848,34079488,7001762336,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
47334512,3328,47337840,7001724864,7049062704,139456,7001867648,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
47339248,3456,47342704,7001861248,7049203952,12768992,7014633696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
47343248,3936,47347184,7014628064,7061975248,1984,7014633984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
47347664,4256,47351920,7014627456,7061979376,10367616,7024999328,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
47365296,3888,47369184,7024979312,7072348496,1920,7024985120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
47374768,4288,47379056,7024973440,7072352496,864,7024978592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
47402384,2704,47405088,7024949552,7072354640,15705376,7040657632,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
47428528,2752,47431280,7040630400,7088061680,5511744,7046144896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
47443024,3280,47446304,7046128656,7093574960,2272,7046134208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
47451792,3952,47455744,7046123248,7093578992,1408,7046128608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
47459664,3392,47463056,7046120032,7093583088,3680,7046127104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
47467568,4512,47472080,7046117120,7093589200,3616,7046125248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
47476176,2976,47479152,7046116096,7093595248,1408,7046120480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
47487248,3360,47490608,7046108864,7093599472,4448,7046116672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
47495664,2592,47498256,7046107360,7093605616,1088,7046111040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
47502976,2848,47505824,7046103920,7093609744,1664,7046108432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
47509968,3104,47513072,7046100736,7093613808,1472,7046105312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
47517648,3184,47520832,7046097104,7093617936,1280,7046101568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
47582576,4016,47586592,7046035408,7093622000,26848,7046066272,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
47610544,3280,47613824,7046036816,7093650640,3741248,7049781344,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
47632480,3600,47636080,7049758336,7097394416,13184,7049775120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
47640096,2944,47643040,7049766096,7097409136,13472,7049782512,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
47657824,3104,47660928,7049764208,7097425136,97696,7049865008,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
47662976,3776,47666752,7049858736,7097525488,3970560,7053833072,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
47667184,3152,47670336,7053828240,7101498576,3552,7053834944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
47670816,2976,47673792,7053830960,7101504752,2437920,7056271856,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
47707648,3632,47711280,7056233664,7103944944,1888,7056239184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
47752112,5072,47757184,7056191856,7103949040,24860704,7081057632,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
47833824,3712,47837536,7080974192,7128811728,12400832,7093378736,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
47859888,3712,47863600,7093351776,7141215376,2338976,7095694464,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
47877008,2992,47880000,7095677328,7143557328,3707360,7099387680,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
47882272,3328,47885600,7099381680,7147267280,3739648,7103124656,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
47892112,3472,47895584,7103113392,7151008976,5512160,7108629024,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
47902800,4768,47907568,7108614848,7156522416,5684192,7114303808,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
47916352,4000,47920352,7114289200,7162209552,242227488,7356520688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
47955696,3872,47959568,7356479328,7404438896,2180384,7358663584,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
47960080,2544,47962624,7358658256,7406620880,1952,7358662752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
47969216,3056,47972272,7358652704,7406624976,2560,7358658320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
47976928,2752,47979680,7358649392,7406629072,1536,7358653680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
47996096,3248,47999344,7358633856,7406633200,45024,7358682128,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
48011680,3824,48015504,7358664800,7406680304,2751680,7361420304,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
48040928,3072,48044000,7361389840,7409433840,1856,7361394768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
48088768,3936,48092704,7361345232,7409437936,7852832,7369202000,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
48127616,2480,48130096,7369161984,7417292080,5460768,7374625232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
48140272,3568,48143840,7374611216,7422755056,3467584,7378082368,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
48157952,3584,48161536,7378063856,7426225392,2368,7378069808,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
48165648,4000,48169648,7378059840,7426229488,2112,7378065952,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
48183984,3280,48187264,7378046352,7426233616,45408,7378095040,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
48189056,2848,48191904,7378089808,7426281712,3408320,7381500976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
48192384,2816,48195200,7381496400,7429691600,1952,7381501168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
48195728,2512,48198240,7381497488,7429695728,2422752,7383922752,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
48227520,3168,48230688,7383890896,7432121584,1856,7383895920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
48267808,2784,48270592,7383855056,7432125648,34878368,7418736208,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
48298304,2928,48301232,7418703840,7467005072,142560,7418849328,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
48302704,3760,48306464,7418844112,7467150576,11880896,7430728768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
48307056,2720,48309776,7430723296,7479033072,1952,7430727968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
48310240,3904,48314144,7430723024,7479037168,10359680,7441086608,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
48326832,2960,48329792,7441069296,7489399088,6624,7441078880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
48335312,3488,48338800,7441068416,7489407216,1568,7441073472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
48361296,2944,48364240,7441047072,7489411312,15720800,7456770816,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
48387760,2720,48390480,7456744384,7505134864,5521792,7462268896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
48405280,3264,48408544,7462250768,7510659312,3904,7462257936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
48414048,3120,48417168,7462248256,7510665424,1440,7462252816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
48420864,2912,48423776,7462245776,7510669552,3008,7462251696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
48427840,3168,48431008,7462244688,7510675696,3520,7462251376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
48435056,2992,48438048,7462243728,7510681776,2048,7462248768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
48447040,5072,48452112,7462233824,7510685936,6688,7462245584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
48456896,3600,48460496,7462233632,7510694128,2848,7462240080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
48464656,4368,48469024,7462229264,7510698288,1600,7462235232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
48473168,3184,48476352,7462225968,7510702320,2304,7462231456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
48481088,3184,48484272,7462222144,7510706416,2240,7462227568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
48545280,2880,48548160,7462162352,7510710512,29504,7462194736,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
48573248,2992,48576240,7462165056,7510741296,3520864,7465688912,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
48592848,2864,48595712,7465669392,7514265104,5600,7465677856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
48599600,2864,48602464,7465669520,7514271984,1952,7465674336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
48617440,3008,48620448,7465655504,7514275952,52032,7465710544,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
48622416,3472,48625888,7465704528,7514330416,4260224,7469968224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
48626368,2960,48629328,7469962880,7518592208,1984,7469967824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
48629824,3136,48632960,7469963376,7518596336,2447712,7472414224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
48670864,3104,48673968,7472372832,7521046800,1856,7472377792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
48723920,3072,48726992,7472323616,7521050608,25226208,7497552896,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
48804096,3680,48807776,7497470320,7546278096,12453792,7509927792,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
48831328,3248,48834576,7509900896,7558735472,2351712,7512255856,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
48848192,3264,48851456,7512238832,7561090288,3714304,7515956400,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
48853744,2640,48856384,7515950992,7564807376,3786336,7519739968,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
48863008,2768,48865776,7519730400,7568596176,5154144,7524887312,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
48873008,2720,48875728,7524877344,7573753072,5813440,7530693504,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
48883664,3088,48886752,7530681616,7579568368,240922976,7771607680,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
48918176,3008,48921184,7771571888,7820493072,2156896,7773731792,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
48921664,2784,48924448,7773727216,7822651664,1952,7773731952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
48931216,3200,48934416,7773721312,7822655728,3360,7773727872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
48939184,3024,48942208,7773719632,7822661840,1568,7773724224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
48958992,2896,48961888,7773703984,7822665872,51264,7773758144,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
48974352,3440,48977792,7773741392,7822719184,2771712,7776516544,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
49003200,2976,49006176,7776485968,7825492144,1952,7776490896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
49042816,4128,49046944,7776449360,7825496304,7849312,7784302800,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
49090640,3392,49094032,7784253312,7833347344,5451136,7789707840,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
49104256,4160,49108416,7789691824,7838800240,3479136,7793175120,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
49122672,3456,49126128,7793154528,7842280656,2368,7793160352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
49130368,3104,49133472,7793151280,7842284752,2144,7793156528,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
49148048,2976,49151024,7793137856,7842288880,47424,7793188256,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
49152784,3008,49155792,7793183264,7842339056,3417600,7796603872,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
49156272,3008,49159280,7796598880,7845758160,2016,7796603904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
49159808,3152,49162960,7796599328,7845762288,2423840,7799026320,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
49193792,2928,49196720,7798992448,7848189168,1888,7798997264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
49235024,3184,49238208,7798954800,7848193008,34270688,7833228672,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
49265936,2944,49268880,7833196672,7882465552,140768,7833340384,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
49270336,3232,49273568,7833334288,7882607856,11865984,7845203504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
49274224,3792,49278016,7845197104,7894475120,2464,7845203360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
49278608,2928,49281536,7845197552,7894479088,10348864,7855549344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
49293728,4224,49297952,7855532752,7904830704,1952,7855538928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
49303280,2912,49306192,7855528608,7904834800,2656,7855534176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
49329184,3088,49332272,7855506624,7904838896,15733856,7871243568,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
49355536,2560,49358096,7871217632,7920575728,5463552,7876683744,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
49370032,3536,49373568,7876668272,7926041840,1920,7876673728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
49378896,3088,49381984,7876663920,7926045904,1440,7876668448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
49385776,4128,49389904,7876660096,7926050000,1312,7876665536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
49393696,2992,49396688,7876657408,7926054096,3520,7876663920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
49400864,2912,49403776,7876656496,7926060272,1344,7876660752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
49412160,4224,49416384,7876647984,7926064368,4992,7876657200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
49421152,2960,49424112,7876646528,7926070640,1120,7876650608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
49428624,2992,49431616,7876643024,7926074640,1632,7876647648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
49435632,2832,49438464,7876640240,7926078704,1504,7876644576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
49443168,3296,49446464,7876636336,7926082800,1216,7876640848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
49516688,3232,49519920,7876566976,7926086896,25632,7876595840,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
49541744,2992,49544736,7876570832,7926115568,3505824,7880079648,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
49562112,2960,49565072,7880058720,7929623792,2432,7880064112,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
49569008,2848,49571856,7880056032,7929627888,1920,7880060800,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
49587456,3328,49590784,7880041200,7929631984,47648,7880092176,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
49592704,11806400,61399104,7868282032,7929681136,3448928,7883537360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
61399680,11859920,73259600,7859873440,7933133040,4032,7871737392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
73260240,3024,73263264,7859875984,7933139248,2809952,7862688960,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
73307664,2350480,75658144,7860293968,7935952112,1856,7862646304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
75703072,3960864,79663936,7856292336,7935956272,25293632,7885546832,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
79746944,3917648,83664592,7877587488,7961252080,11798880,7893304016,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
88963632,5733888,94697520,7878357152,7973054672,2382432,7886473472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
94711456,240306272,335017728,7640421872,7975439600,3919904,7884648048,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
335024416,2168400,337192816,7642169728,7979362544,3922944,7648261072,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
337203344,3712,337207056,7646080448,7983287504,5215584,7651299744,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
337215072,2800,337217872,7651287936,7988505808,5690784,7656981520,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
337230096,3168,337233264,7656967392,7994200656,241148000,7898118560,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
337294976,6464,337301440,7898049872,8235351312,2184512,7900240848,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
337301936,2723280,340025216,7897513296,8237538512,1984,7900238560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
340035552,4928,340040480,7897502160,8237542640,3040,7897510128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
340045936,7686896,347732832,7889815920,8237548752,1568,7897504384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
347761408,5435120,353196528,7884356256,8237552784,52064,7889843440,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
353214192,3701616,356915808,7880690320,8237606128,2756640,7887148576,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
356948160,4160,356952320,7883413488,8240365808,1888,7883419536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
356996944,3296,357000240,7883369664,8240369904,7952640,7891325600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
357046496,5888,357052384,7891271984,8248324368,5449216,7896727088,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
357064880,4020800,361085680,7892689408,8253775088,3472800,7900183008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
361106736,3728,361110464,7896139056,8257249520,2400,7896145184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
361114448,2413456,363527904,7893725712,8257253616,1984,7896141152,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
363545184,5984,363551168,7893706544,8257257712,45696,7893758224,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
363553104,34544576,398097680,7859208160,8257305840,3431232,7897183968,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
398098240,141808,398240048,7862499232,8260739280,1952,7862642992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
398240656,11924096,410164752,7850578720,8260743472,2425536,7864928352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
410204272,4128,410208400,7852962912,8263171312,1888,7852968928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
410248736,10679792,420928528,7842246880,8263175408,34385728,7887312400,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
420958736,4240,420962976,7876599472,8297562448,140160,7876743872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
420964432,4400,420968832,7876736880,8297705712,11916032,7888657312,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
420969408,16172368,437141776,7872482272,8309624048,2432,7888657072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
437142592,5455488,442598080,7867030064,8309628144,10800032,7883285584,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
442612544,3056,442615600,7877814720,8320430320,1920,7877819696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
442622224,2896,442625120,7877809296,8320434416,832,7877813024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
442652112,3360,442655472,7877781152,8320436624,16112576,7893897088,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
442684560,5488,442690048,7893861104,8336551152,5465952,7899332544,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
442708112,3952,442712064,7899307248,8342019312,1952,7899313152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
442718272,3408,442721680,7899301760,8342023440,1440,7899306608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
442728144,5200,442733344,7899294192,8342027536,1312,7899300704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
442738480,6032,442744512,7899287088,8342031600,3680,7899296800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
442749424,4256,442753680,7899284096,8342037776,1312,7899289664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
442768256,7120,442775376,7899266432,8342041808,4896,7899278448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
442784720,4832,442789552,7899258432,8342047984,1088,7899264352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
442793920,3362736,446156656,7895895424,8342052080,1632,7899259792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
446161632,3696,446165328,7895890848,8342056176,1472,7895896016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
446172096,3840,446175936,7895884336,8342060272,1248,7895889424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
446247728,3776,446251504,7895812864,8342064368,26112,7895842752,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
446277584,3390880,449668464,7892424576,8342093040,3493632,7899309088,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
449690320,3728,449694048,7895893904,8345587952,2560,7895900192,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
449698016,2414112,452112128,7893479888,8345592016,1984,7895895984,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
452128752,4144,452132896,7893463248,8345596144,47840,7893515232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
452135120,25754352,477889472,7867756848,8345646320,3444576,7896955776,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
477889952,11822032,489711984,7859380224,8349092208,4096,7871206352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
489712736,5920,489718656,7859379568,8349098224,2448192,7861833680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
489767792,2294704,492062496,7859486160,8351548656,1888,7861782752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
492114336,3760928,495875264,7855677520,8351552784,25738272,7885176720,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
495967680,3856864,499824544,7877471088,8377295632,11891808,7893219760,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
505233904,5665120,510899024,7878291168,8389190192,2346944,7886303232,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
510913488,240436896,751350384,7640188544,8391538928,3761664,7884387104,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
751355552,2164752,753520304,7641782848,8395303152,4026528,7647974128,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
753528464,3264,753531728,7645799808,8399331536,5417472,7651220544,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
753539184,3008,753542192,7651209408,8404751600,5663296,7656875712,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
753552496,3328,753555824,7656860544,8410416368,241593728,7898457600,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
753597488,7360,753604848,7898406944,8652011792,2164960,7900579264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
753605360,2726944,756332304,7897846240,8654178544,1920,7900575104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
756341584,6816,756348400,7897834240,8654182640,2976,7897844032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
756353632,7728624,764082256,7890104640,8654186896,1536,7897834800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
764105344,5441520,769546864,7884643968,8654190832,48416,7890133904,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
769561696,3448912,773010608,7881231424,8654242032,2752160,7887432496,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
773041040,4144,773045184,7883950384,8656995568,1888,7883956416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
773088336,5424,773093760,7883905904,8656999664,7942144,7891853472,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
773132160,3328,773135488,7891808432,8664943920,5458208,7897269968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
773146880,3889008,777035888,7893368960,8670404848,3475616,7900733584,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
777056048,3504,777059552,7896823824,8673883376,4320,7896831648,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
777063680,2707872,779771552,7894118128,8673889680,19776,7896845776,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
779787840,3856,779791696,7894120320,8673912016,52288,7894176464,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
779793584,33119872,812913456,7861053856,8673967312,4322208,7898495936,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
812914032,187792,813101824,7865189872,8678291696,1952,7865379616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
813102480,12696720,825799200,7852496560,8678295760,2444640,7867637920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
825834960,5632,825840592,7854902560,8680743152,1920,7854910112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
825881168,10399248,836280416,7844466832,8680747248,34577664,7889443744,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
836312144,3328,836315472,7879011232,8715326704,141088,7879155648,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
836317184,3008,836320192,7879148880,8715469072,12382976,7891534864,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
836320688,15581440,851902128,7875951264,8727853392,1984,7891534688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
851902672,5573968,857476640,7870380720,8727857360,10443584,7886398272,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
857490592,3136,857493728,7880809488,8738303216,1952,7880814576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
857499872,2736,857502608,7880804704,8738307312,2592,7880810032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
857525312,2944,857528256,7880783152,8738311408,15308832,7896094928,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
857554704,2960,857557664,7896064592,8753622256,5479104,7901546656,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
857569936,3104,857573040,7901529664,8759102704,1952,7901534720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
857578896,2768,857581664,7901525136,8759106800,1408,7901529312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
857585392,2784,857588176,7901522720,8759110896,3648,7901529152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
857592800,3616,857596416,7901520624,8759117040,3072,7901527312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
857600800,2976,857603776,7901519408,8759123184,1376,7901523760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
857616288,10272,857626560,7901500624,8759127184,4640,7901515536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
857631712,6768,857638480,7901494976,8759133456,1152,7901502896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
857644512,3638560,861283072,7897854192,8759137264,1600,7901494352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
861287728,3328,861291056,7897850528,8759141584,1472,7897855328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
861296528,3264,861299792,7897845920,8759145712,1248,7897850432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
861370064,3376,861373440,7897776336,8759149776,25216,7897804928,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
861398816,3758960,865157776,7894018656,8759176432,3694624,7901472240,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
865177456,3296,865180752,7897693344,8762874096,2400,7897699040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
865184752,2416176,867600928,7895277328,8762878256,2176,7897695680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
867617840,3488,867621328,7895260960,8762882288,50528,7895314976,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
867623760,23921488,891545248,7871389232,8762934480,3638240,7898948960,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
891545968,12482496,904028464,7862546336,8766574800,1952,7875030784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
904029136,4048,904033184,7862545744,8766578928,2442912,7864992704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
904078192,2298928,906377120,7862647248,8769024368,1920,7864948096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
906426704,3665792,910092496,7858935872,8769028368,25552160,7888153824,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
910192640,3624192,913816832,7880765456,8794582288,12077248,7896466896,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
919352704,5796848,925149552,7881512544,8806662096,2352160,7889661552,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
925163920,239341408,1164505328,7644510240,8809015568,3721376,7887573024,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1164510912,2162880,1166673792,7646064976,8812738768,4098432,7652326288,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1166682640,3280,1166685920,7650153968,8816839888,5346304,7655503552,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1166693600,2816,1166696416,7655492848,8822189264,5725184,7661220848,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1166708128,3216,1166711344,7661205184,8827916528,241606016,7902814416,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
1166759440,8128,1166767568,7902757696,9069525264,2174688,7904940512,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
1166768208,2728592,1169496800,7902205520,9071702320,1952,7904936064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
1169508624,4384,1169513008,7902193376,9071706384,2720,7902200480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1169518000,7785488,1177303488,7894406928,9071710416,1536,7902193952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
1177330704,5426464,1182757168,7888957344,9071714512,47232,7894431040,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1182776848,3458304,1186235152,7885528512,9071763664,2758720,7891745536,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
1186266928,4224,1186271152,7888253248,9074524400,1952,7888259424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1186319216,3120,1186322336,7888206160,9074528496,7921504,7896130784,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1186364320,3824,1186368144,7896083200,9082451344,5461920,7901548944,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
1186381648,3372992,1189754640,7898160608,9087915248,3486688,7905020288,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
1189775840,4432,1189780272,7901624768,9091405040,2400,7901631600,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1189784432,2427904,1192212336,7899196800,9091409136,2080,7901626784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1192229088,4480,1192233568,7899179632,9091413200,46048,7899230160,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1192235504,34629104,1226864608,7864597744,9091462352,3874528,7903101376,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
1226865184,142416,1227007600,7868331648,9095339248,1952,7868476016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
1227008240,12762544,1239770784,7855572560,9095343344,2624832,7870959936,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
1239810080,4960,1239815040,7858155888,9097970928,1856,7858162704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1239856560,10376672,1250233232,7847741792,9097975024,33697120,7891815584,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1250265872,4592,1250270464,7881404432,9131674896,139840,7881548864,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1250272576,4880,1250277456,7881539744,9131817200,11919712,7893464336,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
1250278192,15756848,1266035040,7877704560,9143739600,1952,7893463360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
1266036336,5823472,1271859808,7871883952,9143743760,10381664,7888089088,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
1271875280,3280,1271878560,7882250384,9154128944,1952,7882255616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1271885296,2800,1271888096,7882245008,9154133104,1824,7882249632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1271915792,4544,1271920336,7882215968,9154136304,15711680,7897932192,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1271948400,6048,1271954448,7897896160,9169850608,5507136,7903409344,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
1271974016,3888,1271977904,7903381824,9175359728,1920,7903387632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1271984176,6096,1271990272,7903373552,9175363824,1568,7903381216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
1271994864,4976,1271999840,7903368080,9175367920,3168,7903376224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1272004384,6688,1272011072,7903363024,9175374096,3392,7903373104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
1272016304,7840,1272024144,7903356000,9175380144,1344,7903365184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1272038832,8480,1272047312,7903337024,9175384336,4928,7903350432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
1272054176,5904,1272060080,7903330656,9175390736,1120,7903337680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
1272064336,3417328,1275481664,7899912784,9175394448,1632,7903331744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
1275486768,4320,1275491088,7899907552,9175398640,1696,7899913568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
1275498016,3408,1275501424,7899901344,9175402768,7616,7899912368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1275572976,3696,1275576672,7899836304,9175412976,26336,7899866336,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
1275602496,4198528,1279801024,7895640496,9175441520,3844544,7903683568,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
1279823024,3424,1279826448,7899461344,9179287792,2336,7899467104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1279830320,2423072,1282253392,7897038496,9179291888,2048,7899463616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1282270336,4432,1282274768,7897021216,9179295984,48768,7897074416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1282276992,24866304,1307143296,7872203888,9179347184,3828800,7900898992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
1307143776,12477136,1319620912,7863557056,9183177968,4032,7876038224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
1319621712,3808,1319625520,7863558592,9183184112,2423808,7865986208,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
1319668752,2294880,1321963632,7863647392,9185611024,1888,7865944160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1322013136,3678496,1325691632,7859923424,9185615056,24620416,7888222336,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1325793664,3633296,1329426960,7880811232,9210238192,12466528,7896911056,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
1334578096,5874496,1340452592,7882255168,9222707760,2350880,7890480544,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
1340468096,238892736,1579360832,7645700784,9225061616,3725056,7888318576,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1579364448,2156080,1581520528,7647267424,9228787952,3735968,7653159472,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1581528416,3232,1581531648,7650993872,9232525520,5525984,7656523088,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1581539200,2416,1581541616,7656511488,9238053104,5802432,7662316336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1581551008,2944,1581553952,7662304176,9243858128,242206816,7904513936,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
1581587376,5152,1581592528,7904474432,9486066960,2168960,7906648544,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
1581592960,2744896,1584337856,7903899984,9488237840,2016,7906646896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
1584346400,4112,1584350512,7903891392,9488241904,2944,7903898448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1584355856,7793680,1592149536,7896096592,9488246128,1536,7903891808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
1592172256,5592352,1597764608,7890485488,9488250096,45504,7896123344,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1597779344,3648176,1601427520,7886869648,9488297168,2763104,7893280928,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
1601457584,5504,1601463088,7889599936,9491063024,1920,7889607360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1601502528,3136,1601505664,7889561456,9491067120,7944544,7897509136,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1601544480,2784,1601547264,7897467152,9499014416,5450496,7902920432,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
1601558800,3786304,1605345104,7899121088,9504466192,3475360,7906382752,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
1605362560,3504,1605366064,7902576736,9507942800,2368,7902582608,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1605370032,2420304,1607790336,7900156400,9507946736,2048,7902578752,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1607806608,3264,1607809872,7900140960,9507950832,47552,7900191776,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1607811776,34027600,1641839376,7866160608,9507999984,3421152,7903609360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
1641840048,140432,1641980480,7869443792,9511424272,1952,7869586176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
1641981120,12368192,1654349312,7857079024,9511428336,2483008,7871930224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
1654384384,4352,1654388736,7859523920,9513912656,2368,7859530640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1654430064,10593680,1665023744,7848893104,9513916848,34376960,7893863744,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1665054544,4224,1665058768,7883237696,9548296464,139616,7883381536,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1665060400,4352,1665064752,7883374016,9548438768,12796832,7896175200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
1665065200,15672688,1680737888,7880499824,9561237712,2240,7896174752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
1680738400,5455632,1686194032,7875047808,9561241840,10357696,7890861136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
1686208144,3024,1686211168,7885390480,9571601648,1920,7885395424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1686217616,3264,1686220880,7885384864,9571605744,832,7885388960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1686244048,3008,1686247056,7885360800,9571607856,15753632,7901117440,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1686273504,4832,1686278336,7901084720,9587363056,5458112,7906547664,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
1686296208,4416,1686300624,7906522400,9592823024,1984,7906528800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1686306352,4080,1686310432,7906516784,9592827216,1408,7906522272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
1686314784,4704,1686319488,7906511728,9592831216,1312,7906517744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1686323696,4992,1686328688,7906506624,9592835312,3296,7906514912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
1686333600,4336,1686337936,7906503520,9592841456,1344,7906509200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
1686348208,6320,1686354528,7906490928,9592845456,4448,7906501696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
1686360256,5248,1686365504,7906486160,9592851664,1088,7906492496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
1686370368,3391328,1689761696,7903094000,9592855696,1632,7906486960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
1689766336,3504,1689769840,7903090048,9592859888,1472,7903095024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
1689775344,5264,1689780608,7903083376,9592863984,1280,7903089920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1689847168,3584,1689850752,7903017328,9592868080,25184,7903046096,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
1689876800,3862112,1693738912,7899155792,9592894704,3628416,7906646320,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
1693766128,3248,1693769376,7902764528,9596533904,17728,7902785504,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1693773536,2819920,1696593456,7899961024,9596554480,11680,7902792624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
1696610752,4016,1696614768,7899954080,9596568848,69088,7900027184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
1696616848,25285088,1721901936,7874737536,9596639472,4118272,7904140896,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
1721902592,11903024,1733805616,7866954400,9600760016,3840,7878861264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
1733806272,2928,1733809200,7866957024,9600766224,2419840,7869379792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
1733851440,2508640,1736360080,7866827872,9603187952,1888,7869338400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
1736407728,3696624,1740104352,7863087696,9603192048,24930496,7891714816,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
1740194480,3860432,1744054912,7884069488,9628124400,12466368,7900396288,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
1749176464,5699216,1754875680,7885718000,9640593680,2350944,7893768160,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
1754890528,240183200,1995073728,7647873104,9642946832,3729024,7891785328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1995079392,2160912,1997240304,7649437920,9646678224,3748576,7655347408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1997248592,3360,1997251952,7653176160,9650428112,5354496,7658534016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1997259936,3008,1997262944,7658521776,9655784720,5783808,7664308592,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
1997272656,3040,1997275696,7664295616,9661571312,241193152,7905491808,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
1997309504,8512,1997318016,7905448368,9902766384,2168640,7907625520,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
1997318640,2735392,2000054032,7904883168,9904937200,1952,7907620512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
2000062368,5552,2000067920,7904873376,9904941296,2944,7904881872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2000073360,7796944,2007870304,7897075216,9904945520,1568,7904873728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2007892000,5452368,2013344368,7891605088,9904949456,47232,7897104688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2013360384,3693200,2017053584,7887945056,9904998640,2753088,7894391344,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
2017085744,3984,2017089728,7890664496,9907754224,1888,7890670368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2017130592,3728,2017134320,7890624000,9907758320,7844192,7898471920,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2017175040,4112,2017179152,7898426112,9915605264,5462816,7903893040,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
2017191040,3990144,2021181184,7899889168,9921070352,3466848,7907346160,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
2021201840,3728,2021205568,7903334064,9924539632,2304,7903340096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2021209680,2415488,2023625168,7900918560,9924543728,2048,7903336096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2023641696,4512,2023646208,7900901584,9924547792,47456,7900953552,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2023648080,34033792,2057681872,7866915072,9924596944,3416192,7904365056,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
2057682416,142256,2057824672,7870191440,9928016112,1952,7870335648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2057825312,11888304,2069713616,7858306592,9928020208,2424832,7872619728,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
2069748688,5904,2069754592,7860693520,9930448112,1856,7860701280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2069796128,10665632,2080461760,7849990448,9930452208,34503808,7895159888,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2080493008,6576,2080499584,7884458384,9964957968,140736,7884605696,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2080501376,6864,2080508240,7884593024,9965101264,12747232,7897347120,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
2080508704,16200080,2096708784,7881141312,9977850096,2208,7897343600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2096709632,5469088,2102178720,7875675472,9977854192,10374624,7891519184,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
2102194704,3648,2102198352,7886033056,9988231408,1920,7886038624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2102204848,2896,2102207744,7886027760,9988235504,2528,7886033184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2102235472,3760,2102239232,7886000368,9988239600,15701312,7901705440,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2102284000,6896,2102290896,7901652768,10003943664,5469120,7907128784,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
2102310128,6272,2102316400,7907098496,10009414896,1920,7907106688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2102324864,4672,2102329536,7907089456,10009418992,1408,7907095536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
2102336016,5248,2102341264,7907081824,10009423088,1376,7907088448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2102346512,6240,2102352752,7907074432,10009427184,3136,7907083808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2102357472,6080,2102363552,7907069776,10009433328,1344,7907077200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2102377168,8256,2102385424,7907052000,10009437424,6720,7907066976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
2102391616,6864,2102398480,7907047136,10009445616,1088,7907055088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
2102403520,3344960,2105748480,7903701232,10009449712,1600,7907047792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
2105753712,3840,2105757552,7903696256,10009453808,1472,7903701568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2105763920,3536,2105767456,7903690448,10009457904,1312,7903695296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2105835568,3552,2105839120,7903622880,10009462000,27584,7903654016,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
2105865296,3458736,2109324032,7900168656,10009492688,3491904,7907119296,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
2109346016,3472,2109349488,7903638176,10012987664,2528,7903644176,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2109353424,2412672,2111766096,7901225728,10012991824,2016,7903640416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2111782944,3744,2111786688,7901209136,10012995824,48352,7901261232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2111788880,25833712,2137622592,7875423408,10013046000,4232896,7905490016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
2137623056,11820816,2149443872,7867837360,10017281232,4096,7879662272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2149444448,3232,2149447680,7867839696,10017287376,2498976,7870341904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
2149496496,2304640,2151801136,7867987904,10019789040,1952,7870294496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2151852384,3701232,2155553616,7864239488,10019793104,24911776,7892852496,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2155687008,3934192,2159621200,7885085856,10044707056,12388768,7901408816,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
2165039888,5668176,2170708064,7886394224,10057102288,2363744,7894426144,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
2170723840,242069584,2412793424,7646675648,10059469072,3784768,7892530000,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2412799152,2153008,2414952160,7648303632,10063255792,3747296,7654203936,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2414960832,3536,2414964368,7652040000,10067004368,5073216,7657116752,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2414972144,2704,2414974848,7657105808,10072080656,5698400,7662806912,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2414986000,3376,2414989376,7662790960,10077780336,242541280,7905335616,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
2415037552,9376,2415046928,7905276032,10320322960,2168832,7907454240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
2415048112,2720096,2417768208,7904725472,10322493680,1920,7907447488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
2417778112,5248,2417783360,7904714416,10322497776,2944,7904722608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2417788816,7801120,2425589936,7896912096,10322502032,1536,7904714752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2425616288,5431392,2431047680,7891458288,10322505968,49696,7896939376,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2431064576,3467776,2434532352,7888024880,10322557232,2751232,7894243888,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
2434563984,3520,2434567504,7890743200,10325310704,1952,7890748672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2434608336,11424,2434619760,7890695040,10325314800,7992640,7898699104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2434661104,4656,2434665760,7898644528,10333310288,5463872,7904113056,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
2434678064,4243856,2438921920,7899853488,10338775408,3477760,7907575104,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
2438941040,3680,2438944720,7903310112,10342254832,2368,7903316160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2438948816,2419296,2441368112,7900890816,10342258928,2048,7903312160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2441384912,5664,2441390576,7900872448,10342263024,46048,7900924160,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2441392720,33746240,2475138960,7867173216,10342312176,3447488,7904366944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
2475139568,141456,2475281024,7870481008,10345762032,1952,7870624416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2475281680,12293504,2487575184,7858190944,10345766128,2423296,7872907744,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
2487613072,7264,2487620336,7860571648,10348191984,1920,7860580832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2487661520,10706656,2498368176,7849827904,10348196080,34563424,7895097984,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2498399600,5312,2498404912,7884357376,10382762288,140576,7884503264,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2498406576,3440,2498410016,7884495632,10382905648,12654624,7897153696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
2498410816,15788176,2514198992,7881363200,10395562192,2688,7897154064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2514199536,5491632,2519691168,7875875152,10395566320,10480992,7891847776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
2519705616,2976,2519708592,7886341440,10406050032,1920,7886346336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2519715168,2944,2519718112,7886335984,10406054096,1088,7886340016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2519741632,2944,2519744576,7886312080,10406056656,15701088,7902016112,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2519773408,4144,2519777552,7901982688,10421760240,5465056,7907451888,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
2519790416,3824,2519794240,7907434192,10427228432,1920,7907439936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2519800800,2880,2519803680,7907428816,10427232496,1408,7907433104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
2519807424,2880,2519810304,7907426288,10427236592,1280,7907430448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2519814960,3104,2519818064,7907422624,10427240688,3232,7907428960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2519822432,2736,2519825168,7907421696,10427246864,1344,7907425776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2519833776,3104,2519836880,7907414048,10427250928,4832,7907421984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
2519842208,19840,2519862048,7907394992,10427257040,1120,7907415952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
2519866368,3589920,2523456288,7903804944,10427261232,1632,7907396496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
2523460880,3008,2523463888,7903801376,10427265264,1472,7903805856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2523469232,3648,2523472880,7903796480,10427269360,1280,7903801408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2523542000,3472,2523545472,7903727984,10427273456,25920,7903757376,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
2523570768,3566720,2527137488,7900164640,10427302128,3508896,7907240256,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
2527159872,3264,2527163136,7903649008,10430812144,2464,7903654736,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2527167136,2416960,2529584096,7901232400,10430816496,2016,7903651376,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2529601088,3776,2529604864,7901215728,10430820592,48512,7901268016,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2529607056,25387232,2554994288,7875877504,10430871792,3516544,7904781280,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
2554994816,12074240,2567069056,7867322224,10434391280,4384,7879400848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2567069680,3744,2567073424,7867324000,10434397424,2736736,7870064480,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
2567117872,2300880,2569418752,7867717872,10437136624,1888,7870020640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2569464176,3672864,2573137040,7864003680,10437140720,25314144,7892990688,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2573239264,3993840,2577233104,7885223072,10462456176,12035712,7901252624,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
2582592704,5692160,2588284864,7886212496,10474497360,2454048,7894358704,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
2588300928,239518224,2827819152,7649134688,10476953840,3817408,7892470320,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2827823696,2154608,2829978304,7650795056,10480773360,3902560,7656852224,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2829986400,3600,2829990000,7654688928,10484678928,5091520,7659784048,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2829997936,2992,2830000928,7659771344,10489772272,5706880,7665481216,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
2830012576,3152,2830015728,7665466368,10495482096,242566784,7908036304,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
2830050096,6160,2830056256,7907995088,10738051344,2171840,7910173088,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
2830056720,2734512,2832791232,7907435024,10740226256,1984,7910171520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
2832799776,4880,2832804656,7907425728,10740230384,3104,7907433712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2832810096,7807648,2840617744,7899618752,10740236496,1536,7907427936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2840638672,5434064,2846072736,7894167792,10740240528,47072,7899648928,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2846088784,3462528,2849551312,7890738464,10740289776,2751712,7896952704,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
2849582400,4832,2849587232,7893456080,10743043312,1888,7893462800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2849627280,3936,2849631216,7893416192,10743047408,7940800,7901360928,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2849670288,2944,2849673232,7901316352,10750989584,5517184,7906836480,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
2849684752,3338896,2853023648,7903485264,10756508912,3821792,7910645952,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
2853043536,3520,2853047056,7907285440,10760332496,2496,7907291456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2853051120,2736096,2855787216,7904549504,10760336720,2048,7907287648,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2855803920,3024,2855806944,7904533776,10760340720,46816,7904583616,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2855808912,33775376,2889584288,7870804528,10760388816,3812448,7908392352,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
2889584848,143824,2889728672,7874475600,10764204272,1920,7874621344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2889729328,12812560,2902541888,7861666448,10764208336,2426976,7876905984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
2902578064,3920,2902581984,7864055312,10766637296,1888,7864061120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2902622992,10288288,2912911280,7853730112,10766641392,34306016,7898324416,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2912943696,3824,2912947520,7888001968,10800949488,140000,7888145792,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2912949200,3328,2912952528,7888139296,10801091824,12269024,7900411648,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
2912953056,15712128,2928665184,7884697232,10813362416,5312,7900414672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2928665776,5466656,2934132432,7879238176,10813370608,10774496,7895479328,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
2934147376,2928,2934150304,7889996880,10824147184,4960,7890004768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2934156816,2976,2934159792,7889993632,10824153424,7264,7890003872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2934182864,3328,2934186192,7889977376,10824163568,15771104,7905751808,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2934215312,6400,2934221712,7905714272,10839935984,5466784,7911187456,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
2934240464,3840,2934244304,7911161120,10845405424,1920,7911166880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2934250496,3472,2934253968,7911155648,10845409616,1440,7911160560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
2934257936,4272,2934262208,7911151440,10845413648,3168,7911158880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2934266864,5664,2934272528,7911147232,10845419760,3168,7911156064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2934276992,4288,2934281280,7911144528,10845425808,1312,7911150128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
2934293232,5344,2934298576,7911131424,10845430000,4544,7911141312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
2934304944,5024,2934309968,7911126176,10845436144,1088,7911132288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
2934314352,3390096,2937704448,7907735824,10845440272,1632,7911127552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
2937709184,3520,2937712704,7907731632,10845444336,1472,7907736624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
2937718192,3728,2937721920,7907726480,10845448400,1312,7907731520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2937789344,3808,2937793152,7907659376,10845452528,26560,7907689744,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
2937818272,3400384,2941218656,7904262544,10845481200,3503456,7911166384,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
2941239440,3504,2941242944,7907744464,10848987408,2368,7907750336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2941246800,2415072,2943661872,7905329600,10848991472,2016,7907746688,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
2943678448,4080,2943682528,7905313040,10848995568,48320,7905365440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
2943684752,24855152,2968539904,7880505808,10849045712,3440576,7908801536,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
2968540400,12476560,2981016960,7871470608,10852487568,4032,7883951200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
2981017792,3344,2981021136,7871472448,10852493584,2674176,7874149968,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
2981071056,2291840,2983362896,7871807392,10855170288,1920,7874101152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
2983408976,3667232,2987076208,7868098208,10855174416,25492928,7897258368,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
2987171408,3637776,2990809184,7889859728,10880668912,11806688,7905304192,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
2996262768,5728256,3001991024,7890487904,10892478928,2395648,7898611808,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
3002006256,240199456,3242205712,7652670176,10894875888,3943904,7896813536,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3242210576,2176672,3244387248,7654434080,10898821328,3916544,7660527296,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3244395360,3216,3244398576,7658341600,10902740176,5236320,7663581136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3244406384,3088,3244409472,7663568464,10907977936,5662944,7669234496,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3244420688,3776,3244424464,7669218272,10913642736,242114368,7911336416,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
3244467104,5552,3244472656,7911286752,11155759408,2167616,7913459920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
3244473312,2875520,3247348832,7910579504,11157928336,1920,7913456944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
3247358544,4768,3247363312,7910569088,11157932400,2912,7910576768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3247368800,8248896,3255617696,7902320752,11157938448,1504,7910571152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
3255642128,5584384,3261226512,7896715872,11157942384,47264,7902347520,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3261242768,3517104,3264759872,7893231760,11157991632,2756704,7899505568,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
3264791280,4240,3264795520,7895955792,11160751312,1984,7895962016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3264837248,4128,3264841376,7895914096,11160755472,7890016,7903808240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3264880768,3056,3264883824,7903763648,11168647472,5505440,7909272144,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
3264895408,3440192,3268335600,7905818912,11174154512,3673952,7912933056,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
3268354400,3568,3268357968,7909472672,11177830640,2592,7909478832,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3268362096,2397056,3270759152,7907075552,11177834704,2048,7909474656,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3270775536,3584,3270779120,7907062752,11177841872,55936,7907122272,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3270781040,34240064,3305021104,7872878112,11177899216,4036064,7911154240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
3305021632,143952,3305165584,7876772288,11181937872,1984,7876918224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
3305166720,12820208,3317986928,7863955072,11181942000,2423648,7879198928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
3318023456,4704,3318028160,7866339696,11184367856,1888,7866346288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3318069632,10271136,3328340768,7856031184,11184371952,34814112,7901116432,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3328373232,4432,3328377664,7890810352,11219188016,140544,7890955328,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3328379472,4208,3328383680,7890947632,11219331312,11914592,7902866432,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
3328384240,15700800,3344085040,7887163552,11231248592,1952,7902866304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
3344085840,5454672,3349540512,7881712208,11231252720,10789568,7897956448,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
3349554960,3584,3349558544,7892485088,11242043632,2112,7892490784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3349565104,3088,3349568192,7892479504,11242047696,960,7892483552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3349591824,3424,3349595248,7892454720,11242049968,16312800,7908770944,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3349623040,4640,3349627680,7908737488,11258365168,5469024,7914211152,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
3349646640,6560,3349653200,7914182272,11263835472,2144,7914190976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3349659152,3408,3349662560,7914177936,11263840496,1408,7914182752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
3349666688,4032,3349670720,7914173872,11263844592,1280,7914179184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3349676000,9264,3349685264,7914163456,11263848720,3296,7914176016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
3349690080,4416,3349694496,7914160368,11263854864,1440,7914166224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3349706848,6080,3349712928,7914146000,11263858928,4320,7914156400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
3349720000,3776,3349723776,7914141296,11263865072,1120,7914146192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
3349728608,3384080,3353112688,7910756480,11263869168,1600,7914142160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
3353117456,3856,3353121312,7910751952,11263873264,1504,7910757312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
3353126912,3968,3353130880,7910746480,11263877360,1248,7910751696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3353199920,3456,3353203376,7910678048,11263881424,25120,7910706624,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
3353229040,3450912,3356679952,7907228128,11263908080,3509536,7914188576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
3356698576,3504,3356702080,7910717264,11267419344,2432,7910723200,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3356706080,2420976,3359127056,7908296416,11267423472,1984,7910719376,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3359144912,3536,3359148448,7908279120,11267427568,48000,7908330656,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3359150528,24892992,3384043520,7883433424,11267476944,3441024,7911767440,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
3384044016,12199824,3396243840,7874676592,11270920432,3776,7886880192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
3396244448,4320,3396248768,7874677808,11270926576,2436416,7877118544,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
3396289552,2466112,3398755664,7874609056,11273364720,1856,7877077024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3398800160,3738544,3402538704,7870830112,11273368816,25923936,7900492592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3402629616,3678928,3406308544,7892986928,11299295472,11797920,7908463776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
3411393344,5711936,3417105280,7893990704,11311095984,2385056,7902087696,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
3417120208,240089808,3657210016,7656274000,11313484016,3934176,7900297984,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3657213696,2164704,3659378400,7658042896,11317421296,3955424,7664163024,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3659386144,3040,3659389184,7661990352,11321379536,5190528,7667183920,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3659396960,2752,3659399712,7667172016,11326571728,5673920,7672848688,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
3659410928,3568,3659414496,7672833296,11332247792,242693856,7915530720,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
3659450432,6176,3659456608,7915487408,11574944016,2174560,7917668144,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
3659457056,2746608,3662203664,7914917312,11577120976,1984,7917665904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
3662211552,4016,3662215568,7914909536,11577125104,2752,7914916304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3662221200,8087248,3670308448,7906820720,11577129168,1536,7914909504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
3670332848,5503296,3675836144,7901297120,11577133264,45664,7906846080,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3675853648,3804288,3679657936,7897522432,11577180368,2752608,7904079328,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
3679689168,5072,3679694240,7900241712,11579935952,1920,7900248704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3679736720,4640,3679741360,7900198688,11579940048,7985536,7908188864,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3679780544,2752,3679783296,7908145072,11587928368,5481344,7913629168,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
3679794624,3727696,3683522320,7909888896,11593411216,3706112,7917322704,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
3683541008,3632,3683544640,7913575088,11597119728,2560,7913581280,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3683548608,2423984,3685972592,7911151264,11597123856,2336,7913577584,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3685988768,3808,3685992576,7911135344,11597127920,47072,7911186224,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3685994432,34967904,3720962336,7876215760,11597178096,4002432,7915186096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
3720962912,140064,3721102976,7880079984,11601182960,1952,7880222000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
3721103632,12298432,3733402064,7867784736,11601186800,2423616,7882506784,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
3733435888,3968,3733439856,7870172032,11603611888,1888,7870177888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3733481504,10711008,3744192512,7859423472,11603615984,34343840,7904478320,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3744224464,3200,3744227664,7893734336,11637962000,140544,7893878080,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3744229264,2976,3744232240,7893873088,11638105328,11934080,7905810144,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
3744232656,15762384,3759995040,7890046032,11650041072,2144,7905810560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
3759995584,5480448,3765476032,7884569136,11650045168,10771616,7900821200,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
3765491776,3520,3765495296,7895324400,11660819696,2016,7895329936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3765501904,2816,3765504720,7895319072,11660823792,1056,7895322944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3765538512,3344,3765541856,7895286032,11660827888,16033728,7911323104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3765569888,4064,3765573952,7911289776,11676863728,5465600,7916759440,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
3765591072,3968,3765595040,7916735856,11682330896,1952,7916741776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3765603472,5520,3765608992,7916726000,11682334992,1440,7916732960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
3765614896,6048,3765620944,7916716992,11682337936,1312,7916724352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3765627056,7904,3765634960,7916706112,11682341072,3296,7916717312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
3765640384,3440,3765643824,7916703424,11682347248,1312,7916708176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
3765659920,7776,3765667696,7916683552,11682351248,4576,7916695904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
3765674848,6608,3765681456,7916676032,11682357488,1088,7916683728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
3765685936,3358880,3769044816,7913316768,11682361584,1632,7916677280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
3769050176,3632,3769053808,7913311872,11682365680,1472,7913316976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
3769061072,3280,3769064352,7913305424,11682369776,1280,7913309984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3769136304,3712,3769140016,7913233856,11682373872,26848,7913264416,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
3769165856,3364704,3772530560,7909871984,11682402544,3503616,7916740304,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
3772551552,3536,3772555088,7913353632,11685908720,2496,7913359664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3772559088,2490416,3775049504,7910863280,11685912784,1984,7913355680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
3775066480,3248,3775069728,7910847184,11685916912,47392,7910897824,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
3775071872,24828896,3799900768,7886065296,11685966064,3441888,7914336080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
3799901280,11832448,3811733728,7877676016,11689409744,3264,7889511728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
3811734336,5424,3811739760,7877676160,11689415920,2435552,7880117136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
3811784416,2342080,3814126496,7877726576,11691853072,1856,7880070512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
3814172640,3902688,3818075328,7873781808,11691857136,26544096,7904228592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
3818183280,3840704,3822023984,7896380352,11718404336,11803168,7912024224,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
3827260368,5660896,3832921264,7897288928,11730210192,2344192,7905294016,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
3832936320,240313328,4073249648,7659306432,11732556080,3879392,7903499152,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4073255056,2152864,4075407920,7661030080,11736438000,3889536,7667072480,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4075416160,3232,4075419392,7664910800,11740330192,5382944,7670296976,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4075427264,2672,4075429936,7670284480,11745714416,5676192,7675963344,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4075441104,3552,4075444656,7675947872,11751392528,241273408,7917224832,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
4075479744,9200,4075488944,7917178496,11992667440,2164000,7919351696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
4075489440,2746432,4078235872,7916598256,11994834128,1952,7919346640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
4078244656,5488,4078250144,7916588112,11994838256,2848,7916596448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4078258080,7811200,4086069280,7908774096,11994843376,1536,7916586832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
4086093296,5441424,4091534720,7903312624,11994847344,47232,7908801280,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4091551328,3555632,4095106960,7899789632,11994896592,2758016,7906103280,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
4095136960,4832,4095141792,7902515536,11997657328,2080,7902522448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4095182592,3664,4095186256,7902475136,11997661392,7871520,7910350320,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4095227344,3392,4095230736,7910305312,12005536048,5454944,7915763648,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
4095243456,4229696,4099473152,7911520752,12010993904,3469600,7919220048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
4099493856,3792,4099497648,7914967616,12014465264,2304,7914973712,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4099501888,2428768,4101930656,7912538704,12014469360,2080,7914969552,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4101949888,4288,4101954176,7912519280,12014473456,46176,7912569744,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4101956112,33892784,4135848896,7878673712,12014522608,3422656,7915989152,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
4135849648,208800,4136058448,7881888416,12017946864,1952,7882099168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
4136059264,12093008,4148152272,7869798688,12017950960,2425152,7884316848,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
4148192720,4048,4148196768,7872182096,12020378864,1888,7872188032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4148240304,10670112,4158910416,7861472576,12020382992,34162048,7906304736,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4158945024,4144,4158949168,7895598528,12054547696,139200,7895741872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4158951024,5744,4158956768,7895731504,12054688272,12332832,7908070080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
4158958112,15223056,4174181168,7892842944,12067024112,1952,7908067952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
4174181744,5468592,4179650336,7887377872,12067028208,10806528,7903652992,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
4179667904,3488,4179671392,7898166160,12077837552,1920,7898171568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4179678432,3264,4179681696,7898159920,12077841616,3072,7898166256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4179717152,4320,4179721472,7898126320,12077847792,15536672,7913667312,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4179750768,5344,4179756112,7913630912,12093387024,5629920,7919266176,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
4179774608,5312,4179779920,7919239072,12099018992,1920,7919246304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4179789488,6352,4179795840,7919227312,12099023152,1408,7919235072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
4179800672,4768,4179805440,7919221744,12099027184,1472,7919227984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4179810976,4736,4179815712,7919215568,12099031280,3360,7919223664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
4179823728,8208,4179831936,7919204464,12099036400,1312,7919213984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4179846576,8448,4179855024,7919185472,12099040496,4448,7919198368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
4179863792,6400,4179870192,7919176448,12099046640,1184,7919184032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
4179877024,3349632,4183226656,7915824048,12099050704,1824,7919175504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
4183232528,4288,4183236816,7915818016,12099054832,1632,7915823936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
4183244512,5040,4183249552,7915809376,12099058928,1280,7915815696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4183326688,3440,4183330128,7915732896,12099063024,25696,7915762032,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
4183356880,3447152,4186804032,7912287664,12099091696,3543520,7919278336,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
4186825936,3488,4186829424,7915807360,12102636784,2464,7915813312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4186833568,2415376,4189248944,7913391936,12102640880,2304,7915809616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4189265776,3760,4189269536,7913375408,12102644944,63616,7913442784,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4189271600,26073328,4215344928,7887365552,12102710480,3828128,7917267008,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
4215345536,12098864,4227444400,7879096896,12106541296,3296,7891199056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
4227445392,4864,4227450256,7879097184,12106547440,2443872,7881545920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
4227496960,2298288,4229795248,7879198528,12108993776,1888,7881498704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4229841008,3687968,4233528976,7875468896,12108997872,24936000,7904092864,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4233627648,3970032,4237597680,7896337664,12133935344,11814080,7912121776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
4243030608,5744480,4248775088,7896978208,12145753296,2352896,7905075584,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
4248791040,242388480,4491179520,7656927952,12148107472,3725216,7903041648,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4491195760,2151120,4493346880,7658487952,12151834832,3740704,7664379776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4493356256,3280,4493359536,7662219040,12155578576,5090944,7667313264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4493367232,3248,4493370480,7667301504,12160671984,5663328,7672968080,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4493387248,3792,4493391040,7672946736,12166337776,241822912,7914773440,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
4493462000,9328,4493471328,7914691280,12408162608,2157568,7916858176,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
4493473152,2684160,4496157312,7914165872,12410323184,1952,7916851984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
4496167824,5088,4496172912,7914154368,12410327280,2976,7914162432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4496181040,7913696,4504094736,7906236832,12410331568,1504,7914152032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
4504123424,5432384,4509555808,7900779408,12410335216,50112,7906261904,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4509576144,3473344,4513049488,7897337216,12410386704,2750304,7903560864,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
4513081040,5680,4513086720,7900052464,12413139184,1920,7900060064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4513130544,4320,4513134864,7900008416,12413143280,7919840,7907932576,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4513173744,2880,4513176624,7907888352,12421064976,5455904,7913347136,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
4513190224,4091328,4517281552,7909242336,12426523888,3468640,7916802304,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
4517301936,3584,4517305520,7912689728,12429995248,2368,7912695680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4517309664,2514256,4519823920,7910175424,12429999344,1984,7912691664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4519840912,4208,4519845120,7910158288,12430003408,48128,7910210624,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4519847008,33516368,4553363376,7876691264,12430054640,3424576,7913632208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
4553364000,159136,4553523136,7879958832,12433481968,1952,7880119920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
4553523808,12646384,4566170192,7867315904,12433486096,2426240,7882388528,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
4566207952,4416,4566212368,7869701600,12435913968,1856,7869707872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4566256128,10383984,4576640112,7859277952,12435918064,33735648,7903397584,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4576672448,4336,4576676784,7892980064,12469656848,140768,7893125168,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4576678800,4368,4576683168,7893115984,12469799152,12803680,7905924032,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
4576684032,15657696,4592341728,7890262608,12482604336,2176,7905922480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
4592342448,5633152,4597975600,7884632768,12482608368,10379136,7900645056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
4597989904,3024,4597992928,7894996752,12492989680,1952,7895001728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4597999840,2912,4598002752,7894991024,12492993776,864,7894994800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4598031824,3056,4598034880,7894961040,12492995920,15888288,7910852384,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4598061184,3136,4598064320,7910822960,12508887280,5504480,7916330576,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
4598081296,5824,4598087120,7916306208,12514393328,2112,7916314144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4598093584,2992,4598096576,7916300848,12514397424,1408,7916305248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
4598100944,2544,4598103488,7916298032,12514401520,1280,7916301856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4598108304,3696,4598112000,7916293616,12514405616,3744,7916301056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
4598116576,3968,4598120544,7916291184,12514411728,1344,7916296496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4598130640,9424,4598140064,7916274480,12514414544,4896,7916288800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
4598150000,5136,4598155136,7916266768,12514421904,1088,7916272992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
4598160384,3561408,4601721792,7912704304,12514426096,1632,7916267344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
4601727440,3792,4601731232,7912698960,12514430192,1760,7912704512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
4601738416,3520,4601741936,7912692352,12514434288,1248,7912697120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4601816720,3664,4601820384,7912617968,12514438352,34208,7912655840,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
4601846720,3805840,4605652560,7908822688,12514475248,3824608,7916453136,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
4605672624,3472,4605676096,7912626864,12518302960,2528,7912632864,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4605680192,2414656,4608094848,7910212208,12518307056,2016,7912628880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4608112192,3792,4608115984,7910195168,12518311152,47136,7910246096,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4608118208,24990336,4633108544,7885251728,12518360272,3841696,7914083760,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
4633109008,12397152,4645506160,7876697184,12522203344,3968,7889098304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
4645506720,3888,4645510608,7876698944,12522209552,2437024,7879139856,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
4645554736,2307552,4647862288,7876786400,12524648688,1888,7879095840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4647908688,3681936,4651590624,7873062192,12524652816,24963488,7901707616,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4651699728,3762032,4655461760,7894156144,12549617904,12417312,7910335488,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
4661047072,5710176,4666757248,7895281008,12562038256,2346336,7903337520,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
4666774192,241392784,4908166976,7656220080,12564387056,3717536,7901330400,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4908174112,2158544,4910332656,7657773568,12568106224,3741536,7663673648,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4910340992,3536,4910344528,7661504512,12571849040,5525152,7667033200,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4910352144,2864,4910355008,7667021488,12577376496,5689024,7672713376,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
4910367232,3424,4910370656,7672696208,12583066864,242627456,7915327088,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
4910413088,8464,4910421552,7915274080,12825695632,2167232,7917449776,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
4910422000,2728704,4913150704,7914714624,12827865328,1984,7917445312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
4913160768,4720,4913165488,7914703968,12827869456,2976,7914711664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
4913172560,7916720,4921089280,7906784464,12827873744,1504,7914702688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
4921117184,5426288,4926543472,7901334144,12827877616,47264,7906807696,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4926560624,3453472,4930014096,7897912640,12827926736,2752640,7904118752,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
4930044928,4496,4930049424,7900631904,12830681328,1952,7900638352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4930092096,4160,4930096256,7900589168,12830685424,7922240,7908515568,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4930135168,2944,4930138112,7908472080,12838610192,5462688,7913937712,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
4930149472,3333648,4933483120,7910591072,12844074192,3470944,7917395664,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
4933504144,3568,4933507712,7914038896,12847546608,2432,7914044896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4933511808,2401376,4935913184,7911637520,12847550704,2112,7914041008,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
4935929376,4480,4935933856,7911620944,12847554800,47168,7911672592,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4935935808,33591248,4969527056,7878077920,12847604976,3418752,7915087920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
4969527616,142640,4969670256,7881354880,12851025136,1952,7881499472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
4969670896,12772720,4982443616,7868585616,12851029232,2467008,7883825344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
4982479424,3920,4982483344,7871014752,12853498096,2080,7871020752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
4982524816,10275824,4992800640,7860701552,12853502192,34443328,7905420704,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
4992833440,3744,4992837184,7895111376,12887948560,140224,7895255344,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
4992838928,4864,4992843792,7895248096,12888091888,11968896,7907221856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
4992844512,15738864,5008583376,7891480064,12900063440,2208,7907221136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5008584112,5500080,5014084192,7885983344,12900067536,10367680,7901851104,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
5014099904,2976,5014102880,7896333712,12910436592,1952,7896338640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5014109104,2928,5014112032,7896328656,12910440688,832,7896332416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5014138880,4560,5014143440,7896299360,12910442800,15742528,7912046448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5014169856,5792,5014175648,7912012112,12926187760,5472992,7917490896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
5014195104,4288,5014199392,7917462640,12931662032,1984,7917468912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5014206288,6832,5014213120,7917453040,12931666160,1440,7917461312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
5014217936,4896,5014222832,7917447424,12931670256,3712,7917456032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5014228768,7920,5014236688,7917439712,12931676400,3456,7917451088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5014241648,5712,5014247360,7917435088,12931682448,1344,7917442144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5014260144,7968,5014268112,7917418528,12931686640,4352,7917430848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
5014275904,3952,5014279856,7917412928,12931692784,1120,7917418000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
5014285120,3681328,5017966448,7913730432,12931696880,1664,7917413424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
5017971200,19552,5017990752,7913710224,12931700976,1504,7913731280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5017996416,30144,5018026560,7913678576,12931705136,1280,7913710000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5018098800,5344,5018104144,7913605024,12931709168,25920,7913636288,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
5018135168,3778832,5021914000,7909823936,12931737936,3556960,7917159728,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
5021935264,3312,5021938576,7913358688,12935297264,2464,7913364464,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5021942544,2419392,5024361936,7910939424,12935301360,2208,7913361024,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5024378496,3200,5024381696,7910923760,12935305456,48480,7910975440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5024383824,24925392,5049309216,7886046544,12935355760,4213088,7915185024,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
5049309856,12452640,5061762496,7877808976,12939571472,3584,7890265200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5061763120,4320,5061767440,7877810144,12939577584,2431296,7880245760,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
5061808784,2304256,5064113040,7877897600,12942010640,1888,7880203744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5064163072,3670128,5067833200,7874181504,12942014704,24939456,7902791088,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5067937424,3624112,5071561536,7895394736,12966956272,12481600,7911500448,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
5077065152,5677552,5082742704,7896699168,12979441872,2345504,7904722224,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
5082758608,240696032,5323454640,7658335296,12981789936,3715584,7902746912,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5323463456,2159600,5325623056,7659883968,12985507024,3743616,7665787184,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5325632224,3456,5325635680,7663617168,12989252848,5140192,7668760816,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5325643632,3312,5325646944,7668748432,12994395376,5886496,7674638240,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5325659968,4432,5325664400,7674620064,13000284464,243240192,7917864688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
5325716768,7872,5325724640,7917802832,13243527472,2167936,7919978640,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
5325725424,2729152,5328454576,7917243712,13245698288,1952,7919974816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
5328466304,5568,5328471872,7917230480,13245702352,2784,7917238832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5328479744,8462464,5336942208,7908764272,13245706480,1536,7917228272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5336973168,5499136,5342472304,7903238272,13245710576,47040,7908784448,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5342492176,3465536,5345957712,7899803008,13245760720,2864192,7906132736,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
5345988320,3984,5345992304,7902634624,13248626928,1888,7902640496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5346036992,3856,5346040848,7902590176,13248631024,7919136,7910513168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5346082384,2992,5346085376,7910466320,13256551696,5460800,7915930112,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
5346104944,3333264,5349438208,7912575600,13262013808,3467264,7919376128,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
5349460272,3504,5349463776,7916019216,13265482992,2336,7916025056,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5349467888,2395360,5351863248,7913623808,13265487056,2080,7916021248,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5351880144,4112,5351884256,7913606928,13265491184,46144,7913657184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5351887056,34268032,5386155088,7879385248,13265540336,3419168,7917072448,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
5386155776,141552,5386297328,7882665184,13268962512,1984,7882808720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5386298912,12727552,5399026464,7869940176,13268966640,2430464,7885098192,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
5399061632,4512,5399066144,7872333520,13271399664,1888,7872339920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5399110544,10280832,5409391376,7862012384,13271403760,34480480,7906773696,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5409425840,4128,5409429968,7896457024,13305886992,140800,7896601952,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5409431760,3632,5409435392,7896594672,13306030064,11942176,7908540480,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
5409435904,15682784,5425118688,7892855536,13317974224,2464,7908540784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5425119232,5460704,5430579936,7887398416,13317978352,10435040,7903294160,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
5430594704,3392,5430598096,7897816864,13328414960,1920,7897822176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5430605152,2912,5430608064,7897811120,13328419184,896,7897814928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5430637760,2992,5430640752,7897782432,13328423184,15770560,7913555984,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5430669296,5296,5430674592,7913522288,13344196880,5478400,7919005984,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
5430692608,4752,5430697360,7918980960,13349678320,1920,7918987632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5430704592,6064,5430710656,7918971760,13349682416,1440,7918979264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
5430716704,6592,5430723296,7918963184,13349686480,1344,7918971120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5430729232,5712,5430734944,7918955632,13349690576,3424,7918964768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5430740016,8624,5430748640,7918948112,13349696752,1344,7918958080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5430765264,8048,5430773312,7918927536,13349700848,4288,7918939872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
5430782160,4480,5430786640,7918920352,13349706992,1088,7918925920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
5430790880,3363024,5434153904,7915557184,13349711088,1632,7918921840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
5434159440,3440,5434162880,7915552304,13349715184,1472,7915557216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5434173248,3232,5434176480,7915542832,13349719312,1440,7915547504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5434249024,3952,5434252976,7915470368,13349723344,25152,7915499472,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
5434278272,4237712,5438515984,7911234016,13349750000,3505472,7918977200,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
5438536720,3536,5438540256,7914716944,13353257200,2432,7914722912,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5438544240,2422000,5440966240,7912295056,13353261296,1984,7914719040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5440982816,4608,5440987424,7912277936,13353265360,47424,7912329968,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5440990144,24870544,5465860688,7887453824,13353314512,4290496,7916614864,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
5465861488,12359840,5478221328,7879388448,13357609776,5088,7891753376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5478221968,3504,5478225472,7879391920,13357617392,2470944,7881866368,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
5478268192,2376608,5480644800,7879446576,13360091376,1920,7881825104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5480692928,3666048,5484358976,7875736496,13360095472,24951584,7904354128,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5484459744,3633120,5488092864,7896955472,13385048336,12361888,7912950480,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
5493161744,5827744,5498989488,7898424448,13397413936,2352704,7906604896,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
5499004528,241787904,5740792432,7658976896,13399769328,3794400,7904559200,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5740797952,2160816,5742958768,7660607552,13403566320,3743264,7666511632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5742967360,3296,5742970656,7664340400,13407311056,5097024,7669440720,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5742978192,3040,5742981232,7669428448,13412409680,5794272,7675225760,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
5742993344,3616,5742996960,7675209488,13418206448,242996160,7918209264,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
5743037280,5984,5743043264,7918162512,13661205776,2172704,7920341200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
5743043904,2732480,5745776384,7917604304,13663380688,1984,7920338768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
5745785808,5056,5745790864,7917593952,13663384816,2752,7917601760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5745797776,7804032,5753601808,7909787104,13663388912,1536,7917592672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5753628240,5424576,5759052816,7904340192,13663393008,45984,7909810752,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5759069728,3450272,5762520000,7900920240,13663440240,2770784,7907141296,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
5762553232,3936,5762557168,7903655904,13666213072,2016,7903661856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5762599360,4016,5762603376,7903613888,13666217264,7897696,7911515600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5762642464,3136,5762645600,7911470768,13674116368,5469888,7916943792,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
5762656896,3334304,5765991200,7913596336,13679587536,3478528,7920409168,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
5766011552,3504,5766015056,7917053088,13683068144,2336,7917058928,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5766019104,2404016,5768423120,7914649216,13683072336,2176,7917055408,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5768439936,4720,5768444656,7914631872,13683076528,47104,7914683696,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5768446528,34209936,5802656464,7880469120,13683125584,3417632,7918096688,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
5802656992,142672,5802799664,7883744928,13686544592,1952,7883889552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5802800960,11883568,5814684528,7871864192,13686548720,2435296,7886183056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
5814721504,4272,5814725776,7874260096,13688985872,1920,7874266288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5814767856,10265264,5825033120,7863956784,13688989904,35071936,7909293984,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5825065312,4000,5825069312,7898994736,13724064048,140832,7899139568,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5825071040,4032,5825075072,7899131248,13724206320,11934080,7911069360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
5825075664,15700928,5840776592,7895366592,13736143184,2208,7911069728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5840777408,5464496,5846241904,7889905280,13736147184,10473696,7905843472,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
5846256736,3344,5846260080,7900363648,13746623728,1920,7900368912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5846266816,3264,5846270080,7900357712,13746627792,864,7900361840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5846293536,4256,5846297792,7900332144,13746629936,15780192,7916116592,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5846323424,5328,5846328752,7916083008,13762411760,5487200,7921575536,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
5846348960,4640,5846353600,7921547920,13767901520,2016,7921554576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5846359328,3696,5846363024,7921542592,13767905616,1440,7921547728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
5846367536,4176,5846371712,7921537904,13767909616,1312,7921543392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5846376480,4560,5846381040,7921532768,13767913808,3488,7921540816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5846386128,5248,5846391376,7921528480,13767919856,1312,7921535040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
5846403792,7792,5846411584,7921512368,13767923952,4704,7921524864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
5846418752,4800,5846423552,7921506640,13767930192,1120,7921512560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
5846428176,3385728,5849813904,7918120320,13767934224,1632,7921507680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
5849818608,3216,5849821824,7918116560,13767938384,1536,7918121312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
5849829808,3296,5849833104,7918109376,13767942480,1312,7918113984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5849901344,3584,5849904928,7918041552,13767946480,26112,7918071248,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
5849930176,3383456,5853313632,7914661520,13767975152,3522240,7921567216,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
5853333744,3632,5853337376,7918162352,13771499728,2336,7918168320,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5853341488,2802640,5856144128,7915359728,13771503856,1984,7918164352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
5856160656,4048,5856164704,7915343248,13771507952,47360,7915394656,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
5856166800,25350048,5881516848,7890040640,13771557488,3504160,7918894848,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
5881517440,11849744,5893367184,7881696128,13775063312,3200,7893549072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
5893367776,4416,5893372192,7881697264,13775069456,2750464,7884452144,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
5893412624,2454832,5895867456,7881954672,13777822128,1888,7884411392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
5895914592,3785808,5899700400,7878125632,13777826032,25831808,7907743248,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
5899793728,3810016,5903603744,7900055792,13803659536,12180320,7916046128,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
5908824880,5683632,5914508512,7901334544,13815843056,2370304,7909388480,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
5914523360,241787536,6156310896,7661904768,13818215664,3851904,7907544208,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6156321488,2161648,6158483136,7663586864,13822070000,3824896,7669573408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6158492016,3632,6158495648,7667402032,13825897680,5097152,7672502816,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6158503184,2768,6158505952,7672490256,13830996208,5708416,7678201440,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6158519168,3440,6158522608,7678184544,13836707152,243821344,7922009328,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
6158575856,6992,6158582848,7921947856,14080530704,2179040,7924133888,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
6158583328,2722128,6161305456,7921406304,14082711760,1920,7924130352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
6161317328,5680,6161323008,7921392976,14082715984,2752,7921401408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6161330256,7891632,6169221888,7913498224,14082720112,1632,7921391488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
6169252832,5433936,6174686768,7908037312,14082724080,49440,7913520688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6174705776,3459968,6178165744,7904609536,14082775280,2768608,7910838112,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
6178198160,5280,6178203440,7907341760,14085545200,1888,7907348928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6178250704,3232,6178253936,7907295360,14085549296,8041856,7915340448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6178300896,2896,6178303792,7915289088,14093592880,5523488,7920815472,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
6178317616,3333600,6181651216,7917468096,14099119312,3508768,7924310464,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
6181672848,3808,6181676656,7920953056,14102629712,2336,7920959200,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6181680736,2402320,6184083056,7918550656,14102633712,2016,7920954992,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6184102592,3936,6184106528,7918531408,14102637936,45984,7918581328,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6184108640,34871584,6218980224,7883705712,14102685936,3415424,7921992720,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
6218980960,143328,6219124288,7886979728,14106104016,1952,7887125008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
6219125776,11922048,6231047824,7875060320,14106108144,2435424,7889417792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
6231086784,6128,6231092912,7877453376,14108546288,1888,7877461392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6231138784,10682672,6241821456,7866728928,14108550384,34749824,7912161424,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6241855760,4672,6241860432,7901442496,14143302928,139584,7901586752,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6241862224,4896,6241867120,7901577056,14143444176,12637024,7914218976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
6241868016,16289184,6258157200,7897926240,14156083440,2208,7914217632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
6258157968,5467376,6263625344,7892462192,14156087536,10553792,7908483360,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
6263640080,3472,6263643552,7903000400,14166643952,1920,7903005792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6263650832,3136,6263653968,7902994080,14166648048,2944,7903000160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6263684368,3520,6263687888,7902964384,14166652272,15802976,7918770880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6263715600,5712,6263721312,7918735216,14182456528,5484832,7924225760,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
6263739840,4832,6263744672,7924198480,14187943152,1952,7924205264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6263751232,6320,6263757552,7924189696,14187947248,1440,7924197456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
6263763392,4016,6263767408,7924184032,14187951440,1632,7924189680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6263772704,5136,6263777840,7924177600,14187955440,3232,7924185968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
6263783808,3840,6263787648,7924174096,14187961744,1376,7924179312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6263798496,9376,6263807872,7924157904,14187965776,4896,7924172176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
6263817712,4112,6263821824,7924150160,14187971984,1344,7924155616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
6263826240,3377216,6267203456,7920772560,14187976016,1632,7924151408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
6267209088,3664,6267212752,7920767232,14187979984,1504,7920772400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
6267218640,4224,6267222864,7920761248,14187984112,1280,7920766752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6267296848,3312,6267300160,7920688272,14187988432,28864,7920720448,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
6267327648,3458704,6270786352,7917232576,14188018928,3517408,7924208688,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
6270807888,3360,6270811248,7920727264,14191538512,2496,7920733120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6270815232,2419168,6273234400,7918308112,14191542512,1952,7920729232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6273251424,3968,6273255392,7918291312,14191546704,49504,7918344784,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6273257600,25812640,6299070240,7892528688,14191598928,3880416,7922221744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
6299070752,11813744,6310884496,7884596320,14195480816,3968,7896414032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
6310885152,3616,6310888768,7884598192,14195486960,2623360,7887225168,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
6310931472,2333712,6313265184,7884847408,14198112592,1888,7887183008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6313309840,3870912,6317180752,7880935840,14198116592,25732096,7910538848,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6317275360,3877552,6321152912,7902697824,14223850736,12178304,7918753680,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
6326395024,5665520,6332060544,7903971952,14236032496,2502656,7912140128,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
6332076240,240197056,6572273296,7666264448,14238537744,3782816,7910244320,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6572279072,2168256,6574447328,7667875312,14242322640,3773120,7673816688,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6574455952,3248,6574459200,7671637904,14246097104,5226624,7676867776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6574466752,2752,6574469504,7676856176,14251325680,5718816,7682577744,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6574481376,3120,6574484496,7682561312,14257045808,245704832,7928269264,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
6574522064,10048,6574532112,7928220544,14502752656,2174368,7930404960,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
6574532720,2738048,6577270768,7927658720,14504929488,1984,7930398752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
6577279504,5376,6577284880,7927648736,14504933616,2944,7927657056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6577291696,7802224,6585093920,7919843952,14504937872,1536,7927647712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
6585118576,5435712,6590554288,7914387520,14504941808,47296,7919870528,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6590571168,3462848,6594034016,7910956912,14504990928,2773440,7917193200,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
6594063712,4176,6594067888,7913698208,14507766096,1952,7913704336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6594110608,5904,6594116512,7913653712,14507770224,8355648,7922015264,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6594154912,3600,6594158512,7921970624,14516129136,5595744,7927569968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
6594169920,3350304,6597520224,7924207024,14521727248,3582016,7931139344,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
6597539136,3600,6597542736,7927768448,14525311184,2336,7927774384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6597546848,2405184,6599952032,7925363280,14525315312,2016,7927770480,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6599969152,4560,6599973712,7925345792,14525319504,45600,7925395952,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6599975584,33829888,6633805472,7891561072,14525366544,3429056,7928820016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
6633806032,175568,6633981600,7894816432,14528798032,1984,7894993984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
6633982224,12457280,6646439504,7882362528,14528802032,2428384,7897248192,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
6646481008,5088,6646486096,7884745888,14531231984,1984,7884752960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6646528112,10516608,6657044720,7874191392,14531236112,34769312,7919477312,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6657077248,3440,6657080688,7908926432,14566007120,140896,7909070768,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6657082320,7184,6657089504,7909060976,14566150480,12833760,7921901920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
6657089936,15362736,6672452672,7906534544,14578987216,1952,7921899232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
6672453664,5615440,6678069104,7900922240,14578991344,10459904,7916997584,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
6678083760,3360,6678087120,7911365472,14589452592,1952,7911370784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6678095232,3056,6678098288,7911358336,14589456624,864,7911362256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6678121552,2880,6678124432,7911334688,14589459120,15787264,7927124832,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6678150000,3376,6678153376,7927095376,14605248752,5485600,7932584352,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
6678165232,3792,6678169024,7932567472,14610736496,1952,7932573216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6678174992,3008,6678178000,7932562464,14610740464,1472,7932566944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
6678181984,3264,6678185248,7932559408,14610744656,1312,7932563984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6678189792,4400,6678194192,7932554560,14610748752,3552,7932562512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
6678198608,3456,6678202064,7932552736,14610754800,1344,7932557536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6678211984,5968,6678217952,7932541040,14610758992,4800,7932551808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
6678223552,3360,6678226912,7932538160,14610765072,1120,7932542640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
6678231568,3575024,6681806592,7928962640,14610769232,1632,7932539296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
6681811456,3120,6681814576,7928958752,14610773328,1472,7928963344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
6681819888,4432,6681824320,7928953008,14610777328,1376,7928958816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6681888832,5104,6681893936,7928887584,14610781520,27456,7928920144,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
6681918944,3786976,6685705920,7925104336,14610810256,3513824,7932405136,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
6685728432,4176,6685732608,7928594000,14614326608,2656,7928600832,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6685736672,2417456,6688154128,7926176480,14614330608,1952,7928595888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
6688170768,4112,6688174880,7926159920,14614334800,54208,7926218240,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
6688177056,26000224,6714177280,7900214768,14614392048,4344608,7930559600,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
6714178192,12033536,6726211728,7892526240,14618737968,4000,7904563776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
6726212416,5840,6726218256,7892525888,14618744144,2452704,7894984432,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
6726263280,2307232,6728570512,7892628096,14621198608,1856,7894937184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
6728619216,3665136,6732284352,7888918320,14621202672,25020704,7917604160,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
6732387152,3863344,6736250496,7909974608,14646225104,12401824,7926239776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
6741690912,5725680,6747416592,7911213216,14658629808,2358784,7919297680,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
6747431696,239621136,6987052832,7673938384,14660991216,3720512,7917280032,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6987056704,2159792,6989216496,7675497056,14664713552,3752288,7681409136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6989224736,3392,6989228128,7679239280,14668467408,5166208,7684408880,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6989235808,2688,6989238496,7684398192,14673636688,5912992,7690313872,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
6989248816,3344,6989252160,7690300080,14679552240,243265760,7933569184,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
6989288528,5952,6989294480,7933525408,14922819888,2181408,7935712768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
6989294992,2741440,6992036432,7932966592,14925003024,1984,7935710016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
6992044784,4256,6992049040,7932958048,14925007088,2944,7932965248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
6992056096,7828240,6999884336,7925127008,14925011344,1504,7932956752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
6999907424,5439088,7005346512,7919668768,14925015280,45504,7925153360,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7005362304,3476224,7008838528,7916224848,14925063376,2772544,7922473616,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
7008867744,4288,7008872032,7918966416,14927838448,1888,7918972592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7008912544,3632,7008916176,7918926336,14927842512,7908448,7926838416,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7008956144,2752,7008958896,7926794208,14935753104,5470688,7932267648,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
7008970896,3336768,7012307664,7928918560,14941226224,3486752,7935742080,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
7012328992,3440,7012332432,7932383680,14944716112,2336,7932389456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7012336384,2645664,7014982048,7929738064,14944720112,1952,7932385680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7014998224,3168,7015001392,7929722912,14944724304,46944,7929773024,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7015003200,34067136,7049070336,7895704240,14944774576,3429888,7933201264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
7049070928,140496,7049211424,7898994416,14948205840,1952,7899136864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7049212080,12770800,7061982880,7886226992,14948209872,2433824,7901431616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
7062019248,4304,7062023552,7888621456,14950645008,1856,7888627616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7062063792,10292352,7072356144,7878293024,14950649168,34601024,7923186400,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7072387568,4080,7072391648,7912860496,14985252144,140448,7913005024,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7072393312,4112,7072397424,7912996992,14985394416,12787328,7925788432,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
7072398064,15671552,7088069616,7910113504,14998183120,1952,7925787008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7088070432,5512912,7093583344,7904603904,14998187248,10507648,7920624464,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
7093596752,3088,7093599840,7915097744,15008697584,1920,7915102752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7093606128,2880,7093609008,7915092800,15008701808,832,7915096512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7093631696,4848,7093636544,7915067664,15008704208,15794528,7930867040,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7093661840,5856,7093667696,7930833280,15024500976,5490432,7936329568,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
7093686384,7424,7093693808,7936298912,15029992720,2080,7936308416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7093699696,3312,7093703008,7936293808,15029996816,1440,7936298560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7093706912,5824,7093712736,7936288176,15030000912,3392,7936297392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7093717552,5248,7093722800,7936284224,15030007024,3488,7936292960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7093727600,4640,7093732240,7936280928,15030013168,1312,7936286880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7093742736,5232,7093747968,7936269296,15030017264,4608,7936279136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
7093753216,4880,7093758096,7936265280,15030023376,1120,7936271280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7093762704,3639856,7097402560,7932624944,15030027504,1664,7936266464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
7097407264,9408,7097416672,7932614928,15030031600,1472,7932625808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7097422384,10256,7097432640,7932603056,15030035696,1280,7932614592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7097497648,36288,7097533936,7932505856,15030039792,26944,7932569088,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
7097558368,3947872,7101506240,7928562224,15030068464,3510464,7936020560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
7101528944,3520,7101532464,7932048288,15033580752,2432,7932054240,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7101536592,2415824,7103952416,7929632432,15033584848,2016,7932050272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7103970496,4240,7103974736,7929614208,15033588944,47936,7929666384,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7103979248,24840160,7128819408,7904819744,15033639152,4327456,7933987360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
7128820160,12402896,7141223056,7896745600,15037968656,3584,7909152080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7141223824,4192,7141228016,7896746784,15037974800,2438464,7899189440,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
7141276752,2292016,7143568768,7896847216,15040415984,1856,7899141088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7143623120,3653136,7147276256,7893143824,15040420080,24980000,7921776960,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7147384720,3633232,7151017952,7914383760,15065401712,12355584,7930372576,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
7156533776,5683504,7162217280,7915544240,15077761520,2391040,7923618784,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
7162232272,242216400,7404448672,7675706800,15080155472,3754496,7921677696,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7404462752,2165984,7406628736,7677283664,15083912400,3751616,7683201264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7406639280,3456,7406642736,7681022656,15087665392,5103328,7686129440,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7406651376,3200,7406654576,7686115424,15092770000,5872896,7691991520,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7406674176,3472,7406677648,7691967168,15098644816,243853824,7935824464,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
7406792976,12672,7406805648,7935694464,15342500112,2173248,7937880384,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
7406806112,2635568,7409441680,7935233344,15344675024,1920,7937870832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
7409455984,5824,7409461808,7935217344,15344679152,2944,7935226112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7409472464,7827936,7417300400,7927382976,15344683376,1504,7935212416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7417356112,5407488,7422763600,7921923744,15344687344,45984,7927377216,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7422789296,3443936,7426233232,7918501408,15344734640,2776768,7924722112,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
7426270432,4496,7426274928,7921237792,15347512720,1888,7921244176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7426330976,3552,7426334528,7921182128,15347516656,7939712,7929125392,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7426389472,3984,7426393456,7929065408,15355458864,5468864,7934538256,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
7426407904,3291648,7429699552,7931229456,15360929008,3482720,7938003824,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
7429720096,3600,7429723696,7934690016,15364413712,2432,7934696048,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7429727952,2401216,7432129168,7932288608,15364417776,2144,7934691968,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7432147600,3952,7432151552,7932270320,15364421872,46048,7932320320,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7432154192,34858752,7467012944,7897457056,15364470000,3435008,7935750816,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
7467013632,144624,7467158256,7900748288,15367906544,1920,7900894832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7467159168,11881472,7479040640,7888870000,15367910640,2439200,7903190672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
7479081632,4208,7479085840,7891266016,15370351856,1920,7891272144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7479132288,10274656,7489406944,7880949008,15370355952,34622048,7925845712,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7489441600,4000,7489445600,7915534928,15404980528,142464,7915681392,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7489447312,5312,7489452624,7915672320,15405124944,12814048,7928491680,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
7489453088,15689456,7505142544,7912798688,15417941232,1984,7928490128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7505143104,5524048,7510667152,7907278176,15417945328,10463552,7923265776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
7510683168,3072,7510686240,7917724464,15428410704,1952,7917729488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7510694448,3184,7510697632,7917717168,15428414800,864,7917721216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7510737328,4672,7510742000,7917676832,15428418832,15803776,7933485280,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7510774336,5184,7510779520,7933445744,15444225264,5480064,7938930992,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
7510797568,9520,7510807088,7938900768,15449707856,1920,7938912208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7510818192,6000,7510824192,7938887760,15449711952,1472,7938895232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7510834160,5776,7510839936,7938876016,15449715952,1312,7938883104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7510845088,6992,7510852080,7938868064,15449720144,3552,7938878608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7510858656,5680,7510864336,7938861856,15449726192,1344,7938868880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7510891344,8096,7510899440,7938830848,15449730288,4480,7938843424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
7510912320,8656,7510920976,7938815616,15449736592,1088,7938825360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7510926112,3347008,7514273120,7935467376,15449740496,1632,7938816016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
7514278400,3488,7514281888,7935462960,15449744848,1504,7935467952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7514289168,4960,7514294128,7935454688,15449748816,1280,7935460928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7514381488,3344,7514384832,7935367984,15449752816,25952,7935397280,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
7514411104,4188768,7518599872,7931181616,15449781488,3512480,7938882864,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
7518622256,3328,7518625584,7934670368,15453295952,2400,7934676096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7518629680,2424736,7521054416,7932245504,15453299920,2176,7934672416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7521071216,4288,7521075504,7932228640,15453304144,47104,7932280032,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7521078000,25207904,7546285904,7907068352,15453354256,4206304,7936482560,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
7546286944,12455456,7558742400,7898820496,15457562896,3264,7911279216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7558743184,4384,7558747568,7898821472,15457569040,2482784,7901308640,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
7558793792,2305520,7561099312,7898955040,15460054352,1888,7901262448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7561151488,3665216,7564816704,7895241744,15460058448,24982208,7923889168,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7564912816,3691568,7568604384,7916437552,15485041936,12379232,7932508352,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
7573762864,5813600,7579576464,7917848864,15497425328,2372352,7926034816,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
7579591184,240910720,7820501904,7679297888,15499799792,3764256,7923972864,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7820506720,2152560,7822659280,7680906752,15503566032,3745824,7686805136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7822667424,3248,7822670672,7684644224,15507314896,5102048,7689749520,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7822678816,3232,7822682048,7689736592,15512418640,5740512,7695480336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
7822694960,3328,7822698288,7695463616,15518161904,243390656,7938857600,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
7822740064,10224,7822750288,7938803584,15761553872,2179552,7940993360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
7822750768,2749296,7825500064,7938235696,15763735760,1984,7940986976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
7825508544,4608,7825513152,7938226736,15763739888,2848,7938234192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7825519424,7836528,7833355952,7930388096,15763744048,1504,7938226128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7833387808,5421408,7838809216,7924938832,15763748048,46464,7930406704,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7838825824,3462656,7842288480,7921507824,15763796304,2774592,7927745072,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
7842318608,3872,7842322480,7924250816,15766573296,1920,7924256608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7842364000,3024,7842367024,7924210368,15766577392,7937408,7932150800,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7842406240,3232,7842409472,7932108080,15774517552,5466464,7937577776,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
7842421040,3344848,7845765888,7934219760,15779985648,3486240,7941050848,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
7845786992,3920,7845790912,7937683600,15783474512,2400,7937689920,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7845795104,2401632,7848196736,7935281872,15783478608,2016,7937685520,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7848213376,4752,7848218128,7935264480,15783482608,45856,7935315088,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7848220272,34252944,7882473216,7901057648,15783530864,3417632,7938728224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
7882473856,141408,7882615264,7904334576,15786949840,1952,7904477936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7882616224,11866480,7894482704,7892471264,15786953968,2433792,7906771536,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
7894523184,5408,7894528592,7894861472,15789390064,1856,7894868736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7894571744,10267072,7904838816,7884555344,15789394160,34660288,7929482704,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7904871072,4368,7904875440,7919182176,15824057616,140576,7919327120,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7904877040,2960,7904880000,7919320944,15824200944,12779424,7932103328,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
7904880432,15702960,7920583392,7916399088,15836982480,2496,7932104544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7920583920,5465408,7926049328,7910937280,15836986608,10441280,7926843968,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
7926063744,3600,7926067344,7921362112,15847429456,2016,7921367728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7926074176,3344,7926077520,7921356032,15847433552,2912,7921362288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7926107760,4560,7926112320,7921327280,15847439600,15823232,7937155072,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7926141568,6848,7926148416,7937116080,15863264496,5483136,7942606064,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
7926164704,4656,7926169360,7942580832,15868750192,1920,7942587408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7926176912,5136,7926182048,7942572112,15868754160,1440,7942578688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7926187376,6320,7926193696,7942564656,15868758352,3424,7942574400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7926199664,5360,7926205024,7942559344,15868764368,3296,7942568000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7926209904,5856,7926215760,7942554880,15868770640,1344,7942562080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
7926229792,7264,7926237056,7942537712,15868774768,4416,7942549392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
7926244224,5024,7926249248,7942531600,15868780848,1088,7942537712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
7926254416,3377264,7929631680,7939153328,15868785008,1632,7942532224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
7929636672,3216,7929639888,7939149088,15868788976,1504,7939153808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
7929645696,3840,7929649536,7939143536,15868793072,1280,7939148656,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7929720336,3296,7929723632,7939073664,15868797296,26336,7939103296,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
7929749328,3391392,7933140720,7935685120,15868825840,3516480,7942592992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
7933163216,3584,7933166800,7939178528,15872345328,2336,7939184448,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7933170800,2789456,7935960256,7936389168,15872349424,2016,7939180640,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
7935976976,4352,7935981328,7936372192,15872353520,47872,7936424416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
7935983584,25276112,7961259696,7911143040,15872402736,3900736,7940319888,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
7961260192,11802160,7973062352,7903242880,15876305232,1952,7915046992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
7973063280,4688,7973067968,7903241264,15876309232,2704032,7905949984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
7973112496,2335808,7975448304,7903566304,15879014608,2208,7905904320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
7975495376,3880560,7979375936,7899642800,15879018736,25014784,7928538144,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
7979476720,3819504,7983296224,7920739824,15904036048,12223424,7936782752,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
7988515152,5693456,7994208608,7922053392,15916262000,2486112,7930232960,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
7994223696,241138400,8235362096,7683388864,15918750960,3770784,7928298048,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8235370144,2176288,8237546432,7684977968,15922524400,3784096,7690938352,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8237554832,3264,8237558096,7688753056,15926311152,5109984,7693866304,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8237566352,3024,8237569376,7693854608,15931423984,5723136,7699580768,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8237581904,3296,8237585200,7699563968,15937149168,243361312,7942928576,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
8237633664,4848,8237638512,7942874528,16180513040,2178944,7945058320,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
8237639888,2733536,8240373424,7942320800,16182694224,1952,7945056288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
8240384176,4528,8240388704,7942309616,16182698320,3200,7942317344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8240397328,7935408,8248332736,7934371632,16182704368,1536,7942308576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
8248367040,5417088,8253784128,7928924432,16182708560,49120,7934390640,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8253802752,3455024,8257257776,7925502976,16182760752,2770976,7931728976,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
8257290112,4432,8257294544,7928240192,16185534736,1920,7928246544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8257339472,3344,8257342816,7928196080,16185538896,8428352,7936627776,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8257388256,3888,8257392144,7936576480,16193968624,5499328,7942079696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
8257404752,3342272,8260747024,7938722400,16199469424,3676128,7945740800,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
8260768720,3616,8260772336,7942375168,16203147504,2496,7942381280,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8260776544,2402544,8263179088,7939972512,16203151600,2080,7942377136,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8263195904,4000,8263199904,7939955760,16203155664,47648,7940007408,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8263201840,34368272,8297570112,7905634768,16203204880,4130240,7944133280,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
8297571328,144064,8297715392,7909621424,16207336816,1952,7909767440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
8297716032,11915616,8309631648,7897709136,16207340784,2429920,7912054672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
8309669232,4608,8309673840,7900099936,16209773776,1888,7900106432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8309714416,10723856,8320438272,7889339728,16209778000,34611488,7934675072,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8320471904,3680,8320475584,7923915600,16244391184,139936,7924059216,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8320477888,4960,8320482848,7924049616,16244532464,12928448,7936983024,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
8320483296,16076352,8336559648,7920903856,16257463504,2208,7936982416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
8336560496,5466480,8342026976,7915440656,16257467632,10450016,7931357152,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
8342042368,3248,8342045616,7925873984,16267919600,1920,7925879152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8342052832,3360,8342056192,7925867600,16267923792,832,7925871792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8342086032,3280,8342089312,7925836976,16267926288,15834848,7941675104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8342119504,5264,8342124768,7941638224,16283762992,5478816,7947122304,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
8342142512,7440,8342149952,7947094448,16289244400,1952,7947103840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8342158736,7728,8342166464,7947082032,16289248496,1408,7947091168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
8342172144,6608,8342178752,7947072848,16289251600,1472,7947080928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8342184496,5200,8342189696,7947064912,16289254608,3456,7947073568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
8342196320,6192,8342202512,7947058272,16289260784,1376,7947065840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8342216496,7984,8342224480,7947040400,16289264880,4800,7947053184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
8342233840,4896,8342238736,7947032256,16289270992,1088,7947038240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
8342243904,3351936,8345595840,7943679280,16289275120,1600,7947032816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
8345600784,3824,8345604608,7943674608,16289279216,1504,7943679936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
8345610944,4336,8345615280,7943668032,16289283312,1280,7943673648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8345686176,3408,8345689584,7943597824,16289287408,26624,7943627856,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
8345715600,3385056,8349100656,7940215424,16289316080,3510240,7947110720,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
8349121792,3408,8349125200,7943704320,16292829520,2432,7943710160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8349129184,2427120,8351556304,7941277184,16292833488,2048,7943706352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8351573168,4368,8351577536,7941260080,16292837616,48736,7941313184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8351579824,25721168,8377300992,7915586768,16292887760,4145728,7945453664,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
8377301472,11895872,8389197344,7907838704,16297036048,3808,7919738384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
8389197968,4896,8389202864,7907839328,16297042192,2516704,7910360928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
8389252016,2295872,8391547888,7908012320,16299560208,1888,7910310080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8391595104,3716848,8395311952,7904252320,16299564272,25347424,7933316592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8395413040,3928512,8399341552,7925572864,16324914416,12396480,7941897856,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
8404761968,5662512,8410424480,7926890032,16337314512,2354336,7934906880,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
8410439184,241582832,8652022016,7687649264,16339671280,3785536,7933017632,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8652028000,2158448,8654186448,7689272608,16343459056,3750080,7695181136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8654194800,4688,8654199488,7693012464,16347211952,5090848,7698108000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8654207312,3184,8654210496,7698093872,16352304368,5793280,7703890336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
8654222832,3456,8654226288,7703872960,16358099248,242750816,7946627232,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
8654273888,5520,8654279408,7946572736,16600852144,2176192,7948754448,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
8654280384,2722736,8657003120,7946027744,16603030864,1984,7948752464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
8657011872,3952,8657015824,7946019040,16603034864,3008,7946026000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8657021584,7930096,8664951680,7938089328,16603041008,1536,7946020960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
8664975728,5437824,8670413552,7932631520,16603045072,48992,7938118336,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8670429312,3462016,8673891328,7929204944,16603096272,2770880,7935437840,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
8673920864,4016,8673924880,7931944416,16605869296,2016,7931950448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8673966160,2928,8673969088,7931904304,16605873392,8377760,7940284992,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8674009696,2912,8674012608,7940241200,16614253808,5504512,7945748624,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
8674023520,4275808,8678299328,7941460528,16619759856,3685984,7949422320,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
8678317424,3664,8678321088,7945126288,16623447376,2432,7945132384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8678325168,2425520,8680750688,7942700656,16623451344,2176,7945128352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8680767632,3904,8680771536,7942684032,16623455568,47456,7942735392,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8680773552,34560976,8715334528,7908170096,16623504624,3658144,7946389216,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
8715335296,142624,8715477920,7911687504,16627165424,1952,7911832080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
8715479152,12381840,8727860992,7899308528,16627169520,2434048,7914124416,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
8727906576,5472,8727912048,7901693568,16629605616,1920,7901700960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8727973776,10337424,8738311200,7891298512,16629609712,34581888,7936217824,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8738354352,4528,8738358880,7925834416,16664193296,141376,7925980320,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8738361280,5024,8738366304,7925970288,16664336592,12743040,7938718352,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
8738366992,15264272,8753631264,7923451056,16677082320,2208,7938717536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
8753632368,5478080,8759110448,7917975968,16677086416,10444640,7933898688,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
8759129936,3248,8759133184,7928399152,16687532336,1952,7928404352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8759141696,3280,8759144976,7928391392,16687536368,928,7928395600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8759228944,3824,8759232768,7928305808,16687538576,15807712,7944117344,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8759289824,7104,8759296928,7944052080,16703349008,5580608,7949639792,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
8759350048,13664,8759363712,7949568112,16708931824,1920,7949583696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8759388112,8912,8759397024,7949539056,16708936080,1440,7949549408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
8759409616,6704,8759416320,7949523760,16708940080,1312,7949531776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8759427408,13856,8759441264,7949504736,16708946000,22080,7949540672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
8759448880,9792,8759458672,7949597888,16709056560,1344,7949609024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
8759519552,14720,8759534272,7949525552,16709059824,5952,7949546224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
8759566176,13888,8759580064,7949487952,16709068016,1120,7949502960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
8759586224,3295552,8762881776,7946190464,16709072240,6144,7949492160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
8762888848,4368,8762893216,7946317488,16709210704,1952,7946323808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
8762906064,4656,8762910720,7946304752,16709215472,1248,7946310656,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8763025376,7440,8763032816,7946186720,16709219536,38432,7946232592,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
8763074480,3508112,8766582592,7942676912,16709259504,3551520,7949736544,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
8766605088,3552,8766608640,7946204112,16712812752,5216,7946212880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8766612528,2419360,8769031888,7943789056,16712820944,2432,7946210848,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
8769052480,3536,8769056016,7943769056,16712825072,49920,7943822512,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
8769058256,25532576,8794590832,7918286464,16712877296,4215904,7948034944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
8794591296,12078096,8806669392,7910426752,16717096144,4128,7922508976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
8806669952,3792,8806673744,7910428576,16717102320,2539872,7912972240,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
8806732176,2291728,8809023904,7910620080,16719643984,1856,7912913664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
8809081648,3666432,8812748080,7906899872,16719647952,24050080,7934616384,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
8812959120,3891648,8816850768,7926848960,16743699728,12171808,7942912416,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
8822205072,5719472,8827924544,7927950800,16755875344,2411200,7936081472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
8827943840,241592832,9069536672,7688767760,16758304432,3849120,7934209712,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9069554896,2155264,9071710160,7690445088,16762155248,3791648,7696392000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9071720080,3136,9071723216,7694225920,16765949136,5113664,7699342720,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9071732128,3104,9071735232,7699329936,16771065168,5721440,7705054480,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9071757200,4832,9071762032,7705027200,16776789232,243282592,7948314624,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
9071845504,10688,9071856192,7948218160,17020074352,2181056,7950409904,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
9071858192,2674176,9074532368,7947725088,17022257456,1952,7950401216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
9074542976,6144,9074549120,7947712368,17022261488,2752,7947721264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9074559056,7900928,9082459984,7939805696,17022265680,1536,7947708160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
9082503840,5420400,9087924240,7934344608,17022268848,47200,7939812208,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9087949744,3463008,9091412752,7930905024,17022317776,2768704,7937136736,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
9091444400,4592,9091448992,7933639056,17025088048,1888,7933645536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9091490976,3984,9091494960,7933596864,17025091824,7918304,7941519152,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9091536800,3008,9091539808,7941472688,17033012496,5477536,7946953232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
9091552896,3793872,9095346768,7943146240,17038493008,3490304,7950430416,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
9095367760,3648,9095371408,7946613344,17041984752,2592,7946619584,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9095375568,2602960,9097978528,7944010320,17041988848,1952,7946615232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9097995936,5056,9098000992,7943991952,17041992944,47552,7944044560,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9098002944,33679648,9131682592,7910360496,17042043088,3416192,7947456336,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
9131683136,142512,9131825648,7913635552,17045461200,2048,7913780112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
9131826304,11921232,9143747536,7901717792,17045465328,2434656,7916073680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
9143785760,4032,9143789792,7904112784,17047902576,1920,7904118736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9143834640,10302048,9154136688,7893769824,17047906512,34610912,7938682784,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9154172848,4192,9154177040,7928341792,17082518832,140352,7928486336,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9154178848,5216,9154184064,7928477072,17082661136,11964480,7940446768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
9154184528,15674288,9169858816,7924769840,17094628656,2208,7940446336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
9169860304,5507232,9175367536,7919265120,17094632656,10482784,7935255136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
9175383552,3328,9175386880,7929730896,17105117776,1920,7929736144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9175394576,4544,9175399120,7929722432,17105121552,864,7929727840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9175444112,3168,9175447280,7929676416,17105123696,15782656,7945462240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9175485568,3120,9175488688,7945419840,17120908528,5489472,7950912432,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
9175508704,8800,9175517504,7950882736,17126400240,1984,7950893520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9175532896,7136,9175540032,7950864304,17126404336,1440,7950872880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
9175546720,6784,9175553504,7950855344,17126408848,3520,7950865648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9175560832,8544,9175569376,7950845168,17126414544,3456,7950857168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
9175575952,7424,9175583376,7950837440,17126420816,1344,7950846208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9175621088,13728,9175634816,7950790000,17126424816,4448,7950808176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
9175694400,6576,9175700976,7950730080,17126431056,1120,7950737776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
9175707424,3588192,9179295616,7947139568,17126435184,1632,7950729392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
9179301920,5056,9179306976,7947132176,17126439152,1472,7947138704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
9179315984,4032,9179320016,7947123360,17126443376,1248,7947128640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9179415840,3936,9179419776,7947027664,17126447440,26944,7947058544,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
9179454496,3731184,9183185680,7943290400,17126476080,3512928,7950534512,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
9183207680,3312,9183210992,7946780512,17129991504,2400,7946786224,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9183215088,2403584,9185618672,7944376832,17129995504,2080,7946782496,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9185636640,4256,9185640896,7944358928,17129999824,47872,7944411056,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9185643280,24602576,9210245856,7919804272,17130050128,3447936,7947854784,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
9210246512,12468592,9222715104,7910784624,17133499728,3616,7923256832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
9222715968,3536,9222719504,7910786368,17133505872,2833664,7913623568,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
9222764704,2305392,9225070096,7911271136,17136341232,1888,7913578416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9225121152,3679872,9228801024,7907544400,17136345424,25380896,7936605168,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9228948704,3587632,9232536336,7929192896,17161729232,11852064,7944632592,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
9238067328,5798816,9243866144,7929718480,17173584624,2479616,7937996912,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
9243884080,242194624,9486078704,7689988608,17176067312,3863872,7936047104,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9486095072,2150672,9488245744,7691687168,17179932912,3950816,7697788656,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9488255824,3488,9488259312,7695626208,17183885520,5209696,7700839392,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9488268208,2720,9488270928,7700825856,17189096784,5707104,7706535680,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9488297024,4944,9488301968,7706503520,17194805488,243530720,7950039184,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
9488395376,9120,9488404496,7949933824,17438338320,2179584,7952122528,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
9488405392,2665456,9491070848,7949449552,17440520400,2048,7952117056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
9491082384,5840,9491088224,7949436304,17440524528,2752,7949444896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9491098944,7923936,9499022880,7941505712,17440528592,1536,7949431184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
9499066240,5412928,9504479168,7936053520,17440532688,45664,7941512112,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9504498704,3451984,9507950688,7932630160,17440580848,2772320,7938854464,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
9507981856,4192,9507986048,7935368816,17443354864,1888,7935374896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9508032496,3776,9508036272,7935322688,17443358960,7933664,7943260128,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9508079104,2880,9508081984,7943211952,17451293936,5481440,7948696272,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
9508095536,3336592,9511432128,7945345296,17456777424,3490848,7952172736,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
9511454736,3664,9511458400,7948811920,17460270320,2304,7948817888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9511462736,2457488,9513920224,7946354192,17460274416,2176,7948813856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9513936960,3600,9513940560,7946337984,17460278544,46048,7946387632,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9513942480,34361680,9548304160,7912023600,17460327760,3426208,7949811488,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
9548304704,141440,9548446144,7915310864,17463757008,1952,7915454256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
9548447904,12797392,9561245296,7902515840,17463761136,2438752,7917751984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
9561282800,3856,9561286656,7904915696,17466202352,1888,7904921440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9561328784,10280688,9571609472,7894596976,17466206448,34688000,7939565664,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9571644000,3888,9571647888,7929248640,17500896528,140192,7929392720,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9571650112,3968,9571654080,7929385776,17501039856,12220320,7941610064,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
9571654816,15716592,9587371408,7925890144,17513261552,2016,7941608752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
9587372464,5458352,9592830816,7920434608,17513265424,10986432,7936879392,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
9592846560,3472,9592850032,7931403904,17524253936,1952,7931409328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9592857264,3232,9592860496,7931397536,17524258032,896,7931401664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9592901568,8208,9592909776,7931350432,17524260208,15775616,7947134256,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9592938608,2976,9592941584,7947096288,17540037872,5476288,7952575552,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
9592960784,5904,9592966688,7952549584,17545516272,1952,7952557440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9592976752,5360,9592982112,7952538256,17545520368,1440,7952545056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
9592990256,4864,9592995120,7952529344,17545524464,1280,7952535488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9593001168,6512,9593007680,7952520880,17545528560,3040,7952530432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
9593014720,5296,9593020016,7952514688,17545534704,1440,7952521424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9593034496,9632,9593044128,7952493264,17545537392,4672,7952507568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
9593052880,4080,9593056960,7952487056,17545544016,1088,7952492224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
9593061488,3480256,9596541744,7949006272,17545548016,1600,7952488128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
9596547472,14992,9596562464,7948989648,17545552112,1504,7949006144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
9596568416,8112,9596576528,7948979808,17545556336,1248,7948989168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9596657552,3232,9596660784,7948899520,17545560304,25984,7948928736,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
9596690480,4077072,9600767552,7944821424,17545588976,3520064,7952418560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
9600790032,3152,9600793184,7948317328,17549110512,2688,7948323168,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9600797136,2398464,9603195600,7945919008,17549114608,2016,7948319488,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9603214272,5344,9603219616,7945899056,17549118672,49440,7945953840,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9603222352,24909936,9628132288,7921037616,17549169904,3445856,7949393408,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
9628132960,12467968,9640600928,7912016880,17552617808,3680,7924488528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
9640601840,4032,9640605872,7912017952,17552623824,2677920,7914699904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
9640649808,2305344,9642955152,7912348608,17555303760,1888,7914655840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9643007808,3679280,9646687088,7908620768,17555307856,25633504,7937933552,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9646813632,3625584,9650439216,7930504416,17580943632,11815744,7945945744,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
9655795904,5783504,9661579408,7931183424,17592762832,2383392,7939350320,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
9661594736,241181248,9902775984,7692371520,17595147504,3935872,7937488640,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9902783600,2161168,9904944768,7694141040,17599085808,3919136,7700221344,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9904952944,3200,9904956144,7698050560,17603006704,5242336,7703296096,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9904964352,2960,9904967312,7703283392,17608250704,5685216,7708971568,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
9904979552,4192,9904983744,7708955184,17613938928,243162464,7952121840,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
9905031312,8000,9905039312,7952063808,17857103120,2174272,7954246080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
9905039824,2722080,9907761904,7951518240,17859280144,1920,7954242240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
9907771376,5648,9907777024,7951507184,17859284208,2624,7951515456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
9907783040,7830512,9915613552,7943674720,17859288272,1536,7951506768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
9915639008,5440768,9921079776,7938212624,17859292400,45184,7943698576,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9921096624,3450848,9924547472,7934792000,17859339472,2773504,7941016352,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
9924577200,4256,9924581456,7937532800,17862114256,1920,7937538976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9924621872,3040,9924624912,7937493760,17862118672,7919360,7945416160,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9924664912,2704,9924667616,7945372848,17870040464,5467552,7950843104,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
9924678944,3344800,9928023744,7947486736,17875510480,3489920,7954321456,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
9928041984,3536,9928045520,7950957920,17879003440,2400,7950963856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9928049728,2406000,9930455728,7948551808,17879007536,1952,7950959760,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
9930472160,5056,9930477216,7948534352,17879011568,47104,7948586512,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9930479312,34486272,9964965584,7914096160,17879061744,3419008,7952001440,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
9964966112,146560,9965112672,7917369392,17882482064,1984,7917517936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
9965114944,12742720,9977857664,7904628432,17882486096,2434304,7919805456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
9977892880,4832,9977897712,7907025408,17884923120,1920,7907032160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
9977939488,10299984,9988239472,7896687744,17884927216,34663328,7941651056,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
9988272720,3760,9988276480,7931315408,17919591888,140288,7931459456,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
9988278528,5072,9988283600,7931451424,17919735024,11913600,7943370096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
9988284160,15667456,10003951616,7927698640,17931650256,2176,7943368272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10003952288,5470336,10009422624,7922231760,17931654384,10436992,7938139088,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
10009437376,3328,10009440704,7932653360,17942094064,1920,7932658608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10009446992,2944,10009449936,7932648256,17942098192,2720,7932653920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10009475088,4896,10009479984,7932622304,17942102288,15837408,7948464608,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10009506448,4896,10009511344,7948430144,17957941488,5479968,7953915008,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
10009529888,6080,10009535968,7953886992,17963422960,1920,7953894992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10009542304,3728,10009546032,7953881120,17963427152,1408,7953886256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
10009549984,4960,10009554944,7953876304,17963431248,1312,7953882576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10009560416,5664,10009566080,7953869136,17963435216,3104,7953877904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10009571136,4320,10009575456,7953866032,17963441488,1376,7953871728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10009590912,5104,10009596016,7953849472,17963445488,4480,7953859056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
10009602768,4240,10009607008,7953844464,17963451472,1088,7953849792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
10009611632,3383936,10012995568,7950458784,17963454352,1632,7953844352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
10013000288,4400,10013004688,7950454112,17963458800,1472,7950459984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10013010256,4128,10013014384,7950448512,17963462896,1280,7950453920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10013081440,3632,10013085072,7950381920,17963466992,25376,7950410928,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
10013114832,4174096,10017288928,7946204720,17963493648,3513056,7953891872,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
10017309120,3376,10017312496,7949695520,17967008016,2592,7949701488,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10017316448,2480320,10019796768,7947215312,17967012080,1984,7949697616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10019813408,4352,10019817760,7947198416,17967016176,48640,7947251408,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10019819968,24896064,10044716032,7922351344,17967067376,3444384,7950691792,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
10044716608,12393200,10057109808,7913404480,17970514288,3840,7925801520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10057110592,6272,10057116864,7913403472,17970520336,2452608,7915862352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
10057165088,2312480,10059477568,7913497296,17972974864,1856,7915811632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10059523488,3740880,10063264368,7909714560,17972978928,25941344,7939396784,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10063367760,3646448,10067014208,7931908784,17998922992,11825184,7947380416,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
10072089968,5698240,10077788208,7932963072,18010751280,2374368,7941035680,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
10077802720,242529136,10320331856,7692796064,18013127920,3870592,7939195792,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10320338112,2163248,10322501360,7694499360,18017000720,3897536,7700560144,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10322510048,3520,10322513568,7698386512,18020900080,5456384,7703846416,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10322521440,2912,10322524352,7703833648,18026358000,5682784,7709519344,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10322536160,3152,10322539312,7709503904,18032043216,243159328,7952666384,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
10322586624,6128,10322592752,7952612768,18275205520,2185664,7954804560,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
10322593184,2725120,10325318304,7952075312,18277393616,1984,7954802416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
10325327632,4896,10325332528,7952065216,18277397744,2976,7952073088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10325341008,7976736,10333317744,7944084256,18277402000,1536,7952062528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10333346592,5436928,10338783520,7938622416,18277405936,50944,7944110288,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10338800832,3461888,10342262720,7935195440,18277458160,2771296,7941428624,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
10342294256,4528,10342298784,7937933360,18280232144,1856,7937939744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10342343488,4128,10342347616,7937888656,18280236272,7895424,7945788208,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10342387984,3056,10342391040,7945742352,18288133392,5527488,7951272896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
10342403744,3366192,10345769936,7947892992,18293662928,3679488,7954938672,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
10345789488,3632,10345793120,7951552144,18297345264,2752,7951558528,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10345797184,2402448,10348199632,7949149696,18297349328,2240,7951554384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10348216320,4144,10348220464,7949132960,18297353424,48032,7949185136,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10348222432,34547792,10382770224,7914633760,18297403984,4093952,7953275504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
10382770800,142192,10382912992,7918587696,18301500688,1920,7918731808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10382913600,12656032,10395569632,7905935152,18301504784,2438080,7921029264,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
10395606256,5072,10395611328,7908333616,18303944944,1888,7908340576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10395651008,10406832,10406057840,7897891200,18303949040,34779168,7943077200,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10406089488,4448,10406093936,7932637344,18338731280,141376,7932783168,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10406095440,4544,10406099984,7932775712,18338875696,11911488,7944691744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
10406100768,15667616,10421768384,7929020432,18350788816,2272,7944690320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10421769648,5466464,10427236112,7923556832,18350792944,10935616,7939958912,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
10427250736,3472,10427254208,7934477104,18361731312,7584,7934488160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10427260624,3056,10427263680,7934491280,18361754960,8672,7934503008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10427291888,4336,10427296224,7934470000,18361766224,16098720,7950573056,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10427326640,4480,10427331120,7950536384,18377867504,5481952,7956022816,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
10427349184,4992,10427354176,7955997936,18383352112,1952,7956004880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10427360864,6576,10427367440,7955988704,18383356144,1440,7955996720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
10427371968,4992,10427376960,7955983344,18383360304,1312,7955989648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10427382512,5408,10427387920,7955976416,18383364336,3648,7955985472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10427392432,5312,10427397744,7955972736,18383370480,1312,7955979360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10427411216,7392,10427418608,7955955936,18383374544,4896,7955968224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
10427426336,6000,10427432336,7955948384,18383380720,1120,7955955504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
10427437232,3383152,10430820384,7952563056,18383383440,1632,7955947840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
10430825344,4096,10430829440,7952558448,18383387888,1472,7952564016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10430834912,3536,10430838448,7952553632,18383392080,1472,7952558640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10430906208,4352,10430910560,7952485616,18383396176,26816,7952516784,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
10430937888,3461120,10434399008,7949025744,18383424752,3515712,7956002576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
10434421152,3232,10434424384,7952518928,18386943312,2400,7952524560,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10434428384,2715872,10437144256,7949803120,18386947376,2048,7952521040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10437161424,3840,10437165264,7949786144,18386951408,49056,7949839040,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10437167840,25295920,10462463760,7924538848,18387002608,3425184,7953259952,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
10462464224,12040320,10474504544,7915925488,18390430032,3808,7927969616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10474505904,3648,10474509552,7915926496,18390436048,2433728,7918363872,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
10474558016,2404080,10476962096,7915909184,18392871280,1856,7918315120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10477007616,3774624,10480782240,7912093008,18392875248,25886688,7941754320,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10480880432,3807488,10484687920,7934077120,18418765040,11822752,7949707360,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
10489782672,5707328,10495490000,7935100416,18430590416,2358144,7943165888,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
10495504576,242555424,10738060000,7694891536,18432951536,3870208,7941317168,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10738064944,2168880,10740233824,7696590480,18436824304,3901312,7702660672,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10740242016,3424,10740245440,7700482448,18440727888,5449536,7705935408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10740253232,3200,10740256432,7705922368,18446178800,5678048,7711603616,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
10740267424,3536,10740270960,7711588736,18451859696,244356320,7955948592,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
10740309120,7584,10740316704,7955902224,18696218928,2190848,7958100656,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
10740317328,2733648,10743050976,7955360240,18698411216,1952,7958095840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
10743059760,5200,10743064960,7955350480,18698415440,2944,7955358624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10743071280,7926752,10750998032,7947423456,18698421488,1536,7955351744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10751021888,5496224,10756518112,7941907472,18698425584,49888,7947453584,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10756533936,3806368,10760340304,7938137600,18698477904,2770112,7944714080,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
10760370896,4336,10760375232,7940874640,18701249872,1888,7940880864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10760416384,4608,10760420992,7940832624,18701253616,8399808,7949237040,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10760459952,3376,10760463328,7949191472,18709654800,5519104,7954713952,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
10760475296,3736560,10764211856,7950964448,18715176304,3799840,7958500848,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
10764230432,3392,10764233824,7954744464,18718978288,4928,7954752784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10764237888,2407200,10766645088,7952339504,18718984592,2112,7954748816,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10766661584,3248,10766664832,7952323696,18718988528,46272,7952373216,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10766666720,34290256,10800956976,7918079648,18719036624,3862208,7956232112,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
10800957488,141824,10801099312,7921801920,18722901232,1952,7921945696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10801100576,12269712,10813370288,7909535040,18722905328,2437024,7924241776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
10813405408,3552,10813408960,7911934704,18725343664,1888,7911940144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10813449504,10705472,10824154976,7901192624,18725347600,34519392,7946417488,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10824185456,4800,10824190256,7935679488,18759869744,140416,7935824704,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10824191840,4736,10824196576,7935816464,18760013040,11940640,7947761840,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
10824196976,15747040,10839944016,7932010912,18771954928,2400,7947760352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10839944912,5468144,10845413056,7926546064,18771959120,11079968,7943094176,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
10845427776,2992,10845430768,7937609984,18783040752,2496,7937615472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10845436992,3232,10845440224,7937604624,18783044848,2144,7937610000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10845463472,3664,10845467136,7937581808,18783048944,15949184,7953534656,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10845493456,5712,10845499168,7953500624,18798999792,5503712,7959010048,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
10845518640,4272,10845522912,7958981904,18804504816,1920,7958988096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10845528528,3024,10845531552,7958977488,18804509040,1440,7958981952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
10845535536,4240,10845539776,7958973328,18804513104,1312,7958978880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10845544752,4768,10845549520,7958967584,18804517104,3456,7958975808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10845553792,4704,10845558496,7958964848,18804523344,1440,7958970992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
10845570800,8176,10845578976,7958948368,18804527344,4800,7958961344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
10845584320,5568,10845589888,7958943824,18804533712,1088,7958950480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
10845594880,3400304,10848995184,7955542496,18804537680,1632,7958944432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
10848999600,3200,10849002800,7955538848,18804541648,1504,7955543552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
10849008000,3136,10849011136,7955533424,18804544560,1280,7955537840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10849078496,3600,10849082096,7955466080,18804548176,25920,7955495600,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
10849106608,3388640,10852495248,7952081312,18804576560,3549088,7959019040,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
10852515584,3328,10852518912,7955609840,18808128752,2400,7955615568,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10852522816,2655088,10855177904,7952955008,18808132912,2176,7955612272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
10855194528,2912,10855197440,7952939504,18808136944,48352,7952990768,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
10855199632,25476928,10880676560,7927510560,18808187120,3443040,7956430528,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
10880677024,11809264,10892486288,7919145536,18811631824,3840,7930958640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
10892487120,3728,10892490848,7919147152,18811638000,2447008,7921597888,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
10892535344,2348800,10894884144,7919203264,18814087408,1920,7921553984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
10894930432,3903680,10898834112,7915257488,18814091600,25021376,7944182544,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
10898926080,3822512,10902748592,7936367552,18839116144,11827520,7952017584,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
10907988240,5662752,10913650992,7937296576,18850947568,2414464,7945373792,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
10913665552,242102864,11155768416,7697596656,18853365072,3933056,7943632576,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11155775632,2160320,11157935952,7699365248,18857301200,3838272,7705363840,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11157944656,3344,11157948000,7703193200,18861141200,5452544,7708649088,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11157955712,2976,11157958688,7708636368,18866595056,5752064,7714391408,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11157970944,3360,11157974304,7714374640,18872348944,242752640,7957130640,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
11158029168,8016,11158037184,7957067376,19115104560,2175072,7959250464,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
11158037792,2721248,11160759040,7956522480,19117281520,1952,7959245680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
11160772176,5584,11160777760,7956507952,19117285712,2976,7956516512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11160785152,7870928,11168656080,7948635648,19117291728,1632,7956508208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
11168688352,5474944,11174163296,7943132528,19117295824,49280,7948656752,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11174181136,3657488,11177838624,7939508400,19117347024,2774432,7945940320,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
11177872496,4000,11177876496,7942246624,19120123120,1888,7942252512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11177920672,4176,11177924848,7942202368,19120127216,7918048,7950124592,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11177967232,2656,11177969888,7950078000,19128047888,5545440,7955626096,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
11177981296,3964352,11181945648,7951650240,19133595888,3704416,7959319008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
11181967776,3856,11181971632,7955330112,19137301744,6656,7955340624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11181975712,2399984,11184375696,7952934240,19137309936,5088,7955339312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11184393456,4064,11184397520,7952920576,19137318096,75392,7953000032,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11184399440,34796224,11219195664,7918199264,19137394928,3973760,7956969248,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
11219196320,145248,11219341568,7922029552,19141371120,1952,7922176752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
11219343280,11913056,11231256336,7910118880,19141375216,2437984,7924469920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
11231293280,4416,11231297696,7912516880,19143814576,1888,7912523184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11231338640,10712864,11242051504,7901766976,19143818480,34589248,7947069088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11242089488,4624,11242094112,7936315120,19178409232,140128,7936459872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11242096160,6704,11242102864,7936448672,19178551536,11918368,7948373744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
11242103264,16270064,11258373328,7932098560,19190471888,2176,7948370800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
11258374400,5468704,11263843104,7926632880,19190475984,10877600,7942979184,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
11263859136,3056,11263862192,7937492896,19201355088,2048,7937498000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11263869040,3264,11263872304,7937486784,19201359088,864,7937490912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11263901008,4784,11263905792,7937455440,19201361232,16805760,7954265984,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11263933664,8880,11263942544,7954226528,19218169072,5480000,7959715408,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
11263959952,4384,11263964336,7959686208,19223650544,1952,7959692544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11263973296,5600,11263978896,7959675744,19223654640,1408,7959682752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
11263984384,5648,11263990032,7959668704,19223658736,3744,7959678096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11263995600,6832,11264002432,7959662416,19223664848,3456,7959672704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
11264006688,3792,11264010480,7959660576,19223671056,1344,7959665712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11264026688,6864,11264033552,7959641568,19223675120,4448,7959652880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
11264040016,6224,11264046240,7959635024,19223681264,1088,7959642336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
11264050960,3376224,11267427184,7956258144,19223685328,1664,7959636032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
11267432240,3552,11267435792,7956253664,19223689456,1472,7956258688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
11267441520,3376,11267444896,7956248656,19223693552,1280,7956253312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11267518640,3456,11267522096,7956174464,19223696560,27104,7956205024,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
11267548304,3379696,11270928000,7952798320,19223726320,3516032,7959694048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
11270947936,3376,11270951312,7956293472,19227244784,2400,7956299248,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11270955440,2416896,11273372336,7953876544,19227248880,2016,7956295456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11273389664,4256,11273393920,7953859088,19227253008,48160,7953911504,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11273396192,25907280,11299303472,7927999776,19227303248,3527936,7957434992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
11299304000,11798912,11311102912,7919730992,19230833904,3616,7931533520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
11311103744,5120,11311108864,7919731184,19230840048,2491008,7922227312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
11311153232,2338816,11313492048,7919840416,19233332464,1856,7922181088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11313539664,3894880,11317434544,7915902016,19233336560,26017728,7945814624,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11317517952,3871856,11321389808,7937966592,19259356400,11800000,7953638448,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
11326581024,5674672,11332255696,7938904576,19271160272,2401824,7946981072,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
11332270880,242682720,11574953600,7698609776,19273563376,3883328,7945175824,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11574957984,2170528,11577128512,7700319920,19277448432,3884192,7706374640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11577137088,3376,11577140464,7704194464,19281334928,5423936,7709621776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11577148000,2960,11577150960,7709609728,19286760688,5687360,7715300048,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11577163440,2768,11577166208,7715284848,19292451056,241628288,7956915904,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
11577206880,5952,11577212832,7956869488,19534082320,2169824,7959045264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
11577213936,2729776,11579943712,7956310480,19536254192,1952,7959042208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
11579952896,5344,11579958240,7956300048,19536258288,2944,7956308336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11579964608,7972592,11587937200,7948325312,19536262512,1536,7956299440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
11587962352,5457488,11593419840,7942846640,19536266480,46432,7948350560,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11593435824,3691792,11597127616,7939187984,19536315600,2777056,7945656832,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
11597158368,4160,11597162528,7941933264,19539095792,1920,7941939344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11597202656,3680,11597206336,7941893552,19539099888,7852032,7949749264,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11597245680,2880,11597248560,7949706432,19546954992,5480384,7955189696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
11597260208,3930336,11601190544,7951247968,19552438512,3482688,7958660992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
11601209328,3520,11601212848,7954711456,19555924304,2336,7954717312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11601216976,2402512,11603619488,7952309008,19555928496,2048,7954713568,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11603636736,3792,11603640528,7952291968,19555932496,47680,7952343440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11603642784,34326752,11637969536,7918012016,19555981552,3432384,7955771152,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
11637970176,143776,11638113952,7921302096,19559416048,1952,7921447824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
11638115056,11933456,11650048512,7909371696,19559420208,2433024,7923738176,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
11650082816,4144,11650086960,7911768352,19561855312,1888,7911774384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11650129216,10698336,11660827552,7901031888,19561859440,34484864,7946215088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11660863120,3504,11660866624,7935478992,19596345616,140064,7935622560,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11660868192,3600,11660871792,7935616128,19596487920,12103776,7947723504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
11660872400,15999776,11676872176,7931721536,19608593712,2048,7947723360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
11676872672,5466016,11682338688,7926259056,19608597744,10852384,7942577456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
11682352992,3248,11682356240,7937095904,19619452144,2048,7937101200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11682362192,3056,11682365248,7937090992,19619456240,832,7937094880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11682388928,4496,11682393424,7937065056,19619458480,15941600,7953011152,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11682419952,6288,11682426240,7952976752,19635402992,5533120,7958516160,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
11682443648,5520,11682449168,7958488544,19640937712,2560,7958496624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11682455824,5056,11682460880,7958480928,19640941808,1440,7958487424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
11682465232,3248,11682468480,7958477680,19640946160,1312,7958482240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11682472800,4880,11682477680,7958472352,19640950032,9408,7958486640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
11682482416,4144,11682486560,7958475760,19640962320,1408,7958481312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11682498624,3600,11682502224,7958464160,19640966384,4544,7958472304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
11682508304,5520,11682513824,7958458800,19640972624,1088,7958465408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
11682518144,3398384,11685916528,7955060096,19640976624,11488,7958469968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
11685921136,3328,11685924464,7955066464,19640990928,10656,7955080448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
11685929936,3680,11685933616,7955069632,19641003248,1760,7955075072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11686002608,3376,11686005984,7955001488,19641007472,34688,7955039552,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
11686030896,3386544,11689417440,7951627888,19641045328,3517632,7958532064,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
11689438448,3376,11689441824,7955122896,19644564720,2368,7955128640,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11689445776,2414896,11691860672,7952708240,19644568912,2080,7955125216,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
11691877680,4256,11691881936,7952690976,19644572912,50432,7952745664,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
11691884112,26528176,11718412288,7926212848,19644625136,3448832,7956189856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
11718413040,11804784,11730217824,7917858192,19648076016,3360,7929666336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
11730218672,4704,11730223376,7917858784,19648082160,2457216,7920320704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
11730265552,2299376,11732564928,7917977008,19650541936,1888,7920278272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
11732612032,3838608,11736450640,7914095264,19650545904,25767264,7943701136,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
11736546400,3792736,11740339136,7935976752,19676315888,11886144,7951655632,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
11745724080,5676432,11751400512,7936804080,19688204592,2350784,7944831296,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
11751415552,241260960,11992676512,7697880176,19690556688,3769696,7942910832,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11992681040,2160784,11994841824,7699487344,19694329168,4067488,7705715616,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11994850016,3008,11994853024,7703546544,19698399568,5439008,7708988560,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11994860672,2880,11994863552,7708977552,19703841104,5761760,7714742192,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
11994874528,3184,11994877712,7714726432,19709604144,241841472,7956571088,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
11994912496,5472,11994917968,7956529344,19951447312,2185280,7958720096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
11994918576,2746912,11997665488,7955970176,19953635664,1952,7958719040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
11997674384,5056,11997679440,7955960224,19953639664,2976,7955968256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
11997687744,7856496,12005544240,7948099776,19953644016,1536,7955957808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12005566864,5437184,12011004048,7942643904,19953647952,47104,7948128192,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12011021168,3452400,12014473568,7939224432,19953698000,2773376,7945450208,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
12014504912,4416,12014509328,7941964768,19956474096,1856,7941971040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12014549744,3712,12014553456,7941924736,19956478192,7878016,7949806464,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12014592256,3232,12014595488,7949763440,19964358928,5479584,7955246256,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
12014607344,3347184,12017954528,7951885936,19969840464,3491872,7958724992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
12017973440,3424,12017976864,7955358384,19973335248,2624,7955364432,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12017980944,2405552,12020386496,7952952848,19973339344,2048,7955360448,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12020402704,3312,12020406016,7952937424,19973343440,46688,7952987424,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12020407984,34147376,12054555360,7918836240,19973391600,4083584,7957067200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
12054555920,139792,12054695712,7922781680,19977477392,2336,7922923808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12054696320,12335264,12067031584,7910449968,19977481552,2549760,7925334992,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
12067067616,3856,12067071472,7912961792,19980033264,1888,7912967536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12067111744,10733504,12077845248,7902192112,19980037360,34247328,7947172944,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12077877424,3456,12077880880,7936406240,20014287120,146144,7936555840,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12077882448,3552,12077886000,7936548512,20014434512,12350112,7948902176,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
12077886416,15508976,12093395392,7933391664,20026787056,2208,7948902848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12093396160,5630592,12099026752,7927764400,20026791152,10440128,7943835120,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
12099041312,3008,12099044320,7938188592,20037232912,1920,7938193520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12099050880,3088,12099053968,7938183008,20037236976,3008,7938189104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12099080688,4080,12099084768,7938158352,20037243120,14879520,7953041952,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12099116992,5808,12099122800,7953002112,20052124912,5635680,7958643600,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
12099140368,4576,12099144944,7958617056,20057762000,1984,7958623616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12099151600,5888,12099157488,7958608640,20057766128,1440,7958615968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12099164048,5232,12099169280,7958600976,20057770256,1440,7958607648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12099175600,6880,12099182480,7958591840,20057774320,3072,7958601792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12099187920,3568,12099191488,7958588976,20057780464,1792,7958594336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12099205584,7216,12099212800,7958571888,20057784688,4544,7958583648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
12099220304,4240,12099224544,7958566160,20057790704,7584,7958577984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12099229024,3415696,12102644720,7955156224,20057800944,1952,7958573872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
12102649600,3664,12102653264,7955151744,20057805008,2016,7955157424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12102658976,4032,12102663008,7955147312,20057810320,1248,7955152592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12102731760,3472,12102735232,7955078000,20057813232,25632,7955107104,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
12102763296,3785712,12106549008,7951292896,20057841904,3676192,7958754800,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
12106572432,3456,12106575888,7954945248,20061521136,2400,7954951104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12106579968,2421376,12109001344,7952523984,20061525328,2240,7954947600,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12109018240,3632,12109021872,7952507616,20061529488,49472,7952560720,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12109024048,24918976,12133943024,7927638528,20061581552,3885408,7956442912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
12133943968,11816512,12145760480,7919708144,20065468624,3648,7931528304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12145761104,4224,12145765328,7919709568,20065474896,2445824,7922159616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
12145810624,2315536,12148126160,7919797024,20067923184,1888,7922114448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12148175264,3673040,12151848304,7916078944,20067927248,25171104,7944923088,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12151958496,3630304,12155588800,7937512464,20093101264,12445568,7953588336,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
12160681776,5663968,12166345744,7939203744,20105549488,2355424,7947223136,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
12166361456,241810560,12408172016,7699734688,20107906704,3719296,7945264544,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12408177200,2153840,12410331040,7701296560,20111627600,3800608,7707251008,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12410339888,3392,12410343280,7705087328,20115430608,5700544,7710791264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12410351024,2608,12410353632,7710779760,20121133392,5727296,7716509664,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12410366496,3360,12410369856,7716493808,20126863664,242556320,7959053488,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
12410411216,6880,12410418096,7959003520,20369421616,2181824,7961192224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
12410419024,2727760,12413146784,7958458032,20371604816,1952,7961187744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
12413155968,5920,12413161888,7958446928,20371608816,2976,7958455824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12413169136,7904880,12421074016,7950539056,20371613072,1504,7958445440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12421097872,5436560,12426534432,7945082544,20371616976,53440,7950572544,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12426550144,3452976,12430003120,7941670208,20371673328,2776864,7947900048,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
12430033024,4512,12430037536,7944413936,20374451472,1888,7944420336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12430079024,3456,12430082480,7944373056,20374455536,7782656,7952159168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12430125088,2960,12430128048,7952111968,20382240016,5478016,7957592944,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
12430139296,3350496,12433489792,7954230640,20387720432,3498272,7961079408,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
12433513184,3440,12433516624,7957703840,20391220464,2336,7957709616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12433520752,2400656,12435921408,7955303248,20391224656,2208,7957706112,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12435937824,3424,12435941248,7955287248,20391228496,46560,7955337232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12435943104,33721472,12469664576,7921613232,20391277808,3830208,7959164912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
12469665200,141584,12469806784,7925303824,20395110608,2208,7925447616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12469807456,12804480,12482611936,7912502800,20395114736,2680512,7927987792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
12482648128,4336,12482652464,7915144096,20397796560,1888,7915150320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12482692832,10304464,12492997296,7904803712,20397801008,33924352,7949032528,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12493029600,3376,12493032976,7938693920,20431726896,141056,7938838352,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12493034512,3376,12493037888,7938831312,20431869200,11924128,7950758816,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
12493038432,15858064,12508896496,7934899296,20443795792,1952,7950759312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12508896992,5503856,12514400848,7929398976,20443799824,10514592,7945417424,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
12514415408,3296,12514418704,7939897600,20454316304,1920,7939902816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12514425024,3168,12514428192,7939892176,20454320368,864,7939896208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12514452112,3264,12514455376,7939867232,20454322608,15693888,7955564384,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12514481248,5584,12514486832,7955531456,20470018288,5522272,7961059312,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
12514509200,4832,12514514032,7961028736,20475542768,2080,7961035648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12514520832,3648,12514524480,7961022384,20475546864,1408,7961027440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12514528256,3232,12514531488,7961019472,20475550960,1312,7961024016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12514536496,4928,12514541424,7961013632,20475555056,10752,7961029312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12514546144,4448,12514550592,7961016752,20475567344,1376,7961022576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12514563296,5936,12514569232,7961002208,20475571440,4672,7961012816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
12514575376,5872,12514581248,7960996400,20475577648,1312,7961003584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12514586752,3723968,12518310720,7957270992,20475581712,1632,7960996592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
12518315392,3584,12518318976,7957266800,20475585776,1600,7957271984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12518324480,3152,12518327632,7957262432,20475590064,1312,7957266896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12518398784,3600,12518402384,7957191584,20475593968,31712,7957226896,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
12518427728,3783232,12522210960,7953417792,20475628752,3834528,7961035552,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
12522234160,3424,12522237584,7957228224,20479465808,2688,7957234336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12522241712,2414944,12524656656,7954814144,20479470800,2144,7957231232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12524673184,4112,12524677296,7954797600,20479474896,49376,7954851088,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12524679424,24946320,12549625744,7929900384,20479526128,3812864,7958659568,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
12549626384,12419104,12562045488,7921295040,20483340528,3968,7933718112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12562046160,3536,12562049696,7921296976,20483346672,2433376,7923733888,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
12562093424,2301408,12564394832,7921387936,20485782768,1888,7923691232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12564442960,3677760,12568120720,7917666112,20485786832,25033120,7946376992,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12568221584,3636768,12571858352,7938963264,20510821616,12471040,7955071072,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
12577385360,5689472,12583074832,7940221088,20523295920,2368672,7948279232,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
12583089648,242614848,12825704496,7699963072,20525667568,3739904,7946317824,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12825708976,2163952,12827872928,7701536336,20529409264,3745888,7707446176,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12827881296,3200,12827884496,7705272608,20533157104,5564416,7710840224,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12827891888,2816,12827894704,7710828928,20538723632,5812416,7716644160,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
12827905632,3408,12827909040,7716628800,20544537840,240774464,7957406672,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
12827945040,6240,12827951280,7957363008,20785314288,2176096,7959545344,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
12827951728,2737424,12830689152,7956804176,20787493328,1920,7959543520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
12830697568,4224,12830701792,7956795504,20787497296,3328,7956803056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12830708192,7910528,12838618720,7948884592,20787503312,1664,7956796784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12838639392,5443872,12844083264,7943424272,20787507536,47328,7948915472,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12844098448,3455904,12847554352,7940003232,20787557584,2772384,7946231520,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
12847584192,4192,12847588384,7942743376,20790331760,1856,7942749424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12847631904,3968,12847635872,7942699888,20790335760,7745440,7950449296,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12847674080,3232,12847677312,7950407056,20798084368,5472320,7955882608,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
12847688656,3344160,12851032816,7952525824,20803558640,3491552,7959361536,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
12851052560,3424,12851055984,7955996544,20807052528,2336,7956002304,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12851060032,2446080,12853506112,7953550704,20807056816,2112,7955998896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12853522048,4080,12853526128,7953534592,20807060720,47616,7953586288,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12853527984,34428288,12887956272,7919153568,20807109840,3424352,7957006208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
12887956832,142624,12888099456,7922436720,20810536176,1920,7922581264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12888100144,11970816,12900070960,7910469312,20810540272,2456224,7924896352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
12900106576,4160,12900110736,7912887136,20812997872,2112,7912893408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12900151856,10292608,12910444464,7902557504,20813001968,34352224,7947202336,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12910477072,3488,12910480560,7936876640,20847357200,142208,7937022336,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12910482112,3440,12910485552,7937016096,20847501648,12776704,7949796240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
12910485968,15710112,12926196080,7934083936,20860280016,2208,7949796256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
12926196896,5472784,12931669680,7928614560,20860284240,10460288,7944547632,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
12931683824,3296,12931687120,7939059232,20870746352,1920,7939064448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
12931693424,3040,12931696464,7939053984,20870750448,832,7939057856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
12931720272,4896,12931725168,7939027424,20870752592,15672768,7954705088,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
12931751360,5600,12931756960,7954670928,20886427888,5476768,7960153296,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
12931794720,5296,12931800016,7960106272,20891906288,1952,7960113520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12931813504,5104,12931818608,7960091776,20891910384,1440,7960098320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12931822944,4992,12931827936,7960086544,20891914480,3648,7960095184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12931834912,3584,12931838496,7960082096,20891920592,3456,7960089136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12931843712,6256,12931849968,7960076800,20891926768,1344,7960084400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
12931863456,6016,12931869472,7960061392,20891930864,4512,7960071920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
12931874880,6160,12931881040,7960055968,20891937008,1120,7960063248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12931885456,3419808,12935305264,7956635872,20891941136,1632,7960057312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
12935310032,3440,12935313472,7956631760,20891945232,1760,7956636960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
12935319248,3824,12935323072,7956626224,20891949296,1280,7956631328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12935393616,3472,12935397088,7956556272,20891953360,4640,7956564384,73,73,0,cudaLaunchKernel, 336 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
12935413344,4165712,12939579056,7952380480,20891959536,3591232,7960137424,73,73,0,cudaLaunchKernel,37296 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
12939595600,4528,12939600128,7955952624,20895552752,1952,7955959104,73,73,0,cudaLaunchKernel, 6 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12939605488,2413968,12942019456,7953537392,20895556848,5457248,7961408608,73,73,0,cudaLaunchKernel,391608 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12942027328,8912,12942036240,7958979552,20901015792,6822208,7965810672,73,73,0,cudaLaunchKernel,783216 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12942048464,24916112,12966964576,7940876176,20907840752,45056,7965837344,73,73,0,cudaLaunchKernel, 414 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
12966971264,12477936,12979449200,7928438656,20907887856,6688,7940923280,73,73,0,cudaLaunchKernel, 6 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
12979453504,3792,12979457296,7928438880,20907896176,51296,7928493968,73,73,0,cudaLaunchKernel,4347 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12979463552,2335072,12981798624,7926151792,20907950416,61632,7928548496,73,73,0,cudaLaunchKernel,8694 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
12981866240,3651664,12985517904,7922496928,20908014832,4410976,7930559568,73,73,0,cudaLaunchKernel, 2 583 1, 8 16 1,"void magma_sgemmEx_kernel<float, float, float, (bool)1, (bool)0, (int)6, (int)4, (int)6, (int)3, (int)4>(int, int, int, Tensor, int, Tensor, int, Tensor, int, Tensor, int, int, int, const T1 *, const T1 *, T1, T1, int, cublasLtEpilogue_t, int, const void *, long)"
12985629840,3632144,12989261984,7923166384,20912428368,99968,7926898496,73,73,0,cuLaunchKernel, 13 1 3, 128 1 1,void cutlass::Kernel2<cutlass_80_simt_sgemm_128x32_8x5_tn_align1>(T1::Params)
12989265920,5139376,12994405296,7918125376,20912530672,4000,7923268752,73,73,0,cudaLaunchKernel, 1 26 1, 32 16 1,"void cublasLt::splitKreduce_kernel<(int)32, (int)16, int, float, float, float, float, (bool)0, float, float, float, (bool)1, (bool)1, (bool)0, (bool)0>(cublasLt::cublasSplitKParams<T6>, const T4 *, const T10 *, T9 *, T5 *, const T6 *, const T6 *, const T11 *, const T4 *, T11 *, void *, long, T6 *, int *, T6 *, T6 *, const T6 *, const T6 *, const T6 *, const T6 *, const T6 *)"
12994440912,5851392,13000292304,7912244512,20912536816,59776,7918155680,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
13000296656,243250816,13243547472,7669051776,20912599248,62272,7912364864,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
13243557840,2148320,13245706160,7666956672,20912662832,1280,7669106272,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
13245724144,3328,13245727472,7666939392,20912666864,100448,7667043168,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
13245743984,7392,13245751376,7667018016,20912769392,86400,7667111808,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
13245758144,2816,13245760960,7667096464,20912857424,1856,7667101136,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
13245765808,5008,13245770816,7667090608,20912861424,1472,7667097088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
13245781872,2852800,13248634672,7664230944,20912865616,5600,7667089344,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
13248646240,7456,13248653696,7664220016,20912873712,1312,7664228784,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
13248661136,7898176,13256559312,7656318592,20912877904,1536,7664218304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
13256563984,5458160,13262022144,7650859920,20912882064,1216,7656319296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
13262026592,3464144,13265490736,7647395264,20912886000,1376,7650860784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
13265503696,6336,13265510032,7647380288,20912890320,1664,7647388288,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 9)]::operator ()() const::[lambda(c10::BFloat16) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
13265514416,3440,13265517856,7647376432,20912894288,3360,7647383232,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
13265525680,22896,13265548576,7647351760,20912900336,4128,7647378784,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
13265553728,3416288,13268970016,7643936560,20912906576,2272,7647355120,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
13268977488,7328,13268984816,7643925760,20912910576,72864,7644005952,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
13268990016,2419488,13271409504,7641576048,20912985552,162432,7644157968,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
13271413136,3360,13271416496,7641732736,20913149232,2240,7641738336,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
13271419776,34474656,13305894432,7607258832,20913153264,2016,7641735504,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
13305926784,118912,13306045696,7607111376,20913157072,2848,7607233136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::AUnaryFunctor<float, float, bool, at::native::<unnamed>::CompareEqFunctor<float>>, std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
20913225648,18000,,,20913239056,159936,173344,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
20913311408,35360,20913346768,53984,20913400752,83872,173216,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
20913363152,18032,20913381184,105616,20913486800,1184,124832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
20913400864,6560,20913407424,81584,20913489008,88064,176208,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
20913431520,11424,20913442944,135248,20913578192,172960,319632,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
20913495840,13200,20913509040,244000,20913753040,1824,259024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::AUnaryFunctor<float, float, bool, at::native::<unnamed>::CompareEqFunctor<float>>, std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
20913773120,2928,,,20913773072,2336,2928,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
20913780720,3216,,,20913782096,3904,5280,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
20913787184,3296,20913790480,4544,20913795024,4928,12768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
20913793584,2976,20913796560,4544,20913801104,27520,35040,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
20913800032,2736,20913802768,28128,20913830896,1600,32464,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
20913857440,4672,,,20913858544,1120,4672,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"