2746 lines
940 KiB
CSV
2746 lines
940 KiB
CSV
|
|
API Start (ns),API Dur (ns),Queue Start (ns),Queue Dur (ns),Kernel Start (ns),Kernel Dur (ns),Total Dur (ns),PID,TID,DevId,API Function,GridXYZ,BlockXYZ,Kernel Name
|
||
|
|
7267792,13408,,,7275376,2144,13408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7290064,5728,,,7292688,2816,5728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7303328,5504,,,7305872,3392,5936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7312624,3072,,,7313232,1088,3072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7320240,3056,,,7320496,1088,3056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7326912,2624,,,7326704,1056,2624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7332464,2944,,,7332624,2080,2944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7339552,2752,,,7339504,1824,2752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7354064,6960,,,7357872,2752,6960,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7368368,6496,,,7370736,5728,8096,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7381248,2672,,,7381104,1120,2672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7392128,4000,,,7392976,1984,4000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7416896,3616,,,7417616,38432,39152,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7457216,5488,,,7459632,48832,51248,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 12)]::operator ()() const::[lambda(c10::BFloat16) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7471440,6608,7478048,31952,7510000,71520,110080,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7645392,5456,,,7647600,4915936,4918144,73,73,0,cuLaunchKernel,2336 3 1, 256 1 1,void cutlass::Kernel2<cutlass_80_simt_sgemm_256x128_8x4_tn_align1>(T1::Params)
|
||
|
|
7660272,3168,7663440,4902048,12565488,5035136,9940352,73,73,0,cudaLaunchKernel,195804 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7680208,3104,7683312,9918336,17601648,3808,9925248,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7749040,5552,7754592,9853168,17607760,44096,9902816,73,73,0,cuLaunchKernel, 56 6 1, 128 1 1,void cutlass::Kernel2<cutlass_80_simt_sgemm_128x64_8x5_tt_align1>(T1::Params)
|
||
|
|
7760960,2784,7763744,9890000,17653744,30368,9923152,73,73,0,cudaLaunchKernel,2174 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7789584,14368,7803952,9881536,17685488,3744,9899648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7808960,2624,7811584,9880144,17691728,1792,9884560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7816096,3040,7819136,9876944,17696080,1344,9881328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7822960,3856,7826816,9873264,17700080,2048,9879168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7830640,4176,7834816,9869456,17704272,1536,9875168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7838288,3408,7841696,9866672,17708368,1280,9871360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7846032,2512,7848544,9863824,17712368,1376,9867712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7851344,3104,7854448,9862112,17716560,2080,9867296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7884416,5552,7889968,9830432,17720400,2848,9838832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnOther_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
17749936,2864,,,17749968,1024,2864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnOther_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
17804720,6544,,,17807664,3766816,3769760,73,73,0,cudaLaunchKernel,1536 3 1, 128 1 1,"void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unnamed>::OpaqueType<(unsigned int)2>, unsigned int, (int)2, (int)128, (int)1, (int)8>(T1 *, at::native::<unnamed>::CatArrInputTensorMetadata<T1, T2, T4, T5>, at::native::<unnamed>::TensorSizeStride<T2, (unsigned int)4>, int, T2)"
|
||
|
|
26357072,19776,,,26372208,8192,23328,73,73,0,cudaLaunchKernel, 222 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
26411856,6864,,,26413968,27680,29792,73,73,0,cudaLaunchKernel,7090 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
26448080,6096,,,26449776,52384,54080,73,73,0,cudaLaunchKernel, 96 3 1, 512 1 1,"void at::native::<unnamed>::CatArrayBatchedCopy<at::native::<unnamed>::OpaqueType<(unsigned int)4>, unsigned int, (int)2, (int)64, (int)64>(T1 *, at::native::<unnamed>::CatArrInputTensorMetadata<T1, T2, T4, T5>, at::native::<unnamed>::TensorSizeStride<T2, (unsigned int)4>, int, T2)"
|
||
|
|
26467520,8432,26475952,27200,26503152,31872,67504,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::cos_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26485712,7200,26492912,43104,26536016,39456,89760,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::sin_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26503344,7696,26511040,66864,26577904,39712,114272,73,73,0,cudaLaunchKernel,1773 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26524576,5744,26530320,88544,26618864,873696,967984,73,73,0,cudaLaunchKernel,1536 4 1, 128 1 1,"void at::native::<unnamed>::CatArrayBatchedCopy_alignedK_contig<at::native::<unnamed>::OpaqueType<(unsigned int)4>, unsigned int, (int)3, (int)128, (int)1, (int)16>(T1 *, at::native::<unnamed>::CatArrInputTensorMetadata<T1, T2, T4, T5>, at::native::<unnamed>::TensorSizeStride<T2, (unsigned int)4>, int, T2)"
|
||
|
|
26542304,3824,26546128,949280,27495408,217120,1170224,73,73,0,cudaLaunchKernel,7090 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26580608,5376,26585984,1128560,27714544,2240,1136176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26596912,4336,26601248,1117488,27718736,1536,1123360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26610752,7728,26618480,1104256,27722736,3424,1115408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26623808,10192,26634000,1094848,27728848,3168,1108208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
26644832,6224,26651056,1082016,27733072,3136,1091376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26750464,31104,26781568,955920,27737488,4736,991760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
26817168,16720,26833888,909616,27743504,1088,927424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
26842128,5984,26848112,899456,27747568,1632,907072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
26881584,13776,26895360,856176,27751536,1504,871456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
26933984,31456,26965440,790320,27755760,2016,823792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
27338800,37296,27376096,383760,27759856,30048,451104,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
27606992,42304,27649296,143072,27792368,3544672,3730048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
27744576,4640,27749216,3589264,31338480,2464,3596368,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
27753472,3216,27756688,3585888,31342576,1984,3591088,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
27834368,7616,27841984,3504688,31346672,49568,3561872,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
27856400,16064,27872464,3526432,31398896,3452992,6995488,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
27875376,14016,27889392,6964448,34853840,2912,6981376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
27895376,18464,27913840,6944128,34857968,2466752,9429344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
28438432,12560,28450992,8875072,37326064,1920,8889552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
28955424,19216,28974640,8355520,37330160,24059776,32434512,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
29491888,43168,29535056,31856160,61391216,11842304,43741632,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
29793040,28320,29821360,43430944,73252304,2395136,45854400,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
29899920,23168,29923088,45726176,75649264,4001984,49751328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
29971760,19104,29990864,49663008,79653872,3999008,53681120,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
30031744,16336,30048080,53606784,83654864,5297792,58920912,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
30084848,13088,30097936,58857152,88955088,5731328,64601568,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
30238096,12496,30250592,64438928,94689520,240315488,304766912,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
30402032,15632,30417664,304589328,335006992,2176224,306781184,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
30424080,12784,30436864,306748144,337185008,1952,306762880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
30460496,9984,30470480,306718624,337189104,1376,306729984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
30491344,5984,30497328,306695872,337193200,1504,306703360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
30616272,10752,30627024,306570272,337197296,40608,306621632,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
30657360,27824,30685184,306555088,337240272,2775488,309358400,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
30757632,9776,30767408,309249984,340017392,1888,309261648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
30860752,10288,30871040,309150448,340021488,7702240,316862976,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
31210832,13904,31224736,316500304,347725040,5461056,321975264,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
31254736,8192,31262928,321925152,353188080,3717632,325650976,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
31305920,8032,31313952,325593296,356907248,5856,325607184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
31319328,5072,31324400,325591040,356915440,3776,325599888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
31353824,3712,31357536,325564048,356921584,60928,325628688,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
31360320,3296,31363616,325620432,356984048,4091840,329715568,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
31364384,3520,31367904,329710064,361077968,1952,329715536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
31368512,3872,31372384,329709712,361082096,2437024,332150608,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
31411328,3808,31415136,332105296,363520432,1920,332111024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
31464768,3056,31467824,332056512,363524336,34563520,366623088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
31511392,3584,31514976,366574512,398089488,140224,366718320,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
31517360,5072,31522432,366709360,398231792,11923520,378637952,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
31522864,2624,31525488,378631808,410157296,2464,378636896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
31526352,4816,31531168,378630224,410161392,10756480,389391520,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
31555888,2864,31558752,389361808,420920560,1920,389366592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
31570192,4048,31574240,389350416,420924656,3040,389357504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
31658144,4288,31662432,389267344,420929776,16202336,405473968,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
31696912,2832,31699744,405433840,437133584,5455232,410891904,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
31715264,4176,31719440,410871008,442590448,1984,410877168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
31725792,3056,31728848,410865696,442594544,1440,410870192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
31733712,3488,31737200,410861440,442598640,1376,410866304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
31742144,3552,31745696,410857040,442602736,3168,410863760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
31751328,3232,31754560,410854288,442608848,1344,410858864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
31768288,4032,31772320,410840720,442613040,4608,410849360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
31778848,3312,31782160,410836832,442618992,1120,410841264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
31786592,2992,31789584,410833632,442623216,1632,410838256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
31795744,2992,31798736,410828576,442627312,1472,410833040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
31806144,3264,31809408,410822000,442631408,1248,410826512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
31882768,3856,31886624,410748880,442635504,29472,410782208,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
31913904,2912,31916816,410749440,442666256,3479584,414231936,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
31933664,2976,31936640,414212208,446148848,2368,414217552,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
31940592,2832,31943424,414209520,446152944,2112,414214464,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
31960448,2640,31963088,414193952,446157040,48416,414245008,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
31965232,2880,31968112,414240128,446208240,3449888,417692896,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
31968512,2416,31970928,417689216,449660144,4032,417695664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
31971488,2752,31974240,417692048,449666288,2435424,420130224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
32013936,2976,32016912,420087520,452104432,1888,420092384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
32061952,2944,32064896,420043632,452108528,25770432,445817008,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
32179824,4736,32184560,445697024,477881584,11819968,457521728,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
32218688,3456,32222144,457482480,489704624,2346688,459832624,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
32238848,3584,32242432,459811312,492053744,3809824,463624720,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
32246832,2832,32249664,463615408,495865072,3947776,467566016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
32258208,3104,32261312,467554352,499815664,5406624,472964080,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
32269968,3104,32273072,472951360,505224432,5664096,478618560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
32286592,3648,32290240,478601008,510891248,240444576,719049232,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
32323632,3488,32327120,719011648,751338768,2172448,721187584,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
32327984,3088,32331072,721181584,753512656,1952,721186624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
32338128,3184,32341312,721175472,753516784,2912,721181568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
32346992,3056,32350048,721170928,753520976,1536,721175520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
32372752,2944,32375696,721149312,753525008,46304,721198560,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
32388960,3136,32392096,721180976,753573072,2749568,723933680,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
32420640,3104,32423744,723900848,756324592,1920,723905872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
32463184,3280,32466464,723862192,756328656,7743936,731609408,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
32507568,2832,32510400,731563888,764074288,5461696,737028416,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
32524576,3072,32527648,737010608,769538256,3462944,740476624,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
32542416,3168,32545584,740456896,773002480,2304,740462368,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
32549600,2704,32552304,740454272,773006576,1984,740458960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
32568224,2784,32571008,740439664,773010672,46624,740489072,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
32572784,2864,32575648,740483152,773058800,3966080,744452096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
32576096,2512,32578608,744449216,777027824,1952,744453680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
32579200,2528,32581728,744450192,777031920,2729952,747182672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
32612736,2864,32615600,747148352,779763952,1856,747153072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
32654352,3184,32657536,747110512,779768048,33135360,780249056,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
32685936,2784,32688720,780216992,812905712,186080,780405856,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
32690304,3744,32694048,780400048,813094096,12695904,793099696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
32694496,2816,32697312,793094416,825791728,2176,793099408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
32697712,2880,32700592,793095328,825795920,10475328,803573536,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
32715072,2736,32717808,803554720,836272528,2176,803559632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
32724256,2976,32727232,803549232,836276464,832,803553040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
32758416,2864,32761280,803517072,836278352,15614944,819134880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
32788016,2768,32790784,819103792,851894576,5572000,824678560,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
32803040,3536,32806576,824662592,857469168,2336,824668464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
32812352,3120,32815472,824657792,857473264,3104,824664016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
32819408,2592,32822000,824657408,857479408,3264,824663264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
32826160,2928,32829088,824656464,857485552,11680,824671072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
32833712,3520,32837232,824662624,857499856,6144,824672288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
32853184,3360,32856544,824652816,857509360,5600,824661776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
32861760,3376,32865136,824651136,857516272,2368,824656880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
32869712,3088,32872800,824647568,857520368,3360,824654016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
32877088,2624,32879712,824646800,857526512,2944,824652368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
32885056,3264,32888320,824642416,857530736,8192,824653872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
32952736,3216,32955952,824584896,857540848,56608,824644720,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
32981504,2896,32984400,824615840,857600240,3673856,828292592,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
32999120,2944,33002064,828273312,861275376,2464,828278720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
33006048,2736,33008784,828270656,861279440,2048,828275440,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
33024304,2640,33026944,828256592,861283536,48960,828308192,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
33028848,2640,33031488,828303248,861334736,3813056,832118944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
33031888,2800,33034688,832115472,865150160,3776,832122048,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
33035216,2496,33037712,832118592,865156304,2434944,834556032,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
33080784,2976,33083760,834509696,867593456,1888,834514560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
33125728,3296,33129024,834468560,867597584,23937632,858409488,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
33213920,4080,33218000,858319648,891537648,12480864,870804592,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
33245472,3360,33248832,870772624,904021456,2345600,873121584,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
33263808,3408,33267216,873102048,906369264,3709440,876814896,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
33270080,2816,33272896,876807312,910080208,3724512,880534640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
33280032,2736,33282768,880524800,913807568,5534656,886062192,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
33290304,2768,33293072,886050432,919343504,5795488,891848688,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
33303040,3056,33306096,891835136,925141232,239349632,1131187824,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
33336304,3424,33339728,1131153472,1164493200,2170784,1133327680,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
33340192,4048,33344240,1133321696,1166665936,1920,1133327664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
33350944,2816,33353760,1133316304,1166670064,2912,1133322032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
33358672,3152,33361824,1133312464,1166674288,1504,1133317120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
33381392,2912,33384304,1133293984,1166678288,47104,1133344000,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
33396976,3360,33400336,1133328064,1166728400,2757664,1136089088,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
33428064,2976,33431040,1136058096,1169489136,1952,1136063024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
33468256,3136,33471392,1136021840,1169493232,7799744,1143824720,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
33509632,3280,33512912,1143782208,1177295120,5451936,1149237424,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
33523600,3088,33526688,1149222192,1182748880,3475680,1152700960,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
33539920,3248,33543168,1152684272,1186227440,2400,1152689920,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
33547248,3136,33550384,1152681120,1186231504,2080,1152686336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
33565648,2736,33568384,1152667216,1186235600,46016,1152715968,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
33570064,2768,33572832,1152710064,1186282896,3462240,1156175072,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
33573280,2640,33575920,1156171008,1189746928,1984,1156175632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
33576480,2656,33579136,1156171856,1189750992,2452064,1158626576,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
33616560,2800,33619360,1158585168,1192204528,1888,1158589856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
33656784,2640,33659424,1158549200,1192208624,34645696,1193197536,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
33687520,2704,33690224,1193166560,1226856784,139968,1193309232,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
33691632,3184,33694816,1193304208,1226999024,12761440,1206068832,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
33695344,2784,33698128,1206065056,1239763184,1920,1206069760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
33698672,3184,33701856,1206065424,1239767280,10456096,1216524704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
33715008,2704,33717712,1216507680,1250225392,1952,1216512336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
33724112,2832,33726944,1216502512,1250229456,864,1216506208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
33752400,2656,33755056,1216476576,1250231632,15792128,1232271360,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
33780528,2448,33782976,1232243792,1266026768,5824160,1238070400,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
33794848,3312,33798160,1238054112,1271852272,1952,1238059376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
33803584,2864,33806448,1238049920,1271856368,1408,1238054192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
33810304,2768,33813072,1238047360,1271860432,2848,1238052976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
33817328,3200,33820528,1238044032,1271864560,3200,1238050432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
33824592,3104,33827696,1238043008,1271870704,1376,1238047488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
33836384,3024,33839408,1238035392,1271874800,4416,1238042832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
33844304,2688,33846992,1238033920,1271880912,1120,1238037728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
33851264,2640,33853904,1238031136,1271885040,1600,1238035376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
33858224,2944,33861168,1238027968,1271889136,1472,1238032384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
33866544,3312,33869856,1238023344,1271893200,1280,1238027936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
33931712,2992,33934704,1237962688,1271897392,26016,1237991696,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
33958256,2912,33961168,1237964800,1271925968,3545984,1241513696,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
33976368,2912,33979280,1241493952,1275473232,2496,1241499360,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
33983168,2576,33985744,1241491488,1275477232,2112,1241496176,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
34001264,3040,34004304,1241477024,1275481328,47552,1241527616,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
34006352,2992,34009344,1241521424,1275530768,4259520,1245783936,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
34009760,2672,34012432,1245780992,1279793424,3712,1245787376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
34012944,2608,34015552,1245783984,1279799536,2444704,1248231296,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
34050960,3472,34054432,1248191440,1282245872,1824,1248196736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
34103904,2752,34106656,1248143280,1282249936,24882560,1273028592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
34187600,3696,34191296,1272943952,1307135248,12475168,1285422816,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
34216080,3328,34219408,1285393248,1319612656,2339296,1287735872,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
34233888,2992,34236880,1287717664,1321954544,3722080,1291442736,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
34239456,2528,34241984,1291436848,1325678832,3736032,1295175408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
34248800,2864,34251664,1295164768,1329416432,5150368,1300318000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
34259200,2592,34261792,1300307408,1334569200,5873152,1306183152,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
34270608,2880,34273488,1306170400,1340443888,238904576,1545077856,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
34302512,3696,34306208,1545045104,1579351312,2158912,1547207712,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
34306752,2560,34309312,1547203600,1581512912,1984,1547208144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
34315600,2880,34318480,1547198560,1581517040,2880,1547204320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
34323536,9296,34332832,1547188368,1581521200,1536,1547199200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
34351312,2768,34354080,1547171056,1581525136,54208,1547228032,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
34366992,3264,34370256,1547210368,1581580624,2747456,1549961088,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
34396800,2800,34399600,1549930336,1584329936,1920,1549935056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
34436816,2784,34439600,1549894464,1584334064,7804864,1557702112,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
34475856,2848,34478704,1557662368,1592141072,5612512,1563277728,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
34489264,3056,34492320,1563263312,1597755632,3661824,1566928192,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
34505120,3200,34508320,1566911184,1601419504,2400,1566916784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
34512384,2848,34515232,1566908336,1601423568,2112,1566913296,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
34529744,2720,34532464,1566895232,1601427696,46240,1566944192,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
34534256,3040,34537296,1566938528,1601475824,3859104,1570800672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
34537760,2592,34540352,1570796976,1605337328,1952,1570801520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
34540848,2416,34543264,1570798192,1605341456,2438848,1573239456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
34571760,2848,34574608,1573208032,1607782640,1920,1573212800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
34610608,2720,34613328,1573173408,1607786736,34043744,1607219872,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
34641248,2688,34643936,1607187888,1641831824,139840,1607330416,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
34645392,2848,34648240,1607324704,1641972944,12366720,1619694272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
34648656,2384,34651040,1619690832,1654341872,1920,1619695136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
34651472,2992,34654464,1619691504,1654345968,10667840,1630362336,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
34667152,2928,34670080,1630345968,1665016048,1984,1630350880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
34676304,3024,34679328,1630340816,1665020144,2560,1630346400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
34702592,2608,34705200,1630319040,1665024240,15704512,1646026160,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
34729936,2912,34732848,1645997504,1680730352,5454720,1651455136,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
34743968,3360,34747328,1651439152,1686186480,1952,1651444464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
34752832,2992,34755824,1651433920,1686189744,1440,1651438352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
34759696,2672,34762368,1651431024,1686193392,1312,1651435008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
34766368,3120,34769488,1651428000,1686197488,3264,1651434384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
34773616,2736,34776352,1651427248,1686203600,1344,1651431328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
34784832,3008,34787840,1651419888,1686207728,4640,1651427536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
34792688,2544,34795232,1651418640,1686213872,1088,1651422272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
34799952,2784,34802736,1651415232,1686217968,1632,1651419648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
34806848,2704,34809552,1651412608,1686222160,1504,1651416816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
34814544,2896,34817440,1651408720,1686226160,1280,1651412896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
34878832,3136,34881968,1651348288,1686230256,27264,1651378688,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
34907072,3184,34910256,1651348672,1686258928,3493056,1654844912,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
34928800,3280,34932080,1654821792,1689753872,2464,1654827536,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
34936064,2816,34938880,1654819056,1689757936,2016,1654823888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
34954144,2720,34956864,1654805168,1689762032,47456,1654855344,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
34958784,2800,34961584,1654849568,1689811152,3918208,1658770576,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
34962064,2448,34964512,1658766544,1693731056,3392,1658772384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
34964976,2544,34967520,1658769680,1693737200,2845728,1661617952,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
35000496,3072,35003568,1661582400,1696585968,1856,1661587328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
35048800,6928,35055728,1661534368,1696590096,25301536,1686842832,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
35154928,5136,35160064,1686734032,1721894096,11901664,1698640832,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
35184208,5216,35189424,1698608960,1733798384,2551328,1701165504,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
35203680,2864,35206544,1701145440,1736351984,3738560,1704886864,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
35208960,2960,35211920,1704880704,1740092624,3951712,1708835376,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
35218672,4384,35223056,1708823264,1744046320,5119744,1713947392,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
35230784,5216,35236000,1713931344,1749167344,5697824,1719634384,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
35244976,3472,35248448,1719619472,1754867920,240193088,1959816032,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
35284608,3456,35288064,1959774480,1995062544,2167328,1961945264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
35288640,2688,35291328,1961941040,1997232368,1920,1961945648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
35298272,3152,35301424,1961935008,1997236432,2944,1961941104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
35306416,4000,35310416,1961930240,1997240656,1504,1961935744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
35329728,3936,35333664,1961910960,1997244624,47296,1961962192,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
35346480,3856,35350336,1961943472,1997293808,2750016,1964697344,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
35377088,3360,35380448,1964665840,2000046288,1952,1964671152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
35421120,4240,35425360,1964625056,2000050416,7806304,1972435600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
35465136,4736,35469872,1972389600,2007859472,5472288,1977866624,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
35480464,3872,35484336,1977850432,2013334768,3708736,1981563040,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
35498128,3440,35501568,1981544144,2017045712,6624,1981554208,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
35505536,3952,35509488,1981544448,2017053936,2144,1981550544,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
35524032,3344,35527376,1981530624,2017058000,47936,1981581904,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
35529584,3696,35533280,1981573936,2017107216,4063680,1985641312,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
35533744,4272,35538016,1985635472,2021173488,1952,1985641696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
35538640,4144,35542784,1985634800,2021177584,2438432,1988077376,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
35575616,3312,35578928,1988038848,2023617776,1920,1988044080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
35615008,3456,35618464,1988003408,2023621872,34049568,2022056432,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
35655808,3200,35659008,2022014960,2057673968,139872,2022158032,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
35660464,3520,35663984,2022152288,2057816272,11888096,2034043904,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
35664912,6000,35670912,2034035024,2069705936,1984,2034043008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
35671344,3808,35675152,2034034912,2069710064,10741088,2044779808,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
35689952,3264,35693216,2044760656,2080453872,1952,2044765872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
35698960,3104,35702064,2044755904,2080457968,2496,2044761504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
35726064,3472,35729536,2044732528,2080462064,16236448,2060972448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
35754320,3344,35757664,2060942960,2096700624,5467584,2066413888,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
35771184,4720,35775904,2066394928,2102170832,1952,2066401600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
35782272,3152,35785424,2066389536,2102174960,1440,2066394128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
35789024,2768,35791792,2066387264,2102179056,1312,2066391344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
35795968,2832,35798800,2066383104,2102181904,3456,2066389392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
35803104,3072,35806176,2066381072,2102187248,1344,2066385488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
35815392,3456,35818848,2066372432,2102191280,4608,2066380496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
35823776,2896,35826672,2066370816,2102197488,1088,2066374800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
35831184,2976,35834160,2066367360,2102201520,1632,2066371968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
35838464,11024,35849488,2066356192,2102205680,1728,2066368944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
35856272,3136,35859408,2066350368,2102209776,1280,2066354784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
35920992,3344,35924336,2066289504,2102213840,26368,2066319216,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
35950704,3280,35953984,2066288560,2102242544,3495232,2069787072,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
35970352,3616,35973968,2069766560,2105740528,2496,2069772672,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
35978512,5664,35984176,2069760448,2105744624,1984,2069768096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
35999808,3184,36002992,2069745728,2105748720,47232,2069796144,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
36005040,3312,36008352,2069789488,2105797840,3515456,2073308256,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
36009264,4784,36014048,2073302256,2109316304,3360,2073310400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
36015072,4448,36019520,2073302960,2109322480,2434016,2075741424,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
36053872,3184,36057056,2075701520,2111758576,1888,2075706592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
36107056,3776,36110832,2075651840,2111762672,25849184,2101504800,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
36190640,5216,36195856,2101418752,2137614608,11818912,2113242880,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
36218672,3776,36222448,2113214272,2149436720,2354816,2115572864,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
36235920,3504,36239424,2115553488,2151792912,3750336,2119307328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
36241808,3184,36244992,2119299792,2155544784,4064384,2123367360,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
36251648,4896,36256544,2123355568,2159612112,5416480,2128776944,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
36264336,3504,36267840,2128763312,2165031152,5667744,2134434560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
36276400,3280,36279680,2134420496,2170700176,242080160,2376503936,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
36308848,4816,36313664,2376469200,2412782864,2159488,2378633504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
36314336,4656,36318992,2378625504,2414944496,1952,2378632112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
36328336,3696,36332032,2378616560,2414948592,2944,2378623200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
36337120,3536,36340656,2378611904,2414952560,1504,2378616944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
36358736,4160,36362896,2378592416,2414955312,49536,2378646112,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
36375328,3776,36379104,2378627824,2415006928,2752224,2381383824,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
36407392,4912,36412304,2381348192,2417760496,1888,2381354992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
36451232,3680,36454912,2381309648,2417764560,7814080,2389127408,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
36492672,3088,36495760,2389085056,2425580816,5456192,2394544336,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
36507072,18896,36525968,2394512704,2431038672,3483520,2398015120,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
36542272,3568,36545840,2397978784,2434524624,6336,2397988688,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
36549792,3424,36553216,2397979376,2434532592,36384,2398019184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
36567776,3184,36570960,2398000544,2434571504,54208,2398057936,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
36572704,3856,36576560,2398052288,2434628848,4283872,2402340016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
36577008,3680,36580688,2402333568,2438914256,1952,2402339200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
36581296,2848,36584144,2402334240,2438918384,2440160,2404777248,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
36620784,6128,36626912,2404733712,2441360624,1888,2404741728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
36668480,3504,36671984,2404692736,2441364720,33763776,2438460016,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
36703360,3552,36706912,2438424336,2475131248,139488,2438567376,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
36708528,3024,36711552,2438560880,2475272432,12292416,2450856320,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
36712096,2912,36715008,2450852560,2487567568,2176,2450857648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
36715456,3760,36719216,2450852512,2487571728,10786304,2461642576,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
36733264,3184,36736448,2461624112,2498360560,1920,2461629216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
36742272,8800,36751072,2461613584,2498364656,832,2461623216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
36777024,3056,36780080,2461586688,2498366768,15820672,2477410416,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
36803984,3600,36807584,2477382992,2514190576,5490432,2482877024,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
36820768,3200,36823968,2482859376,2519683344,2272,2482864848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
36829504,4096,36833600,2482853840,2519687440,1408,2482859344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
36837408,3936,36841344,2482850160,2519691504,3712,2482857808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
36845664,3024,36848688,2482848960,2519697648,8064,2482860048,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
36852736,4016,36856752,2482851104,2519707856,1568,2482856688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
36865424,3648,36869072,2482842848,2519711920,8096,2482854592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
36873712,2848,36876560,2482845664,2519722224,6880,2482855392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
36880880,3072,36883952,2482846432,2519730384,1632,2482851136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
36888176,3216,36891392,2482843120,2519734512,14048,2482860384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
36896080,3040,36899120,2482851776,2519750896,3648,2482858464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
36960640,3008,36963648,2482793392,2519757040,93376,2482889776,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
36987088,3056,36990144,2482863120,2519853264,3592384,2486458560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
37012352,4400,37016752,2486431808,2523448560,2912,2486439120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
37020624,3760,37024384,2486428336,2523452720,2240,2486434336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
37039008,4400,37043408,2486413344,2523456752,47712,2486465456,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
37045504,3424,37048928,2486456976,2523505904,3622240,2490082640,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
37049360,2816,37052176,2490077632,2527129808,4000,2490084448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
37052672,2880,37055552,2490080432,2527135984,2437120,2492520432,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
37098880,4256,37103136,2492473072,2529576208,1856,2492479184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
37145296,3792,37149088,2492431184,2529580272,25405312,2517840288,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
37232240,4576,37236816,2517750048,2554986864,12071296,2529825920,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
37259696,4160,37263856,2529798144,2567062000,2347552,2532149856,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
37277456,3328,37280784,2532130048,2569410832,3711616,2535844992,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
37283104,2512,37285616,2535838208,2573123824,4098912,2539939632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
37292432,3168,37295600,2539928384,2577223984,5356480,2545288032,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
37302816,2704,37305520,2545276992,2582582512,5691456,2550971152,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
37313312,3648,37316960,2550960048,2588277008,239531264,2790494960,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
37344224,3120,37347344,2790462720,2827810064,2158528,2792624368,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
37347904,2576,37350480,2792620160,2829970640,1984,2792624720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
37356720,3328,37360048,2792614720,2829974768,2720,2792620768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
37364784,4608,37369392,2792609472,2829978864,1504,2792615584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
37393408,2928,37396336,2792586592,2829982928,46080,2792635600,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
37409136,3120,37412256,2792619824,2830032080,2749120,2795372064,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
37439296,2944,37442240,2795341360,2832783600,1920,2795346224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
37479072,2704,37481776,2795305920,2832787696,7819616,2803128240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
37516160,3232,37519392,2803090640,2840610032,5449728,2808543600,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
37532224,3216,37535440,2808527392,2846062832,3479168,2812009776,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
37549472,3072,37552544,2811990864,2849543408,2336,2811996272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
37556528,3008,37559536,2811987968,2849547504,1984,2811992960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
37573568,3168,37576736,2811974864,2849551600,46464,2812024496,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
37578480,3008,37581488,2812019232,2849600720,3413024,2815435264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
37581936,2864,37584800,2815430992,2853015792,1984,2815435840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
37585360,2768,37588128,2815431760,2853019888,2757152,2818191680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
37617264,4032,37621296,2818158240,2855779536,1856,2818164128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
37659664,3504,37663168,2818120464,2855783632,33791744,2851915712,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
37691024,2912,37693936,2851882784,2889576720,141536,2852027232,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
37695328,2832,37698160,2852022912,2889721072,12811136,2864836880,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
37698544,2608,37701152,2864833200,2902534352,2208,2864838016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
37701600,2752,37704352,2864834128,2902538480,10362432,2875199312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
37716720,2576,37719296,2875184112,2912903408,1952,2875188640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
37724768,2944,37727712,2875179760,2912907472,864,2875183568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
37749280,2768,37752048,2875157568,2912909616,15744352,2890904688,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
37775392,3920,37779312,2890877312,2928656624,5465664,2896346896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
37791264,3024,37794288,2896330464,2934124752,1984,2896335472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
37799824,3520,37803344,2896325568,2934128912,1408,2896330496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
37807136,3280,37810416,2896322560,2934132976,3680,2896329520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
37814592,3632,37818224,2896320896,2934139120,3488,2896328016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
37822464,3120,37825584,2896319552,2934145136,1344,2896324016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
37834608,3552,37838160,2896309568,2934147728,4608,2896317728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
37842928,3200,37846128,2896308224,2934154352,1120,2896312544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
37850432,3408,37853840,2896304736,2934158576,1632,2896309776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
37858000,3136,37861136,2896301536,2934162672,1472,2896306144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
37866208,3088,37869296,2896297472,2934166768,1280,2896301840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
37929552,2752,37932304,2896238560,2934170864,25920,2896267232,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
37955648,3056,37958704,2896240832,2934199536,3495488,2899739376,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
37973808,2992,37976800,2899719696,2937696496,2528,2899725216,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
37980720,2896,37983616,2899716944,2937700560,1920,2899721760,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
37998832,2784,38001616,2899703040,2937704656,48864,2899754688,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
38003584,2944,38006528,2899748336,2937754864,3453632,2903204912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
38006944,2448,38009392,2903201440,2941210832,3808,2903207696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
38009872,2736,38012608,2903204400,2941217008,2435392,2905642528,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
38055008,2928,38057936,2905596224,2943654160,1888,2905601040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
38108384,2928,38111312,2905546912,2943658224,24871360,2930421200,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
38195520,3904,38199424,2930332752,2968532176,12473728,2942810384,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
38223248,4864,38228112,2942781504,2981009616,2342880,2945129248,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
38242272,2864,38245136,2945109472,2983354608,3711520,2948823856,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
38247584,2784,38250368,2948817264,2987067632,3730304,2952550352,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
38257152,2576,38259728,2952540384,2990800112,5451680,2957994640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
38267296,2592,38269888,2957983504,2996253392,5726816,2963712912,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
38277792,2768,38280560,2963702656,3001983216,240209920,3203915344,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
38309616,3088,38312704,3203883536,3242196240,2180576,3206067200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
38313152,2448,38315600,3206063776,3244379376,1984,3206068208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
38322912,3104,38326016,3206057488,3244383504,2752,3206063344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
38330832,2832,38333664,3206053872,3244387536,1504,3206058208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
38351760,2896,38354656,3206037008,3244391664,45632,3206085536,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
38367104,3072,38370176,3206068560,3244438736,2899360,3208970992,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
38396480,3024,38399504,3208941280,3247340784,2016,3208946320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
38437408,2688,38440096,3208904752,3247344848,8260608,3217168048,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
38475872,2560,38478432,3217130128,3255608560,5606272,3222738960,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
38489328,2960,38492288,3222724752,3261217040,3532864,3226260576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
38505936,3264,38509200,3226242624,3264751824,2528,3226248416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
38513008,2928,38515936,3226239984,3264755920,1984,3226244896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
38530208,3168,38533376,3226226672,3264760048,46304,3226276144,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
38535184,3664,38538848,3226269296,3264808144,3517760,3229790720,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
38539344,3440,38542784,3229784880,3268327664,2144,3229790464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
38543360,2480,38545840,3229785920,3268331760,2417696,3232206096,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
38574352,2848,38577200,3232174272,3270751472,1888,3232179008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
38613264,2800,38616064,3232139504,3270755568,34255616,3266397920,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
38645744,3136,38648880,3266364672,3305013552,141536,3266509344,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
38650320,3040,38653360,3266504512,3305157872,12819968,3279327520,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
38653936,2960,38656896,3279322448,3317979344,2464,3279327872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
38657648,3616,38661264,3279322208,3317983472,10346848,3289672672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
38675312,3488,38678800,3289654240,3328333040,2144,3289659872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
38684480,4000,38688480,3289648656,3328337136,864,3289653520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
38711056,3552,38714608,3289624672,3328339280,15735488,3305363712,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
38737776,2624,38740400,3305336640,3344077040,5454016,3310793280,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
38752544,3856,38756400,3310776512,3349532912,2016,3310782384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
38764400,3424,38767824,3310769184,3349537008,1408,3310774016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
38771568,3488,38775056,3310766048,3349541104,1312,3310770848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
38778976,3232,38782208,3310762992,3349545200,3456,3310769680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
38786480,3280,38789760,3310761584,3349551344,1312,3310766176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
38798528,3984,38802512,3310753056,3349555568,4224,3310761264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
38807280,2832,38810112,3310751408,3349561520,1088,3310755328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
38814272,2928,38817200,3310748480,3349565680,1632,3310753040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
38821696,3744,38825440,3310744304,3349569744,1504,3310749552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
38830464,3072,38833536,3310740336,3349573872,1280,3310744688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
38913568,3008,38916576,3310661360,3349577936,26720,3310691088,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
38942128,3168,38945296,3310661344,3349606640,3496640,3314161152,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
38965424,3504,38968928,3314135824,3353104752,2400,3314141728,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
38972752,2912,38975664,3314133056,3353108720,2112,3314138080,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
38991056,2992,38994048,3314118768,3353112816,47680,3314169440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
38996160,3120,38999280,3314163680,3353162960,3506560,3317673360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
38999728,2464,39002192,3317670016,3356672208,3680,3317676160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
39002720,2512,39005232,3317673120,3356678352,2438752,3320114384,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
39040000,2816,39042816,3320076784,3359119600,1888,3320081488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
39094368,2976,39097344,3320026320,3359123664,24909184,3344938480,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
39177216,3904,39181120,3344854448,3384035568,12198048,3357056400,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
39203856,3760,39207616,3357029168,3396236784,2509216,3359542144,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
39221088,3152,39224240,3359523232,3398747472,3777248,3363303632,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
39226560,2752,39229312,3363296688,3402526000,3770368,3367069808,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
39236096,2992,39239088,3367060256,3406299344,5082752,3372146000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
39246496,2816,39249312,3372135248,3411384560,5710464,3377848528,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
39256992,3488,39260480,3377837424,3417097904,240101408,3617942320,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
39290672,3024,39293696,3617907216,3657200912,2166688,3620076928,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
39294160,2768,39296928,3620073808,3659370736,1920,3620078496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
39303136,3152,39306288,3620068544,3659374832,2528,3620074224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
39310944,3008,39313952,3620064944,3659378896,1536,3620069488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
39330736,2976,39333712,3620049184,3659382896,45856,3620098016,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
39345776,3440,39349216,3620081904,3659431120,2762624,3622847968,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
39375168,5648,39380816,3622815104,3662195920,1920,3622822672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
39418000,2976,39420976,3622779040,3662200016,8099264,3630881280,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
39456784,2592,39459376,3630841600,3670300976,5523968,3636368160,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
39469776,3200,39472976,3636353472,3675826448,3822336,3640179008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
39486640,3344,39489984,3640160080,3679650064,2528,3640165952,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
39493872,3344,39497216,3640156912,3679654128,2080,3640162336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
39511136,3280,39514416,3640143808,3679658224,46624,3640193712,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
39516128,3728,39519856,3640187488,3679707344,3806144,3643997360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
39520288,3552,39523840,3643990928,3683514768,1920,3643996400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
39524400,4752,39529152,3643989552,3683518704,2444096,3646438400,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
39558256,2864,39561120,3646403920,3685965040,1920,3646408704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
39597840,3616,39601456,3646367680,3685969136,34983616,3681354912,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
39630896,3184,39634080,3681320080,3720954160,139744,3681463008,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
39635648,3440,39639088,3681456320,3721095408,12296512,3693756272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
39639504,2592,39642096,3693752544,3733394640,9696,3693764832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
39642576,2624,39645200,3693761760,3733406960,10774656,3704539040,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
39667072,3872,39670944,3704513616,3744184560,7232,3704524720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
39676736,3872,39680608,3704514320,3744194928,3328,3704521520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
39703200,2864,39706064,3704494912,3744200976,15784672,3720282448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
39729776,2608,39732384,3720254608,3759986992,5478976,3725736192,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
39744400,3600,39748000,3725720400,3765468400,1952,3725725952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
39753696,3280,39756976,3725715520,3765472496,1440,3725720240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
39760768,3296,39764064,3725712528,3765476592,1280,3725717104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
39767872,3264,39771136,3725709520,3765480656,3456,3725716240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
39775184,3504,39778688,3725708112,3765486800,1312,3725712928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
39787168,4032,39791200,3725699600,3765490800,4448,3725708080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
39795856,3600,39799456,3725697584,3765497040,1312,3725702496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
39803984,3072,39807056,3725692672,3765499728,1632,3725697376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
39811120,3008,39814128,3725689088,3765503216,1472,3725693568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
39818976,3296,39822272,3725685040,3765507312,1280,3725689616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
39883376,3584,39886960,3725624448,3765511408,24768,3725652800,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
39910752,3136,39913888,3725624144,3765538032,3497504,3729124784,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
39929792,3168,39932960,3729104080,3769037040,2464,3729109712,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
39936864,3872,39940736,3729100400,3769041136,2016,3729106288,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
39955568,3680,39959248,3729085984,3769045232,48544,3729138208,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
39961248,3008,39964256,3729131120,3769095376,3424864,3732558992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
39964912,3120,39968032,3732554736,3772522768,3552,3732561408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
39968656,3120,39971776,3732557136,3772528912,2510688,3735070944,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
40005600,3392,40008992,3735032784,3775041776,1888,3735038064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
40050128,3184,40053312,3734992560,3775045872,24845056,3759840800,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
40142992,3632,40146624,3759746608,3799893232,11830912,3771581152,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
40169056,3440,40172496,3771553984,3811726480,2388928,3773946352,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
40185728,3184,40188912,3773928704,3814117616,3942304,3777874192,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
40191168,3056,40194224,3777867808,3818062032,3950304,3781821168,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
40201120,3424,40204544,3781810192,3822014736,5234368,3787047984,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
40211856,3824,40215680,3787034736,3827250416,5660672,3792699232,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
40223504,3312,40226816,3792686320,3832913136,240325056,4033014688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
40257104,3344,40260448,4032980400,4073240848,2157632,4035141376,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
40260928,2688,40263616,4035136784,4075400400,1952,4035141424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
40270096,3296,40273392,4035131104,4075404496,2560,4035136960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
40278304,3280,40281584,4035127040,4075408624,1504,4035131824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
40298560,2992,40301552,4035111232,4075412784,50400,4035164624,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
40313952,3136,40317088,4035148848,4075465936,2760608,4037912592,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
40342080,3616,40345696,4037882160,4078227856,1952,4037887728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
40382288,2880,40385168,4037846624,4078231792,7826784,4045676288,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
40427632,2976,40430608,4045630720,4086061328,5463200,4051096896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
40440912,3392,40444304,4051082048,4091526352,3570432,4054655872,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
40458800,3744,40462544,4054636640,4095099184,2336,4054642720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
40466544,3232,40469776,4054633408,4095103184,2208,4054638848,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
40484256,3184,40487440,4054619872,4095107312,48384,4054671440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
40489216,3200,40492416,4054665072,4095157488,4305856,4058974128,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
40492944,2896,40495840,4058969616,4099465456,1920,4058974432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
40496384,3168,40499552,4058970032,4099469584,2451072,4061424272,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
40530736,3024,40533760,4061389328,4101923088,1856,4061394208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
40570688,3232,40573920,4061353200,4101927120,33911744,4095268176,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
40602272,4112,40606384,4095234624,4135841008,206816,4095445552,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
40607856,2976,40610832,4095440096,4136050928,12091680,4107534752,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
40611248,2736,40613984,4107530352,4148144336,2208,4107535296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
40614416,2848,40617264,4107531200,4148148464,10751008,4118285056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
40629648,2832,40632480,4118270032,4158902512,1920,4118274784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
40637920,2672,40640592,4118266016,4158906608,3328,4118272016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
40663168,3264,40666432,4118246320,4158912752,15259232,4133508816,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
40689488,4000,40693488,4133480160,4174173648,5466400,4138950560,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
40706640,4048,40710688,4138931984,4179642672,1920,4138937952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
40715904,3392,40719296,4138927408,4179646704,1440,4138932240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
40723024,2944,40725968,4138924800,4179650768,1312,4138929056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
40729808,3264,40733072,4138921824,4179654896,3072,4138928160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
40737152,3280,40740432,4138920608,4179661040,1312,4138925200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
40749472,3264,40752736,4138912304,4179665040,4800,4138920368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
40757424,2800,40760224,4138911024,4179671248,1120,4138914944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
40764736,2992,40767728,4138907584,4179675312,1632,4138912208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
40771824,2960,40774784,4138904688,4179679472,1568,4138909216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
40779488,3328,40782816,4138900720,4179683536,1248,4138905296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
40844480,3120,40847600,4138840096,4179687696,28672,4138871888,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
40869664,3360,40873024,4138845360,4179718384,3498816,4142347536,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
40890320,3984,40894304,4142324176,4183218480,2432,4142330592,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
40898320,3280,40901600,4142320912,4183222512,2112,4142326304,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
40917184,3712,40920896,4142305680,4183226576,48096,4142357488,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
40923136,3152,40926288,4142350464,4183276752,3518400,4145872016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
40926736,2864,40929600,4145866864,4186796464,3456,4145873184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
40930064,2896,40932960,4145869488,4186802448,2435904,4148308288,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
40967040,3232,40970272,4148270288,4189240560,1888,4148275408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
41011104,2800,41013904,4148230752,4189244656,26090176,4174323728,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
41102608,4128,41106736,4174230464,4215337200,12096896,4186331488,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
41130176,3280,41133456,4186303552,4227437008,2347104,4188653936,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
41146768,3696,41150464,4188636400,4229786864,3730976,4192371072,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
41152720,3984,41156704,4192362608,4233519312,4067328,4196433920,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
41168160,3184,41171344,4196417344,4237588688,5428096,4201848624,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
41178784,2928,41181712,4201837312,4243019024,5745408,4207585648,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
41189504,2800,41192304,4207574400,4248766704,242399936,4449977136,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
41222176,3840,41226016,4449942032,4491168048,2168800,4452114672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
41226608,2656,41229264,4452109632,4493338896,1920,4452114208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
41235472,3184,41238656,4452104304,4493342960,2880,4452110368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
41243360,2976,41246336,4452100848,4493347184,1504,4452105328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
41263632,5136,41268768,4452082416,4493351184,46592,4452134144,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
41281440,3328,41284768,4452114480,4493399248,2748320,4454866128,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
41311552,3232,41314784,4454834960,4496149744,1952,4454840144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
41351648,3280,41354928,4454798944,4496153872,7929856,4462732080,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
41396240,3328,41399568,4462687008,4504086576,5458016,4468148352,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
41410160,3456,41413616,4468133120,4509546736,3492480,4471629056,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
41428480,3344,41431824,4471609920,4513041744,2400,4471615664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
41435856,3264,41439120,4471606592,4513045712,1984,4471611840,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
41453632,3040,41456672,4471593168,4513049840,47232,4471643440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
41458464,2768,41461232,4471638784,4513100016,4172256,4475813808,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
41461792,2768,41464560,4475809248,4517273808,1984,4475814000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
41465120,3056,41468176,4475809760,4517277936,2537024,4478349840,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
41497568,5216,41502784,4478313648,4519816432,1888,4478320752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
41538912,2960,41541872,4478278688,4519820560,33533088,4511814736,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
41568368,3408,41571776,4511783760,4553355536,157600,4511944768,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
41573200,3056,41576256,4511938992,4553515248,12645408,4524587456,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
41576672,2544,41579216,4524583424,4566162640,2432,4524588400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
41579616,2624,41582240,4524584528,4566166768,10464160,4535051312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
41597904,2864,41600768,4535031440,4576632208,2400,4535036704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
41606352,3200,41609552,4535026592,4576636144,2208,4535032000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
41631648,5152,41636800,4535003440,4576640240,15692288,4550700880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
41660768,2880,41663648,4550670416,4592334064,5631424,4556304720,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
41675808,3024,41678832,4556289280,4597968112,2560,4556294864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
41684272,3296,41687568,4556284640,4597972208,1440,4556289376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
41691328,2960,41694288,4556281984,4597976272,1472,4556286416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
41699664,3056,41702720,4556277648,4597980368,3680,4556284384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
41706768,2784,41709552,4556276928,4597986480,3136,4556282848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
41718288,3824,41722112,4556270576,4597992688,6432,4556280832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
41727056,2976,41730032,4556270848,4598000880,1280,4556275104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
41734256,3424,41737680,4556267296,4598004976,7072,4556277792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
41741776,2768,41744544,4556268880,4598013424,11168,4556282816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
41749424,3360,41752784,4556274720,4598027504,1248,4556279328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
41813760,3216,41816976,4556214624,4598031600,71488,4556289328,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
41839776,3104,41842880,4556262416,4598105296,3607424,4559872944,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
41857984,2992,41860976,4559853024,4601714000,2464,4559858480,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
41864976,3152,41868128,4559849872,4601718000,2080,4559855104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
41883168,2768,41885936,4559836160,4601722096,48672,4559887600,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
41887840,3056,41890896,4559881408,4601772304,3869632,4563754096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
41891296,3440,41894736,4563750272,4605645008,4032,4563757744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
41895280,2944,41898224,4563752928,4605651152,2434688,4566190560,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
41940368,4848,41945216,4566142064,4608087280,1856,4566148768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
41986240,3168,41989408,4566102000,4608091408,25006880,4591112048,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
42064880,11392,42076272,4591024256,4633100528,12395104,4603430752,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
42098816,3264,42102080,4603396976,4645499056,2352544,4605752784,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
42115104,2848,42117952,4605736368,4647854320,3720192,4609459408,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
42120208,3216,42123424,4609454160,4651577584,3872096,4613329472,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
42130048,2976,42133024,4613319472,4655452496,5580512,4618902960,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
42140336,3216,42143552,4618890736,4661034288,5712640,4624606592,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
42151568,2848,42154416,4624594752,4666749168,241404896,4866002496,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
42184416,3072,42187488,4865968688,4908156176,2166912,4868138672,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
42188048,4256,42192304,4868132672,4910324976,2016,4868138944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
42198960,3168,42202128,4868126944,4910329072,2912,4868133024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
42207552,3536,42211088,4868122176,4910333264,1536,4868127248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
42228352,3328,42231680,4868105584,4910337264,48064,4868156976,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
42243984,3664,42247648,4868140784,4910388432,2752704,4870897152,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
42273360,3472,42276832,4870866160,4913142992,1920,4870871552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
42313360,2880,42316240,4870830880,4913147120,7930720,4878764480,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
42351024,2784,42353808,4878725344,4921079152,5452960,4884181088,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
42365344,3120,42368464,4884166432,4926534896,3469120,4887638672,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
42381936,3200,42385136,4887621216,4930006352,2464,4887626880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
42389376,3136,42392512,4887617808,4930010320,2016,4887622960,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
42407104,3024,42410128,4887604320,4930014448,46528,4887653872,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
42412112,2880,42414992,4887648608,4930063600,3409568,4891061056,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
42415504,2912,42418416,4891057120,4933475536,1952,4891061984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
42418944,2592,42421536,4891058128,4933479664,2424224,4893484944,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
42450368,2896,42453264,4893452256,4935905520,1888,4893457040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
42490640,4240,42494880,4893414768,4935909648,33606624,4927025632,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
42523328,3088,42526416,4926992960,4969519376,139712,4927135760,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
42527904,2960,42530864,4927130816,4969661680,12773024,4939906800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
42531376,2512,42533888,4939902192,4982436080,2176,4939906880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
42534288,2912,42537200,4939902976,4982440176,10351520,4950257408,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
42549168,3008,42552176,4950240800,4992792976,1920,4950245728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
42557632,3136,42560768,4950236144,4992796912,832,4950240112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
42582272,4560,42586832,4950212224,4992799056,15773088,4965989872,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
42610448,2688,42613136,4965961600,5008574736,5499680,4971463968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
42624080,3872,42627952,4971448704,5014076656,2496,4971455072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
42633792,3760,42637552,4971443200,5014080752,1440,4971448400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
42641376,3296,42644672,4971440176,5014084848,3712,4971447184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
42648848,11888,42660736,4971430256,5014090992,3584,4971445728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
42664816,3616,42668432,4971428576,5014097008,1344,4971433536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
42678416,3136,42681552,4971419840,5014101392,4544,4971427520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
42686544,2944,42689488,4971417920,5014107408,1088,4971421952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
42693952,3616,42697568,4971413904,5014111472,1600,4971419120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
42701728,3088,42704816,4971410720,5014115536,1920,4971415728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
42709776,3056,42712832,4971406832,5014119664,1248,4971411136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
42774272,3312,42777584,4971346144,5014123728,26144,4971375600,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
42800128,3248,42803376,4971349120,5014152496,3804640,4975157008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
42818640,3056,42821696,4975136944,5017958640,22080,4975162080,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
42825472,3040,42828512,4975154672,5017983184,32192,4975189904,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
42843696,2976,42846672,4975171360,5018018032,47840,4975222176,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
42848704,2736,42851440,4975216736,5018068176,3836736,4979056208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
42851872,2672,42854544,4979051712,5021906256,3744,4979058128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
42855056,2752,42857808,4979054528,5021912336,2440928,4981498208,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
42891168,3120,42894288,4981460288,5024354576,1856,4981465264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
42934592,3792,42938384,4981420256,5024358640,24941184,5006365232,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
43012032,3600,43015632,5006285568,5049301200,12450592,5018739760,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
43037520,3328,43040848,5018714496,5061755344,2347648,5021065472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
43053808,2832,43056640,5021048560,5064105200,3717760,5024769152,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
43058816,2960,43061776,5024762688,5067824464,3725984,5028491632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
43077152,2800,43079952,5028471744,5071551696,5502592,5033977136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
43087168,3392,43090560,5033965168,5077055728,5676000,5039644560,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
43098672,3280,43101952,5039632912,5082734864,240707424,5280343616,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
43131232,3136,43134368,5280310128,5323444496,2169536,5282482800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
43134784,2784,43137568,5282477744,5325615312,1952,5282482480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
43144112,3472,43147584,5282471856,5325619440,2880,5282478208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
43152112,2928,43155040,5282468560,5325623600,1536,5282473024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
43171808,2768,43174576,5282453056,5325627632,47104,5282502928,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
43187280,3328,43190608,5282486144,5325676752,2767680,5285257152,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
43218224,3136,43221360,5285225344,5328446704,1920,5285230400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
43258944,4080,43263024,5285187776,5328450800,8481312,5293673168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
43297584,3776,43301360,5293632288,5336933648,5526464,5299162528,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
43311920,3280,43315200,5299146992,5342462192,3485760,5302636032,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
43330368,4160,43334528,5302615408,5345949936,2400,5302621968,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
43338352,2992,43341344,5302612688,5345954032,1984,5302617664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
43355344,2992,43358336,5302599792,5345958128,46688,5302649472,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
43360288,2992,43363280,5302642944,5346006224,3422112,5306068048,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
43363728,3616,43367344,5306063296,5349430640,1952,5306068864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
43368000,3360,43371360,5306063216,5349434576,2419200,5308485776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
43401296,3168,43404464,5308450880,5351855344,1888,5308455936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
43447696,3296,43450992,5308408416,5351859408,34284960,5342696672,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
43479520,2848,43482368,5342664720,5386147088,139712,5342807280,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
43484000,4368,43488368,5342801024,5386289392,12727072,5355532464,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
43488864,2992,43491856,5355526848,5399018704,1984,5355531824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
43492304,2896,43495200,5355527664,5399022864,10358368,5365888928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
43507552,2944,43510496,5365873200,5409383696,1920,5365878064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
43516336,2816,43519152,5365868608,5409387760,832,5365872256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
43540528,2896,43543424,5365846448,5409389872,15717632,5381566976,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
43566800,3376,43570176,5381540080,5425110256,5460384,5387003840,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
43581664,3664,43585328,5386986912,5430572240,1952,5386992528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
43590800,5296,43596096,5386980272,5430576368,1440,5386987008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
43599648,3680,43603328,5386977136,5430580464,1312,5386982128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
43607376,3168,43610544,5386974016,5430584560,3392,5386980576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
43614384,3504,43617888,5386972784,5430590672,1376,5386977664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
43627120,3712,43630832,5386963968,5430594800,4256,5386971936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
43635568,3712,43639280,5386961696,5430600976,1088,5386966496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
43643600,3984,43647584,5386957456,5430605040,1600,5386963040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
43651664,3360,43655024,5386954080,5430609104,1504,5386958944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
43659968,3760,43663728,5386949600,5430613328,1248,5386954608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
43724128,2992,43727120,5386890176,5430617296,25312,5386918480,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
43749936,3456,43753392,5386890560,5430643952,3500224,5390394240,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
43771760,3200,43774960,5390371104,5434146064,2496,5390376800,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
43781168,3520,43784688,5390365504,5434150192,2112,5390371136,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
43799360,3232,43802592,5390351632,5434154224,49952,5390404816,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
43804544,3648,43808192,5390398256,5434206448,4299072,5394700976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
43808624,2944,43811568,5394696704,5438508272,3648,5394703296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
43812224,2912,43815136,5394699280,5438514416,2441600,5397143792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
43848848,3424,43852272,5397106432,5440958704,1888,5397111744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
43892688,4320,43897008,5397065792,5440962800,24888224,5421958336,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
43978688,3840,43982528,5421869808,5465852336,12351616,5434225264,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
44004944,3200,44008144,5434205792,5478213936,2420480,5436629472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
44021312,3184,44024496,5436612160,5480636656,3707936,5440323280,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
44026976,2896,44029872,5440316704,5484346576,3735616,5444055216,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
44036448,2768,44039216,5444044960,5488084176,5065568,5449113296,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
44047552,2672,44050224,5449101760,5493151984,5827808,5454932240,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
44057952,3200,44061152,5454920464,5498981616,241799776,5696723440,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
44096032,3168,44099200,5696683696,5740782896,2166496,5698853360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
44099648,2768,44102416,5698848448,5742950864,1984,5698853200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
44108928,2864,44111792,5698842912,5742954704,2912,5698848688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
44116624,2832,44119456,5698839472,5742958928,1536,5698843840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
44136320,3392,44139712,5698823184,5742962896,46112,5698872688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
44152480,3328,44155808,5698856240,5743012048,2754048,5701613616,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
44186144,2880,44189024,5701579664,5745768688,1920,5701584464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
44226496,3056,44229552,5701543200,5745772752,7818272,5709364528,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
44267568,2928,44270496,5709322608,5753593104,5449504,5714775040,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
44281088,3328,44284416,5714760400,5759044816,3466176,5718229904,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
44298464,3984,44302448,5718209856,5762512304,2304,5718216144,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
44306352,3072,44309424,5718206784,5762516208,1952,5718211808,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
44323712,4112,44327824,5718192480,5762520304,47168,5718243760,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
44329552,2576,44332128,5718237328,5762569456,3411264,5721651168,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
44332576,2672,44335248,5721648192,5765983440,1952,5721652816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
44335776,2576,44338352,5721649216,5765987568,2425440,5724077232,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
44370160,2992,44373152,5724042352,5768415504,1888,5724047232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
44409296,3216,44412512,5724007056,5768419568,34226240,5758236512,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
44439248,2928,44442176,5758206800,5802648976,140032,5758349760,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
44443744,3120,44446864,5758344288,5802791152,11884448,5770231856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
44447280,2704,44449984,5770226896,5814676880,1920,5770231520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
44450496,2864,44453360,5770227488,5814680848,10341376,5780571728,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
44465360,4704,44470064,5780555200,5825025264,1984,5780561888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
44475600,3792,44479392,5780549968,5825029360,2560,5780556320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
44501312,2688,44504000,5780529456,5825033456,15733664,5796265808,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
44527440,2752,44530192,5796238208,5840768400,5464736,5801705696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
44542064,3776,44545840,5801688576,5846234416,1920,5801694272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
44550864,2816,44553680,5801684800,5846238480,1408,5801689024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
44557152,2976,44560128,5801682384,5846242512,1312,5801686672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
44564160,4992,44569152,5801677456,5846246608,3072,5801685520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
44573088,2736,44575824,5801676928,5846252752,1344,5801681008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
44584048,3360,44587408,5801669472,5846256880,4864,5801677696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
44591984,2880,44594864,5801668192,5846263056,1088,5801672160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
44599088,3312,44602400,5801664752,5846267152,1664,5801669728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
44606464,3824,44610288,5801660896,5846271184,1504,5801666224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
44615008,3696,44618704,5801656608,5846275312,1280,5801661584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
44679024,3312,44682336,5801597040,5846279376,25952,5801626304,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
44706848,2944,44709792,5801598288,5846308080,3495520,5805096752,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
44727696,3312,44731008,5805075024,5849806032,2368,5805080704,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
44734896,4432,44739328,5805070800,5849810128,2112,5805077344,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
44754048,3200,44757248,5805056976,5849814224,48096,5805108272,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
44759184,3328,44762512,5805101920,5849864432,3438592,5808543840,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
44762976,2896,44765872,5808540192,5853306064,3424,5808546512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
44766416,4032,44770448,5808541920,5853312368,2821952,5811367904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
44803920,3072,44806992,5811329472,5856136464,1856,5811334400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
44847104,3072,44850176,5811290352,5856140528,25366272,5836659696,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
44932048,4240,44936288,5836572880,5881509168,11847616,5848424736,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
44958528,3408,44961936,5848398304,5893360240,2496864,5850898576,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
44975088,2880,44977968,5850881472,5895859440,3826176,5854710528,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
44980352,2576,44982928,5854705344,5899688272,3904192,5858612112,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
44989552,3024,44992576,5858602128,5903594704,5218816,5863823968,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
44999552,2656,45002208,5863812880,5908815088,5683744,5869499280,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
45009792,3008,45012800,5869487536,5914500336,241798560,6111289104,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
45041408,3248,45044656,6111256928,6156301584,2171424,6113431600,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
45045120,2832,45047952,6113427552,6158475504,1984,6113432368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
45054720,3248,45057968,6113421632,6158479600,2912,6113427792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
45062864,15456,45078320,6113405472,6158483792,1536,6113422464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
45095600,2976,45098576,6113389216,6158487792,48224,6113440416,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
45111360,2992,45114352,6113424608,6158538960,2755936,6116183536,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
45139568,2976,45142544,6116155104,6161297648,1952,6116160032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
45178976,2816,45181792,6116119920,6161301712,7908928,6124031664,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
45217472,3008,45220480,6123992720,6169213200,5461504,6129457232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
45230960,3536,45234496,6129442704,6174677200,3478752,6132924992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
45249680,3312,45252992,6132904816,6178157808,2304,6132910432,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
45256880,4208,45261088,6132900816,6178161904,2016,6132907040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
45275440,2896,45278336,6132887664,6178166000,45856,6132936416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
45280112,3344,45283456,6132930672,6178214128,3426912,6136360928,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
45283920,2768,45286688,6136356784,6181643472,1984,6136361536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
45287168,2848,45290016,6136357584,6181647600,2425184,6138785616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
45319184,3152,45322336,6138753168,6184075504,1888,6138758208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
45359376,3840,45363216,6138716384,6184079600,34891392,6173611616,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
45390320,3296,45393616,6173578816,6218972432,141280,6173723392,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
45395152,4240,45399392,6173717392,6219116784,11920992,6185642624,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
45399808,3120,45402928,6185637312,6231040240,1952,6185642384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
45403504,3584,45407088,6185637248,6231044336,10766528,6196407360,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
45419680,3792,45423472,6196390272,6241813744,2144,6196396208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
45428880,2832,45431712,6196386128,6241817840,832,6196389792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
45453056,3504,45456560,6196363392,6241819952,16326752,6212693648,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
45479728,2768,45482496,6212666096,6258148592,5467264,6218136128,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
45493872,3264,45497136,6218120640,6263617776,1984,6218125888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
45502512,2768,45505280,6218116624,6263621904,1408,6218120800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
45508992,2928,45511920,6218114048,6263625968,1312,6218118288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
45515936,3072,45519008,6218111056,6263630064,3264,6218117392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
45522928,2848,45525776,6218110432,6263636208,1440,6218114720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
45533888,4496,45538384,6218101920,6263640304,4704,6218111120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
45543088,2736,45545824,6218100656,6263646480,1088,6218104480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
45550000,2688,45552688,6218097856,6263650544,1600,6218102144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
45556608,2880,45559488,6218095152,6263654640,1472,6218099504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
45564208,13216,45577424,6218081312,6263658736,1280,6218095808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
45638752,3008,45641760,6218021072,6263662832,26688,6218050768,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
45666032,2832,45668864,6218022640,6263691504,3502624,6221528096,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
45690176,3312,45693488,6221502144,6267195632,2400,6221507856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
45697472,3152,45700624,6221499072,6267199696,1984,6221504208,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
45715520,3536,45719056,6221484512,6267203568,47584,6221535632,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
45721232,3152,45724384,6221529616,6267254000,3522112,6225054880,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
45724816,2768,45727584,6225051024,6270778608,3968,6225057760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
45728112,3392,45731504,6225053248,6270784752,2439168,6227495808,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
45767856,3760,45771616,6227455376,6273226992,1888,6227461024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
45813360,3168,45816528,6227414560,6273231088,25829856,6253247584,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
45893152,3840,45896992,6253165520,6299062512,11811904,6264981264,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
45918736,3424,45922160,6264955168,6310877328,2378688,6267337280,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
45934992,2944,45937936,6267319616,6313257552,3908832,6271231392,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
45940288,2832,45943120,6271224832,6317167952,3972352,6275200016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
45949744,2768,45952512,6275190960,6321143472,5239040,6280432768,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
45959552,2736,45962288,6280422752,6326385040,5665728,6286091216,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
45970176,3600,45973776,6286078944,6332052720,240203808,6526286352,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
46001904,3280,46005184,6526254416,6572259600,2177760,6528435456,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
46005776,2704,46008480,6528431184,6574439664,1952,6528435840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
46015264,3520,46018784,6528424944,6574443728,2976,6528431440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
46023680,3216,46026896,6528421088,6574447984,1504,6528425808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
46043904,3088,46046992,6528404928,6574451920,48864,6528456880,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
46059200,3680,46062880,6528439312,6574502192,2758368,6531201360,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
46096784,3168,46099952,6531162880,6577262832,1920,6531167968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
46137232,2784,46140016,6531126912,6577266928,7814496,6538944192,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
46175328,4000,46179328,6538904848,6585084176,5459264,6544368112,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
46190976,3280,46194256,6544351904,6590546160,3478464,6547833648,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
46207680,3472,46211152,6547814752,6594025904,2400,6547820624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
46215216,2944,46218160,6547811648,6594029808,2112,6547816704,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
46232528,2624,46235152,6547798752,6594033904,47328,6547848704,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
46236912,2944,46239856,6547843168,6594083024,3426688,6551272800,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
46240352,2880,46243232,6551269200,6597512432,1952,6551274032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
46243920,2640,46246560,6551269968,6597516528,2426080,6553698688,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
46276864,2928,46279792,6553664672,6599944464,1856,6553669456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
46316976,2912,46319888,6553628640,6599948528,33846624,6587478176,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
46349280,3312,46352592,6587445280,6633797872,172064,6587620656,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
46354064,3120,46357184,6587615760,6633972944,12456320,6600075200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
46357584,3136,46360720,6600071232,6646431952,2208,6600076576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
46361200,2928,46364128,6600071952,6646436080,10598688,6610673568,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
46376480,2832,46379312,6610657344,6657036656,1952,6610662128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
46384752,3520,46388272,6610652384,6657040656,864,6610656768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
46410256,2736,46412992,6610629840,6657042832,15399488,6626032064,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
46442944,3472,46446416,6625998240,6672444656,5615488,6631617200,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
46459536,4016,46463552,6631597904,6678061456,2016,6631603936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
46469792,4016,46473808,6631591648,6678065456,1664,6631597328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
46477456,3120,46480576,6631589168,6678069744,1312,6631593600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
46484752,3232,46487984,6631585600,6678073584,3648,6631592480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
46492128,3088,46495216,6631584480,6678079696,1344,6631588912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
46503712,3120,46506832,6631576992,6678083824,11104,6631591216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
46511520,2768,46514288,6631581920,6678096208,1856,6631586544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
46518816,3056,46521872,6631578336,6678100208,2080,6631583472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
46525936,2704,46528640,6631575664,6678104304,4032,6631582400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
46533408,3984,46537392,6631573056,6678110448,1504,6631578544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
46601728,3792,46605520,6631509024,6678114544,62208,6631575024,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
46628592,3440,46632032,6631546960,6678178992,3617312,6635167712,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
46648448,3280,46651728,6635147200,6681798928,2560,6635153040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
46655872,2816,46658688,6635144336,6681803024,2080,6635149232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
46673568,3632,46677200,6635129856,6681807056,48160,6635181648,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
46679248,2912,46682160,6635175104,6681857264,3838528,6639016544,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
46683024,3328,46686352,6639011936,6685698288,4000,6639019264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
46686960,3136,46690096,6639014336,6685704432,2440192,6641457664,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
46723408,4752,46728160,6641418512,6688146672,1920,6641425184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
46768544,3616,46772160,6641378608,6688150768,26015712,6667397936,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
46856448,3904,46860352,6667309232,6714169584,12030144,6679343280,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
46882336,3312,46885648,6679318336,6726203984,2354880,6681676528,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
46898928,3200,46902128,6681658752,6728560880,3711456,6685373408,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
46904528,4048,46908576,6685366352,6732274928,3963872,6689334272,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
46915360,3296,46918656,6689323216,6736241872,5437760,6694764272,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
46925888,3024,46928912,6694752448,6741681360,5725024,6700480496,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
46936784,3664,46940448,6700468176,6747408624,239633120,6940104960,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
46968976,3360,46972336,6940071776,6987044112,2163136,6942238272,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
46972944,2816,46975760,6942233024,6989208784,1952,6942237792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
46981776,4736,46986512,6942226432,6989212944,2688,6942233856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
46991440,2864,46994304,6942222736,6989217040,1504,6942227104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
47011248,3120,47014368,6942206736,6989221104,46848,6942256704,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
47026912,3472,47030384,6942239968,6989270352,2756896,6945000336,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
47057792,2976,47060768,6944968112,6992028880,1952,6944973040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
47106496,3168,47109664,6944923376,6992033040,7841664,6952768208,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
47147552,2928,47150480,6952725568,6999876048,5460608,6958189104,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
47160704,3664,47164368,6958174496,7005338864,3489408,6961667568,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
47178480,3328,47181808,6961648896,7008830704,2496,6961654720,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
47186000,3536,47189536,6961645232,7008834768,1984,6961650752,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
47211248,3024,47214272,6961624592,7008838864,46144,6961673760,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
47216032,3008,47219040,6961667952,7008886992,3410336,6965081296,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
47219488,2800,47222288,6965077696,7012299984,1952,6965082448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
47222912,2784,47225696,6965078416,7012304112,2667616,6967748816,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
47256576,3376,47259952,6967714496,7014974448,3712,6967721584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
47298000,4288,47302288,6967678560,7014980848,34079488,7001762336,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
47334512,3328,47337840,7001724864,7049062704,139456,7001867648,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
47339248,3456,47342704,7001861248,7049203952,12768992,7014633696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
47343248,3936,47347184,7014628064,7061975248,1984,7014633984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
47347664,4256,47351920,7014627456,7061979376,10367616,7024999328,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
47365296,3888,47369184,7024979312,7072348496,1920,7024985120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
47374768,4288,47379056,7024973440,7072352496,864,7024978592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
47402384,2704,47405088,7024949552,7072354640,15705376,7040657632,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
47428528,2752,47431280,7040630400,7088061680,5511744,7046144896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
47443024,3280,47446304,7046128656,7093574960,2272,7046134208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
47451792,3952,47455744,7046123248,7093578992,1408,7046128608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
47459664,3392,47463056,7046120032,7093583088,3680,7046127104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
47467568,4512,47472080,7046117120,7093589200,3616,7046125248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
47476176,2976,47479152,7046116096,7093595248,1408,7046120480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
47487248,3360,47490608,7046108864,7093599472,4448,7046116672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
47495664,2592,47498256,7046107360,7093605616,1088,7046111040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
47502976,2848,47505824,7046103920,7093609744,1664,7046108432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
47509968,3104,47513072,7046100736,7093613808,1472,7046105312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
47517648,3184,47520832,7046097104,7093617936,1280,7046101568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
47582576,4016,47586592,7046035408,7093622000,26848,7046066272,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
47610544,3280,47613824,7046036816,7093650640,3741248,7049781344,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
47632480,3600,47636080,7049758336,7097394416,13184,7049775120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
47640096,2944,47643040,7049766096,7097409136,13472,7049782512,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
47657824,3104,47660928,7049764208,7097425136,97696,7049865008,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
47662976,3776,47666752,7049858736,7097525488,3970560,7053833072,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
47667184,3152,47670336,7053828240,7101498576,3552,7053834944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
47670816,2976,47673792,7053830960,7101504752,2437920,7056271856,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
47707648,3632,47711280,7056233664,7103944944,1888,7056239184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
47752112,5072,47757184,7056191856,7103949040,24860704,7081057632,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
47833824,3712,47837536,7080974192,7128811728,12400832,7093378736,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
47859888,3712,47863600,7093351776,7141215376,2338976,7095694464,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
47877008,2992,47880000,7095677328,7143557328,3707360,7099387680,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
47882272,3328,47885600,7099381680,7147267280,3739648,7103124656,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
47892112,3472,47895584,7103113392,7151008976,5512160,7108629024,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
47902800,4768,47907568,7108614848,7156522416,5684192,7114303808,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
47916352,4000,47920352,7114289200,7162209552,242227488,7356520688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
47955696,3872,47959568,7356479328,7404438896,2180384,7358663584,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
47960080,2544,47962624,7358658256,7406620880,1952,7358662752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
47969216,3056,47972272,7358652704,7406624976,2560,7358658320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
47976928,2752,47979680,7358649392,7406629072,1536,7358653680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
47996096,3248,47999344,7358633856,7406633200,45024,7358682128,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
48011680,3824,48015504,7358664800,7406680304,2751680,7361420304,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
48040928,3072,48044000,7361389840,7409433840,1856,7361394768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
48088768,3936,48092704,7361345232,7409437936,7852832,7369202000,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
48127616,2480,48130096,7369161984,7417292080,5460768,7374625232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
48140272,3568,48143840,7374611216,7422755056,3467584,7378082368,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
48157952,3584,48161536,7378063856,7426225392,2368,7378069808,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
48165648,4000,48169648,7378059840,7426229488,2112,7378065952,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
48183984,3280,48187264,7378046352,7426233616,45408,7378095040,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
48189056,2848,48191904,7378089808,7426281712,3408320,7381500976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
48192384,2816,48195200,7381496400,7429691600,1952,7381501168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
48195728,2512,48198240,7381497488,7429695728,2422752,7383922752,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
48227520,3168,48230688,7383890896,7432121584,1856,7383895920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
48267808,2784,48270592,7383855056,7432125648,34878368,7418736208,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
48298304,2928,48301232,7418703840,7467005072,142560,7418849328,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
48302704,3760,48306464,7418844112,7467150576,11880896,7430728768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
48307056,2720,48309776,7430723296,7479033072,1952,7430727968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
48310240,3904,48314144,7430723024,7479037168,10359680,7441086608,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
48326832,2960,48329792,7441069296,7489399088,6624,7441078880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
48335312,3488,48338800,7441068416,7489407216,1568,7441073472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
48361296,2944,48364240,7441047072,7489411312,15720800,7456770816,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
48387760,2720,48390480,7456744384,7505134864,5521792,7462268896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
48405280,3264,48408544,7462250768,7510659312,3904,7462257936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
48414048,3120,48417168,7462248256,7510665424,1440,7462252816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
48420864,2912,48423776,7462245776,7510669552,3008,7462251696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
48427840,3168,48431008,7462244688,7510675696,3520,7462251376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
48435056,2992,48438048,7462243728,7510681776,2048,7462248768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
48447040,5072,48452112,7462233824,7510685936,6688,7462245584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
48456896,3600,48460496,7462233632,7510694128,2848,7462240080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
48464656,4368,48469024,7462229264,7510698288,1600,7462235232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
48473168,3184,48476352,7462225968,7510702320,2304,7462231456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
48481088,3184,48484272,7462222144,7510706416,2240,7462227568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
48545280,2880,48548160,7462162352,7510710512,29504,7462194736,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
48573248,2992,48576240,7462165056,7510741296,3520864,7465688912,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
48592848,2864,48595712,7465669392,7514265104,5600,7465677856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
48599600,2864,48602464,7465669520,7514271984,1952,7465674336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
48617440,3008,48620448,7465655504,7514275952,52032,7465710544,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
48622416,3472,48625888,7465704528,7514330416,4260224,7469968224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
48626368,2960,48629328,7469962880,7518592208,1984,7469967824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
48629824,3136,48632960,7469963376,7518596336,2447712,7472414224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
48670864,3104,48673968,7472372832,7521046800,1856,7472377792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
48723920,3072,48726992,7472323616,7521050608,25226208,7497552896,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
48804096,3680,48807776,7497470320,7546278096,12453792,7509927792,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
48831328,3248,48834576,7509900896,7558735472,2351712,7512255856,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
48848192,3264,48851456,7512238832,7561090288,3714304,7515956400,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
48853744,2640,48856384,7515950992,7564807376,3786336,7519739968,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
48863008,2768,48865776,7519730400,7568596176,5154144,7524887312,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
48873008,2720,48875728,7524877344,7573753072,5813440,7530693504,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
48883664,3088,48886752,7530681616,7579568368,240922976,7771607680,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
48918176,3008,48921184,7771571888,7820493072,2156896,7773731792,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
48921664,2784,48924448,7773727216,7822651664,1952,7773731952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
48931216,3200,48934416,7773721312,7822655728,3360,7773727872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
48939184,3024,48942208,7773719632,7822661840,1568,7773724224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
48958992,2896,48961888,7773703984,7822665872,51264,7773758144,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
48974352,3440,48977792,7773741392,7822719184,2771712,7776516544,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
49003200,2976,49006176,7776485968,7825492144,1952,7776490896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
49042816,4128,49046944,7776449360,7825496304,7849312,7784302800,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
49090640,3392,49094032,7784253312,7833347344,5451136,7789707840,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
49104256,4160,49108416,7789691824,7838800240,3479136,7793175120,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
49122672,3456,49126128,7793154528,7842280656,2368,7793160352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
49130368,3104,49133472,7793151280,7842284752,2144,7793156528,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
49148048,2976,49151024,7793137856,7842288880,47424,7793188256,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
49152784,3008,49155792,7793183264,7842339056,3417600,7796603872,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
49156272,3008,49159280,7796598880,7845758160,2016,7796603904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
49159808,3152,49162960,7796599328,7845762288,2423840,7799026320,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
49193792,2928,49196720,7798992448,7848189168,1888,7798997264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
49235024,3184,49238208,7798954800,7848193008,34270688,7833228672,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
49265936,2944,49268880,7833196672,7882465552,140768,7833340384,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
49270336,3232,49273568,7833334288,7882607856,11865984,7845203504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
49274224,3792,49278016,7845197104,7894475120,2464,7845203360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
49278608,2928,49281536,7845197552,7894479088,10348864,7855549344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
49293728,4224,49297952,7855532752,7904830704,1952,7855538928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
49303280,2912,49306192,7855528608,7904834800,2656,7855534176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
49329184,3088,49332272,7855506624,7904838896,15733856,7871243568,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
49355536,2560,49358096,7871217632,7920575728,5463552,7876683744,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
49370032,3536,49373568,7876668272,7926041840,1920,7876673728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
49378896,3088,49381984,7876663920,7926045904,1440,7876668448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
49385776,4128,49389904,7876660096,7926050000,1312,7876665536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
49393696,2992,49396688,7876657408,7926054096,3520,7876663920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
49400864,2912,49403776,7876656496,7926060272,1344,7876660752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
49412160,4224,49416384,7876647984,7926064368,4992,7876657200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
49421152,2960,49424112,7876646528,7926070640,1120,7876650608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
49428624,2992,49431616,7876643024,7926074640,1632,7876647648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
49435632,2832,49438464,7876640240,7926078704,1504,7876644576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
49443168,3296,49446464,7876636336,7926082800,1216,7876640848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
49516688,3232,49519920,7876566976,7926086896,25632,7876595840,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
49541744,2992,49544736,7876570832,7926115568,3505824,7880079648,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
49562112,2960,49565072,7880058720,7929623792,2432,7880064112,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
49569008,2848,49571856,7880056032,7929627888,1920,7880060800,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
49587456,3328,49590784,7880041200,7929631984,47648,7880092176,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
49592704,11806400,61399104,7868282032,7929681136,3448928,7883537360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
61399680,11859920,73259600,7859873440,7933133040,4032,7871737392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
73260240,3024,73263264,7859875984,7933139248,2809952,7862688960,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
73307664,2350480,75658144,7860293968,7935952112,1856,7862646304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
75703072,3960864,79663936,7856292336,7935956272,25293632,7885546832,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
79746944,3917648,83664592,7877587488,7961252080,11798880,7893304016,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
88963632,5733888,94697520,7878357152,7973054672,2382432,7886473472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
94711456,240306272,335017728,7640421872,7975439600,3919904,7884648048,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
335024416,2168400,337192816,7642169728,7979362544,3922944,7648261072,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
337203344,3712,337207056,7646080448,7983287504,5215584,7651299744,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
337215072,2800,337217872,7651287936,7988505808,5690784,7656981520,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
337230096,3168,337233264,7656967392,7994200656,241148000,7898118560,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
337294976,6464,337301440,7898049872,8235351312,2184512,7900240848,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
337301936,2723280,340025216,7897513296,8237538512,1984,7900238560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
340035552,4928,340040480,7897502160,8237542640,3040,7897510128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
340045936,7686896,347732832,7889815920,8237548752,1568,7897504384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
347761408,5435120,353196528,7884356256,8237552784,52064,7889843440,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
353214192,3701616,356915808,7880690320,8237606128,2756640,7887148576,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
356948160,4160,356952320,7883413488,8240365808,1888,7883419536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
356996944,3296,357000240,7883369664,8240369904,7952640,7891325600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
357046496,5888,357052384,7891271984,8248324368,5449216,7896727088,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
357064880,4020800,361085680,7892689408,8253775088,3472800,7900183008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
361106736,3728,361110464,7896139056,8257249520,2400,7896145184,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
361114448,2413456,363527904,7893725712,8257253616,1984,7896141152,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
363545184,5984,363551168,7893706544,8257257712,45696,7893758224,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
363553104,34544576,398097680,7859208160,8257305840,3431232,7897183968,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
398098240,141808,398240048,7862499232,8260739280,1952,7862642992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
398240656,11924096,410164752,7850578720,8260743472,2425536,7864928352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
410204272,4128,410208400,7852962912,8263171312,1888,7852968928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
410248736,10679792,420928528,7842246880,8263175408,34385728,7887312400,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
420958736,4240,420962976,7876599472,8297562448,140160,7876743872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
420964432,4400,420968832,7876736880,8297705712,11916032,7888657312,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
420969408,16172368,437141776,7872482272,8309624048,2432,7888657072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
437142592,5455488,442598080,7867030064,8309628144,10800032,7883285584,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
442612544,3056,442615600,7877814720,8320430320,1920,7877819696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
442622224,2896,442625120,7877809296,8320434416,832,7877813024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
442652112,3360,442655472,7877781152,8320436624,16112576,7893897088,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
442684560,5488,442690048,7893861104,8336551152,5465952,7899332544,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
442708112,3952,442712064,7899307248,8342019312,1952,7899313152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
442718272,3408,442721680,7899301760,8342023440,1440,7899306608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
442728144,5200,442733344,7899294192,8342027536,1312,7899300704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
442738480,6032,442744512,7899287088,8342031600,3680,7899296800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
442749424,4256,442753680,7899284096,8342037776,1312,7899289664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
442768256,7120,442775376,7899266432,8342041808,4896,7899278448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
442784720,4832,442789552,7899258432,8342047984,1088,7899264352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
442793920,3362736,446156656,7895895424,8342052080,1632,7899259792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
446161632,3696,446165328,7895890848,8342056176,1472,7895896016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
446172096,3840,446175936,7895884336,8342060272,1248,7895889424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
446247728,3776,446251504,7895812864,8342064368,26112,7895842752,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
446277584,3390880,449668464,7892424576,8342093040,3493632,7899309088,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
449690320,3728,449694048,7895893904,8345587952,2560,7895900192,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
449698016,2414112,452112128,7893479888,8345592016,1984,7895895984,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
452128752,4144,452132896,7893463248,8345596144,47840,7893515232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
452135120,25754352,477889472,7867756848,8345646320,3444576,7896955776,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
477889952,11822032,489711984,7859380224,8349092208,4096,7871206352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
489712736,5920,489718656,7859379568,8349098224,2448192,7861833680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
489767792,2294704,492062496,7859486160,8351548656,1888,7861782752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
492114336,3760928,495875264,7855677520,8351552784,25738272,7885176720,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
495967680,3856864,499824544,7877471088,8377295632,11891808,7893219760,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
505233904,5665120,510899024,7878291168,8389190192,2346944,7886303232,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
510913488,240436896,751350384,7640188544,8391538928,3761664,7884387104,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
751355552,2164752,753520304,7641782848,8395303152,4026528,7647974128,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
753528464,3264,753531728,7645799808,8399331536,5417472,7651220544,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
753539184,3008,753542192,7651209408,8404751600,5663296,7656875712,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
753552496,3328,753555824,7656860544,8410416368,241593728,7898457600,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
753597488,7360,753604848,7898406944,8652011792,2164960,7900579264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
753605360,2726944,756332304,7897846240,8654178544,1920,7900575104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
756341584,6816,756348400,7897834240,8654182640,2976,7897844032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
756353632,7728624,764082256,7890104640,8654186896,1536,7897834800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
764105344,5441520,769546864,7884643968,8654190832,48416,7890133904,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
769561696,3448912,773010608,7881231424,8654242032,2752160,7887432496,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
773041040,4144,773045184,7883950384,8656995568,1888,7883956416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
773088336,5424,773093760,7883905904,8656999664,7942144,7891853472,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
773132160,3328,773135488,7891808432,8664943920,5458208,7897269968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
773146880,3889008,777035888,7893368960,8670404848,3475616,7900733584,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
777056048,3504,777059552,7896823824,8673883376,4320,7896831648,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
777063680,2707872,779771552,7894118128,8673889680,19776,7896845776,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
779787840,3856,779791696,7894120320,8673912016,52288,7894176464,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
779793584,33119872,812913456,7861053856,8673967312,4322208,7898495936,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
812914032,187792,813101824,7865189872,8678291696,1952,7865379616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
813102480,12696720,825799200,7852496560,8678295760,2444640,7867637920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
825834960,5632,825840592,7854902560,8680743152,1920,7854910112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
825881168,10399248,836280416,7844466832,8680747248,34577664,7889443744,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
836312144,3328,836315472,7879011232,8715326704,141088,7879155648,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
836317184,3008,836320192,7879148880,8715469072,12382976,7891534864,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
836320688,15581440,851902128,7875951264,8727853392,1984,7891534688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
851902672,5573968,857476640,7870380720,8727857360,10443584,7886398272,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
857490592,3136,857493728,7880809488,8738303216,1952,7880814576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
857499872,2736,857502608,7880804704,8738307312,2592,7880810032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
857525312,2944,857528256,7880783152,8738311408,15308832,7896094928,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
857554704,2960,857557664,7896064592,8753622256,5479104,7901546656,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
857569936,3104,857573040,7901529664,8759102704,1952,7901534720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
857578896,2768,857581664,7901525136,8759106800,1408,7901529312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
857585392,2784,857588176,7901522720,8759110896,3648,7901529152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
857592800,3616,857596416,7901520624,8759117040,3072,7901527312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
857600800,2976,857603776,7901519408,8759123184,1376,7901523760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
857616288,10272,857626560,7901500624,8759127184,4640,7901515536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
857631712,6768,857638480,7901494976,8759133456,1152,7901502896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
857644512,3638560,861283072,7897854192,8759137264,1600,7901494352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
861287728,3328,861291056,7897850528,8759141584,1472,7897855328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
861296528,3264,861299792,7897845920,8759145712,1248,7897850432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
861370064,3376,861373440,7897776336,8759149776,25216,7897804928,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
861398816,3758960,865157776,7894018656,8759176432,3694624,7901472240,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
865177456,3296,865180752,7897693344,8762874096,2400,7897699040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
865184752,2416176,867600928,7895277328,8762878256,2176,7897695680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
867617840,3488,867621328,7895260960,8762882288,50528,7895314976,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
867623760,23921488,891545248,7871389232,8762934480,3638240,7898948960,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
891545968,12482496,904028464,7862546336,8766574800,1952,7875030784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
904029136,4048,904033184,7862545744,8766578928,2442912,7864992704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
904078192,2298928,906377120,7862647248,8769024368,1920,7864948096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
906426704,3665792,910092496,7858935872,8769028368,25552160,7888153824,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
910192640,3624192,913816832,7880765456,8794582288,12077248,7896466896,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
919352704,5796848,925149552,7881512544,8806662096,2352160,7889661552,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
925163920,239341408,1164505328,7644510240,8809015568,3721376,7887573024,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1164510912,2162880,1166673792,7646064976,8812738768,4098432,7652326288,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1166682640,3280,1166685920,7650153968,8816839888,5346304,7655503552,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1166693600,2816,1166696416,7655492848,8822189264,5725184,7661220848,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1166708128,3216,1166711344,7661205184,8827916528,241606016,7902814416,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
1166759440,8128,1166767568,7902757696,9069525264,2174688,7904940512,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
1166768208,2728592,1169496800,7902205520,9071702320,1952,7904936064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
1169508624,4384,1169513008,7902193376,9071706384,2720,7902200480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1169518000,7785488,1177303488,7894406928,9071710416,1536,7902193952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
1177330704,5426464,1182757168,7888957344,9071714512,47232,7894431040,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1182776848,3458304,1186235152,7885528512,9071763664,2758720,7891745536,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
1186266928,4224,1186271152,7888253248,9074524400,1952,7888259424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1186319216,3120,1186322336,7888206160,9074528496,7921504,7896130784,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1186364320,3824,1186368144,7896083200,9082451344,5461920,7901548944,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
1186381648,3372992,1189754640,7898160608,9087915248,3486688,7905020288,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
1189775840,4432,1189780272,7901624768,9091405040,2400,7901631600,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1189784432,2427904,1192212336,7899196800,9091409136,2080,7901626784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1192229088,4480,1192233568,7899179632,9091413200,46048,7899230160,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1192235504,34629104,1226864608,7864597744,9091462352,3874528,7903101376,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
1226865184,142416,1227007600,7868331648,9095339248,1952,7868476016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
1227008240,12762544,1239770784,7855572560,9095343344,2624832,7870959936,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
1239810080,4960,1239815040,7858155888,9097970928,1856,7858162704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1239856560,10376672,1250233232,7847741792,9097975024,33697120,7891815584,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1250265872,4592,1250270464,7881404432,9131674896,139840,7881548864,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1250272576,4880,1250277456,7881539744,9131817200,11919712,7893464336,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
1250278192,15756848,1266035040,7877704560,9143739600,1952,7893463360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
1266036336,5823472,1271859808,7871883952,9143743760,10381664,7888089088,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
1271875280,3280,1271878560,7882250384,9154128944,1952,7882255616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1271885296,2800,1271888096,7882245008,9154133104,1824,7882249632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1271915792,4544,1271920336,7882215968,9154136304,15711680,7897932192,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1271948400,6048,1271954448,7897896160,9169850608,5507136,7903409344,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
1271974016,3888,1271977904,7903381824,9175359728,1920,7903387632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1271984176,6096,1271990272,7903373552,9175363824,1568,7903381216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1271994864,4976,1271999840,7903368080,9175367920,3168,7903376224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1272004384,6688,1272011072,7903363024,9175374096,3392,7903373104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
1272016304,7840,1272024144,7903356000,9175380144,1344,7903365184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1272038832,8480,1272047312,7903337024,9175384336,4928,7903350432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
1272054176,5904,1272060080,7903330656,9175390736,1120,7903337680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1272064336,3417328,1275481664,7899912784,9175394448,1632,7903331744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
1275486768,4320,1275491088,7899907552,9175398640,1696,7899913568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
1275498016,3408,1275501424,7899901344,9175402768,7616,7899912368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1275572976,3696,1275576672,7899836304,9175412976,26336,7899866336,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
1275602496,4198528,1279801024,7895640496,9175441520,3844544,7903683568,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
1279823024,3424,1279826448,7899461344,9179287792,2336,7899467104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1279830320,2423072,1282253392,7897038496,9179291888,2048,7899463616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1282270336,4432,1282274768,7897021216,9179295984,48768,7897074416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1282276992,24866304,1307143296,7872203888,9179347184,3828800,7900898992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
1307143776,12477136,1319620912,7863557056,9183177968,4032,7876038224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
1319621712,3808,1319625520,7863558592,9183184112,2423808,7865986208,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
1319668752,2294880,1321963632,7863647392,9185611024,1888,7865944160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1322013136,3678496,1325691632,7859923424,9185615056,24620416,7888222336,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1325793664,3633296,1329426960,7880811232,9210238192,12466528,7896911056,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
1334578096,5874496,1340452592,7882255168,9222707760,2350880,7890480544,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
1340468096,238892736,1579360832,7645700784,9225061616,3725056,7888318576,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1579364448,2156080,1581520528,7647267424,9228787952,3735968,7653159472,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1581528416,3232,1581531648,7650993872,9232525520,5525984,7656523088,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1581539200,2416,1581541616,7656511488,9238053104,5802432,7662316336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1581551008,2944,1581553952,7662304176,9243858128,242206816,7904513936,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
1581587376,5152,1581592528,7904474432,9486066960,2168960,7906648544,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
1581592960,2744896,1584337856,7903899984,9488237840,2016,7906646896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
1584346400,4112,1584350512,7903891392,9488241904,2944,7903898448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1584355856,7793680,1592149536,7896096592,9488246128,1536,7903891808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
1592172256,5592352,1597764608,7890485488,9488250096,45504,7896123344,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1597779344,3648176,1601427520,7886869648,9488297168,2763104,7893280928,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
1601457584,5504,1601463088,7889599936,9491063024,1920,7889607360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1601502528,3136,1601505664,7889561456,9491067120,7944544,7897509136,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1601544480,2784,1601547264,7897467152,9499014416,5450496,7902920432,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
1601558800,3786304,1605345104,7899121088,9504466192,3475360,7906382752,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
1605362560,3504,1605366064,7902576736,9507942800,2368,7902582608,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1605370032,2420304,1607790336,7900156400,9507946736,2048,7902578752,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1607806608,3264,1607809872,7900140960,9507950832,47552,7900191776,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1607811776,34027600,1641839376,7866160608,9507999984,3421152,7903609360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
1641840048,140432,1641980480,7869443792,9511424272,1952,7869586176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
1641981120,12368192,1654349312,7857079024,9511428336,2483008,7871930224,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
1654384384,4352,1654388736,7859523920,9513912656,2368,7859530640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1654430064,10593680,1665023744,7848893104,9513916848,34376960,7893863744,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1665054544,4224,1665058768,7883237696,9548296464,139616,7883381536,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1665060400,4352,1665064752,7883374016,9548438768,12796832,7896175200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
1665065200,15672688,1680737888,7880499824,9561237712,2240,7896174752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
1680738400,5455632,1686194032,7875047808,9561241840,10357696,7890861136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
1686208144,3024,1686211168,7885390480,9571601648,1920,7885395424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1686217616,3264,1686220880,7885384864,9571605744,832,7885388960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1686244048,3008,1686247056,7885360800,9571607856,15753632,7901117440,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1686273504,4832,1686278336,7901084720,9587363056,5458112,7906547664,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
1686296208,4416,1686300624,7906522400,9592823024,1984,7906528800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1686306352,4080,1686310432,7906516784,9592827216,1408,7906522272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1686314784,4704,1686319488,7906511728,9592831216,1312,7906517744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1686323696,4992,1686328688,7906506624,9592835312,3296,7906514912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
1686333600,4336,1686337936,7906503520,9592841456,1344,7906509200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1686348208,6320,1686354528,7906490928,9592845456,4448,7906501696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
1686360256,5248,1686365504,7906486160,9592851664,1088,7906492496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
1686370368,3391328,1689761696,7903094000,9592855696,1632,7906486960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
1689766336,3504,1689769840,7903090048,9592859888,1472,7903095024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
1689775344,5264,1689780608,7903083376,9592863984,1280,7903089920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1689847168,3584,1689850752,7903017328,9592868080,25184,7903046096,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
1689876800,3862112,1693738912,7899155792,9592894704,3628416,7906646320,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
1693766128,3248,1693769376,7902764528,9596533904,17728,7902785504,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1693773536,2819920,1696593456,7899961024,9596554480,11680,7902792624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
1696610752,4016,1696614768,7899954080,9596568848,69088,7900027184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
1696616848,25285088,1721901936,7874737536,9596639472,4118272,7904140896,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
1721902592,11903024,1733805616,7866954400,9600760016,3840,7878861264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
1733806272,2928,1733809200,7866957024,9600766224,2419840,7869379792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
1733851440,2508640,1736360080,7866827872,9603187952,1888,7869338400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
1736407728,3696624,1740104352,7863087696,9603192048,24930496,7891714816,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
1740194480,3860432,1744054912,7884069488,9628124400,12466368,7900396288,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
1749176464,5699216,1754875680,7885718000,9640593680,2350944,7893768160,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
1754890528,240183200,1995073728,7647873104,9642946832,3729024,7891785328,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1995079392,2160912,1997240304,7649437920,9646678224,3748576,7655347408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1997248592,3360,1997251952,7653176160,9650428112,5354496,7658534016,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1997259936,3008,1997262944,7658521776,9655784720,5783808,7664308592,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
1997272656,3040,1997275696,7664295616,9661571312,241193152,7905491808,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
1997309504,8512,1997318016,7905448368,9902766384,2168640,7907625520,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
1997318640,2735392,2000054032,7904883168,9904937200,1952,7907620512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
2000062368,5552,2000067920,7904873376,9904941296,2944,7904881872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2000073360,7796944,2007870304,7897075216,9904945520,1568,7904873728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2007892000,5452368,2013344368,7891605088,9904949456,47232,7897104688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2013360384,3693200,2017053584,7887945056,9904998640,2753088,7894391344,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
2017085744,3984,2017089728,7890664496,9907754224,1888,7890670368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2017130592,3728,2017134320,7890624000,9907758320,7844192,7898471920,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2017175040,4112,2017179152,7898426112,9915605264,5462816,7903893040,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
2017191040,3990144,2021181184,7899889168,9921070352,3466848,7907346160,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
2021201840,3728,2021205568,7903334064,9924539632,2304,7903340096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2021209680,2415488,2023625168,7900918560,9924543728,2048,7903336096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2023641696,4512,2023646208,7900901584,9924547792,47456,7900953552,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2023648080,34033792,2057681872,7866915072,9924596944,3416192,7904365056,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
2057682416,142256,2057824672,7870191440,9928016112,1952,7870335648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2057825312,11888304,2069713616,7858306592,9928020208,2424832,7872619728,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
2069748688,5904,2069754592,7860693520,9930448112,1856,7860701280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2069796128,10665632,2080461760,7849990448,9930452208,34503808,7895159888,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2080493008,6576,2080499584,7884458384,9964957968,140736,7884605696,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2080501376,6864,2080508240,7884593024,9965101264,12747232,7897347120,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
2080508704,16200080,2096708784,7881141312,9977850096,2208,7897343600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2096709632,5469088,2102178720,7875675472,9977854192,10374624,7891519184,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
2102194704,3648,2102198352,7886033056,9988231408,1920,7886038624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2102204848,2896,2102207744,7886027760,9988235504,2528,7886033184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2102235472,3760,2102239232,7886000368,9988239600,15701312,7901705440,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2102284000,6896,2102290896,7901652768,10003943664,5469120,7907128784,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
2102310128,6272,2102316400,7907098496,10009414896,1920,7907106688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2102324864,4672,2102329536,7907089456,10009418992,1408,7907095536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2102336016,5248,2102341264,7907081824,10009423088,1376,7907088448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2102346512,6240,2102352752,7907074432,10009427184,3136,7907083808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2102357472,6080,2102363552,7907069776,10009433328,1344,7907077200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2102377168,8256,2102385424,7907052000,10009437424,6720,7907066976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
2102391616,6864,2102398480,7907047136,10009445616,1088,7907055088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2102403520,3344960,2105748480,7903701232,10009449712,1600,7907047792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
2105753712,3840,2105757552,7903696256,10009453808,1472,7903701568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2105763920,3536,2105767456,7903690448,10009457904,1312,7903695296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2105835568,3552,2105839120,7903622880,10009462000,27584,7903654016,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
2105865296,3458736,2109324032,7900168656,10009492688,3491904,7907119296,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
2109346016,3472,2109349488,7903638176,10012987664,2528,7903644176,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2109353424,2412672,2111766096,7901225728,10012991824,2016,7903640416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2111782944,3744,2111786688,7901209136,10012995824,48352,7901261232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2111788880,25833712,2137622592,7875423408,10013046000,4232896,7905490016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
2137623056,11820816,2149443872,7867837360,10017281232,4096,7879662272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2149444448,3232,2149447680,7867839696,10017287376,2498976,7870341904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
2149496496,2304640,2151801136,7867987904,10019789040,1952,7870294496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2151852384,3701232,2155553616,7864239488,10019793104,24911776,7892852496,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2155687008,3934192,2159621200,7885085856,10044707056,12388768,7901408816,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
2165039888,5668176,2170708064,7886394224,10057102288,2363744,7894426144,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
2170723840,242069584,2412793424,7646675648,10059469072,3784768,7892530000,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2412799152,2153008,2414952160,7648303632,10063255792,3747296,7654203936,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2414960832,3536,2414964368,7652040000,10067004368,5073216,7657116752,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2414972144,2704,2414974848,7657105808,10072080656,5698400,7662806912,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2414986000,3376,2414989376,7662790960,10077780336,242541280,7905335616,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
2415037552,9376,2415046928,7905276032,10320322960,2168832,7907454240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
2415048112,2720096,2417768208,7904725472,10322493680,1920,7907447488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
2417778112,5248,2417783360,7904714416,10322497776,2944,7904722608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2417788816,7801120,2425589936,7896912096,10322502032,1536,7904714752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2425616288,5431392,2431047680,7891458288,10322505968,49696,7896939376,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2431064576,3467776,2434532352,7888024880,10322557232,2751232,7894243888,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
2434563984,3520,2434567504,7890743200,10325310704,1952,7890748672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2434608336,11424,2434619760,7890695040,10325314800,7992640,7898699104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2434661104,4656,2434665760,7898644528,10333310288,5463872,7904113056,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
2434678064,4243856,2438921920,7899853488,10338775408,3477760,7907575104,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
2438941040,3680,2438944720,7903310112,10342254832,2368,7903316160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2438948816,2419296,2441368112,7900890816,10342258928,2048,7903312160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2441384912,5664,2441390576,7900872448,10342263024,46048,7900924160,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2441392720,33746240,2475138960,7867173216,10342312176,3447488,7904366944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
2475139568,141456,2475281024,7870481008,10345762032,1952,7870624416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2475281680,12293504,2487575184,7858190944,10345766128,2423296,7872907744,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
2487613072,7264,2487620336,7860571648,10348191984,1920,7860580832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2487661520,10706656,2498368176,7849827904,10348196080,34563424,7895097984,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2498399600,5312,2498404912,7884357376,10382762288,140576,7884503264,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2498406576,3440,2498410016,7884495632,10382905648,12654624,7897153696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
2498410816,15788176,2514198992,7881363200,10395562192,2688,7897154064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2514199536,5491632,2519691168,7875875152,10395566320,10480992,7891847776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
2519705616,2976,2519708592,7886341440,10406050032,1920,7886346336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2519715168,2944,2519718112,7886335984,10406054096,1088,7886340016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2519741632,2944,2519744576,7886312080,10406056656,15701088,7902016112,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2519773408,4144,2519777552,7901982688,10421760240,5465056,7907451888,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
2519790416,3824,2519794240,7907434192,10427228432,1920,7907439936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2519800800,2880,2519803680,7907428816,10427232496,1408,7907433104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2519807424,2880,2519810304,7907426288,10427236592,1280,7907430448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2519814960,3104,2519818064,7907422624,10427240688,3232,7907428960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2519822432,2736,2519825168,7907421696,10427246864,1344,7907425776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2519833776,3104,2519836880,7907414048,10427250928,4832,7907421984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
2519842208,19840,2519862048,7907394992,10427257040,1120,7907415952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2519866368,3589920,2523456288,7903804944,10427261232,1632,7907396496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
2523460880,3008,2523463888,7903801376,10427265264,1472,7903805856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2523469232,3648,2523472880,7903796480,10427269360,1280,7903801408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2523542000,3472,2523545472,7903727984,10427273456,25920,7903757376,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
2523570768,3566720,2527137488,7900164640,10427302128,3508896,7907240256,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
2527159872,3264,2527163136,7903649008,10430812144,2464,7903654736,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2527167136,2416960,2529584096,7901232400,10430816496,2016,7903651376,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2529601088,3776,2529604864,7901215728,10430820592,48512,7901268016,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2529607056,25387232,2554994288,7875877504,10430871792,3516544,7904781280,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
2554994816,12074240,2567069056,7867322224,10434391280,4384,7879400848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2567069680,3744,2567073424,7867324000,10434397424,2736736,7870064480,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
2567117872,2300880,2569418752,7867717872,10437136624,1888,7870020640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2569464176,3672864,2573137040,7864003680,10437140720,25314144,7892990688,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2573239264,3993840,2577233104,7885223072,10462456176,12035712,7901252624,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
2582592704,5692160,2588284864,7886212496,10474497360,2454048,7894358704,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
2588300928,239518224,2827819152,7649134688,10476953840,3817408,7892470320,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2827823696,2154608,2829978304,7650795056,10480773360,3902560,7656852224,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2829986400,3600,2829990000,7654688928,10484678928,5091520,7659784048,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2829997936,2992,2830000928,7659771344,10489772272,5706880,7665481216,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
2830012576,3152,2830015728,7665466368,10495482096,242566784,7908036304,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
2830050096,6160,2830056256,7907995088,10738051344,2171840,7910173088,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
2830056720,2734512,2832791232,7907435024,10740226256,1984,7910171520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
2832799776,4880,2832804656,7907425728,10740230384,3104,7907433712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2832810096,7807648,2840617744,7899618752,10740236496,1536,7907427936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2840638672,5434064,2846072736,7894167792,10740240528,47072,7899648928,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2846088784,3462528,2849551312,7890738464,10740289776,2751712,7896952704,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
2849582400,4832,2849587232,7893456080,10743043312,1888,7893462800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2849627280,3936,2849631216,7893416192,10743047408,7940800,7901360928,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2849670288,2944,2849673232,7901316352,10750989584,5517184,7906836480,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
2849684752,3338896,2853023648,7903485264,10756508912,3821792,7910645952,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
2853043536,3520,2853047056,7907285440,10760332496,2496,7907291456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2853051120,2736096,2855787216,7904549504,10760336720,2048,7907287648,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2855803920,3024,2855806944,7904533776,10760340720,46816,7904583616,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2855808912,33775376,2889584288,7870804528,10760388816,3812448,7908392352,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
2889584848,143824,2889728672,7874475600,10764204272,1920,7874621344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2889729328,12812560,2902541888,7861666448,10764208336,2426976,7876905984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
2902578064,3920,2902581984,7864055312,10766637296,1888,7864061120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2902622992,10288288,2912911280,7853730112,10766641392,34306016,7898324416,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2912943696,3824,2912947520,7888001968,10800949488,140000,7888145792,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2912949200,3328,2912952528,7888139296,10801091824,12269024,7900411648,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
2912953056,15712128,2928665184,7884697232,10813362416,5312,7900414672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2928665776,5466656,2934132432,7879238176,10813370608,10774496,7895479328,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
2934147376,2928,2934150304,7889996880,10824147184,4960,7890004768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2934156816,2976,2934159792,7889993632,10824153424,7264,7890003872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2934182864,3328,2934186192,7889977376,10824163568,15771104,7905751808,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2934215312,6400,2934221712,7905714272,10839935984,5466784,7911187456,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
2934240464,3840,2934244304,7911161120,10845405424,1920,7911166880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2934250496,3472,2934253968,7911155648,10845409616,1440,7911160560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2934257936,4272,2934262208,7911151440,10845413648,3168,7911158880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2934266864,5664,2934272528,7911147232,10845419760,3168,7911156064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2934276992,4288,2934281280,7911144528,10845425808,1312,7911150128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2934293232,5344,2934298576,7911131424,10845430000,4544,7911141312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
2934304944,5024,2934309968,7911126176,10845436144,1088,7911132288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
2934314352,3390096,2937704448,7907735824,10845440272,1632,7911127552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
2937709184,3520,2937712704,7907731632,10845444336,1472,7907736624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
2937718192,3728,2937721920,7907726480,10845448400,1312,7907731520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2937789344,3808,2937793152,7907659376,10845452528,26560,7907689744,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
2937818272,3400384,2941218656,7904262544,10845481200,3503456,7911166384,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
2941239440,3504,2941242944,7907744464,10848987408,2368,7907750336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2941246800,2415072,2943661872,7905329600,10848991472,2016,7907746688,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
2943678448,4080,2943682528,7905313040,10848995568,48320,7905365440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
2943684752,24855152,2968539904,7880505808,10849045712,3440576,7908801536,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
2968540400,12476560,2981016960,7871470608,10852487568,4032,7883951200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
2981017792,3344,2981021136,7871472448,10852493584,2674176,7874149968,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
2981071056,2291840,2983362896,7871807392,10855170288,1920,7874101152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
2983408976,3667232,2987076208,7868098208,10855174416,25492928,7897258368,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
2987171408,3637776,2990809184,7889859728,10880668912,11806688,7905304192,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
2996262768,5728256,3001991024,7890487904,10892478928,2395648,7898611808,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
3002006256,240199456,3242205712,7652670176,10894875888,3943904,7896813536,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3242210576,2176672,3244387248,7654434080,10898821328,3916544,7660527296,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3244395360,3216,3244398576,7658341600,10902740176,5236320,7663581136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3244406384,3088,3244409472,7663568464,10907977936,5662944,7669234496,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3244420688,3776,3244424464,7669218272,10913642736,242114368,7911336416,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
3244467104,5552,3244472656,7911286752,11155759408,2167616,7913459920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
3244473312,2875520,3247348832,7910579504,11157928336,1920,7913456944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
3247358544,4768,3247363312,7910569088,11157932400,2912,7910576768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3247368800,8248896,3255617696,7902320752,11157938448,1504,7910571152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
3255642128,5584384,3261226512,7896715872,11157942384,47264,7902347520,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3261242768,3517104,3264759872,7893231760,11157991632,2756704,7899505568,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
3264791280,4240,3264795520,7895955792,11160751312,1984,7895962016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3264837248,4128,3264841376,7895914096,11160755472,7890016,7903808240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3264880768,3056,3264883824,7903763648,11168647472,5505440,7909272144,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
3264895408,3440192,3268335600,7905818912,11174154512,3673952,7912933056,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
3268354400,3568,3268357968,7909472672,11177830640,2592,7909478832,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3268362096,2397056,3270759152,7907075552,11177834704,2048,7909474656,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3270775536,3584,3270779120,7907062752,11177841872,55936,7907122272,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3270781040,34240064,3305021104,7872878112,11177899216,4036064,7911154240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
3305021632,143952,3305165584,7876772288,11181937872,1984,7876918224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
3305166720,12820208,3317986928,7863955072,11181942000,2423648,7879198928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
3318023456,4704,3318028160,7866339696,11184367856,1888,7866346288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3318069632,10271136,3328340768,7856031184,11184371952,34814112,7901116432,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3328373232,4432,3328377664,7890810352,11219188016,140544,7890955328,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3328379472,4208,3328383680,7890947632,11219331312,11914592,7902866432,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
3328384240,15700800,3344085040,7887163552,11231248592,1952,7902866304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
3344085840,5454672,3349540512,7881712208,11231252720,10789568,7897956448,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
3349554960,3584,3349558544,7892485088,11242043632,2112,7892490784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3349565104,3088,3349568192,7892479504,11242047696,960,7892483552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3349591824,3424,3349595248,7892454720,11242049968,16312800,7908770944,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3349623040,4640,3349627680,7908737488,11258365168,5469024,7914211152,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
3349646640,6560,3349653200,7914182272,11263835472,2144,7914190976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3349659152,3408,3349662560,7914177936,11263840496,1408,7914182752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3349666688,4032,3349670720,7914173872,11263844592,1280,7914179184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3349676000,9264,3349685264,7914163456,11263848720,3296,7914176016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
3349690080,4416,3349694496,7914160368,11263854864,1440,7914166224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3349706848,6080,3349712928,7914146000,11263858928,4320,7914156400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
3349720000,3776,3349723776,7914141296,11263865072,1120,7914146192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3349728608,3384080,3353112688,7910756480,11263869168,1600,7914142160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
3353117456,3856,3353121312,7910751952,11263873264,1504,7910757312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
3353126912,3968,3353130880,7910746480,11263877360,1248,7910751696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3353199920,3456,3353203376,7910678048,11263881424,25120,7910706624,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
3353229040,3450912,3356679952,7907228128,11263908080,3509536,7914188576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
3356698576,3504,3356702080,7910717264,11267419344,2432,7910723200,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3356706080,2420976,3359127056,7908296416,11267423472,1984,7910719376,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3359144912,3536,3359148448,7908279120,11267427568,48000,7908330656,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3359150528,24892992,3384043520,7883433424,11267476944,3441024,7911767440,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
3384044016,12199824,3396243840,7874676592,11270920432,3776,7886880192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
3396244448,4320,3396248768,7874677808,11270926576,2436416,7877118544,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
3396289552,2466112,3398755664,7874609056,11273364720,1856,7877077024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3398800160,3738544,3402538704,7870830112,11273368816,25923936,7900492592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3402629616,3678928,3406308544,7892986928,11299295472,11797920,7908463776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
3411393344,5711936,3417105280,7893990704,11311095984,2385056,7902087696,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
3417120208,240089808,3657210016,7656274000,11313484016,3934176,7900297984,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3657213696,2164704,3659378400,7658042896,11317421296,3955424,7664163024,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3659386144,3040,3659389184,7661990352,11321379536,5190528,7667183920,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3659396960,2752,3659399712,7667172016,11326571728,5673920,7672848688,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
3659410928,3568,3659414496,7672833296,11332247792,242693856,7915530720,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
3659450432,6176,3659456608,7915487408,11574944016,2174560,7917668144,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
3659457056,2746608,3662203664,7914917312,11577120976,1984,7917665904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
3662211552,4016,3662215568,7914909536,11577125104,2752,7914916304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3662221200,8087248,3670308448,7906820720,11577129168,1536,7914909504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
3670332848,5503296,3675836144,7901297120,11577133264,45664,7906846080,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3675853648,3804288,3679657936,7897522432,11577180368,2752608,7904079328,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
3679689168,5072,3679694240,7900241712,11579935952,1920,7900248704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3679736720,4640,3679741360,7900198688,11579940048,7985536,7908188864,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3679780544,2752,3679783296,7908145072,11587928368,5481344,7913629168,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
3679794624,3727696,3683522320,7909888896,11593411216,3706112,7917322704,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
3683541008,3632,3683544640,7913575088,11597119728,2560,7913581280,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3683548608,2423984,3685972592,7911151264,11597123856,2336,7913577584,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3685988768,3808,3685992576,7911135344,11597127920,47072,7911186224,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3685994432,34967904,3720962336,7876215760,11597178096,4002432,7915186096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
3720962912,140064,3721102976,7880079984,11601182960,1952,7880222000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
3721103632,12298432,3733402064,7867784736,11601186800,2423616,7882506784,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
3733435888,3968,3733439856,7870172032,11603611888,1888,7870177888,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3733481504,10711008,3744192512,7859423472,11603615984,34343840,7904478320,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3744224464,3200,3744227664,7893734336,11637962000,140544,7893878080,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3744229264,2976,3744232240,7893873088,11638105328,11934080,7905810144,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
3744232656,15762384,3759995040,7890046032,11650041072,2144,7905810560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
3759995584,5480448,3765476032,7884569136,11650045168,10771616,7900821200,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
3765491776,3520,3765495296,7895324400,11660819696,2016,7895329936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3765501904,2816,3765504720,7895319072,11660823792,1056,7895322944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3765538512,3344,3765541856,7895286032,11660827888,16033728,7911323104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3765569888,4064,3765573952,7911289776,11676863728,5465600,7916759440,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
3765591072,3968,3765595040,7916735856,11682330896,1952,7916741776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3765603472,5520,3765608992,7916726000,11682334992,1440,7916732960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3765614896,6048,3765620944,7916716992,11682337936,1312,7916724352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3765627056,7904,3765634960,7916706112,11682341072,3296,7916717312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
3765640384,3440,3765643824,7916703424,11682347248,1312,7916708176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3765659920,7776,3765667696,7916683552,11682351248,4576,7916695904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
3765674848,6608,3765681456,7916676032,11682357488,1088,7916683728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
3765685936,3358880,3769044816,7913316768,11682361584,1632,7916677280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
3769050176,3632,3769053808,7913311872,11682365680,1472,7913316976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
3769061072,3280,3769064352,7913305424,11682369776,1280,7913309984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3769136304,3712,3769140016,7913233856,11682373872,26848,7913264416,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
3769165856,3364704,3772530560,7909871984,11682402544,3503616,7916740304,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
3772551552,3536,3772555088,7913353632,11685908720,2496,7913359664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3772559088,2490416,3775049504,7910863280,11685912784,1984,7913355680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
3775066480,3248,3775069728,7910847184,11685916912,47392,7910897824,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
3775071872,24828896,3799900768,7886065296,11685966064,3441888,7914336080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
3799901280,11832448,3811733728,7877676016,11689409744,3264,7889511728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
3811734336,5424,3811739760,7877676160,11689415920,2435552,7880117136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
3811784416,2342080,3814126496,7877726576,11691853072,1856,7880070512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
3814172640,3902688,3818075328,7873781808,11691857136,26544096,7904228592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
3818183280,3840704,3822023984,7896380352,11718404336,11803168,7912024224,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
3827260368,5660896,3832921264,7897288928,11730210192,2344192,7905294016,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
3832936320,240313328,4073249648,7659306432,11732556080,3879392,7903499152,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4073255056,2152864,4075407920,7661030080,11736438000,3889536,7667072480,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4075416160,3232,4075419392,7664910800,11740330192,5382944,7670296976,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4075427264,2672,4075429936,7670284480,11745714416,5676192,7675963344,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4075441104,3552,4075444656,7675947872,11751392528,241273408,7917224832,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
4075479744,9200,4075488944,7917178496,11992667440,2164000,7919351696,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
4075489440,2746432,4078235872,7916598256,11994834128,1952,7919346640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
4078244656,5488,4078250144,7916588112,11994838256,2848,7916596448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4078258080,7811200,4086069280,7908774096,11994843376,1536,7916586832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
4086093296,5441424,4091534720,7903312624,11994847344,47232,7908801280,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4091551328,3555632,4095106960,7899789632,11994896592,2758016,7906103280,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
4095136960,4832,4095141792,7902515536,11997657328,2080,7902522448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4095182592,3664,4095186256,7902475136,11997661392,7871520,7910350320,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4095227344,3392,4095230736,7910305312,12005536048,5454944,7915763648,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
4095243456,4229696,4099473152,7911520752,12010993904,3469600,7919220048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
4099493856,3792,4099497648,7914967616,12014465264,2304,7914973712,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4099501888,2428768,4101930656,7912538704,12014469360,2080,7914969552,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4101949888,4288,4101954176,7912519280,12014473456,46176,7912569744,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4101956112,33892784,4135848896,7878673712,12014522608,3422656,7915989152,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
4135849648,208800,4136058448,7881888416,12017946864,1952,7882099168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
4136059264,12093008,4148152272,7869798688,12017950960,2425152,7884316848,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
4148192720,4048,4148196768,7872182096,12020378864,1888,7872188032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4148240304,10670112,4158910416,7861472576,12020382992,34162048,7906304736,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4158945024,4144,4158949168,7895598528,12054547696,139200,7895741872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4158951024,5744,4158956768,7895731504,12054688272,12332832,7908070080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
4158958112,15223056,4174181168,7892842944,12067024112,1952,7908067952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
4174181744,5468592,4179650336,7887377872,12067028208,10806528,7903652992,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
4179667904,3488,4179671392,7898166160,12077837552,1920,7898171568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4179678432,3264,4179681696,7898159920,12077841616,3072,7898166256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4179717152,4320,4179721472,7898126320,12077847792,15536672,7913667312,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4179750768,5344,4179756112,7913630912,12093387024,5629920,7919266176,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
4179774608,5312,4179779920,7919239072,12099018992,1920,7919246304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4179789488,6352,4179795840,7919227312,12099023152,1408,7919235072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4179800672,4768,4179805440,7919221744,12099027184,1472,7919227984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4179810976,4736,4179815712,7919215568,12099031280,3360,7919223664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
4179823728,8208,4179831936,7919204464,12099036400,1312,7919213984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4179846576,8448,4179855024,7919185472,12099040496,4448,7919198368,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
4179863792,6400,4179870192,7919176448,12099046640,1184,7919184032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4179877024,3349632,4183226656,7915824048,12099050704,1824,7919175504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
4183232528,4288,4183236816,7915818016,12099054832,1632,7915823936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
4183244512,5040,4183249552,7915809376,12099058928,1280,7915815696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4183326688,3440,4183330128,7915732896,12099063024,25696,7915762032,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
4183356880,3447152,4186804032,7912287664,12099091696,3543520,7919278336,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
4186825936,3488,4186829424,7915807360,12102636784,2464,7915813312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4186833568,2415376,4189248944,7913391936,12102640880,2304,7915809616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4189265776,3760,4189269536,7913375408,12102644944,63616,7913442784,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4189271600,26073328,4215344928,7887365552,12102710480,3828128,7917267008,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
4215345536,12098864,4227444400,7879096896,12106541296,3296,7891199056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
4227445392,4864,4227450256,7879097184,12106547440,2443872,7881545920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
4227496960,2298288,4229795248,7879198528,12108993776,1888,7881498704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4229841008,3687968,4233528976,7875468896,12108997872,24936000,7904092864,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4233627648,3970032,4237597680,7896337664,12133935344,11814080,7912121776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
4243030608,5744480,4248775088,7896978208,12145753296,2352896,7905075584,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
4248791040,242388480,4491179520,7656927952,12148107472,3725216,7903041648,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4491195760,2151120,4493346880,7658487952,12151834832,3740704,7664379776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4493356256,3280,4493359536,7662219040,12155578576,5090944,7667313264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4493367232,3248,4493370480,7667301504,12160671984,5663328,7672968080,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4493387248,3792,4493391040,7672946736,12166337776,241822912,7914773440,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
4493462000,9328,4493471328,7914691280,12408162608,2157568,7916858176,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
4493473152,2684160,4496157312,7914165872,12410323184,1952,7916851984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
4496167824,5088,4496172912,7914154368,12410327280,2976,7914162432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4496181040,7913696,4504094736,7906236832,12410331568,1504,7914152032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
4504123424,5432384,4509555808,7900779408,12410335216,50112,7906261904,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4509576144,3473344,4513049488,7897337216,12410386704,2750304,7903560864,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
4513081040,5680,4513086720,7900052464,12413139184,1920,7900060064,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4513130544,4320,4513134864,7900008416,12413143280,7919840,7907932576,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4513173744,2880,4513176624,7907888352,12421064976,5455904,7913347136,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
4513190224,4091328,4517281552,7909242336,12426523888,3468640,7916802304,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
4517301936,3584,4517305520,7912689728,12429995248,2368,7912695680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4517309664,2514256,4519823920,7910175424,12429999344,1984,7912691664,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4519840912,4208,4519845120,7910158288,12430003408,48128,7910210624,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4519847008,33516368,4553363376,7876691264,12430054640,3424576,7913632208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
4553364000,159136,4553523136,7879958832,12433481968,1952,7880119920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
4553523808,12646384,4566170192,7867315904,12433486096,2426240,7882388528,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
4566207952,4416,4566212368,7869701600,12435913968,1856,7869707872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4566256128,10383984,4576640112,7859277952,12435918064,33735648,7903397584,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4576672448,4336,4576676784,7892980064,12469656848,140768,7893125168,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4576678800,4368,4576683168,7893115984,12469799152,12803680,7905924032,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
4576684032,15657696,4592341728,7890262608,12482604336,2176,7905922480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
4592342448,5633152,4597975600,7884632768,12482608368,10379136,7900645056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
4597989904,3024,4597992928,7894996752,12492989680,1952,7895001728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4597999840,2912,4598002752,7894991024,12492993776,864,7894994800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4598031824,3056,4598034880,7894961040,12492995920,15888288,7910852384,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4598061184,3136,4598064320,7910822960,12508887280,5504480,7916330576,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
4598081296,5824,4598087120,7916306208,12514393328,2112,7916314144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4598093584,2992,4598096576,7916300848,12514397424,1408,7916305248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4598100944,2544,4598103488,7916298032,12514401520,1280,7916301856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4598108304,3696,4598112000,7916293616,12514405616,3744,7916301056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
4598116576,3968,4598120544,7916291184,12514411728,1344,7916296496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4598130640,9424,4598140064,7916274480,12514414544,4896,7916288800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
4598150000,5136,4598155136,7916266768,12514421904,1088,7916272992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4598160384,3561408,4601721792,7912704304,12514426096,1632,7916267344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
4601727440,3792,4601731232,7912698960,12514430192,1760,7912704512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
4601738416,3520,4601741936,7912692352,12514434288,1248,7912697120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4601816720,3664,4601820384,7912617968,12514438352,34208,7912655840,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
4601846720,3805840,4605652560,7908822688,12514475248,3824608,7916453136,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
4605672624,3472,4605676096,7912626864,12518302960,2528,7912632864,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4605680192,2414656,4608094848,7910212208,12518307056,2016,7912628880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4608112192,3792,4608115984,7910195168,12518311152,47136,7910246096,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4608118208,24990336,4633108544,7885251728,12518360272,3841696,7914083760,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
4633109008,12397152,4645506160,7876697184,12522203344,3968,7889098304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
4645506720,3888,4645510608,7876698944,12522209552,2437024,7879139856,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
4645554736,2307552,4647862288,7876786400,12524648688,1888,7879095840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4647908688,3681936,4651590624,7873062192,12524652816,24963488,7901707616,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4651699728,3762032,4655461760,7894156144,12549617904,12417312,7910335488,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
4661047072,5710176,4666757248,7895281008,12562038256,2346336,7903337520,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
4666774192,241392784,4908166976,7656220080,12564387056,3717536,7901330400,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4908174112,2158544,4910332656,7657773568,12568106224,3741536,7663673648,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4910340992,3536,4910344528,7661504512,12571849040,5525152,7667033200,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4910352144,2864,4910355008,7667021488,12577376496,5689024,7672713376,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
4910367232,3424,4910370656,7672696208,12583066864,242627456,7915327088,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
4910413088,8464,4910421552,7915274080,12825695632,2167232,7917449776,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
4910422000,2728704,4913150704,7914714624,12827865328,1984,7917445312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
4913160768,4720,4913165488,7914703968,12827869456,2976,7914711664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
4913172560,7916720,4921089280,7906784464,12827873744,1504,7914702688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
4921117184,5426288,4926543472,7901334144,12827877616,47264,7906807696,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4926560624,3453472,4930014096,7897912640,12827926736,2752640,7904118752,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
4930044928,4496,4930049424,7900631904,12830681328,1952,7900638352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4930092096,4160,4930096256,7900589168,12830685424,7922240,7908515568,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4930135168,2944,4930138112,7908472080,12838610192,5462688,7913937712,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
4930149472,3333648,4933483120,7910591072,12844074192,3470944,7917395664,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
4933504144,3568,4933507712,7914038896,12847546608,2432,7914044896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4933511808,2401376,4935913184,7911637520,12847550704,2112,7914041008,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
4935929376,4480,4935933856,7911620944,12847554800,47168,7911672592,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4935935808,33591248,4969527056,7878077920,12847604976,3418752,7915087920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
4969527616,142640,4969670256,7881354880,12851025136,1952,7881499472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
4969670896,12772720,4982443616,7868585616,12851029232,2467008,7883825344,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
4982479424,3920,4982483344,7871014752,12853498096,2080,7871020752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
4982524816,10275824,4992800640,7860701552,12853502192,34443328,7905420704,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
4992833440,3744,4992837184,7895111376,12887948560,140224,7895255344,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
4992838928,4864,4992843792,7895248096,12888091888,11968896,7907221856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
4992844512,15738864,5008583376,7891480064,12900063440,2208,7907221136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5008584112,5500080,5014084192,7885983344,12900067536,10367680,7901851104,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
5014099904,2976,5014102880,7896333712,12910436592,1952,7896338640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5014109104,2928,5014112032,7896328656,12910440688,832,7896332416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5014138880,4560,5014143440,7896299360,12910442800,15742528,7912046448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5014169856,5792,5014175648,7912012112,12926187760,5472992,7917490896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
5014195104,4288,5014199392,7917462640,12931662032,1984,7917468912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5014206288,6832,5014213120,7917453040,12931666160,1440,7917461312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5014217936,4896,5014222832,7917447424,12931670256,3712,7917456032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5014228768,7920,5014236688,7917439712,12931676400,3456,7917451088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5014241648,5712,5014247360,7917435088,12931682448,1344,7917442144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5014260144,7968,5014268112,7917418528,12931686640,4352,7917430848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
5014275904,3952,5014279856,7917412928,12931692784,1120,7917418000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5014285120,3681328,5017966448,7913730432,12931696880,1664,7917413424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
5017971200,19552,5017990752,7913710224,12931700976,1504,7913731280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5017996416,30144,5018026560,7913678576,12931705136,1280,7913710000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5018098800,5344,5018104144,7913605024,12931709168,25920,7913636288,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
5018135168,3778832,5021914000,7909823936,12931737936,3556960,7917159728,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
5021935264,3312,5021938576,7913358688,12935297264,2464,7913364464,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5021942544,2419392,5024361936,7910939424,12935301360,2208,7913361024,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5024378496,3200,5024381696,7910923760,12935305456,48480,7910975440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5024383824,24925392,5049309216,7886046544,12935355760,4213088,7915185024,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
5049309856,12452640,5061762496,7877808976,12939571472,3584,7890265200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5061763120,4320,5061767440,7877810144,12939577584,2431296,7880245760,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
5061808784,2304256,5064113040,7877897600,12942010640,1888,7880203744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5064163072,3670128,5067833200,7874181504,12942014704,24939456,7902791088,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5067937424,3624112,5071561536,7895394736,12966956272,12481600,7911500448,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
5077065152,5677552,5082742704,7896699168,12979441872,2345504,7904722224,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
5082758608,240696032,5323454640,7658335296,12981789936,3715584,7902746912,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5323463456,2159600,5325623056,7659883968,12985507024,3743616,7665787184,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5325632224,3456,5325635680,7663617168,12989252848,5140192,7668760816,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5325643632,3312,5325646944,7668748432,12994395376,5886496,7674638240,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5325659968,4432,5325664400,7674620064,13000284464,243240192,7917864688,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
5325716768,7872,5325724640,7917802832,13243527472,2167936,7919978640,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
5325725424,2729152,5328454576,7917243712,13245698288,1952,7919974816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
5328466304,5568,5328471872,7917230480,13245702352,2784,7917238832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5328479744,8462464,5336942208,7908764272,13245706480,1536,7917228272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5336973168,5499136,5342472304,7903238272,13245710576,47040,7908784448,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5342492176,3465536,5345957712,7899803008,13245760720,2864192,7906132736,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
5345988320,3984,5345992304,7902634624,13248626928,1888,7902640496,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5346036992,3856,5346040848,7902590176,13248631024,7919136,7910513168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5346082384,2992,5346085376,7910466320,13256551696,5460800,7915930112,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
5346104944,3333264,5349438208,7912575600,13262013808,3467264,7919376128,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
5349460272,3504,5349463776,7916019216,13265482992,2336,7916025056,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5349467888,2395360,5351863248,7913623808,13265487056,2080,7916021248,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5351880144,4112,5351884256,7913606928,13265491184,46144,7913657184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5351887056,34268032,5386155088,7879385248,13265540336,3419168,7917072448,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
5386155776,141552,5386297328,7882665184,13268962512,1984,7882808720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5386298912,12727552,5399026464,7869940176,13268966640,2430464,7885098192,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
5399061632,4512,5399066144,7872333520,13271399664,1888,7872339920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5399110544,10280832,5409391376,7862012384,13271403760,34480480,7906773696,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5409425840,4128,5409429968,7896457024,13305886992,140800,7896601952,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5409431760,3632,5409435392,7896594672,13306030064,11942176,7908540480,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
5409435904,15682784,5425118688,7892855536,13317974224,2464,7908540784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5425119232,5460704,5430579936,7887398416,13317978352,10435040,7903294160,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
5430594704,3392,5430598096,7897816864,13328414960,1920,7897822176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5430605152,2912,5430608064,7897811120,13328419184,896,7897814928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5430637760,2992,5430640752,7897782432,13328423184,15770560,7913555984,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5430669296,5296,5430674592,7913522288,13344196880,5478400,7919005984,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
5430692608,4752,5430697360,7918980960,13349678320,1920,7918987632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5430704592,6064,5430710656,7918971760,13349682416,1440,7918979264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5430716704,6592,5430723296,7918963184,13349686480,1344,7918971120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5430729232,5712,5430734944,7918955632,13349690576,3424,7918964768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5430740016,8624,5430748640,7918948112,13349696752,1344,7918958080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5430765264,8048,5430773312,7918927536,13349700848,4288,7918939872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
5430782160,4480,5430786640,7918920352,13349706992,1088,7918925920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5430790880,3363024,5434153904,7915557184,13349711088,1632,7918921840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
5434159440,3440,5434162880,7915552304,13349715184,1472,7915557216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5434173248,3232,5434176480,7915542832,13349719312,1440,7915547504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5434249024,3952,5434252976,7915470368,13349723344,25152,7915499472,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
5434278272,4237712,5438515984,7911234016,13349750000,3505472,7918977200,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
5438536720,3536,5438540256,7914716944,13353257200,2432,7914722912,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5438544240,2422000,5440966240,7912295056,13353261296,1984,7914719040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5440982816,4608,5440987424,7912277936,13353265360,47424,7912329968,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5440990144,24870544,5465860688,7887453824,13353314512,4290496,7916614864,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
5465861488,12359840,5478221328,7879388448,13357609776,5088,7891753376,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5478221968,3504,5478225472,7879391920,13357617392,2470944,7881866368,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
5478268192,2376608,5480644800,7879446576,13360091376,1920,7881825104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5480692928,3666048,5484358976,7875736496,13360095472,24951584,7904354128,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5484459744,3633120,5488092864,7896955472,13385048336,12361888,7912950480,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
5493161744,5827744,5498989488,7898424448,13397413936,2352704,7906604896,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
5499004528,241787904,5740792432,7658976896,13399769328,3794400,7904559200,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5740797952,2160816,5742958768,7660607552,13403566320,3743264,7666511632,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5742967360,3296,5742970656,7664340400,13407311056,5097024,7669440720,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5742978192,3040,5742981232,7669428448,13412409680,5794272,7675225760,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
5742993344,3616,5742996960,7675209488,13418206448,242996160,7918209264,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
5743037280,5984,5743043264,7918162512,13661205776,2172704,7920341200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
5743043904,2732480,5745776384,7917604304,13663380688,1984,7920338768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
5745785808,5056,5745790864,7917593952,13663384816,2752,7917601760,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5745797776,7804032,5753601808,7909787104,13663388912,1536,7917592672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5753628240,5424576,5759052816,7904340192,13663393008,45984,7909810752,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5759069728,3450272,5762520000,7900920240,13663440240,2770784,7907141296,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
5762553232,3936,5762557168,7903655904,13666213072,2016,7903661856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5762599360,4016,5762603376,7903613888,13666217264,7897696,7911515600,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5762642464,3136,5762645600,7911470768,13674116368,5469888,7916943792,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
5762656896,3334304,5765991200,7913596336,13679587536,3478528,7920409168,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
5766011552,3504,5766015056,7917053088,13683068144,2336,7917058928,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5766019104,2404016,5768423120,7914649216,13683072336,2176,7917055408,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5768439936,4720,5768444656,7914631872,13683076528,47104,7914683696,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5768446528,34209936,5802656464,7880469120,13683125584,3417632,7918096688,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
5802656992,142672,5802799664,7883744928,13686544592,1952,7883889552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5802800960,11883568,5814684528,7871864192,13686548720,2435296,7886183056,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
5814721504,4272,5814725776,7874260096,13688985872,1920,7874266288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5814767856,10265264,5825033120,7863956784,13688989904,35071936,7909293984,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5825065312,4000,5825069312,7898994736,13724064048,140832,7899139568,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5825071040,4032,5825075072,7899131248,13724206320,11934080,7911069360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
5825075664,15700928,5840776592,7895366592,13736143184,2208,7911069728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5840777408,5464496,5846241904,7889905280,13736147184,10473696,7905843472,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
5846256736,3344,5846260080,7900363648,13746623728,1920,7900368912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5846266816,3264,5846270080,7900357712,13746627792,864,7900361840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5846293536,4256,5846297792,7900332144,13746629936,15780192,7916116592,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5846323424,5328,5846328752,7916083008,13762411760,5487200,7921575536,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
5846348960,4640,5846353600,7921547920,13767901520,2016,7921554576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5846359328,3696,5846363024,7921542592,13767905616,1440,7921547728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5846367536,4176,5846371712,7921537904,13767909616,1312,7921543392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5846376480,4560,5846381040,7921532768,13767913808,3488,7921540816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5846386128,5248,5846391376,7921528480,13767919856,1312,7921535040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5846403792,7792,5846411584,7921512368,13767923952,4704,7921524864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
5846418752,4800,5846423552,7921506640,13767930192,1120,7921512560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
5846428176,3385728,5849813904,7918120320,13767934224,1632,7921507680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
5849818608,3216,5849821824,7918116560,13767938384,1536,7918121312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
5849829808,3296,5849833104,7918109376,13767942480,1312,7918113984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5849901344,3584,5849904928,7918041552,13767946480,26112,7918071248,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
5849930176,3383456,5853313632,7914661520,13767975152,3522240,7921567216,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
5853333744,3632,5853337376,7918162352,13771499728,2336,7918168320,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5853341488,2802640,5856144128,7915359728,13771503856,1984,7918164352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
5856160656,4048,5856164704,7915343248,13771507952,47360,7915394656,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
5856166800,25350048,5881516848,7890040640,13771557488,3504160,7918894848,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
5881517440,11849744,5893367184,7881696128,13775063312,3200,7893549072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
5893367776,4416,5893372192,7881697264,13775069456,2750464,7884452144,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
5893412624,2454832,5895867456,7881954672,13777822128,1888,7884411392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
5895914592,3785808,5899700400,7878125632,13777826032,25831808,7907743248,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
5899793728,3810016,5903603744,7900055792,13803659536,12180320,7916046128,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
5908824880,5683632,5914508512,7901334544,13815843056,2370304,7909388480,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
5914523360,241787536,6156310896,7661904768,13818215664,3851904,7907544208,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6156321488,2161648,6158483136,7663586864,13822070000,3824896,7669573408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6158492016,3632,6158495648,7667402032,13825897680,5097152,7672502816,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6158503184,2768,6158505952,7672490256,13830996208,5708416,7678201440,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6158519168,3440,6158522608,7678184544,13836707152,243821344,7922009328,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
6158575856,6992,6158582848,7921947856,14080530704,2179040,7924133888,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
6158583328,2722128,6161305456,7921406304,14082711760,1920,7924130352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
6161317328,5680,6161323008,7921392976,14082715984,2752,7921401408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6161330256,7891632,6169221888,7913498224,14082720112,1632,7921391488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
6169252832,5433936,6174686768,7908037312,14082724080,49440,7913520688,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6174705776,3459968,6178165744,7904609536,14082775280,2768608,7910838112,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
6178198160,5280,6178203440,7907341760,14085545200,1888,7907348928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6178250704,3232,6178253936,7907295360,14085549296,8041856,7915340448,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6178300896,2896,6178303792,7915289088,14093592880,5523488,7920815472,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
6178317616,3333600,6181651216,7917468096,14099119312,3508768,7924310464,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
6181672848,3808,6181676656,7920953056,14102629712,2336,7920959200,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6181680736,2402320,6184083056,7918550656,14102633712,2016,7920954992,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6184102592,3936,6184106528,7918531408,14102637936,45984,7918581328,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6184108640,34871584,6218980224,7883705712,14102685936,3415424,7921992720,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
6218980960,143328,6219124288,7886979728,14106104016,1952,7887125008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
6219125776,11922048,6231047824,7875060320,14106108144,2435424,7889417792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
6231086784,6128,6231092912,7877453376,14108546288,1888,7877461392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6231138784,10682672,6241821456,7866728928,14108550384,34749824,7912161424,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6241855760,4672,6241860432,7901442496,14143302928,139584,7901586752,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6241862224,4896,6241867120,7901577056,14143444176,12637024,7914218976,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
6241868016,16289184,6258157200,7897926240,14156083440,2208,7914217632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
6258157968,5467376,6263625344,7892462192,14156087536,10553792,7908483360,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
6263640080,3472,6263643552,7903000400,14166643952,1920,7903005792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6263650832,3136,6263653968,7902994080,14166648048,2944,7903000160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6263684368,3520,6263687888,7902964384,14166652272,15802976,7918770880,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6263715600,5712,6263721312,7918735216,14182456528,5484832,7924225760,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
6263739840,4832,6263744672,7924198480,14187943152,1952,7924205264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6263751232,6320,6263757552,7924189696,14187947248,1440,7924197456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6263763392,4016,6263767408,7924184032,14187951440,1632,7924189680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6263772704,5136,6263777840,7924177600,14187955440,3232,7924185968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
6263783808,3840,6263787648,7924174096,14187961744,1376,7924179312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6263798496,9376,6263807872,7924157904,14187965776,4896,7924172176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
6263817712,4112,6263821824,7924150160,14187971984,1344,7924155616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6263826240,3377216,6267203456,7920772560,14187976016,1632,7924151408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
6267209088,3664,6267212752,7920767232,14187979984,1504,7920772400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
6267218640,4224,6267222864,7920761248,14187984112,1280,7920766752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6267296848,3312,6267300160,7920688272,14187988432,28864,7920720448,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
6267327648,3458704,6270786352,7917232576,14188018928,3517408,7924208688,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
6270807888,3360,6270811248,7920727264,14191538512,2496,7920733120,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6270815232,2419168,6273234400,7918308112,14191542512,1952,7920729232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6273251424,3968,6273255392,7918291312,14191546704,49504,7918344784,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6273257600,25812640,6299070240,7892528688,14191598928,3880416,7922221744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
6299070752,11813744,6310884496,7884596320,14195480816,3968,7896414032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
6310885152,3616,6310888768,7884598192,14195486960,2623360,7887225168,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
6310931472,2333712,6313265184,7884847408,14198112592,1888,7887183008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6313309840,3870912,6317180752,7880935840,14198116592,25732096,7910538848,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6317275360,3877552,6321152912,7902697824,14223850736,12178304,7918753680,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
6326395024,5665520,6332060544,7903971952,14236032496,2502656,7912140128,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
6332076240,240197056,6572273296,7666264448,14238537744,3782816,7910244320,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6572279072,2168256,6574447328,7667875312,14242322640,3773120,7673816688,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6574455952,3248,6574459200,7671637904,14246097104,5226624,7676867776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6574466752,2752,6574469504,7676856176,14251325680,5718816,7682577744,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6574481376,3120,6574484496,7682561312,14257045808,245704832,7928269264,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
6574522064,10048,6574532112,7928220544,14502752656,2174368,7930404960,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
6574532720,2738048,6577270768,7927658720,14504929488,1984,7930398752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
6577279504,5376,6577284880,7927648736,14504933616,2944,7927657056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6577291696,7802224,6585093920,7919843952,14504937872,1536,7927647712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
6585118576,5435712,6590554288,7914387520,14504941808,47296,7919870528,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6590571168,3462848,6594034016,7910956912,14504990928,2773440,7917193200,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
6594063712,4176,6594067888,7913698208,14507766096,1952,7913704336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6594110608,5904,6594116512,7913653712,14507770224,8355648,7922015264,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6594154912,3600,6594158512,7921970624,14516129136,5595744,7927569968,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
6594169920,3350304,6597520224,7924207024,14521727248,3582016,7931139344,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
6597539136,3600,6597542736,7927768448,14525311184,2336,7927774384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6597546848,2405184,6599952032,7925363280,14525315312,2016,7927770480,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6599969152,4560,6599973712,7925345792,14525319504,45600,7925395952,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6599975584,33829888,6633805472,7891561072,14525366544,3429056,7928820016,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
6633806032,175568,6633981600,7894816432,14528798032,1984,7894993984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
6633982224,12457280,6646439504,7882362528,14528802032,2428384,7897248192,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
6646481008,5088,6646486096,7884745888,14531231984,1984,7884752960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6646528112,10516608,6657044720,7874191392,14531236112,34769312,7919477312,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6657077248,3440,6657080688,7908926432,14566007120,140896,7909070768,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6657082320,7184,6657089504,7909060976,14566150480,12833760,7921901920,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
6657089936,15362736,6672452672,7906534544,14578987216,1952,7921899232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
6672453664,5615440,6678069104,7900922240,14578991344,10459904,7916997584,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
6678083760,3360,6678087120,7911365472,14589452592,1952,7911370784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6678095232,3056,6678098288,7911358336,14589456624,864,7911362256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6678121552,2880,6678124432,7911334688,14589459120,15787264,7927124832,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6678150000,3376,6678153376,7927095376,14605248752,5485600,7932584352,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
6678165232,3792,6678169024,7932567472,14610736496,1952,7932573216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6678174992,3008,6678178000,7932562464,14610740464,1472,7932566944,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6678181984,3264,6678185248,7932559408,14610744656,1312,7932563984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6678189792,4400,6678194192,7932554560,14610748752,3552,7932562512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
6678198608,3456,6678202064,7932552736,14610754800,1344,7932557536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6678211984,5968,6678217952,7932541040,14610758992,4800,7932551808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
6678223552,3360,6678226912,7932538160,14610765072,1120,7932542640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6678231568,3575024,6681806592,7928962640,14610769232,1632,7932539296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
6681811456,3120,6681814576,7928958752,14610773328,1472,7928963344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
6681819888,4432,6681824320,7928953008,14610777328,1376,7928958816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6681888832,5104,6681893936,7928887584,14610781520,27456,7928920144,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
6681918944,3786976,6685705920,7925104336,14610810256,3513824,7932405136,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
6685728432,4176,6685732608,7928594000,14614326608,2656,7928600832,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6685736672,2417456,6688154128,7926176480,14614330608,1952,7928595888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
6688170768,4112,6688174880,7926159920,14614334800,54208,7926218240,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
6688177056,26000224,6714177280,7900214768,14614392048,4344608,7930559600,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
6714178192,12033536,6726211728,7892526240,14618737968,4000,7904563776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
6726212416,5840,6726218256,7892525888,14618744144,2452704,7894984432,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
6726263280,2307232,6728570512,7892628096,14621198608,1856,7894937184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
6728619216,3665136,6732284352,7888918320,14621202672,25020704,7917604160,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
6732387152,3863344,6736250496,7909974608,14646225104,12401824,7926239776,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
6741690912,5725680,6747416592,7911213216,14658629808,2358784,7919297680,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
6747431696,239621136,6987052832,7673938384,14660991216,3720512,7917280032,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6987056704,2159792,6989216496,7675497056,14664713552,3752288,7681409136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6989224736,3392,6989228128,7679239280,14668467408,5166208,7684408880,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6989235808,2688,6989238496,7684398192,14673636688,5912992,7690313872,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
6989248816,3344,6989252160,7690300080,14679552240,243265760,7933569184,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
6989288528,5952,6989294480,7933525408,14922819888,2181408,7935712768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
6989294992,2741440,6992036432,7932966592,14925003024,1984,7935710016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
6992044784,4256,6992049040,7932958048,14925007088,2944,7932965248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
6992056096,7828240,6999884336,7925127008,14925011344,1504,7932956752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
6999907424,5439088,7005346512,7919668768,14925015280,45504,7925153360,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7005362304,3476224,7008838528,7916224848,14925063376,2772544,7922473616,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
7008867744,4288,7008872032,7918966416,14927838448,1888,7918972592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7008912544,3632,7008916176,7918926336,14927842512,7908448,7926838416,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7008956144,2752,7008958896,7926794208,14935753104,5470688,7932267648,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
7008970896,3336768,7012307664,7928918560,14941226224,3486752,7935742080,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
7012328992,3440,7012332432,7932383680,14944716112,2336,7932389456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7012336384,2645664,7014982048,7929738064,14944720112,1952,7932385680,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7014998224,3168,7015001392,7929722912,14944724304,46944,7929773024,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7015003200,34067136,7049070336,7895704240,14944774576,3429888,7933201264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
7049070928,140496,7049211424,7898994416,14948205840,1952,7899136864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7049212080,12770800,7061982880,7886226992,14948209872,2433824,7901431616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
7062019248,4304,7062023552,7888621456,14950645008,1856,7888627616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7062063792,10292352,7072356144,7878293024,14950649168,34601024,7923186400,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7072387568,4080,7072391648,7912860496,14985252144,140448,7913005024,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7072393312,4112,7072397424,7912996992,14985394416,12787328,7925788432,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
7072398064,15671552,7088069616,7910113504,14998183120,1952,7925787008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7088070432,5512912,7093583344,7904603904,14998187248,10507648,7920624464,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
7093596752,3088,7093599840,7915097744,15008697584,1920,7915102752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7093606128,2880,7093609008,7915092800,15008701808,832,7915096512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7093631696,4848,7093636544,7915067664,15008704208,15794528,7930867040,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7093661840,5856,7093667696,7930833280,15024500976,5490432,7936329568,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
7093686384,7424,7093693808,7936298912,15029992720,2080,7936308416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7093699696,3312,7093703008,7936293808,15029996816,1440,7936298560,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7093706912,5824,7093712736,7936288176,15030000912,3392,7936297392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7093717552,5248,7093722800,7936284224,15030007024,3488,7936292960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7093727600,4640,7093732240,7936280928,15030013168,1312,7936286880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7093742736,5232,7093747968,7936269296,15030017264,4608,7936279136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
7093753216,4880,7093758096,7936265280,15030023376,1120,7936271280,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7093762704,3639856,7097402560,7932624944,15030027504,1664,7936266464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
7097407264,9408,7097416672,7932614928,15030031600,1472,7932625808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7097422384,10256,7097432640,7932603056,15030035696,1280,7932614592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7097497648,36288,7097533936,7932505856,15030039792,26944,7932569088,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
7097558368,3947872,7101506240,7928562224,15030068464,3510464,7936020560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
7101528944,3520,7101532464,7932048288,15033580752,2432,7932054240,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7101536592,2415824,7103952416,7929632432,15033584848,2016,7932050272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7103970496,4240,7103974736,7929614208,15033588944,47936,7929666384,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7103979248,24840160,7128819408,7904819744,15033639152,4327456,7933987360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
7128820160,12402896,7141223056,7896745600,15037968656,3584,7909152080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7141223824,4192,7141228016,7896746784,15037974800,2438464,7899189440,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
7141276752,2292016,7143568768,7896847216,15040415984,1856,7899141088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7143623120,3653136,7147276256,7893143824,15040420080,24980000,7921776960,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7147384720,3633232,7151017952,7914383760,15065401712,12355584,7930372576,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
7156533776,5683504,7162217280,7915544240,15077761520,2391040,7923618784,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
7162232272,242216400,7404448672,7675706800,15080155472,3754496,7921677696,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7404462752,2165984,7406628736,7677283664,15083912400,3751616,7683201264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7406639280,3456,7406642736,7681022656,15087665392,5103328,7686129440,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7406651376,3200,7406654576,7686115424,15092770000,5872896,7691991520,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7406674176,3472,7406677648,7691967168,15098644816,243853824,7935824464,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
7406792976,12672,7406805648,7935694464,15342500112,2173248,7937880384,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
7406806112,2635568,7409441680,7935233344,15344675024,1920,7937870832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
7409455984,5824,7409461808,7935217344,15344679152,2944,7935226112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7409472464,7827936,7417300400,7927382976,15344683376,1504,7935212416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7417356112,5407488,7422763600,7921923744,15344687344,45984,7927377216,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7422789296,3443936,7426233232,7918501408,15344734640,2776768,7924722112,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
7426270432,4496,7426274928,7921237792,15347512720,1888,7921244176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7426330976,3552,7426334528,7921182128,15347516656,7939712,7929125392,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7426389472,3984,7426393456,7929065408,15355458864,5468864,7934538256,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
7426407904,3291648,7429699552,7931229456,15360929008,3482720,7938003824,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
7429720096,3600,7429723696,7934690016,15364413712,2432,7934696048,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7429727952,2401216,7432129168,7932288608,15364417776,2144,7934691968,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7432147600,3952,7432151552,7932270320,15364421872,46048,7932320320,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7432154192,34858752,7467012944,7897457056,15364470000,3435008,7935750816,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
7467013632,144624,7467158256,7900748288,15367906544,1920,7900894832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7467159168,11881472,7479040640,7888870000,15367910640,2439200,7903190672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
7479081632,4208,7479085840,7891266016,15370351856,1920,7891272144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7479132288,10274656,7489406944,7880949008,15370355952,34622048,7925845712,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7489441600,4000,7489445600,7915534928,15404980528,142464,7915681392,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7489447312,5312,7489452624,7915672320,15405124944,12814048,7928491680,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
7489453088,15689456,7505142544,7912798688,15417941232,1984,7928490128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7505143104,5524048,7510667152,7907278176,15417945328,10463552,7923265776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
7510683168,3072,7510686240,7917724464,15428410704,1952,7917729488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7510694448,3184,7510697632,7917717168,15428414800,864,7917721216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7510737328,4672,7510742000,7917676832,15428418832,15803776,7933485280,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7510774336,5184,7510779520,7933445744,15444225264,5480064,7938930992,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
7510797568,9520,7510807088,7938900768,15449707856,1920,7938912208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7510818192,6000,7510824192,7938887760,15449711952,1472,7938895232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7510834160,5776,7510839936,7938876016,15449715952,1312,7938883104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7510845088,6992,7510852080,7938868064,15449720144,3552,7938878608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7510858656,5680,7510864336,7938861856,15449726192,1344,7938868880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7510891344,8096,7510899440,7938830848,15449730288,4480,7938843424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
7510912320,8656,7510920976,7938815616,15449736592,1088,7938825360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7510926112,3347008,7514273120,7935467376,15449740496,1632,7938816016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
7514278400,3488,7514281888,7935462960,15449744848,1504,7935467952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7514289168,4960,7514294128,7935454688,15449748816,1280,7935460928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7514381488,3344,7514384832,7935367984,15449752816,25952,7935397280,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
7514411104,4188768,7518599872,7931181616,15449781488,3512480,7938882864,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
7518622256,3328,7518625584,7934670368,15453295952,2400,7934676096,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7518629680,2424736,7521054416,7932245504,15453299920,2176,7934672416,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7521071216,4288,7521075504,7932228640,15453304144,47104,7932280032,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7521078000,25207904,7546285904,7907068352,15453354256,4206304,7936482560,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
7546286944,12455456,7558742400,7898820496,15457562896,3264,7911279216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7558743184,4384,7558747568,7898821472,15457569040,2482784,7901308640,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
7558793792,2305520,7561099312,7898955040,15460054352,1888,7901262448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7561151488,3665216,7564816704,7895241744,15460058448,24982208,7923889168,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7564912816,3691568,7568604384,7916437552,15485041936,12379232,7932508352,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
7573762864,5813600,7579576464,7917848864,15497425328,2372352,7926034816,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
7579591184,240910720,7820501904,7679297888,15499799792,3764256,7923972864,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7820506720,2152560,7822659280,7680906752,15503566032,3745824,7686805136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7822667424,3248,7822670672,7684644224,15507314896,5102048,7689749520,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7822678816,3232,7822682048,7689736592,15512418640,5740512,7695480336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
7822694960,3328,7822698288,7695463616,15518161904,243390656,7938857600,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
7822740064,10224,7822750288,7938803584,15761553872,2179552,7940993360,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
7822750768,2749296,7825500064,7938235696,15763735760,1984,7940986976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
7825508544,4608,7825513152,7938226736,15763739888,2848,7938234192,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7825519424,7836528,7833355952,7930388096,15763744048,1504,7938226128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7833387808,5421408,7838809216,7924938832,15763748048,46464,7930406704,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7838825824,3462656,7842288480,7921507824,15763796304,2774592,7927745072,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
7842318608,3872,7842322480,7924250816,15766573296,1920,7924256608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7842364000,3024,7842367024,7924210368,15766577392,7937408,7932150800,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7842406240,3232,7842409472,7932108080,15774517552,5466464,7937577776,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
7842421040,3344848,7845765888,7934219760,15779985648,3486240,7941050848,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
7845786992,3920,7845790912,7937683600,15783474512,2400,7937689920,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7845795104,2401632,7848196736,7935281872,15783478608,2016,7937685520,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7848213376,4752,7848218128,7935264480,15783482608,45856,7935315088,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7848220272,34252944,7882473216,7901057648,15783530864,3417632,7938728224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
7882473856,141408,7882615264,7904334576,15786949840,1952,7904477936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7882616224,11866480,7894482704,7892471264,15786953968,2433792,7906771536,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
7894523184,5408,7894528592,7894861472,15789390064,1856,7894868736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7894571744,10267072,7904838816,7884555344,15789394160,34660288,7929482704,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7904871072,4368,7904875440,7919182176,15824057616,140576,7919327120,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7904877040,2960,7904880000,7919320944,15824200944,12779424,7932103328,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
7904880432,15702960,7920583392,7916399088,15836982480,2496,7932104544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7920583920,5465408,7926049328,7910937280,15836986608,10441280,7926843968,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
7926063744,3600,7926067344,7921362112,15847429456,2016,7921367728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7926074176,3344,7926077520,7921356032,15847433552,2912,7921362288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7926107760,4560,7926112320,7921327280,15847439600,15823232,7937155072,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7926141568,6848,7926148416,7937116080,15863264496,5483136,7942606064,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
7926164704,4656,7926169360,7942580832,15868750192,1920,7942587408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7926176912,5136,7926182048,7942572112,15868754160,1440,7942578688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7926187376,6320,7926193696,7942564656,15868758352,3424,7942574400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7926199664,5360,7926205024,7942559344,15868764368,3296,7942568000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7926209904,5856,7926215760,7942554880,15868770640,1344,7942562080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7926229792,7264,7926237056,7942537712,15868774768,4416,7942549392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
7926244224,5024,7926249248,7942531600,15868780848,1088,7942537712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
7926254416,3377264,7929631680,7939153328,15868785008,1632,7942532224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
7929636672,3216,7929639888,7939149088,15868788976,1504,7939153808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
7929645696,3840,7929649536,7939143536,15868793072,1280,7939148656,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7929720336,3296,7929723632,7939073664,15868797296,26336,7939103296,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
7929749328,3391392,7933140720,7935685120,15868825840,3516480,7942592992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
7933163216,3584,7933166800,7939178528,15872345328,2336,7939184448,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7933170800,2789456,7935960256,7936389168,15872349424,2016,7939180640,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
7935976976,4352,7935981328,7936372192,15872353520,47872,7936424416,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
7935983584,25276112,7961259696,7911143040,15872402736,3900736,7940319888,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
7961260192,11802160,7973062352,7903242880,15876305232,1952,7915046992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
7973063280,4688,7973067968,7903241264,15876309232,2704032,7905949984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
7973112496,2335808,7975448304,7903566304,15879014608,2208,7905904320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
7975495376,3880560,7979375936,7899642800,15879018736,25014784,7928538144,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
7979476720,3819504,7983296224,7920739824,15904036048,12223424,7936782752,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
7988515152,5693456,7994208608,7922053392,15916262000,2486112,7930232960,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
7994223696,241138400,8235362096,7683388864,15918750960,3770784,7928298048,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8235370144,2176288,8237546432,7684977968,15922524400,3784096,7690938352,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8237554832,3264,8237558096,7688753056,15926311152,5109984,7693866304,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8237566352,3024,8237569376,7693854608,15931423984,5723136,7699580768,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8237581904,3296,8237585200,7699563968,15937149168,243361312,7942928576,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
8237633664,4848,8237638512,7942874528,16180513040,2178944,7945058320,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
8237639888,2733536,8240373424,7942320800,16182694224,1952,7945056288,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
8240384176,4528,8240388704,7942309616,16182698320,3200,7942317344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8240397328,7935408,8248332736,7934371632,16182704368,1536,7942308576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
8248367040,5417088,8253784128,7928924432,16182708560,49120,7934390640,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8253802752,3455024,8257257776,7925502976,16182760752,2770976,7931728976,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
8257290112,4432,8257294544,7928240192,16185534736,1920,7928246544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8257339472,3344,8257342816,7928196080,16185538896,8428352,7936627776,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8257388256,3888,8257392144,7936576480,16193968624,5499328,7942079696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
8257404752,3342272,8260747024,7938722400,16199469424,3676128,7945740800,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
8260768720,3616,8260772336,7942375168,16203147504,2496,7942381280,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8260776544,2402544,8263179088,7939972512,16203151600,2080,7942377136,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8263195904,4000,8263199904,7939955760,16203155664,47648,7940007408,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8263201840,34368272,8297570112,7905634768,16203204880,4130240,7944133280,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
8297571328,144064,8297715392,7909621424,16207336816,1952,7909767440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
8297716032,11915616,8309631648,7897709136,16207340784,2429920,7912054672,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
8309669232,4608,8309673840,7900099936,16209773776,1888,7900106432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8309714416,10723856,8320438272,7889339728,16209778000,34611488,7934675072,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8320471904,3680,8320475584,7923915600,16244391184,139936,7924059216,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8320477888,4960,8320482848,7924049616,16244532464,12928448,7936983024,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
8320483296,16076352,8336559648,7920903856,16257463504,2208,7936982416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
8336560496,5466480,8342026976,7915440656,16257467632,10450016,7931357152,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
8342042368,3248,8342045616,7925873984,16267919600,1920,7925879152,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8342052832,3360,8342056192,7925867600,16267923792,832,7925871792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8342086032,3280,8342089312,7925836976,16267926288,15834848,7941675104,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8342119504,5264,8342124768,7941638224,16283762992,5478816,7947122304,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
8342142512,7440,8342149952,7947094448,16289244400,1952,7947103840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8342158736,7728,8342166464,7947082032,16289248496,1408,7947091168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8342172144,6608,8342178752,7947072848,16289251600,1472,7947080928,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8342184496,5200,8342189696,7947064912,16289254608,3456,7947073568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
8342196320,6192,8342202512,7947058272,16289260784,1376,7947065840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8342216496,7984,8342224480,7947040400,16289264880,4800,7947053184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
8342233840,4896,8342238736,7947032256,16289270992,1088,7947038240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8342243904,3351936,8345595840,7943679280,16289275120,1600,7947032816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
8345600784,3824,8345604608,7943674608,16289279216,1504,7943679936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
8345610944,4336,8345615280,7943668032,16289283312,1280,7943673648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8345686176,3408,8345689584,7943597824,16289287408,26624,7943627856,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
8345715600,3385056,8349100656,7940215424,16289316080,3510240,7947110720,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
8349121792,3408,8349125200,7943704320,16292829520,2432,7943710160,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8349129184,2427120,8351556304,7941277184,16292833488,2048,7943706352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8351573168,4368,8351577536,7941260080,16292837616,48736,7941313184,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8351579824,25721168,8377300992,7915586768,16292887760,4145728,7945453664,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
8377301472,11895872,8389197344,7907838704,16297036048,3808,7919738384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
8389197968,4896,8389202864,7907839328,16297042192,2516704,7910360928,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
8389252016,2295872,8391547888,7908012320,16299560208,1888,7910310080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8391595104,3716848,8395311952,7904252320,16299564272,25347424,7933316592,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8395413040,3928512,8399341552,7925572864,16324914416,12396480,7941897856,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
8404761968,5662512,8410424480,7926890032,16337314512,2354336,7934906880,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
8410439184,241582832,8652022016,7687649264,16339671280,3785536,7933017632,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8652028000,2158448,8654186448,7689272608,16343459056,3750080,7695181136,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8654194800,4688,8654199488,7693012464,16347211952,5090848,7698108000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8654207312,3184,8654210496,7698093872,16352304368,5793280,7703890336,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
8654222832,3456,8654226288,7703872960,16358099248,242750816,7946627232,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
8654273888,5520,8654279408,7946572736,16600852144,2176192,7948754448,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
8654280384,2722736,8657003120,7946027744,16603030864,1984,7948752464,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
8657011872,3952,8657015824,7946019040,16603034864,3008,7946026000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8657021584,7930096,8664951680,7938089328,16603041008,1536,7946020960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
8664975728,5437824,8670413552,7932631520,16603045072,48992,7938118336,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8670429312,3462016,8673891328,7929204944,16603096272,2770880,7935437840,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
8673920864,4016,8673924880,7931944416,16605869296,2016,7931950448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8673966160,2928,8673969088,7931904304,16605873392,8377760,7940284992,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8674009696,2912,8674012608,7940241200,16614253808,5504512,7945748624,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
8674023520,4275808,8678299328,7941460528,16619759856,3685984,7949422320,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
8678317424,3664,8678321088,7945126288,16623447376,2432,7945132384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8678325168,2425520,8680750688,7942700656,16623451344,2176,7945128352,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8680767632,3904,8680771536,7942684032,16623455568,47456,7942735392,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8680773552,34560976,8715334528,7908170096,16623504624,3658144,7946389216,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
8715335296,142624,8715477920,7911687504,16627165424,1952,7911832080,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
8715479152,12381840,8727860992,7899308528,16627169520,2434048,7914124416,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
8727906576,5472,8727912048,7901693568,16629605616,1920,7901700960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8727973776,10337424,8738311200,7891298512,16629609712,34581888,7936217824,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8738354352,4528,8738358880,7925834416,16664193296,141376,7925980320,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8738361280,5024,8738366304,7925970288,16664336592,12743040,7938718352,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
8738366992,15264272,8753631264,7923451056,16677082320,2208,7938717536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
8753632368,5478080,8759110448,7917975968,16677086416,10444640,7933898688,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
8759129936,3248,8759133184,7928399152,16687532336,1952,7928404352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8759141696,3280,8759144976,7928391392,16687536368,928,7928395600,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8759228944,3824,8759232768,7928305808,16687538576,15807712,7944117344,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8759289824,7104,8759296928,7944052080,16703349008,5580608,7949639792,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
8759350048,13664,8759363712,7949568112,16708931824,1920,7949583696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8759388112,8912,8759397024,7949539056,16708936080,1440,7949549408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8759409616,6704,8759416320,7949523760,16708940080,1312,7949531776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8759427408,13856,8759441264,7949504736,16708946000,22080,7949540672,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
8759448880,9792,8759458672,7949597888,16709056560,1344,7949609024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8759519552,14720,8759534272,7949525552,16709059824,5952,7949546224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
8759566176,13888,8759580064,7949487952,16709068016,1120,7949502960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
8759586224,3295552,8762881776,7946190464,16709072240,6144,7949492160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
8762888848,4368,8762893216,7946317488,16709210704,1952,7946323808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
8762906064,4656,8762910720,7946304752,16709215472,1248,7946310656,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8763025376,7440,8763032816,7946186720,16709219536,38432,7946232592,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
8763074480,3508112,8766582592,7942676912,16709259504,3551520,7949736544,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
8766605088,3552,8766608640,7946204112,16712812752,5216,7946212880,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8766612528,2419360,8769031888,7943789056,16712820944,2432,7946210848,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
8769052480,3536,8769056016,7943769056,16712825072,49920,7943822512,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
8769058256,25532576,8794590832,7918286464,16712877296,4215904,7948034944,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
8794591296,12078096,8806669392,7910426752,16717096144,4128,7922508976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
8806669952,3792,8806673744,7910428576,16717102320,2539872,7912972240,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
8806732176,2291728,8809023904,7910620080,16719643984,1856,7912913664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
8809081648,3666432,8812748080,7906899872,16719647952,24050080,7934616384,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
8812959120,3891648,8816850768,7926848960,16743699728,12171808,7942912416,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
8822205072,5719472,8827924544,7927950800,16755875344,2411200,7936081472,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
8827943840,241592832,9069536672,7688767760,16758304432,3849120,7934209712,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9069554896,2155264,9071710160,7690445088,16762155248,3791648,7696392000,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9071720080,3136,9071723216,7694225920,16765949136,5113664,7699342720,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9071732128,3104,9071735232,7699329936,16771065168,5721440,7705054480,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9071757200,4832,9071762032,7705027200,16776789232,243282592,7948314624,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
9071845504,10688,9071856192,7948218160,17020074352,2181056,7950409904,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
9071858192,2674176,9074532368,7947725088,17022257456,1952,7950401216,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
9074542976,6144,9074549120,7947712368,17022261488,2752,7947721264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9074559056,7900928,9082459984,7939805696,17022265680,1536,7947708160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
9082503840,5420400,9087924240,7934344608,17022268848,47200,7939812208,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9087949744,3463008,9091412752,7930905024,17022317776,2768704,7937136736,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
9091444400,4592,9091448992,7933639056,17025088048,1888,7933645536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9091490976,3984,9091494960,7933596864,17025091824,7918304,7941519152,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9091536800,3008,9091539808,7941472688,17033012496,5477536,7946953232,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
9091552896,3793872,9095346768,7943146240,17038493008,3490304,7950430416,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
9095367760,3648,9095371408,7946613344,17041984752,2592,7946619584,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9095375568,2602960,9097978528,7944010320,17041988848,1952,7946615232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9097995936,5056,9098000992,7943991952,17041992944,47552,7944044560,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9098002944,33679648,9131682592,7910360496,17042043088,3416192,7947456336,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
9131683136,142512,9131825648,7913635552,17045461200,2048,7913780112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
9131826304,11921232,9143747536,7901717792,17045465328,2434656,7916073680,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
9143785760,4032,9143789792,7904112784,17047902576,1920,7904118736,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9143834640,10302048,9154136688,7893769824,17047906512,34610912,7938682784,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9154172848,4192,9154177040,7928341792,17082518832,140352,7928486336,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9154178848,5216,9154184064,7928477072,17082661136,11964480,7940446768,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
9154184528,15674288,9169858816,7924769840,17094628656,2208,7940446336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
9169860304,5507232,9175367536,7919265120,17094632656,10482784,7935255136,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
9175383552,3328,9175386880,7929730896,17105117776,1920,7929736144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9175394576,4544,9175399120,7929722432,17105121552,864,7929727840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9175444112,3168,9175447280,7929676416,17105123696,15782656,7945462240,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9175485568,3120,9175488688,7945419840,17120908528,5489472,7950912432,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
9175508704,8800,9175517504,7950882736,17126400240,1984,7950893520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9175532896,7136,9175540032,7950864304,17126404336,1440,7950872880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9175546720,6784,9175553504,7950855344,17126408848,3520,7950865648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9175560832,8544,9175569376,7950845168,17126414544,3456,7950857168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
9175575952,7424,9175583376,7950837440,17126420816,1344,7950846208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9175621088,13728,9175634816,7950790000,17126424816,4448,7950808176,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
9175694400,6576,9175700976,7950730080,17126431056,1120,7950737776,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9175707424,3588192,9179295616,7947139568,17126435184,1632,7950729392,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
9179301920,5056,9179306976,7947132176,17126439152,1472,7947138704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
9179315984,4032,9179320016,7947123360,17126443376,1248,7947128640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9179415840,3936,9179419776,7947027664,17126447440,26944,7947058544,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
9179454496,3731184,9183185680,7943290400,17126476080,3512928,7950534512,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
9183207680,3312,9183210992,7946780512,17129991504,2400,7946786224,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9183215088,2403584,9185618672,7944376832,17129995504,2080,7946782496,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9185636640,4256,9185640896,7944358928,17129999824,47872,7944411056,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9185643280,24602576,9210245856,7919804272,17130050128,3447936,7947854784,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
9210246512,12468592,9222715104,7910784624,17133499728,3616,7923256832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
9222715968,3536,9222719504,7910786368,17133505872,2833664,7913623568,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
9222764704,2305392,9225070096,7911271136,17136341232,1888,7913578416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9225121152,3679872,9228801024,7907544400,17136345424,25380896,7936605168,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9228948704,3587632,9232536336,7929192896,17161729232,11852064,7944632592,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
9238067328,5798816,9243866144,7929718480,17173584624,2479616,7937996912,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
9243884080,242194624,9486078704,7689988608,17176067312,3863872,7936047104,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9486095072,2150672,9488245744,7691687168,17179932912,3950816,7697788656,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9488255824,3488,9488259312,7695626208,17183885520,5209696,7700839392,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9488268208,2720,9488270928,7700825856,17189096784,5707104,7706535680,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9488297024,4944,9488301968,7706503520,17194805488,243530720,7950039184,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
9488395376,9120,9488404496,7949933824,17438338320,2179584,7952122528,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
9488405392,2665456,9491070848,7949449552,17440520400,2048,7952117056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
9491082384,5840,9491088224,7949436304,17440524528,2752,7949444896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9491098944,7923936,9499022880,7941505712,17440528592,1536,7949431184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
9499066240,5412928,9504479168,7936053520,17440532688,45664,7941512112,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9504498704,3451984,9507950688,7932630160,17440580848,2772320,7938854464,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
9507981856,4192,9507986048,7935368816,17443354864,1888,7935374896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9508032496,3776,9508036272,7935322688,17443358960,7933664,7943260128,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9508079104,2880,9508081984,7943211952,17451293936,5481440,7948696272,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
9508095536,3336592,9511432128,7945345296,17456777424,3490848,7952172736,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
9511454736,3664,9511458400,7948811920,17460270320,2304,7948817888,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9511462736,2457488,9513920224,7946354192,17460274416,2176,7948813856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9513936960,3600,9513940560,7946337984,17460278544,46048,7946387632,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9513942480,34361680,9548304160,7912023600,17460327760,3426208,7949811488,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
9548304704,141440,9548446144,7915310864,17463757008,1952,7915454256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
9548447904,12797392,9561245296,7902515840,17463761136,2438752,7917751984,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
9561282800,3856,9561286656,7904915696,17466202352,1888,7904921440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9561328784,10280688,9571609472,7894596976,17466206448,34688000,7939565664,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9571644000,3888,9571647888,7929248640,17500896528,140192,7929392720,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9571650112,3968,9571654080,7929385776,17501039856,12220320,7941610064,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
9571654816,15716592,9587371408,7925890144,17513261552,2016,7941608752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
9587372464,5458352,9592830816,7920434608,17513265424,10986432,7936879392,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
9592846560,3472,9592850032,7931403904,17524253936,1952,7931409328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9592857264,3232,9592860496,7931397536,17524258032,896,7931401664,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9592901568,8208,9592909776,7931350432,17524260208,15775616,7947134256,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9592938608,2976,9592941584,7947096288,17540037872,5476288,7952575552,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
9592960784,5904,9592966688,7952549584,17545516272,1952,7952557440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9592976752,5360,9592982112,7952538256,17545520368,1440,7952545056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9592990256,4864,9592995120,7952529344,17545524464,1280,7952535488,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9593001168,6512,9593007680,7952520880,17545528560,3040,7952530432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
9593014720,5296,9593020016,7952514688,17545534704,1440,7952521424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9593034496,9632,9593044128,7952493264,17545537392,4672,7952507568,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
9593052880,4080,9593056960,7952487056,17545544016,1088,7952492224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9593061488,3480256,9596541744,7949006272,17545548016,1600,7952488128,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
9596547472,14992,9596562464,7948989648,17545552112,1504,7949006144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
9596568416,8112,9596576528,7948979808,17545556336,1248,7948989168,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9596657552,3232,9596660784,7948899520,17545560304,25984,7948928736,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
9596690480,4077072,9600767552,7944821424,17545588976,3520064,7952418560,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
9600790032,3152,9600793184,7948317328,17549110512,2688,7948323168,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9600797136,2398464,9603195600,7945919008,17549114608,2016,7948319488,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9603214272,5344,9603219616,7945899056,17549118672,49440,7945953840,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9603222352,24909936,9628132288,7921037616,17549169904,3445856,7949393408,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
9628132960,12467968,9640600928,7912016880,17552617808,3680,7924488528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
9640601840,4032,9640605872,7912017952,17552623824,2677920,7914699904,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
9640649808,2305344,9642955152,7912348608,17555303760,1888,7914655840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9643007808,3679280,9646687088,7908620768,17555307856,25633504,7937933552,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9646813632,3625584,9650439216,7930504416,17580943632,11815744,7945945744,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
9655795904,5783504,9661579408,7931183424,17592762832,2383392,7939350320,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
9661594736,241181248,9902775984,7692371520,17595147504,3935872,7937488640,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9902783600,2161168,9904944768,7694141040,17599085808,3919136,7700221344,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9904952944,3200,9904956144,7698050560,17603006704,5242336,7703296096,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9904964352,2960,9904967312,7703283392,17608250704,5685216,7708971568,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
9904979552,4192,9904983744,7708955184,17613938928,243162464,7952121840,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
9905031312,8000,9905039312,7952063808,17857103120,2174272,7954246080,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
9905039824,2722080,9907761904,7951518240,17859280144,1920,7954242240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
9907771376,5648,9907777024,7951507184,17859284208,2624,7951515456,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
9907783040,7830512,9915613552,7943674720,17859288272,1536,7951506768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
9915639008,5440768,9921079776,7938212624,17859292400,45184,7943698576,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9921096624,3450848,9924547472,7934792000,17859339472,2773504,7941016352,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
9924577200,4256,9924581456,7937532800,17862114256,1920,7937538976,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9924621872,3040,9924624912,7937493760,17862118672,7919360,7945416160,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9924664912,2704,9924667616,7945372848,17870040464,5467552,7950843104,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
9924678944,3344800,9928023744,7947486736,17875510480,3489920,7954321456,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
9928041984,3536,9928045520,7950957920,17879003440,2400,7950963856,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9928049728,2406000,9930455728,7948551808,17879007536,1952,7950959760,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
9930472160,5056,9930477216,7948534352,17879011568,47104,7948586512,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9930479312,34486272,9964965584,7914096160,17879061744,3419008,7952001440,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
9964966112,146560,9965112672,7917369392,17882482064,1984,7917517936,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
9965114944,12742720,9977857664,7904628432,17882486096,2434304,7919805456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
9977892880,4832,9977897712,7907025408,17884923120,1920,7907032160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
9977939488,10299984,9988239472,7896687744,17884927216,34663328,7941651056,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
9988272720,3760,9988276480,7931315408,17919591888,140288,7931459456,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
9988278528,5072,9988283600,7931451424,17919735024,11913600,7943370096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
9988284160,15667456,10003951616,7927698640,17931650256,2176,7943368272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10003952288,5470336,10009422624,7922231760,17931654384,10436992,7938139088,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
10009437376,3328,10009440704,7932653360,17942094064,1920,7932658608,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10009446992,2944,10009449936,7932648256,17942098192,2720,7932653920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10009475088,4896,10009479984,7932622304,17942102288,15837408,7948464608,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10009506448,4896,10009511344,7948430144,17957941488,5479968,7953915008,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
10009529888,6080,10009535968,7953886992,17963422960,1920,7953894992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10009542304,3728,10009546032,7953881120,17963427152,1408,7953886256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10009549984,4960,10009554944,7953876304,17963431248,1312,7953882576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10009560416,5664,10009566080,7953869136,17963435216,3104,7953877904,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10009571136,4320,10009575456,7953866032,17963441488,1376,7953871728,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10009590912,5104,10009596016,7953849472,17963445488,4480,7953859056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
10009602768,4240,10009607008,7953844464,17963451472,1088,7953849792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10009611632,3383936,10012995568,7950458784,17963454352,1632,7953844352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
10013000288,4400,10013004688,7950454112,17963458800,1472,7950459984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10013010256,4128,10013014384,7950448512,17963462896,1280,7950453920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10013081440,3632,10013085072,7950381920,17963466992,25376,7950410928,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
10013114832,4174096,10017288928,7946204720,17963493648,3513056,7953891872,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
10017309120,3376,10017312496,7949695520,17967008016,2592,7949701488,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10017316448,2480320,10019796768,7947215312,17967012080,1984,7949697616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10019813408,4352,10019817760,7947198416,17967016176,48640,7947251408,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10019819968,24896064,10044716032,7922351344,17967067376,3444384,7950691792,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
10044716608,12393200,10057109808,7913404480,17970514288,3840,7925801520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10057110592,6272,10057116864,7913403472,17970520336,2452608,7915862352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
10057165088,2312480,10059477568,7913497296,17972974864,1856,7915811632,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10059523488,3740880,10063264368,7909714560,17972978928,25941344,7939396784,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10063367760,3646448,10067014208,7931908784,17998922992,11825184,7947380416,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
10072089968,5698240,10077788208,7932963072,18010751280,2374368,7941035680,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
10077802720,242529136,10320331856,7692796064,18013127920,3870592,7939195792,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10320338112,2163248,10322501360,7694499360,18017000720,3897536,7700560144,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10322510048,3520,10322513568,7698386512,18020900080,5456384,7703846416,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10322521440,2912,10322524352,7703833648,18026358000,5682784,7709519344,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10322536160,3152,10322539312,7709503904,18032043216,243159328,7952666384,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
10322586624,6128,10322592752,7952612768,18275205520,2185664,7954804560,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
10322593184,2725120,10325318304,7952075312,18277393616,1984,7954802416,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
10325327632,4896,10325332528,7952065216,18277397744,2976,7952073088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10325341008,7976736,10333317744,7944084256,18277402000,1536,7952062528,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10333346592,5436928,10338783520,7938622416,18277405936,50944,7944110288,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10338800832,3461888,10342262720,7935195440,18277458160,2771296,7941428624,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
10342294256,4528,10342298784,7937933360,18280232144,1856,7937939744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10342343488,4128,10342347616,7937888656,18280236272,7895424,7945788208,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10342387984,3056,10342391040,7945742352,18288133392,5527488,7951272896,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
10342403744,3366192,10345769936,7947892992,18293662928,3679488,7954938672,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
10345789488,3632,10345793120,7951552144,18297345264,2752,7951558528,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10345797184,2402448,10348199632,7949149696,18297349328,2240,7951554384,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10348216320,4144,10348220464,7949132960,18297353424,48032,7949185136,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10348222432,34547792,10382770224,7914633760,18297403984,4093952,7953275504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
10382770800,142192,10382912992,7918587696,18301500688,1920,7918731808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10382913600,12656032,10395569632,7905935152,18301504784,2438080,7921029264,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
10395606256,5072,10395611328,7908333616,18303944944,1888,7908340576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10395651008,10406832,10406057840,7897891200,18303949040,34779168,7943077200,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10406089488,4448,10406093936,7932637344,18338731280,141376,7932783168,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10406095440,4544,10406099984,7932775712,18338875696,11911488,7944691744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
10406100768,15667616,10421768384,7929020432,18350788816,2272,7944690320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10421769648,5466464,10427236112,7923556832,18350792944,10935616,7939958912,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
10427250736,3472,10427254208,7934477104,18361731312,7584,7934488160,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10427260624,3056,10427263680,7934491280,18361754960,8672,7934503008,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10427291888,4336,10427296224,7934470000,18361766224,16098720,7950573056,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10427326640,4480,10427331120,7950536384,18377867504,5481952,7956022816,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
10427349184,4992,10427354176,7955997936,18383352112,1952,7956004880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10427360864,6576,10427367440,7955988704,18383356144,1440,7955996720,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10427371968,4992,10427376960,7955983344,18383360304,1312,7955989648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10427382512,5408,10427387920,7955976416,18383364336,3648,7955985472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10427392432,5312,10427397744,7955972736,18383370480,1312,7955979360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10427411216,7392,10427418608,7955955936,18383374544,4896,7955968224,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
10427426336,6000,10427432336,7955948384,18383380720,1120,7955955504,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10427437232,3383152,10430820384,7952563056,18383383440,1632,7955947840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
10430825344,4096,10430829440,7952558448,18383387888,1472,7952564016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10430834912,3536,10430838448,7952553632,18383392080,1472,7952558640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10430906208,4352,10430910560,7952485616,18383396176,26816,7952516784,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
10430937888,3461120,10434399008,7949025744,18383424752,3515712,7956002576,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
10434421152,3232,10434424384,7952518928,18386943312,2400,7952524560,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10434428384,2715872,10437144256,7949803120,18386947376,2048,7952521040,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10437161424,3840,10437165264,7949786144,18386951408,49056,7949839040,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10437167840,25295920,10462463760,7924538848,18387002608,3425184,7953259952,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
10462464224,12040320,10474504544,7915925488,18390430032,3808,7927969616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10474505904,3648,10474509552,7915926496,18390436048,2433728,7918363872,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
10474558016,2404080,10476962096,7915909184,18392871280,1856,7918315120,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10477007616,3774624,10480782240,7912093008,18392875248,25886688,7941754320,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10480880432,3807488,10484687920,7934077120,18418765040,11822752,7949707360,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
10489782672,5707328,10495490000,7935100416,18430590416,2358144,7943165888,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
10495504576,242555424,10738060000,7694891536,18432951536,3870208,7941317168,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10738064944,2168880,10740233824,7696590480,18436824304,3901312,7702660672,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10740242016,3424,10740245440,7700482448,18440727888,5449536,7705935408,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10740253232,3200,10740256432,7705922368,18446178800,5678048,7711603616,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
10740267424,3536,10740270960,7711588736,18451859696,244356320,7955948592,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
10740309120,7584,10740316704,7955902224,18696218928,2190848,7958100656,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
10740317328,2733648,10743050976,7955360240,18698411216,1952,7958095840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
10743059760,5200,10743064960,7955350480,18698415440,2944,7955358624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10743071280,7926752,10750998032,7947423456,18698421488,1536,7955351744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10751021888,5496224,10756518112,7941907472,18698425584,49888,7947453584,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10756533936,3806368,10760340304,7938137600,18698477904,2770112,7944714080,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
10760370896,4336,10760375232,7940874640,18701249872,1888,7940880864,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10760416384,4608,10760420992,7940832624,18701253616,8399808,7949237040,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10760459952,3376,10760463328,7949191472,18709654800,5519104,7954713952,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
10760475296,3736560,10764211856,7950964448,18715176304,3799840,7958500848,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
10764230432,3392,10764233824,7954744464,18718978288,4928,7954752784,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10764237888,2407200,10766645088,7952339504,18718984592,2112,7954748816,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10766661584,3248,10766664832,7952323696,18718988528,46272,7952373216,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10766666720,34290256,10800956976,7918079648,18719036624,3862208,7956232112,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
10800957488,141824,10801099312,7921801920,18722901232,1952,7921945696,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10801100576,12269712,10813370288,7909535040,18722905328,2437024,7924241776,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
10813405408,3552,10813408960,7911934704,18725343664,1888,7911940144,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10813449504,10705472,10824154976,7901192624,18725347600,34519392,7946417488,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10824185456,4800,10824190256,7935679488,18759869744,140416,7935824704,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10824191840,4736,10824196576,7935816464,18760013040,11940640,7947761840,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
10824196976,15747040,10839944016,7932010912,18771954928,2400,7947760352,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10839944912,5468144,10845413056,7926546064,18771959120,11079968,7943094176,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
10845427776,2992,10845430768,7937609984,18783040752,2496,7937615472,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10845436992,3232,10845440224,7937604624,18783044848,2144,7937610000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10845463472,3664,10845467136,7937581808,18783048944,15949184,7953534656,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10845493456,5712,10845499168,7953500624,18798999792,5503712,7959010048,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
10845518640,4272,10845522912,7958981904,18804504816,1920,7958988096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10845528528,3024,10845531552,7958977488,18804509040,1440,7958981952,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10845535536,4240,10845539776,7958973328,18804513104,1312,7958978880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10845544752,4768,10845549520,7958967584,18804517104,3456,7958975808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10845553792,4704,10845558496,7958964848,18804523344,1440,7958970992,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10845570800,8176,10845578976,7958948368,18804527344,4800,7958961344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
10845584320,5568,10845589888,7958943824,18804533712,1088,7958950480,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
10845594880,3400304,10848995184,7955542496,18804537680,1632,7958944432,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
10848999600,3200,10849002800,7955538848,18804541648,1504,7955543552,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
10849008000,3136,10849011136,7955533424,18804544560,1280,7955537840,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10849078496,3600,10849082096,7955466080,18804548176,25920,7955495600,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
10849106608,3388640,10852495248,7952081312,18804576560,3549088,7959019040,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
10852515584,3328,10852518912,7955609840,18808128752,2400,7955615568,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10852522816,2655088,10855177904,7952955008,18808132912,2176,7955612272,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
10855194528,2912,10855197440,7952939504,18808136944,48352,7952990768,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
10855199632,25476928,10880676560,7927510560,18808187120,3443040,7956430528,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
10880677024,11809264,10892486288,7919145536,18811631824,3840,7930958640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
10892487120,3728,10892490848,7919147152,18811638000,2447008,7921597888,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
10892535344,2348800,10894884144,7919203264,18814087408,1920,7921553984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
10894930432,3903680,10898834112,7915257488,18814091600,25021376,7944182544,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
10898926080,3822512,10902748592,7936367552,18839116144,11827520,7952017584,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
10907988240,5662752,10913650992,7937296576,18850947568,2414464,7945373792,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
10913665552,242102864,11155768416,7697596656,18853365072,3933056,7943632576,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11155775632,2160320,11157935952,7699365248,18857301200,3838272,7705363840,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11157944656,3344,11157948000,7703193200,18861141200,5452544,7708649088,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11157955712,2976,11157958688,7708636368,18866595056,5752064,7714391408,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11157970944,3360,11157974304,7714374640,18872348944,242752640,7957130640,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
11158029168,8016,11158037184,7957067376,19115104560,2175072,7959250464,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
11158037792,2721248,11160759040,7956522480,19117281520,1952,7959245680,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
11160772176,5584,11160777760,7956507952,19117285712,2976,7956516512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11160785152,7870928,11168656080,7948635648,19117291728,1632,7956508208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
11168688352,5474944,11174163296,7943132528,19117295824,49280,7948656752,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11174181136,3657488,11177838624,7939508400,19117347024,2774432,7945940320,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
11177872496,4000,11177876496,7942246624,19120123120,1888,7942252512,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11177920672,4176,11177924848,7942202368,19120127216,7918048,7950124592,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11177967232,2656,11177969888,7950078000,19128047888,5545440,7955626096,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
11177981296,3964352,11181945648,7951650240,19133595888,3704416,7959319008,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
11181967776,3856,11181971632,7955330112,19137301744,6656,7955340624,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11181975712,2399984,11184375696,7952934240,19137309936,5088,7955339312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11184393456,4064,11184397520,7952920576,19137318096,75392,7953000032,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11184399440,34796224,11219195664,7918199264,19137394928,3973760,7956969248,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
11219196320,145248,11219341568,7922029552,19141371120,1952,7922176752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
11219343280,11913056,11231256336,7910118880,19141375216,2437984,7924469920,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
11231293280,4416,11231297696,7912516880,19143814576,1888,7912523184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11231338640,10712864,11242051504,7901766976,19143818480,34589248,7947069088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11242089488,4624,11242094112,7936315120,19178409232,140128,7936459872,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11242096160,6704,11242102864,7936448672,19178551536,11918368,7948373744,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
11242103264,16270064,11258373328,7932098560,19190471888,2176,7948370800,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
11258374400,5468704,11263843104,7926632880,19190475984,10877600,7942979184,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
11263859136,3056,11263862192,7937492896,19201355088,2048,7937498000,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11263869040,3264,11263872304,7937486784,19201359088,864,7937490912,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11263901008,4784,11263905792,7937455440,19201361232,16805760,7954265984,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11263933664,8880,11263942544,7954226528,19218169072,5480000,7959715408,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
11263959952,4384,11263964336,7959686208,19223650544,1952,7959692544,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11263973296,5600,11263978896,7959675744,19223654640,1408,7959682752,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11263984384,5648,11263990032,7959668704,19223658736,3744,7959678096,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11263995600,6832,11264002432,7959662416,19223664848,3456,7959672704,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
11264006688,3792,11264010480,7959660576,19223671056,1344,7959665712,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11264026688,6864,11264033552,7959641568,19223675120,4448,7959652880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
11264040016,6224,11264046240,7959635024,19223681264,1088,7959642336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11264050960,3376224,11267427184,7956258144,19223685328,1664,7959636032,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
11267432240,3552,11267435792,7956253664,19223689456,1472,7956258688,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
11267441520,3376,11267444896,7956248656,19223693552,1280,7956253312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11267518640,3456,11267522096,7956174464,19223696560,27104,7956205024,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
11267548304,3379696,11270928000,7952798320,19223726320,3516032,7959694048,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
11270947936,3376,11270951312,7956293472,19227244784,2400,7956299248,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11270955440,2416896,11273372336,7953876544,19227248880,2016,7956295456,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11273389664,4256,11273393920,7953859088,19227253008,48160,7953911504,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11273396192,25907280,11299303472,7927999776,19227303248,3527936,7957434992,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
11299304000,11798912,11311102912,7919730992,19230833904,3616,7931533520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
11311103744,5120,11311108864,7919731184,19230840048,2491008,7922227312,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
11311153232,2338816,11313492048,7919840416,19233332464,1856,7922181088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11313539664,3894880,11317434544,7915902016,19233336560,26017728,7945814624,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11317517952,3871856,11321389808,7937966592,19259356400,11800000,7953638448,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
11326581024,5674672,11332255696,7938904576,19271160272,2401824,7946981072,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
11332270880,242682720,11574953600,7698609776,19273563376,3883328,7945175824,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11574957984,2170528,11577128512,7700319920,19277448432,3884192,7706374640,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11577137088,3376,11577140464,7704194464,19281334928,5423936,7709621776,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11577148000,2960,11577150960,7709609728,19286760688,5687360,7715300048,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11577163440,2768,11577166208,7715284848,19292451056,241628288,7956915904,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
11577206880,5952,11577212832,7956869488,19534082320,2169824,7959045264,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
11577213936,2729776,11579943712,7956310480,19536254192,1952,7959042208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
11579952896,5344,11579958240,7956300048,19536258288,2944,7956308336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11579964608,7972592,11587937200,7948325312,19536262512,1536,7956299440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
11587962352,5457488,11593419840,7942846640,19536266480,46432,7948350560,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11593435824,3691792,11597127616,7939187984,19536315600,2777056,7945656832,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
11597158368,4160,11597162528,7941933264,19539095792,1920,7941939344,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11597202656,3680,11597206336,7941893552,19539099888,7852032,7949749264,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11597245680,2880,11597248560,7949706432,19546954992,5480384,7955189696,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
11597260208,3930336,11601190544,7951247968,19552438512,3482688,7958660992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
11601209328,3520,11601212848,7954711456,19555924304,2336,7954717312,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11601216976,2402512,11603619488,7952309008,19555928496,2048,7954713568,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11603636736,3792,11603640528,7952291968,19555932496,47680,7952343440,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11603642784,34326752,11637969536,7918012016,19555981552,3432384,7955771152,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
11637970176,143776,11638113952,7921302096,19559416048,1952,7921447824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
11638115056,11933456,11650048512,7909371696,19559420208,2433024,7923738176,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
11650082816,4144,11650086960,7911768352,19561855312,1888,7911774384,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11650129216,10698336,11660827552,7901031888,19561859440,34484864,7946215088,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11660863120,3504,11660866624,7935478992,19596345616,140064,7935622560,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11660868192,3600,11660871792,7935616128,19596487920,12103776,7947723504,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
11660872400,15999776,11676872176,7931721536,19608593712,2048,7947723360,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
11676872672,5466016,11682338688,7926259056,19608597744,10852384,7942577456,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
11682352992,3248,11682356240,7937095904,19619452144,2048,7937101200,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11682362192,3056,11682365248,7937090992,19619456240,832,7937094880,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11682388928,4496,11682393424,7937065056,19619458480,15941600,7953011152,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11682419952,6288,11682426240,7952976752,19635402992,5533120,7958516160,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
11682443648,5520,11682449168,7958488544,19640937712,2560,7958496624,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11682455824,5056,11682460880,7958480928,19640941808,1440,7958487424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11682465232,3248,11682468480,7958477680,19640946160,1312,7958482240,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11682472800,4880,11682477680,7958472352,19640950032,9408,7958486640,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
11682482416,4144,11682486560,7958475760,19640962320,1408,7958481312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11682498624,3600,11682502224,7958464160,19640966384,4544,7958472304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
11682508304,5520,11682513824,7958458800,19640972624,1088,7958465408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11682518144,3398384,11685916528,7955060096,19640976624,11488,7958469968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
11685921136,3328,11685924464,7955066464,19640990928,10656,7955080448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
11685929936,3680,11685933616,7955069632,19641003248,1760,7955075072,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11686002608,3376,11686005984,7955001488,19641007472,34688,7955039552,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
11686030896,3386544,11689417440,7951627888,19641045328,3517632,7958532064,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
11689438448,3376,11689441824,7955122896,19644564720,2368,7955128640,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11689445776,2414896,11691860672,7952708240,19644568912,2080,7955125216,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
11691877680,4256,11691881936,7952690976,19644572912,50432,7952745664,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
11691884112,26528176,11718412288,7926212848,19644625136,3448832,7956189856,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
11718413040,11804784,11730217824,7917858192,19648076016,3360,7929666336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
11730218672,4704,11730223376,7917858784,19648082160,2457216,7920320704,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
11730265552,2299376,11732564928,7917977008,19650541936,1888,7920278272,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
11732612032,3838608,11736450640,7914095264,19650545904,25767264,7943701136,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
11736546400,3792736,11740339136,7935976752,19676315888,11886144,7951655632,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
11745724080,5676432,11751400512,7936804080,19688204592,2350784,7944831296,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
11751415552,241260960,11992676512,7697880176,19690556688,3769696,7942910832,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11992681040,2160784,11994841824,7699487344,19694329168,4067488,7705715616,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11994850016,3008,11994853024,7703546544,19698399568,5439008,7708988560,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11994860672,2880,11994863552,7708977552,19703841104,5761760,7714742192,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
11994874528,3184,11994877712,7714726432,19709604144,241841472,7956571088,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
11994912496,5472,11994917968,7956529344,19951447312,2185280,7958720096,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
11994918576,2746912,11997665488,7955970176,19953635664,1952,7958719040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
11997674384,5056,11997679440,7955960224,19953639664,2976,7955968256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
11997687744,7856496,12005544240,7948099776,19953644016,1536,7955957808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12005566864,5437184,12011004048,7942643904,19953647952,47104,7948128192,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12011021168,3452400,12014473568,7939224432,19953698000,2773376,7945450208,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
12014504912,4416,12014509328,7941964768,19956474096,1856,7941971040,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12014549744,3712,12014553456,7941924736,19956478192,7878016,7949806464,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12014592256,3232,12014595488,7949763440,19964358928,5479584,7955246256,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
12014607344,3347184,12017954528,7951885936,19969840464,3491872,7958724992,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
12017973440,3424,12017976864,7955358384,19973335248,2624,7955364432,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12017980944,2405552,12020386496,7952952848,19973339344,2048,7955360448,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12020402704,3312,12020406016,7952937424,19973343440,46688,7952987424,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12020407984,34147376,12054555360,7918836240,19973391600,4083584,7957067200,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
12054555920,139792,12054695712,7922781680,19977477392,2336,7922923808,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12054696320,12335264,12067031584,7910449968,19977481552,2549760,7925334992,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
12067067616,3856,12067071472,7912961792,19980033264,1888,7912967536,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12067111744,10733504,12077845248,7902192112,19980037360,34247328,7947172944,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12077877424,3456,12077880880,7936406240,20014287120,146144,7936555840,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12077882448,3552,12077886000,7936548512,20014434512,12350112,7948902176,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
12077886416,15508976,12093395392,7933391664,20026787056,2208,7948902848,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12093396160,5630592,12099026752,7927764400,20026791152,10440128,7943835120,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
12099041312,3008,12099044320,7938188592,20037232912,1920,7938193520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12099050880,3088,12099053968,7938183008,20037236976,3008,7938189104,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12099080688,4080,12099084768,7938158352,20037243120,14879520,7953041952,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12099116992,5808,12099122800,7953002112,20052124912,5635680,7958643600,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
12099140368,4576,12099144944,7958617056,20057762000,1984,7958623616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12099151600,5888,12099157488,7958608640,20057766128,1440,7958615968,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12099164048,5232,12099169280,7958600976,20057770256,1440,7958607648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12099175600,6880,12099182480,7958591840,20057774320,3072,7958601792,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12099187920,3568,12099191488,7958588976,20057780464,1792,7958594336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12099205584,7216,12099212800,7958571888,20057784688,4544,7958583648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
12099220304,4240,12099224544,7958566160,20057790704,7584,7958577984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12099229024,3415696,12102644720,7955156224,20057800944,1952,7958573872,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
12102649600,3664,12102653264,7955151744,20057805008,2016,7955157424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12102658976,4032,12102663008,7955147312,20057810320,1248,7955152592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12102731760,3472,12102735232,7955078000,20057813232,25632,7955107104,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
12102763296,3785712,12106549008,7951292896,20057841904,3676192,7958754800,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
12106572432,3456,12106575888,7954945248,20061521136,2400,7954951104,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12106579968,2421376,12109001344,7952523984,20061525328,2240,7954947600,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12109018240,3632,12109021872,7952507616,20061529488,49472,7952560720,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12109024048,24918976,12133943024,7927638528,20061581552,3885408,7956442912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
12133943968,11816512,12145760480,7919708144,20065468624,3648,7931528304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12145761104,4224,12145765328,7919709568,20065474896,2445824,7922159616,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
12145810624,2315536,12148126160,7919797024,20067923184,1888,7922114448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12148175264,3673040,12151848304,7916078944,20067927248,25171104,7944923088,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12151958496,3630304,12155588800,7937512464,20093101264,12445568,7953588336,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
12160681776,5663968,12166345744,7939203744,20105549488,2355424,7947223136,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
12166361456,241810560,12408172016,7699734688,20107906704,3719296,7945264544,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12408177200,2153840,12410331040,7701296560,20111627600,3800608,7707251008,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12410339888,3392,12410343280,7705087328,20115430608,5700544,7710791264,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12410351024,2608,12410353632,7710779760,20121133392,5727296,7716509664,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12410366496,3360,12410369856,7716493808,20126863664,242556320,7959053488,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
12410411216,6880,12410418096,7959003520,20369421616,2181824,7961192224,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
12410419024,2727760,12413146784,7958458032,20371604816,1952,7961187744,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
12413155968,5920,12413161888,7958446928,20371608816,2976,7958455824,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12413169136,7904880,12421074016,7950539056,20371613072,1504,7958445440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12421097872,5436560,12426534432,7945082544,20371616976,53440,7950572544,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12426550144,3452976,12430003120,7941670208,20371673328,2776864,7947900048,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
12430033024,4512,12430037536,7944413936,20374451472,1888,7944420336,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12430079024,3456,12430082480,7944373056,20374455536,7782656,7952159168,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12430125088,2960,12430128048,7952111968,20382240016,5478016,7957592944,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
12430139296,3350496,12433489792,7954230640,20387720432,3498272,7961079408,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
12433513184,3440,12433516624,7957703840,20391220464,2336,7957709616,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12433520752,2400656,12435921408,7955303248,20391224656,2208,7957706112,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12435937824,3424,12435941248,7955287248,20391228496,46560,7955337232,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12435943104,33721472,12469664576,7921613232,20391277808,3830208,7959164912,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
12469665200,141584,12469806784,7925303824,20395110608,2208,7925447616,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12469807456,12804480,12482611936,7912502800,20395114736,2680512,7927987792,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
12482648128,4336,12482652464,7915144096,20397796560,1888,7915150320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12482692832,10304464,12492997296,7904803712,20397801008,33924352,7949032528,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12493029600,3376,12493032976,7938693920,20431726896,141056,7938838352,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12493034512,3376,12493037888,7938831312,20431869200,11924128,7950758816,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
12493038432,15858064,12508896496,7934899296,20443795792,1952,7950759312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12508896992,5503856,12514400848,7929398976,20443799824,10514592,7945417424,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
12514415408,3296,12514418704,7939897600,20454316304,1920,7939902816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12514425024,3168,12514428192,7939892176,20454320368,864,7939896208,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12514452112,3264,12514455376,7939867232,20454322608,15693888,7955564384,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12514481248,5584,12514486832,7955531456,20470018288,5522272,7961059312,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
12514509200,4832,12514514032,7961028736,20475542768,2080,7961035648,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12514520832,3648,12514524480,7961022384,20475546864,1408,7961027440,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12514528256,3232,12514531488,7961019472,20475550960,1312,7961024016,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12514536496,4928,12514541424,7961013632,20475555056,10752,7961029312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12514546144,4448,12514550592,7961016752,20475567344,1376,7961022576,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12514563296,5936,12514569232,7961002208,20475571440,4672,7961012816,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
12514575376,5872,12514581248,7960996400,20475577648,1312,7961003584,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12514586752,3723968,12518310720,7957270992,20475581712,1632,7960996592,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
12518315392,3584,12518318976,7957266800,20475585776,1600,7957271984,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12518324480,3152,12518327632,7957262432,20475590064,1312,7957266896,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12518398784,3600,12518402384,7957191584,20475593968,31712,7957226896,73,73,0,cudaLaunchKernel,3024 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
12518427728,3783232,12522210960,7953417792,20475628752,3834528,7961035552,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
12522234160,3424,12522237584,7957228224,20479465808,2688,7957234336,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12522241712,2414944,12524656656,7954814144,20479470800,2144,7957231232,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12524673184,4112,12524677296,7954797600,20479474896,49376,7954851088,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12524679424,24946320,12549625744,7929900384,20479526128,3812864,7958659568,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
12549626384,12419104,12562045488,7921295040,20483340528,3968,7933718112,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12562046160,3536,12562049696,7921296976,20483346672,2433376,7923733888,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
12562093424,2301408,12564394832,7921387936,20485782768,1888,7923691232,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12564442960,3677760,12568120720,7917666112,20485786832,25033120,7946376992,73,73,0,cuLaunchKernelEx, 296 168 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12568221584,3636768,12571858352,7938963264,20510821616,12471040,7955071072,73,73,0,cudaLaunchKernel,529340 1 1, 128 1 1,"void comfy::<unnamed>::rope_kernel<__nv_bfloat16, __nv_bfloat16, __nv_bfloat16, (bool)1, (bool)1, (bool)1, (bool)1, (bool)0>(const T1 *, const T1 *, const T2 *, const T3 *, const T3 *, T1 *, T1 *, long, long, long, int, int, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, long, float)"
|
||
|
|
12577385360,5689472,12583074832,7940221088,20523295920,2368672,7948279232,73,73,0,cudaLaunchKernel, 56 37 1, 32 4 1,"void at::native::reduce_kernel<(int)128, (int)4, at::native::ReduceOp<c10::BFloat16, at::native::MeanOps<c10::BFloat16, float, float, c10::BFloat16>, unsigned int, c10::BFloat16, (int)4, (int)4>>(T3)"
|
||
|
|
12583089648,242614848,12825704496,7699963072,20525667568,3739904,7946317824,73,73,0,cudaLaunchKernel,1184 56 1, 512 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)32, (unsigned int)1, (bool)0, (bool)0, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12825708976,2163952,12827872928,7701536336,20529409264,3745888,7707446176,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void QuantInt8Kernel<(unsigned int)128, (unsigned int)64, (unsigned int)1, (bool)0, (bool)1, __nv_bfloat16>(T6 *, T6 *, signed char *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12827881296,3200,12827884496,7705272608,20533157104,5564416,7710840224,73,73,0,cudaLaunchKernel, 591 56 1,1024 1 1,"void TransposePadPermuteKernel<(unsigned int)128, (unsigned int)64, (bool)1, __nv_bfloat16>(T4 *, T4 *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12827891888,2816,12827894704,7710828928,20538723632,5812416,7716644160,73,73,0,cudaLaunchKernel, 56 1 128, 256 1 1,"void MeanScaleKernel<(unsigned int)64, (bool)0, __nv_bfloat16>(T3 *, signed char *, float *, float *, float, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int)"
|
||
|
|
12827905632,3408,12827909040,7716628800,20544537840,240774464,7957406672,73,73,0,cudaLaunchKernel, 296 56 1, 32 4 1,"void qk_int_sv_f8_attn_kernel<(unsigned int)128, (unsigned int)64, (unsigned int)32, (unsigned int)64, (unsigned int)128, (DataType)1, (QuantGranularity)2, (QuantGranularity)2, float, (bool)1, __nv_bfloat16, (ComputeUnit)1, (MaskMode)0, (bool)0, (bool)1, (bool)0, (bool)1>(signed char *, signed char *, signed char *, T11 *, float *, float *, float *, float *, float *, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, unsigned int, float)"
|
||
|
|
12827945040,6240,12827951280,7957363008,20785314288,2176096,7959545344,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_bf16_vec_kernel(const uint4 *, const unsigned short *, float *, long, long)"
|
||
|
|
12827951728,2737424,12830689152,7956804176,20787493328,1920,7959543520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_warp_kernel(const float *, float *, long, float)"
|
||
|
|
12830697568,4224,12830701792,7956795504,20787497296,3328,7956803056,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12830708192,7910528,12838618720,7948884592,20787503312,1664,7956796784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12838639392,5443872,12844083264,7943424272,20787507536,47328,7948915472,73,73,0,cudaLaunchKernel,8288 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12844098448,3455904,12847554352,7940003232,20787557584,2772384,7946231520,73,73,0,cudaLaunchKernel,529536 1 1, 128 1 1,"void comfy::<unnamed>::quantize_nvfp4_kernel<__nv_bfloat16, __nv_fp4x2_e2m1, __nv_fp8_e4m3, (bool)1, (bool)1>(const T1 *, const float *, T2 *, T3 *, unsigned long, unsigned long, unsigned long, unsigned long, float)"
|
||
|
|
12847584192,4192,12847588384,7942743376,20790331760,1856,7942749424,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12847631904,3968,12847635872,7942699888,20790335760,7745440,7950449296,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12847674080,3232,12847677312,7950407056,20798084368,5472320,7955882608,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
12847688656,3344160,12851032816,7952525824,20803558640,3491552,7959361536,73,73,0,cudaLaunchKernel,37810 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
12851052560,3424,12851055984,7955996544,20807052528,2336,7956002304,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12851060032,2446080,12853506112,7953550704,20807056816,2112,7955998896,73,73,0,cudaLaunchKernel, 63 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12853522048,4080,12853526128,7953534592,20807060720,47616,7953586288,73,73,0,cudaLaunchKernel,6216 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12853527984,34428288,12887956272,7919153568,20807109840,3424352,7957006208,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"void <unnamed>::partial_absmax_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, float *, long, long)"
|
||
|
|
12887956832,142624,12888099456,7922436720,20810536176,1920,7922581264,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12888100144,11970816,12900070960,7910469312,20810540272,2456224,7924896352,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"void <unnamed>::quantize_nvfp4_modulated_bf16_kernel<float>(const unsigned short *, const T1 *, const T1 *, const int *, const float *, unsigned char *, unsigned char *, long, long, long, long, long, long)"
|
||
|
|
12900106576,4160,12900110736,7912887136,20812997872,2112,7912893408,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12900151856,10292608,12910444464,7902557504,20813001968,34352224,7947202336,73,73,0,cuLaunchKernelEx, 296 224 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12910477072,3488,12910480560,7936876640,20847357200,142208,7937022336,73,73,0,cudaLaunchKernel,16576 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<unsigned char>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12910482112,3440,12910485552,7937016096,20847501648,12776704,7949796240,73,73,0,cudaLaunchKernel, 256 1 1, 128 1 1,"<unnamed>::partial_absmax_swiglu_bf16_kernel(const unsigned short *, float *, long, long)"
|
||
|
|
12910485968,15710112,12926196080,7934083936,20860280016,2208,7949796256,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"<unnamed>::final_scale_bf16_compat_kernel(const float *, float *, long, float)"
|
||
|
|
12926196896,5472784,12931669680,7928614560,20860284240,10460288,7944547632,73,73,0,cudaLaunchKernel,37888 1 1, 256 1 1,"<unnamed>::quantize_nvfp4_swiglu_bf16_kernel(const unsigned short *, const float *, unsigned char *, unsigned char *, long, long, long, long, long)"
|
||
|
|
12931683824,3296,12931687120,7939059232,20870746352,1920,7939064448,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
12931693424,3040,12931696464,7939053984,20870750448,832,7939057856,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::FillFunctor<float>, std::array<char *, (unsigned long)1>>(int, T2, T3)"
|
||
|
|
12931720272,4896,12931725168,7939027424,20870752592,15672768,7954705088,73,73,0,cuLaunchKernelEx, 296 42 1, 384 1 1,cutlass3x_sm120_bstensorop_s16864gemm_block_scaled_ue4m3xe2m1_ue4m3xe2m1_f32_bf16_bf16_128x128x256_1x1x1_0_tnn_align32_o_vs16_bias_bf16_relu
|
||
|
|
12931751360,5600,12931756960,7954670928,20886427888,5476768,7960153296,73,73,0,cuLaunchKernelEx,37810 6 1, 128 1 1,_gate_add_kernel
|
||
|
|
12931794720,5296,12931800016,7960106272,20891906288,1952,7960113520,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12931813504,5104,12931818608,7960091776,20891910384,1440,7960098320,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12931822944,4992,12931827936,7960086544,20891914480,3648,7960095184,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::floor_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12931834912,3584,12931838496,7960082096,20891920592,3456,7960089136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12931843712,6256,12931849968,7960076800,20891926768,1344,7960084400,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::<unnamed>::launch_clamp_scalar(at::TensorIteratorBase &, c10::Scalar, c10::Scalar, at::native::detail::ClampLimits)::[lambda() (instance 1)]::operator ()() const::[lambda() (instance 4)]::operator ()() const::[lambda(long) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12931863456,6016,12931869472,7960061392,20891930864,4512,7960071920,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
12931874880,6160,12931881040,7960055968,20891937008,1120,7960063248,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)2, at::native::CUDAFunctorOnSelf_add<long>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12931885456,3419808,12935305264,7956635872,20891941136,1632,7960057312,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::index_elementwise_kernel<(int)128, (int)4, void at::native::gpu_index_kernel<void at::native::index_kernel_impl<at::native::OpaqueType<(int)4>>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>)::[lambda(char *, const char *, long) (instance 1)]>(at::TensorIteratorBase &, c10::ArrayRef<long>, c10::ArrayRef<long>, const T1 &, bool)::[lambda(int) (instance 1)]>(long, T3)"
|
||
|
|
12935310032,3440,12935313472,7956631760,20891945232,1760,7956636960,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)2>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
12935319248,3824,12935323072,7956626224,20891949296,1280,7956631328,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::<unnamed>::lerp_tensor_kernel(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 2)]::operator ()() const::[lambda(float, float, float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12935393616,3472,12935397088,7956556272,20891953360,4640,7956564384,73,73,0,cudaLaunchKernel, 336 1 1, 2 32 1,"std::enable_if<!T7, void>::type internal::gemvx::kernel<int, int, float, float, float, float, (bool)0, (bool)1, (bool)1, (bool)0, (int)6, (bool)0, cublasGemvParamsEx<int, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<const float>, cublasGemvTensorStridedBatched<float>, float>>(T13)"
|
||
|
|
12935413344,4165712,12939579056,7952380480,20891959536,3591232,7960137424,73,73,0,cudaLaunchKernel,37296 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
12939595600,4528,12939600128,7955952624,20895552752,1952,7955959104,73,73,0,cudaLaunchKernel, 6 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12939605488,2413968,12942019456,7953537392,20895556848,5457248,7961408608,73,73,0,cudaLaunchKernel,391608 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12942027328,8912,12942036240,7958979552,20901015792,6822208,7965810672,73,73,0,cudaLaunchKernel,783216 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12942048464,24916112,12966964576,7940876176,20907840752,45056,7965837344,73,73,0,cudaLaunchKernel, 414 1 1, 32 4 1,"void at::native::<unnamed>::vectorized_layer_norm_kernel<c10::BFloat16, float, (bool)1>(int, T2, const T1 *, const T1 *, const T1 *, T2 *, T2 *, T1 *)"
|
||
|
|
12966971264,12477936,12979449200,7928438656,20907887856,6688,7940923280,73,73,0,cudaLaunchKernel, 6 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
12979453504,3792,12979457296,7928438880,20907896176,51296,7928493968,73,73,0,cudaLaunchKernel,4347 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12979463552,2335072,12981798624,7926151792,20907950416,61632,7928548496,73,73,0,cudaLaunchKernel,8694 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<float>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
12981866240,3651664,12985517904,7922496928,20908014832,4410976,7930559568,73,73,0,cudaLaunchKernel, 2 583 1, 8 16 1,"void magma_sgemmEx_kernel<float, float, float, (bool)1, (bool)0, (int)6, (int)4, (int)6, (int)3, (int)4>(int, int, int, Tensor, int, Tensor, int, Tensor, int, Tensor, int, int, int, const T1 *, const T1 *, T1, T1, int, cublasLtEpilogue_t, int, const void *, long)"
|
||
|
|
12985629840,3632144,12989261984,7923166384,20912428368,99968,7926898496,73,73,0,cuLaunchKernel, 13 1 3, 128 1 1,void cutlass::Kernel2<cutlass_80_simt_sgemm_128x32_8x5_tn_align1>(T1::Params)
|
||
|
|
12989265920,5139376,12994405296,7918125376,20912530672,4000,7923268752,73,73,0,cudaLaunchKernel, 1 26 1, 32 16 1,"void cublasLt::splitKreduce_kernel<(int)32, (int)16, int, float, float, float, float, (bool)0, float, float, float, (bool)1, (bool)1, (bool)0, (bool)0>(cublasLt::cublasSplitKParams<T6>, const T4 *, const T10 *, T9 *, T5 *, const T6 *, const T6 *, const T11 *, const T4 *, T11 *, void *, long, T6 *, int *, T6 *, T6 *, const T6 *, const T6 *, const T6 *, const T6 *, const T6 *)"
|
||
|
|
12994440912,5851392,13000292304,7912244512,20912536816,59776,7918155680,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13000296656,243250816,13243547472,7669051776,20912599248,62272,7912364864,73,73,0,cudaLaunchKernel,6993 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
13243557840,2148320,13245706160,7666956672,20912662832,1280,7669106272,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13245724144,3328,13245727472,7666939392,20912666864,100448,7667043168,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)]>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
13245743984,7392,13245751376,7667018016,20912769392,86400,7667111808,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13245758144,2816,13245760960,7667096464,20912857424,1856,7667101136,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13245765808,5008,13245770816,7667090608,20912861424,1472,7667097088,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13245781872,2852800,13248634672,7664230944,20912865616,5600,7667089344,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
13248646240,7456,13248653696,7664220016,20912873712,1312,7664228784,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13248661136,7898176,13256559312,7656318592,20912877904,1536,7664218304,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13256563984,5458160,13262022144,7650859920,20912882064,1216,7656319296,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctorOnSelf_add<float>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13262026592,3464144,13265490736,7647395264,20912886000,1376,7650860784,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::bfloat16_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13265503696,6336,13265510032,7647380288,20912890320,1664,7647388288,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::neg_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 2)]::operator ()() const::[lambda() (instance 9)]::operator ()() const::[lambda(c10::BFloat16) (instance 1)], std::array<char *, (unsigned long)2>>(int, T2, T3)"
|
||
|
|
13265514416,3440,13265517856,7647376432,20912894288,3360,7647383232,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<c10::BFloat16, c10::BFloat16, c10::BFloat16, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
13265525680,22896,13265548576,7647351760,20912900336,4128,7647378784,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)4, void at::native::gpu_kernel_impl_nocast<at::native::CUDAFunctor_add<c10::BFloat16>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
13265553728,3416288,13268970016,7643936560,20912906576,2272,7647355120,73,73,0,cudaLaunchKernel, 26 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::direct_copy_kernel_cuda(at::TensorIteratorBase &)::[lambda() (instance 3)]::operator ()() const::[lambda() (instance 7)]::operator ()() const::[lambda(float) (instance 1)], std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithCast<(int)1>, at::native::memory::StoreWithCast<(int)1>>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
13268977488,7328,13268984816,7643925760,20912910576,72864,7644005952,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
13268990016,2419488,13271409504,7641576048,20912985552,162432,7644157968,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
13271413136,3360,13271416496,7641732736,20913149232,2240,7641738336,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
13271419776,34474656,13305894432,7607258832,20913153264,2016,7641735504,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
13305926784,118912,13306045696,7607111376,20913157072,2848,7607233136,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::AUnaryFunctor<float, float, bool, at::native::<unnamed>::CompareEqFunctor<float>>, std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
20913225648,18000,,,20913239056,159936,173344,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
20913311408,35360,20913346768,53984,20913400752,83872,173216,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
20913363152,18032,20913381184,105616,20913486800,1184,124832,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
20913400864,6560,20913407424,81584,20913489008,88064,176208,73,73,0,cudaLaunchKernel,13986 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
20913431520,11424,20913442944,135248,20913578192,172960,319632,73,73,0,cudaLaunchKernel,3497 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
20913495840,13200,20913509040,244000,20913753040,1824,259024,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::AUnaryFunctor<float, float, bool, at::native::<unnamed>::CompareEqFunctor<float>>, std::array<char *, (unsigned long)2>, (int)4, TrivialOffsetCalculator<(int)1, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
20913773120,2928,,,20913773072,2336,2928,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
20913780720,3216,,,20913782096,3904,5280,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::DivFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
20913787184,3296,20913790480,4544,20913795024,4928,12768,73,73,0,cudaLaunchKernel, 1 1 1, 128 1 1,"void at::native::unrolled_elementwise_kernel<at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>, (int)4, TrivialOffsetCalculator<(int)2, unsigned int>, TrivialOffsetCalculator<(int)1, unsigned int>, at::native::memory::LoadWithoutCast, at::native::memory::StoreWithoutCast>(int, T1, T2, T4, T5, T6, T7)"
|
||
|
|
20913793584,2976,20913796560,4544,20913801104,27520,35040,73,73,0,cudaLaunchKernel, 52 1 1, 128 1 1,"void at::native::elementwise_kernel<(int)128, (int)2, void at::native::gpu_kernel_impl_nocast<at::native::BinaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>>(at::TensorIteratorBase &, const T1 &)::[lambda(int) (instance 1)]>(int, T3)"
|
||
|
|
20913800032,2736,20913802768,28128,20913830896,1600,32464,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::CUDAFunctor_add<float>, std::array<char *, (unsigned long)3>>(int, T2, T3)"
|
||
|
|
20913857440,4672,,,20913858544,1120,4672,73,73,0,cudaLaunchKernel, 13 1 1, 128 1 1,"void at::native::vectorized_elementwise_kernel<(int)4, at::native::AUnaryFunctor<float, float, float, at::native::binary_internal::MulFunctor<float>>, std::array<char *, (unsigned long)2>>(int, T2, T3)"
|