|
| 1 | +- {MinimumRequiredVersion: 4.33.0} |
| 2 | +- strixhalo |
| 3 | +- gfx1151 |
| 4 | +- [Device 1586] |
| 5 | +- AllowNoFreeDims: false |
| 6 | + AssignedDerivedParameters: true |
| 7 | + Batched: true |
| 8 | + ComplexConjugateA: false |
| 9 | + ComplexConjugateB: false |
| 10 | + ComputeDataType: 0 |
| 11 | + ConvolutionConfig: [] |
| 12 | + DataType: 0 |
| 13 | + DestDataType: 0 |
| 14 | + Fp16AltImpl: false |
| 15 | + HighPrecisionAccumulate: false |
| 16 | + Index0: 0 |
| 17 | + Index01A: 0 |
| 18 | + Index01B: 1 |
| 19 | + Index1: 1 |
| 20 | + IndexAssignmentsA: [0, 3, 2] |
| 21 | + IndexAssignmentsB: [1, 3, 2] |
| 22 | + IndexAssignmentsLD: [4, 5, 6, 7] |
| 23 | + IndexUnroll: 3 |
| 24 | + IndexUnrollA: 1 |
| 25 | + IndexUnrollB: 1 |
| 26 | + IndicesBatch: [2] |
| 27 | + IndicesFree: [0, 1] |
| 28 | + IndicesSummation: [3] |
| 29 | + MirrorDimsA: [] |
| 30 | + MirrorDimsB: [] |
| 31 | + NumIndicesBatch: 1 |
| 32 | + NumIndicesC: 3 |
| 33 | + NumIndicesFree: 2 |
| 34 | + NumIndicesLD: 4 |
| 35 | + NumIndicesSummation: 1 |
| 36 | + OperationType: GEMM |
| 37 | + SetConstStrideA: [] |
| 38 | + SetConstStrideB: [] |
| 39 | + SilentHighPrecisionAccumulate: false |
| 40 | + StridedBatched: true |
| 41 | + TLUA: true |
| 42 | + TLUB: true |
| 43 | + Tensor0: 0 |
| 44 | + Tensor1: 1 |
| 45 | + TileA: 0 |
| 46 | + TileAwareSelection: false |
| 47 | + TileB: 1 |
| 48 | + TotalIndices: 4 |
| 49 | + TransposeA: false |
| 50 | + TransposeB: true |
| 51 | + UseBeta: true |
| 52 | + UseInitialStridesAB: false |
| 53 | + UseInitialStridesCD: false |
| 54 | + ZeroPadA: [] |
| 55 | + ZeroPadB: [] |
| 56 | +- - 1LDSBuffer: 0 |
| 57 | + AggressivePerfMode: 1 |
| 58 | + AssertAlphaValue: false |
| 59 | + AssertBetaValue: false |
| 60 | + AssertCEqualsD: false |
| 61 | + AssertFree0ElementMultiple: 1 |
| 62 | + AssertFree1ElementMultiple: 1 |
| 63 | + AssertMinApproxSize: 0 |
| 64 | + AssertSizeEqual: {} |
| 65 | + AssertSizeGreaterThan: {} |
| 66 | + AssertSizeLessThan: {} |
| 67 | + AssertSizeMultiple: {} |
| 68 | + AssertStrideAEqual: {0: 1} |
| 69 | + AssertStrideBEqual: {0: 1} |
| 70 | + AssertStrideCEqual: {0: 1} |
| 71 | + AssertStrideDEqual: {0: 1} |
| 72 | + AssertSummationElementMultiple: 1 |
| 73 | + AssignedDerivedParameters: true |
| 74 | + AssignedProblemIndependentDerivedParameters: true |
| 75 | + AtomicAddC: false |
| 76 | + BufferLoad: true |
| 77 | + BufferStore: true |
| 78 | + CheckDimOverflow: 0 |
| 79 | + CheckTensorDimAsserts: false |
| 80 | + CodeObjectVersion: default |
| 81 | + CustomKernelName: '' |
| 82 | + DepthU: 8 |
| 83 | + DepthULdsDivisor: 1 |
| 84 | + DirectToLds: false |
| 85 | + DirectToLdsA: false |
| 86 | + DirectToLdsB: false |
| 87 | + DirectToVgprA: false |
| 88 | + DirectToVgprB: false |
| 89 | + DisableAtomicFail: 0 |
| 90 | + DisableKernelPieces: 0 |
| 91 | + DisableVgprOverlapping: false |
| 92 | + EdgeType: ShiftPtr |
| 93 | + EnableMatrixInstruction: false |
| 94 | + ExpandPointerSwap: 0 |
| 95 | + Fp16AltImpl: false |
| 96 | + FractionalLoad: 0 |
| 97 | + GlobalLoadVectorWidthA: 1 |
| 98 | + GlobalLoadVectorWidthB: 1 |
| 99 | + GlobalRead2A: true |
| 100 | + GlobalRead2B: true |
| 101 | + GlobalReadCoalesceGroupA: true |
| 102 | + GlobalReadCoalesceGroupB: true |
| 103 | + GlobalReadCoalesceVectorA: true |
| 104 | + GlobalReadCoalesceVectorB: true |
| 105 | + GlobalReadPerMfma: 1 |
| 106 | + GlobalReadVectorWidth: 1 |
| 107 | + GlobalSplitU: 1 |
| 108 | + GlobalSplitUAlgorithm: SingleBuffer |
| 109 | + GlobalSplitUSummationAssignmentRoundRobin: true |
| 110 | + GlobalSplitUWorkGroupMappingRoundRobin: false |
| 111 | + GlobalWriteVectorWidth: 1 |
| 112 | + GroupLoadStore: false |
| 113 | + GuaranteeNoPartialA: true |
| 114 | + GuaranteeNoPartialB: true |
| 115 | + ISA: [11, 5, 0] |
| 116 | + InnerUnroll: 1 |
| 117 | + InterleaveAlpha: 0 |
| 118 | + KernelLanguage: Assembly |
| 119 | + LSCA: 32 |
| 120 | + LSCB: 32 |
| 121 | + LSPA: 8 |
| 122 | + LSPB: 8 |
| 123 | + LVCA: 32 |
| 124 | + LVCB: 32 |
| 125 | + LVPA: 8 |
| 126 | + LVPB: 8 |
| 127 | + LdcEqualsLdd: false |
| 128 | + LdsBlockSizePerPad: 0 |
| 129 | + LdsBlockSizePerPadA: 0 |
| 130 | + LdsBlockSizePerPadB: 0 |
| 131 | + LdsInitCVgprs: false |
| 132 | + LdsNumElements: 512 |
| 133 | + LdsOffsetA: 0 |
| 134 | + LdsOffsetB: 256 |
| 135 | + LdsPadA: 0 |
| 136 | + LdsPadB: 0 |
| 137 | + LocalDotLayout: 1 |
| 138 | + LocalRead2A: true |
| 139 | + LocalRead2B: true |
| 140 | + LocalReadVectorWidth: 1 |
| 141 | + LocalSplitU: 1 |
| 142 | + LocalWrite2A: true |
| 143 | + LocalWrite2B: true |
| 144 | + LocalWritePerMfma: -1 |
| 145 | + LocalWriteUseSgprA: false |
| 146 | + LocalWriteUseSgprB: false |
| 147 | + LoopDoWhile: false |
| 148 | + LoopIters: 8 |
| 149 | + LoopTail: true |
| 150 | + LoopUnroll: 8 |
| 151 | + MACInstruction: FMA |
| 152 | + MIArchVgpr: false |
| 153 | + MacroTile0: 32 |
| 154 | + MacroTile1: 32 |
| 155 | + MacroTileA: 32 |
| 156 | + MacroTileB: 32 |
| 157 | + MacroTileShapeMax: 64 |
| 158 | + MacroTileShapeMin: 1 |
| 159 | + MagicDivAlg: 2 |
| 160 | + MatrixInstruction: [] |
| 161 | + MaxOccupancy: 40 |
| 162 | + MaxVgprNumber: 256 |
| 163 | + MinVgprNumber: 0 |
| 164 | + NoLdsWriteCode: false |
| 165 | + NoReject: false |
| 166 | + NoTailLoop: false |
| 167 | + NonTemporalA: 0 |
| 168 | + NonTemporalB: 0 |
| 169 | + NonTemporalC: 0 |
| 170 | + NonTemporalD: 0 |
| 171 | + NumElementsPerBatchStore: 0 |
| 172 | + NumElementsPerThread: 4 |
| 173 | + NumGlobalWriteVectorsPerThread: 4 |
| 174 | + NumLoadsA: 1 |
| 175 | + NumLoadsB: 1 |
| 176 | + NumLoadsCoalescedA: 1 |
| 177 | + NumLoadsCoalescedB: 1 |
| 178 | + NumLoadsPerpendicularA: 1 |
| 179 | + NumLoadsPerpendicularB: 1 |
| 180 | + NumThreads: 256 |
| 181 | + OptNoLoadLoop: 1 |
| 182 | + OptPreLoopVmcnt: 0 |
| 183 | + PackBatchDims: 0 |
| 184 | + PackFreeDims: 1 |
| 185 | + PackGranularity: 2 |
| 186 | + PackSummationDims: 0 |
| 187 | + PackedC0IdxChars: [I] |
| 188 | + PackedC0IndicesX: [0] |
| 189 | + PackedC1IdxChars: [J] |
| 190 | + PackedC1IndicesX: [1] |
| 191 | + PerformanceSyncLocation: -1 |
| 192 | + PerformanceWaitCount: -1 |
| 193 | + PerformanceWaitLocation: -1 |
| 194 | + PersistentKernel: 0 |
| 195 | + PersistentKernelAlongBatch: false |
| 196 | + PrefetchAcrossPersistent: 0 |
| 197 | + PrefetchAcrossPersistentMode: 0 |
| 198 | + PrefetchGlobalRead: false |
| 199 | + PrefetchLocalRead: true |
| 200 | + ProblemType: |
| 201 | + AllowNoFreeDims: false |
| 202 | + AssignedDerivedParameters: true |
| 203 | + Batched: true |
| 204 | + ComplexConjugateA: false |
| 205 | + ComplexConjugateB: false |
| 206 | + ComputeDataType: 0 |
| 207 | + ConvolutionConfig: [] |
| 208 | + DataType: 0 |
| 209 | + DestDataType: 0 |
| 210 | + Fp16AltImpl: false |
| 211 | + HighPrecisionAccumulate: false |
| 212 | + Index0: 0 |
| 213 | + Index01A: 0 |
| 214 | + Index01B: 1 |
| 215 | + Index1: 1 |
| 216 | + IndexAssignmentsA: [0, 3, 2] |
| 217 | + IndexAssignmentsB: [1, 3, 2] |
| 218 | + IndexAssignmentsLD: [4, 5, 6, 7] |
| 219 | + IndexUnroll: 3 |
| 220 | + IndexUnrollA: 1 |
| 221 | + IndexUnrollB: 1 |
| 222 | + IndicesBatch: [2] |
| 223 | + IndicesFree: [0, 1] |
| 224 | + IndicesSummation: [3] |
| 225 | + MirrorDimsA: [] |
| 226 | + MirrorDimsB: [] |
| 227 | + NumIndicesBatch: 1 |
| 228 | + NumIndicesC: 3 |
| 229 | + NumIndicesFree: 2 |
| 230 | + NumIndicesLD: 4 |
| 231 | + NumIndicesSummation: 1 |
| 232 | + OperationType: GEMM |
| 233 | + SetConstStrideA: [] |
| 234 | + SetConstStrideB: [] |
| 235 | + SilentHighPrecisionAccumulate: false |
| 236 | + StridedBatched: true |
| 237 | + TLUA: true |
| 238 | + TLUB: true |
| 239 | + Tensor0: 0 |
| 240 | + Tensor1: 1 |
| 241 | + TileA: 0 |
| 242 | + TileAwareSelection: false |
| 243 | + TileB: 1 |
| 244 | + TotalIndices: 4 |
| 245 | + TransposeA: false |
| 246 | + TransposeB: true |
| 247 | + UseBeta: true |
| 248 | + UseInitialStridesAB: false |
| 249 | + UseInitialStridesCD: false |
| 250 | + ZeroPadA: [] |
| 251 | + ZeroPadB: [] |
| 252 | + ReplacementKernel: false |
| 253 | + ScheduleGlobalRead: 1 |
| 254 | + ScheduleIterAlg: 1 |
| 255 | + ScheduleLocalWrite: 1 |
| 256 | + SolutionIndex: 0 |
| 257 | + SolutionNameMin: Cijk_Ailk_Bjlk_SB_MT32x32x8_SN_ |
| 258 | + SourceSwap: false |
| 259 | + StaggerU: 32 |
| 260 | + StaggerUMapping: 0 |
| 261 | + StaggerUStride: 256 |
| 262 | + StoreCInUnroll: false |
| 263 | + StoreCInUnrollExact: false |
| 264 | + StoreCInUnrollInterval: 1 |
| 265 | + StoreCInUnrollPostLoop: false |
| 266 | + StorePriorityOpt: false |
| 267 | + StoreRemapVectorWidth: 0 |
| 268 | + StoreSyncOpt: 0 |
| 269 | + StoreVectorWidth: 4 |
| 270 | + SubGroup0: 16 |
| 271 | + SubGroup1: 16 |
| 272 | + SubGroupA: 16 |
| 273 | + SubGroupB: 16 |
| 274 | + SuppressNoLoadLoop: false |
| 275 | + ThreadTile: [2, 2] |
| 276 | + ThreadTile0: 2 |
| 277 | + ThreadTile1: 2 |
| 278 | + ThreadTileA: 2 |
| 279 | + ThreadTileB: 2 |
| 280 | + TransposeLDS: 0 |
| 281 | + UnrollIncIsDepthU: 0 |
| 282 | + UnrollMajorLDSA: 0 |
| 283 | + UnrollMajorLDSB: 0 |
| 284 | + UnrollMemFence: false |
| 285 | + Use64bShadowLimit: 1 |
| 286 | + UseInstOffsetForGRO: 0 |
| 287 | + UseSgprForGRO: -1 |
| 288 | + Valid: true |
| 289 | + VectorAtomicWidth: 1 |
| 290 | + VectorStore: -1 |
| 291 | + VectorWidth: 1 |
| 292 | + WaveSeparateGlobalReadA: 0 |
| 293 | + WaveSeparateGlobalReadB: 0 |
| 294 | + WavefrontSize: 64 |
| 295 | + WorkGroup: [16, 16, 1] |
| 296 | + WorkGroupMapping: 8 |
| 297 | + WorkGroupMappingType: B |
| 298 | + _DepthULds: 8 |
| 299 | + _GlobalAccumulation: null |
| 300 | + _UseSgprForGRO: 1 |
| 301 | + _VectorStore: 1 |
| 302 | + _WorkspaceSizePerElemC: 0 |
| 303 | + _staggerStrideShift: 3 |
| 304 | + allowLRVWforTLUandMI: false |
| 305 | +- [2, 3, 0, 1] |
| 306 | +- - - [126, 126, 2, 66, 126, 126, 126, 126] |
| 307 | + - [0, 0] |
| 308 | +- null |
| 309 | +- null |
| 310 | +- DeviceEfficiency |
0 commit comments