Line data Source code
1 : /**
2 : * Copyright (c) 2025 Huawei Technologies Co., Ltd.
3 : * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
4 : * CANN Open Software License Agreement Version 2.0 (the "License").
5 : * Please refer to the License for details. You may not use this file except in compliance with the License.
6 : * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
7 : * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
8 : * See LICENSE in the root of the software repository for the full text of the License.
9 : */
10 :
11 : #include "coll_reduce_scatter_mesh_opbase_small_count_deterministic_executor.h"
12 :
13 : const u32 RANK_SIZE_FOUR = 4;
14 : namespace hccl {
15 : // 准入条件: 确定性&小数据量
16 0 : CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor(
17 0 : const HcclDispatcher dispatcher, std::unique_ptr<TopoMatcher>& topoMatcher)
18 0 : : CollReduceScatterExecutor(dispatcher, topoMatcher)
19 : {
20 0 : DMAReduceFlag_ = true;
21 0 : CCLMemSlice_ = false;
22 0 : }
23 :
24 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CalcStreamNum(u32& streamNum)
25 : {
26 : u32 totalStreamNum;
27 0 : if (IsPowerOfTwo(topoAttr_.deviceNumPerAggregation)) {
28 : // level0 为HD staged
29 0 : totalStreamNum = 2U;
30 : } else {
31 0 : totalStreamNum = 1U;
32 : }
33 :
34 0 : streamNum = totalStreamNum - 1U;
35 0 : HCCL_INFO(
36 : "[CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor][CalcStreamNum] tag[%s] streamNum[%u]",
37 : tag_.c_str(), streamNum);
38 0 : return HCCL_SUCCESS;
39 : }
40 :
41 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CalcCommInfo(
42 : std::vector<LevelNSubCommTransport>& opTransport)
43 : {
44 0 : TransportMemType inputType = TransportMemType::RESERVED;
45 0 : TransportMemType outputType = TransportMemType::RESERVED;
46 0 : CHK_RET(CalcTransportMemType(inputType, outputType));
47 0 : CHK_RET(CalcLevel0CommInfo(inputType, outputType, opTransport));
48 0 : CHK_RET(CalcLevel1CommInfo(inputType, outputType, opTransport));
49 0 : return HCCL_SUCCESS;
50 : }
51 :
52 0 : bool CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::IsPowerOfTwo(u32 num)
53 : {
54 0 : return (num & (num - 1)) == 0;
55 : }
56 :
57 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CalcTransportMemType(
58 : TransportMemType& inputType, TransportMemType& outputType)
59 : {
60 0 : inputType = TransportMemType::CCL_INPUT;
61 0 : outputType = TransportMemType::CCL_OUTPUT;
62 0 : HCCL_INFO(
63 : "[CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor][CalcTransportMemType]"
64 : "tag[%s] inputType[%d], outputType[%d]",
65 : tag_.c_str(), inputType, outputType);
66 0 : return HCCL_SUCCESS;
67 : }
68 :
69 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CalcLevel0CommInfo(
70 : TransportMemType inputType, TransportMemType outputType, std::vector<LevelNSubCommTransport>& opTransport)
71 : {
72 : CommType commType;
73 0 : if (topoAttr_.deviceNumPerAggregation >= RANK_SIZE_FOUR && IsPowerOfTwo(topoAttr_.deviceNumPerAggregation)) {
74 : // HD stage
75 0 : commType = CommType::COMM_TAG_HALVING_DOUBLING;
76 : } else {
77 : // NHR
78 0 : commType = CommType::COMM_TAG_WHOLE_NHR;
79 : }
80 0 : CommParaInfo commParaInfo(COMM_LEVEL0, commType);
81 0 : commParaInfo.meshSinglePlane = false;
82 0 : CHK_RET(CalcCommPlaneInfo(tag_, commParaInfo, opTransport[COMM_LEVEL0], inputType, outputType));
83 0 : return HCCL_SUCCESS;
84 0 : }
85 :
86 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CalcLevel1CommInfo(
87 : TransportMemType inputType, TransportMemType outputType, std::vector<LevelNSubCommTransport>& opTransport)
88 : {
89 0 : HCCL_INFO("[%s][CalcLevel1CommInfo]tag[%s] start", __func__, tag_.c_str());
90 0 : CommParaInfo commParaLevel1(COMM_LEVEL1, CommType::COMM_TAG_MAX);
91 0 : if (algType_.algoLevel1 == AlgTypeLevel1::ALG_LEVEL1_RING) {
92 0 : commParaLevel1.commType = CommType::COMM_TAG_RING_INNER;
93 0 : HCCL_INFO("[%s][CalcLevel1CommInfo]tag[%s] Calc RingCommInfo", __func__, tag_.c_str());
94 0 : } else if (algType_.algoLevel1 == AlgTypeLevel1::ALG_LEVEL1_NHR) {
95 0 : commParaLevel1.commType = CommType::COMM_TAG_NONUNIFORM_HIERARCHICAL_RING;
96 0 : HCCL_INFO("[%s][CalcLevel1CommInfo]tag[%s] Calc NHRCommInfo", __func__, tag_.c_str());
97 0 : } else if (algType_.algoLevel1 == AlgTypeLevel1::ALG_LEVEL1_NB) {
98 0 : commParaLevel1.commType = CommType::COMM_TAG_NONUNIFORM_BRUCK;
99 0 : HCCL_INFO("[%s][CalcLevel1CommInfo]tag[%s] Calc NBCommInfo", __func__, tag_.c_str());
100 : } else {
101 0 : commParaLevel1.commType = CommType::COMM_TAG_HALVING_DOUBLING;
102 0 : HCCL_INFO("[%s][CalcLevel1CommInfo]tag[%s] Calc HDCommInfo", __func__, tag_.c_str());
103 : }
104 0 : commParaLevel1.forceRdma = false;
105 0 : CHK_RET(CalcCommPlaneInfo(tag_, commParaLevel1, opTransport[commParaLevel1.commPlane], inputType, outputType));
106 0 : HCCL_INFO("[%s][CalcLevel1CommInfo]tag[%s] Calc CommInfo Finish", __func__, tag_.c_str());
107 :
108 0 : return HCCL_SUCCESS;
109 0 : }
110 :
111 0 : u64 CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CalcLoopMaxCount(const u32 unitSize)
112 : {
113 : // 中转内存单次最多能够接受的output count
114 0 : u64 maxCountPerLoop = inCCLbufferSize_ / (topoAttr_.userRankSize * unitSize);
115 0 : return maxCountPerLoop;
116 : }
117 :
118 0 : bool CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::IsHugeData(
119 : const u64 curSize, [[maybe_unused]] OpParam* param)
120 : {
121 0 : bool hugeData = (curSize * topoAttr_.userRankSize / HCCL_INTERNODE_MAX_DATA_RATE > RDMA_SEND_MAX_SIZE)
122 0 : || (curSize > SDMA_SEND_MAX_SIZE);
123 0 : return hugeData;
124 : }
125 :
126 0 : bool CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::IsSmallData(
127 : [[maybe_unused]] const u64 totalSize, [[maybe_unused]] const u64 curSize)
128 : {
129 : // 小数据量才选到该执行器,默认为true
130 0 : return true;
131 : }
132 :
133 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::KernelRun(const OpParam& param, ExecMem& execMem)
134 : {
135 0 : HCCL_CONFIG_INFO(
136 : HCCL_ALG, "[CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor][Run]"
137 : "CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor begins.");
138 0 : u32 unitSize = SIZE_TABLE[param.DataDes.dataType];
139 0 : u64 curSize = execMem.count * unitSize; // 单位:字节
140 0 : CHK_RET(CheckCommSize(COMM_LEVEL0, COMM_INDEX_0 + 1));
141 0 : SubCommInfo level0CommInfo = GetSubCommInfo(COMM_LEVEL0, COMM_INDEX_0);
142 0 : CHK_RET(CheckCommSize(COMM_LEVEL1, level0CommInfo.localRank + 1));
143 0 : SubCommInfo level1CommInfo = GetSubCommInfo(COMM_LEVEL1, level0CommInfo.localRank);
144 :
145 0 : execMem.inputMem = execMem.inputMem.range(0, curSize * topoAttr_.userRankSize);
146 0 : execMem.outputMem = execMem.outputMem.range(0, curSize * topoAttr_.userRankSize);
147 0 : u64 reduceAttr = GetReduceAttr(execMem.inputMem, execMem.outputMem, param.DataDes.dataType, param.reduceType);
148 0 : CHK_RET(RunAlgLevel1(param, reduceAttr, execMem, level1CommInfo));
149 0 : CHK_RET(RunAlgLevel0(param, reduceAttr, execMem, level0CommInfo, level1CommInfo));
150 0 : return HCCL_SUCCESS;
151 0 : }
152 :
153 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::CopyFromUserInToCclIn(
154 : const OpParam& param, ExecMem& execMem)
155 : {
156 0 : u32 unitSize = SIZE_TABLE[param.DataDes.dataType];
157 0 : const bool preloadCopyOpt = IsPreloadCopyOptimizeCondition(param, execMem);
158 0 : DeviceMem dstMem;
159 0 : DeviceMem srcMem;
160 0 : if (preloadCopyOpt) {
161 : // 中转内存大小足够时,一次性搬完
162 0 : const u64 copySize = execMem.count * unitSize * topoAttr_.userRankSize;
163 0 : dstMem = execMem.inputMem.range(0, copySize);
164 0 : srcMem = DeviceMem::create(static_cast<u8*>(execMem.inputPtr), copySize);
165 0 : CHK_RET(HcclD2DMemcpyAsync(dispatcher_, dstMem, srcMem, const_cast<Stream&>(param.stream)));
166 : } else {
167 0 : u64 copySizeOnce = execMem.count * unitSize;
168 0 : for (u32 i = 0; i < topoAttr_.userRankSize; i++) {
169 : // 拷贝input上每个slice的数据到中转内存,源端每个slice的size固定为output的size
170 0 : dstMem = execMem.inputMem.range(copySizeOnce * i, copySizeOnce);
171 0 : srcMem = DeviceMem::create(
172 0 : static_cast<u8*>(execMem.inputPtr) + param.DataDes.count * unitSize * i, copySizeOnce);
173 0 : CHK_RET(HcclD2DMemcpyAsync(dispatcher_, dstMem, srcMem, const_cast<Stream&>(param.stream)));
174 : }
175 : }
176 0 : return HCCL_SUCCESS;
177 0 : }
178 :
179 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::RunAlgLevel1(
180 : const OpParam& param, u64 reduceAttr, ExecMem& execMem, SubCommInfo& level1CommInfo)
181 : {
182 0 : u32 unitSize = SIZE_TABLE[param.DataDes.dataType];
183 :
184 0 : CHK_RET(CopyFromUserInToCclIn(param, execMem));
185 :
186 : // 第一步:节点间
187 0 : std::unique_ptr<AlgTemplateBase> level1TempAlg;
188 0 : if (algType_.algoLevel1 == AlgTypeLevel1::ALG_LEVEL1_RING) {
189 : level1TempAlg
190 0 : = AlgTemplateRegistry::Instance().GetAlgTemplate(TemplateType::TEMPLATE_REDUCESCATTER_RING, dispatcher_);
191 0 : CHK_SMART_PTR_NULL(level1TempAlg);
192 0 : CHK_RET(level1TempAlg->Prepare(reduceAttr));
193 0 : HCCL_INFO("ReduceScatter smallcount deterministic: using ring algo inter-server.");
194 0 : u64 ringSize = execMem.inputMem.size() / level1CommInfo.localRankSize;
195 0 : u64 ringCount = ringSize / unitSize;
196 0 : CHK_RET(level1TempAlg->Prepare(
197 : execMem.inputMem, execMem.inputMem, execMem.scratchMem, ringCount, param.DataDes.dataType, param.stream,
198 : param.reduceType, LEVEL0_BRIDGE_RANK_ID, std::vector<Slice>(0)));
199 0 : } else if (algType_.algoLevel1 == AlgTypeLevel1::ALG_LEVEL1_NHR) {
200 : level1TempAlg
201 0 : = AlgTemplateRegistry::Instance().GetAlgTemplate(TemplateType::TEMPLATE_REDUCESCATTER_NHR, dispatcher_);
202 0 : HCCL_INFO("ReduceScatter smallcount deterministic: using nhr algo inter-server.");
203 0 : CHK_SMART_PTR_NULL(level1TempAlg);
204 0 : CHK_RET(level1TempAlg->Prepare(reduceAttr, false));
205 0 : u64 ringSize = execMem.inputMem.size() / level1CommInfo.localRankSize;
206 0 : u64 ringCount = ringSize / unitSize;
207 0 : CHK_RET(level1TempAlg->Prepare(
208 : execMem.inputMem, execMem.inputMem, execMem.scratchMem, ringCount, param.DataDes.dataType, param.stream,
209 : param.reduceType, LEVEL0_BRIDGE_RANK_ID, std::vector<Slice>(0)));
210 0 : level1TempAlg->CloseBarrier();
211 0 : } else if (algType_.algoLevel1 == AlgTypeLevel1::ALG_LEVEL1_NB) {
212 : level1TempAlg
213 0 : = AlgTemplateRegistry::Instance().GetAlgTemplate(TemplateType::TEMPLATE_REDUCESCATTER_NB, dispatcher_);
214 0 : HCCL_INFO("ReduceScatter smallcount deterministic: using nonuniform-bruck algo inter-server.");
215 0 : CHK_SMART_PTR_NULL(level1TempAlg);
216 0 : CHK_RET(level1TempAlg->Prepare(reduceAttr));
217 0 : u64 ringSize = execMem.inputMem.size() / level1CommInfo.localRankSize;
218 0 : u64 ringCount = ringSize / unitSize;
219 0 : CHK_RET(level1TempAlg->Prepare(
220 : execMem.inputMem, execMem.inputMem, execMem.scratchMem, ringCount, param.DataDes.dataType, param.stream,
221 : param.reduceType, LEVEL0_BRIDGE_RANK_ID, std::vector<Slice>(0)));
222 : } else {
223 0 : level1TempAlg = AlgTemplateRegistry::Instance().GetAlgTemplate(
224 0 : TemplateType::TEMPLATE_REDUCESCATTER_RECURSIVE_HD, dispatcher_);
225 0 : CHK_SMART_PTR_NULL(level1TempAlg);
226 0 : CHK_RET(level1TempAlg->Prepare(reduceAttr));
227 0 : HCCL_INFO("ReduceScatter smallcount deterministic: using halving-doubling algo inter-server.");
228 0 : u64 inputDataCount = execMem.inputMem.size() / unitSize; // count是output的数据个数
229 0 : CHK_RET(level1TempAlg->Prepare(
230 : execMem.inputMem, execMem.inputMem, execMem.scratchMem, inputDataCount, param.DataDes.dataType,
231 : param.stream, param.reduceType, LEVEL0_BRIDGE_RANK_ID, std::vector<Slice>(0)));
232 : }
233 0 : CHK_RET(level1TempAlg->RegisterProfiler(
234 : (level1CommInfo.localRankSize << PROF_RANKSIZE_OFFSET_OF_PLANEID) + level1CommInfo.localRank, PROF_STAGE_0,
235 : HCCL_EXEC_STEP_NOT_SET, param.stream));
236 0 : CHK_RET(RunTemplate(level1TempAlg, level1CommInfo));
237 0 : return HCCL_SUCCESS;
238 0 : }
239 :
240 0 : HcclResult CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::RunAlgLevel0(
241 : const OpParam& param, u64 reduceAttr, ExecMem& execMem, SubCommInfo& level0CommInfo, SubCommInfo& level1CommInfo)
242 : {
243 0 : u32 unitSize = SIZE_TABLE[param.DataDes.dataType];
244 : // 第二步:节点内
245 : // 根据数据量算每个环上数据的偏移和大小,把做完hd的slice均分成RankSize份
246 0 : std::vector<Slice> dataSegsSlice;
247 0 : CHK_RET(PrepareReduceScatterSliceData(execMem.count, unitSize, level0CommInfo.localRankSize, dataSegsSlice));
248 :
249 : // 每个server分配的slice大小
250 0 : u64 serverSliceSize = execMem.inputMem.size() / level1CommInfo.localRankSize;
251 : // 每个服务器对应的偏移
252 0 : u64 serverSliceOffset = serverSliceSize * level1CommInfo.localRank;
253 :
254 0 : HCCL_DEBUG(
255 : "inputMem.size=%llu, level0CommInfo.localRankSize=%u, serverSliceSize=%llu, serverSliceOffset=%llu "
256 : "level0CommInfo.localRank=%u level1CommInfo.localRank=%u",
257 : execMem.inputMem.size(), level0CommInfo.localRankSize, serverSliceSize, serverSliceOffset,
258 : level0CommInfo.localRank, level1CommInfo.localRank);
259 :
260 0 : DeviceMem reduceScatterMeshInput = execMem.inputMem.range(serverSliceOffset, serverSliceSize);
261 0 : CHK_SMART_PTR_NULL(reduceScatterMeshInput);
262 0 : DeviceMem reduceScatterMeshOutput = execMem.outputMem.range(0, serverSliceSize);
263 0 : CHK_SMART_PTR_NULL(reduceScatterMeshOutput);
264 :
265 0 : HcomCollOpInfo opInfo
266 : = {"",
267 0 : reduceScatterMeshInput.ptr(),
268 0 : execMem.outputPtr,
269 0 : param.DataDes.count,
270 0 : param.DataDes.dataType,
271 0 : param.root,
272 0 : param.reduceType,
273 0 : 0};
274 0 : std::unique_ptr<AlgTemplateBase> level0TempAlg;
275 : // HD stage 模板中ranksize必须大于等于4
276 0 : if (level0CommInfo.localRankSize >= RANK_SIZE_FOUR && IsPowerOfTwo(level0CommInfo.localRankSize)) {
277 : level0TempAlg
278 0 : = AlgTemplateRegistry::Instance().GetAlgTemplate(TemplateType::TEMPLATE_REDUCESCATTER_HDSTAGE, dispatcher_);
279 0 : CHK_SMART_PTR_NULL(level0TempAlg);
280 0 : CHK_RET(level0TempAlg->Prepare(
281 : reduceScatterMeshInput, reduceScatterMeshOutput, reduceScatterMeshOutput, execMem.count,
282 : param.DataDes.dataType, param.stream, param.reduceType, LEVEL0_BRIDGE_RANK_ID, std::vector<Slice>(0), 0,
283 : reduceAttr, algResResp_->slaveStreams, algResResp_->notifiesMain, algResResp_->notifiesAux,
284 : topoAttr_.userRank, &opInfo));
285 0 : HCCL_INFO("ReduceScatter smallcount deterministic: using hd stage algo inter-server.");
286 : } else {
287 : level0TempAlg
288 0 : = AlgTemplateRegistry::Instance().GetAlgTemplate(TemplateType::TEMPLATE_REDUCESCATTER_NHR, dispatcher_);
289 0 : CHK_SMART_PTR_NULL(level0TempAlg);
290 0 : CHK_RET(level0TempAlg->Prepare(reduceAttr, false));
291 0 : u64 ringSize = reduceScatterMeshInput.size() / level0CommInfo.localRankSize;
292 0 : u64 ringCount = ringSize / unitSize;
293 0 : CHK_RET(level0TempAlg->Prepare(
294 : reduceScatterMeshInput, reduceScatterMeshInput, reduceScatterMeshOutput, ringCount, param.DataDes.dataType,
295 : param.stream, param.reduceType, LEVEL0_BRIDGE_RANK_ID, std::vector<Slice>(0), serverSliceOffset));
296 0 : level0TempAlg->CloseBarrier();
297 0 : HCCL_INFO("ReduceScatter smallcount deterministic: using nhr algo inter-server.");
298 : }
299 0 : CHK_RET(level0TempAlg->RegisterProfiler(
300 : (level0CommInfo.localRankSize << PROF_RANKSIZE_OFFSET_OF_PLANEID) + level0CommInfo.localRank, PROF_STAGE_2,
301 : HCCL_EXEC_STEP_NOT_SET, param.stream));
302 0 : CHK_RET(RunTemplate(level0TempAlg, level0CommInfo));
303 0 : if (level0CommInfo.localRankSize < RANK_SIZE_FOUR || !IsPowerOfTwo(level0CommInfo.localRankSize)) {
304 : DeviceMem srcMem = execMem.inputMem.range(
305 0 : serverSliceOffset + dataSegsSlice[level0CommInfo.localRank].offset, execMem.count * unitSize);
306 0 : DeviceMem dstMem = DeviceMem::create(execMem.outputPtr, execMem.count * unitSize);
307 0 : CHK_SMART_PTR_NULL(srcMem);
308 0 : CHK_SMART_PTR_NULL(dstMem);
309 0 : CHK_RET(HcclD2DMemcpyAsync(dispatcher_, dstMem, srcMem, const_cast<Stream&>(param.stream)));
310 0 : }
311 0 : return HCCL_SUCCESS;
312 0 : }
313 :
314 0 : bool CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor::IsPreloadCopyOptimizeCondition(
315 : const OpParam& param, ExecMem& execMem)
316 : {
317 : // 通信buffer足够大时,将user in到ccl的拷贝任务合并成一个
318 0 : return param.DataDes.count == execMem.count;
319 : }
320 :
321 : REGISTER_EXEC(
322 : "ReduceScatterMeshOpbaseSmallCountDeterministicExecutor", ReduceScatterMeshOpbaseSmallCountDeterministic,
323 : CollReduceScatterMeshOpbaseSmallCountDeterministicExecutor);
324 :
325 : } // namespace hccl
|