Line data Source code
1 : /**
2 : * Copyright (c) 2025 Huawei Technologies Co., Ltd.
3 : * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
4 : * CANN Open Software License Agreement Version 2.0 (the "License").
5 : * Please refer to the License for details. You may not use this file except in compliance with the License.
6 : * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
7 : * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
8 : * See LICENSE in the root of the software repository for the full text of the License.
9 : */
10 :
11 : #include "log.h"
12 :
13 : #include "alg_data_trans_wrapper.h"
14 : #include "ins_alg_template/ins_temp_all_gather_nhr.h"
15 :
16 : namespace Hccl {
17 0 : InsTempAllGatherNHR::InsTempAllGatherNHR(const RankId virtualRank, const u32 tempRankSize,
18 0 : const std::vector<std::vector<RankId>> &tempVTopo, const std::map<RankId, u32> &tempVirtRankMap)
19 0 : : InsAlgTemplateBase(virtualRank, tempRankSize, tempVTopo, tempVirtRankMap)
20 : {
21 0 : }
22 :
23 0 : InsTempAllGatherNHR::~InsTempAllGatherNHR()
24 : {
25 0 : }
26 :
27 0 : HcclResult InsTempAllGatherNHR::CalcRes(AlgTempResReq &tempResReq)
28 : {
29 0 : CHK_PRT_RET(CalcResLinksNHR(myRank_, tempRankSize_, tempVTopo_, tempResReq) != HcclResult::HCCL_SUCCESS,
30 : HCCL_ERROR("[CollAlgFactory] [InsTempAllGatherNHR] Rank [%d], resLinks calculation error!", myRank_),
31 : HcclResult::HCCL_E_INTERNAL);
32 0 : auto &linkReq = tempResReq.links;
33 0 : u32 pathNum = 0;
34 0 : for (auto resReqIter = linkReq.begin(); resReqIter != linkReq.end(); resReqIter++) {
35 0 : auto remoteRank = resReqIter->first;
36 0 : if (rank2PathNumMap_.find(remoteRank) == rank2PathNumMap_.end() || rank2PathNumMap_[remoteRank] == 0) {
37 0 : HCCL_ERROR("[InsTempAllGatherNHR] No path to remoteRank[%d]", remoteRank);
38 0 : return HcclResult::HCCL_E_INTERNAL;
39 : }
40 0 : if (pathNum == 0) {
41 0 : pathNum = rank2PathNumMap_[remoteRank];
42 0 : } else if (rank2PathNumMap_[remoteRank] != pathNum) {
43 0 : HCCL_ERROR("[InsTempAllGatherNHR] Inconsistency pathNum to remoteRanks, Previous consistent pathNum=[%u], "
44 : "mismatched "
45 : "remoteRank=[%d], pathNum=[%u]",
46 : pathNum, remoteRank, rank2PathNumMap_[remoteRank]);
47 0 : return HcclResult::HCCL_E_INTERNAL;
48 : }
49 0 : resReqIter->second = pathNum;
50 : }
51 :
52 : // NHR 需要的 que Num 为 1
53 0 : tempResReq.queNum = 1 * pathNum;
54 0 : HCCL_INFO("[InsTempAllGatherNHR] tempResReq.queNum = %u", tempResReq.queNum);
55 0 : tempResReq.streamNum = tempResReq.queNum;
56 0 : tempResReq.queNotifys = CreateMasterSlaveQueNotifiesRequest(tempResReq.queNum);
57 :
58 0 : return HcclResult::HCCL_SUCCESS;
59 : }
60 :
61 0 : HcclResult InsTempAllGatherNHR::CalcSliceInfo(
62 : const AllignInfo &allignInfo, const u64 dataSize, RankSliceInfo &sliceInfoVec)
63 : {
64 0 : std::vector<SliceInfo> tmp(tempVTopo_.size());
65 0 : sliceInfoVec.resize(tempRankSize_, tmp);
66 :
67 0 : CHK_RET(CalcRsAgSliceInfoNHR(myRank_, tempRankSize_, allignInfo, dataSize, sliceInfoVec));
68 :
69 0 : return HcclResult::HCCL_SUCCESS;
70 0 : }
71 :
72 0 : HcclResult InsTempAllGatherNHR::GenExtIns(const TempFuncs &tempFuncs, const TemplateDataParams &tempAlgParams,
73 : const ResLinks &tempLinks, std::vector<InsQuePtr> &tempInsQues)
74 : {
75 0 : if (IsPcieLink(tempLinks)) {
76 0 : dmaMode_ = DmaMode::GET;
77 : }
78 0 : opMode_ = tempFuncs.opMode;
79 0 : tempAlgParams_ = tempAlgParams;
80 0 : tempLinks_ = tempLinks;
81 :
82 0 : uint32_t linkNum = tempLinks.begin()->second.size();
83 : // 流的数量不能少于linkNum
84 0 : CHK_PRT_RET(linkNum > tempInsQues.size(),
85 : HCCL_ERROR("[CollAlgFactory] [InsTempAllReduceNHR] Rank [%d], requiredQue Error.", myRank_),
86 : HcclResult::HCCL_E_INTERNAL);
87 0 : CHK_RET(LocalDataCopy(tempInsQues));
88 0 : CHK_RET(RunNHR(tempInsQues));
89 0 : CHK_RET(PostLocalCopy(tempInsQues));
90 :
91 0 : return HcclResult::HCCL_SUCCESS;
92 : }
93 :
94 0 : HcclResult InsTempAllGatherNHR::GetStepInfo(u32 step, u32 nSteps, AicpuNHRStepInfo &stepInfo)
95 : {
96 0 : u32 rankIdx = 0;
97 0 : CHK_RET(GetAlgRank(myRank_, tempVTopo_[0], rankIdx));
98 0 : stepInfo.txSliceIdxs.clear();
99 0 : stepInfo.rxSliceIdxs.clear();
100 0 : stepInfo.step = step;
101 0 : stepInfo.myRank = rankIdx;
102 :
103 : // 计算通信对象
104 0 : u32 deltaRank = 1 << (nSteps - 1 - step);
105 0 : u32 recvFrom = (rankIdx + tempRankSize_ - deltaRank) % tempRankSize_;
106 0 : u32 sendTo = (rankIdx + deltaRank) % tempRankSize_;
107 :
108 : // 数据份数和数据编号增量
109 0 : u32 nSlices = (tempRankSize_ - 1 + (1 << (nSteps - 1 - step))) / (1 << (nSteps - step));
110 0 : u32 deltaSliceIndex = 1 << (nSteps - step);
111 0 : u32 txSliceIdx = rankIdx;
112 0 : u32 rxSliceIdx = (rankIdx - (1 << (nSteps - 1 - step)) + tempRankSize_) % tempRankSize_;
113 :
114 0 : stepInfo.nSlices = nSlices;
115 0 : stepInfo.toRank = sendTo;
116 0 : stepInfo.fromRank = recvFrom;
117 :
118 0 : for (u32 i = 0; i < nSlices; i++) {
119 0 : stepInfo.txSliceIdxs.push_back(txSliceIdx);
120 0 : stepInfo.rxSliceIdxs.push_back(rxSliceIdx);
121 0 : HCCL_DEBUG("[AllGatherNHR][GetStepInfo] i[%u] txSliceIdx[%u] rxSliceIdx[%u]", i, txSliceIdx, rxSliceIdx);
122 :
123 0 : txSliceIdx = (txSliceIdx + tempRankSize_ - deltaSliceIndex) % tempRankSize_;
124 0 : rxSliceIdx = (rxSliceIdx + tempRankSize_ - deltaSliceIndex) % tempRankSize_;
125 : }
126 0 : return HcclResult::HCCL_SUCCESS;
127 : }
128 :
129 0 : RankId InsTempAllGatherNHR::GetRankFromMap(const u32 rankIdx)
130 : {
131 0 : return tempVTopo_[0].at(rankIdx);
132 : }
133 :
134 0 : HcclResult InsTempAllGatherNHR::LocalDataCopy(std::vector<InsQuePtr> &tempInsQues)
135 : {
136 0 : u32 algRankIdx = 0;
137 0 : CHK_RET(GetAlgRank(myRank_, tempVTopo_[0], algRankIdx));
138 : // 做个保护,tailSize填写为0就认为尾块是正常块
139 0 : u64 tailSize = (tempAlgParams_.tailSize == 0) ? tempAlgParams_.sliceSize : tempAlgParams_.tailSize;
140 0 : u64 sliceSize = (algRankIdx == tempRankSize_ - 1) ? tailSize : tempAlgParams_.sliceSize;
141 0 : for (u64 rpt = 0; rpt < tempAlgParams_.repeatNum; ++rpt) {
142 0 : const u64 inBaseOff = tempAlgParams_.buffInfo.inBuffBaseOff + rpt * tempAlgParams_.inputRepeatStride;
143 0 : const u64 scratchBase = tempAlgParams_.buffInfo.scratchBuffBaseOff
144 0 : + rpt * (tempAlgParams_.sliceSize * (tempRankSize_ - 1) + tailSize);
145 :
146 0 : const u64 inOff = tempAlgParams_.inputSliceStride * algRankIdx + inBaseOff;
147 0 : const u64 scOff = scratchBase + tempAlgParams_.sliceSize * algRankIdx;
148 :
149 0 : DataSlice src(tempAlgParams_.buffInfo.inBuffType, inOff, sliceSize);
150 0 : DataSlice dst(tempAlgParams_.buffInfo.scratBuffType, scOff, sliceSize);
151 :
152 0 : auto ins = std::make_unique<InsLocalCopy>(src, dst);
153 0 : tempInsQues[0]->Append(std::move(ins));
154 0 : }
155 0 : return HcclResult::HCCL_SUCCESS;
156 : }
157 :
158 0 : HcclResult InsTempAllGatherNHR::PostLocalCopy(std::vector<InsQuePtr> &tempInsQues)
159 : {
160 0 : CHK_PRT_RET(
161 : tempInsQues.empty(), HCCL_ERROR("[AllGatherNHR][PostLocalCopy] empty queue"), HcclResult::HCCL_E_INTERNAL);
162 0 : CHK_PTR_NULL(tempInsQues[0]);
163 : // 做个保护,tailSize填写为0就认为尾块是正常块
164 0 : u64 tailSize = (tempAlgParams_.tailSize == 0) ? tempAlgParams_.sliceSize : tempAlgParams_.tailSize;
165 0 : for (u64 rpt = 0; rpt < tempAlgParams_.repeatNum; ++rpt) {
166 0 : const u64 outBaseOff = tempAlgParams_.buffInfo.outBuffBaseOff + rpt * tempAlgParams_.outputRepeatStride;
167 0 : const u64 scratchBase = tempAlgParams_.buffInfo.scratchBuffBaseOff
168 0 : + rpt * (tempAlgParams_.sliceSize * (tempRankSize_ - 1) + tailSize);
169 :
170 0 : for (u32 algIdx = 0; algIdx < tempRankSize_; ++algIdx) {
171 0 : const u64 scratchOffset = scratchBase + tempAlgParams_.sliceSize * algIdx;
172 0 : const u64 outOffset = tempAlgParams_.outputSliceStride * algIdx + outBaseOff;
173 : // 如果是最后一张卡需要用尾部数据计算
174 0 : u64 sliceSize = (algIdx == tempRankSize_ - 1) ? tailSize : tempAlgParams_.sliceSize;
175 0 : DataSlice src(tempAlgParams_.buffInfo.scratBuffType, scratchOffset, sliceSize);
176 0 : DataSlice dst(tempAlgParams_.buffInfo.outBuffType, outOffset, sliceSize);
177 :
178 0 : auto ins = std::make_unique<InsLocalCopy>(src, dst);
179 0 : tempInsQues[0]->Append(std::move(ins));
180 0 : }
181 : }
182 0 : return HcclResult::HCCL_SUCCESS;
183 : }
184 :
185 0 : HcclResult InsTempAllGatherNHR::RunNHR(std::vector<InsQuePtr> &tempInsQues)
186 : {
187 0 : u32 mainQueIdx = 0;
188 : // 流间前同步,主流通知从流,只有一个流则不做任何事
189 0 : CHK_RET(PreSyncQues(tempInsQues, mainQueIdx));
190 0 : const u32 nSteps = GetNHRStepNum(tempRankSize_);
191 0 : u32 myAlgRank = 0;
192 0 : CHK_RET(GetAlgRank(myRank_, tempVTopo_[0], myAlgRank));
193 : // 做个保护,tailSize填写为0就认为尾块是正常块
194 0 : u64 tailSize = (tempAlgParams_.tailSize == 0) ? tempAlgParams_.sliceSize : tempAlgParams_.tailSize;
195 0 : for (u32 step = 0; step < nSteps; ++step) {
196 0 : AicpuNHRStepInfo stepInfo;
197 0 : CHK_RET(GetStepInfo(step, nSteps, stepInfo));
198 0 : const std::vector<LinkData> &linkRecv = tempLinks_.at(GetRankFromMap(stepInfo.fromRank));
199 0 : const std::vector<LinkData> &linkSend = tempLinks_.at(GetRankFromMap(stepInfo.toRank));
200 0 : HCCL_DEBUG(
201 : "[InsTempAllGatherNHR] rank[%d] rankSize[%u] recvFrom[%u] sendTo[%u] step[%u] nSteps[%u] nSlices[%u]",
202 : myRank_, tempRankSize_, stepInfo.fromRank, stepInfo.toRank, step, nSteps, stepInfo.nSlices);
203 0 : if (linkRecv.size() != linkSend.size()) {
204 0 : HCCL_ERROR("linkRecv.size()!=linkSend.size()");
205 0 : return HcclResult::HCCL_E_INTERNAL;
206 : }
207 0 : HCCL_INFO("GetRankFromMap(stepInfo.fromRank)=%d", GetRankFromMap(stepInfo.fromRank));
208 0 : u32 linkNum = rank2PathNumMap_.at(GetRankFromMap(stepInfo.fromRank));
209 0 : if (linkNum != linkRecv.size()) {
210 0 : HCCL_ERROR("InsTempAllGatherMesh1D::RunMesh linkNum != linkRecv.size()");
211 0 : return HcclResult::HCCL_E_INTERNAL;
212 : }
213 0 : std::vector<float> dataSplitRate(linkNum);
214 0 : CHK_RET(CalcDataSplitRateForLinks(
215 : linkRecv, dataSplitRate)); // todo, 修改CalcDataSplitRateForLinks接口,变为对每个对端分别计算
216 0 : for (u32 j = 0; j < linkNum; j++) {
217 0 : std::vector<DataSlice> txSrcSlices;
218 0 : std::vector<DataSlice> txDstSlices;
219 0 : std::vector<DataSlice> rxSrcSlices;
220 0 : std::vector<DataSlice> rxDstSlices;
221 0 : for (u32 rpt = 0; rpt < tempAlgParams_.repeatNum; ++rpt) {
222 0 : const u64 scratchRepeatStride = tempAlgParams_.sliceSize * (tempRankSize_ - 1) + tailSize;
223 0 : const u64 scratchBase = tempAlgParams_.buffInfo.scratchBuffBaseOff + rpt * scratchRepeatStride;
224 0 : for (u32 i = 0; i < stepInfo.nSlices; ++i) {
225 0 : const u32 txIdx = stepInfo.txSliceIdxs[i];
226 0 : const u32 rxIdx = stepInfo.rxSliceIdxs[i];
227 0 : const u64 txScratchOff = scratchBase + tempAlgParams_.sliceSize * txIdx;
228 0 : const u64 rxScratchOff = scratchBase + tempAlgParams_.sliceSize * rxIdx;
229 0 : u64 sliceSize = (myAlgRank == tempRankSize_ - 1) ? tailSize : tempAlgParams_.sliceSize;
230 0 : DataSlice txSrcSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, txScratchOff, sliceSize);
231 0 : DataSlice txDstSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, txScratchOff, sliceSize);
232 0 : DataSlice rxSrcSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, rxScratchOff, sliceSize);
233 0 : DataSlice rxDstSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, rxScratchOff, sliceSize);
234 0 : txSrcSlices.emplace_back(CalcDataSliceForLinks(txSrcSliceAllLink, dataSplitRate, j, dataType_));
235 0 : txDstSlices.emplace_back(CalcDataSliceForLinks(txDstSliceAllLink, dataSplitRate, j, dataType_));
236 0 : rxSrcSlices.emplace_back(CalcDataSliceForLinks(rxSrcSliceAllLink, dataSplitRate, j, dataType_));
237 0 : rxDstSlices.emplace_back(CalcDataSliceForLinks(rxDstSliceAllLink, dataSplitRate, j, dataType_));
238 : }
239 : }
240 0 : TxRxSlicesList sendRecvSlicesList({txSrcSlices, txDstSlices}, {rxSrcSlices, rxDstSlices});
241 0 : TxRxLinks sendRecvLinks(linkSend[j], linkRecv[j]);
242 0 : SendRecvInfo sendRecvInfo(sendRecvLinks, sendRecvSlicesList);
243 0 : CHK_PRT_RET(SendRecv(sendRecvInfo, tempInsQues[j], 0, true, dmaMode_),
244 : HCCL_ERROR("[InsTempAllGatherNHR] sendrecv failed (step=%u)", step), HcclResult::HCCL_E_INTERNAL);
245 0 : }
246 0 : }
247 : // 流间后同步,从流通知主流
248 0 : CHK_RET(PostSyncQues(tempInsQues, mainQueIdx));
249 0 : return HcclResult::HCCL_SUCCESS;
250 : }
251 :
252 : } // namespace Hccl
|