Line data Source code
1 : /**
2 : * Copyright (c) 2025 Huawei Technologies Co., Ltd.
3 : * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
4 : * CANN Open Software License Agreement Version 2.0 (the "License").
5 : * Please refer to the License for details. You may not use this file except in compliance with the License.
6 : * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
7 : * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
8 : * See LICENSE in the root of the software repository for the full text of the License.
9 : */
10 :
11 : #include "log.h"
12 :
13 : #include "alg_data_trans_wrapper.h"
14 : #include "ins_alg_template/ins_temp_all_reduce_mesh_1D_one_shot.h"
15 :
16 : namespace Hccl {
17 0 : InsTempAllReduceMesh1DOneShot::InsTempAllReduceMesh1DOneShot(const RankId virtualRank, const u32 tempRankSize,
18 0 : const std::vector<std::vector<RankId>> &tempVTopo, const std::map<RankId, u32> &tempVirtRankMap)
19 0 : : InsAlgTemplateBase(virtualRank, tempRankSize, tempVTopo, tempVirtRankMap)
20 : {
21 0 : }
22 :
23 0 : InsTempAllReduceMesh1DOneShot::~InsTempAllReduceMesh1DOneShot()
24 : {
25 0 : }
26 :
27 0 : u32 InsTempAllReduceMesh1DOneShot::CalcScratchMultiple(BufferType input, BufferType output) const
28 : {
29 : (void)input;
30 : (void)output;
31 : // one shot 场景,scratch Buffer 需要是 usrIn的rankSize倍
32 0 : return tempRankSize_;
33 : }
34 :
35 0 : HcclResult InsTempAllReduceMesh1DOneShot::CalcRes(AlgTempResReq &tempResReq)
36 : {
37 0 : tempResReq.queNum = tempVTopo_[0].size();
38 0 : tempResReq.streamNum = tempResReq.queNum;
39 0 : tempResReq.queNotifys = CreateMasterSlaveQueNotifiesRequest(tempResReq.queNum);
40 :
41 0 : QId centerQ = 0;
42 0 : tempResReq.localWaitGroupCntNotify.emplace_back(centerQ, 0);
43 0 : tempResReq.localBcastPostCntNotify.emplace_back(centerQ, 0);
44 :
45 0 : CHK_PRT_RET(CalcResLinksMesh(myRank_, tempRankSize_, tempVTopo_, linkNumBtwPeers_, tempResReq) != HcclResult::HCCL_SUCCESS,
46 : HCCL_ERROR("[CollAlgFactory] [InsTempAllReduceMesh1DOneShot] Rank [%d], resLinks calculation error!", myRank_),
47 : HcclResult::HCCL_E_INTERNAL);
48 :
49 0 : return HcclResult::HCCL_SUCCESS;
50 : }
51 :
52 0 : HcclResult InsTempAllReduceMesh1DOneShot::CalcSlice(const u64 dataSize, RankSliceInfo &sliceInfoVec)
53 : {
54 0 : std::vector<SliceInfo> tmp(tempVTopo_.size());
55 0 : sliceInfoVec.resize(tempRankSize_, tmp);
56 0 : AllignInfo allignInfo = {false, 0, dataType_}; // 参数填充,CalcRsAgSliceInfoMesh实际没用到
57 :
58 0 : CHK_RET(CalcRsAgSliceInfoMesh(myRank_, tempRankSize_, allignInfo, dataSize, sliceInfoVec));
59 :
60 0 : return HcclResult::HCCL_SUCCESS;
61 0 : }
62 :
63 0 : HcclResult InsTempAllReduceMesh1DOneShot::GenExtIns(const TempFuncs &tempFuncs, const TemplateDataParams &tempAlgParams,
64 : const ResLinks &tempLinks, std::vector<InsQuePtr> &tempInsQues)
65 : {
66 0 : HCCL_INFO("[InsTempAllReduceMesh1DOneShot][Run] AllReduceMesh1DOneShot begin: rank[%d] start", myRank_);
67 :
68 0 : opMode_ = tempFuncs.opMode;
69 0 : queNum_ = tempVTopo_[0].size();
70 0 : CHK_PRT_RET(queNum_ != tempInsQues.size(),
71 : HCCL_ERROR("[CollAlgFactory] [InsTempAllReduceMesh1DOneShot] Rank [%d], requiredQue Error.", myRank_),
72 : HcclResult::HCCL_E_INTERNAL);
73 :
74 0 : RankSliceInfo sliceInfoVec;
75 0 : CHK_RET(CalcSlice(tempAlgParams.sliceSize, sliceInfoVec));
76 :
77 0 : HCCL_INFO("[InsTempAllReduceMesh1DOneShot][PreCopy] write userIn data directly to the ScratchBuffer, skip precopy");
78 0 : CHK_RET(RunAllReduce(tempAlgParams, sliceInfoVec, tempLinks, tempInsQues));
79 0 : HCCL_INFO("[InsTempAllReduceMesh1DOneShot][PostCopy] data is already in the userOut, skip postcopy");
80 :
81 0 : HCCL_INFO("[InsTempAllReduceMesh1DOneShot][Run] AllReduceMesh1DOneShot finished: rank[%d] end", myRank_);
82 0 : return HcclResult::HCCL_SUCCESS;
83 0 : }
84 :
85 0 : HcclResult InsTempAllReduceMesh1DOneShot::RunAllReduce(const TemplateDataParams &tempAlgParams, const RankSliceInfo &sliceInfoVec,
86 : const ResLinks &tempLinks, std::vector<InsQuePtr> &tempInsQues)
87 : {
88 0 : HCCL_INFO("[InsTempAllReduceMesh1DOneShot][RunAllReduce] send/recv: rank[%d]", myRank_);
89 :
90 : // semaphore sync
91 0 : if (tempVTopo_[0].size() > 1) {
92 0 : CHK_RET(PreSyncInterQueues(tempInsQues));
93 : }
94 :
95 0 : DataSlice usrInSlices = DataSlice(BufferType::INPUT, tempAlgParams.buffInfo.inBuffBaseOff, tempAlgParams.sliceSize);
96 0 : DataSlice usrOutSlices = DataSlice(BufferType::OUTPUT, tempAlgParams.buffInfo.outBuffBaseOff, tempAlgParams.sliceSize);
97 :
98 : // 主流动作
99 0 : CHK_RET(LocalCopy(tempInsQues[0], usrInSlices, usrOutSlices));
100 :
101 : // 从流动作
102 0 : for (u32 queIdx = 1; queIdx < queNum_; queIdx++) {
103 0 : u32 nextRank = (myRank_ + queIdx) % tempRankSize_; // 让rank和que对应上
104 0 : RankId fromRank = nextRank;
105 0 : RankId toRank = nextRank;
106 :
107 0 : const std::vector<LinkData> &linkRecv = tempLinks.at(fromRank);
108 0 : const std::vector<LinkData> &linkSend = tempLinks.at(toRank);
109 :
110 0 : std::vector<DataSlice> txSrcSlices;
111 0 : std::vector<DataSlice> txDstSlices;
112 :
113 0 : u64 txDstOffset = sliceInfoVec[myRank_][0].offset + tempAlgParams.buffInfo.scratchBuffBaseOff;
114 0 : u64 txDstSize = sliceInfoVec[myRank_][0].size;
115 0 : DataSlice txSrcSlice = usrInSlices;
116 0 : DataSlice txDstSlice = DataSlice(BufferType::SCRATCH, txDstOffset, txDstSize);
117 0 : txSrcSlices.push_back(txSrcSlice);
118 0 : txDstSlices.push_back(txDstSlice);
119 :
120 0 : std::vector<DataSlice> rxSrcSlices;
121 0 : std::vector<DataSlice> rxDstSlices;
122 0 : u64 rxDstOffset = sliceInfoVec[fromRank][0].offset + tempAlgParams.buffInfo.scratchBuffBaseOff;
123 0 : u64 rxDstSize = sliceInfoVec[fromRank][0].size;
124 0 : DataSlice rxSrcSlice = usrInSlices;
125 0 : DataSlice rxDstSlice = DataSlice(BufferType::SCRATCH, rxDstOffset, rxDstSize);
126 0 : rxSrcSlices.push_back(rxSrcSlice);
127 0 : rxDstSlices.push_back(rxDstSlice);
128 :
129 0 : TxRxLinks sendRecvLinks(linkSend[0], linkRecv[0]);
130 0 : TxRxSlicesList sendRecvSlicesList({txSrcSlices, txDstSlices}, {rxSrcSlices, rxDstSlices});
131 :
132 0 : SendRecvInfo sendRecvInfo(sendRecvLinks, sendRecvSlicesList);
133 0 : CHK_PRT_RET(SendRecv(sendRecvInfo, tempInsQues[queIdx], 0, true, DmaMode::PUT),
134 : HCCL_ERROR("[InsTempAllReduceMesh1DOneShot] RunAllReduce SendRecv failed"),
135 : HcclResult::HCCL_E_INTERNAL);
136 0 : }
137 :
138 : // semaphore sync
139 0 : if (tempVTopo_[0].size() > 1) {
140 0 : CHK_RET(PostSyncInterQueues(tempInsQues));
141 : }
142 :
143 0 : HCCL_INFO("[InsTempAllReduceMesh1DOneShot][RunAllReduce] reduce: rank[%d]", myRank_);
144 :
145 0 : for (u32 rankIdx = 0; rankIdx < tempVTopo_[0].size(); rankIdx++) {
146 0 : RankId myRank = myRank_;
147 0 : RankId curRank = rankIdx;
148 0 : if ( curRank == myRank) {
149 0 : continue;
150 : }
151 :
152 0 : u64 curSrcOffset = sliceInfoVec[curRank][0].offset + tempAlgParams.buffInfo.scratchBuffBaseOff;
153 0 : u64 curSrcSize = sliceInfoVec[curRank][0].size;
154 0 : DataSlice curSrcSlice = DataSlice(BufferType::SCRATCH, curSrcOffset, curSrcSize);
155 0 : DataSlice curDstSlice = usrOutSlices;
156 :
157 0 : CHK_RET(LocalReduce(tempInsQues[0], curSrcSlice, curDstSlice, dataType_, redOp_));
158 : }
159 :
160 0 : return HcclResult::HCCL_SUCCESS;
161 : }
162 :
163 : } // namespace Hccl
|