LCOV - code coverage report
Current view: top level - legacy/ascend950/service/collective/alg/coll_alg_factory/alg_template/ins_alg_template - ins_temp_scatter_nhr.cc (source / functions) Coverage Total Hit
Test: coverage.info Lines: 0.0 % 219 0
Test Date: 2026-08-04 10:52:23 Functions: 0.0 % 14 0

            Line data    Source code
       1              : /**
       2              :  * Copyright (c) 2025 Huawei Technologies Co., Ltd.
       3              :  * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
       4              :  * CANN Open Software License Agreement Version 2.0 (the "License").
       5              :  * Please refer to the License for details. You may not use this file except in compliance with the License.
       6              :  * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
       7              :  * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
       8              :  * See LICENSE in the root of the software repository for the full text of the License.
       9              :  */
      10              : 
      11              : #include "ins_temp_scatter_nhr.h"
      12              : #include "ins_temp_all_gather_nhr.h"
      13              : #include "alg_data_trans_wrapper.h"
      14              : #include "dev_mode.h"
      15              : #include "log.h"
      16              : 
      17              : namespace Hccl {
      18            0 : InsTempScatterNHR::InsTempScatterNHR(const RankId virtualRank, const u32 tempRankSize,
      19            0 :     const std::vector<std::vector<RankId>> &tempVTopo, const std::map<RankId, u32> &tempVirtRankMap)
      20            0 :     : InsAlgTemplateBase(virtualRank, tempRankSize, tempVTopo, tempVirtRankMap)
      21              : {
      22            0 : }
      23              : 
      24            0 : InsTempScatterNHR::~InsTempScatterNHR()
      25              : {
      26            0 : }
      27              : 
      28            0 : HcclResult InsTempScatterNHR::CalcRes(AlgTempResReq &tempResReq)
      29              : {
      30            0 :     CHK_PRT_RET(CalcResLinksNHR(myRank_, tempRankSize_, tempVTopo_, tempResReq) != HcclResult::HCCL_SUCCESS,
      31              :         HCCL_ERROR("[CollAlgFactory] [InsTempScatterNHR] Rank [%d], resLinks calculation error!", myRank_),
      32              :         HcclResult::HCCL_E_INTERNAL);
      33            0 :     auto &linkReq = tempResReq.links;
      34            0 :     u32 pathNum = 0;
      35            0 :     for (auto resReqIter = linkReq.begin(); resReqIter != linkReq.end(); resReqIter++) {
      36            0 :         auto remoteRank = resReqIter->first;
      37            0 :         if (rank2PathNumMap_.find(remoteRank) == rank2PathNumMap_.end() || rank2PathNumMap_[remoteRank] == 0) {
      38            0 :             HCCL_ERROR("[InsTempScatterNHR] No path to remoteRank[%d]", remoteRank);
      39            0 :             return HcclResult::HCCL_E_INTERNAL;
      40              :         }
      41            0 :         if (pathNum == 0) {
      42            0 :             pathNum = rank2PathNumMap_[remoteRank];
      43            0 :         } else if (rank2PathNumMap_[remoteRank] != pathNum) {
      44            0 :             HCCL_ERROR("[InsTempScatterNHR] Inconsistency pathNum to remoteRanks, Previous consistent pathNum=[%u], "
      45              :                        "mismatched "
      46              :                        "remoteRank=[%d], pathNum=[%u]",
      47              :                 pathNum, remoteRank, rank2PathNumMap_[remoteRank]);
      48            0 :             return HcclResult::HCCL_E_INTERNAL;
      49              :         }
      50            0 :         resReqIter->second = pathNum;
      51              :     }
      52              : 
      53              :     // NHR 需要的 que Num 为 1
      54            0 :     tempResReq.queNum = 1 * pathNum;
      55            0 :     HCCL_INFO("[InsTempScatterNHR] tempResReq.queNum = %u", tempResReq.queNum);
      56            0 :     tempResReq.streamNum = tempResReq.queNum;
      57            0 :     tempResReq.queNotifys = CreateMasterSlaveQueNotifiesRequest(tempResReq.queNum);
      58              : 
      59            0 :     return HcclResult::HCCL_SUCCESS;
      60              : }
      61              : 
      62            0 : uint64_t InsTempScatterNHR::GetExpandedMode() const
      63              : {
      64            0 :     return DeviceMode::AICPU;
      65              : }
      66              : 
      67            0 : HcclResult InsTempScatterNHR::PreCopy(const TemplateDataParams &templateDataParams, std::vector<InsQuePtr> &tempInsQues)
      68              : {
      69            0 :     if (u32(myRank_) != root_ || buffInfo_.inBuffType == BufferType::SCRATCH) {
      70            0 :         return HCCL_SUCCESS;
      71              :     }
      72              :     // root卡需要将发送的数据刷新为尾部数据长度,保护一下tailSize=0认为没有
      73            0 :     u64 tailSize = templateDataParams.tailSize == 0 ? templateDataParams.sliceSize : templateDataParams.tailSize;
      74            0 :     for (u32 r = 0; r < templateDataParams.repeatNum; r++) {
      75            0 :         for (u32 algRank = 0; algRank < tempRankSize_; algRank++) {
      76            0 :             u64 srcOffset = r * templateDataParams.inputRepeatStride + templateDataParams.inputSliceStride * algRank
      77            0 :                             + buffInfo_.inBuffBaseOff;
      78            0 :             DataSlice srcSlice(BufferType::INPUT, srcOffset, tailSize);
      79            0 :             u64 dstOffset = r * ((tempRankSize_ - 1) * templateDataParams.sliceSize + tailSize)
      80            0 :                             + buffInfo_.scratchBuffBaseOff + algRank * templateDataParams.sliceSize;
      81            0 :             DataSlice dstSlice(BufferType::SCRATCH, dstOffset, tailSize);
      82            0 :             LocalCopy(tempInsQues[0], srcSlice, dstSlice);
      83              :         }
      84              :     }
      85              : 
      86            0 :     return HcclResult::HCCL_SUCCESS;
      87              : }
      88              : 
      89            0 : HcclResult InsTempScatterNHR::PostCopy(const TemplateDataParams &templateDataParams, std::vector<InsQuePtr> &tempInsQues)
      90              : {
      91              :     u32 myAlgRank;
      92            0 :     GetAlgRank(myRank_, tempVTopo_[0], myAlgRank);
      93              :     // root卡需要将发送的数据刷新为尾部数据长度,保护一下tailSize=0认为没有
      94            0 :     u64 tailSize = templateDataParams.tailSize == 0 ? templateDataParams.sliceSize : templateDataParams.tailSize;
      95              :     // 支持不均匀切分的情况下需要把尾部数据放到最后一张卡上
      96            0 :     u64 sliceSize = myAlgRank == tempVTopo_[0].size() - 1 ? tailSize : templateDataParams.sliceSize;
      97              : 
      98            0 :     for (u32 r = 0; r < templateDataParams.repeatNum; r++) {
      99            0 :         u64 dstOffset = buffInfo_.outBuffBaseOff + r * templateDataParams.sliceSize;
     100            0 :         u64 srcOffset = r * ((tempRankSize_ - 1) * templateDataParams.sliceSize + tailSize)
     101            0 :                         + buffInfo_.scratchBuffBaseOff + myAlgRank * templateDataParams.sliceSize;
     102            0 :         DataSlice dstSlice(buffInfo_.outBuffType, dstOffset, sliceSize);
     103            0 :         DataSlice srcSlice(BufferType::SCRATCH, srcOffset, sliceSize);
     104            0 :         if (buffInfo_.outBuffType == BufferType::SCRATCH && srcOffset == dstOffset) {
     105            0 :             continue;
     106              :         }
     107            0 :         LocalCopy(tempInsQues[0], srcSlice, dstSlice);
     108              :     }
     109            0 :     return HcclResult::HCCL_SUCCESS;
     110              : }
     111              : 
     112            0 : HcclResult InsTempScatterNHR::RunNHR(
     113              :     TemplateDataParams &templateDataParams, ResLinks &tempLinks, std::vector<InsQuePtr> &tempInsQues) const
     114              : {
     115            0 :     u32 mainQueIdx = 0;
     116              :     // 流间前同步,主流通知从流,只有一个流则不做任何事
     117            0 :     CHK_RET(PreSyncQues(tempInsQues, mainQueIdx));
     118              : 
     119              :     // nhr主体部分
     120            0 :     u32 nSteps = GetNHRStepNum(tempRankSize_);
     121            0 :     for (u32 r = 0; r < templateDataParams.repeatNum; r++) {
     122            0 :         for (u32 step = 0; step < nSteps; step++) {
     123            0 :             AicpuNHRStepInfo stepInfo;
     124            0 :             GetStepInfo(step, nSteps, stepInfo);
     125              : 
     126              :             // 只有Tx,使用send指令
     127            0 :             if (stepInfo.txSliceIdxs.size() > 0 && stepInfo.rxSliceIdxs.size() == 0) {
     128            0 :                 CHK_RET(BatchSend(stepInfo, tempLinks, tempInsQues, templateDataParams, r));
     129              :             }
     130              :             // 只有Rx,使用recv指令
     131            0 :             else if (stepInfo.txSliceIdxs.size() == 0 && stepInfo.rxSliceIdxs.size() > 0) {
     132            0 :                 CHK_RET(BatchRecv(stepInfo, tempLinks, tempInsQues, templateDataParams, r));
     133              :             }
     134              :             // 既有Tx又有Rx,使用SendRecv指令
     135            0 :             else if (stepInfo.txSliceIdxs.size() > 0 && stepInfo.rxSliceIdxs.size() > 0) {
     136            0 :                 CHK_RET(BatchSR(stepInfo, tempLinks, tempInsQues, templateDataParams, r));
     137              :             }
     138            0 :         }
     139              :     }
     140              :     // 流间后同步,从流通知主流
     141            0 :     CHK_RET(PostSyncQues(tempInsQues, mainQueIdx));
     142            0 :     return HCCL_SUCCESS;
     143              : }
     144              : 
     145              : // 需要支持input->scratch, scratch->output, input->output
     146            0 : HcclResult InsTempScatterNHR::GenExtIns(TempFuncs &tempFuncs, TemplateDataParams &templateDataParams,
     147              :     ResLinks &tempLinks, std::vector<InsQuePtr> &tempInsQues)
     148              : {
     149            0 :     if (IsPcieLink(tempLinks)) {
     150            0 :         dmaMode_ = DmaMode::GET;
     151              :     } else {
     152            0 :         dmaMode_ = DmaMode::PUT;
     153              :     }
     154            0 :     opMode_ = tempFuncs.opMode;
     155            0 :     enableCounterNotify_ = tempFuncs.enableCounterNotify;
     156            0 :     buffInfo_ = templateDataParams.buffInfo;
     157              : 
     158            0 :     HCCL_INFO("[InsTempScatterNHR] Run start");
     159            0 :     uint32_t linkNum = tempLinks.begin()->second.size();
     160              :     // 流的数量不能少于linkNum
     161            0 :     CHK_PRT_RET(linkNum < tempInsQues.size(),
     162              :         HCCL_ERROR("[CollAlgFactory] [InsTempScatterNHR] Rank [%d], requiredQue Error.", myRank_),
     163              :         HcclResult::HCCL_E_INTERNAL);
     164              : 
     165            0 :     HCCL_INFO("[InsTempScatterNHR Run]RankID:[%d], root:[%u], isForepart:[%d], isBottom:[%d]", myRank_, root_,
     166              :         tempFuncs.isForepart, tempFuncs.isBottom);
     167            0 :     CHK_RET(PreCopy(templateDataParams, tempInsQues));
     168            0 :     CHK_RET(RunNHR(templateDataParams, tempLinks, tempInsQues));
     169            0 :     CHK_RET(PostCopy(templateDataParams, tempInsQues));
     170            0 :     return HCCL_SUCCESS;
     171              : }
     172              : 
     173            0 : u32 InsTempScatterNHR::CalcScratchMultiple(BufferType inBuffType, BufferType outBuffType) const
     174              : {
     175              :     (void)inBuffType;
     176              :     (void)outBuffType;
     177            0 :     return tempRankSize_;
     178              : }
     179              : 
     180            0 : HcclResult InsTempScatterNHR::BatchSend(AicpuNHRStepInfo &stepInfo, const ResLinks &tempLinks,
     181              :     std::vector<InsQuePtr> &tempInsQues, TemplateDataParams &templateDataParams, u32 repeat) const
     182              : {
     183            0 :     const std::vector<LinkData> &linkSend = tempLinks.at(stepInfo.toRank);
     184            0 :     u32 linkNum = rank2PathNumMap_.at(stepInfo.toRank);
     185            0 :     std::vector<float> dataSplitRate(linkNum);
     186            0 :     CHK_RET(CalcDataSplitRateForLinks(linkSend, dataSplitRate));
     187              :     // root卡需要将发送的数据刷新为尾部数据长度,保护一下tailSize=0认为没有
     188            0 :     u64 tailSize = templateDataParams.tailSize == 0 ? templateDataParams.sliceSize : templateDataParams.tailSize;
     189              : 
     190            0 :     const u32 sliceCount = stepInfo.txSliceIdxs.size();
     191            0 :     const u64 baseOffset = repeat * ((tempRankSize_ - 1) * templateDataParams.sliceSize + tailSize)
     192            0 :                            + buffInfo_.scratchBuffBaseOff;
     193            0 :     std::vector<DataSlice> srcDstSlices;
     194            0 :     srcDstSlices.reserve(sliceCount);
     195            0 :     for (u32 j = 0; j < linkNum; j++) {
     196            0 :         srcDstSlices.clear();
     197            0 :         for (u32 i = 0; i < sliceCount; i++) {
     198            0 :             u64 srcDstOffset = baseOffset + stepInfo.txSliceIdxs[i] * templateDataParams.sliceSize;
     199              :             // 发送的一定是root
     200            0 :             DataSlice srcDstSlice(templateDataParams.buffInfo.scratBuffType, srcDstOffset, tailSize);
     201            0 :             srcDstSlices.emplace_back(CalcDataSliceForLinks(srcDstSlice, dataSplitRate, j, dataType_));
     202              :         }
     203            0 :         SlicesList txSlicesList(srcDstSlices, srcDstSlices);
     204            0 :         DataInfo sendData(linkSend[j], std::move(txSlicesList));
     205            0 :         CHK_PRT_RET(Send(sendData, tempInsQues[j], 0, true, dmaMode_),
     206              :             HCCL_ERROR("[InsTempScatterNHR] BatchSend failed"), HcclResult::HCCL_E_INTERNAL);
     207            0 :     }
     208              : 
     209            0 :     return HcclResult::HCCL_SUCCESS;
     210            0 : }
     211              : 
     212            0 : HcclResult InsTempScatterNHR::BatchRecv(AicpuNHRStepInfo &stepInfo, const ResLinks &tempLinks,
     213              :     std::vector<InsQuePtr> &tempInsQues, TemplateDataParams &templateDataParams, u32 repeat) const
     214              : {
     215              :     u32 myAlgRank;
     216            0 :     GetAlgRank(myRank_, tempVTopo_[0], myAlgRank);
     217              :     // root卡需要将发送的数据刷新为尾部数据长度,保护一下tailSize=0认为没有
     218            0 :     u64 tailSize = templateDataParams.tailSize == 0 ? templateDataParams.sliceSize : templateDataParams.tailSize;
     219              :     // 支持不均匀切分的情况下需要把尾部数据放到最后一张卡上
     220            0 :     u64 sliceSize = myAlgRank == tempVTopo_[0].size() - 1 ? tailSize : templateDataParams.sliceSize;
     221            0 :     const std::vector<LinkData> &linkRecv = tempLinks.at(stepInfo.fromRank);
     222            0 :     u32 linkNum = rank2PathNumMap_.at(stepInfo.fromRank);
     223            0 :     std::vector<float> dataSplitRate(linkNum);
     224            0 :     CHK_RET(CalcDataSplitRateForLinks(linkRecv, dataSplitRate));
     225            0 :     const u32 sliceCount = stepInfo.txSliceIdxs.size();
     226            0 :     const u64 baseOffset = repeat * ((tempRankSize_ - 1) * templateDataParams.sliceSize + templateDataParams.tailSize)
     227            0 :                            + buffInfo_.scratchBuffBaseOff;
     228            0 :     std::vector<DataSlice> srcDstSlices;
     229            0 :     srcDstSlices.reserve(sliceCount);
     230              : 
     231            0 :     for (u32 j = 0; j < linkNum; j++) {
     232            0 :         srcDstSlices.clear();
     233            0 :         for (u32 i = 0; i < sliceCount; i++) {
     234            0 :             u64 srcDstOffset = baseOffset + stepInfo.rxSliceIdxs[i] * templateDataParams.sliceSize;
     235            0 :             DataSlice srcDstSlice(templateDataParams.buffInfo.scratBuffType, srcDstOffset, sliceSize);
     236            0 :             srcDstSlices.emplace_back(CalcDataSliceForLinks(srcDstSlice, dataSplitRate, j, dataType_));
     237              :         }
     238            0 :         SlicesList rxSlicesList(srcDstSlices, srcDstSlices);
     239            0 :         DataInfo recvData(linkRecv[j], std::move(rxSlicesList));
     240            0 :         CHK_PRT_RET(Recv(recvData, tempInsQues[j], 0, true, dmaMode_),
     241              :             HCCL_ERROR("[InsTempScatterNHR] BatchTxRx Recv failed"), HcclResult::HCCL_E_INTERNAL);
     242            0 :     }
     243              : 
     244            0 :     return HcclResult::HCCL_SUCCESS;
     245            0 : }
     246              : 
     247            0 : HcclResult InsTempScatterNHR::BatchSR(AicpuNHRStepInfo &stepInfo, const ResLinks &tempLinks,
     248              :     std::vector<InsQuePtr> &tempInsQues, TemplateDataParams &templateDataParams, u32 repeat) const
     249              : {
     250            0 :     const std::vector<LinkData> &linkRecv = tempLinks.at(stepInfo.fromRank);
     251            0 :     const std::vector<LinkData> &linkSend = tempLinks.at(stepInfo.toRank);
     252              : 
     253            0 :     HCCL_INFO("BatchSR(stepInfo.fromRank)=%u", stepInfo.fromRank);
     254            0 :     u32 linkNum = rank2PathNumMap_.at(stepInfo.fromRank);
     255            0 :     if (linkNum > linkRecv.size()) {
     256            0 :         HCCL_ERROR("InsTempScatterNHR::RunMesh linkNum > linkRecv.size()");
     257            0 :         return HcclResult::HCCL_E_INTERNAL;
     258              :     }
     259            0 :     std::vector<float> dataSplitRate(linkNum);
     260            0 :     CHK_RET(CalcDataSplitRateForLinks(linkRecv, dataSplitRate));
     261              : 
     262            0 :     const u32 txSliceCount = stepInfo.txSliceIdxs.size();
     263            0 :     const u32 rxSliceCount = stepInfo.rxSliceIdxs.size();
     264            0 :     std::vector<DataSlice> txSrcDstSlices;
     265            0 :     std::vector<DataSlice> rxSrcDstSlices;
     266            0 :     txSrcDstSlices.reserve(txSliceCount);
     267            0 :     rxSrcDstSlices.reserve(rxSliceCount);
     268              :     u32 myAlgRank;
     269            0 :     GetAlgRank(myRank_, tempVTopo_[0], myAlgRank);
     270              :     // root卡需要将发送的数据刷新为尾部数据长度,保护一下tailSize=0认为没有
     271            0 :     u64 tailSize = templateDataParams.tailSize == 0 ? templateDataParams.sliceSize : templateDataParams.tailSize;
     272              :     // 支持不均匀切分的情况下需要把尾部数据放到最后一张卡上
     273            0 :     u64 sliceSize = myAlgRank == tempVTopo_[0].size() - 1 ? tailSize : templateDataParams.sliceSize;
     274            0 :     const u64 baseOffset = repeat * ((tempRankSize_ - 1) * templateDataParams.sliceSize + tailSize)
     275            0 :                            + buffInfo_.scratchBuffBaseOff;
     276              : 
     277            0 :     for (u32 j = 0; j < linkNum; j++) {
     278            0 :         txSrcDstSlices.clear();
     279            0 :         rxSrcDstSlices.clear();
     280            0 :         for (u32 i = 0; i < txSliceCount; i++) {
     281            0 :             u64 srcDstOffset = baseOffset + stepInfo.txSliceIdxs[i] * templateDataParams.sliceSize;
     282            0 :             u64 sliceSize = templateDataParams.sliceSize;
     283            0 :             DataSlice txSrcDstSlice(templateDataParams.buffInfo.scratBuffType, srcDstOffset, sliceSize);
     284            0 :             txSrcDstSlices.emplace_back(CalcDataSliceForLinks(txSrcDstSlice, dataSplitRate, j, dataType_));
     285              :         }
     286            0 :         SlicesList txSlicesList(txSrcDstSlices, txSrcDstSlices);
     287            0 :         for (u32 i = 0; i < rxSliceCount; i++) {
     288            0 :             u64 srcDstOffset = baseOffset + stepInfo.rxSliceIdxs[i] * templateDataParams.sliceSize;
     289            0 :             DataSlice rxSrcDstSlice(templateDataParams.buffInfo.scratBuffType, srcDstOffset, sliceSize);
     290            0 :             rxSrcDstSlices.emplace_back(CalcDataSliceForLinks(rxSrcDstSlice, dataSplitRate, j, dataType_));
     291              :         }
     292            0 :         SlicesList rxSlicesList(rxSrcDstSlices, rxSrcDstSlices);
     293            0 :         TxRxSlicesList txRxSlicesList(std::move(txSlicesList), std::move(rxSlicesList));
     294            0 :         TxRxLinks sendRecvLinks(linkSend[j], linkRecv[j]);
     295            0 :         SendRecvInfo sendRecvInfo(sendRecvLinks, std::move(txRxSlicesList));
     296            0 :         CHK_PRT_RET(SendRecv(sendRecvInfo, tempInsQues[j], 0, true, dmaMode_),
     297              :             HCCL_ERROR("[InsTempScatterNHR] sendrecv failed (j=%u)", j), HcclResult::HCCL_E_INTERNAL);
     298            0 :     }
     299            0 :     return HcclResult::HCCL_SUCCESS;
     300            0 : }
     301              : 
     302              : // NHR每步的算法描述原理函数
     303            0 : HcclResult InsTempScatterNHR::GetStepInfo(u32 step, u32 nSteps, AicpuNHRStepInfo &stepInfo) const
     304              : {
     305            0 :     u32 rankSize = tempRankSize_;
     306              :     u32 myAlgRank;
     307              :     u32 rootAlgRank;
     308            0 :     GetAlgRank(myRank_, tempVTopo_[0], myAlgRank);
     309            0 :     GetAlgRank(root_, tempVTopo_[0], rootAlgRank);
     310            0 :     stepInfo.txSliceIdxs.clear();
     311            0 :     stepInfo.rxSliceIdxs.clear();
     312            0 :     stepInfo.nSlices = 0;
     313            0 :     stepInfo.toRank = rankSize;
     314            0 :     stepInfo.fromRank = rankSize;
     315            0 :     stepInfo.step = step;
     316            0 :     stepInfo.myRank = myRank_;
     317              : 
     318            0 :     u32 deltaRoot = (rootAlgRank + rankSize - myAlgRank) % rankSize;
     319            0 :     u32 deltaRankPair = 1 << step;
     320              : 
     321              :     // 数据份数和数据编号增量
     322            0 :     u32 nSlices = (rankSize - 1 + (1 << step)) / (1 << (step + 1));
     323            0 :     u32 deltaSliceIndex = 1 << (step + 1);
     324              : 
     325              :     // 判断是否是2的幂
     326            0 :     u32 nRanks = 0; // 本步需要进行收/发的rank数
     327            0 :     bool isPerfect = (rankSize & (rankSize - 1)) == 0;
     328            0 :     if (!isPerfect && step == nSteps - 1) {
     329            0 :         nRanks = rankSize - deltaRankPair;
     330              :     } else {
     331            0 :         nRanks = deltaRankPair;
     332              :     }
     333              : 
     334            0 :     if (deltaRoot < nRanks) { // 需要发
     335            0 :         u32 sendTo = (myAlgRank + rankSize - deltaRankPair) % rankSize;
     336            0 :         u32 txSliceIdx = sendTo;
     337            0 :         for (u32 i = 0; i < nSlices; i++) {
     338            0 :             u32 targetTxSliceIdx = txSliceIdx;
     339            0 :             stepInfo.txSliceIdxs.push_back(targetTxSliceIdx);
     340            0 :             txSliceIdx = (txSliceIdx + rankSize - deltaSliceIndex) % rankSize;
     341              :         }
     342              : 
     343            0 :         stepInfo.toRank = tempVTopo_[0][sendTo];
     344            0 :         stepInfo.nSlices = nSlices;
     345            0 :     } else if (deltaRoot >= deltaRankPair && deltaRoot < nRanks + deltaRankPair) { // 需要收
     346            0 :         u32 recvFrom = (myAlgRank + deltaRankPair) % rankSize;
     347            0 :         u32 rxSliceIdx = myAlgRank;
     348            0 :         for (u32 i = 0; i < nSlices; i++) {
     349            0 :             u32 targetRxSliceIdx = rxSliceIdx;
     350            0 :             stepInfo.rxSliceIdxs.push_back(targetRxSliceIdx);
     351            0 :             rxSliceIdx = (rxSliceIdx + rankSize - deltaSliceIndex) % rankSize;
     352              :         }
     353              : 
     354            0 :         stepInfo.fromRank = tempVTopo_[0][recvFrom];
     355            0 :         stepInfo.nSlices = nSlices;
     356              :     }
     357            0 :     return HcclResult::HCCL_SUCCESS;
     358              : }
     359              : 
     360              : } // namespace Hccl
        

Generated by: LCOV version 2.0-1