LCOV - code coverage report
Current view: top level - legacy/ascend950/service/collective/alg/coll_alg_factory/alg_template/ins_alg_template - ins_temp_all_gather_nhr.cc (source / functions) Coverage Total Hit
Test: coverage.info Lines: 0.0 % 158 0
Test Date: 2026-07-28 12:11:00 Functions: 0.0 % 11 0

            Line data    Source code
       1              : /**
       2              :  * Copyright (c) 2025 Huawei Technologies Co., Ltd.
       3              :  * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
       4              :  * CANN Open Software License Agreement Version 2.0 (the "License").
       5              :  * Please refer to the License for details. You may not use this file except in compliance with the License.
       6              :  * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
       7              :  * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
       8              :  * See LICENSE in the root of the software repository for the full text of the License.
       9              :  */
      10              : 
      11              : #include "log.h"
      12              : 
      13              : #include "alg_data_trans_wrapper.h"
      14              : #include "ins_alg_template/ins_temp_all_gather_nhr.h"
      15              : 
      16              : namespace Hccl {
      17            0 : InsTempAllGatherNHR::InsTempAllGatherNHR(const RankId virtualRank, const u32 tempRankSize,
      18            0 :     const std::vector<std::vector<RankId>> &tempVTopo, const std::map<RankId, u32> &tempVirtRankMap)
      19            0 :     : InsAlgTemplateBase(virtualRank, tempRankSize, tempVTopo, tempVirtRankMap)
      20              : {
      21            0 : }
      22              : 
      23            0 : InsTempAllGatherNHR::~InsTempAllGatherNHR()
      24              : {
      25            0 : }
      26              : 
      27            0 : HcclResult InsTempAllGatherNHR::CalcRes(AlgTempResReq &tempResReq)
      28              : {
      29            0 :     CHK_PRT_RET(CalcResLinksNHR(myRank_, tempRankSize_, tempVTopo_, tempResReq) != HcclResult::HCCL_SUCCESS,
      30              :         HCCL_ERROR("[CollAlgFactory] [InsTempAllGatherNHR] Rank [%d], resLinks calculation error!", myRank_),
      31              :         HcclResult::HCCL_E_INTERNAL);
      32            0 :     auto &linkReq = tempResReq.links;
      33            0 :     u32 pathNum = 0;
      34            0 :     for (auto resReqIter = linkReq.begin(); resReqIter != linkReq.end(); resReqIter++) {
      35            0 :         auto remoteRank = resReqIter->first;
      36            0 :         if (rank2PathNumMap_.find(remoteRank) == rank2PathNumMap_.end() || rank2PathNumMap_[remoteRank] == 0) {
      37            0 :             HCCL_ERROR("[InsTempAllGatherNHR] No path to remoteRank[%d]", remoteRank);
      38            0 :             return HcclResult::HCCL_E_INTERNAL;
      39              :         }
      40            0 :         if (pathNum == 0) {
      41            0 :             pathNum = rank2PathNumMap_[remoteRank];
      42            0 :         } else if (rank2PathNumMap_[remoteRank] != pathNum) {
      43            0 :             HCCL_ERROR("[InsTempAllGatherNHR] Inconsistency pathNum to remoteRanks, Previous consistent pathNum=[%u], "
      44              :                        "mismatched "
      45              :                        "remoteRank=[%d], pathNum=[%u]",
      46              :                 pathNum, remoteRank, rank2PathNumMap_[remoteRank]);
      47            0 :             return HcclResult::HCCL_E_INTERNAL;
      48              :         }
      49            0 :         resReqIter->second = pathNum;
      50              :     }
      51              : 
      52              :     // NHR 需要的 que Num 为 1
      53            0 :     tempResReq.queNum = 1 * pathNum;
      54            0 :     HCCL_INFO("[InsTempAllGatherNHR] tempResReq.queNum = %u", tempResReq.queNum);
      55            0 :     tempResReq.streamNum = tempResReq.queNum;
      56            0 :     tempResReq.queNotifys = CreateMasterSlaveQueNotifiesRequest(tempResReq.queNum);
      57              : 
      58            0 :     return HcclResult::HCCL_SUCCESS;
      59              : }
      60              : 
      61            0 : HcclResult InsTempAllGatherNHR::CalcSliceInfo(
      62              :     const AllignInfo &allignInfo, const u64 dataSize, RankSliceInfo &sliceInfoVec)
      63              : {
      64            0 :     std::vector<SliceInfo> tmp(tempVTopo_.size());
      65            0 :     sliceInfoVec.resize(tempRankSize_, tmp);
      66              : 
      67            0 :     CHK_RET(CalcRsAgSliceInfoNHR(myRank_, tempRankSize_, allignInfo, dataSize, sliceInfoVec));
      68              : 
      69            0 :     return HcclResult::HCCL_SUCCESS;
      70            0 : }
      71              : 
      72            0 : HcclResult InsTempAllGatherNHR::GenExtIns(const TempFuncs &tempFuncs, const TemplateDataParams &tempAlgParams,
      73              :     const ResLinks &tempLinks, std::vector<InsQuePtr> &tempInsQues)
      74              : {
      75            0 :     if (IsPcieLink(tempLinks)) {
      76            0 :         dmaMode_ = DmaMode::GET;
      77              :     }
      78            0 :     opMode_ = tempFuncs.opMode;
      79            0 :     tempAlgParams_ = tempAlgParams;
      80            0 :     tempLinks_ = tempLinks;
      81              : 
      82            0 :     uint32_t linkNum = tempLinks.begin()->second.size();
      83              :     // 流的数量不能少于linkNum
      84            0 :     CHK_PRT_RET(linkNum > tempInsQues.size(),
      85              :         HCCL_ERROR("[CollAlgFactory] [InsTempAllReduceNHR] Rank [%d], requiredQue Error.", myRank_),
      86              :         HcclResult::HCCL_E_INTERNAL);
      87            0 :     CHK_RET(LocalDataCopy(tempInsQues));
      88            0 :     CHK_RET(RunNHR(tempInsQues));
      89            0 :     CHK_RET(PostLocalCopy(tempInsQues));
      90              : 
      91            0 :     return HcclResult::HCCL_SUCCESS;
      92              : }
      93              : 
      94            0 : HcclResult InsTempAllGatherNHR::GetStepInfo(u32 step, u32 nSteps, AicpuNHRStepInfo &stepInfo)
      95              : {
      96            0 :     u32 rankIdx = 0;
      97            0 :     CHK_RET(GetAlgRank(myRank_, tempVTopo_[0], rankIdx));
      98            0 :     stepInfo.txSliceIdxs.clear();
      99            0 :     stepInfo.rxSliceIdxs.clear();
     100            0 :     stepInfo.step = step;
     101            0 :     stepInfo.myRank = rankIdx;
     102              : 
     103              :     // 计算通信对象
     104            0 :     u32 deltaRank = 1 << (nSteps - 1 - step);
     105            0 :     u32 recvFrom = (rankIdx + tempRankSize_ - deltaRank) % tempRankSize_;
     106            0 :     u32 sendTo = (rankIdx + deltaRank) % tempRankSize_;
     107              : 
     108              :     // 数据份数和数据编号增量
     109            0 :     u32 nSlices = (tempRankSize_ - 1 + (1 << (nSteps - 1 - step))) / (1 << (nSteps - step));
     110            0 :     u32 deltaSliceIndex = 1 << (nSteps - step);
     111            0 :     u32 txSliceIdx = rankIdx;
     112            0 :     u32 rxSliceIdx = (rankIdx - (1 << (nSteps - 1 - step)) + tempRankSize_) % tempRankSize_;
     113              : 
     114            0 :     stepInfo.nSlices = nSlices;
     115            0 :     stepInfo.toRank = sendTo;
     116            0 :     stepInfo.fromRank = recvFrom;
     117              : 
     118            0 :     for (u32 i = 0; i < nSlices; i++) {
     119            0 :         stepInfo.txSliceIdxs.push_back(txSliceIdx);
     120            0 :         stepInfo.rxSliceIdxs.push_back(rxSliceIdx);
     121            0 :         HCCL_DEBUG("[AllGatherNHR][GetStepInfo] i[%u] txSliceIdx[%u] rxSliceIdx[%u]", i, txSliceIdx, rxSliceIdx);
     122              : 
     123            0 :         txSliceIdx = (txSliceIdx + tempRankSize_ - deltaSliceIndex) % tempRankSize_;
     124            0 :         rxSliceIdx = (rxSliceIdx + tempRankSize_ - deltaSliceIndex) % tempRankSize_;
     125              :     }
     126            0 :     return HcclResult::HCCL_SUCCESS;
     127              : }
     128              : 
     129            0 : RankId InsTempAllGatherNHR::GetRankFromMap(const u32 rankIdx)
     130              : {
     131            0 :     return tempVTopo_[0].at(rankIdx);
     132              : }
     133              : 
     134            0 : HcclResult InsTempAllGatherNHR::LocalDataCopy(std::vector<InsQuePtr> &tempInsQues)
     135              : {
     136            0 :     u32 algRankIdx = 0;
     137            0 :     CHK_RET(GetAlgRank(myRank_, tempVTopo_[0], algRankIdx));
     138              :     // 做个保护,tailSize填写为0就认为尾块是正常块
     139            0 :     u64 tailSize = (tempAlgParams_.tailSize == 0) ? tempAlgParams_.sliceSize : tempAlgParams_.tailSize;
     140            0 :     u64 sliceSize = (algRankIdx == tempRankSize_ - 1) ? tailSize : tempAlgParams_.sliceSize;
     141            0 :     for (u64 rpt = 0; rpt < tempAlgParams_.repeatNum; ++rpt) {
     142            0 :         const u64 inBaseOff = tempAlgParams_.buffInfo.inBuffBaseOff + rpt * tempAlgParams_.inputRepeatStride;
     143            0 :         const u64 scratchBase = tempAlgParams_.buffInfo.scratchBuffBaseOff
     144            0 :                                 + rpt * (tempAlgParams_.sliceSize * (tempRankSize_ - 1) + tailSize);
     145              : 
     146            0 :         const u64 inOff = tempAlgParams_.inputSliceStride * algRankIdx + inBaseOff;
     147            0 :         const u64 scOff = scratchBase + tempAlgParams_.sliceSize * algRankIdx;
     148              : 
     149            0 :         DataSlice src(tempAlgParams_.buffInfo.inBuffType, inOff, sliceSize);
     150            0 :         DataSlice dst(tempAlgParams_.buffInfo.scratBuffType, scOff, sliceSize);
     151              : 
     152            0 :         auto ins = std::make_unique<InsLocalCopy>(src, dst);
     153            0 :         tempInsQues[0]->Append(std::move(ins));
     154            0 :     }
     155            0 :     return HcclResult::HCCL_SUCCESS;
     156              : }
     157              : 
     158            0 : HcclResult InsTempAllGatherNHR::PostLocalCopy(std::vector<InsQuePtr> &tempInsQues)
     159              : {
     160            0 :     CHK_PRT_RET(
     161              :         tempInsQues.empty(), HCCL_ERROR("[AllGatherNHR][PostLocalCopy] empty queue"), HcclResult::HCCL_E_INTERNAL);
     162            0 :     CHK_PTR_NULL(tempInsQues[0]);
     163              :     // 做个保护,tailSize填写为0就认为尾块是正常块
     164            0 :     u64 tailSize = (tempAlgParams_.tailSize == 0) ? tempAlgParams_.sliceSize : tempAlgParams_.tailSize;
     165            0 :     for (u64 rpt = 0; rpt < tempAlgParams_.repeatNum; ++rpt) {
     166            0 :         const u64 outBaseOff = tempAlgParams_.buffInfo.outBuffBaseOff + rpt * tempAlgParams_.outputRepeatStride;
     167            0 :         const u64 scratchBase = tempAlgParams_.buffInfo.scratchBuffBaseOff
     168            0 :                                 + rpt * (tempAlgParams_.sliceSize * (tempRankSize_ - 1) + tailSize);
     169              : 
     170            0 :         for (u32 algIdx = 0; algIdx < tempRankSize_; ++algIdx) {
     171            0 :             const u64 scratchOffset = scratchBase + tempAlgParams_.sliceSize * algIdx;
     172            0 :             const u64 outOffset = tempAlgParams_.outputSliceStride * algIdx + outBaseOff;
     173              :             // 如果是最后一张卡需要用尾部数据计算
     174            0 :             u64 sliceSize = (algIdx == tempRankSize_ - 1) ? tailSize : tempAlgParams_.sliceSize;
     175            0 :             DataSlice src(tempAlgParams_.buffInfo.scratBuffType, scratchOffset, sliceSize);
     176            0 :             DataSlice dst(tempAlgParams_.buffInfo.outBuffType, outOffset, sliceSize);
     177              : 
     178            0 :             auto ins = std::make_unique<InsLocalCopy>(src, dst);
     179            0 :             tempInsQues[0]->Append(std::move(ins));
     180            0 :         }
     181              :     }
     182            0 :     return HcclResult::HCCL_SUCCESS;
     183              : }
     184              : 
     185            0 : HcclResult InsTempAllGatherNHR::RunNHR(std::vector<InsQuePtr> &tempInsQues)
     186              : {
     187            0 :     u32 mainQueIdx = 0;
     188              :     // 流间前同步,主流通知从流,只有一个流则不做任何事
     189            0 :     CHK_RET(PreSyncQues(tempInsQues, mainQueIdx));
     190            0 :     const u32 nSteps = GetNHRStepNum(tempRankSize_);
     191            0 :     u32 myAlgRank = 0;
     192            0 :     CHK_RET(GetAlgRank(myRank_, tempVTopo_[0], myAlgRank));
     193              :     // 做个保护,tailSize填写为0就认为尾块是正常块
     194            0 :     u64 tailSize = (tempAlgParams_.tailSize == 0) ? tempAlgParams_.sliceSize : tempAlgParams_.tailSize;
     195            0 :     for (u32 step = 0; step < nSteps; ++step) {
     196            0 :         AicpuNHRStepInfo stepInfo;
     197            0 :         CHK_RET(GetStepInfo(step, nSteps, stepInfo));
     198            0 :         const std::vector<LinkData> &linkRecv = tempLinks_.at(GetRankFromMap(stepInfo.fromRank));
     199            0 :         const std::vector<LinkData> &linkSend = tempLinks_.at(GetRankFromMap(stepInfo.toRank));
     200            0 :         HCCL_DEBUG(
     201              :             "[InsTempAllGatherNHR] rank[%d] rankSize[%u] recvFrom[%u] sendTo[%u] step[%u] nSteps[%u] nSlices[%u]",
     202              :             myRank_, tempRankSize_, stepInfo.fromRank, stepInfo.toRank, step, nSteps, stepInfo.nSlices);
     203            0 :         if (linkRecv.size() != linkSend.size()) {
     204            0 :             HCCL_ERROR("linkRecv.size()!=linkSend.size()");
     205            0 :             return HcclResult::HCCL_E_INTERNAL;
     206              :         }
     207            0 :         HCCL_INFO("GetRankFromMap(stepInfo.fromRank)=%d", GetRankFromMap(stepInfo.fromRank));
     208            0 :         u32 linkNum = rank2PathNumMap_.at(GetRankFromMap(stepInfo.fromRank));
     209            0 :         if (linkNum != linkRecv.size()) {
     210            0 :             HCCL_ERROR("InsTempAllGatherMesh1D::RunMesh linkNum != linkRecv.size()");
     211            0 :             return HcclResult::HCCL_E_INTERNAL;
     212              :         }
     213            0 :         std::vector<float> dataSplitRate(linkNum);
     214            0 :         CHK_RET(CalcDataSplitRateForLinks(
     215              :             linkRecv, dataSplitRate)); // todo, 修改CalcDataSplitRateForLinks接口,变为对每个对端分别计算
     216            0 :         for (u32 j = 0; j < linkNum; j++) {
     217            0 :             std::vector<DataSlice> txSrcSlices;
     218            0 :             std::vector<DataSlice> txDstSlices;
     219            0 :             std::vector<DataSlice> rxSrcSlices;
     220            0 :             std::vector<DataSlice> rxDstSlices;
     221            0 :             for (u32 rpt = 0; rpt < tempAlgParams_.repeatNum; ++rpt) {
     222            0 :                 const u64 scratchRepeatStride = tempAlgParams_.sliceSize * (tempRankSize_ - 1) + tailSize;
     223            0 :                 const u64 scratchBase = tempAlgParams_.buffInfo.scratchBuffBaseOff + rpt * scratchRepeatStride;
     224            0 :                 for (u32 i = 0; i < stepInfo.nSlices; ++i) {
     225            0 :                     const u32 txIdx = stepInfo.txSliceIdxs[i];
     226            0 :                     const u32 rxIdx = stepInfo.rxSliceIdxs[i];
     227            0 :                     const u64 txScratchOff = scratchBase + tempAlgParams_.sliceSize * txIdx;
     228            0 :                     const u64 rxScratchOff = scratchBase + tempAlgParams_.sliceSize * rxIdx;
     229            0 :                     u64 sliceSize = (myAlgRank == tempRankSize_ - 1) ? tailSize : tempAlgParams_.sliceSize;
     230            0 :                     DataSlice txSrcSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, txScratchOff, sliceSize);
     231            0 :                     DataSlice txDstSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, txScratchOff, sliceSize);
     232            0 :                     DataSlice rxSrcSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, rxScratchOff, sliceSize);
     233            0 :                     DataSlice rxDstSliceAllLink(tempAlgParams_.buffInfo.scratBuffType, rxScratchOff, sliceSize);
     234            0 :                     txSrcSlices.emplace_back(CalcDataSliceForLinks(txSrcSliceAllLink, dataSplitRate, j, dataType_));
     235            0 :                     txDstSlices.emplace_back(CalcDataSliceForLinks(txDstSliceAllLink, dataSplitRate, j, dataType_));
     236            0 :                     rxSrcSlices.emplace_back(CalcDataSliceForLinks(rxSrcSliceAllLink, dataSplitRate, j, dataType_));
     237            0 :                     rxDstSlices.emplace_back(CalcDataSliceForLinks(rxDstSliceAllLink, dataSplitRate, j, dataType_));
     238              :                 }
     239              :             }
     240            0 :             TxRxSlicesList sendRecvSlicesList({txSrcSlices, txDstSlices}, {rxSrcSlices, rxDstSlices});
     241            0 :             TxRxLinks sendRecvLinks(linkSend[j], linkRecv[j]);
     242            0 :             SendRecvInfo sendRecvInfo(sendRecvLinks, sendRecvSlicesList);
     243            0 :             CHK_PRT_RET(SendRecv(sendRecvInfo, tempInsQues[j], 0, true, dmaMode_),
     244              :                 HCCL_ERROR("[InsTempAllGatherNHR] sendrecv failed (step=%u)", step), HcclResult::HCCL_E_INTERNAL);
     245            0 :         }
     246            0 :     }
     247              :     // 流间后同步,从流通知主流
     248            0 :     CHK_RET(PostSyncQues(tempInsQues, mainQueIdx));
     249            0 :     return HcclResult::HCCL_SUCCESS;
     250              : }
     251              : 
     252              : } // namespace Hccl
        

Generated by: LCOV version 2.0-1