LCOV - code coverage report
Current view: top level - legacy/ascend950/service/collective/alg/coll_alg_factory/alg_ccu_context/reduce_scatter - ccu_context_reduce_scatter_mesh1d_detour.cc (source / functions) Coverage Total Hit
Test: coverage.info Lines: 0.0 % 214 0
Test Date: 2026-08-18 17:47:01 Functions: 0.0 % 5 0

            Line data    Source code
       1              : /**
       2              :  * Copyright (c) 2025 Huawei Technologies Co., Ltd.
       3              :  * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
       4              :  * CANN Open Software License Agreement Version 2.0 (the "License").
       5              :  * Please refer to the License for details. You may not use this file except in compliance with the License.
       6              :  * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
       7              :  * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
       8              :  * See LICENSE in the root of the software repository for the full text of the License.
       9              :  */
      10              : 
      11              : #include "ccu_context_reduce_scatter_mesh1d_detour.h"
      12              : #include "ccu_instruction_reduce_scatter_mesh1d_detour.h"
      13              : 
      14              : namespace Hccl {
      15              : 
      16              : constexpr int INPUT_XN_ID = 0;
      17              : constexpr int OUTPUT_XN_ID = 1;
      18              : constexpr int TOKEN_XN_ID = 2;
      19              : constexpr int CKE_IDX_0 = 0;
      20              : constexpr int CKE_IDX_1 = 1;
      21              : constexpr int CKE_IDX_2 = 2;
      22              : constexpr int CKE_IDX_3 = 3;
      23              : 
      24            0 : CcuContextReduceScatterMeshDetour1D::CcuContextReduceScatterMeshDetour1D(
      25            0 :     const CcuCtxArg& arg, const std::vector<CcuTransport*>& transports, const CcuTransportGroup& group)
      26            0 :     : CcuContextAlgBase(arg, transports, group)
      27              : {
      28            0 :     const CcuCtxArgReduceScatterMeshDetour1D* ctxArg = dynamic_cast<const CcuCtxArgReduceScatterMeshDetour1D*>(&arg);
      29            0 :     if (ctxArg == nullptr) {
      30            0 :         THROW<NullPtrException>(StringFormat("CcuContextReduceScatterMeshDetour1D::ctxArg ptr is null"));
      31              :     }
      32            0 :     rankId_ = ctxArg->rankId_;
      33            0 :     rankSize_ = ctxArg->dimSize_[0];
      34            0 :     dataType_ = ctxArg->op_.dataType;
      35            0 :     outputDataType_ = ctxArg->op_.outputDataType;
      36            0 :     if (outputDataType_ == DataType::INVALID) {
      37            0 :         outputDataType_ = dataType_;
      38            0 :         HCCL_INFO(
      39              :             "[CcuContextReduceScatterMeshDetour1D] outputDataType is [INVALID], set outputDataType to[%s]",
      40              :             outputDataType_.Describe().c_str());
      41              :     }
      42            0 :     reduceOp_ = ctxArg->op_.reduceOp;
      43            0 :     singleTransportSize_ = ctxArg->singleTransportSize_;
      44            0 :     detourPathNum_ = ctxArg->detourPathNum_;
      45            0 :     pathNumPerPeer_ = ctxArg->pathNumPerPeer_;
      46            0 :     HCCL_INFO(
      47              :         "[CcuContextReduceScatterMeshDetour1D] Init, CtxArgs are rankId[%u], rankSize[%u], dataType[%s], "
      48              :         "outputDataType[%s], reduceOp[%s]",
      49              :         rankId_, rankSize_, dataType_.Describe().c_str(), outputDataType_.Describe().c_str(),
      50              :         reduceOp_.Describe().c_str());
      51            0 :     if (transports.size() == 0 || transports.size() < rankSize_ - 1) {
      52            0 :         THROW<NullPtrException>(
      53            0 :             StringFormat("CcuContextReduceScatterMeshDetour1D transports is empty or size is less"));
      54              :     }
      55            0 :     HCCL_INFO("[CcuContextReduceScatterMeshDetour1D] transport.size[%zu]", transports.size());
      56            0 :     for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
      57              :         // 到每个对端有pathNum个transport,故detourTransport中共有pathNum组
      58            0 :         detourTransports_.emplace_back(std::vector<CcuTransport*>());
      59              :     }
      60            0 :     uint64_t directPathNum = pathNumPerPeer_ - detourPathNum_;
      61            0 :     for (uint64_t i = 0; i < directPathNum; i++) {
      62              :         // 有pathNum-detourPathNum组的直连链路,每组重复
      63            0 :         for (uint32_t j = 0; j < rankSize_ - 1; j++) {
      64            0 :             detourTransports_[i].emplace_back(transports[j]);
      65              :         }
      66            0 :         HCCL_INFO(
      67              :             "[CcuContextReduceScatterMeshDetour1D] Add directTransports[%llu], size[%zu]", i,
      68              :             detourTransports_[i].size());
      69              :     }
      70            0 :     for (uint32_t i = 0; i < detourPathNum_; i++) {
      71            0 :         for (uint32_t j = 0; j < rankSize_ - 1; j++) {
      72            0 :             detourTransports_[i + directPathNum].emplace_back(transports[(i + 1) * (rankSize_ - 1) + j]);
      73            0 :             detourTransports_[i + directPathNum].emplace_back(
      74            0 :                 transports[(i + 1) * (rankSize_ - 1) + j + detourPathNum_ * (rankSize_ - 1)]);
      75            0 :             HCCL_INFO(
      76              :                 "detourTransports_ emplace_back sendLink[%u], recvLink[%u]", (i + 1) * (rankSize_ - 1) + j,
      77              :                 (i + 1) * (rankSize_ - 1) + j + detourPathNum_ * (rankSize_ - 1));
      78              :         }
      79              :     }
      80            0 : }
      81              : 
      82            0 : void CcuContextReduceScatterMeshDetour1D::CreateMultiOpReduceDetour(
      83              :     DataType& dataType, DataType& outputDataType, ReduceOp& opType)
      84              : {
      85            0 :     moConfig.loopCount = CcuRep::CCU_MS_DEFAULT_LOOP_COUNT;
      86            0 :     moConfig.msInterleave = pathNumPerPeer_ * rankSize_;
      87            0 :     if (moRes.executor.size() == 0) {
      88            0 :         moRes.executor = CreateBlockExecutor(moConfig.loopCount);
      89            0 :         moRes.maskSignal = CreateBlockMaskSignal(moConfig.loopCount);
      90            0 :         moRes.ccuBuffer = CreateBlockCcuBuffer(moConfig.loopCount * moConfig.msInterleave);
      91              :     }
      92            0 :     std::string loopType = "reduceDetour";
      93            0 :     if (registeredLoop.find(loopType) != registeredLoop.end()) {
      94            0 :         return;
      95              :     }
      96            0 :     CcuRep::LoopBlock lb(this, loopType + "_loop");
      97              :     {
      98              :         // loopblock的形参
      99            0 :         std::vector<CcuRep::Memory> src;
     100            0 :         std::vector<CcuRep::Memory> dst;
     101            0 :         std::vector<CcuRep::Variable> lengths;
     102            0 :         for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     103            0 :             lengths.emplace_back(CreateVariable());
     104            0 :             dst.emplace_back(CreateMemory());
     105            0 :             for (uint32_t j = 0; j < rankSize_; j++) {
     106            0 :                 src.emplace_back(CreateMemory());
     107              :             }
     108              :         }
     109              : 
     110            0 :         lb(src, dst, lengths);
     111            0 :         std::vector<std::vector<CcuRep::CcuBuffer>> bufs;
     112            0 :         bufs.resize(pathNumPerPeer_);
     113            0 :         std::vector<CcuRep::MaskSignal> sems;
     114              : 
     115            0 :         for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     116            0 :             for (uint32_t j = 0; j < rankSize_; j++) {
     117            0 :                 bufs[i].emplace_back(moRes.ccuBuffer[i * rankSize_ + j]);
     118              :             }
     119            0 :             sems.emplace_back(moRes.maskSignal[i]);
     120              :         }
     121              : 
     122              :         // 先读远端直连的到本地MS
     123            0 :         uint64_t directPathNum = pathNumPerPeer_ - detourPathNum_;
     124            0 :         for (uint32_t i = 0; i < directPathNum; i++) {
     125            0 :             for (uint32_t j = 0; j < detourTransports_[i].size(); j++) {
     126            0 :                 if (detourTransports_[i][j] == nullptr) {
     127            0 :                     THROW<CcuApiException>("transport is nullptr");
     128              :                 }
     129            0 :                 Read(*detourTransports_[i][j], bufs[i][j], src[i * rankSize_ + j], lengths[i], sems[i], 1 << j);
     130              :             }
     131              :         }
     132              :         // 再读远端绕路的到本地MS
     133            0 :         for (uint32_t i = directPathNum; i < pathNumPerPeer_; i++) {
     134            0 :             for (uint32_t j = 0; j < rankSize_ - 1; j++) {
     135            0 :                 if (detourTransports_[i][j * 2 + 1] == nullptr) { // j * 2 + 1是recvOnly Link
     136            0 :                     THROW<CcuApiException>("transport is nullptr");
     137              :                 }
     138            0 :                 Read(*detourTransports_[i][j * 2 + 1], bufs[i][j], src[i * rankSize_ + j], lengths[i], sems[i], 1 << j);
     139              :             }
     140              :         }
     141              : 
     142            0 :         for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     143            0 :             LocalCopy(
     144            0 :                 bufs[i][rankSize_ - 1], src[i * rankSize_ + rankSize_ - 1], lengths[i], sems[i], 1 << (rankSize_ - 1));
     145              :         }
     146            0 :         for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     147            0 :             LocalWait(sems[i], (1 << rankSize_) - 1);
     148              :         }
     149            0 :         if (rankSize_ > 1) {
     150            0 :             for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     151            0 :                 LocalReduce(bufs[i], rankSize_, dataType, outputDataType, opType, sems[i], lengths[i]);
     152            0 :                 LocalWait(sems[i]);
     153              :             }
     154              :         }
     155            0 :         for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     156            0 :             LocalCopy(dst[i], bufs[i][0], lengths[i], sems[i]);
     157            0 :             LocalWait(sems[i]);
     158              :         }
     159            0 :     }
     160            0 :     registeredLoop.insert(loopType);
     161            0 :     return;
     162            0 : }
     163              : 
     164            0 : void CcuContextReduceScatterMeshDetour1D::GroupReduceDetour(
     165              :     std::vector<CcuRep::Memory>& src, std::vector<CcuRep::Memory>& dst, DataType& dataType, DataType& outputDataType,
     166              :     ReduceOp& opType)
     167              : {
     168            0 :     CreateMultiOpReduceDetour(dataType, outputDataType, opType);
     169            0 :     uint32_t interLeave = 8;
     170              : 
     171            0 :     CCU_IF(iterNum_ != 0)
     172              :     {
     173            0 :         CcuRep::Variable loopParam = CreateVariable();
     174            0 :         CcuRep::Variable paraCfg = CreateVariable();
     175            0 :         CcuRep::Variable offsetCfg = CreateVariable();
     176              : 
     177            0 :         loopParam = CcuRep::GetLoopParam(
     178            0 :             0, singleTransportSize_ * moConfig.loopCount, 0); // 下次迭代的偏移是单次总搬运量*loopNum
     179            0 :         loopParam += iterNum_;                                // 加上loop的迭代次数构成完整loop参数
     180            0 :         paraCfg = CcuRep::GetParallelParam(moConfig.loopCount - 1, 0, 1); // loop固定展开到128个
     181            0 :         offsetCfg = CcuRep::GetOffsetParam(singleTransportSize_, interLeave, pathNumPerPeer_); // 下一个loop偏移量
     182            0 :         auto lc = Loop("reduceDetour_loop")(src, dst, lengths_);
     183            0 :         LoopGroup({lc}, {loopParam}, paraCfg, offsetCfg);
     184            0 :     }
     185            0 :     return;
     186            0 : }
     187              : 
     188            0 : void CcuContextReduceScatterMeshDetour1D::Algorithm()
     189              : {
     190            0 :     HCCL_INFO("[CcuContextReduceScatterMeshDetour1D] ReduceScatterMeshDetour1D run");
     191            0 :     uint16_t selfBit = 1 << rankId_;
     192            0 :     uint16_t allBit = ((1 << rankSize_) - 1) & (~(1 << rankId_));
     193            0 :     output_.push_back(CreateVariable());
     194              :     // 初始化资源
     195            0 :     uint16_t transportIdx = 0;
     196              :     // 按照rank号从小到大遍历transports,遇到本rank就填充本地资源,否则依次取远端资源,要求给框架返回的Link同样是按顺序排列的
     197            0 :     for (uint64_t peerId = 0; peerId < rankSize_; peerId++) {
     198            0 :         if (peerId == rankId_) {
     199            0 :             input_.push_back(CreateVariable());
     200            0 :             token_.push_back(CreateVariable());
     201              :         } else {
     202            0 :             HCCL_INFO(
     203              :                 "[CcuContextReduceScatterMeshDetour1D] MyRank[%u], PeerId[%llu], TransportId[%u]", rankId_, peerId,
     204              :                 transportIdx);
     205            0 :             CHK_PRT_RET(
     206              :                 detourTransports_[0][transportIdx] == nullptr,
     207              :                 HCCL_ERROR("[CcuContextReduceScatterMeshDetour1D] Algorithm transport ptr is null"), );
     208            0 :             input_.push_back(CreateVariable((*detourTransports_[0][transportIdx]), INPUT_XN_ID));
     209            0 :             token_.push_back(CreateVariable((*detourTransports_[0][transportIdx]), TOKEN_XN_ID));
     210            0 :             transportIdx++;
     211              :         }
     212              :     }
     213            0 :     offset_ = CreateVariable();
     214            0 :     iterNum_ = CreateVariable();
     215            0 :     tailOffset_ = CreateVariable();
     216            0 :     tailSize_ = CreateVariable();
     217            0 :     groupOpSize_ = CreateGroupOpSize();
     218            0 :     for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     219            0 :         lengths_.emplace_back(CreateVariable());
     220              :     }
     221              : 
     222            0 :     Load(input_[rankId_]);
     223            0 :     Load(output_[0]);
     224            0 :     Load(token_[rankId_]);
     225            0 :     Load(offset_);
     226            0 :     Load(iterNum_);
     227            0 :     Load(tailOffset_);
     228            0 :     Load(tailSize_);
     229            0 :     Load(groupOpSize_);
     230            0 :     for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     231            0 :         Load(lengths_[i]);
     232              :     }
     233              : 
     234            0 :     for (auto& t : detourTransports_[0]) {
     235            0 :         WriteVariableWithSignal(*t, input_[rankId_], INPUT_XN_ID, CKE_IDX_1, selfBit);
     236            0 :         WriteVariableWithSignal(*t, token_[rankId_], TOKEN_XN_ID, CKE_IDX_3, selfBit);
     237              :     }
     238              : 
     239            0 :     GroupWait(*transportGroup, CKE_IDX_1, allBit);
     240            0 :     GroupWait(*transportGroup, CKE_IDX_3, allBit);
     241              :     // 如果是4p*2场景,template里可以都传4k进来,transport和length通过<直连4k>, <直连4k>,
     242              :     // <绕路4k>这样构造达成数据量2:1的效果
     243              : 
     244            0 :     std::vector<CcuRep::Memory> reduceSrc;
     245            0 :     std::vector<CcuRep::Memory> reduceDst;
     246              : 
     247              :     // 为每个直连或绕路transport分别准备reduceSrc与reduceDst
     248            0 :     for (uint32_t i = 0; i < pathNumPerPeer_; i++) {
     249            0 :         reduceDst.emplace_back(CreateMemory());
     250            0 :         for (uint32_t j = 0; j < rankSize_; j++) {
     251            0 :             reduceSrc.emplace_back(CreateMemory());
     252              :         }
     253              :     }
     254              : 
     255              :     // reduceDst填充
     256            0 :     reduceDst[0].addr = output_[0];
     257              :     // reduceDst[0].addr += offset_;
     258            0 :     reduceDst[0].token = token_[rankId_];
     259            0 :     for (uint32_t i = 1; i < pathNumPerPeer_; i++) {
     260            0 :         reduceDst[i].addr = reduceDst[i - 1].addr + lengths_[i - 1];
     261            0 :         reduceDst[i].token = token_[rankId_];
     262              :     }
     263              :     // 直连transport的reduceSrc填充
     264            0 :     uint32_t srcId = 0;
     265            0 :     uint32_t curId = 0;
     266            0 :     for (uint32_t rankIdx = 0; rankIdx < rankSize_; rankIdx++) {
     267            0 :         if (rankIdx != rankId_) {
     268            0 :             curId = srcId;
     269            0 :             srcId++;
     270              :         } else {
     271            0 :             curId = rankSize_ - 1;
     272              :         }
     273            0 :         reduceSrc[curId].addr = input_[rankIdx];
     274            0 :         reduceSrc[curId].token = token_[rankIdx];
     275            0 :         reduceSrc[curId].addr += offset_;
     276              :     }
     277              :     // 绕路transport的reduceSrc相比直连src再做偏移
     278            0 :     for (uint32_t i = 1; i < pathNumPerPeer_; i++) {
     279            0 :         for (uint32_t j = 0; j < rankSize_; j++) {
     280            0 :             reduceSrc[i * rankSize_ + j].addr = reduceSrc[(i - 1) * rankSize_ + j].addr + lengths_[i - 1];
     281            0 :             reduceSrc[i * rankSize_ + j].token = reduceSrc[(i - 1) * rankSize_ + j].token;
     282              :         }
     283              :     }
     284              : 
     285            0 :     GroupReduceDetour(reduceSrc, reduceDst, dataType_, outputDataType_, reduceOp_);
     286              : 
     287              :     // 余下的尾块用直连Reduce
     288            0 :     std::vector<CcuRep::Memory> tailSrc;
     289            0 :     CcuRep::Memory tailDst = CreateMemory();
     290            0 :     for (uint32_t i = 0; i < rankSize_; i++) {
     291            0 :         tailSrc.emplace_back(CreateMemory());
     292              :     }
     293            0 :     tailDst.addr = output_[0];
     294              :     // tailDst.addr += offset_;
     295            0 :     tailDst.addr += tailOffset_;
     296            0 :     tailDst.token = token_[rankId_];
     297            0 :     srcId = 0;
     298            0 :     curId = 0;
     299            0 :     for (uint32_t rankIdx = 0; rankIdx < rankSize_; rankIdx++) {
     300            0 :         if (rankIdx != rankId_) {
     301            0 :             curId = srcId;
     302            0 :             srcId++;
     303              :         } else {
     304            0 :             curId = rankSize_ - 1;
     305              :         }
     306            0 :         tailSrc[curId].addr = input_[rankIdx];
     307            0 :         tailSrc[curId].addr += offset_;
     308            0 :         tailSrc[curId].addr += tailOffset_;
     309            0 :         tailSrc[curId].token = token_[rankIdx];
     310              :     }
     311              : 
     312            0 :     GroupReduce(detourTransports_[0], tailDst, tailSrc, groupOpSize_, dataType_, outputDataType_, reduceOp_);
     313              : 
     314            0 :     for (auto t : detourTransports_[0]) {
     315            0 :         RemotePost(*t, CKE_IDX_0, selfBit);
     316              :     }
     317            0 :     GroupWait(*transportGroup, CKE_IDX_0, allBit);
     318              : 
     319            0 :     HCCL_INFO("[CcuContextReduceScatterMeshDetour1D] ReduceScatterMeshDetour1D end");
     320            0 :     return;
     321            0 : }
     322              : 
     323            0 : std::vector<uint64_t> CcuContextReduceScatterMeshDetour1D::GeneArgs(const CcuTaskArg& arg)
     324              : {
     325            0 :     const CcuTaskArgReduceScatterMeshDetour1D* taskArg = dynamic_cast<const CcuTaskArgReduceScatterMeshDetour1D*>(&arg);
     326            0 :     if (taskArg == nullptr) {
     327            0 :         THROW<NullPtrException>(StringFormat("CcuContextReduceScatterMeshDetour1D::taskArg ptr is null"));
     328              :     }
     329            0 :     uint64_t inputAddr = taskArg->inputAddr_;
     330            0 :     uint64_t outputAddr = taskArg->outputAddr_;
     331            0 :     uint64_t tokenInfo = taskArg->token_;
     332            0 :     uint64_t offset = taskArg->offset_;
     333            0 :     uint64_t iterNum = taskArg->iterNum_;
     334            0 :     uint64_t tailOffset = taskArg->tailOffset_;
     335            0 :     uint64_t tailSize = taskArg->tailSize_;
     336            0 :     auto goSize = CalGoSize(tailSize); // ***
     337              : 
     338            0 :     HCCL_INFO(
     339              :         "[CcuContextReduceScatterMeshDetour1D] GeneArgs, taskArg are inputAddr[%llu], outputAddr[%llu], "
     340              :         "offset[%llu], iterNum[%llu], tailOffset[%llu], tailSize[%llu]",
     341              :         inputAddr, outputAddr, offset, iterNum, tailOffset, tailSize);
     342              :     std::vector<uint64_t> sqeArgs = {inputAddr, outputAddr, tokenInfo, offset,    iterNum,  tailOffset,
     343            0 :                                      tailSize,  goSize[0],  goSize[1], goSize[2], goSize[3]};
     344            0 :     for (auto len : taskArg->lengths_) {
     345            0 :         HCCL_INFO("get lengths");
     346            0 :         sqeArgs.emplace_back(len);
     347              :     }
     348            0 :     return sqeArgs;
     349            0 : }
     350              : 
     351              : } // namespace Hccl
        

Generated by: LCOV version 2.0-1