LCOV - code coverage report
Current view: top level - legacy/ascend910/algorithm/base/alg_template/temp_all_reduce - all_reduce_chunk_mesh.cc (source / functions) Coverage Total Hit
Test: coverage.info Lines: 6.1 % 196 12
Test Date: 2026-08-18 17:47:01 Functions: 30.8 % 13 4

            Line data    Source code
       1              : /**
       2              :  * Copyright (c) 2025 Huawei Technologies Co., Ltd.
       3              :  * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
       4              :  * CANN Open Software License Agreement Version 2.0 (the "License").
       5              :  * Please refer to the License for details. You may not use this file except in compliance with the License.
       6              :  * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
       7              :  * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
       8              :  * See LICENSE in the root of the software repository for the full text of the License.
       9              :  */
      10              : 
      11              : #include "alg_template_register.h"
      12              : #include "all_reduce_chunk_mesh.h"
      13              : 
      14              : namespace hccl {
      15            2 : AllReduceChunkMesh::AllReduceChunkMesh(const HcclDispatcher dispatcher) : AlgTemplateBase(dispatcher) {}
      16              : 
      17            4 : AllReduceChunkMesh::~AllReduceChunkMesh() {}
      18              : 
      19            2 : HcclResult AllReduceChunkMesh::Prepare(
      20              :     u64 reduceAttrBitMap, std::vector<Stream>& meshStreams, std::vector<std::shared_ptr<LocalNotify>>& meshSignal,
      21              :     std::vector<std::shared_ptr<LocalNotify>>& meshSignalAux, u32 interRank, u32 interRankSize, u32 userRank,
      22              :     HcomCollOpInfo* opInfo)
      23              : {
      24            2 :     reduceAttr_ = reduceAttrBitMap;
      25            2 :     localRank_ = interRank;
      26            2 :     localRankSize_ = interRankSize;
      27            2 :     userRank_ = userRank;
      28            2 :     meshStreams_ = meshStreams;
      29            2 :     meshSignal_ = &meshSignal;
      30            2 :     meshSignalAux_ = &meshSignalAux;
      31            2 :     opInfo_ = opInfo;
      32            2 :     return HCCL_SUCCESS;
      33              : }
      34            0 : HcclResult AllReduceChunkMesh::MainRecordSub()
      35              : {
      36            0 :     for (u32 signalIndex = 0; signalIndex < meshSignalAux_->size(); signalIndex++) {
      37            0 :         CHK_RET(LocalNotify::Post(stream_, dispatcher_, (*meshSignalAux_)[signalIndex], profilerInput_.stage));
      38              :     }
      39            0 :     return HCCL_SUCCESS;
      40              : }
      41              : 
      42            0 : HcclResult AllReduceChunkMesh::SubWaitMain()
      43              : {
      44            0 :     for (u32 streamIndex = 0; streamIndex < meshSignalAux_->size(); streamIndex++) {
      45            0 :         CHK_RET(LocalNotify::Wait(
      46              :             meshStreams_[streamIndex], dispatcher_, (*meshSignalAux_)[streamIndex], profilerInput_.stage));
      47              :     }
      48            0 :     return HCCL_SUCCESS;
      49              : }
      50              : 
      51            0 : HcclResult AllReduceChunkMesh::MainWaitSub()
      52              : {
      53            0 :     for (u32 signalIndex = 0; signalIndex < meshSignal_->size(); signalIndex++) {
      54            0 :         CHK_RET(LocalNotify::Wait(stream_, dispatcher_, (*meshSignal_)[signalIndex], profilerInput_.stage));
      55              :     }
      56            0 :     return HCCL_SUCCESS;
      57              : }
      58              : 
      59            0 : HcclResult AllReduceChunkMesh::SubRecordMain()
      60              : {
      61            0 :     for (u32 streamIndex = 0; streamIndex < meshSignal_->size(); streamIndex++) {
      62            0 :         CHK_RET(LocalNotify::Post(
      63              :             meshStreams_[streamIndex], dispatcher_, (*meshSignal_)[streamIndex], profilerInput_.stage));
      64              :     }
      65            0 :     return HCCL_SUCCESS;
      66              : }
      67              : 
      68              : // 将数据均分,最小单位是128
      69            0 : HcclResult AllReduceChunkMesh::PrepareSlice(u64 dataCount, u32 unitSize, u32 sliceNum, std::vector<Slice>& dataSlice)
      70              : {
      71            0 :     u64 totalSize = dataCount * unitSize;
      72            0 :     Slice temp;
      73            0 :     dataSlice.clear();
      74            0 :     dataSlice.reserve(sliceNum);
      75            0 :     if (sliceNum == 0) {
      76            0 :         HCCL_ERROR("[Prepare][SliceData]data slice prepare, sliceNum is 0");
      77            0 :         return HCCL_E_PARA;
      78              :     }
      79            0 :     u64 sizePerSlice = (totalSize + sliceNum - 1) / sliceNum; /* 1是为了向上取整 */
      80            0 :     sizePerSlice = RoundUpWithDivisor(sizePerSlice, HCCL_MIN_SLICE_ALIGN);
      81            0 :     u64 residueSize = totalSize;
      82            0 :     u32 i = 0;
      83            0 :     while (residueSize > 0) {
      84            0 :         u64 sliceSize = sizePerSlice < residueSize ? sizePerSlice : residueSize;
      85            0 :         temp.size = sliceSize;
      86            0 :         temp.offset = totalSize - residueSize;
      87            0 :         i++;
      88            0 :         if (sliceSize <= 0) {
      89            0 :             HCCL_ERROR("[Prepare][SliceData]data_slice_prepare sliceSize[%llu]", sliceSize);
      90            0 :             return HCCL_E_PARA;
      91              :         }
      92            0 :         residueSize -= sliceSize;
      93            0 :         dataSlice.push_back(temp);
      94              :     }
      95            0 :     while (i < sliceNum) {
      96            0 :         temp.size = 0;
      97            0 :         temp.offset = totalSize;
      98            0 :         i++;
      99            0 :         dataSlice.push_back(temp);
     100              :     }
     101            0 :     return HCCL_SUCCESS;
     102              : }
     103              : 
     104            0 : HcclResult AllReduceChunkMesh::PrepareAllreduceSliceData()
     105              : {
     106            0 :     u32 unitSize = SIZE_TABLE[dataType_];
     107            0 :     HcclResult ret = HCCL_SUCCESS;
     108            0 :     CHK_RET(PrepareSlice(count_, unitSize, localRankSize_, slices_));
     109            0 :     for (u32 rank = 0; rank < localRankSize_; rank++) {
     110            0 :         std::vector<Slice> dataSegsSlice;
     111            0 :         ret = PrepareSlice(slices_[rank].size / unitSize, unitSize, localRankSize_ - 1, dataSegsSlice);
     112            0 :         sliceMap[rank] = dataSegsSlice;
     113            0 :         CHK_PRT_RET(ret != HCCL_SUCCESS, HCCL_ERROR("[AllReduceChunkMesh][PrepareSlice]rank[%u] failed", rank), ret);
     114            0 :     }
     115            0 :     return HCCL_SUCCESS;
     116              : }
     117              : 
     118            0 : HcclResult AllReduceChunkMesh::RunAsync(const u32 rank, const u32 rankSize, const std::vector<LINK>& links)
     119              : {
     120            0 :     HcclResult ret = HCCL_SUCCESS;
     121            0 :     CHK_SMART_PTR_NULL(dispatcher_);
     122            0 :     CHK_PTR_NULL(stream_.ptr());
     123            0 :     HCCL_INFO(
     124              :         "AllReduceChunkMesh run: rank[%u] ranksize[%u] inputMem[%p] outputMem[%p] count[%llu]", rank, rankSize,
     125              :         inputMem_.ptr(), outputMem_.ptr(), count_);
     126              : 
     127            0 :     if (links.size() < rankSize) {
     128            0 :         HCCL_ERROR(
     129              :             "[AllReduceChunkMesh][RunAsync]rank[%u] linksize[%llu] is less than rankSize[%u]", rank, links.size(),
     130              :             rankSize);
     131            0 :         return HCCL_E_INTERNAL;
     132              :     }
     133              : 
     134              :     // 如果ranksize为1, inline reduce和普通跨片reduce操作一致,从input->output
     135            0 :     if (rankSize == 1) {
     136            0 :         if (opInfo_->inputAddr != opInfo_->outputAddr) {
     137            0 :             DeviceMem userMemIn = DeviceMem::create(opInfo_->inputAddr, count_ * DataUnitSize(dataType_));
     138            0 :             DeviceMem userMemOut = DeviceMem::create(opInfo_->outputAddr, count_ * DataUnitSize(dataType_));
     139            0 :             ret = HcclD2DMemcpyAsync(dispatcher_, userMemOut, userMemIn, stream_);
     140            0 :             CHK_PRT_RET(
     141              :                 ret != HCCL_SUCCESS, HCCL_ERROR("[AllReduceRing][RunAsync]rank[%u] memcpy async failed", rank), ret);
     142            0 :         }
     143            0 :         return ret;
     144              :     }
     145              : 
     146            0 :     ret = PrepareAllreduceSliceData();
     147            0 :     CHK_PRT_RET(
     148              :         ret != HCCL_SUCCESS,
     149              :         HCCL_ERROR("[AllReduceRing][RunAsync]rank[%u] count[%llu] failed in PrepareSliceData step", rank, count_), ret);
     150              : 
     151            0 :     ret = RunReduceScatter(rank, rankSize, links);
     152            0 :     CHK_PRT_RET(
     153              :         ret != HCCL_SUCCESS,
     154              :         HCCL_ERROR(
     155              :             "[AllReduceRing][RunAsync]rank[%u] count[%llu] failed in reducescater "
     156              :             "step",
     157              :             rank, count_),
     158              :         ret);
     159              : 
     160            0 :     ret = RunAllGather(rank, rankSize, links);
     161            0 :     CHK_PRT_RET(
     162              :         ret != HCCL_SUCCESS,
     163              :         HCCL_ERROR(
     164              :             "[AllReduceRing][RunAsync]rank[%u] count[%llu] failed in AllGather "
     165              :             "step",
     166              :             rank, count_),
     167              :         ret);
     168              : 
     169            0 :     HCCL_INFO("AllReduceChunkMesh finished: rank[%u] ranksize[%u]", rank, rankSize);
     170            0 :     return HCCL_SUCCESS;
     171              : }
     172              : 
     173            0 : HcclResult AllReduceChunkMesh::RunReduceScatter(u32 rank, u32 rankSize, const std::vector<LINK>& links)
     174              : {
     175            0 :     HCCL_INFO(
     176              :         "ReduceScatterMeshAtomicOpbase run: rank[%u] totalrank[%u] inputMem[%p] outputMem[%p] count[%llu]", rank,
     177              :         rankSize, inputMem_.ptr(), outputMem_.ptr(), count_);
     178              : 
     179              :     // 数据准备
     180            0 :     u32 unitSize = DataUnitSize(dataType_);
     181              : 
     182            0 :     DeviceMem commMemOut = outputMem_;
     183              : 
     184            0 :     DeviceMem src;
     185            0 :     DeviceMem dst;
     186              : 
     187            0 :     src = DeviceMem::create(static_cast<char*>(opInfo_->inputAddr), count_ * unitSize);
     188              : 
     189            0 :     if (commMemOut.ptr() == opInfo_->outputAddr) {
     190              :         // 图模式
     191            0 :         src = src.range(slices_[rank].offset, slices_[rank].size);
     192            0 :         dst = commMemOut.range(slices_[rank].offset, slices_[rank].size);
     193              :     } else {
     194              :         // 单算子
     195            0 :         src = src.range(0, count_ * unitSize);
     196            0 :         dst = commMemOut.range(0, count_ * unitSize);
     197              :     }
     198            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, dst, src, stream_));
     199              : 
     200            0 :     DeviceMem emptySrc = commMemOut.range(0, 0);
     201            0 :     DeviceMem emptyDst = commMemOut.range(0, 0);
     202              : 
     203              :     // 主从流之前加空拷贝 防止成环
     204            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     205              : 
     206            0 :     CHK_RET(MainRecordSub());
     207            0 :     CHK_RET(SubWaitMain());
     208              : 
     209            0 :     for (u32 round = 1; round < rankSize; round++) {
     210            0 :         u32 dstRank = (round + rank) % rankSize;
     211            0 :         Stream& subStream = (round == localRankSize_ - 1) ? stream_ : meshStreams_[round - 1];
     212            0 :         CHK_RET(links[dstRank]->TxAck(subStream));
     213            0 :         CHK_RET(links[dstRank]->RxAck(subStream));
     214              :     }
     215              : 
     216            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     217              : 
     218            0 :     for (u32 round = 1; round < rankSize; round++) {
     219              :         // 主从流同步
     220              : 
     221            0 :         CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     222              : 
     223            0 :         CHK_RET(SubRecordMain());
     224            0 :         CHK_RET(MainWaitSub());
     225              : 
     226            0 :         CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     227              : 
     228            0 :         CHK_RET(MainRecordSub());
     229            0 :         CHK_RET(SubWaitMain());
     230              : 
     231            0 :         CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     232              : 
     233              :         // 跨片reduceinline写
     234            0 :         for (u32 peer = 1; peer < rankSize; peer++) {
     235            0 :             u32 gap = (peer + round) > rankSize ? (peer + round - 1) % (rankSize - 1) : (peer + round - 1);
     236            0 :             u32 dstRank = (gap + rank) % rankSize;
     237            0 :             Stream& subStream = (peer == localRankSize_ - 1) ? stream_ : meshStreams_[peer - 1];
     238            0 :             u32 dstSlice = peer - 1;
     239            0 :             void* remMemPtr = nullptr;
     240              : 
     241            0 :             if (commMemOut.ptr() == opInfo_->outputAddr) {
     242            0 :                 CHK_RET(links[dstRank]->GetRemoteMem(UserMemType::INPUT_MEM, &remMemPtr));
     243              :             } else {
     244            0 :                 CHK_RET(links[dstRank]->GetRemoteMem(UserMemType::OUTPUT_MEM, &remMemPtr));
     245              :             }
     246              : 
     247            0 :             src = DeviceMem::create(
     248            0 :                 static_cast<char*>(remMemPtr) + slices_[rank].offset + sliceMap[rank][dstSlice].offset,
     249            0 :                 sliceMap[rank][dstSlice].size);
     250            0 :             dst = commMemOut.range(
     251            0 :                 slices_[rank].offset + sliceMap[rank][dstSlice].offset, sliceMap[rank][dstSlice].size);
     252            0 :             CHK_RET(HcclReduceAsync(
     253              :                 dispatcher_, static_cast<void*>(src.ptr()), sliceMap[rank][dstSlice].size / unitSize, dataType_,
     254              :                 reductionOp_, subStream, static_cast<void*>(dst.ptr()), links[dstRank]->GetRemoteRank(),
     255              :                 links[dstRank]->GetLinkType(), INLINE_REDUCE_BIT));
     256              :         }
     257              :     }
     258              : 
     259            0 :     for (u32 round = 1; round < rankSize; round++) {
     260            0 :         u32 gap = (round - 1) == 0 ? (rankSize - 1) : (round - 1);
     261            0 :         u32 dstRank = (rank + gap) % rankSize;
     262            0 :         Stream& subStream = (round == localRankSize_ - 1) ? stream_ : meshStreams_[round - 1];
     263            0 :         CHK_RET(links[dstRank]->TxDataSignal(subStream));
     264            0 :         CHK_RET(links[dstRank]->RxDataSignal(subStream));
     265              :     }
     266              : 
     267            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     268              : 
     269            0 :     CHK_RET(SubRecordMain());
     270            0 :     CHK_RET(MainWaitSub());
     271              : 
     272            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     273            0 :     return HCCL_SUCCESS;
     274            0 : }
     275              : 
     276            0 : HcclResult AllReduceChunkMesh::RunAllGather(u32 rank, u32 rankSize, const std::vector<LINK>& links)
     277              : {
     278            0 :     HCCL_INFO(
     279              :         "AllGatherMesh run: rank[%u] totalrank[%u] inputMem[%p] outputMem[%p] count[%llu]", rank, rankSize,
     280              :         inputMem_.ptr(), outputMem_.ptr(), count_);
     281            0 :     u32 unitSize = DataUnitSize(dataType_);
     282              : 
     283            0 :     DeviceMem userMemOut = DeviceMem::create(opInfo_->outputAddr, count_ * unitSize);
     284            0 :     DeviceMem commMemOut = DeviceMem::create(outputMem_.ptr(), outputMem_.size());
     285              : 
     286            0 :     DeviceMem emptySrc = userMemOut.range(0, 0);
     287            0 :     DeviceMem emptyDst = commMemOut.range(0, 0);
     288              : 
     289            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     290              : 
     291            0 :     CHK_RET(MainRecordSub());
     292            0 :     CHK_RET(SubWaitMain());
     293              : 
     294            0 :     for (u32 round = 1; round < rankSize; round++) {
     295            0 :         u32 dstRank = BackwardRank(rank, rankSize, round);
     296            0 :         Stream& subStream = (round == localRankSize_ - 1) ? stream_ : meshStreams_[round - 1];
     297            0 :         CHK_RET(links[dstRank]->TxAck(subStream));
     298            0 :         CHK_RET(links[dstRank]->RxAck(subStream));
     299              :     }
     300              : 
     301            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     302              : 
     303            0 :     CHK_RET(SubRecordMain());
     304            0 :     CHK_RET(MainWaitSub());
     305              : 
     306            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     307              : 
     308            0 :     CHK_RET(MainRecordSub());
     309            0 :     CHK_RET(SubWaitMain());
     310              : 
     311            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     312              : 
     313            0 :     DeviceMem src;
     314            0 :     DeviceMem dst;
     315            0 :     if (opInfo_->outputAddr != outputMem_.ptr()) {
     316            0 :         dst = userMemOut.range(slices_[rank].offset, slices_[rank].size);
     317            0 :         src = commMemOut.range(slices_[rank].offset, slices_[rank].size);
     318            0 :         CHK_RET(HcclD2DMemcpyAsync(dispatcher_, dst, src, meshStreams_[meshStreams_.size() - 1]));
     319              :     }
     320              : 
     321            0 :     for (u32 round = 1; round < rankSize; round++) {
     322            0 :         u32 dstRank = BackwardRank(rank, rankSize, round);
     323            0 :         Stream& subStream = (round == localRankSize_ - 1) ? stream_ : meshStreams_[round - 1];
     324            0 :         void* remMemPtr = nullptr;
     325            0 :         CHK_RET(links[dstRank]->GetRemoteMem(UserMemType::OUTPUT_MEM, &remMemPtr));
     326            0 :         src = DeviceMem::create(static_cast<char*>(remMemPtr) + slices_[dstRank].offset, slices_[dstRank].size);
     327            0 :         dst = userMemOut.range(slices_[dstRank].offset, slices_[dstRank].size);
     328            0 :         CHK_RET(HcclD2DMemcpyAsync(
     329              :             dispatcher_, dst, src, subStream, links[dstRank]->GetRemoteRank(), links[dstRank]->GetLinkType()));
     330              : 
     331            0 :         CHK_RET(links[dstRank]->TxDataSignal(subStream));
     332            0 :         CHK_RET(links[dstRank]->RxDataSignal(subStream));
     333            0 :         HCCL_DEBUG("[AllReduceChunkMesh]round %u success");
     334              :     }
     335              : 
     336            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     337              : 
     338            0 :     CHK_RET(SubRecordMain());
     339            0 :     CHK_RET(MainWaitSub());
     340              : 
     341            0 :     CHK_RET(HcclD2DMemcpyAsync(dispatcher_, emptyDst, emptySrc, stream_));
     342              : 
     343            0 :     HCCL_INFO("[AllGatherMesh] finished: rank[%u]", rank);
     344            0 :     return HCCL_SUCCESS;
     345            0 : }
     346              : REGISTER_TEMPLATE(TemplateType::TEMPLATE_ALL_REDUCE_CHUNK_MESH, AllReduceChunkMesh);
     347              : } // namespace hccl
        

Generated by: LCOV version 2.0-1