Line data Source code
1 : /**
2 : * Copyright (c) 2025 Huawei Technologies Co., Ltd.
3 : * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
4 : * CANN Open Software License Agreement Version 2.0 (the "License").
5 : * Please refer to the License for details. You may not use this file except in compliance with the License.
6 : * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
7 : * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
8 : * See LICENSE in the root of the software repository for the full text of the License.
9 : */
10 :
11 : #include "coll_aligned_all_gather_double_ring_for_910_93_executor.h"
12 : #include "hccl_types.h"
13 :
14 : namespace hccl {
15 2 : CollAlignedAllGatherDoubleRingFor91093Executor::CollAlignedAllGatherDoubleRingFor91093Executor(
16 : const HcclDispatcher dispatcher,
17 2 : std::unique_ptr<TopoMatcher> &topoMatcher)
18 2 : : CollAllGatherRingFor91093Executor(dispatcher, topoMatcher)
19 : {
20 2 : DMAReduceFlag_ = workflowMode_ == HcclWorkflowMode::HCCL_WORKFLOW_MODE_OP_BASE;
21 2 : }
22 :
23 18 : HcclResult CollAlignedAllGatherDoubleRingFor91093Executor::RunIntraSeverAllGather(
24 : const std::string &tag, DeviceMem &inputMem, DeviceMem &outputMem,
25 : const u64 count, const HcclDataType &dataType, const std::vector<std::vector<Slice>> &multRingsSliceZero,
26 : const Stream &stream, s32 profStage, const u64 baseOffset, const HcomCollOpInfo *opInfo,
27 : const std::vector<std::vector<Slice>> &multRingsUserMemSlice)
28 : {
29 18 : CHK_RET(DoubleRingAllGather(tag, inputMem, outputMem, count, dataType,
30 : multRingsSliceZero, stream, profStage, baseOffset, opInfo, multRingsUserMemSlice));
31 18 : return HCCL_SUCCESS;
32 : }
33 :
34 18 : HcclResult CollAlignedAllGatherDoubleRingFor91093Executor::DoubleRingAllGather(
35 : const std::string &tag, DeviceMem inputMem, DeviceMem outputMem,
36 : const u64 count, const HcclDataType dataType, const std::vector<std::vector<Slice> > multRingsSliceZero,
37 : Stream stream, s32 profStage, const u64 baseOffset, const HcomCollOpInfo *opInfo,
38 : const std::vector<std::vector<Slice>> multRingsUserMemSlice)
39 : {
40 18 : HCCL_CONFIG_INFO(HCCL_ALG, "[CollAlignedAllGatherDoubleRingFor91093Executor]userRank[%u], count[%llu]",
41 : topoAttr_.userRank, count);
42 :
43 : (void)tag;
44 18 : HCCL_INFO("[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather] DoubleRingAllGather starts");
45 18 : HcclResult ret = HCCL_SUCCESS;
46 18 : u32 ringNum = multRingsSliceZero.size();
47 18 : CHK_RET(CheckCommSize(COMM_LEVEL0, ringNum));
48 : // 拿到ring环映射关系
49 18 : SubCommInfo level0ZeroCommInfo = GetSubCommInfo(COMM_LEVEL0, COMM_INDEX_0);
50 18 : auto nicList = topoAttr_.nicList;
51 : std::vector<std::vector<u32>> multiRingsOrder =
52 18 : GetRingsOrderByTopoType(level0ZeroCommInfo.localRankSize, topoType_, nicList);
53 : // 生成两个ring上的userMemOut_上对应的slices
54 18 : std::vector<std::vector<Slice>> userMemOutputSlicesOfDoubleRing;
55 18 : CHK_RET(CollectMultiRingsUserMemSlices(ringNum, dataType, opInfo, multRingsSliceZero,
56 : multiRingsOrder, multRingsUserMemSlice, userMemOutputSlicesOfDoubleRing));
57 : // 生成两个ring上的rankOrder
58 18 : std::vector<std::vector<u32>> rankOrders;
59 18 : CHK_RET(CollectMultiRingsRankOrder(ringNum, multiRingsOrder, rankOrders));
60 : // 初始化executor
61 18 : std::unique_ptr<AlgTemplateBase> tempAlg = AlgTemplateRegistry::Instance().GetAlgTemplate(
62 18 : TemplateType::TEMPLATE_ALIGNED_ALL_GATHER_DOUBLE_RING, dispatcher_);
63 18 : HCCL_CONFIG_INFO(HCCL_ALG, "[%s] Run TEMPLATE_ALIGNED_ALL_GATHER_DOUBLE_RING in COMM_LEVEL0", __func__);
64 18 : CHK_SMART_PTR_NULL(tempAlg);
65 18 : CHK_RET(tempAlg->Prepare(const_cast<HcomCollOpInfo *>(opInfo), topoAttr_.userRank, algResResp_->slaveStreams,
66 : algResResp_->notifiesMain, algResResp_->notifiesAux, rankOrders, userMemOutputSlicesOfDoubleRing));
67 :
68 18 : ret = tempAlg->Prepare(outputMem, outputMem, inputMem, count, dataType, stream, multRingsSliceZero,
69 : HCCL_REDUCE_RESERVED, LEVEL0_BRIDGE_RANK_ID, baseOffset);
70 18 : CHK_PRT_RET(ret != HCCL_SUCCESS,
71 : HCCL_ERROR("[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather]Double ring "
72 : "AllGather failed, return[%d]", ret), ret);
73 18 : u32 ringIndexOp = COMM_INDEX_0;
74 18 : u32 rankSize = level0ZeroCommInfo.localRankSize;
75 18 : ret = tempAlg->RegisterProfiler(
76 18 : ((ringIndexOp + 1) << PROF_RINGINDEX_OFFSET_OF_PLANEID) +
77 18 : (rankSize << PROF_RANKSIZE_OFFSET_OF_PLANEID) + level0ZeroCommInfo.localRank,
78 : profStage, HCCL_EXEC_STEP_NOT_SET, stream);
79 18 : CHK_PRT_RET(ret != HCCL_SUCCESS,
80 : HCCL_ERROR("[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather]Double ring "
81 : "AllGather failed, return[%d]", ret), ret);
82 :
83 : // 空拷贝用于后续操作附着
84 18 : CHK_RET(AlgTemplateBase::ExecEmptyTask(inputMem, outputMem, stream, dispatcher_));
85 18 : ret = RunTemplate(tempAlg, level0ZeroCommInfo);
86 18 : CHK_PRT_RET(ret != HCCL_SUCCESS,
87 : HCCL_ERROR("[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather] Double ring "
88 : "AllGather failed, return[%d]", ret), ret);
89 : // 添加空task,保证执行时不乱序
90 18 : CHK_RET(AlgTemplateBase::ExecEmptyTask(inputMem, outputMem, stream, dispatcher_));
91 18 : return HCCL_SUCCESS;
92 18 : }
93 :
94 : REGISTER_EXEC("AlignedAllGatherDoubleRingFor91093Executor", AlignedAllGatherDoubleRingFor91093,
95 : CollAlignedAllGatherDoubleRingFor91093Executor);
96 :
97 : } // namespace hccl
|