Line data Source code
1 : /**
2 : * Copyright (c) 2025 Huawei Technologies Co., Ltd.
3 : * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
4 : * CANN Open Software License Agreement Version 2.0 (the "License").
5 : * Please refer to the License for details. You may not use this file except in compliance with the License.
6 : * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
7 : * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
8 : * See LICENSE in the root of the software repository for the full text of the License.
9 : */
10 :
11 : #include "coll_aligned_all_gather_double_ring_for_910_93_executor.h"
12 : #include "hccl_types.h"
13 :
14 : namespace hccl {
15 2 : CollAlignedAllGatherDoubleRingFor91093Executor::CollAlignedAllGatherDoubleRingFor91093Executor(
16 2 : const HcclDispatcher dispatcher, std::unique_ptr<TopoMatcher>& topoMatcher)
17 2 : : CollAllGatherRingFor91093Executor(dispatcher, topoMatcher)
18 : {
19 2 : DMAReduceFlag_ = workflowMode_ == HcclWorkflowMode::HCCL_WORKFLOW_MODE_OP_BASE;
20 2 : }
21 :
22 18 : HcclResult CollAlignedAllGatherDoubleRingFor91093Executor::RunIntraSeverAllGather(
23 : const std::string& tag, DeviceMem& inputMem, DeviceMem& outputMem, const u64 count, const HcclDataType& dataType,
24 : const std::vector<std::vector<Slice>>& multRingsSliceZero, const Stream& stream, s32 profStage,
25 : const u64 baseOffset, const HcomCollOpInfo* opInfo, const std::vector<std::vector<Slice>>& multRingsUserMemSlice)
26 : {
27 18 : CHK_RET(DoubleRingAllGather(
28 : tag, inputMem, outputMem, count, dataType, multRingsSliceZero, stream, profStage, baseOffset, opInfo,
29 : multRingsUserMemSlice));
30 18 : return HCCL_SUCCESS;
31 : }
32 :
33 18 : HcclResult CollAlignedAllGatherDoubleRingFor91093Executor::DoubleRingAllGather(
34 : const std::string& tag, DeviceMem inputMem, DeviceMem outputMem, const u64 count, const HcclDataType dataType,
35 : const std::vector<std::vector<Slice>> multRingsSliceZero, Stream stream, s32 profStage, const u64 baseOffset,
36 : const HcomCollOpInfo* opInfo, const std::vector<std::vector<Slice>> multRingsUserMemSlice)
37 : {
38 18 : HCCL_CONFIG_INFO(
39 : HCCL_ALG, "[CollAlignedAllGatherDoubleRingFor91093Executor]userRank[%u], count[%llu]", topoAttr_.userRank,
40 : count);
41 :
42 : (void)tag;
43 18 : HCCL_INFO("[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather] DoubleRingAllGather starts");
44 18 : HcclResult ret = HCCL_SUCCESS;
45 18 : u32 ringNum = multRingsSliceZero.size();
46 18 : CHK_RET(CheckCommSize(COMM_LEVEL0, ringNum));
47 : // 拿到ring环映射关系
48 18 : SubCommInfo level0ZeroCommInfo = GetSubCommInfo(COMM_LEVEL0, COMM_INDEX_0);
49 18 : auto nicList = topoAttr_.nicList;
50 : std::vector<std::vector<u32>> multiRingsOrder
51 18 : = GetRingsOrderByTopoType(level0ZeroCommInfo.localRankSize, topoType_, nicList);
52 : // 生成两个ring上的userMemOut_上对应的slices
53 18 : std::vector<std::vector<Slice>> userMemOutputSlicesOfDoubleRing;
54 18 : CHK_RET(CollectMultiRingsUserMemSlices(
55 : ringNum, dataType, opInfo, multRingsSliceZero, multiRingsOrder, multRingsUserMemSlice,
56 : userMemOutputSlicesOfDoubleRing));
57 : // 生成两个ring上的rankOrder
58 18 : std::vector<std::vector<u32>> rankOrders;
59 18 : CHK_RET(CollectMultiRingsRankOrder(ringNum, multiRingsOrder, rankOrders));
60 : // 初始化executor
61 18 : std::unique_ptr<AlgTemplateBase> tempAlg = AlgTemplateRegistry::Instance().GetAlgTemplate(
62 18 : TemplateType::TEMPLATE_ALIGNED_ALL_GATHER_DOUBLE_RING, dispatcher_);
63 18 : HCCL_CONFIG_INFO(HCCL_ALG, "[%s] Run TEMPLATE_ALIGNED_ALL_GATHER_DOUBLE_RING in COMM_LEVEL0", __func__);
64 18 : CHK_SMART_PTR_NULL(tempAlg);
65 18 : CHK_RET(tempAlg->Prepare(
66 : const_cast<HcomCollOpInfo*>(opInfo), topoAttr_.userRank, algResResp_->slaveStreams, algResResp_->notifiesMain,
67 : algResResp_->notifiesAux, rankOrders, userMemOutputSlicesOfDoubleRing));
68 :
69 18 : ret = tempAlg->Prepare(
70 : outputMem, outputMem, inputMem, count, dataType, stream, multRingsSliceZero, HCCL_REDUCE_RESERVED,
71 : LEVEL0_BRIDGE_RANK_ID, baseOffset);
72 18 : CHK_PRT_RET(
73 : ret != HCCL_SUCCESS,
74 : HCCL_ERROR(
75 : "[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather]Double ring "
76 : "AllGather failed, return[%d]",
77 : ret),
78 : ret);
79 18 : u32 ringIndexOp = COMM_INDEX_0;
80 18 : u32 rankSize = level0ZeroCommInfo.localRankSize;
81 18 : ret = tempAlg->RegisterProfiler(
82 18 : ((ringIndexOp + 1) << PROF_RINGINDEX_OFFSET_OF_PLANEID) + (rankSize << PROF_RANKSIZE_OFFSET_OF_PLANEID)
83 18 : + level0ZeroCommInfo.localRank,
84 : profStage, HCCL_EXEC_STEP_NOT_SET, stream);
85 18 : CHK_PRT_RET(
86 : ret != HCCL_SUCCESS,
87 : HCCL_ERROR(
88 : "[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather]Double ring "
89 : "AllGather failed, return[%d]",
90 : ret),
91 : ret);
92 :
93 : // 空拷贝用于后续操作附着
94 18 : CHK_RET(AlgTemplateBase::ExecEmptyTask(inputMem, outputMem, stream, dispatcher_));
95 18 : ret = RunTemplate(tempAlg, level0ZeroCommInfo);
96 18 : CHK_PRT_RET(
97 : ret != HCCL_SUCCESS,
98 : HCCL_ERROR(
99 : "[CollAlignedAllGatherDoubleRingFor91093Executor][DoubleRingAllGather] Double ring "
100 : "AllGather failed, return[%d]",
101 : ret),
102 : ret);
103 : // 添加空task,保证执行时不乱序
104 18 : CHK_RET(AlgTemplateBase::ExecEmptyTask(inputMem, outputMem, stream, dispatcher_));
105 18 : return HCCL_SUCCESS;
106 18 : }
107 :
108 : REGISTER_EXEC(
109 : "AlignedAllGatherDoubleRingFor91093Executor", AlignedAllGatherDoubleRingFor91093,
110 : CollAlignedAllGatherDoubleRingFor91093Executor);
111 :
112 : } // namespace hccl
|