Line data Source code
1 : /**
2 : * Copyright (c) 2025 Huawei Technologies Co., Ltd.
3 : * This program is free software, you can redistribute it and/or modify it under the terms and conditions of
4 : * CANN Open Software License Agreement Version 2.0 (the "License").
5 : * Please refer to the License for details. You may not use this file except in compliance with the License.
6 : * THIS SOFTWARE IS PROVIDED ON AN "AS IS" BASIS, WITHOUT WARRANTIES OF ANY KIND, EITHER EXPRESS OR IMPLIED,
7 : * INCLUDING BUT NOT LIMITED TO NON-INFRINGEMENT, MERCHANTABILITY, OR FITNESS FOR A PARTICULAR PURPOSE.
8 : * See LICENSE in the root of the software repository for the full text of the License.
9 : */
10 :
11 : #ifndef __AICPU_ALLREDUCE_H__
12 : #define __AICPU_ALLREDUCE_H__
13 :
14 : #include "aicpu_algorithm.h"
15 :
16 : class AicpuAllreduce : public AicpuAlgorithm {
17 : public:
18 40 : explicit AicpuAllreduce(AicpuComContext *ctx) : AicpuAlgorithm(ctx) {}
19 39 : ~AicpuAllreduce() override = default;
20 :
21 : HcclResult RunAlgorithm(HcclReduceOp opType, void *sendBuffer, void *recvBuffer, u64 dataCount,
22 : HcclDataType dataType, u64 strideLen = 0, AivAicpuOpParam *nextTask = nullptr) override;
23 :
24 : private:
25 : int64_t RoundUpWithDivisor(u64 value, u64 divisor) const;
26 : HcclResult PrepareSlice(u64 dataCount, HcclDataType dataType, u32 sliceNum, std::vector<Slice>& dataSlice) const;
27 : void GetDataSizes16K(std::vector<u64>& dataSizes, u64 allDataSize) const;
28 : void RunAllReduceSlice(u8 *curOutputPtr, u8 *curInputPtr, u64 *sliceSize, u64 *dataSlice,
29 : HcclReduceOp opType, HcclDataType dataType) const;
30 : void RunAllReduceSliceWin2Win(u8 *curOutputPtr, u64 *sliceSize, u64 *dataSlice,
31 : HcclReduceOp opType, HcclDataType dataType) const;
32 : HcclResult RunAllReduceAlign(HcclReduceOp opType, void *sendBuffer, void *recvBuffer, u64 dataCount,
33 : HcclDataType dataType) const;
34 : HcclResult RunAllReduceAlignWin2Win(HcclReduceOp opType, void *recvBuffer,
35 : u64 dataCount, HcclDataType dataType) const;
36 : HcclResult RunAllReduce(HcclReduceOp opType, void *sendBuffer, void *recvBuffer, u64 dataCount,
37 : HcclDataType dataType) const;
38 : HcclResult RunAllReduceOneShot4Stream(HcclReduceOp opType, void *sendBuffer, void *recvBuffer, u64 dataSize,
39 : HcclDataType dataType) const;
40 : HcclResult RunAllReduceReduceBcast(HcclReduceOp opType, void *sendBuffer, void *recvBuffer, u64 dataSize,
41 : HcclDataType dataType) const;
42 : HcclResult RunReduceBcastOnMainSq(u32 mainRankId, u32 maxStreamNum, u32 /* startRank */, u32 /* end_rank */,
43 : void *sendBuffer, void *recvBuffer, u64 dataSize, HcclDataType dataType) const;
44 : HcclResult RunReduceBcastOnOtherSq(HcclReduceOp opType, u32 mainRankId, u32 maxStreamNum,
45 : void *sendBuffer, void *recvBuffer, u64 dataSize, HcclDataType dataType) const;
46 : HcclResult RunAllReduceOneShot1Stream(HcclReduceOp opType, void *sendBuffer, void *recvBuffer,
47 : u64 dataSize, HcclDataType dataType) const;
48 : HcclResult RunAllReduceTwoShot1Stream(HcclReduceOp opType, void *sendBuffer, void *recvBuffer,
49 : u64 dataCount, HcclDataType dataType) const;
50 : u32 GetHdPeer(const u32 hdRound, const u32 curRank) const;
51 : HcclResult RunAllReduceOneshotHD(HcclReduceOp opType, void *sendBuffer, void *recvBuffer,
52 : u64 dataSize, HcclDataType dataType) const;
53 : HcclResult RunAllReduceRing(HcclReduceOp opType, void *sendBuffer, void *recvBuffer,
54 : u64 dataCount, HcclDataType dataType) const;
55 : u64 AlignWith(u64 oriValue, u64 alignValue) const;
56 : HcclResult GetBurstDataCounts(u64 windowSize, u64 dataCount, std::vector<u64>& burstDataCounts) const;
57 : std::vector<std::vector<u32>> GetRingOrders() const;
58 : HcclResult reorderRingSlice(const std::vector<u32> &ringOrder, const std::vector<Slice> &ringSlices,
59 : std::vector<Slice> &orderedRingSlices) const;
60 : HcclResult PrepareRingSlice(
61 : const std::vector<std::vector<u32>> &ringOrders, u64 dataCount,
62 : HcclDataType dataType,
63 : std::vector<std::vector<Slice>> &orderedAllRingSlice) const;
64 : HcclResult RingIPCPreSync(const u32 stream, const u32 prevRank, const u32 nextRank) const;
65 : HcclResult RingIPCPostSync(const u32 stream, const u32 prevRank, const u32 nextRank) const;
66 : HcclResult GetPrevRankList(const std::vector<u32> &ringOrder, std::vector<u32> &previousRankList) const;
67 : size_t FindNextRank(const std::vector<u32> &previousRankList, const u32 localRank) const;
68 : Slice* GetNextRingSlice(const std::vector<u32> &previousRankList,
69 : std::vector<Slice> &orderedRingSlices, u32 &curSliceIdx) const;
70 : HcclResult RunAllReduceRingSingleBurst(
71 : HcclReduceOp opType, void *sendBuffer, void *recvBuffer, u64 dataCount,
72 : HcclDataType dataType, std::vector<std::vector<u32>> &ringOrders) const;
73 : HcclResult RunAllReduceRingAlg(HcclReduceOp opType, void *sendBuffer, void *recvBuffer,
74 : std::vector<Slice> &orderedRingSlices, std::vector<u32> &ringOrder, HcclDataType dataType) const;
75 : };
76 :
77 : #endif
|