Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension


Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
3 changes: 3 additions & 0 deletions docs/2026.html
Original file line number Diff line number Diff line change
Expand Up @@ -63,6 +63,9 @@ <h5>New features</h5>
<li>NEON, SVE2 optimizations of classes SynetMergedConvolution16bCdc.</li>
<li>NEON, SVE2 optimizations of classes SynetMergedConvolution16bCd.</li>
<li>NEON, SVE2 optimizations of classes SynetMergedConvolution16bDc.</li>
<li>NEON optimizations of classes SynetQuantizedMergedConvolutionCdc.</li>
<li>NEON optimizations of classes SynetQuantizedMergedConvolutionCd.</li>
<li>NEON optimizations of classes SynetQuantizedMergedConvolutionDc.</li>
</ul>
<h5>Improving</h5>
<ul>
Expand Down
5 changes: 5 additions & 0 deletions prj/vs2022/Neon.vcxproj
Original file line number Diff line number Diff line change
Expand Up @@ -146,6 +146,10 @@
<ClCompile Include="..\..\src\Simd\SimdNeonSynetMergedConvolution8iDepthwise.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetMergedConvolution8iInput.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetMergedConvolution8iOutput.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolution.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolutionDepthwise.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolutionInput.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolutionOutput.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetPermute.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetPooling.cpp" />
<ClCompile Include="..\..\src\Simd\SimdNeonSynetPoolingMax16b.cpp" />
Expand Down Expand Up @@ -250,6 +254,7 @@
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizedActivation.h" />
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizedAdd.h" />
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizedAddCommon.h" />
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizedMergedConvolution.h" />
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizeLinear.h" />
<ClInclude Include="..\..\src\Simd\SimdSynetScale8i.h" />
<ClInclude Include="..\..\src\Simd\SimdTime.h" />
Expand Down
15 changes: 15 additions & 0 deletions prj/vs2022/Neon.vcxproj.filters
Original file line number Diff line number Diff line change
Expand Up @@ -364,6 +364,18 @@
<ClCompile Include="..\..\src\Simd\SimdNeonSynetMergedConvolution8iOutput.cpp">
<Filter>Neon\Synet\MergedConvolution</Filter>
</ClCompile>
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolution.cpp">
<Filter>Neon\Synet\Quantized</Filter>
</ClCompile>
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolutionDepthwise.cpp">
<Filter>Neon\Synet\Quantized</Filter>
</ClCompile>
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolutionInput.cpp">
<Filter>Neon\Synet\Quantized</Filter>
</ClCompile>
<ClCompile Include="..\..\src\Simd\SimdNeonSynetQuantizedMergedConvolutionOutput.cpp">
<Filter>Neon\Synet\Quantized</Filter>
</ClCompile>
<ClCompile Include="..\..\src\Simd\SimdNeonSynet.cpp">
<Filter>Neon\Synet\Other</Filter>
</ClCompile>
Expand Down Expand Up @@ -779,6 +791,9 @@
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizedAddCommon.h">
<Filter>Inc</Filter>
</ClInclude>
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizedMergedConvolution.h">
<Filter>Inc</Filter>
</ClInclude>
<ClInclude Include="..\..\src\Simd\SimdSynetQuantizeLinear.h">
<Filter>Inc</Filter>
</ClInclude>
Expand Down
2 changes: 1 addition & 1 deletion src/Simd/SimdLib.cpp
Original file line number Diff line number Diff line change
Expand Up @@ -7480,7 +7480,7 @@ SIMD_API void* SimdSynetQuantizedMergedConvolutionInit(size_t batch, const SimdC
SIMD_EMPTY();
#if defined(SIMD_SYNET_ENABLE)
typedef void* (*SimdSynetQuantizedMergedConvolutionInitPtr) (size_t batch, const SimdConvolutionParameters* convs, size_t count, int add);
const static SimdSynetQuantizedMergedConvolutionInitPtr simdSynetQuantizedMergedConvolutionInit = SIMD_FUNC5(SynetQuantizedMergedConvolutionInit, SIMD_AMXBF16_FUNC, SIMD_AVX512VNNI_FUNC, SIMD_AVX512BW_FUNC, SIMD_AVX2_FUNC, SIMD_SSE41_FUNC);
const static SimdSynetQuantizedMergedConvolutionInitPtr simdSynetQuantizedMergedConvolutionInit = SIMD_FUNC6(SynetQuantizedMergedConvolutionInit, SIMD_AMXBF16_FUNC, SIMD_AVX512VNNI_FUNC, SIMD_AVX512BW_FUNC, SIMD_AVX2_FUNC, SIMD_SSE41_FUNC, SIMD_NEON_FUNC);

return simdSynetQuantizedMergedConvolutionInit(batch, convs, count, add);
#else
Expand Down
9 changes: 9 additions & 0 deletions src/Simd/SimdMath.h
Original file line number Diff line number Diff line change
Expand Up @@ -1515,6 +1515,15 @@ namespace Simd
return vcvtq_s32_f32(vaddq_f32(value, round));
}

SIMD_INLINE int32x4_t NearbyInt(float32x4_t value)
{
#if defined(__aarch64__)
return vcvtnq_s32_f32(value);
#else
return Round(value);
#endif
}

SIMD_INLINE uint32x4_t RoundPositive(float32x4_t value)
{
return vcvtq_u32_f32(vaddq_f32(value, vdupq_n_f32(0.5f)));
Expand Down
93 changes: 93 additions & 0 deletions src/Simd/SimdNeonSynetQuantizedMergedConvolution.cpp
Original file line number Diff line number Diff line change
@@ -0,0 +1,93 @@
/*
* Simd Library (http://ermig1979.github.io/Simd).
*
* Copyright (c) 2011-2026 Yermalayeu Ihar.
*
* Permission is hereby granted, free of charge, to any person obtaining a copy
* of this software and associated documentation files (the "Software"), to deal
* in the Software without restriction, including without limitation the rights
* to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
* copies of the Software, and to permit persons to whom the Software is
* furnished to do so, subject to the following conditions:
*
* The above copyright notice and this permission notice shall be included in
* all copies or substantial portions of the Software.
*
* THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
* IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
* FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
* AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
* LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
* OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
* SOFTWARE.
*/
#include "Simd/SimdSynetQuantizedMergedConvolution.h"
#include "Simd/SimdSynetQuantizeLinear.h"
#include "Simd/SimdSynetConvolution8iCommon.h"
#include "Simd/SimdSynet.h"
#include "Simd/SimdMath.h"
#include "Simd/SimdBase.h"
#include "Simd/SimdCpu.h"
#include "Simd/SimdLog.h"

namespace Simd
{
#if defined(SIMD_NEON_ENABLE) && defined(SIMD_SYNET_ENABLE)
namespace Neon
{
typedef Base::SynetQuantizedMergedConvolution::AlgParam AlgParam;

//------------------------------------------------------------------------------------------------

SynetQuantizedMergedConvolutionCdc::SynetQuantizedMergedConvolutionCdc(const MergConvParam& p)
: Base::SynetQuantizedMergedConvolutionCdc(p)
{
SetSize(F, 4, 2);
SetInputConvolution(p.conv[0], _alg, _inputConvolution);
SetDepthwisePreprocess(p.conv[1], _alg, _depthwisePreprocess);
SetDepthwiseConvolution(p.conv[1], _alg, _depthwiseConvolution);
SetOutputConvolution(p.conv[2], _alg, _outputConvolution);
SetAddInputToOutput(p.conv[2], _alg, _addInputToOutput);
}

//------------------------------------------------------------------------------------------------

SynetQuantizedMergedConvolutionCd::SynetQuantizedMergedConvolutionCd(const MergConvParam& p)
: Base::SynetQuantizedMergedConvolutionCd(p)
{
SetSize(F, 4, 2);
SetInputConvolution(p.conv[0], _alg, _inputConvolution);
SetDepthwisePreprocess(p.conv[1], _alg, _depthwisePreprocess);
SetDepthwiseConvolution(p.conv[1], _alg, _depthwiseConvolution);
}

//------------------------------------------------------------------------------------------------

SynetQuantizedMergedConvolutionDc::SynetQuantizedMergedConvolutionDc(const MergConvParam& p)
: Base::SynetQuantizedMergedConvolutionDc(p)
{
SetSize(F, 4, 2);
SetDepthwisePreprocess(p.conv[0], _alg, _depthwisePreprocess);
SetDepthwiseConvolution(p.conv[0], _alg, _depthwiseConvolution);
SetOutputConvolution(p.conv[1], _alg, _outputConvolution);
SetAddInputToOutput(p.conv[1], _alg, _addInputToOutput);
}

//------------------------------------------------------------------------------------------------

void* SynetQuantizedMergedConvolutionInit(size_t batch, const SimdConvolutionParameters* convs, size_t count, int add)
{
MergConvParam param(batch, convs, count, add);
if (!param.Valid(SimdTensorData8u, SimdTensorData8u))
return NULL;
else if (SynetQuantizedMergedConvolutionCdc::Preferable(param))
return new SynetQuantizedMergedConvolutionCdc(param);
else if (SynetQuantizedMergedConvolutionCd::Preferable(param))
return new SynetQuantizedMergedConvolutionCd(param);
else if (SynetQuantizedMergedConvolutionDc::Preferable(param))
return new SynetQuantizedMergedConvolutionDc(param);
return new Base::SynetQuantizedMergedConvolutionRef(param);
}
}
#endif
}
Loading