最新成果:用于边缘计算的神经网络到逻辑流的转换

Late Breaking Results: Conversion of Neural Networks into Logic Flows for Edge Computing

arXiv: 2601.22151v1

论文信息

标题: Late Breaking Results: Conversion of Neural Networks into Logic Flows for Edge Computing

作者: Daniel Stein, Shaoyi Huang, Rolf Drechsler, et al.

发布日期: 2026-01-29

arXiv ID: 2601.22151v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何提升神经网络在边缘设备 CPU 上的执行效率,解决 CPU 不擅长大规模乘累加运算的瓶颈。
  • 核心方法:将神经网络转换为等价的决策树,从中提取输出恒定的决策路径并压缩为逻辑流,以 if-else 结构和少量乘累加运算替代原始计算。
  • 关键结果:在 RISC-V CPU 模拟器上,平均延迟最高可降低 14.9%,且无精度损失(见论文表 I)。
  • 主要局限:当前方法仅适用于中小规模全连接网络,尚未扩展至深度网络和多分类任务(见论文第 IV 节)。
  • 适合读者:关注边缘 AI 部署、神经网络编译器优化以及软硬件协同设计的研究人员和工程师。

论文背景和研究动机

神经网络在资源受限的边缘设备上部署时面临显著的计算效率挑战。这类设备通常仅配备通用 CPU,缺乏 GPU 或专用 AI 加速器所拥有的并行乘累加电路。CPU 内部包含大量逻辑执行单元,但专用的乘法器和加法器数量有限,导致大规模乘累加运算成为性能瓶颈。

现有的加速方法主要集中在算法层面(如剪枝、量化、知识蒸馏、动态网络结构)和硬件编译层面(内存分配、指令调度、循环优化)来减少乘累加操作或隐藏其延迟。然而,这些技术本质上仍然聚焦于高效执行大量乘累加操作,并未深入探索神经网络的逻辑表达形式。论文指出,即使对于集成了神经网络处理单元的异构 CPU 平台,在 CPU 上以逻辑形式执行神经网络仍然是充分利用所有计算资源的关键手段,而这一研究方向在当前领域中尚属空白。

核心方法和技术细节

该方法将神经网络转换为逻辑流的过程分为三个关键步骤。

第一步:基于训练数据构建决策树。 对于一个已训练好的神经网络,该方法按照激活函数的决策边界构造决策节点。以 ReLU 激活函数为例,每个神经元产生一个线性不等式作为分支条件(如 2x0−1>02x_0 - 1 > 0 对应神经元激活为真)。这些条件从输入层开始逐层连接,形成决策树。为控制树的复杂度,仅保留在训练数据中实际被样本访问过的分支路径(例如,图 1(b) 中最右侧 y1y_1 决策节点的假分支从未被访问,因此不添加到树中)。最后一层神经元则形成叶子节点,存储分类结果。

第二步:提取恒定输出的决策路径并压缩。 对于分类任务,恒定叶子节点意味着到达该叶子的所有输入样本始终被预测为同一类别。为严格验证某个决策路径对所有可能输入是否确实恒定(而非仅对训练样本恒定),论文使用 Gurobi 求解器构造混合整数规划问题,分别对每个可能的类别建立模型。若某类别对应的约束系统不存在可行解,则说明该叶子对该类别是恒定的。以图 1 的叶子 L4 为例,y3>y4y_3 > y_4(对应类别 c0c_0)无可行解,因此 L4 永远输出 c1c_1。

此后,论文利用 Gurobi 计算不可行性子系统的不可约核心——一个最小的约束集合,只要移除其中任何一个约束,问题就变得可行。对 L4 而言,该集合仅包含 y0<0y_0 < 0,意味着仅凭这一个约束即可断定该路径必然输出 c1c_1,其他决策节点的条件均可省略。

第三步:混合执行模式。 被选中的压缩路径转换为由 if-else 结构和少量乘累加运算组成的逻辑流。当输入样本满足某个逻辑流的所有条件时,推理直接输出结果并终止;若所有逻辑流均未匹配,则回退至原始神经网络格式完成计算。这种混合执行确保了一部分简单样本可以被快速处理,而复杂样本仍保留完整推理能力。

创新点和贡献

本工作的核心创新在于开辟了一个新维度来加速边缘端神经网络推理。与以往聚焦于减少或优化乘累加运算的方法不同,本文首次系统性地探索了将神经网络执行从数值计算向逻辑表达转换的路径。这一思路充分利用了 CPU 擅长逻辑判断和分支跳转的硬件特性,本质上实现了计算范式的部分转移。

具体贡献包括三个方面:其一,提出了完整的神经网络到逻辑流的转换方法论,涵盖决策树构建、恒定路径形式化验证和约束压缩三个关键环节;其二,设计了混合执行框架,确保在提升效率的同时不损失模型表达能力;其三,通过在真实 RISC-V CPU 模拟器上的实验,实证了该方法在无精度损失前提下可获得显著的延迟降低。

实验结果分析

论文在三个公开数据集上验证了方法有效性:修改后的 MNIST(判断手写数字奇偶性)、Occupancy I 和 Occupancy II(室内占用检测)。所有模型均为量化的三层全连接网络。

实验使用 Ibex RISC-V CPU 的硬件模拟器,对比了参考代码(未经转换的标准神经网络)与混合执行代码的性能。关键结果如下(见论文表 I):

  • 模型准确率无任何下降,三个数据集的参考代码和混合代码准确率完全一致。
  • 最小延迟降幅显著,MNIST* 上降低 4.8%,Occupancy I 上降低 52.2%,Occupancy II 上降低 25.5%。
  • 平均延迟降幅更为稳健,Occupancy I 达到最高的 14.9%,MNIST* 和 Occupancy II 分别为 0.7% 和 5.2%。
  • 最大延迟出现小幅增加(0.1% 至 1.2%),论文解释为增加了逻辑流匹配判断的额外开销。
  • 若仅考察网络第二、三层的加速收益,延迟降幅更为可观,Occupancy I 达到 39.3%。

表中 “Exit by Tree” 列显示了通过逻辑流直接完成推理的样本比例,Occupancy I 达到 34.1%,表明约有三分之一的简单样本避免了大量乘累加计算。

实践建议

对于希望在边缘设备 CPU 上部署神经网络的工程团队,该方法提供了若干可操作的实践方向。

首先,优先分析目标部署场景中是否存在大量可被简单案例替代的推理请求。论文中 Occupancy I 数据集的高加速比(14.9%)正源于其样本分布中存在较高比例的 “容易” 样本(34.1% 通过逻辑流退出)。对于输入分布相对均匀或普遍复杂的应用场景,应审慎评估收益。

其次,该方法目前仅适用于中小规模全连接网络。在实际项目中,可考虑将神经网络的部分层或子模块单独转换为逻辑流,与其他优化技术(如量化和剪枝)协同使用。论文代码已开源(https://github.com/TUDa-HWAI/NN2Logic),可直接集成至现有的模型部署流程中。

第三,混合执行框架的设计原则具有普适性。在开发自定义推理引擎时,可借鉴其 “快速路径优先” 的执行策略:将模型推理分解为一条可快速验证的判定分支和一个完整的后备计算路径,利用 CPU 的分支预测能力提升总体吞吐率。

最后,需注意该方法增加了额外的分支判断逻辑,可能对 CPU 的分支预测器和指令缓存带来负面影响。建议在实际硬件上进行充分测试,权衡延迟均值的改善与延迟尾部的劣化。