破解边缘MoE大模型“稀疏性消失”难题,中国电信与上海交通大学云计算联合实验室论文被MobiCom 2026录用
2026-07-01

近日,中国电信-上海交通大学云计算联合实验室合作完成的论文《Sparsity-Aware Scheduling for Efficient MoE-Based LLM Serving on Edge Servers》被移动计算领域国际顶级会议ACM MobiCom 2026(The 30th Annual International Conference on Mobile Computing and Networking)正式录用。该研究针对边缘服务器上混合专家(Mixture-of-Experts, MoE)大语言模型服务中的关键效率瓶颈,创新性地提出稀疏性感知的请求调度框架Saber,实现了边缘MoE模型推理吞吐量与延迟的协同优化。

本研究工作由上海交通大学云计算联合实验室与中国电信云计算研究院共同完成。研究团队由上海交通大学计算机学院陈贵海教授、常务副院长吴帆教授、郑臻哲教授及庄严博士等,与中国电信首席科学家、云计算研究院院长吴杰教授,云计算研究院黄潇瑶研究员共同组建,双方发挥各自在大模型系统优化、边缘计算和云计算平台方面的优势,紧密合作完成了本项研究。

随着大语言模型(LLM)在边缘智能应用中的广泛部署,如何在资源受限的边缘服务器上高效服务MoE架构的大模型成为一项紧迫挑战。MoE模型通过稀疏激活机制,在推理时仅调用少量专家参数,可显著降低计算与存储开销,是边缘部署的理想选择。然而,现有LLM服务系统大多继承自云端架构,在边缘场景下面临严峻的“稀疏性消失”问题:当多个请求的输入token被批处理时,不同请求激活的专家集合叠加,导致激活专家比例急剧膨胀,引发频繁的CPU-GPU专家权值交换和巨大的I/O开销,严重制约系统吞吐性能。

针对这一关键问题,该论文首次提出稀疏性感知的请求调度框架Saber。Saber的核心思想是通过组级别批处理策略,动态识别并聚合具有相似专家激活模式的请求,构建稀疏性保持的输入批次。具体而言,Saber在离线阶段预计算并聚类模型的激活路径分布,训练轻量级token分类器;在运行时,利用该分类器快速将请求分组,并采用自适应提示分块策略处理多token的预填充请求,有效保持批次内的激活稀疏性。此外,Saber设计了基于效用函数的优先级调度机制,在最大化推理吞吐量的同时,通过动态调整组优先级有效避免请求饥饿,实现了吞吐量与尾延迟的均衡优化。实验结果表明,与现有稀疏性无关的调度策略相比,Saber可将批次执行时间降低最高3.8倍,在同等延迟水平下实现最高3.27倍的吞吐量提升,同时将每批次的I/O开销降低最高1.95倍,显著提升了边缘服务器上MoE大模型服务的效率与响应能力。

Saber框架概览

ACM MobiCom是中国计算机学会(CCF)推荐的A类国际顶级学术会议,也是移动计算与无线网络领域历史最悠久、影响力最大的学术会议之一,以评审严格、录用率低、前沿性强著称。本次入选论文聚焦大模型边缘推理这一前沿研究方向,创新性地从调度策略角度突破MoE模型边缘部署的效率瓶颈,获得了审稿人的高度评价,是中国电信-上海交通大学云计算联合实验室产学研协同创新的又一重要成果。未来,团队将继续围绕云边端协同智能计算方向,持续深化理论创新与技术攻关,为推动边缘大模型服务的高效部署与规模化应用贡献力量。

破解边缘MoE大模型“稀疏性消失”难题,中国电信与上海交通大学云计算联合实验室论文被MobiCom 2026录用
2026-07-01

近日,中国电信-上海交通大学云计算联合实验室合作完成的论文《Sparsity-Aware Scheduling for Efficient MoE-Based LLM Serving on Edge Servers》被移动计算领域国际顶级会议ACM MobiCom 2026(The 30th Annual International Conference on Mobile Computing and Networking)正式录用。该研究针对边缘服务器上混合专家(Mixture-of-Experts, MoE)大语言模型服务中的关键效率瓶颈,创新性地提出稀疏性感知的请求调度框架Saber,实现了边缘MoE模型推理吞吐量与延迟的协同优化。

本研究工作由上海交通大学云计算联合实验室与中国电信云计算研究院共同完成。研究团队由上海交通大学计算机学院陈贵海教授、常务副院长吴帆教授、郑臻哲教授及庄严博士等,与中国电信首席科学家、云计算研究院院长吴杰教授,云计算研究院黄潇瑶研究员共同组建,双方发挥各自在大模型系统优化、边缘计算和云计算平台方面的优势,紧密合作完成了本项研究。

随着大语言模型(LLM)在边缘智能应用中的广泛部署,如何在资源受限的边缘服务器上高效服务MoE架构的大模型成为一项紧迫挑战。MoE模型通过稀疏激活机制,在推理时仅调用少量专家参数,可显著降低计算与存储开销,是边缘部署的理想选择。然而,现有LLM服务系统大多继承自云端架构,在边缘场景下面临严峻的“稀疏性消失”问题:当多个请求的输入token被批处理时,不同请求激活的专家集合叠加,导致激活专家比例急剧膨胀,引发频繁的CPU-GPU专家权值交换和巨大的I/O开销,严重制约系统吞吐性能。

针对这一关键问题,该论文首次提出稀疏性感知的请求调度框架Saber。Saber的核心思想是通过组级别批处理策略,动态识别并聚合具有相似专家激活模式的请求,构建稀疏性保持的输入批次。具体而言,Saber在离线阶段预计算并聚类模型的激活路径分布,训练轻量级token分类器;在运行时,利用该分类器快速将请求分组,并采用自适应提示分块策略处理多token的预填充请求,有效保持批次内的激活稀疏性。此外,Saber设计了基于效用函数的优先级调度机制,在最大化推理吞吐量的同时,通过动态调整组优先级有效避免请求饥饿,实现了吞吐量与尾延迟的均衡优化。实验结果表明,与现有稀疏性无关的调度策略相比,Saber可将批次执行时间降低最高3.8倍,在同等延迟水平下实现最高3.27倍的吞吐量提升,同时将每批次的I/O开销降低最高1.95倍,显著提升了边缘服务器上MoE大模型服务的效率与响应能力。

Saber框架概览

ACM MobiCom是中国计算机学会(CCF)推荐的A类国际顶级学术会议,也是移动计算与无线网络领域历史最悠久、影响力最大的学术会议之一,以评审严格、录用率低、前沿性强著称。本次入选论文聚焦大模型边缘推理这一前沿研究方向,创新性地从调度策略角度突破MoE模型边缘部署的效率瓶颈,获得了审稿人的高度评价,是中国电信-上海交通大学云计算联合实验室产学研协同创新的又一重要成果。未来,团队将继续围绕云边端协同智能计算方向,持续深化理论创新与技术攻关,为推动边缘大模型服务的高效部署与规模化应用贡献力量。