中国电信云计算研究院提出Serverless GPU“安全超售”新算法,成果获顶刊IEEE TC录用
2026-09-10

近日,由中国电信云计算研究院杨亚南、黄潇瑶以及吴杰院长等人联合天翼云科技有限公司合作完成的论文《Exploring SLO-aware GPU Function Overselling in Multi-tenant FaaS Platforms》被CCF-A类期刊IEEE Transactions on Computers(IEEE TC)录取。该研究针对当前Serverless GPU函数资源超售所面临的用户性能下降问题,提出了一种SLO感知的GPU超售策略,从而在避免引起用户性能剧烈波动的前提下实现安全的资源超售。

GPU超售是降低云成本的有效手段但也是一把双刃剑:过度超售会导致用户请求排队等待时间过长,导致用户服务延迟增加甚至违反SLO,最终引发用户流失。如何把控合理的超售力度,在“省钱”和“保体验”之间找到平衡点,是云厂商长期面临的难题。从数学上看,云厂商的总收益可以建模为标准价格收入、折扣吸引新客带来的增量收入,再减去租户流失带来的隐性损失。但这个模型几乎无法直接求解—有多少用户会选择超售模式、折扣能吸引多少新用户、租户流失函数的定义这些都无从知晓。同时,这些变量不仅随时间动态变化,还彼此耦合,因此也无法对超售力度进行准确量化。

SOT算法动态调整超售力度示意图

正因如此,与其硬算一个不存在的“最优解”,不如换个思路:设计一套反馈机制,让系统利用“强化学习”思想在实际运行中自己摸索出合适的超售力度。针对该问题,该工作设计了一套SLO感知的超售调节算法(简称SOT算法)来实现对超售力度的控制。该算法巧妙地引入了一个控制参数—“用户延迟预测裕量”,调度器在执行请求前会按该裕量对预估时间进行放大,裕量越大则调度越保守、超售强度越低,反之则超售更激进。同时,该工作采用了一种非对称的“预测裕量”更新策略,其控制逻辑借鉴了TCP拥塞控制中经典的“快回退、慢增长”思路:一旦检测到性能出问题,就快速降低超售强度;如果一切正常,则缓慢试探性提高超售力度,直到逼近那个“既省钱又不超时”的临界点。测试结果显示,SOT算法可在满足95%以上用户延迟目标的前提下,实现24%-43%的GPU资源的超售率。

作为中国电信科技创新的重要研究机构,中国电信云计算研究院持续推进“智能泛在云”技术体系建设,不断深化前沿技术研究。未来,中国电信云计算研究院将继续聚焦Serverless AI推理平台性能优化研究,为降低Token生产成本贡献力量。

中国电信云计算研究院提出Serverless GPU“安全超售”新算法,成果获顶刊IEEE TC录用
2026-09-10

近日,由中国电信云计算研究院杨亚南、黄潇瑶以及吴杰院长等人联合天翼云科技有限公司合作完成的论文《Exploring SLO-aware GPU Function Overselling in Multi-tenant FaaS Platforms》被CCF-A类期刊IEEE Transactions on Computers(IEEE TC)录取。该研究针对当前Serverless GPU函数资源超售所面临的用户性能下降问题,提出了一种SLO感知的GPU超售策略,从而在避免引起用户性能剧烈波动的前提下实现安全的资源超售。

GPU超售是降低云成本的有效手段但也是一把双刃剑:过度超售会导致用户请求排队等待时间过长,导致用户服务延迟增加甚至违反SLO,最终引发用户流失。如何把控合理的超售力度,在“省钱”和“保体验”之间找到平衡点,是云厂商长期面临的难题。从数学上看,云厂商的总收益可以建模为标准价格收入、折扣吸引新客带来的增量收入,再减去租户流失带来的隐性损失。但这个模型几乎无法直接求解—有多少用户会选择超售模式、折扣能吸引多少新用户、租户流失函数的定义这些都无从知晓。同时,这些变量不仅随时间动态变化,还彼此耦合,因此也无法对超售力度进行准确量化。

SOT算法动态调整超售力度示意图

正因如此,与其硬算一个不存在的“最优解”,不如换个思路:设计一套反馈机制,让系统利用“强化学习”思想在实际运行中自己摸索出合适的超售力度。针对该问题,该工作设计了一套SLO感知的超售调节算法(简称SOT算法)来实现对超售力度的控制。该算法巧妙地引入了一个控制参数—“用户延迟预测裕量”,调度器在执行请求前会按该裕量对预估时间进行放大,裕量越大则调度越保守、超售强度越低,反之则超售更激进。同时,该工作采用了一种非对称的“预测裕量”更新策略,其控制逻辑借鉴了TCP拥塞控制中经典的“快回退、慢增长”思路:一旦检测到性能出问题,就快速降低超售强度;如果一切正常,则缓慢试探性提高超售力度,直到逼近那个“既省钱又不超时”的临界点。测试结果显示,SOT算法可在满足95%以上用户延迟目标的前提下,实现24%-43%的GPU资源的超售率。

作为中国电信科技创新的重要研究机构,中国电信云计算研究院持续推进“智能泛在云”技术体系建设,不断深化前沿技术研究。未来,中国电信云计算研究院将继续聚焦Serverless AI推理平台性能优化研究,为降低Token生产成本贡献力量。