InferSurge
· AI 算力中心吞吐模拟器
返回首页
演示模式
沙盒
00:00
已暂停
准备就绪
点击
播放
运行场景:基线请求、整点 cron 羊群、有效算力降容、重试放大与恢复排队。
推理集群 · 30 个服务阶段位 · 6 个 GPU worker
排队
空载速率
局部视图
24 阶段位
跟随拥塞
时间–服务进度图
服务进度 vs. 时间,颜色表示服务速率
理论堆积 / 恢复波
吞吐–负载基本图
吞吐率与系统负载,来自各观测点
完成吞吐
请求/秒
等待队列深度
等待中的请求数
端到端延迟
秒
播放
重启
1×
5×
15×
30×
60×
步进 1 个事件
步进 1 秒
基线到达率
55
请求/秒
cron 突发倍率
4.0
×
错峰窗口
0
秒
空载服务参数
108
调度开销 τ
1.40
秒
拥塞位置
24
阶段位
开启 retry storm
重试放大
0.6
×
高峰有效容量
100
%
失效 worker
1
2
4
触发算力降容
降容事件类型
GPU 池维护
高峰限流
模型切换
GPU worker 总数
4
6
8
算力模型原理。
每个 worker 是一条占用槽位链。请求只有在空载服务时间,或前序槽释放并经过调度开销 τ 后才能前进。 并行 worker 数、τ 与服务速率共同决定有效容量。当到达(含对齐的 cron 突发与 retry storm)超过有效容量时,差额变成等待队列; 恢复容量只恢复服务速率,队列仍按容量排出。将突发在时间窗内错开(stagger),是在不增加 GPU 的前提下削峰的一等手段。