InferSurge · AI 算力中心吞吐模拟器

返回首页
00:00已暂停
准备就绪
点击播放运行场景:基线请求、整点 cron 羊群、有效算力降容、重试放大与恢复排队。

推理集群 · 30 个服务阶段位 · 6 个 GPU worker 排队空载速率

时间–服务进度图 服务进度 vs. 时间,颜色表示服务速率

吞吐–负载基本图 吞吐率与系统负载,来自各观测点

完成吞吐 请求/秒

等待队列深度 等待中的请求数

端到端延迟

算力模型原理。 每个 worker 是一条占用槽位链。请求只有在空载服务时间,或前序槽释放并经过调度开销 τ 后才能前进。 并行 worker 数、τ 与服务速率共同决定有效容量。当到达(含对齐的 cron 突发与 retry storm)超过有效容量时,差额变成等待队列; 恢复容量只恢复服务速率,队列仍按容量排出。将突发在时间窗内错开(stagger),是在不增加 GPU 的前提下削峰的一等手段。