SLO · Service Level Objective
A target for a service metric such as latency or availability that an inference fleet is sized to meet.
Current numbers
2:1–3:1 examples; ~31% modeled 2:1 cost deltareported 2:1–3:1 inference examples; derive each tier from measured traffic, placement, failure headroom, and tail-latency SLO
1:1 vs 2:1–3:1published scale-out examples (1:1, 2:1–3:1, reported 7:1) — derive from measured traffic, topology and SLO; contested
1:1 vs 2:1–3:1published scale-out examples (1:1, 2:1–3:1, reported 7:1) — derive from measured traffic, topology and SLO; contested