MTBF · Mean Time Between Failures
The average operating time between failures of a component or system, a core reliability input.
Current numbers
flap every ~48 slink-flap cadence in a 10M-optic fleet (hard failure only every few days); MTTF far below MTBF
>90%goodput (effective-training-time) achievable despite ~3-hr cluster MTBF, given automated validation + recovery
~7 days / one 512-H100 clusterreported MTBF for one 512-H100 cluster at a top-tier operator; not a per-GPU rate or portable fleet baseline