Criterion measured CPU preparation cases and saved reusable baseline estimates. Confidence intervals and outlier reports exposed interference from concurrent machine work.
- What worked
- Named groups, custom stage timers, and persisted JSON estimates supported comparisons.
- What got in the way
- Concurrent builds widened some intervals. These results need isolated repetition before performance acceptance.
