Why workloads move.
WHAT INVOLUNTARY DISRUPTION IS
A node failing, running out of resources, or being lost.
WHAT VOLUNTARY DISRUPTION IS
Something deliberate: draining a node, scaling down, upgrading.
WHY THE DISTINCTION MATTERS
Only the voluntary kind can be controlled.
WHAT A DISRUPTION BUDGET DOES
Limits how much voluntary disruption is permitted at once.
WHAT IT CANNOT DO
Prevent a node failing.
WHAT THAT MEANS
Resilience still requires replicas spread across nodes.
WHAT TO SET FOR A SERVICE
A minimum number available, below the replica count.
WHAT HAPPENS IF THE BUDGET CANNOT BE MET
Draining waits, indefinitely.
WHY THAT CAUSES PROBLEMS
Node maintenance blocks, and nobody understands why.
WHAT THE COMMONEST CAUSE IS
A budget requiring all replicas available.
WHAT TO AVOID
Budgets on single-replica workloads requiring one available.
WHY
It can never be drained.
WHAT TO DO INSTEAD
Accept brief unavailability, or run more than one.
WHAT ELSE CAUSES EVICTION
Node pressure on memory or disk.
WHAT IS EVICTED FIRST
Pods exceeding their requests, and those with none.
WHAT THAT ARGUES FOR
Setting requests honestly.
WHAT TO TEST
Draining a node, and watching what happens.