Configuration Reference

Complete schema for mlsrvyn.yaml. Each model endpoint gets its own configuration block. Workspace-level settings apply globally.

Top-level structure

SLO block

FieldTypeDescription
p50_msintegerMedian latency target in milliseconds. Optional — used as soft scaling threshold.
p90_msinteger90th percentile latency target. Optional.
p99_msinteger99th percentile latency target. Required for SLO enforcement.
ttft_p90_msintegerTime-to-first-token p90 target. LLM endpoints only.

Scaling block

FieldTypeDefaultDescription
min_replicasinteger1Minimum replicas to keep warm at all times.
max_replicasinteger20Maximum replicas allowed.
scale_up_slo_pctinteger80Scale out when p99 reaches this percentage of the SLO budget.
scale_batch_sizeinteger1Number of replicas to add per scale-out event.
prewarm_minutes_before_peakintegerBursty archetype: minutes before predicted peak to pre-warm replicas.
sessions_per_replicaintegerSteady (LLM) archetype: max concurrent sessions per replica before scaling.
scaling_metricstringp99_latencyOverride: p99_latency, concurrent_sessions, queue_depth, gpu_utilization.

Bin-packing block

Next steps