Agentic serving: cost efficiency vs. interactivity
Best-performing vLLM Pareto curves on AgentX traces
P90 interactivity
Cost efficiency
TCO: GB300 $2.31/GPU-hour; B300 $2.26/GPU-hour · Source: SemiAnalysis InferenceX