Agentic serving: cost efficiency vs. interactivity

Best-performing vLLM Pareto curves on AgentX traces
TCO: GB300 $2.31/GPU-hour; B300 $2.26/GPU-hour · Source: SemiAnalysis InferenceX