An architectural exploration of latency, throughput trade-offs, hardware utilization, and optimization strategies for scaling modern LLM inference workloads.