vLLM
Related tags:
Posts about vllmPosts about ai-inferencePosts about devopsPosts about cicdPosts about mixture-of-expertsPosts about data-science
Exploring Speculative Decoding in vLLM on AMD GPUsIsoExec: Unified Execution to Eliminate Trainer-Inference Mismatch in SkyRLDistributed Layerwise Offload: Scaling Toward 200B+ DiT Models Efficiently in vLLM-OmniAdaptive Verification in vLLM: DSpark confidence-scheduled verificationDay 0 Support for Qwen3.8-2.4T-A95B on vLLMAnnouncing Day-0 Support for NVIDIA Nemotron 3.5 Lightning on vLLMEfficient Decode Context Parallelism with vLLM for Long Context WorkloadsvLLM Reaches 25K Total TPS/GPU on Qwen3.5Optimizing vLLM on Arm CPUsParallel All the Way Down: Beyond Single-Token Generation with Speculative Decoding