EXPLORE
dhruvhead/LMCache MIRROR
amdcudafastinferencekv-cache
Python 0 0 5
dhruvhead/vllm-omni MIRROR
audio-generationdiffusionimage-generationinferencemodel-serving
Python 0 0
dhruvhead/Mooncake MIRROR
disaggregationinferencekvcachellmrdma
C++ 0 0 3
dhruvhead/text-generation-inference MIRROR
bloomdeep-learningfalcongptinference
Python 0 0 109
dhruvhead/vllm MIRROR
amdblackwellcudadeepseekdeepseek-v3
Python 0 0 1
sgl-project/sglang
SGLang is a high-performance serving framework for large language models and multimodal models.
attentionblackwellcudadeepseekdiffusion
Python 0 0 89
ggml-org/whisper.cpp MIRROR
Port of OpenAI's Whisper model in C/C++
inferenceopenaispeech-recognitionspeech-to-texttransformer
C++ 0 0 68
hpcaitech/ColossalAI MIRROR
Making large AI models cheaper, faster and more accessible
aibig-modeldata-parallelismdeep-learningdistributed-computing
Python 0 0 47