
vllm-project/vllm
vllm
Инструмент позволяет запускать большие языковые модели локально и обслуживать запросы к ним с высокой скоростью. Он поддерживает более 200 архитектур моделей, включая текстовые и мультимодальные. Совместим с API в формате OpenAI, что упрощает интеграцию в готовые приложения. Работает на GPU от NVIDIA, AMD и Intel, а также на обычных процессорах.