vLLM
БесплатноЛокальные модели
Берём для быстрого self-host инференса под нагрузкой
vLLM — открытый движок и сервер инференса с высокой пропускной способностью (PagedAttention), популярный для self-host LLM в продакшне.
Подходит, когда нужно обслуживать модель многим пользователям эффективно, с OpenAI-совместимым API.
Открыть сайт
Кому: Командам, разворачивающим открытые модели в проде с высокой нагрузкой.
Что умеет
- Высокая пропускная способность
- PagedAttention
- OpenAI-совместимый сервер
- Поддержка многих моделей
Плюсы
- Отличная производительность
- Стандарт для self-host
- Открытый код
На что обратить внимание
- Нужны GPU и DevOps
- Сложнее десктоп-приложений
Цена
Бесплатно. Бесплатно, открытый код.
#инференс#self-host#open-source