SGLang#
SGLang – компонент DropApp для сервисного развертывания крупных языковых (LLM) и визуально-языковых моделей (VLM). Он предназначен для обеспечения низкой задержки и высокой пропускной способности вывода (инференс) в различных конфигурациях, от одного GPU до крупных распределенных кластеров.
Основные функции:
Быстрый фоновой режим выполнения:
Обеспечивает эффективное обслуживание с RadixAttention для оптимизации кеша префиксов.
Минимальная нагрузка на CPU благодаря собственному планировщику, что позволяет эффективно использовать ресурсы.
Разделение процессов заполнения и декодирования для повышения производительности.
Спекулятивное декодирование и непрерывная пакетная обработка для оптимизации обработки данных в реальном времени.
Использование механизма paged attention и возможность параллельной обработки тензоров, конвейеров, экспертов и данных для повышения скорости обработки.
Структурированные выходные данные и пакетное предварительное заполнение для более удобного управления потоками данных.
Квантование (FP4/FP8/INT4/AWQ/GPTQ) и многопакетная обработка с использованием LoRA для оптимизации моделей и уменьшения объема памяти.
Широкая поддержка моделей:
Поддержка различных генеративных моделей (Llama, Qwen, DeepSeek, Kimi, GLM, GPT, Gemma, Mistral и др.), эмбеддинговых моделей (e5-mistral, gte, mcdse) и моделей вознаграждения (Skywork);
Легкая расширяемость для интеграции новых моделей;
Совместимость с большинством моделей Hugging Face и API OpenAI.
Широкая поддержка аппаратного обеспечения, работает на:
GPU NVIDIA (GB200/B300/H100/A100/Spark);
GPU AMD (MI355/MI300);
CPU Intel Xeon;
TPU Google;
NPU Ascend;
и других.
Гибкий язык фронтенда:
Предлагает интуитивно понятный интерфейс для разработки приложений LLM;
Поддерживает цепочечные вызовы генерации, продвинутые подсказки, управление потоками, мультимодальные входные данные, параллелизм и внешние взаимодействия.