HeadlinesBriefing favicon HeadlinesBriefing.com

Ollama vs vLLM vs SGLang: Сравнение

ByteByteGo •
×

Для запуска моделей с открытыми весами локально команды выбирают между Ollama, vLLM и SGLang. Каждый движок обрабатывает запросы по-разному. Ollama ставит запросы в очередь через FIFO и запускает предварительно квантованные модели GGUF, что лучше всего подходит для локальной разработки и оборудования ноутбуков через API, совместимый с OpenAI.

Для обслуживания высокого трафика vLLM использует непрерывную пакетную обработку и Paged Attention для хранения KV-кэшей. Это вставляет новые запросы в выполняющиеся пакеты, максимизируя использование GPU для тысяч одновременных пользователей. Тем временем SGLang ориентирован на ИИ-агентов и многооборотные чаты с планировщиком, учитывающим префиксы, и кэшем Radix Attention. Он повторно использует общие префиксы промптов вместо их пересчета, оптимизируя циклы инструментов и структурированные выводы.

Кроме того, Anthropic поделилась планами по водяным знакам текста для выявления контента, созданного ИИ. LLM обычно случайным образом выбирают вероятности следующего слова. При водяном знаке ключевая функция ограничивает допустимые кандидаты на основе секретного ключа и предыдущих слов. Детекция проверяет, совпадают ли слова-кандидаты с этим правилом по всему тексту, вычисляя оценку ИИ, несмотря на постоянные опасения по поводу ложноотрицательных результатов.

Ключевые сущности: Компании: Anthropic, ByteByteGo, GitHub | Люди: [PERSON_NAME]

Вопрос: Как работает водяной знак текста ИИ?

Он изменяет распределения вероятностей следующего слова, используя секретный ключ во время генерации, внедряя обнаруживаемые сигналы, которые можно проверить, убедившись, что сгенерированные слова соответствуют заранее определенным допустимым кандидатам по всему тексту.