Почему LLM замирает? Длинные запросы и Chunked Prefill
Почему короткий вопрос к LLM может ждать, пока обрабатывается чужой длинный документ? Разбираем на схемах, как prefill и decode используют общую GPU и как chunked prefill помогает уменьшить паузы в генерации. Эффект зависит от движка, планировщика и нагрузки: длинный запрос не обязательно замедляет всех пользователей. Показываю, что проверить перед покупкой ещё одной видеокарты. 00:00 Почему чужой документ мешает вашему ответу 00:19 Prefill и decode: два этапа работы LLM 00:41 Как длинный prefill задерживает генерацию 01:03 От чего зависит задержка 01:26 Chunked prefill: обработка по частям 01:45 Компромисс: плавность и скорость 02:03 Какие задержки измерять 02:22 Что проверить перед масштабированием Это первый выпуск серии «LLM в продакшене: неочевидные проблемы и решения». Подписывайтесь на АйтиЭкспресс — короткие разборы архитектуры и инженерных решений. Автор — Ксения Погорельских. Источники для тех, кто хочет разобраться глубже: vLLM — Chunked Prefill и настройка производительности: https://docs.vllm.ai/en/stable/configuration/optimization/ SARATHI — исследование обработки prefill по частям: https://arxiv.org/abs/2308.16369 vLLM — метрики инференса: https://docs.vllm.ai/en/latest/design/metrics/ Голос и видео ведущей — оригинальная запись. Изображение рисующей руки создано с помощью ИИ. #LLM #Архитектура #АйтиЭкспресс
Название:
Почему LLM замирает? Длинные запросы и Chunked Prefill
Категория:
Разное