Стриминг — это режим вывода языковых моделей, при котором сгенерированные токены отправляются пользователю по мере их появления, а не после завершения всей генерации. Такой подход уменьшает субъективную задержку и делает интерфейс похожим на печать текста в реальном времени. Стриминг особенно полезен для длинных ответов или чатов, где важна мгновенная реакция. При этом итоговое время генерации не уменьшается, меняется только восприятие пользователем.
Пример
В ChatGPT потоковый режим включается автоматически: ответы появляются посимвольно, имитируя набор текста.