Контекстное окно — это максимальное количество токенов, которые языковая модель может обработать за один раз. В пределах контекстного окна модель учитывает всю последовательность текста для генерации ответа. Размер окна ограничивает, сколько информации модель может держать в «памяти» без потери важного контекста. Контекстное окно не равно количеству слов: один токен может быть словом, частью слова или знаком.
Пример
В GPT-4o контекстное окно — 128 тысяч токенов. Это позволяет загружать в чат длинные документы, чтобы модель анализировала их полностью в одном запросе.