KV-кэш — это архитектурная оптимизация, используемая в больших языковых моделях для ускорения инференса. Она хранит промежуточные значения (Key-Value) для уже обработанных токенов, чтобы не вычислять их повторно при генерации очередного токена. Такая схема значительно уменьшает задержку и стоимость генерации длинных последовательностей. Иногда ошибочно полагают, что KV-кэш увеличивает размер контекстного окна, но он только ускоряет работу с уже обработанным контекстом.
Пример
В GPT-4 при генерации длинного текста KV-кэш сохраняет ключи и значения для первых 1000 токенов, чтобы не пересчитывать их при каждом следующем шаге.