Сэмплирование (sampling) — это метод выбора следующего токена при генерации текста языковой моделью на основе вероятностного распределения её предсказаний. Алгоритмы сэмплирования используют параметры вроде температуры, top-p или top-k для управления случайностью и разнообразием текста. В отличие от жадного декодирования, сэмплирование не всегда выбирает самый вероятный токен.
Пример
В ChatGPT пользователь меняет температуру на 1.2, чтобы получить более разнообразные ответы: сэмплирование даёт неожиданные варианты продолжения текста.