Спекулятивное декодирование — метод ускорения генерации текста, в котором быстрая малая модель предлагает несколько вариантов токенов, а большая проверяет их одновременно. Такой подход позволяет сократить время инференса без ухудшения итогового качества текста. Этот метод не изменяет структуру самой языковой модели.
Пример
В некоторых сервисах генерации текстов OpenAI применяет speculative decoding для повышения скорости отклика без потери точности.