Латентность — это время, которое проходит с момента отправки запроса языковой модели до появления первого токена ответа (метрика TTFT — Time to First Token). Этот показатель критичен для пользовательского опыта в чатах и AI-продуктах, так как влияет на ощущение скорости работы. На латентность влияют провайдер, нагрузки на сервис и размер модели. Латентность не равна общей длительности ответа: она измеряет только задержку старта вывода.
Пример
При работе с API OpenAI задержка между отправкой запроса и появлением первого слова ответа называется латентностью и напрямую ощущается пользователем.