Предобучение — это основной этап создания больших языковых моделей, когда нейросеть обучается на огромных текстовых корпусах предсказывать следующий токен в последовательности. Обычно этот этап требует больших вычислительных ресурсов и терабайт исходных данных. В отличие от дообучения, предобучение формирует базовые языковые знания модели, а не адаптирует её под конкретную задачу.
Пример
GPT-3 прошла предобучение на сотнях миллиардов токенов из интернета, прежде чем её начали дообучать на пользовательских данных.