Cosmopedia — крупнейший открытый синтетический датасет для обучения больших языковых моделей, представленный Hugging Face.
Кратко:
- ●Cosmopedia содержит 25 миллиардов токенов.
- ●Использует Mixtral‑8x7B‑Instruct для генерации данных.
- ●Обучена модель Cosmo‑1B на основе Llama2.
- ●Проект открыт для воспроизводимости и доступа.
Cosmopedia: новый шаг в обучении языковых моделей
Hugging Face представила Cosmopedia — крупнейший открытый синтетический датасет для предварительного обучения больших языковых моделей (LLM). Это событие стало важной вехой в мире искусственного интеллекта, поскольку предлагает альтернативу закрытым датасетам, ранее использовавшимся для моделей серии Phi.
Объем и состав датасета
Cosmopedia включает более 30 миллионов файлов и около 25 миллиардов токенов, что делает его крупнейшим синтетическим датасетом на момент версии 0.1. Контент создается с помощью модели Mixtral‑8x7B‑Instruct‑v0.1 и включает разнообразные жанры: от учебников до блог-постов и статей в стиле WikiHow.