AIHugging Faceмашинное обучениеAmazon SageMakerобучение моделей
Как обучить BART/T5 для суммаризации с Amazon SageMaker
Анна Волкова18 августа 2026 г.5 мин чтения
Рассматриваем обучение Seq2Seq моделей BART и T5 с использованием Hugging Face Transformers и Amazon SageMaker.
Кратко:
●Использование SageMaker для распределённого обучения
●Настройка среды и гиперпараметров
●Экономическая эффективность процесса
●Возможности и примеры использования
Обучение моделей BART и T5 для суммаризации
8 апреля 2021 года на блоге Hugging Face была опубликована статья, посвящённая обучению моделей BART и T5 с использованием 🤗 Transformers и Amazon SageMaker. Это подробное руководство объясняет, как эффективно применять Deep Learning Containers для распределённого обучения Seq2Seq моделей в задачах суммаризации.
Шаги реализации
В статье подробно описаны шаги по настройке среды и обучению моделей:
●
Установка и настройка: Используются пакеты sagemaker, transformers, datasets, работа через SageMaker Notebook или локальный SDK. Это позволяет создать оптимальную среду для обучения моделей.
●Использование примеров: Пример run_summarization.py адаптирован для версии v4.4.2, что упрощает настройку и запуск обучения.
●Настройка модели и данных: Модель BART-large-cnn обучается на датасете SAMSum, содержащем около 16 тысяч диалогов с референтными суммаризациями.
●Гиперпараметры: Включают per_device_train_batch_size=4, num_train_epochs=3, learning_rate=5e-5, использование fp16 и другие.
●Распределённое обучение: Используется SageMaker Data Parallelism с конфигурацией distribution = {'smdistributed':{'dataparallel':{'enabled':True}}}.
Производительность и стоимость
Обучение заняло 2882 секунды, что эквивалентно примерно 28 долларов на 16 GPU V100. Это демонстрирует экономическую эффективность и высокую производительность распределённого обучения.
Дальнейшая работа с моделью
После обучения модель сохраняется на S3 и загружается на Hugging Face Hub, где создаётся model_card с метриками, такими как ROGUE-1/2/L. Это позволяет протестировать модель через интерфейс Inference Widget.
Современные возможности SageMaker
SageMaker AI поддерживает различные стратегии распределённого обучения, включая data-parallelism и model-parallelism. Это даёт возможность масштабировать обучение и оптимизировать коммуникационные затраты. Подробнее об этом можно узнать в документации AWS.
Перспективы развития технологий
Несмотря на то, что базовый туториал был опубликован в 2021 году, он остаётся актуальным. Однако, технологии не стоят на месте, и появляются новые инструменты, такие как FSDP и LoRA, которые могут использоваться для более тонкой настройки моделей.
Частые вопросы
Какой датасет использовался для обучения?
Использовался датасет SAMSum, содержащий около 16 тысяч диалогов с референтными суммаризациями.
Какие гиперпараметры применялись?
Основные гиперпараметры включают per_device_train_batch_size=4, num_train_epochs=3, и learning_rate=5e-5.
Почему используется именно SageMaker для обучения?
SageMaker предоставляет удобные инструменты для распределённого обучения и масштабирования моделей, что делает его идеальным выбором для таких задач.
Каковы результаты обучения?
Модель достигла метрик ROGUE-1 ≈ 42.62 на валидации и ROGUE-1 ≈ 41.32 на тесте.