Трансформер (transformer) — архитектура нейросети, впервые описанная Google в 2017 году в статье «Attention is All You Need». Трансформеры легли в основу всех современных LLM и используют механизм внимания для анализа последовательности токенов в тексте. Эта архитектура позволяет эффективно обрабатывать длинные тексты и учитывать связи между удалёнными словами. Трансформер отличается от рекуррентных сетей тем, что работает с текстом параллельно, а не последовательно.
Пример
GPT-4o и Claude Opus построены на архитектуре трансформеров, поэтому способны работать с большими объёмами текста и сложными задачами.