Когда в 2017 году восемь исследователей Google Brain опубликовали статью "Attention Is All You Need", они скромно надеялись на «сотни цитирований». Спустя семь лет их работа получила почти 300 тысяч ссылок и стала фундаментом для каждой современной ИИ-системы. Это превратило её из академического труда в катализатор новой промышленной революции.
Один из авторов, Эйдан Гомес, назвал работу над Transformer «продуктивными четырьмя месяцами». До появления Transformer доминировали рекуррентные нейронные сети (RNN). Они обрабатывали данные последовательно, что создавало вычислительное узкое место, ограничивающее скорость обучения и способность моделей улавливать длинные зависимости.
Архитектура Transformer устранила рекуррентность полностью. Модель стала обрабатывать все токены параллельно, а не по очереди. Это сократило время обучения с недель до часов.
Ключевое новшество Transformer — механизм самовнимания (self-attention). В нём каждая позиция в последовательности может напрямую обращаться к любой другой позиции за постоянное время O(1), что намного быстрее, чем O(n) у RNN. Дополнительно, многоголовое внимание (multi-head attention) позволяет модели одновременно учитывать информацию из восьми разных подпространств представлений.
Результаты были решающими. На задаче англо-немецкого перевода Transformer показал 28.4 BLEU. Это превзошло все предыдущие модели, включая ансамбли. При этом модель обучилась всего за 3.5 дня на восьми графических процессорах. Сегодня каждая крупная ИИ-система — от GPT-4 и Claude до Gemini, BERT и LLaMA — построена на архитектуре Transformer.
Модель Transformer, появившаяся из скромного академического исследования, не просто улучшила машинный перевод, а переписала правила игры для всего ИИ. Её история — яркое напоминание инженерам о том, как фундаментальные прорывы могут радикально изменить индустрию, даже если их авторы изначально рассчитывают лишь на «сотни цитирований».