Glossaire
IA

Transformer

Aussi : Transformer architecture, Transformer model, Attention-based model

Un Transformer est une architecture de réseau de neurones qui utilise le self-attention pour traiter des séquences en parallèle. Elle est au cœur de la plupart des modèles de langage et d'IA générative actuels.

De quoi il s'agit

Un Transformer est une architecture de deep learning introduite en 2017 dans l'article « Attention Is All You Need ». Elle traite des données séquentielles (texte, code, tokens audio) à l'aide d'un mécanisme appelé self-attention, et non par la récurrence pas à pas des modèles antérieurs comme les RNN et les LSTM. Elle peut ainsi pondérer les relations entre tous les éléments d'une séquence en une seule fois, quelle que soit la distance qui les sépare.

Pourquoi c'est important

Avant les Transformers, les modèles de séquence traitaient les tokens un par un : entraînement lent et mauvaise capture des dépendances à longue portée. Les Transformers ont changé cela :

  • Parallélisation du calcul : tous les tokens sont traités simultanément, ce qui rend l'entraînement sur de gros volumes de données et sur GPU/TPU bien plus efficace.
  • Bon passage à l'échelle : les performances continuent de s'améliorer à mesure que les données, les paramètres et la puissance de calcul augmentent. C'est le fondement des large language models (LLM).
  • Généralisation entre domaines : le même design de base alimente aujourd'hui le texte, les images (Vision Transformers), l'audio et les systèmes multimodaux.

Le Transformer est la colonne vertébrale de familles de modèles connues comme GPT, BERT, T5, et de nombreux modèles open source.

Comment ça marche (en bref)

  • Tokenisation et embeddings : l'entrée est découpée en tokens puis convertie en vecteurs numériques.
  • Positional encoding : l'attention n'intègre pas d'ordre par construction, on ajoute donc l'information de position pour que le modèle connaisse la séquence des tokens.
  • Self-attention : chaque token calcule des vecteurs Query, Key et Value pour déterminer le degré d'« attention » à porter à chacun des autres tokens.
  • Multi-head attention : plusieurs calculs d'attention tournent en parallèle pour capturer différentes relations.
  • Couches feed-forward et connexions résiduelles : des blocs empilés affinent la représentation, avec de la normalisation pour stabiliser l'entraînement.

Parmi les variantes : encoder-only (bon pour la compréhension, par exemple la classification), decoder-only (bon pour la génération, par exemple les chatbots) et encoder-decoder (bon pour la traduction ou le résumé).

Un exemple concret

Prenez la phrase : « Le trophée n'entrait pas dans la valise parce qu'il était trop grand. » Un Transformer utilise le self-attention pour relier « il » à « trophée » plutôt qu'à « valise », en s'appuyant sur le contexte de toute la phrase. En pratique, une équipe support client peut fine-tuner un Transformer decoder-only sur ses tickets passés pour qu'il rédige des réponses justes, tandis qu'une équipe finance peut utiliser un modèle encoder pour classer des libellés de transactions à grande échelle.

Transformer Block (simplified flow)Input TokensEmbedding + PositionMulti-HeadSelf-AttentionFeed-Forward LayerOutputStacked N times
Data flow through a single Transformer block, repeated across stacked layers.

Voir aussi

Questions fréquentes

Qu'est-ce qu'un Transformer en IA ?

Un Transformer est une architecture de deep learning, présentée en 2017 dans l'article « Attention Is All You Need », qui traite des séquences (texte, code, tokens audio) grâce au self-attention plutôt qu'au traitement séquentiel pas à pas des RNN et LSTM. Il pondère d'un coup les relations entre tous les tokens d'une séquence, quelle que soit leur distance. C'est l'architecture qui sous-tend GPT, BERT ou T5.

Pourquoi les Transformers ont-ils remplacé les RNN et LSTM ?

Parce qu'ils s'entraînent beaucoup plus vite et gèrent mieux les dépendances longues. Les RNN et LSTM traitent les tokens un par un, ce qui est lent et fait perdre le contexte éloigné ; un Transformer traite tous les tokens en parallèle et exploite donc efficacement les GPU et TPU. Ses performances continuent aussi de progresser avec les données, les paramètres et la puissance de calcul, ce qui a rendu possibles les grands modèles de langage.

Quelle différence entre un Transformer encoder-only, decoder-only et encoder-decoder ?

La différence porte sur la tâche visée. Les modèles encoder-only (type BERT) conviennent à la compréhension, par exemple la classification ; les decoder-only (type GPT) à la génération, donc aux chatbots ; les encoder-decoder (type T5) à la traduction et au résumé, où l'on transforme une séquence d'entrée en séquence de sortie. Le mécanisme de self-attention reste le même dans les trois cas.

Comment fonctionne concrètement le self-attention ?

Chaque token produit trois vecteurs, Query, Key et Value, qui servent à déterminer l'attention qu'il porte à chacun des autres tokens de la séquence. Plusieurs de ces calculs tournent en parallèle (multi-head attention) pour capter différents types de relations, puis des couches feed-forward, des connexions résiduelles et une normalisation affinent la représentation au fil des blocs empilés. Comme l'attention n'intègre aucune notion d'ordre, un positional encoding est ajouté pour indiquer la position des tokens.

Un Transformer sert-il uniquement au texte ?

Non. La même architecture de base traite aujourd'hui les images via les Vision Transformers, l'audio, ainsi que des systèmes multimodaux combinant plusieurs types d'entrées. Cette capacité à généraliser explique en partie sa diffusion rapide au-delà du traitement du langage.