Tests A/B : pourquoi la plupart ne concluent rien
Un test A/B compare deux versions d'une même page pour déterminer laquelle produit le meilleur résultat. Sa difficulté n'est pas technique mais statistique et elle coûte cher : la plupart des tests menés en PME n'ont jamais assez de trafic pour distinguer un effet réel d'une fluctuation et sont pourtant déclarés concluants, puis facturés.
- Le nombre de conversions nécessaires se calcule avant de lancer le test, jamais après.
- Arrêter un test dès qu'une variante prend l'avance est la façon la plus courante de se tromper.
- Un test doit couvrir des semaines entières pour absorber les variations de jour et de cycle.
- Sous un certain volume, il vaut mieux appliquer les bonnes pratiques que tester. C'est aussi beaucoup moins cher.
- Un test mal conçu ne donne pas zéro information, il en donne une fausse et des décisions coûteuses en découlent.
Sur cette page
Test A/B
Un test A/B est une expérience où deux versions d'une même page ou d'un même message sont montrées simultanément à des groupes de visiteurs répartis au hasard, afin de comparer leur taux de conversion. Sa validité repose sur trois conditions : une répartition aléatoire, un volume suffisant pour que l'écart observé ne soit pas dû au hasard et une durée couvrant un cycle complet de comportement.
La question du volume, qui décide de tout
Pour une direction, le vrai enjeu d'un programme de tests n'est pas la conversion gagnée, c'est le risque de payer pour des conclusions fausses. Un test sous-dimensionné produit un gagnant apparent, l'équipe l'applique et l'entreprise décide sur du bruit. Le calcul qui l'évite prend dix minutes et se fait avant de dépenser un dollar.
Si on vous a déjà présenté un test « concluant » suivi d'aucune amélioration des ventes, c'est presque toujours ce qui s'est produit. Un test se conduit comme un contrôle de qualité : sans taille d'échantillon suffisante, le résultat n'est pas discutable, il est simplement invalide.
C'est le point où la majorité des démarches de test échouent et il se règle avant de commencer.
Détecter un écart demande d'autant plus d'observations que l'écart est petit. Passer de 2 % à 4 % de conversion se détecte avec peu de trafic, parce que l'effet est énorme. Passer de 2 % à 2,2 % demande plus de cent mille visiteurs par variante, parce que l'effet est du même ordre de grandeur que le bruit.
Or les gains réalistes se situent presque toujours du côté des petits écarts. C'est ce décalage qui explique pourquoi tant de tests sont lancés sans jamais pouvoir conclure et pourquoi le budget qu'ils consomment aurait mieux servi ailleurs.
| Taux de départ | Effet à détecter | Ordre de grandeur nécessaire par variante |
|---|---|---|
| 2 % | Doublement, vers 4 % | Quelques milliers de visiteurs |
| 2 % | Hausse de 25 %, vers 2,5 % | Quelques dizaines de milliers |
| 2 % | Hausse de 10 %, vers 2,2 % | Plus de cent mille |
| 10 % | Hausse de 10 %, vers 11 % | Quelques dizaines de milliers |
Le calcul se fait avec un calculateur de taille d'échantillon, avant de lancer. Si le nombre de visiteurs nécessaire dépasse ce que la page reçoit en deux mois, le test n'aura pas lieu. Mieux vaut le savoir avant de configurer l'outil.
Ce qu'il faut vérifier avant d'autoriser un programme de tests
Un test crédible demande deux semaines entières au minimum et un volume de conversions calculé d'avance. Sous ce seuil, il ne coûte pas seulement du temps : il produit des conclusions fausses sur lesquelles l'entreprise engage ensuite des décisions. Le Baymard Institute mesure jusqu'à 35 % de hausse de conversion atteignable par la seule conception du tunnel, sans aucun test. C'est presque toujours le meilleur point de départ.
- Combien de conversions par semaine cette page produit-elle et combien en faudrait-il pour conclure ?
- Le calcul de taille d'échantillon a-t-il été fait avant le lancement et par qui ?
- Sur quoi mesure-t-on la victoire, le clic ou la vente ?
- Combien de tests lancés l'an dernier ont mené à un changement qu'on a gardé ?
- Y a-t-il des correctifs connus à appliquer avant de tester quoi que ce soit ?
Une bonne réponse donne un nombre de conversions nécessaires calculé d'avance et accepte de dire qu'un test est impossible. Une réponse molle propose de tester des couleurs de bouton, ou promet un pourcentage de gain avant d'avoir mesuré.
Décider si votre volume permet de tester, ou s'il vaut mieux corriger sans tester, se règle en une rencontre. Une consultation de 90 minutes le tranche sur vos chiffres réels, avec une synthèse écrite qui circule dans votre organisation.
Les erreurs de méthode qui invalident un test
Arrêter dès qu'une variante prend l'avance
C'est l'erreur la plus fréquente et la plus coûteuse. En début de test, les écarts sont énormes et purement aléatoires. Regarder les résultats chaque jour et arrêter au premier écart favorable garantit de conclure sur du bruit.
Tester moins d'une semaine complète
Le comportement d'achat varie fortement selon le jour. Un test lancé un mardi et arrêté un vendredi compare deux populations différentes. La règle est de couvrir des semaines entières, deux au minimum.
Tester plusieurs éléments à la fois
Changer le titre, le bouton et l'image simultanément produit un résultat sans explication. On saura que la version B gagne, jamais pourquoi, donc rien ne sera transférable ailleurs.
Mesurer le clic plutôt que la vente
Une variante peut augmenter les clics sur un bouton et réduire les ventes, si elle attire des visiteurs moins qualifiés. L'indicateur de succès doit être l'action commerciale finale.
Lancer plusieurs tests sur le même parcours
Deux tests simultanés sur des pages successives se contaminent mutuellement. Les résultats deviennent ininterprétables et personne ne s'en aperçoit.
Un test déclaré concluant à 95 % de confiance se trompe une fois sur vingt. Sur vingt tests menés dans l'année, un résultat est faux en moyenne et rien ne le distingue des autres. C'est une raison de retester les changements importants, pas de renoncer aux tests, dont le coût reste inférieur à celui d'une refonte décidée à l'aveugle.
Quoi tester en priorité
L'ordre suit le revenu attendu, pas la facilité de mise en oeuvre. Tester un détail sur une page à faible trafic coûte des semaines pour un gain nul.
L'ordre compte, parce que le volume disponible est limité et que chaque test en consomme une part.
| Rang | Élément | Amplitude d'effet attendue |
|---|---|---|
| 1 | La proposition principale et le titre | Forte |
| 2 | Le nombre de champs d'un formulaire | Forte |
| 3 | La présence et la place de la preuve | Moyenne à forte |
| 4 | La structure des prix et des options | Moyenne à forte |
| 5 | Le libellé de l'appel à l'action | Faible à moyenne |
| 6 | La couleur d'un bouton | Négligeable |
La dernière ligne mérite d'être dite clairement. Les tests de couleur de bouton circulent depuis quinze ans comme exemple canonique et ils produisent des effets si petits qu'aucun site de PME n'a le volume pour les détecter. Le temps consacré à ce genre de test est du temps retiré aux quatre premières lignes.
Ce qui reste à l'interne est la définition de ce qui compte comme succès. Une conversion n'est pas la même chose selon la marge du produit, la durée du cycle de vente ou la valeur du client sur trois ans et seule l'entreprise détient ces chiffres. Un test optimisé sur le mauvais événement fait perdre de l'argent en toute rigueur statistique. Ce qui se délègue est le reste : calcul de puissance, instrumentation, découpage des segments, lecture des résultats et refus argumenté des tests impossibles. C'est ce dernier point qui distingue un bon prestataire.
Quand on n'a pas le trafic pour tester
C'est la situation de la majorité des entreprises et il existe des alternatives qui produisent davantage que des tests non concluants.
| Méthode | Ce qu'elle donne | Volume requis |
|---|---|---|
| Appliquer les bonnes pratiques documentées | Des gains connus, sans validation locale | Aucun |
| Tests auprès de cinq utilisateurs | Les obstacles majeurs, expliqués | Aucun |
| Enregistrements de session | Où les gens bloquent, sans savoir pourquoi | Faible |
| Entretiens avec des clients récents | L'objection réelle, dans leurs mots | Aucun |
| Test avant et après, sans variante | Un indice, jamais une preuve | Faible |
La deuxième ligne est de loin la plus rentable en dessous d'un certain volume. Observer cinq personnes tenter d'accomplir une tâche sur votre site révèle presque toujours des obstacles qu'aucun test A/B n'aurait identifiés, parce qu'un test dit qu'une version perd, jamais pourquoi.
À titre de repère, le Baymard Institute estime qu'un grand site de commerce en ligne peut gagner en moyenne 35 % de taux de conversion par la seule application des principes de conception documentés, sans aucun test préalable.
Un test A/B dit laquelle des deux versions gagne. Il ne dit jamais pourquoi. C'est un outil de décision, pas un outil de compréhension.
Grille d'analyse FaliaAvant de lancer un test
Les éléments à tester en priorité sont décrits dans ce qui fait converger une page d'arrivée. Les mécanismes de décision qui expliquent les résultats sont détaillés dans les ressorts de la décision en ligne. Le cas du tunnel de paiement est traité dans abandon de panier. L'exécution est sur la page agence CRO.
L'ordre général des corrections de conversion est posé dans ce que l'optimisation du taux de conversion règle vraiment.
L'amélioration du taux de conversion est au cœur de l'objectif Améliorer la conversion de votre site.
Vous pilotez déjà une équipe marketing ? Voyez comment on s'intègre en renfort sur l'optimisation du taux de conversion.
Questions fréquentes sur les tests A/B
Qu'est-ce qu'un test A/B ?
C'est une expérience où deux versions d'une même page sont montrées simultanément à des groupes de visiteurs répartis au hasard, afin de comparer leur taux de conversion. Sa validité repose sur la répartition aléatoire, un volume suffisant et une durée couvrant un cycle complet de comportement.
Combien de visiteurs faut-il pour un test A/B ?
Cela dépend entièrement de l'ampleur de l'effet à détecter. Doubler un taux de 2 % se détecte avec quelques milliers de visiteurs. Le faire passer à 2,2 % en demande plus de cent mille par variante. Le calcul se fait avant de lancer, avec un calculateur de taille d'échantillon.
Combien de temps doit durer un test ?
Au moins deux semaines entières, pour absorber les variations de comportement selon le jour de la semaine. Un test lancé un mardi et arrêté un vendredi compare deux populations différentes, quel que soit le volume atteint.
Peut-on arrêter un test dès qu'une version gagne ?
Non et c'est l'erreur la plus fréquente. En début de test, les écarts sont importants et purement aléatoires. Regarder les résultats chaque jour et arrêter au premier écart favorable garantit de conclure sur du bruit statistique.
Que faire si je n'ai pas assez de trafic ?
Appliquer les principes de conception documentés plutôt que de tester et observer cinq personnes utiliser votre site. Le Baymard Institute estime qu'un grand site de commerce en ligne peut gagner en moyenne 35 % de conversion par la seule application de ces principes, sans test préalable.
La couleur d'un bouton change-t-elle quelque chose ?
Très peu. L'effet est si faible qu'aucun site de PME n'a le volume nécessaire pour le détecter. Le temps consacré à ce type de test est retiré aux éléments qui comptent vraiment : la proposition, le nombre de champs et la place de la preuve.
- Baymard Institute, recherche sur la facilité d'utilisation des tunnels de paiement, consultée en juillet 2026.
- Jakob Nielsen, Nielsen Norman Group, Why You Only Need to Test with 5 Users, consulté en juillet 2026.
- Google Analytics Help, arrêt de Google Optimize, consulté en juillet 2026.

C'est presque toujours Gabriel qui prend votre premier appel et qui réalise votre audit. Il construit la stratégie à partir de votre objectif de croissance : où placer votre budget, quel marché tester et comment relier chaque lead à une vente réelle dans votre CRM. Il mène surtout les accompagnements Optimiser la rentabilité de vos campagnes numériques, Développer un nouveau marché ainsi que Générer de la demande et de la croissance. Avec Geneviève, il travaille aussi le référencement (SEO), la visibilité IA (GEO) et la conversion (CRO). Les ventes d'une campagne Google Ads ou Meta Ads dépendent de la page qui reçoit le clic. Ses analyses portent surtout sur la stratégie marketing, la publicité payante et la mesure.
À propos de Falia →Trois analyses sur le même sujet
Tout Conversion et CRO →Taux de conversion : quel est un bon taux et pour quel site
Détaillants qui expédient aux États-Unis : la fin de l'exemption change votre tunnel d'achat
Commerçants en ligne : ce que le multidevise règle et ce qu'il vous laisse
Consultation diagnostique · Mandat payant
90 minutes sur votre rentabilité, pas sur la théorie
Vous venez de lire la méthode. La vôtre commence par vos chiffres. On regarde vos chiffres avec vous, on nomme l'écart et vous repartez avec une synthèse écrite et l'ordre de travail recommandé, que vous l'exécutiez avec nous ou non.
C'est un mandat payant, mené par l'expert qui exécute. Vous gardez le livrable, sans engagement de suite.