Tu as une nouvelle accroche, un autre formulaire ou une nouvelle présentation de tes plans. Tu veux les comparer à la version actuelle avec un test A/B. L’outil est facile à installer ; obtenir une réponse exploitable dépend d’autre chose.
Il faut assez de participants, une conversion correctement mesurée et une différence que l’expérience a une chance de détecter. Sur un SaaS avec peu de trafic, un test peut durer des mois tout en restant indécis.
Cela ne veut pas dire qu’il faut conserver les problèmes observables. Cela signifie qu’il faut choisir une méthode adaptée à la question et au volume disponible. Voici les calculs et les arbitrages à faire avant de lancer deux variantes.
Ce qu’un test A/B permet de savoir
Une expérience répartit des participants entre une version de référence et une variante. Si l’assignation et la mesure sont fiables, elle permet d’estimer l’effet du changement sur un indicateur dans les conditions observées.
Elle ne produit pas automatiquement une explication. Si une variante convertit mieux, tu sais davantage sur son effet que sur le raisonnement de chaque utilisateur. Et si tu changes l’accroche, le prix et le formulaire ensemble, le résultat porte sur cet ensemble de modifications.
Il faut aussi définir la bonne unité. Pour une landing page, il peut s’agir d’un visiteur éligible avec une assignation stable. Pour un outil collaboratif, le compte ou l’organisation peuvent être plus adaptés : deux membres de la même équipe ne constituent pas toujours des observations indépendantes.
Ce choix intervient avant le calcul de volume. Compter plusieurs sessions de la même personne comme autant de participants indépendants peut donner une précision trompeuse.
Combien de visiteurs faut-il pour un test fiable ?
La réponse dépend au minimum de quatre paramètres.
| Paramètre | Ce qu’il représente | Exemple pédagogique |
|---|---|---|
| Taux de départ | Fréquence actuelle de l’action mesurée | 3,8 % des visiteurs éligibles s’inscrivent |
| Effet minimal détectable | Différence que le test est dimensionné pour détecter | Une hausse relative de 20 % |
| Risque d’erreur de type I | Risque de conclure à une différence sous l’hypothèse d’absence d’effet, selon la procédure choisie | 5 % |
| Puissance | Probabilité de détecter l’effet prévu s’il existe, dans les hypothèses du calcul | 80 % |
Le taux de 3,8 % ci-dessus est une hypothèse de calcul, pas une moyenne universelle des inscriptions SaaS. Pour ton test, utilise une estimation correspondant exactement à l’événement, à la population et à la page concernés.
Un exemple calculé
Passer de 3,8 % à 4,56 % représente une hausse relative de 20 %. La différence absolue est de 0,76 point de pourcentage. Ce sont deux manières d’exprimer le même changement ; les confondre fausse la taille du test.
Pour deux variantes de même taille, une approximation courante avec un risque bilatéral de 5 % et une puissance de 80 % s’écrit :
n par variante ≈ 16 × p × (1 − p) / δ²
p : proportion utilisée pour l’approximation de variance
δ : différence absolue à détecter
Dans cet exemple, on utilise la moyenne des deux taux attendus, soit p = 0,0418, et δ = 0,0076. Le calcul donne environ 11 100 participants par variante, soit 22 200 au total après arrondi. Les méthodes de calcul plus précises peuvent produire un résultat légèrement différent. Kohavi, Deng et Vermeer, A/B Testing Intuition Busters.
Avec 5 000 visiteurs uniques éligibles par mois, répartis à parts égales et sans perte, cela représente environ 4,4 mois de recrutement. Il faut encore tenir compte du délai de conversion et de la stabilité du contexte pendant cette période.
Un effet plus petit demande beaucoup plus de volume
Avec le même taux de départ, détecter une hausse relative de 10 % signifie chercher un passage de 3,8 % à 4,18 %. La différence absolue est deux fois plus petite.
La taille dépend approximativement de l’inverse du carré de cette différence. En reprenant la même méthode, on obtient environ 42 450 participants par variante, soit près de 84 900 au total. À 5 000 participants mensuels, le recrutement prendrait autour de 17 mois.
| Scénario hypothétique | Taux comparés | Participants par variante, environ | Durée de recrutement à 5 000 par mois |
|---|---|---|---|
| Hausse relative de 20 % | 3,8 % → 4,56 % | 11 100 | 4,4 mois |
| Hausse relative de 10 % | 3,8 % → 4,18 % | 42 450 | 17 mois |
Ces durées supposent que tout le trafic annoncé est éligible et correctement mesuré. Si seule une partie des visiteurs voit la page testée, le recrutement sera plus lent.
Tu peux refaire le calcul avec le calculateur de taille d’échantillon d’Evan Miller. Vérifie si l’effet est saisi en variation relative ou absolue et si le résultat est donné par variante ou pour l’ensemble du test.
Le passage de l’essai au payant demande souvent encore plus de patience
Un test sur le payant ne recrute pas dans l’ensemble des visiteurs du site. Il recrute parmi les comptes éligibles à cette expérience, souvent bien moins nombreux.
Prenons un second exemple entièrement hypothétique : un taux de passage au payant de 8 %, avec un effet à détecter de 20 % relatif, soit 9,6 %. La différence absolue est de 1,6 point. Avec la même approximation, il faut environ 5 016 comptes par variante, soit 10 032 au total.
| Nouveaux essais éligibles par mois | Temps de recrutement approximatif |
|---|---|
| 40 | Près de 21 ans |
| 400 | Environ 25 mois |
| 4 000 | Environ 2,5 mois |
Le calcul est volontairement simple : répartition égale, comptes indépendants et aucun participant perdu. Il ne prédit pas l’évolution de ton produit. Son rôle est de montrer que le taux de conversion seul ne détermine pas la faisabilité. Le nombre d’unités réellement éligibles compte autant.
Ajoute ensuite la fenêtre nécessaire pour observer le paiement. Si tu mesures le passage au payant dans les semaines qui suivent l’essai, les comptes recrutés le dernier jour n’ont pas encore eu ce délai. Arrêter le recrutement ne signifie pas que toutes les conversions sont arrivées.
Les équipes SaaS rencontrent aussi des contraintes de dépendance : plusieurs utilisateurs par entreprise, invitations entre variantes, décisions budgétaires prises à l’échelle d’une équipe. Le plan d’expérience doit tenir compte de ces relations plutôt que de multiplier artificiellement les observations.
Le guide de conversion des essais gratuits explique comment définir les cohortes et l’activation avant de choisir un changement à tester.
Une expérience indécise n’est pas la preuve que les versions sont identiques
Si le test ne montre pas de différence statistiquement détectable, plusieurs situations restent possibles : l’effet est faible, l’échantillon est insuffisant, la mesure est trop variable ou l’effet est réellement proche de zéro.
Lis l’estimation avec son intervalle d’incertitude. Un résultat compatible à la fois avec une baisse importante et une hausse intéressante ne donne pas le même niveau d’information qu’un intervalle étroit autour de zéro.
Évite aussi de lire le seuil statistique comme une probabilité directe que la variante soit meilleure. Dans une approche fréquentiste, la valeur p se rapporte aux données et à une hypothèse ; elle ne dit pas « cette version a 95 % de chances de gagner ».
Enfin, un test sous-dimensionné peut occasionnellement afficher un gros gain. Le chiffre spectaculaire mérite alors de la prudence : les effets qui franchissent le seuil avec peu de données peuvent surestimer l’effet réel. Ne choisis pas une durée uniquement pour obtenir un résultat favorable.
Que rapportent les équipes qui expérimentent beaucoup ?
Les résultats historiques des grandes plateformes montrent que les expériences positives ne sont pas systématiques. Dans une synthèse publiée en 2022, Kohavi, Deng et Vermeer rapportent notamment ces taux de succès issus de contextes distincts :
| Contexte rapporté | Part d’expériences positives |
|---|---|
| Microsoft, ensemble historique cité | Environ un tiers |
| Bing | Environ 15 % |
| Google Ads, Booking et Netflix | Environ 10 % |
| Airbnb Search | Environ 8 % |
Les définitions, périodes et domaines diffèrent. Ces chiffres décrivent des programmes historiques ; ils ne prédisent pas tes chances de succès. Publication et contexte des chiffres.
Il ne faut pas non plus traduire « pas de hausse » par « expérience inutile ». Empêcher une dégradation, comprendre qu’une idée n’apporte pas l’effet attendu ou choisir une version plus simple à maintenir peut avoir de la valeur.
Ces observations rappellent surtout qu’une idée convaincante ne suffit pas à prouver son effet. La réputation de la personne qui la propose, son origine dans une bonne pratique ou son succès supposé chez un concurrent ne remplace pas la validation adaptée à ton contexte.
Avec peu de trafic, diagnostiquer les problèmes observables
Un faible volume ne t’oblige pas à choisir les modifications au hasard. Il change la nature des preuves accessibles.
Commencer par le fonctionnement
Un formulaire qui refuse une adresse valide, un bouton masqué par le clavier ou un tarif incorrect peuvent être vérifiés directement. Décris le défaut, reproduis-le dans ton environnement et définis le comportement attendu après correction.
Cette vérification peut confirmer que le problème fonctionnel est résolu. Elle ne mesure pas automatiquement l’effet sur le revenu, mais elle apporte une preuve plus solide qu’une préférence graphique.
Examiner la compréhension et l’effort demandé
Une revue de page peut repérer une promesse vague, une condition d’essai absente ou une difficulté à comparer les plans. Associe chaque constat à la zone observée et explicite ce qui reste une hypothèse sur le comportement.
Des retours de personnes proches de la cible peuvent compléter la revue. Demande ce qu’elles comprennent et ce qu’elles attendent après le clic. Ne leur fais pas simplement choisir la version qu’elles trouvent la plus jolie.
Vérifier la mesure avant de lire les courbes
Confirme que l’inscription est enregistrée après réussite, que les comptes internes sont identifiés et que les parcours alternatifs sont pris en compte. Sinon, une variation de l’instrumentation peut passer pour un effet de design.
La méthode d’audit CRO SaaS déroule ce diagnostic. Si le problème se situe avant la création du compte, les sept vérifications d’un SaaS qui reçoit du trafic sans inscription donnent un ordre de travail concret.
Prioriser selon la preuve et la gravité
Un blocage reproductible passe généralement avant une hypothèse stylistique peu étayée. Pour les autres recommandations, regarde le nombre de personnes potentiellement concernées, la cohérence de l’explication, les retours disponibles et l’effort de correction.
Après un changement, tu peux suivre les indicateurs et noter la date de mise en ligne. Mais une comparaison avant/après reste exposée aux variations d’acquisition, de saison, de produit et de population. Présente-la comme une observation, sans lui attribuer la force causale d’une expérience correctement randomisée.
Quand l’A/B test redevient-il le bon outil ?
Une expérience devient intéressante quand tu as une question délimitée, une mesure fiable et un volume permettant de détecter un effet utile dans une durée acceptable.
Avant le lancement, écris le protocole :
- La population éligible et l’unité d’assignation : visiteur, compte ou organisation.
- L’hypothèse et ce qui change entre les variantes.
- L’indicateur principal, sa définition et son délai d’observation.
- Les indicateurs de contrôle, comme les erreurs, les annulations ou la qualité des inscriptions.
- L’effet minimal pertinent, les hypothèses de calcul et la taille prévue.
- La durée, les règles d’arrêt et les situations qui imposeraient de corriger ou d’annuler le test.
Vérifie l’assignation stable, l’exposition réelle et la collecte avant de lire les effets. Une répartition anormale entre les groupes peut signaler un problème de mise en œuvre. Un outil qui affiche deux courbes ne garantit pas que l’expérience est valide.
Évite de multiplier les variantes et les métriques décisives sans ajuster le plan. Chaque choix supplémentaire complique la lecture et peut augmenter le risque de retenir un résultat favorable par hasard.
Enfin, ne surveille pas un test à horizon fixe pour l’arrêter dès que le seuil devient favorable. Une procédure séquentielle peut permettre des lectures intermédiaires, mais elle doit être choisie et comprise dès le départ. Le fonctionnement statistique de l’outil fait partie du protocole.
Questions fréquentes
Combien de visites faut-il pour un A/B test SaaS ?
Il n’y a pas de seuil universel. Il faut connaître le taux initial, l’effet recherché, le niveau d’incertitude accepté et le nombre de participants réellement éligibles. Le calcul se fait généralement par variante.
Peut-on tester avec peu de trafic ?
Parfois, si l’événement est fréquent et l’effet recherché assez important. Pour des effets modestes sur un événement rare, la durée peut devenir incompatible avec le rythme du produit. Le diagnostic et les contrôles fonctionnels restent alors utiles.
Un test sans résultat positif a-t-il échoué ?
Pas nécessairement. Il peut éviter une dégradation ou montrer qu’un changement n’apporte pas l’effet attendu. Sa valeur dépend de la question initiale et de la précision réellement obtenue.
Faut-il tester les prix ?
Cela demande un cadre particulièrement clair : unités d’assignation, cohérence des prix présentés à une même organisation, conditions proposées, effet sur la qualité des clients et durée d’observation. Un test de présentation du tarif ne répond pas à la même question qu’un test du montant facturé.
Quel outil choisir ?
Commence par le besoin : pages publiques ou produit, assignation par visiteur ou compte, mesure côté navigateur ou serveur, méthode statistique et capacité de contrôle. Aucun outil ne compense l’absence de volume ou une définition de conversion incorrecte.
L’audit Mon Audit CRO comprend-il des expériences ?
Non. Il fournit un diagnostic d’une page publique sur mobile et ordinateur, des preuves et des instructions de correction priorisées. La mise en œuvre, l’accès à tes données privées et les tests A/B ne sont pas inclus.
Choisir la preuve adaptée à la décision
L’A/B test est utile quand il peut répondre à une question réelle dans un délai raisonnable. Le lancer sans calculer le volume peut retarder des corrections déjà justifiées tout en donnant une impression de rigueur.
Si tu veux d’abord identifier ce qui mérite d’être corrigé sur une page publique, consulte l’offre d’audit ou regarde un exemple de restitution. Tu pourras distinguer les défauts observés des hypothèses qui demanderont ensuite une mesure plus poussée.
← Retour au blog CRO