Créa & tests

Concepteur de tests A/B

Conçoit des tests A/B rigoureux pour Google Ads avec des hypothèses claires, des métriques de succès, des calculs de taille d'échantillon et des estimations de durée de test. Se déclenche quand l'utilisateur veut tester quelque chose, lancer une expérimentation, comparer des variantes d'annonces, ou demande « dois-je tester X contre Y ? ». Fournit un cadre de test scientifique qui évite les erreurs courantes et garantit des résultats statistiquement valides.

Concepteur de tests A/B
  1. ---
  2. name: concepteur-de-tests-a-b
  3. description: "Conçoit des tests A/B rigoureux pour Google Ads avec des hypothèses claires, des métriques de succès, des calculs de taille d'échantillon et des estimations de durée de test. Se déclenche quand l'utilisateur veut tester quelque chose, lancer une expérimentation, comparer des variantes d'annonces, ou demande « dois-je tester X contre Y ? ». Fournit un cadre de test scientifique qui évite les erreurs courantes et garantit des résultats statistiquement valides."
  4. ---
  5. # Concepteur de tests A/B
  6. Arrêtez de tester au hasard. Commencez à apprendre.
  7. ## Philosophie de base
  8. **La plupart des « tests » PPC ne sont pas des tests : ce sont des suppositions avec des étapes en plus.**
  9. **Ce qui fait un vrai test :**
  10. 1. Une hypothèse claire (pas juste « essayons un truc »)
  11. 2. L'isolation d'une seule variable (savoir ce qui a causé le changement)
  12. 3. Une taille d'échantillon suffisante (significativité statistique)
  13. 4. Des critères de succès prédéterminés (pas de règles du jeu qui changent en cours de route)
  14. 5. Des apprentissages documentés (construit une connaissance institutionnelle)
  15. **L'objectif :** chaque test gagne, perd, ou vous apprend quelque chose d'utile.
  16. ---
  17. ## Contexte requis
  18. ### Indispensable
  19. **1. Ce que vous voulez tester**
  20. - Variable testée (accroche, CTA, page d'atterrissage, stratégie d'enchères, etc.)
  21. - État actuel (contrôle)
  22. - Changement proposé (variante)
  23. **2. Référence de performance actuelle**
  24. - Métrique concernée (CTR, taux de conversion, CPA, etc.)
  25. - Valeur actuelle
  26. - Taille d'échantillon disponible (clics mensuels, conversions)
  27. ### Fortement recommandé
  28. **3. Contexte business**
  29. - Pourquoi testez-vous cela ? Quel problème résolvez-vous ?
  30. - Qu'est-ce qui rendrait ce test « rentable » ?
  31. - Effet minimum détectable qui compte pour le business
  32. **4. Contraintes**
  33. - Limitations de budget
  34. - Contraintes de temps
  35. - Limitations techniques
  36. ### Appréciable
  37. - Résultats de tests historiques (ce qui a marché ou échoué avant)
  38. - Contexte concurrentiel
  39. - Considérations de saisonnalité
  40. ---
  41. ## Cadre de test
  42. ### Étape 1 : formulation de l'hypothèse
  43. **Format :** « Si nous [changeons X], alors [la métrique Y] va [s'améliorer/diminuer] parce que [raisonnement]. »
  44. **Bonne hypothèse :**
  45. « Si nous remplaçons l'accroche "Logiciel de gestion de projet" par "Livrez vos projets 2x plus vite", alors le CTR va s'améliorer d'au moins 15 % parce que les accroches orientées bénéfice surperforment les accroches orientées fonctionnalité dans notre secteur. »
  46. **Mauvaise hypothèse :**
  47. « Essayons une nouvelle accroche et voyons ce que ça donne. »
  48. **Liste de contrôle qualité de l'hypothèse :**
  49. - [ ] Changement spécifique identifié
  50. - [ ] Résultat mesurable défini
  51. - [ ] Ampleur du changement attendu précisée
  52. - [ ] Raisonnement basé sur des preuves ou une logique
  53. - [ ] Falsifiable (peut être prouvée fausse)
  54. ---
  55. ### Étape 2 : isolation de la variable
  56. **Règle d'or :** testez UNE seule chose à la fois.
  57. **Pourquoi c'est important :**
  58. Si vous changez l'accroche ET le CTA ET l'image, et que la performance s'améliore, quel changement en est la cause ?
  59. **Catégories de variables :**
  60. | Type de variable | Exemples | Difficulté d'isolation |
  61. |---------------|----------|---------------------|
  62. | Texte publicitaire | Accroches, descriptions, CTA | Tester un seul élément par variante |
  63. | Page d'atterrissage | Titre, formulaire, mise en page, images | Un changement par variante de page |
  64. | Ciblage | Mots-clés, audiences, zones géographiques | Campagnes/groupes d'annonces séparés |
  65. | Enchères | Stratégie, cibles, ajustements | Nécessite un split de campagne |
  66. | Créa | Images, vidéos, formats | Un seul élément créatif par test |
  67. **Test multivarié :**
  68. Ne faites cela que si vous avez un très gros volume ET de vrais outils de test multivarié. Sinon, vous ne faites que générer du bruit.
  69. ---
  70. ### Étape 3 : calcul de la taille d'échantillon
  71. **Données requises :**
  72. - Taux de conversion de référence (performance actuelle)
  73. - Effet minimum détectable (MDE) : plus petite amélioration qui vaut la peine d'être détectée
  74. - Niveau de significativité statistique (généralement 95 %)
  75. - Puissance statistique (généralement 80 %)
  76. **Formule de taille d'échantillon (simplifiée) :**
  77. Pour les tests de taux de conversion :
  78. ```
  79. n = 16 × p × (1-p) / MDE²
  80. Où :
  81. n = taille d'échantillon par variante
  82. p = taux de conversion de référence
  83. MDE = effet minimum détectable (en décimal)
  84. ```
  85. **Tableau de référence rapide :**
  86. | Taux de conversion de référence | MDE 10 % | MDE 15 % | MDE 20 % | MDE 25 % |
  87. |--------------|---------|---------|---------|---------|
  88. | 1 % | 15 840 | 7 040 | 3 960 | 2 534 |
  89. | 2 % | 31 360 | 13 938 | 7 840 | 5 018 |
  90. | 3 % | 46 560 | 20 693 | 11 640 | 7 450 |
  91. | 5 % | 76 000 | 33 778 | 19 000 | 12 160 |
  92. | 10 % | 144 000 | 64 000 | 36 000 | 23 040 |
  93. *Taille d'échantillon par variante. Multipliez par 2 pour le trafic de test total nécessaire.*
  94. **Pour les tests de CTR :** utilisez la même formule avec le CTR comme taux de référence.
  95. ---
  96. ### Étape 4 : calcul de la durée du test
  97. **Formule :**
  98. ```
  99. Durée du test (jours) = Taille d'échantillon nécessaire / Trafic quotidien
  100. Où :
  101. Taille d'échantillon nécessaire = calcul ci-dessus (pour LES DEUX variantes)
  102. Trafic quotidien = clics quotidiens moyens sur l'emplacement testé
  103. ```
  104. **Règles de durée minimale :**
  105. - Jamais moins de 7 jours (il faut une semaine complète pour couvrir la variation jour par jour)
  106. - Idéalement 14 à 28 jours pour la fiabilité
  107. - Éviter les grandes périodes de fêtes ou de promotions
  108. - Prendre en compte le délai de conversion
  109. **Contraintes de durée :**
  110. ```
  111. Si la durée calculée < 7 jours → faire tourner 7 jours minimum
  112. Si la durée calculée > 60 jours → envisager :
  113. - Accepter un MDE plus grand
  114. - Tester sur un emplacement à trafic plus élevé
  115. - Se demander si le test est viable
  116. ```
  117. ---
  118. ### Étape 5 : définition des critères de succès
  119. **À définir AVANT le début du test :**
  120. **Métrique principale :**
  121. - Quelle métrique détermine la victoire ou la défaite ?
  122. - Quel seuil d'amélioration = « gagnant » ?
  123. - Quel niveau de confiance requis ?
  124. **Métriques secondaires :**
  125. - Quelles autres métriques surveiller ?
  126. - Qu'est-ce qui disqualifierait un « gagnant » ? (ex. : CTR en hausse mais taux de conversion en baisse)
  127. **Métriques garde-fous :**
  128. - Métriques qui ne doivent PAS se dégrader
  129. - Variance acceptable sur les garde-fous
  130. **Exemple de critères de succès :**
  131. ```
  132. PRINCIPAL : le CTR doit s'améliorer d'au moins 15 % avec 95 % de confiance
  133. SECONDAIRE : surveiller le taux de conversion (ne doit pas baisser de plus de 10 %)
  134. GARDE-FOU : le CPA ne doit pas augmenter de plus de 20 %
  135. GAGNANT : la variante bat le contrôle sur la métrique principale tout en respectant les garde-fous
  136. ```
  137. ---
  138. ### Étape 6 : plan d'exécution du test
  139. **Liste de contrôle de mise en place :**
  140. - [ ] Contrôle et variante créés
  141. - [ ] Répartition du trafic configurée (50/50 recommandé)
  142. - [ ] Tracking vérifié pour toutes les métriques
  143. - [ ] Date de début fixée (éviter les jours atypiques)
  144. - [ ] Date de fin fixée (basée sur le calcul de durée)
  145. - [ ] Critères de succès documentés
  146. - [ ] Notification programmée pour la fin du test
  147. **Pendant le test :**
  148. - [ ] Vérifier les erreurs d'implémentation (jour 1-2)
  149. - [ ] Vérifier que la répartition du trafic fonctionne correctement
  150. - [ ] NE PAS surveiller les résultats en continu pour trancher trop tôt
  151. - [ ] Documenter tout facteur externe
  152. **Après le test :**
  153. - [ ] Attendre la significativité statistique
  154. - [ ] Vérifier toutes les métriques (principale, secondaires, garde-fous)
  155. - [ ] Documenter les résultats et les apprentissages
  156. - [ ] Mettre en place le gagnant (ou documenter pourquoi pas)
  157. - [ ] Planifier le prochain test à partir des apprentissages
  158. ---
  159. ## Format de sortie
  160. ### Document de conception du test
  161. ```
  162. ═══════════════════════════════════════════════════════
  163. TEST : [Nom descriptif]
  164. STATUT : Prêt à lancer / En revue
  165. ═══════════════════════════════════════════════════════
  166. ```
  167. ---
  168. ### 🎯 Hypothèse
  169. **Énoncé :**
  170. « Si nous [changement spécifique], alors [métrique] va [résultat attendu] parce que [raisonnement]. »
  171. **Niveau de confiance :** Élevé / Moyen / Faible
  172. **Fondement :** [Quelle preuve ou logique soutient cette hypothèse]
  173. ---
  174. ### 🔬 Conception du test
  175. | Élément | Contrôle | Variante |
  176. |---------|---------|-----------|
  177. | [Variable] | [État actuel] | [Nouvel état] |
  178. **Variable testée :** [Variable unique]
  179. **Tout le reste maintenu constant :** [Confirmer l'isolation]
  180. ---
  181. ### 📊 Exigences statistiques
  182. | Paramètre | Valeur | Notes |
  183. |-----------|-------|-------|
  184. | Métrique de référence | [X %] | [CTR/taux de conversion/etc.] actuel |
  185. | Effet minimum détectable | [X %] | Plus petite amélioration significative |
  186. | Taille d'échantillon requise | [X] par variante | [X] au total |
  187. | Trafic quotidien estimé | [X] | Sur l'emplacement testé |
  188. | Durée de test estimée | [X] jours | Minimum 7 jours |
  189. | Niveau de confiance | 95 % | Standard |
  190. | Puissance statistique | 80 % | Standard |
  191. ---
  192. ### ✅ Critères de succès
  193. **Pour déclarer un gagnant :**
  194. **Métrique principale :** [Nom de la métrique]
  195. - Seuil de victoire : ≥ [X] % d'amélioration
  196. - Confiance requise : 95 %
  197. **Métriques secondaires :**
  198. - [Métrique] : à surveiller, sans seuil
  199. - [Métrique] : ne doit pas baisser de plus de X %
  200. **Garde-fous :**
  201. - [Métrique] : ne doit pas se dégrader de plus de X %
  202. **Règles de décision :**
  203. - Si la métrique principale gagne ET les garde-fous passent → mettre en place la variante
  204. - Si la métrique principale gagne MAIS les garde-fous échouent → investiguer, rejet probable
  205. - Si la métrique principale est inconcluante → prolonger le test ou accepter un résultat nul
  206. - Si la métrique principale perd → documenter l'apprentissage, rejeter la variante
  207. ---
  208. ### 📅 Plan d'exécution
  209. **Calendrier :**
  210. - Mise en place terminée le : [Date]
  211. - Début du test : [Date]
  212. - Date de fin minimale : [Date]
  213. - Date de décision : [Date]
  214. **Répartition du trafic :** 50 % contrôle / 50 % variante
  215. **Points de contrôle :**
  216. - Jour 1-2 : vérifier l'implémentation
  217. - Jour 7 : premier contrôle statistique (aucune décision)
  218. - Jour [X] : fin du test, analyse finale
  219. ---
  220. ### ⚠️ Risques et considérations
  221. - [Risque 1] : [Atténuation]
  222. - [Risque 2] : [Atténuation]
  223. **Facteurs externes à documenter :**
  224. - Saisonnalité : [pertinente ?]
  225. - Promotions : [des promotions pendant le test ?]
  226. - Activité concurrentielle : [changements connus ?]
  227. ---
  228. ### 📝 Modèle de documentation
  229. **Avant le test :**
  230. ```
  231. Nom du test :
  232. Hypothèse :
  233. Date de début :
  234. Date de fin prévue :
  235. Critères de succès :
  236. ```
  237. **Après le test :**
  238. ```
  239. Date de fin réelle :
  240. Résultat : Victoire / Défaite / Inconclusif
  241. Métrique principale : Contrôle [X %] vs Variante [X %]
  242. Significativité statistique : [X %]
  243. Métriques secondaires : [Résultats]
  244. Garde-fous : Respectés/Non respectés
  245. Décision : Mettre en place / Rejeter / Prolonger
  246. Apprentissage clé :
  247. Prochain test :
  248. ```
  249. ---
  250. ## Types de tests courants
  251. ### Tests de texte publicitaire
  252. **Quoi tester :**
  253. - Accroches (une à la fois)
  254. - Lignes de description
  255. - Variantes de CTA
  256. - Mise en avant de la proposition de valeur
  257. **MDE typique :** amélioration de 10 à 20 % du CTR
  258. **Durée :** généralement 7 à 14 jours
  259. ### Tests de page d'atterrissage
  260. **Quoi tester :**
  261. - Titre/proposition de valeur
  262. - Bouton CTA (texte, couleur, emplacement)
  263. - Longueur du formulaire
  264. - Emplacement de la preuve sociale
  265. - Image d'en-tête
  266. **MDE typique :** amélioration de 15 à 25 % du taux de conversion
  267. **Durée :** généralement 14 à 28 jours
  268. ### Tests de stratégie d'enchères
  269. **Quoi tester :**
  270. - Manuel vs automatisé
  271. - Différentes valeurs cibles
  272. - Ajustements d'enchères
  273. **MDE typique :** amélioration de 10 à 15 % du CPA
  274. **Durée :** 28 à 42 jours (nécessite une période d'apprentissage)
  275. ### Tests d'audience
  276. **Quoi tester :**
  277. - Données démographiques
  278. - Segments d'intérêt
  279. - Audiences personnalisées
  280. - Sosies (lookalike)
  281. **MDE typique :** amélioration de 20 à 30 % du taux de conversion
  282. **Durée :** généralement 14 à 28 jours
  283. ---
  284. ## Erreurs courantes à éviter
  285. ### 1. Surveiller les résultats et arrêter trop tôt
  286. **Problème :** vérifier les résultats chaque jour et arrêter dès qu'on voit un « gagnant »
  287. **Pourquoi c'est faux :** la significativité statistique fluctue ; arrêter trop tôt = faux positifs
  288. **Solution :** fixer la durée à l'avance et s'y tenir
  289. ### 2. Tester trop de choses à la fois
  290. **Problème :** changer 5 choses et appeler ça un « test A/B »
  291. **Pourquoi c'est faux :** impossible d'attribuer la causalité
  292. **Solution :** une seule variable par test, point final
  293. ### 3. Taille d'échantillon insuffisante
  294. **Problème :** faire tourner un test 3 jours avec 50 clics
  295. **Pourquoi c'est faux :** les résultats sont du bruit aléatoire, pas un signal
  296. **Solution :** calculer la taille d'échantillon nécessaire avant de commencer
  297. ### 4. Pas d'hypothèse claire
  298. **Problème :** « essayons ça et on verra bien »
  299. **Pourquoi c'est faux :** vous n'apprenez rien, même si ça « gagne »
  300. **Solution :** écrire l'hypothèse d'abord, concevoir le test ensuite
  301. ### 5. Déplacer les objectifs en cours de route
  302. **Problème :** changer les critères de succès après avoir vu les résultats
  303. **Pourquoi c'est faux :** biais de confirmation, conclusions invalides
  304. **Solution :** documenter les critères avant le début du test
  305. ### 6. Ignorer la significativité pratique
  306. **Problème :** célébrer une amélioration de 0,5 % à 95 % de confiance
  307. **Pourquoi c'est faux :** statistiquement significatif ne veut pas dire pertinent pour le business
  308. **Solution :** fixer le MDE en fonction de l'impact business
  309. ---
  310. ## Limites
  311. **Ce que je peux fournir :**
  312. - Un cadre de conception de test rigoureux
  313. - Des calculs de taille d'échantillon
  314. - Des estimations de durée
  315. - Des modèles de critères de succès
  316. - Des alertes sur les pièges courants
  317. **Ce que je ne peux pas fournir :**
  318. - L'analyse statistique réelle des résultats (nécessite les données brutes)
  319. - Le choix entre méthodologie bayésienne ou fréquentiste (dépend de votre configuration)
  320. - L'implémentation spécifique à un outil (varie selon la plateforme)
  321. - Des idées de test garanties gagnantes
  322. **Pour une meilleure conception de test, fournissez aussi :**
  323. - Les résultats de tests historiques
  324. - Les données de tunnel de conversion
  325. - Des exemples d'annonces concurrentes
  326. - Des insights issus de la recherche utilisateur
  327. ---
  328. ## Liste de contrôle qualité
  329. Avant de lancer le test :
  330. - [ ] L'hypothèse est spécifique et falsifiable
  331. - [ ] Une seule variable est isolée
  332. - [ ] La taille d'échantillon est calculée
  333. - [ ] La durée est fixée (minimum 7 jours)
  334. - [ ] Les critères de succès sont documentés
  335. - [ ] Les métriques garde-fous sont définies
  336. - [ ] La répartition du trafic est configurée
  337. - [ ] Le tracking est vérifié
  338. - [ ] Les facteurs externes sont notés
  339. - [ ] Le modèle de documentation est prêt
  340. ---
  341. *Compétence adaptée en français depuis le dépôt open source [anthropics/skills](https://github.com/anthropics/skills) (licence Apache 2.0).*
SKILL.mdMarkdownUTF-8FR466 lignes

Questions

Questions fréquentes

À partir de combien de clics ou de conversions un test A/B a-t-il vraiment un sens ?

Tout dépend de votre taux de conversion actuel et de l'amélioration minimale que vous voulez détecter (le fameux MDE). Avec un taux de conversion de 3 % et un MDE de 15 %, il faut environ 20 700 visiteurs par variante, soit plus de 41 000 au total. En dessous de ce seuil, arrêtez de conclure quoi que ce soit : vous lisez du bruit statistique, pas un signal.

Combien de temps faut-il faire tourner un test avant de trancher ?

Jamais moins de 7 jours, même si le résultat semble déjà clair au bout de 2 jours : il faut couvrir une semaine complète pour lisser les écarts de comportement entre lundi et dimanche. La durée idéale se situe entre 14 et 28 jours selon le volume de trafic, et si votre calcul dépasse 60 jours, c'est le signe qu'il faut soit accepter un effet minimum détectable plus large, soit tester sur un emplacement à plus fort trafic.

Quelle est l'erreur qui fausse le plus de tests A/B en PME ?

Regarder les résultats chaque jour et couper le test dès qu'une variante semble gagner : la significativité statistique fluctue en cours de route, et arrêter tôt multiplie les faux positifs. La deuxième erreur la plus fréquente est de changer plusieurs éléments en même temps (accroche, image et CTA), ce qui rend impossible d'identifier ce qui a réellement fait la différence.

Quel gain de performance viser selon ce qu'on teste (annonce, page d'atterrissage, enchères) ?

Sur un texte d'annonce, visez un MDE de 10 à 20 % de CTR sur 7 à 14 jours. Sur une page d'atterrissage (titre, formulaire, CTA), comptez 15 à 25 % d'amélioration du taux de conversion sur 14 à 28 jours. Sur une stratégie d'enchères, c'est plus long (28 à 42 jours) car l'algorithme a besoin d'une période d'apprentissage, pour un gain typique de 10 à 15 % de CPA.

Comment décider objectivement si une variante a « gagné » sans se mentir à soi-même ?

Fixez trois niveaux de métriques avant de lancer le test : une métrique principale avec un seuil de victoire clair (ex. CTR +15 % à 95 % de confiance), des métriques secondaires à surveiller sans seuil strict, et des métriques garde-fous qui ne doivent jamais se dégrader (ex. le CPA ne doit pas grimper de plus de 20 %). Si la métrique principale gagne mais qu'un garde-fou casse, la variante est rejetée, même si elle a l'air séduisante sur le papier.