Série Flowlysis · Outils & principes · Fiche N° O-55

LE TEST A/B, ET QUAND LE VOLUME NE SUFFIT PAS

Deux versions d'un même geste, envoyées au hasard, une seule différence, et tout écrit avant : la mesure, la taille, la durée. Quand le volume manque, on suit une carte de contrôle à la place.

Aussi appelétest A/B, expérimentation contrôlée, test randomisé Principe qu'il appliquele cycle PDCA, fiche P-06 Se prépare enune demi-journée, pour écrire la mesure, les garde-fous et la taille Se fait en2 à 8 semaines, selon le volume et le délai de la mesure Levier principalROI D'aprèsR. Kohavi, D. Tang et Y. Xu, Trustworthy Online Controlled Experiments, 2020
flowlysis.
Ce que ça rapporte
Impact sur le TTM
Faible
Impact sur la qualité (FTR)
Moyen
Impact sur l'Opex / Capex
Moyen
Ce que ça coûte
Coût d'implémentation
Faible
Difficulté d'implémentation
Moyen
Difficulté de maintien
Moyen
Faible Moyen Élevé N/A (sans objet)
1

Le problème auquel ça s'appliqueEt ce qu'il vous coûte chaque année

Ce que vous voyez déjà
  • Les paiements montent depuis la nouvelle relance. Rien ne dit que c'est elle.
  • Trois choses ont changé dans le même courrier. Personne ne sait laquelle a joué.
  • Le test a été arrêté le jour où la courbe était belle.
Où part l'argent

Une version généralisée sur une fausse preuve coûte deux fois : le gain annoncé n'arrive pas, et la bonne version n'est jamais essayée.

L'ordre de grandeur, à la louche

Comptez-le sur vos chiffres. Un ordre de grandeur suffit pour décider d'essayer.

Combien de fois / anenvois du geste testé
×
Ce que ça coûte à chaque foiscoût d'un client qui ne répond pas
×
Part qu'on évitepoints gagnés par la meilleure version, une fois prouvés
=
Gain / anà écrire au crayon, à la date prévue
Quand ça ne sert à rien

Sous quelques milliers de clients par version, l'écart ne se voit pas. On change pour tous et on suit l'effet sur une carte de contrôle (fiche O-18).

2

Comment ça marcheLa mécanique, en clair

L'idée en une phrase

Le hasard fait deux groupes semblables en tout, sauf la version reçue. L'écart mesuré à la date prévue vient donc de la version, à un risque connu près.

Les gestes, dans l'ordre
  1. Changer une seule chose entre A et B, et écrire pourquoi elle devrait jouer.
  2. Écrire avant la mesure principale, deux garde-fous et le plus petit écart à pouvoir détecter.
  3. Calculer la taille par version : n ≈ 2 × (1,96 + 0,84)² × p(1 − p) / d².
  4. Tirer au hasard par le système, client par client, jamais par agence ou par gestionnaire.
  5. Fixer la durée d'avance, et ne pas s'arrêter le jour où le résultat plaît.
  6. À la date prévue, décider sur la mesure principale, garde-fous vérifiés.
Ce qu'il faut avoir sous la main

Un outil d'envoi qui sait tirer au hasard, la mesure disponible client par client, et quelqu'un qui sait refaire le calcul de taille.

Le signe que ça a marché

Le comité attend la date prévue pour conclure, alors que la courbe de la deuxième semaine lui plaisait.

3

Les pièges de l'implémentationCe qui fait rater, et ce qu'on fait à la place

Au lancementChanger trois choses à la fois

B gagne, et personne ne sait si c'est l'objet, le ton ou la date d'envoi.

Une seule différence par test. Les autres attendent le suivant.

Au lancementLancer sans calculer la taille

Le test finit sur un écart « prometteur » qui tient dans le bruit.

Écrire le plus petit écart à détecter, et en déduire le nombre de clients par version.

PendantRegarder chaque jour, et s'arrêter quand ça plaît

À force de regarder, un écart dû au seul hasard finit par passer le seuil.

La durée fixée d'avance, ou un test séquentiel, conçu pour être lu en cours de route.

PendantRépartir par agence ou par gestionnaire

Les groupes diffèrent avant même le test. L'écart mesure l'agence, pas la version.

Le tirage au hasard par le système, client par client.

Dans la duréeOublier les garde-fous

La relance plus ferme fait payer plus vite, et les réclamations doublent trois mois plus tard.

Deux garde-fous écrits avant, et suivis après la généralisation (fiche O-18).

4

Un exempleCas type du tertiaire

L'objet

Le courrier de première relance des factures impayées d'un fournisseur d'énergie, clients particuliers.

Ce qui cloche

Trois refontes en deux ans, chacune déclarée gagnante. Le taux de paiement n'a pas bougé.

Ce qu'ils regardaient avant

Le taux de paiement du mois, comparé au mois précédent. Il variait de quatre points sans que rien change.

Les chiffres de départ

À relever avant d'écrire le protocole.

180 000relances d'impayés par an 38 %payées sous 15 jours avec le courrier actuel 240 €d'impayé moyen par relance 9 €par relance de niveau 2, recommandé et appel
Ce qu'ils ont fait Un seul changement, 4 500 clients par version tirés au hasard, une date de lecture fixée d'avance.
Le déclencheurUne quatrième refonte du courrier est proposée, avec un gain annoncé de cinq points.
▶
Le gesteProtocole écrit avant. Seul changement : un lien de paiement en tête du courrier.
▶
Ce qu'ils ont vuAu quinzième jour, 41,6 % contre 38,0 %. Réclamations au même niveau.
▶
La décisionB généralisée. Le test suivant portera sur la date d'envoi, et sur elle seule.
1 · UNE DIFFÉRENCE, UN TIRAGE, UNE DATE Clients à relancer tirage au hasard A · le courrier actuel B · une seule différence mesure à J+15 et deux garde-fous décision à la date prévue Écrit avant le premier envoi : la mesure, deux garde-fous, l'écart à détecter, la taille, la durée. SANS EFFET RÉEL, L'ÉCART OBSERVÉ JOUR APRÈS JOUR au quatrième jour, l'écart sort du bruit par hasard date prévue : dans le bruit, aucun effet 0 jour 1 en gris : l'écart que le hasard seul produit jour 15 Sans effet réel, un écart finit par sortir du bruit si l'on regarde assez souvent. On lit à la date prévue, ou on choisit un test séquentiel, conçu pour être lu en route. 2 · LA RELANCE D'IMPAYÉS LA TAILLE, CALCULÉE AVANT n ≈ 2 × (1,96 + 0,84)² × 0,38 × 0,62 / 0,03² ≈ 4 100 clients par version. 4 500 retenus. PAYÉES SOUS 15 JOURS A 38,0 % B 41,6 % +3,6 points Réclamations et désinscriptions : au même niveau dans A et B. LE CAS CONTRAIRE : 300 CLIENTS ENTRE ENTREPRISES À 150 clients par version, seul un écart de 16 points se verrait. On change pour tous, et on suit le délai de paiement en carte de contrôle. haute moyenne basse nouveau courrier Neuf semaines de suite sous la moyenne : le signal (fiche O-18).

À gauche le protocole, et pourquoi on ne lit pas le résultat en cours de route. À droite la relance, puis le cas où le volume ne suffit pas.

Ce que ça vautUne fourchette, et d'où elle sort

Le nombre de relances ne change pas. Ce qui change est la part des clients qui paient avant la deuxième.

Le gain mesuré +3,6 points payés sous 15 jours 38,0 → 41,6 %, sur 4 500 clients par version, calculés avant pour voir 3 points
Les relances de niveau 2 évitées 6 480 par an au point mesuré, soit 45 à 71 k€ à 7 à 11 € la relance ; intervalle de confiance : 2 900 à 10 100, à recaler
La trésorerie avancée 1,56 M€ par an, avancés, pas gagnés 6 480 × 240 € payés quelques semaines plus tôt ; 0,7 à 2,4 M€ selon l'intervalle
Ce que ça a coûté Cinq semaines, deux jours de protocole l'outil d'envoi savait déjà tirer au hasard : aucun développement

Sans tirage au hasard, les 3,6 points se seraient perdus dans l'écart normal d'un mois à l'autre.