Mesurer ce qui marche en conversation : le protocole
Tester une variante de chatting sans se raconter d'histoires : une variable à la fois, volume prévu d'avance, créneaux comparables, biais neutralisés.
Publié le 28 juillet 2026
La plupart des tests menés en agence ne prouvent rien. Ils ne sont pas faux, ils sont ininterprétables : trois choses ont changé en même temps, sur deux périodes qui n’avaient rien de comparable, et le chiffre qui a bougé ne dit pas laquelle en est responsable.
Mesurer ce qui marche en conversation n’est pas une affaire de statistiques. C’est une affaire de décisions prises avant de regarder le résultat.
Pourquoi la plupart des tests d’agence ne prouvent-ils rien ?
Parce qu’ils comparent deux situations qui différaient déjà avant le test. L’écart existe, il est même parfois net, mais il a plusieurs causes possibles et aucune n’est isolable.
Les quatre façons habituelles de rater un test :
- Changer plusieurs choses à la fois. Nouvelle formulation, nouveau moment, nouveau prix, tous la même semaine. L’écart final n’appartient à personne.
- Comparer deux périodes au lieu de deux groupes. La semaine d’après n’est pas la semaine d’avant : ni les mêmes fans, ni le même calendrier, ni la même fatigue d’équipe.
- Arrêter quand ça arrange. On regarde tous les jours, on s’arrête le jour où l’écart est le plus flatteur. Le résultat mesure alors le moment où on a cessé de regarder.
- Confier la variante à quelqu’un. La personne qui teste s’applique, et elle sait qu’on la regarde.
Le quatrième est le plus coûteux en agence, et le seul qu’on ne corrige pas avec de la rigueur : il se corrige avec de la répartition.
Qu’est-ce qu’un protocole, et que ne te donnera-t-il pas ?
Un protocole est la liste des décisions écrites avant le premier message : ce qui change, ce qui ne change pas, qui reçoit quoi, combien de temps, et quel chiffre tranchera. Écrit après, ce n’est plus un protocole, c’est une justification.
Ce qu’un protocole propre ne te donnera pas :
- Une cause. Il te donne un écart entre deux groupes comparables. Pourquoi cet écart existe reste une hypothèse, développée dans ce que nos données ne disent pas.
- Une règle universelle. Ton résultat vaut pour tes créatrices, ta fanbase, tes prix.
- Une garantie de durée. Ce qui marche cette saison peut cesser de marcher, et le seul moyen de le savoir est de rejouer le test plus tard.
- Un remplacement de la lecture. Un chiffre te dit qu’un écart existe ; seule la relecture de conversations te dit ce qui s’est réellement passé dedans.
Quels biais suffisent à rendre une comparaison illisible ?
Quatre, et ils sont tous présents par défaut dans une agence. Aucun ne se voit dans le résultat final : c’est ce qui les rend dangereux.
| Biais | Comment il se manifeste | Comment le neutraliser |
|---|---|---|
| Attribution des fans | le chatteur ancien a gardé les fans anciens, qui achètent plus | tirage au sort fan par fan, jamais par personne |
| Créneau horaire | une variante est testée le soir, l’autre l’après-midi | mêmes plages horaires pour les deux groupes, sur les mêmes jours |
| Effet d’observation | celui qui teste s’applique plus que d’habitude | les deux groupes sont tenus par les mêmes personnes, en aveugle si possible |
| Ancienneté du fan | un groupe concentre plus de fans anciens que l’autre | comparer à l’intérieur d’un même segment, pas sur le total |
Le créneau mérite une attention particulière, parce que l’heure pèse lourd sur la conversion : nos données montrent un effondrement au milieu de la nuit et un maximum le soir, détaillé dans à quelle heure les fans achètent. Un test dont les deux groupes ne couvrent pas les mêmes heures mesure l’horaire, pas la variante.
Comment monter un test en six étapes ?
En écrivant tout avant, puis en ne touchant plus à rien. Les six étapes tiennent sur une demi-page.
- Formuler la question en une phrase, avec un verbe et une seule variable : « est-ce que retirer la question finale du message de vente change le taux de conclusion ? »
- Isoler une seule variable. Ce qui change, en une ligne. Ce qui ne change pas, en trois lignes. C’est cette seconde liste qu’on oublie.
- Choisir la répartition des fans, au hasard, et l’écrire noir sur blanc.
- Fixer le volume et la date d’arrêt avant de lancer, et s’y tenir même si l’écart apparaît plus tôt.
- Choisir le chiffre qui tranche, un seul, avec son dénominateur : le taux de conversion sur les propositions envoyées, par exemple, et pas le chiffre d’affaires du groupe.
- Relire un échantillon pendant le test pour vérifier que la consigne est appliquée.
L’étape quatre est celle qu’on saute. C’est aussi la seule qui empêche de se raconter des histoires, parce qu’elle enlève à celui qui regarde le pouvoir de décider quand s’arrêter.
Comment répartir les fans entre les deux variantes ?
Au hasard, fan par fan, et jamais selon une caractéristique de l’organisation. L’unité de répartition décide de ce que ton test compare réellement.
| Unité de répartition | Ce que le test compare en vrai | Verdict |
|---|---|---|
| Par fan, au hasard | les deux variantes | la seule bonne |
| Par chatteur | deux personnes | inutilisable |
| Par créatrice | deux comptes et deux fanbases | inutilisable |
| Par créneau | deux moments de la journée | inutilisable |
Si ton outil ne permet pas le tirage au sort, l’alternance stricte fonctionne : un fan sur deux, dans l’ordre d’arrivée des messages. Ce qui ne fonctionne pas, c’est de laisser chaque chatteur choisir à qui il applique la variante : le choix suit toujours l’intuition, et l’intuition suit les fans qui achètent déjà.
Quand un test est-il terminé ?
À la date et au volume écrits à l’étape quatre, pas avant, pas après. Un test prolongé parce que le résultat déplaît est aussi faussé qu’un test arrêté parce qu’il plaît.
Trois règles d’arrêt qui évitent les discussions :
- Le volume d’abord, la date ensuite. Si le volume prévu n’est pas atteint à la date prévue, prolonge sans changer la variante, et note-le.
- Pas de coup d’œil quotidien. Regarder chaque jour finit toujours par produire une décision anticipée. Une lecture à mi-parcours suffit, et seulement pour vérifier l’application de la consigne.
- Un seul chiffre tranche. Celui de l’étape cinq. Les autres se regardent après, pour comprendre, jamais pour décider.
Ensuite, note le résultat au même endroit que les précédents : question, variante, volume, dates, écart, décision. C’est ce registre, et pas la mémoire de l’équipe, qui empêche de retester six mois plus tard une question déjà tranchée.
Que faire demain matin si tu n’as jamais testé ?
Un seul test, sur une variable que tu peux changer sans rien réécrire.
- Choisis une question à laquelle ton équipe répond aujourd’hui par une opinion : la dernière ligne d’un message de vente, par exemple.
- Écris le protocole en six lignes, une par étape, et fais-le relire par la personne qui tiendra les conversations.
- Inscris la consigne dans tes scripts de chatting sous forme d’exemple avant/après, jamais sous forme de principe.
- Vérifie l’application avec ton contrôle qualité habituel, sur quelques conversations par personne et par semaine.
- Prévois d’avance ce que tu feras des deux résultats possibles. Une décision écrite avant se prend ; une décision laissée ouverte se discute.
Le reste du pilotage (quels chiffres regarder, à quelle fréquence, avec quel seuil) est traité dans les indicateurs d’une agence de créateurs.
justonedash réunit ce pilotage et le chatbot qui tient les conversations avec les fans, sans abonnement : 20 % des ventes réalisées. L’accès agence se fait sur candidature, l’espace créatrice est gratuit.
Questions fréquentes
Combien de conversations faut-il pour qu'un test veuille dire quelque chose ?
Assez pour que quelques ventes de plus ou de moins ne déplacent pas le résultat, ce qui suppose quelques centaines de propositions par groupe. En dessous, l'écart que tu observes est compatible avec le hasard, et le lire comme un enseignement est la première source de mauvaises décisions. Si tu n'as pas ce volume, ne renonce pas à mesurer : allonge la période au lieu d'élargir le test à d'autres variantes.
Peut-on tester deux choses en même temps pour aller plus vite ?
Non, et c'est le raccourci qui ruine le plus de tests en agence. Si tu changes la formulation et le moment de la proposition dans la même période, l'écart final n'est attribuable à aucun des deux, et la discussion se tranchera par l'autorité de celui qui parle le plus fort. Teste en série plutôt qu'en parallèle : deux tests propres l'un après l'autre valent mieux que quatre tests mélangés.
Faut-il séparer les fans par chatteur ou au hasard ?
Au hasard, fan par fan, jamais par chatteur. Répartir par personne revient à comparer deux chatteurs plutôt que deux variantes, et il n'existe pas deux chatteurs équivalents : l'un a hérité des fans les plus anciens, l'autre travaille les créneaux du soir. Le tirage au sort sur le fan est la seule répartition qui mélange ces différences dans les deux groupes au lieu de les concentrer dans un seul.
Comment savoir si l'équipe applique vraiment la variante testée ?
En relisant un échantillon de conversations pendant le test, pas seulement à la fin. Une consigne mal comprise, appliquée à moitié, produit un résultat plat qu'on interprète ensuite comme « ça ne marche pas ». Le contrôle qualité fait donc partie du protocole : il mesure l'application avant que le test ne mesure l'effet.
Un test négatif est-il un test raté ?
C'est le résultat le plus utile que tu puisses obtenir, parce qu'il t'évite de généraliser une pratique coûteuse. Une agence qui ne publie à son équipe que ses tests positifs finit par accumuler des consignes dont aucune n'a été vérifiée. Note les tests négatifs au même endroit que les autres, avec la date et le volume.
Faut-il tester sur plusieurs créatrices en même temps ?
Oui si tu veux savoir si le résultat tient au-delà d'un compte, non si tu veux un premier résultat rapidement. Un test mené sur une seule créatrice te dit ce qui marche pour elle, avec sa fanbase et sa façon d'écrire. Le rejouer ensuite sur deux ou trois autres comptes est ce qui transforme une observation locale en règle d'équipe.
Voir ce que ça donne en pratique
Le chatbot justonedash tient les conversations, garde la voix de chaque créatrice et travaille en continu.