Bei einem E-Mail-Holdout-Test erhält eine berechtigte Gruppe eine Kampagne, während eine vergleichbare Gruppe sie nicht erhält. Damit wird gefragt, ob die Nachricht das Kaufverhalten verändert hat, statt welche Bestellungen einer Zuordnungsregel entsprachen. Das Konzept ist einfach; ein verlässlicher Vergleich erfordert sorgfältige Gruppenzuteilung, einheitliche Messung und Beachtung anderer Nachrichten, die dieselben Kunden erhalten.
Gruppen vor dem Versand planen
Beginnen Sie mit einer berechtigten Zielgruppe und teilen Sie eine vergleichbare Teilgruppe für die Promotion zu; eine andere erhält diese konkrete Marketingnachricht nicht. Erforderliche Servicekommunikation muss weiterlaufen. Halten Sie keine wichtigen Bestellinformationen für ein Experiment zurück.
Verwenden Sie verfügbare Zielgruppensteuerungen zur Planung und dokumentieren Sie die Zuteilung. Können Sie keine vergleichbaren Gruppen bilden oder Ergebnisse nicht einheitlich verfolgen, behandeln Sie die Auswertung als explorativ und nicht als verlässlichen Kausaltest.
Die Behandlung genau definieren
Legen Sie fest, ob Sie eine einzelne E-Mail, eine Nachrichtenfolge oder die Ergänzung von SMS zu einem bestehenden E-Mail-Plan testen. Die Kontrollgruppe sollte sich nur in dieser definierten Marketingbehandlung unterscheiden; notwendige Servicenachrichten bleiben erhalten. Werden mehrere andere Bedingungen geändert, beantwortet das Ergebnis eine breitere Frage als die Wirkung einer E-Mail.
Teilen Sie berechtigte Kunden nach Möglichkeit und geeigneten Daten zufällig zu und behalten Sie die Gruppenzugehörigkeit während der Beobachtungszeit bei. Weisen Sie nicht die am wenigsten aktiven Personen der Kontrollgruppe und die besten Kunden der Behandlungsgruppe zu. Ein solcher Vergleich misst vor allem die Auswahl, nicht die Wirkung der Kampagne.
Dokumentieren Sie Zuteilungsverfahren, Gruppengrößen, Ausschlüsse, geplante Kontakte und Hauptergebnis vor dem Versand. Messen Sie das Ergebnis aus einer Quelle, die Käufe in beiden Gruppen erfassen kann. Nachrichtenzugerechneter Umsatz allein ist ungeeignet, denn die Gruppe ohne Nachricht hat keine entsprechende Gelegenheit zur Zuordnung.
Andere Einflüsse sichtbar halten
Prüfen Sie, ob andere Kampagnen, Automatisierungen oder öffentliche Angebote die Gruppen unterschiedlich erreichen. Eine Kontrollgruppe für eine E-Mail kann denselben Sale an anderer Stelle sehen. Das macht den Test nicht automatisch nutzlos, verändert aber, was sich daraus ableiten lässt.
Verwenden Sie für beide Gruppen denselben Beobachtungszeitraum und dieselbe Ergebnisdefinition. Vergleichen Sie Bestellquote oder Deckungsbeitrag pro berechtigtem Kunden und nicht nur zugerechneten Umsatz, da die Gruppe ohne Nachricht keinen gleichwertigen Weg zur Nachrichtenzuordnung hat.
Den Unterschied berechnen, ohne zu viel daraus abzuleiten
Stellen Sie sich 2.000 Kunden in jeder Gruppe vor. Während desselben Beobachtungszeitraums kaufen 60 Personen in der Behandlungsgruppe und 50 in der Kontrollgruppe. Die beobachteten Raten sind 3 und 2,5 Prozent, also 0,5 Prozentpunkte Unterschied. Auf 2.000 Kunden angewendet entspricht das einer beobachteten Differenz von zehn Käufern; es beweist nicht, dass alle 60 Käufe durch die Nachricht entstanden.
Auch dieses Beispiel erfordert eine Bewertung der Unsicherheit. Zufällige Schwankungen können einen Unterschied verursachen, besonders wenn Käufe selten sind. Verwenden Sie eine geeignete statistische Analyse und prüfen Sie, ob die Wirkung wirtschaftlich relevant ist. Ein positiver Punktschätzer ist keine verlässliche Schlussfolgerung.
Den Unterschied zurückhaltend interpretieren
Kleine Gruppen und seltene Käufe erzeugen verrauschte Ergebnisse. Ein geringer Unterschied kann unentschieden bleiben. Dokumentieren Sie Stichprobengröße, Überschneidungen, Zeitpunkt und Abweichungen vom Plan, bevor Sie eine geschäftliche Aussage treffen.
Kampagnenberichte von Sendvio können in die Auswertung einfließen; ein Holdout ist jedoch ein Messverfahren und keine garantierte Dashboard-Funktion. Verwenden Sie es, wenn die Entscheidung die Vorbereitung rechtfertigt. Ziel ist, zusätzlichen Wert zu verstehen – einschließlich der Fälle, in denen weniger Versand ein ähnliches wirtschaftliches Ergebnis liefert.
Untersuchen Sie Kontakte außerhalb der getesteten Nachricht. Eine Person der Kontrollgruppe kann den öffentlichen Sale sehen oder eine andere zulässige Automatisierung erhalten. Das macht den Test nicht automatisch ungültig, bedeutet aber, dass Sie die zusätzliche Wirkung der festgelegten Behandlung im breiteren Umfeld schätzen und nicht die Wirkung sämtlichen Marketings gegenüber gar keinem.
Vergleichen Sie, wenn es für die Entscheidung nötig ist, Deckungsbeitrag und negative Reaktionen anhand einheitlicher Definitionen und mit genügend Zeit für Rücksendungen. Machen Sie Abweichungen vom Plan sichtbar. Waren die Gruppen nicht vergleichbar oder Kontakte schlecht erfasst, berichten Sie den Versuch als explorativ. Ein guter Holdout kann zeigen, dass eine Kampagne Mehrwert bringt, wenig beiträgt oder mehr kostet als sie einnimmt. Alle drei Ergebnisse sind nützlich, wenn sie eine echte Entscheidung verändern.