Ein Test wird nach drei Tagen abgebrochen, weil Variante B eindeutig gewinnt. Klingt vernuenftig. Ist meist falsch.
A/B Testing ist keine Raketenwissenschaft. Aber es gibt ein paar Grundregeln, die viele ignorieren.
Wird ein Test vorzeitig abgebrochen, weil eine Variante scheinbar eindeutig gewinnt, wird oft zufaelliges Rauschen als Signal interpretiert. Das nennt sich Peeking Problem, und es fuehrt zuverlaessig zu falschen Entscheidungen.
Wie lange ein Test wirklich laufen muss
Mindestens eine volle Geschaeftswoche, um Wocheneffekte auszugleichen. Idealerweise bis zur statistischen Signifikanz bei einem vorab definierten Confidence Level, 95 Prozent ist Standard, und mit einer vorab kalkulierten Mindeststichprobengroesse. Kostenlose Sample Size Calculators uebernehmen diese Rechnung.
Was sich zu testen lohnt
Headlines und Call-to-Actions bringen oft die groessten Effekte und sind einfach zu testen. Danach folgen Formularlaenge, Seitenlayout, Preisdarstellung und Bilder. Kleine Designaenderungen wie eine Button-Farbe ohne klare Hypothese lohnen sich dagegen selten. Jeder Test braucht eine Hypothese in der Form: Wenn wir X aendern, erwarten wir Y, weil Z.
Werkzeuge im Ueberblick
Google Optimize ist Geschichte. Aktuelle Optionen sind VWO, Optimizely fuer den Enterprise-Bereich, AB Tasty oder, fuer eine selbst gehostete Variante, GrowthBook. Fuer viele kleinere Projekte sind Feature Flags kombiniert mit eigenem Event-Tracking guenstiger und transparenter als teure Testing-Suites.
Nach dem Test
Die Gewinnervariante wird deployt, und dokumentiert, warum sie gewonnen hat. Diese Learnings sind langfristig wertvoller als die einzelne Conversion-Verbesserung.
Checkliste: Hypothese schriftlich formuliert, Mindeststichprobengroesse vorab berechnet, Testdauer fixiert, nur eine Variable pro Test geaendert, Segmentierung geprueft, Ergebnisse dokumentiert.
Ein Beispiel aus der Praxis
Ein Team testete zwei Varianten eines Checkout-Buttons und stoppte den Test nach vier Tagen, weil eine Variante deutlich vorne lag. Wenige Wochen spaeter zeigte sich beim naechsten, laenger laufenden Test dasselbe Muster in die entgegengesetzte Richtung. Die Ursache: Der erste Test war ueber ein verkaufsstarkes Wochenende gelaufen, das die Daten verzerrt hatte, waehrend der laengere Test auch normale Wochentage einschloss. Seither gilt im Team eine feste Regel: kein Testabbruch vor Ablauf einer vollen Woche, unabhaengig davon, wie eindeutig ein Zwischenstand aussieht.
A/B-Testing-Strategie fehlt noch? markom.digital hilft beim Aufbau eines strukturierten Testing-Prozesses, von der ersten Hypothese bis zur ausgewerteten Testserie.