Business-Software
A/B-Testing Tools für höhere Conversion Rates
Die meisten Tests werden zu früh beendet und messen dann Zufall. Wie viele Fälle nötig sind und wie ein Test aufgesetzt wird, der etwas beweist.
- 1
- Änderung pro Test
- 2 Wochen
- Mindestlaufzeit, volle Wochen
- ~100
- Abschlüsse je Variante als Faustwert
Ein A/B-Test teilt Besucher zufällig auf zwei Fassungen einer Seite auf und misst, welche häufiger zum gewünschten Abschluss führt. Das Verfahren ist alt und gut verstanden. Trotzdem sind die meisten Tests in der Praxis wertlos – nicht weil die Werkzeuge schlecht wären, sondern weil zu früh abgebrochen wird.
Was getestet werden sollte
Der Nutzen wächst mit der Nähe zur Entscheidung. In dieser Reihenfolge lohnt es sich:
- Formulare und Bestellabläufe. Jedes Feld weniger, jede klarere Beschriftung wirkt direkt.
- Überschrift und erster Absatz. Entscheiden darüber, ob überhaupt weitergelesen wird.
- Handlungsaufruf: Text und Position. „Angebot anfordern“ und „Absenden“ sind nicht dasselbe.
- Preisdarstellung. Reihenfolge, Hervorhebung, Anzahl der Stufen.
- Nachweise. Kundenstimmen, Referenzen, Zertifikate und wo sie stehen.
Farben von Buttons stehen bewusst nicht auf der Liste. Der Effekt ist meist so klein, dass er bei üblichen Besucherzahlen nicht nachweisbar ist – und die Testzeit ist an anderer Stelle mehr wert.
Die Rechnung vor dem Test
Vor dem Start müssen drei Zahlen feststehen:
- Aktuelle Abschlussquote. Der Ausgangswert.
- Kleinster interessanter Unterschied. Nicht „irgendeine Verbesserung“, sondern der Wert, ab dem Sie tatsächlich umstellen würden. Meist ein relativer Zuwachs von zehn bis zwanzig Prozent.
- Nötige Fallzahl. Ergibt sich aus beiden. Jeder Rechner für Stichprobengrößen liefert sie in einer Minute.
Kommt dabei heraus, dass der Test bei Ihrem Verkehrsaufkommen sieben Monate laufen müsste, ist das ein Ergebnis: Diese Änderung lässt sich nicht testen. Dann entscheiden Sie nach Sachargumenten, statt eine Messung vorzutäuschen.
Häufigster Fehler: den Test beenden, sobald eine Variante vorn liegt. Bei kleinen Fallzahlen wechselt die Führung mehrfach. Wer immer dann stoppt, wenn das gewünschte Ergebnis oben steht, misst ausschließlich den eigenen Bestätigungsdrang.
Werkzeugkategorien
| Kategorie | Passt für | Zu bedenken |
|---|---|---|
| Clientseitige Testwerkzeuge | Marketing-Teams ohne Entwicklungszugriff | Sichtbares Umschalten der Variante, Ladezeit leidet |
| Serverseitige Tests | Eigene Anwendung mit Entwicklungsteam | Kein Flackern, aber Aufwand je Test |
| Testfunktion des Shopsystems | Standard-Shops | Begrenzt auf vorgesehene Elemente |
| Funktionsschalter in der Anwendung | Software-Produkte | Braucht saubere Ereignismessung |
Ablauf eines belastbaren Tests
- Hypothese formulieren. „Weil das Formular sieben Pflichtfelder hat, brechen viele ab. Mit vier Feldern steigt die Abschlussquote.“ Prüfbar und mit Begründung.
- Fallzahl berechnen und Laufzeit festlegen. Beides vorher notieren, nicht während des Tests anpassen.
- Nur eine Änderung umsetzen. Alles andere bleibt gleich, auch die Werbung, die auf die Seite führt.
- Vorab prüfen. Beide Fassungen auf Mobilgerät und Desktop ansehen. Eine kaputte Variante ist kein Testergebnis.
- Laufen lassen und nicht hineinsehen. Zwischenstände verleiten zum Abbruch.
- Auswerten und festhalten. Auch das Ergebnis „kein Unterschied“ ist ein Ergebnis und verhindert, dass dieselbe Idee in einem Jahr erneut getestet wird.
Wenn der Verkehr nicht reicht
Die meisten Seiten haben zu wenige Besucher für aussagekräftige Tests. Dann helfen Verfahren, die keine Fallzahl brauchen:
- Nutzerbeobachtung. Fünf Personen beim Ausfüllen zusehen deckt mehr auf als ein unterbesetzter Test.
- Kurzbefragung auf der Seite. Eine Frage beim Verlassen: „Was hat Sie davon abgehalten?“
- Auswertung der Ausstiegspunkte. Der Schritt mit dem größten Verlust ist auch ohne Test sichtbar.
- Prüfung an anerkannten Regeln. Kontrast, Beschriftung, Fehlermeldungen, Ladezeit – hier braucht es keinen Beweis, dass Verbesserung hilft.
Wo die Hypothesen herkommen, zeigen Heatmaps. Welche Kennzahl der Test bewegen soll, klärt Welche Metriken zählen wirklich.
Häufige Fragen
Wie lange muss ein A/B-Test laufen?
Was ist statistische Signifikanz?
Kann man mehrere Änderungen gleichzeitig testen?
Was tun bei zu wenig Verkehr?
Passend dazu
Keyword-Recherche-Tools
Suchvolumen ist eine Schätzung, keine Messung. Wer weiß, woher die Zahl kommt, liest sie richtig – und wählt das passende Werkzeug.
CRM für Start-ups
Ein CRM lohnt sich früher, als die meisten denken – aber nur, wenn es jemand pflegt. Fünf Systeme und die Frage nach dem richtigen Zeitpunkt.
E-Mail-Marketing für KMU
Der Funktionsvergleich ist selten das Problem. Zustellbarkeit, Anmeldeverfahren und die Preisstufe bei 5.000 Adressen sind es.