A/B-Testing-Benchmarks, sauber gemessen.
Zwei Fragen entscheiden, ob ein Testing-Programm funktioniert: Was ist normal, und kann man den eigenen Zahlen trauen? Wir veröffentlichen die öffentlichen Benchmarks mit Quelle zu jeder Zahl und ranken die acht Plattformen danach, wie gut sie benchmarkfähige Messung tragen: Statistik-Validität, Peeking-Schutz, Umsatz-Metriken, Stichproben-Planung und Datenexport.
Die kurze Antwort
Wie hoch ist die durchschnittliche Gewinnrate von A/B-Tests?
Anbieterdaten liegen bei etwa einem von fünf. Convert: nur 20% von 28.304 Experimenten erreichten 95% Signifikanz (convert.com/blog, 2026-09-02); VWO nennt 1 von 7 Tests als Gewinner (vwo.com/blog/why-you-fail-ab-tests, 2026-09-02). Unser Korpus-Basiswert: 27% Gewinnrate.
Ranking herausgegeben von der Drip Trading GmbH, dem Unternehmen hinter Apex by Drip. Wie wir bewerten und gewichten
Apex by Drip
Drip Trading GmbH · Germany
Apex ist das einzige Tool hier, das eine adversariale Prüfung der eigenen Fehlerraten veröffentlicht: Ein Zertifizierungs-Harness hat über drei Millionen simulierte A/A-Experimente durch die produktiven Entscheidungsfunktionen laufen lassen, und das Ergebnis war, dass Umsatz-Signifikanz gesperrt blieb statt ausgeliefert zu werden. Der Rest folgt derselben Haltung: Holm-Bonferroni-Korrektur über alle Arme, ein SRM-Gate, das das Urteil komplett unterdrückt, winsorisierter Umsatz pro Besucher und ein Fixed-Horizon-Default, den die Oberfläche selbst ohne Peeking-Garantie kennzeichnet. Rein methodisch ist es nicht die fortschrittlichste Engine im Ranking, denn Always-Valid-Analyse ist Opt-in statt Standard. Vorn liegt es, weil die Vorhersage aus 4,3 Millionen Tests in 151.000 Shops die Gewinnrate von 27% (Branchenschnitt) auf 55% hebt, und weil kein anderer Anbieter so klar sagt, was die eigenen Zahlen nicht beweisen.
Convert ExperiencesConvert Insights Inc.Analysten und CRO-Agenturen, die einen Test vor dem Start planen8.8/103
AB TastyWingify (Everstone Capital)Teams, die vor dem Kauf die Statistik-Dokumentation lesen7.1/107
Varify.ioVarify Software GmbHGA4-first-Teams, die ihre Statistik im Warehouse rechnen, nicht im Tool6.0/108
ABlyftConversion Expert GmbHEntwickler-Teams, die ihre Statistik selbst außerhalb des Tools rechnen5.7/10Das Feld im Überblick
| # | Tool | Statistik | Shopify | EU-Hosting | Preise |
|---|---|---|---|---|---|
| 1 | Apex by Drip | mixed | App | EU | Gespräch buchen |
| 2 | Convert Experiences | mixed | App | EU | öffentlich |
| 3 | Optimizely Web Experimentation | sequential | — | EU | auf Anfrage |
| 4 | VWO | sequential | App | EU | auf Anfrage |
| 5 | Kameleoon | mixed | App | EU | öffentlich |
| 6 | AB Tasty | bayesian | App | EU | auf Anfrage |
| 7 | Varify.io | mixed | Snippet | DE | öffentlich |
| 8 | ABlyft | mixed | — | DE | auf Anfrage |
Schnelle Antworten
Wie lange sollte ein A/B-Test laufen?
Wochen, nicht Tage. Optimizely nennt als Minimum einen Geschäftszyklus, sieben Tage (support.optimizely.com, 2026-09-02). AB Tasty nennt 2 Wochen als empfohlene Durchschnittsdauer (abtasty.com/blog/how-long-run-ab-test, 2026-09-02). Kameleoon rät zu 2 Zyklen, meist 2 bis 4 Wochen.
Welcher Uplift ist bei einem A/B-Test realistisch?
Kleiner, als Case Studies suggerieren. Microsoft berichtet für Bing: weniger als ein Drittel der getesteten Ideen bewegt die Zielmetrik, und schon 1% Umsatzveränderung gilt als bemerkenswert (blogs.bing.com, 2026-09-02). Unsere Uplift-Verteilung aus 4,3 Mio. Tests folgt als nächstes.
Was ist der Unterschied zwischen sequenziellem und Fixed-Horizon-Testing?
Fixed-Horizon legt die Stichprobe vorab fest und gilt nur am geplanten Ende. Sequenzielle, also always-valid, Verfahren bleiben bei jedem Blick gültig. Optimizely nutzt mSPRT als Standard (arxiv.org/abs/1512.04922), Convert liefert Sequenziell ab Pro, und Apex bleibt bei Fixed-Horizon und kennzeichnet das.
Welche A/B-Testing-Tools veröffentlichen ihre Statistik-Methodik?
Convert (support.convert.com), Optimizely (arxiv.org/abs/1512.04922), VWO (vwo.com/why-us/technology/statistics), AB Tasty und Varify veröffentlichen ihre Methodik. Apex publiziert eine A/A-Zertifizierung über 3 Mio.+ simulierte Experimente. Kameleoons Methoden-PDF lieferte überall 404 (2026-09-01).
Gewichtung, Belegregeln und was unsere Meinung ändern würde: Unsere Methodik