Az A/B tesztelés egy kontrollált kísérleti módszer, amelyet egy weboldal, alkalmazásképernyő, e-mail vagy más digitális eszköz két vagy több verziójának összehasonlítására használnak annak meghatározása érdekében, hogy melyik teljesít jobban egy meghatározott cél, például az átkattintási arány, a regisztrációs arány vagy a látogatónkénti bevétel tekintetében. Legegyszerűbb formájában a forgalmat véletlenszerűen osztják fel egy kontrollverzió (A) és egy variáns (B) között, és statisztikai elemzést alkalmaznak a kapott adatokon annak eldöntésére, hogy a megfigyelt teljesítménybeli különbség valódi hatás-e, vagy egyszerűen a véletlenszerű változás eredménye. A technika közvetlenül a klinikai kutatásban és a mezőgazdasági tudományban alkalmazott randomizált, kontrollált vizsgálatok módszertanából merít, ezért a gyakorlati szakemberek gyakran hivatkoznak statisztikai szignifikanciára, konfidencia intervallumokra és mintaszámításokra a tesztterv megvitatásakor.
Az A/B tesztelés azért fontos, mert a szubjektív véleményeket és a belső vitákat empirikus bizonyítékokkal helyettesíti arról, hogy a valódi látogatók hogyan viselkednek valójában. A tervező és marketingcsapatok gyakran nem értenek egyet abban, hogy melyik címsor, gombszín, elrendezés vagy árképzési struktúra konvertál jobban, és az intuíció köztudottan megbízhatatlan útmutató: az e-kereskedelmi és SaaS webhelyeken végzett tanulmányok ismételten kimutatták, hogy a konverziós arányok javítását célzó változtatások a tesztek nagyjából 80-90 százalékában nem teszik ezt, vagy akár csökkentik azt. Azzal, hogy egy hipotézist élő közönségnek tesznek közzé, és közvetlenül mérik az eredményt, az A/B tesztelés lehetővé teszi a szervezetek számára, hogy validálják vagy elutasítsák az ötleteket, mielőtt a tervezési időt, a marketingköltségvetést vagy a márkakockázatot a teljes körű bevezetés érdekében fordítanák.
Egy érvényes A/B teszt futtatása többet igényel, mint pusztán a forgalom felosztását és a konverziók számának összehasonlítását. Az elemzők előre kiszámítják a minimális minta méretét, amely az alap konverziós arányon, a vállalkozás számára fontos minimálisan kimutatható hatáson, valamint a kívánt statisztikai erőn (általában 80 százalék) és szignifikanciaszinten (általában 95 százalék, vagy 0.05 alatti p-érték) alapul. A teszteket jellemzően legalább egy-két teljes üzleti cikluson keresztül, gyakran 14-30 napig futtatják, hogy figyelembe vegyék a hét napjainak hatásait, és elkerüljék a véletlenszerű ingadozás miatti korai leállást, ezt a hibát nevezik bekukucskálásnak. Az olyan eszközök, mint a VWO, az Optimizely és az AB Tasty kezelik a véletlenszerűsítést, a követést és a statisztikai számításokat, de a kimenet értelmezéséhez továbbra is meg kell érteni az olyan fogalmakat, mint a minta arányának eltérése és az újdonsághatások.
Gyakori tévhit, hogy egyetlen tesztből származó statisztikailag szignifikáns eredmény állandó, univerzális igazság. A valóságban az eredmények specifikusak a forgalmi szegmensre, az időszakra és a teszt kontextusára, és romolhatnak vagy visszafordulhatnak a közönség, az évszakok vagy a versenyfeltételek változásával. Egy másik gyakori buktató a túl sok változó egyszerre történő tesztelése megfelelő forgalom nélkül, ami gyenge teljesítményű teszteket eredményez, amelyek álpozitív eredményeket adnak, vagy egyáltalán nem érik el a szignifikáns szintet. A többváltozós tesztelés, amely több elem kombinációit vizsgálja egyszerre, lényegesen több forgalmat igényel, mint egy egyszerű kétváltozós A/B teszt, és nem jelent gyors megoldást a minta méretére vonatkozó követelmények megkerülésére.
Belül egy CRO Vagy UX tanácsadási megbízás esetén az A/B tesztelés az a mechanizmus, amely a kvalitatív kutatásokat, például a felhasználói interjúkat, a hőtérképeket és a munkamenet-felvételeket validált, bevételt befolyásoló döntésekké alakítja. Egy jól működő tesztelési program jellemzően egy strukturált folyamatot követ: adatok és kutatás segítségével azonosít egy súrlódási pontot, konkrét hipotézist állít fel arról, hogy miért létezik, és hogyan lehet kijavítani, rangsorolja azt más ötletekkel szemben egy pontozási keretrendszer segítségével, lefuttatja a kísérletet statisztikai érvényességig, és dokumentálja a tanulságokat, függetlenül attól, hogy a változat nyert-e vagy veszített. Idővel ez egy bizonyítékokon alapuló ütemtervet hoz létre, amely csökkenti a költséges újratervezések kockázatát, és intézményi ismereteket épít arról, hogy mi valójában befolyásolja az ügyfelek viselkedését egy adott webhelyen.