A/B testi nə vaxt mənalıdır — trafik həddi məsələsi

Üç gün əvvəl saytınızda iki fərqli başlıq sınadınız. Bu gün B versiyası A-dan irəlidədir — deyəsən. Sevincdən B-ni saxlayıb testi bağlayırsınız. Bir həftə sonra rəqəmlərə yenidən baxanda fərq yoxa çıxıb, hətta A geri öndədir. Test səhv nəticə vermədi — siz onu vaxtından əvvəl oxudunuz.
A/B testi güclü alətdir, amma yalnız iki şərtlə işləyir: kifayət qədər trafik və nəticəni gözləmə səbri. İkisindən biri çatışmadıqda alət sizə cavab vermir, sadəcə təsadüfü rəsmi rəqəm kimi geri qaytarır. Aşağıda bunun niyə belə olduğu və trafikiniz azdırsa nə etməli olduğunuz var.
Niyə erkən baxmaq testin özünü öldürür
Hər gün nəticəyə baxıb, "B qalib gəlir" görən kimi dayandırmaq təbii instinktdir. Amma statistikanın əhəmiyyətlilik hesablaması qabaqcadan sabitlənmiş nümunə həcmini fərz edir. Evan Miller-in bu barədə geniş sitat gətirilən yazısına görə, nəticəyə hər müşahidədən sonra baxıb "əhəmiyyətli" görünən an dayanmaq, elan edilən 5% yanlış-pozitiv nisbətini əslində 26,1%-ə qədər şişirdir. Yəni "95% əminik" deyə elan etdiyiniz qalib, real dünyada dörddə bir ehtimalla sadəcə təsadüfdür.
Müəllifin öz sözü ilə: nümunə həcmini əvvəlcədən sabitləməmiş heç bir veb eksperimenti aparılmamalıdır — və bu qərara "demək olar dini intizamla" sadiq qalınmalıdır. Yəni test başlamazdan əvvəl "neçə ziyarətçidən sonra baxacağıq" sualının cavabı yazılı olmalıdır, testin ortasında yox.
Trafik həddi nə deməkdir
"Kifayət qədər trafik" mücərrəd ifadə deyil — üç konkret amilin funksiyasıdır: hazırkı konversiya nisbəti, gözlədiyiniz fərqin ölçüsü və gündəlik ziyarətçi sayı. Optimizely-nin statistik əhəmiyyət izahına görə, "daha böyük nümunələr ümumən daha etibarlı nəticələr verir" və "sayt testləri üçün daha çox trafik daha sürətli, daha dəqiq nəticə deməkdir." Universal bir "min ziyarətçi kifayətdir" rəqəmi yoxdur, çünki cavab hər saytın öz konversiya nisbətindən asılıdır.
Az trafikdə "qalib" niyə yalandır
Ayda 300 ziyarətçisi olan sayt üçün bir həftəlik test bir neçə onlarla klikə söykənir. Bu ölçüdə nümunədə statistik "əhəmiyyətli" görünən fərq çox vaxt sadəcə kiçik ədədlərin təbii dalğalanmasıdır — sikkəni iki dəfə atıb ikisinin də yazı gəlməsi kimi. Böyük saytlarda eyni fərq minlərlə müşahidə üzərində sabit qalırsa, deməli real ola bilər.
Sual necə qoyulmalıdır
"Neçə ziyarətçi lazımdır?" yerinə "cari nisbətimlə, gözlədiyim fərqlə, gündəlik trafikimlə testi neçə həftəyə bitirə bilərəm?" sualı verin. Cavab tez-tez "bir neçə ay" çıxır — və bu, çoxu kiçik biznes üçün real vaxt büdcəsi deyil. Bu hesablamanı əvvəlcədən aparmaq sizi "testi nə vaxt bağlayacağıq" sualından "bu dəyişikliyi ümumiyyətlə testlə yoxlamağa dəyərmi" sualına aparır — və çox vaxt daha dürüst cavab elə budur.
Statistik əhəmiyyət nə deyir, nə demir
Statistik əhəmiyyət sizə "B həmişəlik qalib olacaq" demir — Optimizely-nin tərifinə görə o, "bir variasiya ilə əsas versiya arasındakı konversiya fərqinin təsadüfi olma ehtimalı"nı ölçür. Bu, keçmiş dövr üçün bir ehtimal qiymətləndirməsidir, gələcək üçün zəmanət deyil. Klassik metodologiya minimum aşkarlana bilən effekti və nümunə həcmini əvvəlcədən müəyyənləşdirməyi, sonra nəticəyə baxmadan gözləməyi tələb edir — əks halda elan edilən əhəmiyyətlilik səviyyəsi sadəcə yanlış olur, çünki nəticəyə təkrar-təkrar baxmaq yanlış-pozitiv nisbətini həmişə artırır.
Erkən bağlanan test cavab vermir — sadəcə təsadüfü rəsmi rəqəm kimi qeydə alır.
Az trafikli saytda alternativ: ardıcıl təkmilləşdirmə
Trafikiniz test üçün kifayət deyilsə, bu, saytınızı yaxşılaşdıra bilməyəcəyiniz demək deyil — split test yerinə ardıcıl təkmilləşdirmə işləyir. Məlum UX prinsiplərinə (aydın CTA, qısa forma, sürətli yüklənmə) əsaslanan dəyişikliyi tətbiq edin, split testlə "sübut" axtarmaq əvəzinə uzun müddət ərzində trendi izləyin. İstilik xəritəsi, sessiya qeydi və birbaşa müştəri sualları kimi keyfiyyət siqnalları az trafikdə statistikadan daha etibarlı istiqamət verir, çünki onlar "hansı rəqəm qalib" sualına yox, "insanlar harada dayanır" sualına cavab verir.
Məsələn, ayda 500 ziyarətçisi olan xidmət saytı üçün başlıq testini iki ay çəkdirmək əvəzinə, sessiya qeydinə baxıb insanların formada hansı sahədə dayandığını görmək bir günə cavab verir — və həmin dəyişikliyi bütün ziyarətçilərə eyni anda tətbiq edə bilərsiniz, çünki heç kimi süni şəkildə "test qrupuna" bölmürsünüz.
Digər tez-tez buraxılan səhvlər
- Mövsümi təsir testi korlayır. Böyük endirim kampaniyası, bayram günləri və ya birdəfəlik reklam partlayışı zamanı aparılan test o həftənin xüsusi davranışını ölçür, adi günü yox. Nəticəni sakit, "normal" hesab olunan dövrdə təkrar yoxlamadan qərar üçün istifadə etməyin.
- Yenilik effekti diqqəti çəkir, keyfiyyəti göstərmir. İstifadəçilər yalnız fərqli göründüyü üçün yeni versiyaya fərqli reaksiya verir — bu, testin ilk günlərində süni "qalib" yaradır və bir neçə həftə sonra fərq özbaşına yox olur. Testi planlaşdırılan müddətdən erkən bağlamamaq bu təsiri neytrallaşdırır.
- Eyni səhifədə paralel testlər bir-birini korlayır. Başlıq testini düymə rəngi testi ilə eyni anda aparsanız, ziyarətçi hər iki dəyişikliyi eyni anda görür və hansının nəticəyə təsir etdiyini heç vaxt ayırd edə bilməzsiniz. Bir səhifədə bir anda yalnız bir test aparın.
Testə başlamazdan əvvəl yoxlanmalı dörd bənd
- Nümunə həcmi əvvəlcədən yazılıb — testin neçə ziyarətçidən yaxud neçə həftədən sonra bağlanacağı başlamazdan əvvəl qərarlaşdırılıb, nəticəyə görə deyil.
- Tək dəyişən var — başlıq da, düymə də, şəkil də eyni anda dəyişirsə, hansının təsir etdiyini heç vaxt biləməzsiniz.
- Uğur metriki bir dənədir — "klik, yoxsa satış, yoxsa hər ikisi" sualı testdən əvvəl cavablanıb.
- Bağlanana qədər baxılmır — baxmaq maraqlıdır, amma nəticəyə görə hərəkət etmək qadağandır, elə buna görə testin bitmə tarixi əvvəlcədən yazılıb.
Trafikiniz kifayət qədərdirsə, testin özünü düzgün qurmaq nəticəni aylarla gec görməkdən qat-qat ucuzdur. Konversiya A/B test xidmətimizdə nümunə həcmini, tək dəyişəni və dayanma qaydasını əvvəlcədən sizinlə yazılı razılaşdırırıq — sonra heç kim erkən baxıb qərar vermir.