Super Sale WeekClaude Skills — 20% OFF
Tips

İstatistikçi Olmadan A/B Testi Sonuçları Nasıl Analiz Edilir (2026 Kılavuzu)

Powerdrill Team·
İstatistikçi Olmadan A/B Testi Sonuçları Nasıl Analiz Edilir (2026 Kılavuzu)

A/B testi sonuçlarını analiz etmek için iki grubu tek bir birincil metrik üzerinden karşılaştırın. Aradaki farkın normal rastgele sapmadan daha büyük olup olmadığını kontrol edin, ardından gerçek farkın düşebileceği aralığı belirtin. Excel bu aritmetiği yapabilir. Genellikle yanlış giden şey, bu süreçteki karar anlarıdır.

Bu kılavuz, sayılara bakmadan önce neleri toplamanız gerektiğini ve testi manuel olarak nasıl yürüteceğinizi kapsıyor. Ayrıca manuel yöntemin nerede yetersiz kaldığını ve sonuçların dürüstçe nasıl okunacağını da ele alıyor.

Testi okumaya başlamadan önce ihtiyacınız olanlar

Bir sonucun bir anlam ifade edip etmediğini dört şey belirler. Önce bunları toplayın.

Test çalıştırılmadan önce seçilmiş tek bir birincil metrik. Dönüşüm oranı, ziyaretçi başına gelir veya aktivasyon oranı. Bunu önceden belirleyin. Verileri gördükten sonra seçmek, ekiplerin kendilerini bir başarıya inandırma yoludur.

Sadece yüzdeler değil, ham sayılar. %3'lük bir artış 200 ziyaretçide farklı, 200.000 ziyaretçide ise bambaşka bir anlama gelir. Paydalara ihtiyacınız var.

Tam test süresi. Yarım haftalar sonuçları saptırır, çünkü hafta içi ve hafta sonu davranışları farklıdır. Testleri tam haftalar halinde çalıştırın.

Neyin değiştiğinin kaydı. Test başına tek bir değişken. Başlığı ve buton rengini aynı anda değiştirdiyseniz, hiçbir istatistik bunları birbirinden ayıramaz.

Bu dörtten biri bile eksikse, aritmetiğe geçmeden önce durun. Kusurlu bir test üzerinde yapılan hatasız bir hesaplama, yine de kendinden emin bir yanlış sonuç doğurur.

Her A/B testinin yanıtladığı iki soru

Her sonuç iki soruya indirgenir ve bunları birbiriyle karıştırmak kolaydır.

Fark gerçek mi? Bu, anlamlılık sorusudur. İki versiyon aslında tamamen aynı performansı gösterseydi, bu kadar büyük bir farkın ortaya çıkma olasılığının ne olduğunu sorgular. Bunu bir p-değeri (p-value) yanıtlar. Genel kabul, 0.05'in altındaki değerlerin harekete geçmek için yeterince düşük bir olasılık sayılmasıdır.

Fark önemseyecek kadar büyük mü? Bu, etki büyüklüğü sorusudur. Bir güven aralığı, gerçek farkın makul olarak hangi aralıkta yer aldığını göstererek bunu yanıtlar. İstatistiksel olarak gerçek olan %0.2'lik bir artış, yine de mühendislik maliyetine değmeyebilir.

Anlamlı ancak çok küçük olan bir test sonucu, yaygın ve maliyetli bir yanlış okumadır. Her iki soruyu da sırasıyla yanıtlayın. Her iki sayıyı birlikte raporlayın, çünkü yalnızca p-değerini duyan bir ekip, her anlamlı sonucu yayına alınabilir olarak değerlendirir.

Excel'de manuel yöntem

Excel bunu yerel olarak destekler. İzleyeceğiniz yol, ne tür bir metriği test ettiğinize bağlıdır.

İki grubu yan yana yerleştirin

Her varyant için bir sütun açın. Ziyaretçi başına gelir gibi sürekli bir metrik için her satır bir ziyaretçinin değeridir. Dönüşüm için her satır 1 veya 0'dır. Özet yerine ham satırları koruyun, çünkü formüller arka plandaki dağılıma ihtiyaç duyar.

Sürekli bir metrik için T.TEST kullanın

T.TEST(array1, array2, tails, type), Student t-testi ile ilişkili olasılığı döndürür. Önceden yalnızca tek bir yönün önemli olduğuna karar vermediyseniz tails = 2 kullanın. type için, eşleştirilmiş örneklemler için 1, iki grubun varyansı eşit olduğunda 2 ve eşit olmadığında 3 kullanın. İki örneklemli eşit olmayan varyans, çoğu web testi için daha güvenli bir varsayılandır.

Formül doğrudan p-değerini döndürür. Microsoft'un T.TEST işlevi sayfası parametreleri belgelemektedir.

Dönüşüm oranlarını farklı şekilde ele alın

Dönüşüm, sürekli bir ölçüm değil, bir orandır. Standart yaklaşım iki oranlı z-testidir ve Excel'de bunun için tek bir işlev yoktur. İki uygulanabilir seçeneğiniz vardır.

Z-testini birleştirilmiş oran ve standart hatadan manuel olarak oluşturun, ardından NORM.S.DIST ile skoru bir p-değerine dönüştürün. Veya sayıları varyantlara göre dönüştürülen ve dönüştürülmeyen şeklinde ikiye ikilik bir tablo olarak düzenleyin. Beklenen sayıları hesaplayın, ardından p-değerini elde etmek için CHISQ.TEST kullanın.

İkisi de işe yarar. İkisi de test yapısı her değiştiğinde yeniden kurulum gerektirir.

Manuel yöntemin yetersiz kaldığı yerler

Üç şey bu yöntemi kesinlikle sekteye uğratır.

Tek başına p-değeri size artışın büyüklüğünü söylemez, bu nedenle hala ayrı bir güven aralığı hesaplamasına ihtiyacınız vardır. Birden fazla metrik, yanlış pozitif oranınızı katlar ve tablodaki hiçbir şey sizi bu konuda uyarmaz. Ayrıca her yeni test, farklı biçimdeki bir dışa aktarma dosyasına karşı aynı formülleri yeniden kurmak anlamına gelir.

Gözden kaçırması kolay dördüncü bir maliyet daha vardır. Tabloyu kim oluşturduysa, onu kontrol edebilecek tek kişi o olur.

Tek bir test için manuel yöntem sorun değildir. Ancak haftalık bir test programı için aynı tabloyu yılda elli kez yeniden kuruyorsunuz demektir.

Powerdrill Bloom ile A/B testi sonuçları nasıl analiz edilir

Test verileriniz zaten bir dışa aktarma dosyasında bulunuyorsa, formül hazırlama adımını atlayabilirsiniz.

Adım 1: Test verilerinizi yükleyin

Test aracınızdan veya veritabanınızdan aldığınız Excel, CSV, veya TSV dışa aktarma dosyasını sürükleyip bırakın. Birden fazla dosya birlikte yüklenebilir, böylece bir etkinlik dosyası ile bir kullanıcı dosyası tek seferde karşılaştırılabilir. Sütun algılama ve temizleme işlemleri yükleme sırasında çalışır.

Anlamlılık analizi için A/B testi sonuçlarını Powerdrill Bloom'a yükleme

Adım 2: Karşılaştırmayı doğal dille açıklayın

Soruyu bir meslektaşınıza sorar gibi sorun. Örneğin: "A ve B varyantları arasındaki dönüşümü karşılaştır, farkın anlamlı olup olmadığını söyle ve bana güven aralığını ver." Ajan, metrik türü için uygun testi seçer, p-değerini ve aralığı raporlar ve hangi testi kullandığını açıklar. Segment kırılımı istediğinizde, sizi yeniden kurulum yapmaya zorlamak yerine testi tekrar çalıştırır.

Adım 3: Grafiği, raporu veya sunumu dışa aktarın

Sonucu bir grafik olarak alın, yazılı bir özete dönüştürün veya sunum için tuvali slaytlara dönüştürün. Professional, Business ve Fancy stillerinin tümü PowerPoint veya Notion'a aktarılabilir. Görsel taraf için, veri görselleştirme aracı aynı yüklemeden elde edilebilecek diğer grafik türlerini kapsar.

Powerdrill Bloom'da bir A/B testi sunumunu slayt destesi olarak dışa aktarma

Sonuçları abartılı iddialarda bulunmadan nasıl okumalısınız?

Gördüğünüz Anlamı Anlamına gelmediği durum
p = 0.03 Gerçek bir fark olmadığı durumda bu kadar büyük bir farkın oluşması düşük bir olasılıktır B'nin daha iyi olma olasılığının %97 olduğu anlamına gelmez
p = 0.20 Karar vermek için yeterli kanıt yok Versiyonların birebir aynı olduğunun kanıtı değildir
Aralık −%1 ila +%6 Gerçek artış negatif olabilir Orta nokta bu olsa bile, %2.5'lik bir artış olduğu anlamına gelmez
Anlamlı ancak %0.2'lik artış Gerçek, ancak muhtemelen yayına almaya değmez Tek başına bir iş başarısı değildir
Sekiz metrikten birinde anlamlı Kabaca sadece şansın üretebileceği bir sonuç Bir keşif değildir

Yuvarlamaları da dürüstçe yapın. Bir artışı virgülden sonra iki basamakla raporlamak, örneklem boyutunun desteklemediği bir hassasiyet algısı yaratır.

Sonucu içinde bir aralık barındıran bir cümle olarak yazın. "Varyant B, dönüşümü %1 ile %5 arasında bir oranda artırdı" dürüst bir ifadedir. Güven aralığı tamamen sıfırın üzerinde olmadığı sürece "Varyant B kazandı" demek dürüst değildir.

Sık yapılan hatalar

Testi ilk anlamlı göründüğü anda durdurmak. Sürekli kontrol edip ilk iyi sonuçta durdurmak, yanlış pozitifleri ciddi şekilde artırır. Örneklem boyutuna ve bitiş tarihine önceden karar verin, ardından bekleyin.

Sekiz metriği test edip kazananı raporlamak. Yeterli sayıda metrik olduğunda, bazıları şans eseri 0.05 sınırını aşacaktır. Birincil metriği en başta belirleyin ve geri kalanını bağlam olarak değerlendirin.

Paydayı göz ardı etmek. Küçük örneklemler dramatik görünen yüzdesel dalgalanmalar yaratır. Oranların yanında her zaman sayıları da gösterin.

Sonradan, bir şeyler işe yarayana kadar segmentasyon yapmak. Bir segment anlamlı çıkana kadar cihaz, ülke ve kanala göre dilimlemek, aynı problemin farklı bir biçimidir. Önem verdiğiniz segmentleri önceden belirleyin.

Hiçbir zaman karşılaştırılabilir olmayan grupları karşılaştırmak. Trafik dengesiz bölündüyse veya varyantlar farklı günlerde çalıştırıldıysa, ölçülen fark bu dengesizliği de içerir.

Anlamsız (null) bir sonucu başarısızlık olarak görmek. Fark göstermeyen bir test de gerçek bir bilgidir. Sizi emek gerektiren ama hiçbir getiri sağlamayan bir değişikliği yayına almaktan kurtarır.

Özetle

A/B testi sonuçlarını analiz etmek iki yanıta indirgenir: fark gerçek mi ve önemseyecek kadar büyük mü. Excel size T.TEST ile ilkini verir ve ikincisini kendiniz hazırlamanızı gerektirir. Oranlar, sürekli metriklerden farklı bir test gerektirir ki bu da çoğu insanın atladığı adımdır.

Düzenli olarak testler yapıyorsanız, yeniden kurulum süreci ortadan kaldırılmaya değerdir. Powerdrill Bloom'u ücretsiz deneyin — dışa aktarma dosyasını yükleyin, doğal dille karşılaştırma isteyin ve sonucu dışa aktarın. Araç seçenekleri için A/B testi analizi için yapay zeka araçları sayfasına, temel bilgiler için ise tanımlayıcı istatistiklerin nasıl çalıştırılacağı başlıklı yazıya göz atın.

Sıkça sorulan sorular

A/B testi sonuçlarımın anlamlı olup olmadığını nasıl anlarım?

İki grubu birincil metriğiniz üzerinden karşılaştırın ve bir p-değeri hesaplayın. 0.05'in altı, bir farkın şans eseri olma olasılığının düşük olduğunu söylemek için genel kabul gören eşiktir. Bunu bir güven aralığı ile eşleştirin, çünkü tek başına anlamlılık farkın ne kadar büyük olduğu hakkında hiçbir şey söylemez.

A/B testi sonuçlarını Excel'de analiz edebilir miyim?

Evet. Ziyaratçi başına gelir gibi sürekli metrikler için T.TEST kullanın. Dönüşüm oranları birer orandır, bu nedenle iki oranlı bir z-testi veya ikiye ikilik bir sayı tablosu üzerinde ki-kare testi gerektirirler. Excel'de iki oranlı test için tek bir yerleşik işlev yoktur.

Bir A/B testi için ne kadarlık bir örneklem boyutuna ihtiyacım var?

Bu, temel oranınıza ve tespit etmeye değer en küçük artış miktarına bağlıdır. Beklenen daha küçük artışlar, çok daha büyük örneklemler gerektirir. Testi başlatmadan önce hedefi hesaplayın, ardından sonuç iyi göründüğünde durmak yerine bu sayıya ulaşana kadar testi çalıştırın.

Bir p-değeri bana gerçekte ne söyler?

İki versiyon gerçekten aynı performansı gösterseydi, en az bu kadar büyük bir fark görme olasılığını verir. Düşük bir p-değeri, şansın zayıf bir açıklama olduğu anlamına gelir. Varyantınızın daha iyi olma olasılığı değildir.

A/B testim neden hiçbir fark göstermedi?

Üç yaygın nedeni vardır. Örneklem etkiyi tespit etmek için çok küçüktü, değişiklik davranışı değiştirmek için çok belirsizdi veya gerçekten hiçbir fark yoktu. Anlamsız (null) bir sonuç gerçek bir bulgudur ve sizi hiçbir getiri sağlamayan bir şeyi yayına almaktan korur.