20. Betimsel İstatistik: Merkez ve Dağılım

    Matematikİstatistik

    Betimsel istatistik, elimizdeki ham gözlemleri birkaç anlamlı ölçüyle özetleyerek verinin nerede toplandığını, ne kadar yayıldığını ve nasıl bir biçim aldığını görmemizi sağlar. Bir yapay zekâ modeli kurulmadan önce veriyi tanımak, olağandışı değerleri fark etmek ve model sonuçlarını doğru yorumlamak için bu özetlere ihtiyaç duyarız. Bu makalede ortalama, ortanca ve tepe değer gibi merkez ölçülerini; açıklık, çeyrekler arası açıklık, varyans ve standart sapma gibi dağılım ölçülerini tek bir veri kümesi üzerinde adım adım hesaplayacak, hangi ölçünün hangi durumda yanıltıcı olabileceğini inceleyeceğiz.

    Bir Sayı Listesi Bize Ne Anlatır?

    Bir kargo şirketinin on teslimatının kaç günde tamamlandığını kaydettiğimizi düşünelim:

    $$ 2, 3, 3, 4, 4, 4, 5, 5, 6, 14 $$

    Listeyi okuyunca teslimatların çoğunun birkaç gün içinde tamamlandığını, bir teslimatın ise belirgin biçimde uzun sürdüğünü seziyoruz. Fakat iki şubeyi karşılaştırmak, müşteriye tipik bir süre söylemek veya gecikmelerin ne kadar değişken olduğunu ölçmek istersek sezgi tek başına yetmez. Şu sorulara sayısal cevaplar ararız:

    • Merkez: Teslimat sürelerinin tipik veya temsil edici değeri nedir?
    • Dağılım: Süreler merkezin çevresinde ne kadar sıkı ya da dağınık duruyor?
    • Biçim: Değerler simetrik mi, bir tarafa doğru uzuyor mu, birden fazla kümeye mi ayrılıyor?
    • Olağandışı gözlemler: Diğerlerinden belirgin biçimde uzak değerler var mı?

    Bir önceki makalede önce bir olasılık modeli seçmiş, ardından gözlenen veriye en iyi uyan model parametresini MLE veya MAP ile tahmin etmiştik. Şimdi bir adım geri çekiliyor ve henüz belirli bir dağılım modeli kurmadan önce şu daha temel soruyu soruyoruz: Elimizdeki veri kendi başına nasıl görünüyor?

    Betimsel istatistik (descriptive statistics), gözlediğimiz veriyi düzenleyen ve bu sorulara cevap veren yöntemlerin bütünüdür. “Betimsel” sözcüğü önemlidir: Burada önce elimizdeki verinin ne söylediğini açıklıyoruz. Bu veriden daha büyük bir topluluk hakkında ne kadar güvenle sonuç çıkarabileceğimiz ise ileride Çıkarımsal İstatistik ve Hipotezler yazısının konusu olacaktır.

    Gözlem, Değişken, Anakütle ve Örneklem

    Hesaplara başlamadan önce verinin parçalarını adlandıralım. Her teslimat bir gözlemdir. Teslimat süresi, gözlemden gözleme farklı değer alabilen bir değişkendir. Bizim değişkenimiz gün cinsinden sayısal bir büyüklüktür.

    İlgilendiğimiz bütün teslimatların oluşturduğu topluluğa anakütle veya evren (population) denir. Örneğin şirketin bir yıl içindeki bütün teslimatları anakütle olabilir. Bu topluluktan incelediğimiz daha küçük bölüme ise örneklem (sample) deriz. Yukarıdaki on teslimat, daha geniş bir teslimat sürecinden seçildiyse bir örneklemdir.

    Bu ayrım yalnızca kelime seçimi değildir. Elimizdeki on değeri kendi başına özetliyorsak onların gerçek ortalamasını ve varyansını hesaplarız. Fakat bu on gözlemden bütün yılın bilinmeyen davranışını tahmin etmeye çalışıyorsak, hesapladığımız sayılar birer tahmin olur ve örneklem belirsizliği taşır.

    Ayrıca her değişkene her işlemi uygulayamayız. Süre, yaş ve sıcaklık gibi sayısal değişkenlerde ortalama anlamlı olabilir. Şehir adı, ürün türü veya sınıf etiketi gibi kategorik değişkenlerde ise kategorilere 1, 2, 3 kodları vermek bu sayıların ortalamasını anlamlı hâle getirmez. Kategorik veriyi çoğunlukla sayı ve oranlarla, yani her kategorinin kaç kez görüldüğüyle özetleriz.

    İlk Adım: Veriyi Sıralamak ve Saymak

    Veriyi küçükten büyüğe sıralamak, merkezin ve yayılımın önemli parçalarını görünür kılar. Teslimat sürelerimiz zaten sıralı. Şimdi her sürenin kaç kez görüldüğünü bir frekans tablosunda toplayalım:

    Süre \(x\) (gün) Frekans \(f\) Göreli frekans \(f/n\)
    21%10
    32%20
    43%30
    52%20
    61%10
    141%10

    Frekans, bir değerin kaç kez gözlendiğini; göreli frekans ise toplam içindeki payını gösterir. Örneğin 4 günlük teslimat 3 kez görüldüğü için göreli frekansı \(3/10=0{,}30\), yani yüzde 30'dur. Frekans tablosu tekrarları sıkıştırır fakat gözlem sayısını korur: Frekansların toplamı \(n=10\), göreli frekansların toplamı \(1\) olmalıdır.

    Sıralama ve frekans hesabı basit görünse de önemli bir veri kontrolüdür. “\(-3\) gün” gibi olanaksız bir değer, yanlış birimle girilmiş “96 saat” veya ondalık ayırıcı hatası yüzünden \(4{,}5\) yerine \(45\) yazılması burada dikkat çekebilir. İstatistiksel olarak uzak görünen her değer hatalı değildir; fakat incelenmeye değerdir.

    Denge Noktası Olarak Aritmetik Ortalama

    En tanıdık merkez ölçüsü aritmetik ortalamadır. \(n\) gözlemimiz \(x_1,x_2,\ldots,x_n\) ise örneklem ortalamasını \(\bar{x}\) ile gösteririz:

    $$ \bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i $$

    Üstteki çizgi nedeniyle \(\bar{x}\) ifadesini “x çizgi” diye okuyabiliriz. Formül “bütün gözlemleri topla ve gözlem sayısına böl” demektedir. Teslimat verisinde:

    $$ \begin{aligned} \bar{x} &=\frac{2+3+3+4+4+4+5+5+6+14}{10}\\ &=\frac{50}{10}\\ &=5\text{ gün} \end{aligned} $$

    Ortalama 5 gündür. Bu, on teslimatın toplam süresi eşit biçimde paylaştırılsaydı her birine 5 gün düşeceği anlamına gelir. Ortalama bu nedenle bir denge noktası gibi düşünülebilir.

    Bu dengeyi sapmaları toplayarak görebiliriz. Her değerden ortalamayı çıkardığımızda:

    $$ \sum_{i=1}^{n}(x_i-\bar{x}) =\sum_{i=1}^{n}x_i-n\bar{x} =n\bar{x}-n\bar{x} =0 $$

    Ortalamadan küçük değerlerin negatif sapmaları ile büyük değerlerin pozitif sapmaları birbirini tam olarak dengeler. Fakat bu özellik yayılımın sıfır olduğu anlamına gelmez. Tam tersine, biraz sonra varyansı hesaplarken sapmaların işaret yüzünden yok olmasını engelleyeceğiz.

    Frekans tablosundan da aynı ortalamayı bulabiliriz. Her değeri kaç kez görüldüğüyle çarparız:

    $$ \bar{x} =\frac{\sum_x x f_x}{\sum_x f_x} =\frac{2\cdot1+3\cdot2+4\cdot3+5\cdot2+6\cdot1+14\cdot1}{10} =5 $$

    Bu hesap, önceki Beklenen Değer ve Varyans yazısındaki ağırlıklı ortalamaya benzer. Fark şudur: Orada olası sonuçları teorik olasılıklarıyla, burada gerçekten gözlenen değerleri deneysel frekanslarıyla ağırlıklandırıyoruz.

    Ortadaki Gözlem: Ortanca

    Ortanca (median), sıralanmış veriyi gözlem sayısı bakımından iki eşit parçaya ayıran merkezdir. Gözlem sayısı tekse tam ortadaki değeri seçeriz. Gözlem sayısı çiftse ortadaki iki değerin aritmetik ortalamasını alırız.

    On gözlemimiz olduğu için ortada tek bir değer yoktur. Beşinci ve altıncı gözlemler 4'tür:

    $$ \operatorname{Medyan} =\frac{x_{(5)}+x_{(6)}}{2} =\frac{4+4}{2} =4\text{ gün} $$

    Buradaki \(x_{(5)}\), ham listedeki adı “5” olan değişkeni değil, veriler küçükten büyüğe sıralandığında beşinci sırada bulunan gözlemi gösterir. Ortancanın altında beş, üstünde beş gözlem vardır.

    Ortancanın önemli özelliği, çok büyük veya çok küçük tek bir değerden ortalamaya göre daha az etkilenmesidir. Son teslimat 14 değil 40 gün sürseydi ortalama:

    $$ \bar{x}_{\text{yeni}}=\frac{50-14+40}{10}=7{,}6\text{ gün} $$

    olurdu. Ortanca ise yine 4 gün kalırdı; çünkü ortadaki sıralar değişmezdi. Bu dayanıklılık nedeniyle gelir, ev fiyatı veya bekleme süresi gibi bir tarafa doğru uzun kuyruk oluşturabilen verilerde ortanca çoğu zaman “tipik” gözlemi ortalamadan daha iyi anlatır.

    Ortanca uç değerlere dayanıklıdır, fakat verinin bütün büyüklüklerini hesaba katmaz. En büyük değerin 14'ten 40'a çıkması sistemin riskini ciddi biçimde değiştirdiği hâlde ortanca aynı kalabilir. Dayanıklılık, her bilgiyi taşıdığı anlamına gelmez.

    En Sık Görülen Değer: Tepe Değer

    Tepe değer (mode), en yüksek frekansa sahip değerdir. Teslimat verisinde 4 gün üç kez görülür ve diğer bütün değerlerden daha sıktır. Bu nedenle tepe değer 4 gündür.

    Bir veri kümesinin:

    • tek bir tepe değeri olabilir,
    • aynı en yüksek frekansı paylaşan birden fazla tepe değeri olabilir,
    • ya da bütün değerler birer kez görülüyorsa anlamlı bir tepe değeri bulunmayabilir.

    Tepe değer, kategorik veride de kullanılabilen merkez ölçüsüdür. Bir veri kümesinde en sık ürün türü “kitap” ise kitap kategorisinin sayısal bir ortalaması olmamasına rağmen tepe değerden söz edebiliriz. Fakat sürekli ölçümlerde tam olarak aynı sayının tekrar etmesi nadir olabilir; bu durumda değerleri gelişigüzel yuvarlamak veya aralıklara bölmek görünen tepeyi değiştirebilir.

    Hangi Merkez Ölçüsü Daha Doğru?

    Ortalama, ortanca ve tepe değer aynı sorunun üç rakip cevabı değildir. Her biri “merkez” sözcüğüne farklı anlam verir:

    Ölçü Temel fikir Güçlü yanı Dikkat edilmesi gereken
    Aritmetik ortalamaBütün değerlerin denge noktasıHer gözlemi ve büyüklüğünü kullanırUç değerlerden güçlü biçimde etkilenir
    OrtancaSıralı verinin orta konumuUç değerlere dayanıklıdırDeğerlerin uçlardaki büyüklüğünü saklayabilir
    Tepe değerEn sık gözlenen değerKategorik veride de kullanılabilirBirden fazla olabilir veya hiç olmayabilir

    Simetrik ve tek tepeli bir dağılımda üç ölçü birbirine yakın olabilir. Sağ tarafta birkaç çok büyük değer varsa ortalama genellikle ortancanın sağına çekilir. Sol tarafta birkaç çok küçük değer varsa bu kez sola çekilir. Bu nedenle ortalama ile ortanca arasındaki fark, dağılımın asimetrisi hakkında ilk ipucunu verebilir; fakat tek başına dağılımın biçimini kanıtlamaz.

    Teslimat örneğimizde ortalama 5, ortanca 4 ve tepe değer 4 gündür. Bu üçlü, 14 günlük gecikmenin ortalamayı sağa çektiğini gösteriyor. “Ortalama teslimat 5 gün” ifadesi matematiksel olarak doğrudur; “teslimatların çoğu 5 gün sürüyor” ifadesi ise yanlıştır. Çoğu teslimat 3 ile 5 gün arasındadır ve en sık değer 4 gündür.

    Merkez Tek Başına Neden Yetmez?

    Aşağıdaki iki küçük veri kümesini düşünelim:

    $$ A=(4,5,5,6), \qquad B=(0,5,5,10) $$

    İki kümenin de ortalaması ve ortancası 5'tir. Fakat \(A\)'daki değerler 5'in çevresinde toplanırken \(B\)'deki değerler 0 ile 10'a kadar yayılır. Yalnızca merkez ölçüsünü bildirirsek bu fark bütünüyle kaybolur.

    Dağılım veya yayılım ölçüleri, değerlerin birbirine ve merkeze ne kadar yakın olduğunu anlatır. Küçük yayılım daha tutarlı, büyük yayılım daha değişken gözlemler anlamına gelebilir. Ancak bağlamı unutmamak gerekir: Bir sensörün ölçümlerindeki yüksek değişkenlik istenmeyen gürültü olabilirken, bir veri kümesindeki biyolojik çeşitlilik gerçek ve önemli bir yapı olabilir.

    En Basit Yayılım Ölçüsü: Açıklık

    Açıklık (range), en büyük değer ile en küçük değer arasındaki farktır:

    $$ R=x_{\max}-x_{\min} $$

    Teslimat verisinde:

    $$ R=14-2=12\text{ gün} $$

    Açıklık hızlı ve kolaydır, fakat yalnızca iki gözleme bakar. Aradaki sekiz gözlemin nasıl dağıldığını hiç kullanmaz. 14 günlük teslimatı listeden çıkarsaydık açıklık \(6-2=4\) güne düşerdi. Tek bir uç değerin ölçüyü 4'ten 12'ye çıkarması, açıklığın uç değerlere ne kadar duyarlı olduğunu gösterir.

    Veriyi Dört Parçaya Ayırmak: Çeyrekler

    Ortanca sıralı veriyi ikiye ayırıyordu. Aynı fikri bir adım ileri götürüp veriyi dört bölüme ayırabiliriz. Bu sınır noktalarına çeyrekler (quartiles) denir:

    • \(Q_1\), gözlemlerin yaklaşık yüzde 25'inin altında veya eşit olduğu birinci çeyrektir.
    • \(Q_2\), yüzde 50 sınırıdır ve ortancaya eşittir.
    • \(Q_3\), gözlemlerin yaklaşık yüzde 75'inin altında veya eşit olduğu üçüncü çeyrektir.

    On gözlemli teslimat verisinde ortancayı hesaplarken listeyi iki eşit yarıya ayırmıştık:

    $$ \underbrace{2,3,3,4,4}_{\text{alt yarı}} \quad\big|\quad \underbrace{4,5,5,6,14}_{\text{üst yarı}} $$

    Alt yarının ortancası 3, üst yarının ortancası 5'tir. Bu yaygın “yarıların ortancası” yöntemine göre:

    $$ Q_1=3, \qquad Q_2=4, \qquad Q_3=5 $$

    Çeyreklerin daha genel hâli yüzdeliklerdir (percentiles). Örneğin 90. yüzdelik, gözlemlerin yaklaşık yüzde 90'ının altında veya eşit olduğu sınırı anlatır. Bir API'nin “gecikme süresi 200 milisaniye” demek yerine “90. yüzdelik gecikme 200 milisaniye” demesi, isteklerin yüzde 90'ının yaklaşık bu sürede veya daha kısa tamamlandığını bildirir.

    Çeyrek hesabında birden fazla kabul vardır. Küçük veri kümelerinde yazılımlar ve ders kitapları sıra konumları arasında farklı biçimlerde ara değer hesaplayabilir. Bu nedenle özellikle küçük örneklemlerde kullanılan yöntemi belirtmek ve karşılaştırılan sonuçlarda aynı yöntemi korumak gerekir. Burada yarıların ortancası yöntemini kullandık.

    Ortadaki Yüzde 50: Çeyrekler Arası Açıklık

    Çeyrekler arası açıklık (interquartile range, IQR), üçüncü ve birinci çeyrek arasındaki farktır:

    $$ \operatorname{IQR}=Q_3-Q_1 $$

    Teslimat verisinde:

    $$ \operatorname{IQR}=5-3=2\text{ gün} $$

    Bu sonuç, verinin ortadaki yüzde 50'sinin 3 ile 5 gün arasındaki 2 günlük bir bölgeye yayıldığını söyler. IQR en küçük ve en büyük değer yerine orta bölgeye dayandığı için uç değerlere açıklıktan daha dayanıklıdır.

    Beş sayılı özet, dağılımı şu beş değerle anlatır:

    $$ \text{minimum}=2, \quad Q_1=3, \quad \text{ortanca}=4, \quad Q_3=5, \quad \text{maksimum}=14 $$

    Bu özet bir kutu grafiğinin (box plot) temelini oluşturur. Kutu \(Q_1\) ile \(Q_3\) arasını, kutunun içindeki çizgi ortancayı gösterir. Böylece merkez, orta yayılım, asimetri ve olası uç değerler tek görünümde karşılaştırılabilir.

    Yaygın bir inceleme kuralı, aşağıdaki sınırların dışındaki gözlemleri olası uç değer olarak işaretler:

    $$ \begin{aligned} \text{alt sınır}&=Q_1-1{,}5\operatorname{IQR}=3-1{,}5\cdot2=0,\\ \text{üst sınır}&=Q_3+1{,}5\operatorname{IQR}=5+1{,}5\cdot2=8. \end{aligned} $$

    14 gün, 8 günlük üst sınırın ötesinde olduğu için incelemeye adaydır. Fakat bu kural “14 yanlıştır, silinmelidir” demez. Gecikme gerçek bir hava olayı, adres sorunu veya operasyon arızası yüzünden oluşmuş olabilir. Uç değer etiketi bir hüküm değil, veri kaynağını ve bağlamı kontrol etme çağrısıdır.

    Bütün Gözlemleri Kullanan Yayılım: Varyans

    Açıklık yalnızca uçlara, IQR ise ortadaki yarıya bakar. Varyans bütün gözlemlerin ortalamadan uzaklığını kullanır. Beklenen Değer ve Varyans makalesinde teorik bir dağılım için varyansı \(\operatorname{E}[(X-\mu)^2]\) biçiminde tanımlamıştık. Elimizdeki \(N\) gözlemin tamamını kendi başına bir anakütle gibi özetliyorsak aynı fikrin sonlu veri biçimi şöyledir:

    $$ \sigma^2=\frac{1}{N}\sum_{i=1}^{N}(x_i-\mu)^2 $$

    Burada \(\mu\), bu sonlu anakütlenin aritmetik ortalaması; \(\sigma^2\) ise anakütle varyansıdır. Teslimat verisinin tamamını özetlediğimizi düşünelim. Ortalama 5 gündü. Sapmaları ve karelerini yazalım:

    \(x_i\) \(x_i-5\) \((x_i-5)^2\)
    \(2\)\(-3\)\(9\)
    \(3,3\)\(-2,-2\)\(4,4\)
    \(4,4,4\)\(-1,-1,-1\)\(1,1,1\)
    \(5,5\)\(0,0\)\(0,0\)
    \(6\)\(1\)\(1\)
    \(14\)\(9\)\(81\)

    Kareli sapmaların toplamı \(102\)'dir. On gözlemin tamamını bu grubun anakütlesi kabul ettiğimiz için \(N=10\)'a böleriz:

    $$ \sigma^2=\frac{102}{10}=10{,}2\text{ gün}^2 $$

    14 günlük gözlemin tek başına kareli sapması \(81\)'dir; toplam \(102\)'nin büyük bölümünü oluşturur. Kare alma, büyük uzaklıklara daha fazla ağırlık verir. Bu özellik bazı problemler için yararlıdır, fakat varyansı uç değerlere duyarlı kılar.

    Bir önceki MLE–MAP makalesinde Normal dağılımın varyansı için de paydasında \(n\) bulunan bir MLE tahmini görmüştük. İki hesabın aynı biçime sahip olması, aynı soruyu cevapladıkları anlamına gelmez. Burada elimizdeki grubun gerçek yayılımını betimliyoruz; MLE'de ise varsaydığımız Normal modeli gözlenen veriye en iyi uyduran parametreyi seçiyorduk.

    Asıl Birimde Yayılım: Standart Sapma

    Varyans gün kare cinsindedir. Yorumu yeniden gün birimine taşımak için pozitif karekökünü alırız:

    $$ \sigma=\sqrt{\sigma^2}=\sqrt{10{,}2}\approx3{,}19\text{ gün} $$

    Standart sapma, kareli sapmalardan türetilen tipik bir uzaklık ölçeğidir. “Her gözlem ortalamadan tam 3,19 gün uzaktadır” anlamına gelmez. Teslimatlarımızın bazıları ortalamaya eşit, bazıları bir veya iki gün yakın, biri ise dokuz gün uzaktadır.

    Ayrıca “gözlemlerin yüzde 68'i bir standart sapma içindedir” gibi oranlar her veri kümesi için geçerli değildir. Olasılık Dağılımları yazısında gördüğümüz yaklaşık yüzde 68–95–99,7 kuralı Normal dağılıma özgüdür. Verinin biçimini incelemeden bu kuralı kullanamayız.

    Varyansta Neden Bazen \(n-1\)'e Böleriz?

    Aynı veri için bazı hesap makineleri \(10{,}2\), bazıları \(11{,}33\) sonucunu verebilir. Bu fark bir hata olmak zorunda değildir; cevapladıkları soru farklı olabilir.

    Karışıklığı önlemek için üç durumu yan yana koyalım:

    Amaç Payda Ne söylüyor?
    Gözlenen grubun tamamını betimlemek \(N\) Bu sonlu grubun gerçek varyansını hesaplar.
    Normal modelin varyansını MLE ile tahmin etmek \(n\) Normal modelin olabilirliğini en büyük yapan tahmini verir.
    Örneklemden anakütle varyansını yansız tahmin etmek \(n-1\) Tekrarlanan örneklemlerdeki sistematik düşük tahmini düzeltir.

    Elimizdeki on teslimat, yalnızca bu on teslimattan oluşan grubun tamamıysa anakütle varyansında \(N\)'e böleriz. Fakat bu on teslimatı daha büyük bir sürecin rastgele örneklemi olarak kullanıyor ve bilinmeyen anakütle varyansı \(\sigma^2\)'yi tahmin etmek istiyorsak yaygın örneklem varyansı şöyledir:

    $$ s^2=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})^2 $$

    Bizim verimizde:

    $$ s^2=\frac{102}{9}\approx11{,}33\text{ gün}^2, \qquad s=\sqrt{11{,}33}\approx3{,}37\text{ gün} $$

    Neden bir gözlemi eksiltiyoruz? Anakütle ortalamasını bilmediğimiz için onu aynı veriden \(\bar{x}\) ile tahmin ederiz. Örneklem ortalaması, kendisini üreten gözlemlerin tam ortasına yerleşir. Bu nedenle gözlemler, bilinmeyen gerçek merkez \(\mu\)'ya kıyasla \(\bar{x}\)'e ortalama olarak biraz daha yakın görünür. Doğrudan \(n\)'e bölmek anakütle varyansını sistematik biçimde düşük tahmin eder; \(n-1\) paydası bu aşağı yönlü eğilimi düzeltir.

    İsteyenler İçin Daha Derin Bir Bakış

    Ana fikir yukarıdaki paragraftadır. Bu düzeltmenin cebirsel nedenini de görmek istersek şu ilişkiyi kullanabiliriz:

    $$ \sum_{i=1}^{n}(x_i-\bar{x})^2 =\sum_{i=1}^{n}(x_i-\mu)^2-n(\bar{x}-\mu)^2 $$

    Sağdaki son terim sıfır veya pozitiftir ve toplamdan çıkarılır. Yani örneklem ortalamasının çevresindeki kareli sapmalar, gerçek merkez çevresindeki kareli sapmalardan daha küçük ya da en fazla ona eşittir. Rastgele örnekleme koşulları altında bu kaybın beklenen sonucu bir gözlemlik bilgiye karşılık gelir; bu yüzden \(n-1\) kullanılır. Bu düzeltmeye Bessel düzeltmesi denir.

    Başka bir sezgi de serbestlik derecesidir. \(\bar{x}\) hesaplandıktan sonra sapmaların toplamı sıfır olmak zorundadır. İlk \(n-1\) sapmayı bilirsek sonuncusu artık serbestçe değişemez; toplamı sıfıra tamamlamak zorundadır. Bu nedenle bağımsız sapma bilgisi sayısı \(n-1\)'dir.

    \(n\) ile \(n-1\) arasında bağlamdan bağımsız “daima doğru” bir seçim yoktur. Gözlenen grubun kendi yayılımını mı betimliyoruz, yoksa rastgele örneklemden daha büyük bir anakütlenin varyansını mı tahmin ediyoruz? Önce soruyu belirlemeli, sonra formülü seçmeliyiz.

    Uç Değerlere Dayanıklı Bir Yayılım: Medyan Mutlak Sapma

    Varyansın kare alma nedeniyle uç değerlerden güçlü biçimde etkilendiğini gördük. Ortancaya dayanan daha dayanıklı bir seçenek, medyan mutlak sapmadır (median absolute deviation). Önce her gözlemin ortancaya mutlak uzaklığını bulur, sonra bu uzaklıkların ortancasını alırız:

    $$ \operatorname{MAD} =\operatorname{Medyan}\bigl(|x_i-\operatorname{Medyan}(x)|\bigr) $$

    Teslimat verisinin ortancası 4'tür. Mutlak uzaklıklar sıralandığında:

    $$ 0, 0, 0, 1, 1, 1, 1, 2, 2, 10 $$

    elde edilir. Ortadaki iki uzaklık da 1 olduğu için \(\operatorname{MAD}=1\) gündür. 14 günlük değer 40 güne çıksa bile uzaklık listesinin ortasındaki konumlar değişmediği sürece MAD 1 kalabilir. Bu dayanıklılık, veri yoğun biçimde çarpıksa veya güvenilir biçimde ölçülmüş gerçek uç değerler içeriyorsa yararlı olabilir.

    Fakat dayanıklı ölçüler uçları bilerek daha az etkili kılar. Nadir ama ağır gecikmeler iş açısından çok maliyetliyse onları özetten silmek istemeyiz. Bu nedenle ortanca ile IQR veya MAD'ı kullanırken maksimumu, yüksek yüzdelikleri ve uç olayların sayısını da ayrıca raporlamak çoğu zaman daha dürüsttür.

    Sayıların Yanında Dağılımın Biçimi

    Merkez ve yayılım ölçüleri güçlü özetlerdir, fakat ham veriyi yeniden kurmaya yetmez. Farklı veri kümeleri aynı ortalamaya ve aynı varyansa sahip olabilir; yine de biri simetrik, diğeri iki ayrı kümeden oluşmuş olabilir. Bu yüzden şu biçim özelliklerini de incelemeliyiz:

    • Simetri: Merkezin iki tarafındaki değerler yaklaşık ayna görüntüsü oluşturuyor mu?
    • Çarpıklık: Dağılımın kuyruğu sağa veya sola doğru uzuyor mu?
    • Tepe sayısı: Tek bir yoğun bölge mi, yoksa birden fazla grup mu var?
    • Kuyruklar: Merkezden çok uzak gözlemler ne kadar sık görülüyor?
    • Boşluklar: Değerlerin hiç görünmediği aralıklar veya kümeler arasında kopukluk var mı?

    Teslimat verimiz sağa çarpık görünür: Gözlemlerin çoğu 2 ile 6 gün arasındayken kuyruk 14 güne doğru uzar. Ortalama 5'in ortanca 4'ten büyük olması bu görünümle uyumludur. Fakat yalnızca bu iki sayıya bakarak kesin bir çarpıklık kararı vermeyiz; sıralı listeyi, frekansları, yüzdelikleri ve mümkünse histogram ya da kutu grafiğini birlikte inceleriz.

    Birden fazla tepe özellikle önemli olabilir. Örneğin teslimatlar şehir içi ve şehir dışı olmak üzere iki ayrı süreçten geliyorsa genel dağılım iki kümeye ayrılabilir. Tek bir genel ortalama iki grubun hiçbirini iyi temsil etmeyebilir. Veriyi anlamlı alt gruplara ayırmadan hesaplanan özetler gerçek yapıyı gizleyebilir.

    Farklı Ölçekleri Karşılaştırmak: Standart Puan

    Bir gözlemin kendi değişkeni içinde ne kadar sıra dışı olduğunu “ortalamadan kaç standart sapma uzakta?” sorusuyla ifade edebiliriz. Anakütle ortalaması \(\mu\) ve standart sapması \(\sigma>0\) biliniyorsa standart puan veya z-puanı:

    $$ z=\frac{x-\mu}{\sigma} $$

    biçimindedir. On teslimatı kendi başına anakütle kabul edip \(\mu=5\) ve \(\sigma\approx3{,}19\) kullanırsak, 14 günlük teslimatın standart puanı:

    $$ z=\frac{14-5}{3{,}19}\approx2{,}82 $$

    olur. Değer ortalamanın yaklaşık 2,82 standart sapma üzerindedir. Standartlaştırılmış verinin ortalaması 0, anakütle formülüyle hesaplanan varyansı 1 olur. Ancak standartlaştırma dağılımı Normal hâle getirmez, çarpıklığı gidermez ve bir değeri kendiliğinden hatalı ilan etmez.

    Standart puan, farklı birim ve ölçeklerdeki özellikleri ortak bir dille ifade etmeye yardım eder. Yine de yalnızca sayıların ölçeğini değiştirir. Bir özelliğin anlamını, veri kalitesini veya model için yararlılığını garanti etmez. Ayrıca standart sapma sıfırsa bütün değerler aynıdır ve sıfıra bölme nedeniyle z-puanı tanımsızdır.

    Göreli Yayılım: Değişim Katsayısı

    Standart sapma değişkenin kendi birimini taşır. Ortalamaları çok farklı iki pozitif büyüklüğün göreli değişkenliğini karşılaştırmak için bazen değişim katsayısı (coefficient of variation) kullanılır:

    $$ \operatorname{CV}=\frac{s}{\bar{x}} $$

    Örneklem standart sapmasını kullandığımız teslimat verisinde \(\operatorname{CV}\approx3{,}37/5\approx0{,}67\), yani yaklaşık yüzde 67'dir. Bu oran “standart sapma, ortalamanın yaklaşık yüzde 67'si büyüklüğündedir” diye okunabilir.

    Fakat değişim katsayısı her ölçekte anlamlı değildir. Sıfırın gerçek bir “yokluk” anlamı taşıdığı oran ölçeklerinde ve ortalama sıfırdan yeterince uzaktayken kullanılmalıdır. Santigrat sıcaklıkta sıfır keyfî bir referanstır; ortalama sıfıra yaklaştığında oran aşırı büyüyebilir, sıfır olduğunda tanımsız olur. Bu nedenle birimsiz görünmesi onu bağlamdan bağımsız yapmaz.

    Yapay Zekâdan Önce Veriyi Tanımak

    Bir yapay zekâ modelinin girdisi çoğu zaman büyük bir tablodur: Her satır bir gözlem, her sütun bir özellik olabilir. Modeli eğitmeden önce yapılan keşifsel veri analizi (exploratory data analysis), bu tablonun neye benzediğini anlamaya çalışır. Betimsel istatistik bu sürecin ilk araçlarından biridir.

    Her sayısal özellik için gözlem sayısı, eksik değer sayısı, minimum, çeyrekler, ortalama, ortanca, maksimum ve standart sapma incelendiğinde şu sorunlar erken fark edilebilir:

    • yaş sütununda \(-12\) veya \(850\) gibi geçersiz değerler,
    • metre ile santimetrenin aynı sütunda karışması,
    • sensör arızası nedeniyle uzun süre aynı değerin tekrarlanması,
    • çoğu gözlemden çok farklı ölçeğe sahip birkaç değer,
    • bir özelliğin neredeyse tamamen eksik olması,
    • hedef sınıflardan birinin çok seyrek görülmesi.

    Kategorik bir hedef değişkeninde ortalama ve standart sapma yerine sınıf frekanslarına bakarız. Örneğin 10.000 kaydın 9.900'ü “normal”, 100'ü “sahtekârlık” ise en sık sınıf normaldir; fakat bu özet aynı zamanda ciddi bir sınıf dengesizliği olduğunu gösterir. Her kayda “normal” diyen bir model yüzde 99 doğruluk elde eder, yine de sahtekârlıkların tamamını kaçırır. Tek bir merkez veya performans sayısı bağlamı gizleyebilir.

    Eksik Değer, Ölçekleme ve Veri Sızıntısı

    Eksik sayısal değerleri ortalama veya ortancayla doldurmak yaygın bir başlangıç yöntemidir. Çarpık ve uç değerli veride ortanca daha dayanıklı olabilir. Fakat doldurma işlemi masum değildir: Çok sayıda eksik değeri aynı merkezle doldurmak yapay bir yığılma oluşturur ve gözlenen varyansı küçültebilir. Eksikliğin neden oluştuğunu anlamadan yalnızca boş hücreleri kapatmak önemli bir sinyali yok edebilir.

    Standartlaştırma da model eğitiminde sık kullanılır. Bir özelliği ortalamasından çıkarıp standart sapmasına böleriz. Ancak ortalama, ortanca, çeyrek ve standart sapma gibi bütün veriyle “öğrenilen” özetler yalnızca eğitim verisinden hesaplanmalıdır. Test verisinin ortalamasını eğitim sırasında kullanırsak model gelecekte görmemesi gereken bilgiden yararlanmış olur. Buna veri sızıntısı (data leakage) denir.

    Doğru sıra şöyledir: Önce veriyi eğitim ve değerlendirme bölümlerine ayırırız; doldurma ve ölçekleme ölçülerini eğitim bölümünde hesaplarız; sonra aynı sabit ölçüleri doğrulama, test ve gerçek kullanım verisine uygularız. Böylece değerlendirme, gerçekten görülmemiş verideki davranışı daha dürüst biçimde yansıtır.

    Ortalama Model Başarısı Kimi Saklıyor?

    Bir modelin ortalama kaybı düşük olabilir; fakat bazı kullanıcı gruplarında veya nadir durumlarda çok kötü sonuç verebilir. Bu nedenle performansı yalnızca genel ortalamayla raporlamak yerine dağılımını da incelemek gerekir:

    • Kayıpların ortancası ve yüksek yüzdelikleri nedir?
    • Hatalar belirli sınıf, bölge veya zaman dilimlerinde yoğunlaşıyor mu?
    • Ortalama iyileşirken en kötü durumlar kötüleşiyor mu?
    • Eğitim ve gerçek kullanım verilerinin merkezleri ve yayılımları zamanla ayrışıyor mu?

    Örneğin bir yanıt süresi sisteminin ortalaması 200 milisaniye olabilir; fakat küçük bir kullanıcı grubunda istekler 5 saniye sürüyorsa ortalama deneyimin tamamını anlatmaz. Ortanca, 90. ve 99. yüzdelikler ile maksimum değer farklı kullanıcı deneyimlerini görünür kılar.

    Aynı biçimde bir özelliğin eğitim dönemindeki ortalaması 40, standart sapması 5 iken gerçek kullanımda ortalaması 55'e ve standart sapması 12'ye çıkmışsa veri üreten süreç değişmiş olabilir. Bu tür veri kayması (data drift) sinyalleri tek başına modelin bozulduğunu kanıtlamaz; fakat daha ayrıntılı inceleme için uyarı verir.

    Grupları Birleştirirken Kaybolan Bilgi

    Genel bir ortalama, farklı alt grupları birbirine karıştırabilir. Şehir içi teslimatlar çoğunlukla 2–4 gün, şehir dışı teslimatlar 6–10 gün sürüyorsa bütün teslimatların tek ortalaması iki sürecin de tipik davranışını iyi anlatmayabilir.

    Genel ortalama, grup ortalamalarının grup büyüklükleriyle ağırlıklandırılmış hâlidir. \(k\) grubun büyüklükleri \(n_j\), ortalamaları \(\bar{x}_j\) ise:

    $$ \bar{x}=\frac{\sum_{j=1}^{k}n_j\bar{x}_j}{\sum_{j=1}^{k}n_j} $$

    Grupları eşit ağırlıkla ortalamak, grup büyüklükleri farklıysa yanlış genel sonuç verir. Öte yandan yalnızca doğru ağırlıklı genel ortalamayı vermek de gruplar arasındaki önemli farkları saklayabilir. İyi bir betimsel analiz hem bütünü hem anlamlı alt grupları raporlar ve hangi ağırlıkların kullanıldığını açıkça belirtir.

    Betimsel İstatistikte Sık Yapılan Hatalar

    • Ortalamayı “çoğu gözlemin değeri” sanmak: Ortalama denge noktasıdır; veri kümesinde hiç gözlenmemiş olabilir ve en sık değeri göstermez.
    • Veriyi sıralamadan ortanca veya çeyrek bulmak: Bu ölçüler gözlemlerin büyüklük sırasına dayanır.
    • Her değişkenin ortalamasını almak: Kategori kodlarının aritmetik ortalaması çoğu zaman anlamsızdır.
    • Yalnızca merkezi raporlamak: Aynı ortalama, çok farklı yayılımları ve biçimleri saklayabilir.
    • Varyans ile standart sapmayı karıştırmak: Varyans kareli, standart sapma asıl birimdedir.
    • \(n\) ve \(n-1\) seçimini ezber kuralına dönüştürmek: Seçim, gözlenen grubu betimlemek ile daha büyük bir anakütleyi tahmin etmek arasındaki farka bağlıdır.
    • IQR sınırını otomatik silme emri sanmak: İşaretlenen gözlemin veri hatası mı, gerçek ama nadir bir olay mı olduğu araştırılmalıdır.
    • Çeyrek yöntemini belirtmemek: Küçük veri kümelerinde farklı geçerli yöntemler farklı sonuçlar verebilir.
    • Standartlaştırmanın dağılımı Normal yaptığını düşünmek: İşlem merkezi ve ölçeği değiştirir; biçimi zorunlu olarak değiştirmez.
    • Alt grupları incelememek: Genel özet, farklı gruplardaki başarısızlıkları veya ayrı veri üretim süreçlerini saklayabilir.
    • Test verisinden özet hesaplamak: Model hazırlığında test verisinin ortalama, ortanca veya standart sapmasını kullanmak veri sızıntısı oluşturur.
    • Eksik gözlemleri sessizce dışlamak: Her ölçünün farklı sayıda gözlemden hesaplanması karşılaştırmayı bozabilir; eksiklerin sayısı ve ele alınış biçimi raporlanmalıdır.

    Bir Veri Kümesini Okurken İzlenecek Yol

    1. Gözlemi ve değişkeni tanımlayın. Her satır neyi, her sütun hangi büyüklüğü temsil ediyor?
    2. Türü ve birimi belirleyin. Değişken sayısal mı kategorik mi; gün, lira, metre veya başka bir birim mi kullanılıyor?
    3. Veri kalitesini kontrol edin. Eksik, yinelenmiş, olanaksız veya birimi karışmış değer var mı?
    4. Gözlem sayısını ve frekansları bulun. Özellikle kategorilerin ve hedef sınıfların dengesini görün.
    5. Veriyi sıralayın ve merkezleri karşılaştırın. Ortalama, ortanca ve tepe değer aynı hikâyeyi mi anlatıyor?
    6. Yayılımı birden fazla açıdan ölçün. Açıklık ve maksimumla uçları; IQR veya MAD ile dayanıklı orta yayılımı; standart sapmayla bütün kareli sapmaları inceleyin.
    7. Dağılımın biçimine bakın. Simetri, çarpıklık, birden fazla tepe, boşluk ve kuyruklar var mı?
    8. Olası uç değerleri araştırın. Kaynağa dönün; değeri yalnızca sıra dışı olduğu için silmeyin.
    9. Anakütle ile örneklemi ayırın. Yalnızca gözlenen veriyi mi betimliyor, yoksa daha geniş bir süreç hakkında tahmin mi yapıyorsunuz?
    10. Anlamlı alt grupları inceleyin. Genel özetin sakladığı bölge, sınıf, zaman veya kullanıcı farkları var mı?
    11. Özeti bağlamla raporlayın. Kullanılan çeyrek yöntemi, varyans paydası, eksik değer politikası ve birimleri görünür kılın.

    Sonuç: Bir Sayıya Değil, Birlikte Okunan Ölçülere

    Bu makalede bir olasılık modelinin parametrelerini tahmin etmekten, gözlenmiş verinin kendisini betimlemeye geçtik. Aritmetik ortalamanın bütün değerleri kullanan bir denge noktası, ortancanın sıralı verinin orta konumu, tepe değerin ise en sık gözlem olduğunu gördük. Aynı “merkez” sözcüğünün üç farklı soruya cevap verebildiğini ve doğru seçimin veri türüne, dağılımın biçimine ve sorduğumuz soruya bağlı olduğunu öğrendik.

    Yayılımı önce açıklıkla, sonra çeyrekler ve IQR ile, ardından bütün gözlemleri kullanan varyans ve standart sapmayla ölçtük. Anakütle varyansında \(N\), daha büyük bir anakütleyi tahmin eden örneklem varyansında neden \(n-1\) kullandığımızı ayırdık. Uç değerlere dayanıklı MAD'ın yararını gördük; fakat dayanıklı olmanın uçlardaki gerçek riski ayrıca raporlama gereğini ortadan kaldırmadığını vurguladık.

    Teslimat örneği bize tek bir sayının yeterli olmadığını gösterdi: Ortalama 5, ortanca ve tepe değer 4, IQR 2 ve anakütle standart sapması yaklaşık 3,19 gündü. Bu ölçüler birlikte okunduğunda çoğu teslimatın 3–5 gün çevresinde toplandığını, 14 günlük bir gecikmenin dağılımı sağa uzattığını ve ortalamayı yukarı çektiğini anlayabildik.

    Yapay zekâ açısından betimsel istatistik, modelden önce veriyi tanımanın ve modelden sonra performansı dürüstçe raporlamanın temelidir. Ölçek sorunlarını, eksik değerleri, sınıf dengesizliğini, uç gözlemleri ve zaman içindeki veri kaymasını fark etmemize yardım eder. Ancak bütün bu ölçüler burada tek bir değişkeni ayrı ayrı inceledi. Gerçek sorular çoğu zaman iki değişkenin birlikte nasıl hareket ettiğini sorar.

    Sıradaki Korelasyon ve Regresyon Analizi yazısında “Bir değişken artarken diğeri de artma veya azalma eğilimi gösteriyor mu?” sorusuna geçeceğiz. Kovaryans ve korelasyonla birlikte değişimi ölçecek, ardından noktalar arasındaki doğrusal ilişkiyi bir regresyon doğrusu ile ifade edeceğiz. Böylece tek tek sütunları betimlemekten değişkenler arasındaki yapıyı anlamaya doğru ilerleyeceğiz.

    Yazar: Levent KARAGÖL

    Makaleyi Paylaş:

    İlgili Makaleler