21. Korelasyon ve Regresyon Analizi

    Matematikİstatistik

    Korelasyon, iki sayısal değişkenin birlikte hangi yönde ve ne kadar düzenli hareket ettiğini; regresyon ise bu ilişkiyi bir denklemle özetleyip bir değişkenden diğerine yönelik tahmin üretmeyi sağlar. Bu iki araç, verideki örüntüleri görmekten yapay zekâ modellerinin temel çalışma mantığını anlamaya kadar geniş bir alanda kullanılır. Bu makalede saçılım grafiğinden kovaryans ve korelasyona ilerleyecek, doğrusal regresyon doğrusunu en küçük kareler düşüncesinden adım adım türetecek; artıklar, hata ölçüleri, açıklanan değişkenlik, aykırı değerler, doğrusal olmayan ilişkiler ve “korelasyon nedensellik değildir” uyarısı üzerinden sonuçları doğru yorumlamayı öğreneceğiz.

    Tek Tek Değişkenlerden Birlikte Değişime

    Önceki Betimsel İstatistik: Merkez ve Dağılım makalesinde bir değişkeni kendi başına incelemiştik. Teslimat sürelerinin ortalamasını, ortancasını, çeyreklerini ve standart sapmasını hesaplayarak verinin nerede toplandığını ve ne kadar yayıldığını görmüştük.

    Gerçek sorular ise çoğu zaman iki değişkeni birlikte içerir: Çalışma süresi arttığında sınav puanı da yükseliyor mu? Bir evin alanı ile fiyatı nasıl hareket ediyor? Hava sıcaklığı yükseldiğinde enerji tüketimi değişiyor mu? Bir modelin güven puanı büyüdükçe hatası azalıyor mu?

    Bu soruların her birinde aynı gözlem için eşleşmiş iki değer vardır. \(i\)'inci gözlemin birinci değerine \(x_i\), ikinci değerine \(y_i\) diyelim. Veri artık tek bir liste değil, sıralı ikililerden oluşur:

    $$ (x_1,y_1),(x_2,y_2),\ldots,(x_n,y_n) $$

    Eşleşme bozulmamalıdır. Bir öğrencinin çalışma süresini başka bir öğrencinin puanıyla yan yana getirmek, iki ayrı doğru listeye sahip olsak bile ilişkiyi anlamsız hâle getirir. Korelasyon ve regresyon, yalnızca değerleri değil, hangi \(x\) ile hangi \(y\)'nin aynı gözleme ait olduğunu da kullanır.

    İlk Bakış: Saçılım Grafiği

    Beş öğrencinin haftalık çalışma süresi ile sınav puanını gözlediğimizi düşünelim:

    Öğrenci Çalışma süresi \(x\) (saat) Sınav puanı \(y\)
    A150
    B260
    C365
    D470
    E580

    Her öğrenciyi \((x_i,y_i)\) noktası olarak Analitik Düzlem üzerinde işaretlersek bir saçılım grafiği (scatter plot) elde ederiz. Noktalar genel olarak sol alttan sağ üste doğru ilerler. Bu görünüm, çalışma süresi yüksek öğrencilerin puanlarının da yüksek olma eğiliminde olduğunu düşündürür.

    Bir saçılım grafiğini okurken yalnızca “yukarı mı, aşağı mı?” diye bakmayız. En az beş özelliği birlikte inceleriz:

    • Yön: \(x\) artarken \(y\) genellikle artıyor mu, azalıyor mu?
    • Biçim: Noktalar yaklaşık bir doğruyu mu, bir eğriyi mi, yoksa daha karmaşık bir deseni mi izliyor?
    • Güç: Noktalar bu biçimin çevresinde ne kadar sıkı toplanıyor?
    • Olağandışı noktalar: Genel desenden belirgin biçimde ayrılan gözlem var mı?
    • Alt gruplar: Tek bir bulut yerine farklı kümeler veya boşluklar görülüyor mu?

    Grafik, sayısal bir ölçüden önce gelmelidir. Tek bir korelasyon katsayısı; eğriliği, kümeleri, değişen yayılımı veya aykırı bir noktanın etkisini gizleyebilir. Sayı ilişkiyi özetler, fakat grafiğin yerine geçmez.

    Merkezin Aynı Tarafında mı? Kovaryans

    İki değişkenin birlikte hareketini ölçmek için önce her birini kendi merkezine göre ele alalım. \(x_i-\bar{x}\), \(i\)'inci \(x\) değerinin \(x\) ortalamasından sapmasıdır. \(y_i-\bar{y}\) de aynı gözlemin \(y\) ortalamasından sapmasını gösterir.

    Beklenen Değer ve Varyans makalesinde kovaryansla, iki rastgele değişkenin toplam varyansını etkileyen birlikte hareket terimi olarak kısaca karşılaşmıştık. Şimdi aynı fikri sonlu bir gözlem tablosunda adım adım hesaplayıp yorumlayacağız.

    Bu iki sapmayı çarptığımızda işaret bize basit bir bilgi verir:

    • \(x_i\) ve \(y_i\) kendi ortalamalarının aynı tarafındaysa çarpım pozitiftir.
    • Biri ortalamasının üstünde, diğeri altındaysa çarpım negatiftir.
    • Değerlerden biri tam ortalamadaysa katkı sıfırdır.

    Bu çarpımları bütün gözlemler boyunca ortalamak, kovaryansı (covariance) verir. Elimizdeki veri daha büyük bir anakütleden alınmış bir örneklemse örneklem kovaryansını şöyle yazarız:

    $$ s_{xy} =\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y}) $$

    Paydadaki \(n-1\), bir önceki makaledeki örneklem varyansıyla aynı gerekçeye dayanır: Ortalamaları yine aynı örneklemden tahmin ettiğimiz için bir serbestlik derecesi kullanılmış olur. Yalnızca elimizdeki grubun kendi kovaryansını betimliyorsak birazdan göreceğimiz \(N\) paydalı anakütle biçimini kullanırız.

    Buradaki \(s_{xy}\), “x ile y'nin örneklem kovaryansı” diye okunabilir. Gözlediğimiz kayıtların tamamı kendi başına anakütleyse payda \(N\), anakütle ortalamaları da \(\mu_x\) ve \(\mu_y\) olur:

    $$ \operatorname{Cov}(X,Y) =\frac{1}{N}\sum_{i=1}^{N}(x_i-\mu_x)(y_i-\mu_y) $$

    İşaretin yorumu açıktır: Pozitif kovaryans birlikte artma veya azalma, negatif kovaryans ters yönlerde hareket etme eğilimi, sıfıra yakın kovaryans ise belirgin bir doğrusal birlikte hareket görülmemesi demektir.

    Sıfır kovaryans, iki değişkenin bağımsız olduğunu kanıtlamaz. Bağımsızlık uygun koşullarda sıfır kovaryans getirir; fakat doğrusal olmayan güçlü bir ilişki varken kovaryans yine sıfır olabilir.

    Kovaryansı Adım Adım Hesaplayalım

    Çalışma süresi ve sınav puanı verisine dönelim. Ortalamalar:

    $$ \bar{x}=\frac{1+2+3+4+5}{5}=3, \qquad \bar{y}=\frac{50+60+65+70+80}{5}=65 $$

    Her gözlemin sapmasını ve sapma çarpımını yazalım:

    \(x_i\) \(y_i\) \(x_i-\bar{x}\) \(y_i-\bar{y}\) Sapmaların çarpımı
    150-2-1530
    260-1-55
    365000
    470155
    58021530

    Sapma çarpımlarının toplamı \(70\)'tir. Bu beş öğrenciyi daha büyük bir öğrenci topluluğundan alınmış örneklem kabul edersek:

    $$ s_{xy}=\frac{70}{5-1}=17{,}5\text{ puan-saat} $$

    Sonuç pozitiftir; çünkü küçük çalışma süreleri genellikle düşük puanlarla, büyük çalışma süreleri ise yüksek puanlarla eşleşmiştir. Fakat \(17{,}5\) sayısını tek başına “güçlü” veya “zayıf” diye yorumlamak kolay değildir. Kovaryans iki değişkenin birimlerini birlikte taşır. Saati dakikaya çevirirsek aynı ilişki değişmediği hâlde sayı 60 kat büyür. Ölçekten bağımsız bir ölçüye ihtiyacımız vardır.

    Ölçekten Arındırılmış Birlikte Hareket: Pearson Korelasyonu

    Kovaryansı iki değişkenin standart sapmalarına bölersek birimleri kaldırırız. Elde ettiğimiz sayıya Pearson korelasyon katsayısı denir. Örneklem için \(r\), anakütle için çoğunlukla Yunan harfi \(\rho\) kullanılır:

    $$ r=\frac{s_{xy}}{s_xs_y} $$

    Pay ve paydadaki ortak \(n-1\) terimleri sadeleştiği için aynı formülü hesaplamaya daha uygun biçimde de yazabiliriz:

    $$ r= \frac{\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})} {\sqrt{\sum_{i=1}^{n}(x_i-\bar{x})^2}\sqrt{\sum_{i=1}^{n}(y_i-\bar{y})^2}} $$

    Bu yapı Vektörler makalesindeki kosinüs benzerliğine benzer. Ortalama çıkarılmış \(x\) ve \(y\) değerlerini iki vektör gibi düşünürsek pay onların nokta çarpımı, payda ise uzunluklarının çarpımıdır. Nokta çarpımın mutlak değeri iki vektörün uzunlukları çarpımını aşamaz. Cauchy–Schwarz eşitsizliği adı verilen bu kural, korelasyonun sınırlarını belirler:

    $$ -1\le r\le1 $$
    • \(r=1\): Bütün noktalar pozitif eğimli bir doğru üzerinde bulunur.
    • \(r=-1\): Bütün noktalar negatif eğimli bir doğru üzerinde bulunur.
    • \(r\) sıfıra yakın: Güçlü bir doğrusal örüntü görülmez.
    Sıfır yayılım sınırı: Bütün \(x\) değerleri veya bütün \(y\) değerleri aynıysa ilgili standart sapma sıfır olur. Paydada sıfıra bölme oluşacağı için Pearson korelasyonu tanımsızdır. Bütün \(x\) değerleri aynı olduğunda regresyon eğimini de veriden belirleyemeyiz; eğimi karşılaştıracak yatay değişim yoktur.

    “Sıfıra yakın” ifadesi “hiç ilişki yok” anlamına gelmez. Pearson katsayısı özellikle doğrusal ilişkiyi ölçer. Ayrıca \(0{,}7\)'nin her alanda güçlü, \(0{,}3\)'ün her alanda önemsiz olduğunu söyleyen evrensel sınırlar yoktur. Ölçüm gürültüsü, örneklem büyüklüğü, konu alanı ve kararın maliyeti yorumu değiştirir.

    Korelasyonu Aynı Veride Hesaplayalım

    Çalışma süresi sapmalarının kareleri toplamı \(10\), puan sapmalarının kareleri toplamı \(500\), çapraz çarpımların toplamı \(70\)'ti:

    $$ \begin{aligned} \sum(x_i-\bar{x})^2&=4+1+0+1+4=10,\\ \sum(y_i-\bar{y})^2&=225+25+0+25+225=500,\\ \sum(x_i-\bar{x})(y_i-\bar{y})&=70. \end{aligned} $$

    Bunları formüle yerleştirelim:

    $$ r=\frac{70}{\sqrt{10}\sqrt{500}} =\frac{70}{\sqrt{5000}} \approx0{,}990 $$

    Katsayı 1'e çok yakındır; bu küçük örneklemde güçlü ve pozitif bir doğrusal ilişki vardır. Ancak buradan “Bir saat daha çalışmak herkesin puanını kesin olarak yükseltir” sonucu çıkmaz. Veri yalnızca bu beş gözlemde iki değişkenin birlikte nasıl hareket ettiğini gösterir. Önce ilişkiyi betimliyor, henüz neden-sonuç iddiası kurmuyoruz.

    Korelasyonun iki güzel özelliği vardır. Değişkenlerden birine sabit eklemek katsayıyı değiştirmez. Pozitif bir sayıyla ölçeklemek de değiştirmez; saat yerine dakika veya puan yerine yüzde kullanmak aynı \(r\)'yi verir. Negatif bir sayıyla çarpmak ise ölçüm yönünü tersine çevirdiği için işareti değiştirir.

    Doğrusal Olmayan Güçlü Bir İlişki Sıfır Görünebilir

    Pearson korelasyonunun neyi ölçmediğini küçük bir örnekle görelim:

    $$ x=(-2,-1,0,1,2), \qquad y=(4,1,0,1,4) $$

    Burada \(y=x^2\) olduğu için ilişki bütünüyle belirlenmiştir. \(x\)'i bilirsek \(y\)'yi hatasız hesaplarız. Fakat grafik U biçimindedir: \(x\), \(-2\)'den 0'a gelirken \(y\) azalır; 0'dan 2'ye giderken artar.

    \(\bar{x}=0\) ve \(\bar{y}=2\)'dir. Çapraz sapmaların toplamı:

    $$ (-2)(2)+(-1)(-1)+0(-2)+1(-1)+2(2)=0 $$

    Dolayısıyla \(r=0\)'dır. Pozitif ve negatif doğrusal eğilimler birbirini götürmüştür. Bu örnek önemli bir ayrımı gösterir: Sıfır korelasyon, sıfır ilişki demek değildir; sıfır doğrusal korelasyon demektir.

    İlişki yaklaşık doğrusal değil fakat sürekli olarak aynı yönde ilerliyorsa, gözlem değerleri yerine sıralarını kullanan Spearman sıra korelasyonu yararlı olabilir. Spearman katsayısı özünde Pearson korelasyonunun sıra numaralarına uygulanmasıdır. Yine de hiçbir katsayı grafiğe, bağlama ve veri kalitesi incelemesine olan ihtiyacı kaldırmaz.

    İlişkiyi Denklemle Özetlemek: Doğrusal Regresyon

    Korelasyon iki değişken arasındaki doğrusal birlikteliği tek sayıyla ve iki yönü eşit görerek özetler: \(x\) ile \(y\)'nin korelasyonu, \(y\) ile \(x\)'in korelasyonuna eşittir. Regresyonda ise roller ayrılır. Bir değişkeni açıklayıcı veya girdi değişkeni \(x\), tahmin etmek istediğimiz değişkeni yanıt veya hedef değişken \(y\) olarak seçeriz.

    Basit doğrusal regresyon, \(x\) ile \(y\) arasındaki ortalama ilişkiyi bir doğruyla yaklaşıklar:

    $$ \hat{y}=b_0+b_1x $$
    • \(\hat{y}\), “y şapka” diye okunur ve modelin tahminidir.
    • \(b_0\), doğrunun \(y\) eksenini kestiği değer, yani sabit terimdir.
    • \(b_1\), eğimdir; \(x\) bir birim arttığında tahminin ortalama olarak ne kadar değiştiğini söyler.

    Gerçek gözlem \(y_i\) ile tahmin \(\hat{y}_i\) arasındaki farka artık (residual) denir:

    $$ e_i=y_i-\hat{y}_i $$

    Nokta doğrunun üzerindeyse artık sıfırdır. Nokta doğrunun üstündeyse gerçek değer tahminden büyük olduğu için artık pozitif, altındaysa negatiftir. Regresyon doğrusu bütün noktalardan geçmek zorunda değildir; amaç genel eğilimi makul bir hata ile yakalamaktır.

    Polinom Fonksiyonları makalesinde \(\hat{y}\) gösterimini, katsayılarla kurulan tahmini ve hata kareleri fikrini önceden görmüştük. Burada birinci derece modeli ele alıyor ve en uygun katsayıların neden aşağıdaki formüllerle bulunduğunu çıkarıyoruz.

    Hangi Doğru? En Küçük Kareler İlkesi

    Aynı nokta bulutunun içinden birçok doğru geçirebiliriz. Aralarından birini seçmek için artıkların kareleri toplamını kullanırız:

    $$ \operatorname{SSE}(b_0,b_1) =\sum_{i=1}^{n}\bigl(y_i-(b_0+b_1x_i)\bigr)^2 $$

    SSE, İngilizce “hata kareleri toplamı” ifadesinin kısaltmasıdır. Kare almak pozitif ve negatif artıkların birbirini götürmesini engeller, büyük hatalara daha fazla ağırlık verir ve düzgün bir en küçük nokta bulmamızı sağlar. SSE'yi en aza indiren yönteme en küçük kareler (least squares) denir.

    Olabilirlik, Log-Olabilirlik ve Parametre Tahmini makalesinde Normal hata modeli altında negatif log-olabilirliği küçültmenin kareli hataları küçültmekle aynı sonuca ulaştığını görmüştük. Dolayısıyla hataların birbirinden bağımsız, ortalamasının sıfır ve varyansının sabit olduğu Normal modelde en küçük kareler aynı zamanda bir MLE çözümüdür. En küçük kareler doğrusunu hesaplayabilmek için hataların Normal olması şart değildir; Normal varsayımı bu çözüme olasılıksal bir yorum ve klasik belirsizlik hesapları kazandırır.

    Neden dikey uzaklıkları ölçüyoruz? Çünkü bu modelde \(x\)'i verilmiş kabul edip \(y\)'yi tahmin ediyoruz. \(x\)'te de önemli ölçüm hatası varsa veya iki ekseni tamamen eşit ele almak istiyorsak klasik en küçük kareler başka bir soruyu çözüyor olabilir.

    En İyi Doğrunun Katsayılarını Türetelim

    Daha önce Gradyan ve Kısmi Türevler makalesinde çok değişkenli bir fonksiyonun her girdiye göre değişimini ölçmüştük. SSE hem \(b_0\)'a hem \(b_1\)'e bağlıdır. En küçük noktayı bulmak için iki kısmi türevi sıfıra eşitleriz.

    Okuma notu: Bu bölüm formülün nereden geldiğini görmek isteyenler içindir. Cebir adımlarını ilk okumada izlemek zor gelirse temel sonucu kaybetmiş sayılmazsınız: En iyi doğru \((\bar{x},\bar{y})\) noktasından geçer; eğimi, birlikte değişimin \(x\)'teki değişkenliğe bölünmesiyle bulunur.

    Önce \(b_0\)'a göre türev:

    $$ \frac{\partial\operatorname{SSE}}{\partial b_0} =-2\sum_{i=1}^{n}(y_i-b_0-b_1x_i)=0 $$

    Eşitliği düzenleyelim:

    $$ \begin{aligned} \sum y_i-nb_0-b_1\sum x_i&=0,\\ n\bar{y}-nb_0-b_1n\bar{x}&=0,\\ b_0&=\bar{y}-b_1\bar{x}. \end{aligned} $$

    Bu sonuç, en küçük kareler doğrusunun \((\bar{x},\bar{y})\) noktasından geçtiğini söyler. Şimdi bu \(b_0\) ifadesini tek bir artığın içine yerleştirelim:

    $$ \begin{aligned} y_i-b_0-b_1x_i &=y_i-(\bar{y}-b_1\bar{x})-b_1x_i\\ &=(y_i-\bar{y})-b_1(x_i-\bar{x}) \end{aligned} $$

    Böylece her artığı, merkezden sapmalar üzerinden yazdık. Bu ifadeyi SSE'ye koyup \(b_1\)'e göre türevlediğimizde:

    $$ \begin{aligned} 0 &=-2\sum_{i=1}^{n}(x_i-\bar{x}) \left[(y_i-\bar{y})-b_1(x_i-\bar{x})\right] \end{aligned} $$

    Eksi 2 çarpanı sıfırın yerini değiştirmez. Köşeli parantezi açıp \(b_1\)'li terimi diğer tarafa aldığımızda:

    $$ \begin{aligned} \sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y}) &=b_1\sum_{i=1}^{n}(x_i-\bar{x})^2\\ b_1 &=\frac{\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})} {\sum_{i=1}^{n}(x_i-\bar{x})^2} \end{aligned} $$

    sonucuna ulaşırız. Pay, birlikte değişimi; payda ise \(x\)'in kendi değişkenliğini taşır. Payda sıfırsa bütün \(x\) değerleri aynıdır ve eğimi veriden belirleyemeyiz. Örneklem kovaryansı ve varyansındaki \(n-1\) çarpanları sadeleştiği için, payda sıfır olmadığı sürece aynı eğimi şöyle de yazabiliriz:

    $$ b_1=\frac{s_{xy}}{s_x^2} =r\frac{s_y}{s_x} $$

    Son eşitlik korelasyon ile regresyon arasındaki bağı açıklar. Korelasyon yalnızca yön ve doğrusal düzenliliği ölçerken regresyon eğimi, bu bilgiyi \(x\) ve \(y\)'nin gerçek ölçeklerine taşır. Bu nedenle birimsiz olan \(r\) ile birim taşıyan \(b_1\) aynı sayı olmak zorunda değildir.

    Regresyon Doğrusunu Hesaplayalım

    Örneğimizde çapraz sapmalar toplamı \(70\), çalışma süresi sapmalarının kareleri toplamı \(10\)'du. Eğim:

    $$ b_1=\frac{70}{10}=7\text{ puan/saat} $$

    Sabit terim:

    $$ b_0=\bar{y}-b_1\bar{x}=65-7\cdot3=44 $$

    Dolayısıyla en küçük kareler doğrusu:

    $$ \hat{y}=44+7x $$

    Eğim, bu veri aralığında haftalık çalışma süresi bir saat arttığında tahmin edilen sınav puanının ortalama 7 puan yükseldiğini söyler. Bu bir nedensel etki kanıtı değildir; gözlenen doğrusal eğilimin eğimidir.

    Sabit terim \(44\), \(x=0\) için modelin puan tahminidir. Fakat verimiz yalnızca 1 ile 5 saat arasındadır. Sıfır saat gözlenmediği için 44'ün gerçek dünyada güvenilir veya anlamlı bir başlangıç puanı olduğunu varsayamayız. Sabit terim doğruyu matematiksel olarak konumlandırır; her zaman başlı başına yorumlanabilir bir gerçek değildir.

    Tahminler ve Artıklar Bize Ne Söyler?

    Her çalışma süresini doğru denklemine yerleştirip tahminleri ve artıkları hesaplayalım:

    \(x_i\) Gerçek \(y_i\) Tahmin \(\hat{y}_i\) Artık \(e_i\)
    15051-1
    260582
    365650
    47072-2
    580791

    Artıkların toplamı \(-1+2+0-2+1=0\)'dır. Sabit terim içeren en küçük kareler regresyonunda bu tesadüf değildir; \(b_0\)'a göre türevi sıfıra eşitlediğimiz denklem tam olarak artıkların toplamının sıfır olmasını gerektirir. Ayrıca artıklarla \(x\) sapmalarının çarpımları toplamı da sıfırdır. Doğru, veride kalan doğrusal eğilimi tüketmiştir.

    Yine de artıkların yalnızca toplamına bakmak yeterli değildir. Artıkları tahminlere veya \(x\)'e karşı çizdiğimizde sıfır çevresinde rastgele bir bulut görmek isteriz. U biçimi kalan doğrusal olmayan yapıya, huni biçimi hataların değişen yayılımına, ayrı kümeler ise eksik bir grup değişkenine işaret edebilir.

    Model Hatasını Nasıl Özetleriz?

    Artıklar farklı işaretler taşıdığı için doğrudan ortalamaları sıfır olur ve hata büyüklüğünü saklar. Bu nedenle mutlak değer veya kare kullanırız.

    Hata kareleri toplamı:

    $$ \operatorname{SSE}=(-1)^2+2^2+0^2+(-2)^2+1^2=10 $$

    Ortalama kare hata (MSE), betimsel bir değerlendirmede kareli hataların gözlem sayısına bölünmesidir:

    $$ \operatorname{MSE}=\frac{10}{5}=2 $$

    Kök ortalama kare hata (RMSE), karekök alarak sonucu puan birimine geri taşır:

    $$ \operatorname{RMSE}=\sqrt{2}\approx1{,}41\text{ puan} $$

    Ortalama mutlak hata (MAE) ise mutlak artıkların ortalamasıdır:

    $$ \operatorname{MAE} =\frac{1+2+0+2+1}{5} =1{,}2\text{ puan} $$

    RMSE büyük hataları kare nedeniyle daha ağır cezalandırır; MAE her birim hataya aynı ağırlığı verir. Hangisinin daha uygun olduğu problemin maliyetine bağlıdır. İleride çıkarımsal regresyonda hata varyansını tahmin ederken serbestlik derecesi nedeniyle farklı bir payda göreceğiz. Buradaki \(n\)'e bölme, eldeki tahmin hatalarını yalnızca betimsel olarak özetlemektedir.

    Model Ne Kadar Değişkenlik Açıklıyor? \(R^2\)

    Regresyon doğrusunu, hiçbir \(x\) bilgisi kullanmadan herkese \(\bar{y}\) tahmini veren başlangıç modeliyle karşılaştıralım. \(y\)'nin ortalama çevresindeki toplam kareli değişkenliği:

    $$ \operatorname{SST} =\sum_{i=1}^{n}(y_i-\bar{y})^2 =500 $$

    Doğrusal modelden sonra açıklanamayan kareli hata \(\operatorname{SSE}=10\)'du. Belirleme katsayısı \(R^2\), başlangıçtaki değişkenliğin ne kadarının model tarafından azaltıldığını ölçer:

    $$ R^2 =1-\frac{\operatorname{SSE}}{\operatorname{SST}} =1-\frac{10}{500} =0{,}98 $$

    Bu veri kümesinde puanların ortalama çevresindeki kareli değişkenliğinin yüzde 98'i, çalışma süresiyle kurulan doğrusal model tarafından açıklanmıştır. “Açıklamak” burada matematiksel değişkenliği azaltmak demektir; çalışma süresinin puanın yüzde 98'ine neden olduğunu söylemez.

    Sabit terimli, tek açıklayıcı değişkenli ve aynı eğitim verisi üzerinde hesaplanan basit doğrusal regresyonda özel bir ilişki vardır:

    $$ R^2=r^2 $$

    Örneğimizde \(r\approx0{,}990\) olduğu için \(r^2\approx0{,}980\)'dir. Bu eşitlik çok değişkenli, sabit terimsiz, doğrusal olmayan veya değerlendirme verisinde hesaplanan her model için genel bir kural değildir. Değerlendirme verisinde model, yalnızca ortalamayı söylemekten bile kötü davranırsa \(R^2\) negatif olabilir.

    Korelasyon Nedensellik Değildir

    İki değişkenin birlikte hareket etmesi, birinin diğerini değiştirdiğini tek başına göstermez. Bunun birkaç nedeni vardır:

    • Karıştırıcı değişken: Yaz aylarında hem dondurma satışı hem boğulma vakaları artabilir. Ortak etken sıcaklıktır; dondurma boğulmaya neden olduğu için değil.
    • Ters yönlü neden: Sağlık sorunu egzersizi azaltabilir; düşük egzersiz ile sağlık sorunu arasındaki ilişkiyi yalnızca “az egzersiz hastalığa yol açtı” diye okumak eksik olabilir.
    • Seçim yanlılığı: Veriye kimlerin veya hangi koşulların girdiği ilişkiyi oluşturabilir ya da gizleyebilir.
    • Ortak zaman eğilimi: Yıllar içinde birlikte yükselen iki sayı, doğrudan bağlantılı olmasalar bile yüksek korelasyon gösterebilir.
    • Rastlantı ve çok sayıda deneme: Yüzlerce değişken çifti tarandığında bazı yüksek korelasyonlar yalnızca şans eseri ortaya çıkabilir.

    Nedensellik için problem bilgisinin yanında uygun çalışma tasarımı, zaman sırası, deney veya doğal deney, karıştırıcıların kontrolü ve belirsizlik analizi gerekir. Korelasyon değerli bir işarettir; fakat tek başına neden-sonuç mührü değildir.

    Alt Gruplar İlişkiyi Tersine Çevirebilir

    Veriyi bir arada incelemek bazen grupların içinde görülen ilişkiden farklı, hatta ters bir sonuç üretebilir. Buna Simpson paradoksu denir. Örneğin iki ayrı ders düzeyinde daha çok çalışma daha yüksek puanla ilişkili olabilir. Fakat zor dersteki öğrenciler hem daha çok çalışıyor hem sınavdan daha düşük puan alıyorsa, dersleri birleştirdiğimizde genel ilişki zayıflayabilir veya ters dönebilir.

    Bu durum matematiğin bozulduğu anlamına gelmez. Genel korelasyon başka, koşullu veya grup içi korelasyon başka bir soruya cevap verir. Yaş, bölge, ürün türü, sınıf veya zaman dönemi gibi anlamlı alt grupları bilmeden yalnızca genel katsayıyı yorumlamak yanıltıcı olabilir.

    Aykırı ve Etkili Gözlemler Sonucu Değiştirebilir

    Pearson korelasyonu ve en küçük kareler regresyonu ortalamalara, standart sapmalara ve kareli hatalara dayanır. Bu nedenle uzak bir gözlem iki yöntemi de güçlü biçimde etkileyebilir.

    Özellikle \(x\) ekseninde diğer noktalardan uzakta bulunan bir gözleme yüksek kaldıraçlı (high leverage) nokta denir. Bu noktanın \(y\) değeri genel desenden de ayrılıyorsa regresyon doğrusunu kendine doğru çekebilir. Her aykırı nokta etkili değildir; her etkili nokta da veri hatası değildir.

    Doğru yaklaşım otomatik silme değildir:

    1. Kaynağı kontrol edin: Birim, ondalık ayırıcı veya eşleştirme hatası var mı?
    2. Gözlemin gerçek fakat nadir bir durumu temsil edip etmediğini araştırın.
    3. Sonucu gözlem dâhil ve hariç hesaplayarak duyarlılığı karşılaştırın.
    4. Gerekirse dayanıklı yöntemleri veya farklı bir model biçimini değerlendirin.
    5. Her dışlama kararını gerekçesiyle raporlayın.

    Regresyonun Varsayımları Neyi Korur?

    Bir doğruyu her sayısal veri kümesine uydurabiliriz; fakat katsayıları, belirsizlikleri ve gelecekteki tahminleri güvenle yorumlamak için bazı koşulları incelemeliyiz.

    • Doğrusallık: \(x\) ile \(y\)'nin koşullu ortalaması yaklaşık bir doğru izlemelidir. Artıklardaki eğri desen, model biçiminin eksik olduğunu gösterir.
    • Bağımsız gözlemler: Bir gözlemin hatası diğerini sistematik biçimde belirlememelidir. Zaman serileri ve aynı kişiden tekrarlanan ölçümler özel yöntemler gerektirebilir.
    • Sabit hata yayılımı: Artıkların yayılımı \(x\) boyunca yaklaşık sabit olmalıdır. Tahminler büyüdükçe hata bulutu açılıyorsa belirsizlik her bölgede aynı değildir.
    • Hata teriminin koşullu ortalamasının sıfır olması: Modelin dışında kalan etkenler \(x\) ile sistematik biçimde bağlantılıysa eğim yanlı yorumlanabilir. Gözleyemediğimiz gerçek hatayı artıklar üzerinden dolaylı biçimde inceleriz.
    • Belirsizlik hesabı için dağılım koşulları: Küçük örneklemde klasik güven aralıkları ve testler çoğu zaman hataların yaklaşık Normal dağıldığı varsayımına dayanır. Doğruyu hesaplamak için artıkların mutlaka Normal olması gerekmez; Normal varsayımı özellikle çıkarımsal sonuçların biçimini etkiler.

    Bu koşullar bir “geçti-kaldı” listesi gibi körlemesine kullanılmamalıdır. Her biri belirli bir yorumun veya belirsizlik hesabının neden güvenilir olabileceğini açıklar. Bir ihlal gördüğümüzde önce veriyi ve soruyu anlamalı, sonra dönüşüm, yeni özellik, farklı model veya uygun bir belirsizlik yöntemi seçmeliyiz.

    Aralık İçinde Tahmin ile Dışarı Taşmak Aynı Değildir

    Modelimiz 1–5 saat aralığındaki öğrencilerden öğrenildi. \(x=3{,}5\) için tahmin yapmak gözlenen aralığın içindedir:

    $$ \hat{y}=44+7\cdot3{,}5=68{,}5 $$

    Bu işleme aradeğerleme denir. \(x=20\) saat için aynı doğru \(184\) puan üretir; sınavın 100 üzerinden olduğu bir sistemde bu açıkça anlamsızdır. Gözlenen aralığın dışına yönelik bu işleme dış değer tahmini veya ekstrapolasyon denir.

    Yüksek korelasyon ve küçük eğitim hatası, ilişkinin veri aralığının dışında da aynı kalacağını garanti etmez. Doğru, gözlediğimiz bölgedeki yerel eğilimin özetidir; doğa yasası olmak zorunda değildir.

    Korelasyon ve Regresyon Aynı Şey Değildir

    Özellik Korelasyon Doğrusal regresyon
    Temel soruİki değişken ne kadar doğrusal birlikte hareket ediyor?\(x\) verildiğinde \(y\)'nin ortalama eğilimi ve tahmini nedir?
    Roller\(x\) ve \(y\) simetriktir.Girdi \(x\) ve hedef \(y\) farklı roller taşır.
    SonuçBirimsiz, \([-1,1]\) aralığında bir katsayıBirim taşıyan katsayılara sahip bir tahmin denklemi
    Değişkenleri yer değiştirmekKatsayı değişmez.Genellikle farklı bir doğru ve farklı tahmin sorusu oluşur.
    NedensellikTek başına göstermez.Tek başına göstermez.

    Regresyon katsayısı sıfırdan farklıyken korelasyonun işareti aynıdır; fakat büyüklükleri farklı şeyler söyler. Örneğimizde \(r\approx0{,}990\), \(b_1=7\)'dir. İlki birimsiz doğrusal düzenliliği, ikincisi saat başına puan değişimini anlatır.

    Birden Fazla Girdi: Çoklu Regresyona Ön Bakış

    Sınav puanını yalnızca çalışma süresi belirlemez. Ön bilgi, uyku, dersin zorluğu ve ölçüm koşulları da sonuçla ilişkili olabilir. Birden fazla girdiyi aynı modelde kullanmak için doğrusal denklemi genişletebiliriz:

    $$ \hat{y}=b_0+b_1x_1+b_2x_2+\cdots+b_px_p $$

    Burada \(b_j\), diğer girdiler modelde sabit tutulurken \(x_j\)'deki bir birimlik artışla ilişkilendirilen tahmin değişimidir. “Sabit tutulurken” ifadesi, basit ikili korelasyondan daha koşullu bir yorum sağlar; yine de gözlemsel veride otomatik olarak nedensellik oluşturmaz.

    Girdiler birbirleriyle çok yüksek korelasyon taşıyorsa aynı bilgiyi paylaşabilir. Buna çoklu doğrusal bağlantı (multicollinearity) denir. Modelin toplam tahmini iyi kalırken tek tek katsayılar kararsızlaşabilir. Bu nedenle korelasyon matrisi yararlı bir ilk incelemedir; fakat özellik seçimini yalnızca ikili korelasyonlara indirmek doğru değildir.

    Yapay Zekâda Somut Kullanımlar

    Korelasyon ve regresyon, yapay zekâya yalnızca “bu yöntemler kullanılır” diye uzaktan bağlanan kavramlar değildir. Veri hazırlama, model kurma ve değerlendirme adımlarında doğrudan mekanik görevler üstlenir.

    Özellikleri Tanımak ve Tekrarlı Bilgiyi Görmek

    Yüzlerce sayısal sütun içeren bir veri kümesinde korelasyon matrisi, birlikte hareket eden özellikleri görünür kılar. Santimetre ve metre cinsinden aynı uzunluğu taşıyan iki sütun neredeyse kusursuz korelasyon gösterir. Bu, veri hattında yinelenen bilgi veya birim dönüşümü hatası olabileceğini düşündürür.

    Hedef Sızıntısını Yakalamak

    Bir özelliğin hedefle olağanüstü yüksek korelasyonu her zaman sevindirici değildir. Kredi geri ödeme sonucundan sonra oluşturulan bir “tahsilat durumu” sütunu geçmiş veride hedefi neredeyse doğrudan açığa çıkarabilir. Model bu sütunla çok başarılı görünür, fakat gerçek tahmin anında bilgi henüz mevcut değildir. Korelasyon burada başarı kanıtı değil, hedef sızıntısı için alarmdır.

    Basit ve Denetlenebilir Başlangıç Modeli

    Doğrusal regresyon, daha karmaşık bir modelden önce güçlü bir başlangıç çizgisi sağlar. Katsayıları birimlerle yorumlanabilir, tahmin hesabı izlenebilir ve artıklar üzerinden eksik desenler görülebilir. Karmaşık model bu basit doğrudan daha iyi değilse ek karmaşıklığın yararı sorgulanmalıdır.

    Kayıp Fonksiyonundan Öğrenmeye

    Bu makalede iki katsayı için en küçük kareler çözümünü kapalı formülle çıkardık. Girdi sayısı büyüdüğünde aynı problem matrislerle yazılabilir. Çok büyük modellerde katsayılar doğrudan formülle değil, daha önce öğrendiğimiz gradyan kullanılarak hata adım adım azaltılabilir. Sinir ağlarının eğitimindeki temel düşünce de aynıdır: Tahmin üret, kaybı ölç, parametrelerin kayba etkisini hesapla ve daha düşük kayba doğru güncelle.

    Modeli Yalnızca Eğitim Verisinde Ölçmemek

    Bir regresyon doğrusu eğitim noktalarına iyi uyabilir; önemli olan yeni gözlemlerde de yararlı tahmin üretmesidir. MSE, MAE ve \(R^2\) gibi ölçüler eğitimden ayrılmış doğrulama veya test verisinde de hesaplanmalıdır. Özellik seçimi, ölçekleme veya model ayarı test verisine bakılarak yapılırsa değerlendirme iyimserleşir.

    Korelasyon ve Regresyonda Sık Yapılan Hatalar

    • Korelasyonu nedensellik sanmak: Birlikte değişim; karıştırıcıları, ters nedenselliği ve seçim etkilerini tek başına ayıramaz.
    • Grafiği çizmeden katsayıya bakmak: Aynı \(r\), çok farklı nokta desenlerinden doğabilir.
    • \(r=0\) ise ilişki yok demek: Pearson katsayısı doğrusal ilişkiyi ölçer; U biçimli örnekte güçlü ilişki sıfır görünmüştü.
    • Yüksek korelasyonu kusursuz tahmin sanmak: Korelasyon bir tahmin denklemi, hata dağılımı veya yeni veride başarı garantisi değildir.
    • Düşük korelasyonu önemsizlik sanmak: Doğrusal olmayan yapı, alt gruplar veya bağlama göre önemli küçük etkiler bulunabilir.
    • Sabit terimi her koşulda yorumlamak: \(x=0\) veri aralığının dışında veya gerçek dünyada anlamsız olabilir.
    • Eğimi nedensel etki gibi okumak: Regresyon eğimi gözlemsel ilişkiyi özetler; çalışma tasarımı nedensel yorumu ayrıca desteklemelidir.
    • Artıkları incelememek: Tek bir hata sayısı eğriliği, değişen yayılımı ve kümeleri saklayabilir.
    • Aykırı değeri otomatik silmek: Uzak gözlem veri hatası da gerçek ve önemli bir olay da olabilir.
    • Ekstrapolasyona güvenmek: Veri aralığının dışındaki doğrunun gerçek ilişkiyi sürdürdüğüne dair kanıt olmayabilir.
    • \(R^2\)'yi doğruluk veya nedensellik oranı sanmak: \(R^2\), kareli değişkenliğin modelle azaltılan bölümüdür; tek başına model kalitesinin tamamı değildir.
    • Eksik değerleri sessizce çıkarmak: Her değişken çifti farklı gözlemlerle hesaplanırsa korelasyonlar doğrudan karşılaştırılamayabilir.
    • Çok sayıda çifti tarayıp en büyüğünü gerçek keşif sanmak: Çoklu karşılaştırmalar rastlantısal yüksek değerlerin olasılığını artırır.

    Bir İlişkiyi İncelerken İzlenecek Yol

    1. Gözlemleri ve eşleşmeyi tanımlayın. Her \((x_i,y_i)\) çifti aynı kişiye, zamana veya nesneye mi ait?
    2. Değişken türlerini ve birimleri kontrol edin. Pearson korelasyonu sayısal değişkenler için anlamlı mı; kodlanmış kategoriler yanlışlıkla sayı gibi mi kullanılıyor?
    3. Eksik, olanaksız ve yinelenmiş kayıtları inceleyin. Hangi gözlemlerin hesaba girdiğini görünür kılın.
    4. Saçılım grafiğini çizin. Yön, biçim, güç, kümeler ve olağandışı noktaları gözleyin.
    5. Amaca uygun ilişki ölçüsünü seçin. Doğrusal birliktelik için Pearson, sıralı ve tek yönlü fakat doğrusal olmayan yapı için Spearman düşünülebilir.
    6. Regresyonda rolleri belirleyin. Hangi değişken girdi, hangisi hedef ve bu seçim neden anlamlı?
    7. Katsayıları birimleriyle yorumlayın. Eğim hangi aralıkta, hangi koşullar altında ne söylüyor?
    8. Artıkları inceleyin. Sıfır çevresinde rastgele mi, yoksa kalan bir desen var mı?
    9. Aykırı ve etkili gözlemlere duyarlılığı sınayın. Sonuç birkaç noktaya mı dayanıyor?
    10. Tahmin aralığını koruyun. Aradeğerleme ile ekstrapolasyonu ayırın.
    11. Nedensel dili sınırlayın. Gözlemsel ilişkiyi çalışma tasarımının desteklemediği bir neden-sonuç iddiasına dönüştürmeyin.
    12. Yeni veride değerlendirin. Eğitim uyumu ile genelleme başarısını birbirine karıştırmayın.

    Sonuç: Birlikte Hareketten Tahmin Doğrusuna

    Bu makalede tek değişkenli özetlerden iki değişkenin birlikte davranışına geçtik. Önce eşleşmiş gözlemleri saçılım grafiğinde görerek yön, biçim, güç, alt grup ve aykırı nokta sorularını sorduk. Ardından sapmaların çarpımından kovaryansı kurduk; kovaryansı standart sapmalarla ölçekleyerek \(-1\) ile \(1\) arasında, birimsiz Pearson korelasyonuna ulaştık.

    Aynı çalışma süresi ve sınav puanı örneğinde \(r\approx0{,}990\) bulduk. Bunun güçlü pozitif doğrusal birliktelik anlattığını, fakat nedensellik veya hatasız tahmin anlamına gelmediğini gördük. \(y=x^2\) örneği ise bütünüyle belirlenmiş güçlü bir ilişkinin Pearson korelasyonunda sıfır çıkabileceğini gösterdi.

    Sonra ilişkiyi bir tahmin denklemine dönüştürdük. Artık kareleri toplamını en aza indirerek \(\hat{y}=44+7x\) doğrusunu adım adım türettik; eğimin kovaryansın \(x\) varyansına oranı olduğunu ve korelasyonla \(b_1=r(s_y/s_x)\) bağı üzerinden birleştiğini gördük. Normal hata varsayımı altında en küçük karelerin MLE ile aynı çözüme ulaştığını belirttik. Tahminleri artıklarla karşılaştırdık; SSE, MSE, RMSE, MAE ve \(R^2\) ölçülerinin aynı modelin farklı yönlerini anlattığını ayırdık.

    En önemli zihinsel model şudur: Korelasyon bir nokta bulutunun doğrusal yönünü ve düzenliliğini özetler; regresyon ise hedefi seçer, bir doğru kurar ve dikey tahmin hatalarını ölçer. İkisi de bağlamdan bağımsız birer doğruluk veya nedensellik makinesi değildir. Grafik, veri üretim süreci, alt gruplar, artıklar, aykırı noktalar ve yeni verideki başarı sayısal katsayılarla birlikte okunmalıdır.

    Şimdi yeni bir soru doğuyor: Bu beş öğrencide bulduğumuz yüksek korelasyon ve pozitif eğim, daha geniş öğrenci topluluğunda da var mı; yoksa örneklem seçiminin rastlantısı olabilir mi? Bir sonraki Çıkarımsal İstatistik ve Hipotezler makalesinde örneklemden anakütleye geçecek; tahminlerin belirsizliğini, güven aralıklarını, sıfır hipotezini ve gözlenen sonucun rastlantıyla ne kadar uyumlu olduğunu inceleyeceğiz.

    Yazar: Levent KARAGÖL

    Makaleyi Paylaş:

    İlgili Makaleler