
Gerçekleşen sonuçlara modelin ne kadar olasılık verdiğini bilirsek tahminin bedelini ölçebiliriz. Çapraz entropi bu olasılıkları gerçek sonuçların sıklığına göre ortalar. KL ıraksaması, ortaya çıkan bedelin gerçek dağılımı bilseydik kaçınabileceğimiz kısmını gösterir. İki renkli bir kutuyla başlayıp bu ölçüleri hesaplayacak, sıfır olasılık durumunu ve yapay zekâ eğitimindeki karşılıklarını inceleyeceğiz.
Doğru Çıkan Bir Tahmin Ne Kadar İyi Bir Tahmindir?
Bir kutudan kırmızı veya mavi bilye çekiyoruz. Uzun süre gözlem yapan biri, bilyelerin yaklaşık dörtte üçünün kırmızı, dörtte birinin mavi çıktığını görmüş. Arkadaşımızsa iki rengin eşit sıklıkta geleceğini söylüyor. Kırmızı gelince “Kırmızı da gelebilir demiştim” diye karşılık veriyor. Bu, tahmininin iyi olduğu anlamına gelir mi?
Tek çekilişle karar veremeyiz; iki tahmin de kırmızıya sıfırdan büyük olasılık veriyor. Yine de arkadaşımız kırmızıya gerçek sıklığından az, maviye fazla pay ayırmış. Çekilişler tekrarlandığında bu farkı nasıl ölçebiliriz?
Olasılık Dağılımları yazısında sonuçlara verilen olasılıkları bir arada göstermiştik. Entropide ise bir sonucun şaşırtıcılığını olasılığının negatif logaritmasıyla ölçüp bütün sonuçlar için ortalamasını almıştık. Burada sonuçların sıklığını bir dağılımdan, onları değerlendireceğimiz olasılıkları başka bir dağılımdan alacağız.
Aynı İki Renk İçin İki Ayrı Dağılım
Gerçek dünyadaki çekiliş oranlarını \(P\), arkadaşımızın kullandığı tahmini \(Q\) ile adlandıralım. İki dağılım da aynı sonuçları, aynı sırada ele almalı: önce kırmızı, sonra mavi. Bu örnekte:
\(P\), kırmızının gerçekten yüzde 75, mavinin yüzde 25 sıklıkta geldiğini; \(Q\) ise modelin her renge yüzde 50 olasılık verdiğini söyler. İki dağılımın da payları kendi içinde 1'e toplanır. Hesabı kolaylaştırmak için \(P\)'yi bildiğimizi varsayıyoruz. Uygulamada gerçek \(P\) çoğunlukla bilinmez, veriden tahmin edilir.
| Sonuç | Gerçek pay \(P\) | Modelin payı \(Q\) |
|---|---|---|
| Kırmızı | \(0{,}75\) | \(0{,}50\) |
| Mavi | \(0{,}25\) | \(0{,}50\) |
Hesapta hangi sonucun ne sıklıkla geleceğini \(P\) belirleyecek. O sonuç geldiğinde modelin ne kadar şaşıracağını ise \(Q\)'daki olasılıkla ölçeceğiz.
Bir Sonucun Bedelinden Ortalama Bedele
Entropi yazısında olasılığı \(q\) olan bir sonucun bilgi miktarını \(-\log_2 q\) bit olarak ölçmüştük. Modelimiz her renge \(0{,}5\) verdiği için, hangi renk çıkarsa çıksın onun gözünden sonuç 1 bitlik bir sürprizdir:
Kırmızı çekilişlerin yaklaşık yüzde 75'inde, mavi yüzde 25'inde gelir. Model ikisine de 1 bitlik bedel biçtiğine göre gerçek sıklıklarla ağırlıklandırılmış ortalama şöyledir:
Buna çapraz entropi (cross-entropy) denir. İki dağılım kullanıyoruz: Sonuçlar \(P\)'ye göre geliyor, onları \(Q\)'nun olasılıklarıyla değerlendiriyoruz. \(H(P,Q)\), “\(P\) ile \(Q\) arasındaki çapraz entropi” diye okunur. İlk sırada gerçek sıklıklar, ikinci sırada modelin tahmini vardır.
Aynı hesabı sıkıştırmada da görebiliriz. Model iki rengi eşit bekliyorsa ikisine de birer bitlik kod ayırabilir. Kırmızı daha sık geldiğinden, uzun diziler için gerçek oranlara uyarlanmış kodlar ortalama uzunluğu azaltabilir. Buradaki \(-\log_2 q\) tek bilyeye ayrılması gereken tam sayı bit uzunluğu değildir; uzun dizilerin ideal ortalamasıyla ilgili bir bilgi ölçüsüdür.
Çapraz Entropinin Genel Kuralı
İki renkten daha fazla sonuç da olabilir. Olası sonuçları \(1,2,\ldots,n\) diye sıralayalım. \(p_i\), \(i\)'inci sonucun gerçek dağılımdaki payı; \(q_i\), modelin aynı sonuca verdiği pay olsun. Her iki listedeki sayılar sıfırdan küçük değildir ve her listenin toplamı 1'dir. Bu yazıda sonlu, kesikli sonuç kümeleriyle çalışıyoruz. Genel formül:
Toplamda her olası sonuç için bir terim var. Köşeli parantezdeki \(-\log_2 q_i\), modelin o sonuca verdiği olasılıktan hesaplanan bilgi miktarıdır. Önündeki \(p_i\), sonucun gerçekte ne sıklıkta yaşandığını hesaba katar. Sık görülen bir olaya düşük olasılık vermek çapraz entropiyi yükseltir.
Logaritma tabanını 2 seçtiğimiz için bu bölümdeki sonuçlar bit cinsindedir. Yapay zekâ yazılımlarında çoğu zaman doğal logaritma \(\ln\) kullanılır ve birim nat olur. İki tabanı aynı hesabın içinde karıştırmamalıyız; bit cinsindeki bir değeri nata çevirmek için \(\ln 2\) ile çarparız.
Model Gerçek Oranları Bilseydi Ne Değişirdi?
Model gerçek oranları bilseydi \(Q=P=(0{,}75,0{,}25)\) olurdu. Kırmızı daha az, mavi daha çok şaşırtırdı. Ortalama bedeli hesaplayalım:
İlk terimde kırmızının model açısından bilgi miktarını gerçek yüzde 75 sıklığıyla, ikinci terimde mavinin bilgi miktarını yüzde 25 sıklığıyla çarptık. Bulduğumuz \(0{,}811\) bit, önceki yazıdaki \(3/4\)–\(1/4\) dağılımının entropisidir. Çünkü iki dağılım aynı olduğunda çapraz entropideki iki olasılık listesi de aynı listeye dönüşür:
Gerçek oranları bilmek hangi rengin geleceğini kesinleştirmez; kutu iki rengi de verebilir. Bu yüzden eşit olasılık tahminiyle bulduğumuz 1 bitin tamamı modele yüklenemez. \(0{,}811\) bitlik bölüm kutunun kendi belirsizliğidir.
Kaçınılmaz Belirsizlikten Ek Bedeli Ayırmak
Eşit olasılık tahmini ortalamada 1 bit, gerçek oranları kullanan tahmin yaklaşık \(0{,}811\) bit verdi. Farkları:
Bu ek bedele Kullback–Leibler ıraksaması, kısaca KL ıraksaması (KL divergence) denir. \(D_{\mathrm{KL}}(P\parallel Q)\) gösterimi “\(P\)'nin \(Q\)'ya göre KL ıraksaması” diye okunur. Çift çizgi, \(P\) ile \(Q\)'nun çıkarıldığı anlamına gelmez:
\(H(P)\) gerçek dağılımın kendi belirsizliğidir. \(H(P,Q)\) ise aynı sonuçları modelin olasılıklarıyla değerlendirmenin ortalama bedelidir. Aradaki KL ıraksaması, doğru oranları bilseydik ödemeyeceğimiz bölümdür; iki dağılım aynıysa sıfır olur.
Gerçek dağılım sabitken yalnızca \(Q\)'yu değiştirirsek \(H(P)\) bütün adaylarda aynı kalır. Çapraz entropiyi düşüren aday KL ıraksamasını da düşürür. Model \(P\)'ye tam uyduğunda KL sıfır olur, çapraz entropi ise kutudaki rastlantı yüzünden \(H(P)\) düzeyinde kalır. Farklı görevlerin çapraz entropilerini karşılaştırırken gerçek dağılımların farklı olabileceğini de hesaba katmalıyız.
Sıkıştırmada da aynı farkla karşılaşırız. Aynı tür bağımsız sonuçların uzun dizilerinde, gerçek oranlara göre tasarlanmış ideal kod yerine yanlış \(Q\) oranlarını kullanan kodun ortalama ek yükü KL ıraksamasıyla ilişkilidir. Gerçek dosyalarda başlıkların kapladığı yer, kodların tam sayı uzunlukları ve sonuçların birbirine bağımlılığı da hesabı etkiler.
KL Formülü Nereden Geliyor?
Çapraz entropiden entropiyi çıkarırken her iki toplamda da aynı \(p_i\) ağırlığı bulunur. Değişen, logaritmanın içindeki olasılıktır:
İkinci satırda parantezleri açıp iki toplamı birleştirdik. Son satırda logaritmanın “iki logaritmanın farkı, bölümün logaritmasıdır” kuralını kullandık. Oran \(p_i/q_i\), aynı sonuca gerçekte ne kadar pay ayrıldığını modelin ne kadar pay ayırdığıyla karşılaştırır. Ağırlık yine \(p_i\)'dir; ortalamayı gerçek olay sıklığına göre alıyoruz.
Bizim kutu örneğinde ilk terim kırmızıya, ikinci terim maviye aittir:
Maviye ait terim negatif çıktı, çünkü model maviye gerçek payından fazla olasılık verdi: Bu durumda \(p_i/q_i<1\) ve logaritma negatiftir. KL toplamındaki terimler tek tek negatif olabilir; bütün dağılım için elde edilen değer negatif olamaz. Aşağıda bunun nedenini göreceğiz.
Üç Aday Modeli Aynı Kutuda Karşılaştıralım
Gerçek dağılım \(P=(0{,}75,0{,}25)\) olarak kalsın. Modelin verdiği payları değiştirelim: Biri gerçek oranları kullanıyor, biri renkleri eşit bekliyor, sonuncusu ise çoğunlukla mavi geleceğini düşünüyor.
| Modelin dağılımı \(Q\) | Çapraz entropi \(H(P,Q)\) | Ek bedel \(D_{\mathrm{KL}}(P\parallel Q)\) |
|---|---|---|
| \((0{,}75,0{,}25)\): doğru oran | \(0{,}811\) bit | \(0\) bit |
| \((0{,}50,0{,}50)\): eşit pay | \(1{,}000\) bit | \(0{,}189\) bit |
| \((0{,}25,0{,}75)\): ters ağırlık | \(1{,}604\) bit | \(0{,}792\) bit |
Üçüncü satırı da hesaplayalım. Kırmızı çekilişlerin dörtte üçünde geldiği halde model ona yalnızca dörtte bir pay ayırıyor. Bu sık karşılaşılan sonuç, her gelişinde \(-\log_2(0{,}25)=2\) bitlik bedel yaratıyor. Maviye verdiği yüzde 75 payın bedeli ise yaklaşık \(0{,}415\) bit:
Sonuç 1 biti aştı. İki sonuçlu dağılımdaki 1 bitlik üst sınır, dağılımın kendi entropisi için geçerlidir. Gerçek sonuçları yanlış olasılıklarla değerlendirdiğimiz çapraz entropinin böyle bir üst sınırı yoktur.
KL Neden Negatif Olamaz?
Doğru oranları kullanan modelin çapraz entropisi en düşüktü. Sonlu kesikli dağılımlarda da \(H(P,Q)\geq H(P)\) ve dolayısıyla \(D_{\mathrm{KL}}(P\parallel Q)\geq0\) geçerlidir. İki dağılım aynı sonuçlara aynı olasılıkları verdiğinde eşitlik sağlanır. Bu sonuca Gibbs eşitsizliği de denir.
\(Q\)'da bir sonuca fazla pay ayırırsak toplamın 1 kalması için başka bir sonuçtan eksiltmemiz gerekir. Sık gerçekleşen bir sonucun payını eksiltmek ortalama sürprizi artırır. Tek tek terimlerde artış da azalış da görebiliriz; hepsini gerçek sıklıklarıyla ağırlıklandırdığımızda yanlış dağılım daha düşük toplam bedel vermez.
Kanıtta \(p_i>0\) olan her sonuç için \(q_i>0\) gerekti. Model bu sonuçlardan birine sıfır olasılık verirse sonlu bir logaritma elde edemeyiz. Bunun sonuca etkisini aşağıda inceleyeceğiz.
Iraksama Neden Bir Uzaklık Ölçüsü Değil?
KL ıraksaması iki dağılımın uyuşmazlığını ölçer, fakat geometrik uzaklığın bütün kurallarına uymaz. Dağılımların sırasını değiştirmek bile sonucu değiştirebilir.
Yine \(P=(0{,}75,0{,}25)\) ve \(Q=(0{,}50,0{,}50)\) olsun. Az önce \(P\)'den gelen sonuçları \(Q\) ile değerlendirdik ve \(D_{\mathrm{KL}}(P\parallel Q)\approx0{,}189\) bit bulduk. Rolleri ters çevirirsek artık sonuçları eşit olasılıklı \(Q\) üretir, değerlendirmeyi \(P\) yapar:
Bir yönde \(0{,}189\), ters yönde \(0{,}208\) bit bulduk. İlk hesapta sonuçlar \(P\)'den gelip \(Q\) ile, ikincisinde \(Q\)'dan gelip \(P\) ile değerlendirilir. Böylece hangi sonuçların daha sık yaşandığı değişir. KL genel olarak üçgen eşitsizliğini de sağlamaz. Dolayısıyla metrik uzaklık değildir.
Sıfır Olasılık Hesabı Nasıl Değiştirir?
Gerçek dağılımda \(p_i=0\) olan sonuç gerçekleşmez. Çapraz entropi ve KL hesabında bu sonucun ağırlıklı katkısı 0 kabul edilir; \(\log 0\)'ı doğrudan hesaplamayız. Model bu sonuca pozitif pay ayırırsa başka sonuçlara verebileceği pay azalır. Yani sıfır katkının yine dolaylı etkisi olabilir.
Gerçekte mümkün olan bir sonuca \(p_i>0\) iken model \(q_i=0\) verirse, o sonuç gerçekleştiğinde \(-\log_2 q_i\) sınırsız büyür. Bu durumda:
Mavi çekilişlerin dörtte birinde gelebiliyorken model onu imkânsız sayıyorsa tahmini gerçek dağılımla bağdaşmaz. Formüldeki sonsuzluk, tek çekilişin fiziksel olarak sonsuz bilgi ürettiği anlamına gelmez. Yazılımda tam sıfırlar ve sayı hassasiyeti için kullanılan hesaplama yöntemini ayrıca düşünmeliyiz; olasılıkları gelişigüzel küçük bir sayıya kırpmak ölçülen kaybı değiştirir.
Veri Kümesinde Çapraz Entropi Nasıl Görünür?
Gerçek dağılımı bilmediğimizi varsayalım. Dört bağımsız çekilişte üç kırmızı, bir mavi gözledik. Bu veri kümesindeki gözlenen oran \(3/4\)–\(1/4\)'tür. Dört kayıt, uzun dönem oranının da böyle olduğunu göstermez.
Sabit bir model her çekiliş için \(Q=(0{,}5,0{,}5)\) üretsin. Gerçekleşen her sonucun negatif logaritmasını hesaplar, dört gözlemin ortalamasını alırız:
Model \(Q=(0{,}75,0{,}25)\) kullansaydı aynı dört kayıt için ortalama kayıp yaklaşık \(0{,}811\) bit olurdu. Gözlenen oranları \(P\) yerine koyarak ampirik çapraz entropiyi buluruz. Girdileri farklı olan bir sınıflandırma görevinde ise model her kayıt için başka bir dağılım üretebilir. Bu kez tek bir \(Q\) kullanmayız: Her kaydın gerçek etiketine o kayıt için verilen olasılığın negatif logaritmasını alır, sonra ortalarız.
Olabilirlik, Log-Olabilirlik ve Parametre Tahmini: MLE ile MAP yazısında kayıtların olabilirliklerini uygun koşullarda çarpmıştık. Logaritma bu çarpımı toplama dönüştürür; negatif işaret ve gözlem sayısına bölme işlemiyle ortalama kayba ulaşırız. Kayıt olasılıklarını çarpabilmek için bağımsızlık varsayımını veya kullandığımız koşullu olasılık modelini açıkça belirtmemiz gerekir.
Tek Bir Doğru Etikette Neden Sadece Bir Logaritma Kalır?
Bir görüntü için “kedi”, “köpek”, “kuş” seçenekleri olsun. Görüntünün etiketi köpekse, o kayıt için hedef dağılımını \((0,1,0)\) biçiminde gösterebiliriz. Buna tek etkinli gösterim (one-hot) denir: Doğru sınıfta 1, diğerlerinde 0 bulunur. Modelin bu görüntü için ürettiği dağılım \(Q=(0{,}7,0{,}2,0{,}1)\) olsun. Tek kayıtlık çapraz entropide sıfır ağırlıklı sınıfların katkısı yoktur:
Bu örnekte doğal logaritma kullandık; kaybın birimi nattır. Model en yüksek payı kediye verdiğinden seçtiği sınıf yanlıştır. Kayıp ise gerçek sınıf olan köpeğe ayrılan \(0{,}2\) payından hesaplanır. Model ham puanlar üretiyorsa önce bunları negatif olmayan, toplamı 1 eden sınıf paylarına dönüştürmeliyiz. Üstel ve Logaritmik Fonksiyonlar yazısındaki softmax, çok sınıflı durumda böyle bir dönüşümdür. Toplamın 1 olması, elde edilen sayıların kendiliğinden iyi kalibre edilmiş veya doğru olasılıklar olduğunu göstermez.
Hedefi \((0,1,0)\) olan bu kaydın entropisi sıfırdır; dolayısıyla çapraz entropi ile KL aynı sayıyı verir. Bütün veri kümesindeki gerçek etiket dağılımının entropisi bundan dolayı sıfır olmaz. Tek kaydın hedefiyle veriyi üreten dağılımı ayrı düşünmeliyiz.
İki Sınıfta Aynı Fikir: İkili Çapraz Entropi
“İstenmeyen ileti mi?” gibi evet–hayır sorularında modelin “evet”e verdiği olasılığı \(q\), “hayır”a verdiği olasılığı \(1-q\) ile gösterelim. Gerçek etiket \(y=1\) ise evet, \(y=0\) ise hayır demektir. İki durumun kaybını tek satırda yazabiliriz:
\(y=1\) yazarsak ikinci terimin katsayısı sıfır olur ve \(L(1,q)=-\ln q\) kalır. \(y=0\) yazarsak ilk terim kaybolur ve \(L(0,q)=-\ln(1-q)\) çıkar. Yani her iki durumda da yalnızca gerçekleşen sonuca verilen olasılığın negatif logaritmasını ölçüyoruz. Bu, Bernoulli modelinin negatif log-olabilirliğiyle aynı hesaptır.
Uzun dönemde “evet” oranı \(p\) ise beklenen ikili kayıp:
olur. Buradaki katsayılar tek bir kaydın 0 veya 1 etiketi yerine gerçek dağılımın paylarıdır. Aynı görünümlü formüllerden birinin tek kayıt kaybını, ötekinin beklenen kaybı anlattığını unutmamalıyız.
Düşük Kayıp Neyi Kanıtlamaz?
Eğitim verisindeki düşük çapraz entropi, modelin o kayıtlardaki gerçek etiketlere yüksek olasılık verdiğini gösterir. Yeni verideki başarısı için aynı sonucu bekleyemeyiz. Yanlı örnek seçimi, hatalı etiketler veya veriyi ezberleyen bir model eğitim kaybını yanıltıcı kılabilir. Başarıyı ayrı doğrulama ve test verisinde ölçmeliyiz.
Tek gözlemin kaybıyla dağılımlar üzerindeki ortalamayı karşılaştırırken de dikkatli olalım. Gerçek \(P=(0{,}75,0{,}25)\), model \(Q=(0{,}9,0{,}1)\) olsun. Kırmızı bir gözlemin kaybı \(-\log_2(0{,}9)\approx0{,}152\) bittir; \(H(P)\approx0{,}811\) bitten küçüktür. Bu, çapraz entropinin alt sınırıyla çelişmez; sınır gerçek dağılım üzerindeki ortalama için geçerlidir. Mavinin yüzde 25 sıklıkla gelmesini de hesaba kattığımızda \(H(P,Q)\approx0{,}944\) bit buluruz. Bu değer \(0{,}811\)'den büyüktür.
Dil modelinin sıradaki doğru sözcük parçasına yüksek olasılık vermesi, oluşan cümlenin doğru, güvenli veya yararlı olduğunu göstermez. Çapraz entropi, etiketlerin ya da sözcük parçalarının modele göre ne kadar beklenir olduğunu ölçer. Olgusal doğruluk ve kullanıcıya yarar için ayrı değerlendirmeler gerekir. Küçük bir KL değeri de ancak seçilen \(P\) ve \(Q\) dağılımları, sonuç kümesi ve verinin temsil gücü çerçevesinde yorumlanabilir.
Çapraz Entropi ve KL'de Sık Yapılan Hatalar
- Gerçek ve model dağılımının yerini değiştirmek: \(H(P,Q)\) ve \(D_{\mathrm{KL}}(P\parallel Q)\) hesaplarında \(P\) sonuçların gerçek sıklığını, \(Q\) kullanılan tahmini temsil eder.
- Etiketleri farklı sırada eşlemek: \(p_i\) ile \(q_i\) aynı sonuca ait olmalıdır. Kırmızının gerçek payını mavinin model payıyla karşılaştırmak hesabı anlamsızlaştırır.
- Çapraz entropinin tamamını model hatası sanmak: \(H(P)\) gerçek dünyanın kalan belirsizliğidir; model uyuşmazlığından doğan ek bölüm \(D_{\mathrm{KL}}(P\parallel Q)\)'dur.
- KL'yi simetrik uzaklık sanmak: Rolleri değiştirmek çoğu zaman değeri değiştirir; hangi yönün hesaplandığını belirtmeliyiz.
- Her KL teriminin pozitif olmasını beklemek: Bir terim negatif olabilir; negatif olamayan bütün terimlerin toplamıdır.
- Sıfır olasılığı koşulsuz olarak logaritmaya sokmak: \(p_i=0\) olan sonucun ağırlıklı katkısı 0 olarak tanımlanır. \(p_i>0\) ve \(q_i=0\) ise kayıp sonsuzdur.
- Bit ile nat değerlerini karşılaştırmak: \(\log_2\) bit, \(\ln\) nat üretir; birim dönüştürmeden sayıları yan yana koyamayız.
- Ham puanı olasılık sanmak: Sınıf puanları negatif olabilir veya toplamları 1 olmayabilir. Önce kullanılan olasılık modelini belirtmeliyiz.
- Tek kayıt kaybından genel bir eşitsizlik çıkarmak: \(H(P,Q)\geq H(P)\) beklenen değerler arasındadır; tek gözlemin kaybı bunun altında kalabilir.
İki Dağılımı Karşılaştırırken İzlenecek Yol
- Sonuç kümesini açıkça yazın. Renkleri, sınıfları veya sözcük parçalarını aynı sırada listeleyin.
- Dağılımların rollerini söyleyin. Hangisi veriyi üreten ya da hedeflenen \(P\), hangisi modelin \(Q\) tahmini?
- Olasılık koşullarını kontrol edin. Her pay 0 ile 1 arasında, her dağılımın toplamı 1 olmalı. \(p_i>0\) iken \(q_i=0\) durumunu ayrıca işaretleyin.
- Logaritma tabanını seçin. Sonucu bit veya nat cinsinden okuyacağınızı baştan belirtin.
- Önce her sonucun bedelini, sonra ortalamayı bulun. \(-\log q_i\) değerini \(p_i\) ile ağırlıklandırın ve hepsini toplayın.
- Ek bedel soruluyorsa gerçek entropiyi çıkarın. \(H(P,Q)-H(P)\) size \(P\parallel Q\) yönündeki KL'yi verir.
- Veri ile gerçek dağılımı ayırın. Gözlenen oranlar \(P\) için tahmindir; küçük bir örneklem kesin uzun dönem oranını vermez.
- Yorumu sınırlarıyla birlikte yapın. Düşük kaybı doğru sınıf seçimi, kalibrasyon veya yeni veride başarıyla otomatik olarak eşitlemeyin.
Sonuç: İki Dağılım Arasındaki Bedeli Görmek
Entropide sonuçların sıklığını ve bilgi miktarını aynı dağılımdan almıştık. Burada sonuçlar \(P\)'ye göre geldi, bilgi miktarını ise \(Q\)'nun verdiği olasılıklarla hesapladık. Bu ortalama çapraz entropidir. Ondan gerçek dağılımın entropisini çıkardığımızda modelin yanlış oranlarına bağlanan ek bedel, yani KL ıraksaması kalır.
Kırmızının yüzde 75 sıklıkta geldiği kutuda gerçek entropi yaklaşık \(0{,}811\) bit, eşit olasılık tahmininin çapraz entropisi 1 bit, aradaki KL ıraksaması yaklaşık \(0{,}189\) bitti. Model ağırlığı maviye verdiğinde bedel arttı. Sınıflandırmada tek kayıt kaybının da doğru etikete verilen olasılığın negatif logaritması olduğunu gördük. Hangi dağılımın hangi rolde olduğu, logaritmanın birimi, sıfır olasılıklar ve veri varsayımları sonucu yorumlarken önemlidir.
Bir tahmine bedel biçebiliyoruz; şimdi bu bedeli düşürmek isteyeceğiz. Sıradaki Optimizasyon Nedir? Maliyet Fonksiyonları yazısında bu bedeli nasıl bir amaç olarak tanımladığımızı, farklı maliyet fonksiyonlarının neyi ödüllendirip cezalandırdığını ve model ayarları arasında daha düşük maliyetli bir noktayı nasıl aradığımızı inceleyeceğiz.
Yazar: Levent KARAGÖL
