- Bitlis Eren Üniversitesi Fen Bilimleri Dergisi
- Vol: 8 Issue: 4
- Ağırlıklandırılmış Çizgelerde Tf-Idf ve Eigen Ayrışımı Kullanarak Metin Sınıflandırma
Ağırlıklandırılmış Çizgelerde Tf-Idf ve Eigen Ayrışımı Kullanarak Metin Sınıflandırma
Authors : Taner Uçkan, Cengiz Hark, Ebubekir Seyyarer, Ali Karci
Pages : 1349-1362
Doi:10.17798/bitlisfen.531221
View : 14 | Download : 3
Publication Date : 2019-12-24
Article Type : Research
Abstract :Günümüzde gerek metin gerekse cümle sınıflandırma problemleri üzerinde yoğunlukla çalışılmaktadır. Metin sınıflandırma işlemlerinde en önemli problemlerden biri sınıflandırılacak metinlerin yapısal olmamasıdır. Belli bir formata sahip olmayan metinlerin öncelikle bir önişlemden geçirilmesi gerekmektedir. Bu çalışmada metinleri sınıflandırma işleminde öncelikle sınıflandırılacak metinlerin önişlemini yapmak amacıyla KUSH (Karci-Uçkan-Seyyarer-Hark) adında bir ön işleme aracı geliştirildi. Sonrasında elde edilen işlenmiş metinlerin sınıflandırılmasında çizge tabanlı matematiksel bir yaklaşım sunulmaktadır. Yapılan çalışmada Türkiye’de iyi bilinen 6 haber portalından ve 6 farklı alandan elde edilen metinleri içeren TTC-3600 veri seti kullanılmaktadır. Sınıflandırılacak metinler Tf (Terim Frekansı) ve Idf (Ters doküman Frekansı) değerleri dikkate alınarak çeşitli ön işlemlerden geçirildikten sonra kenar ve düğümlerden oluşan bir ağırlıklı çizge oluşturulmaktadır. Ağırlıklandırılmış çizgeler kullanılarak sınıflandırma işleminin etkililiği ve matematiksel verimliliği arttırılmıştır. Elde edilen çizgeyi ifade eden komşuluk matrisi ve Derece matrisi Kullanılarak Laplace matrisi elde edilmektedir. Laplace matrisinin özdeğer ayrışımı sonucunda elde edilen öz değer ve öz değer vektörleri ile metinler sınıflandırılmaktadır. Yapılan testler sonucunda sınıflandırma oranlarında dikkate değer bir doğruluk değerine ulaşıldığı görülmektedir.Keywords : Çizge Bölümleme, Metin Sınıflandırma, Öz vektörler, TTC-3600, Tf-Idf