ANALISIS KINERJA K-NEAREST NEIGHBORS (KNN) DALAM KLASIFIKASI DESKRIPSI CUACA BERBASIS METODE N-GRAM
Kata Kunci:
K-Nearest Neighbors, N-Gram, Klasifikasi Teks, Deskripsi Cuaca, Text MiningAbstrak
Penelitian ini berfokus pada analisis kinerja algoritma K-Nearest Neighbors (KNN) dalam mengklasifikasikan deskripsi cuaca dari Badan Meteorologi, Klimatologi dan Geofisika (BMKG) dengan menggunakan metode ekstraksi fitur N-Gram. Berbeda dengan metode konvensional di mana data anomali biasanya dibuang, penelitian ini mengoptimalkan proses pra-pemrosesan sehingga tidak ada data observasi historis yang terbuang, dengan 100% dari 731 data curah hujan berhasil dipertahankan dengan menormalisasi data yang tidak terukur ke dalam kelas komputasi yang valid. Data tekstual kemudian diproses melalui langkah - langkah pra-pemrosesan teks, yang meliputi pembersihan, pengubahan huruf besar/kecil, tokenisasi, normalisasi, dan penghapusan kata - kata penghenti (stopword). Penghapusan dan stemming. Transformasi fitur teks dilakukan dengan variasi N-Gram (Unigram, Bigram, Trigram, dan Kombinasi) dan direpresentasikan dalam bentuk numerik menggunakan metode Binary Bag- of -Words. Proses klasifikasi dengan jarak Euclidean untuk variasi parameter K =1, 3, 5, dan 7 dengan pembobotan jarak. Evaluasi dengan matriks kebingungan pada 20% data pengujian menunjukkan bahwa konfigurasi KNN dengan fitur Unigram pada nilai K=3 adalah model yang paling optimal dan efisien. Model ini memberikan Akurasi 99,19%, Presisi Makro 0,9948, Recall Makro 0,9688, dan Skor F1 Makro 0,9807. Hasil menunjukkan bahwa metode Unigram jauh lebih efisien untuk mengurangi dimensi ruang fitur komputasi daripada metode Kombinasi N -Gram tanpa mengurangi tingkat akurasi klasifikasi cuaca.


