K-Means clustering python
Clustering termasuk dalam unsupervised learning (pembelajaran tanpa label), karena data tidak punya label kelas. Algoritma hanya mencari pola dan mengelompokkan secara otomatis.
Misalkan ada data tinggi badan dan berat badan sejumlah orang. Clustering akan mengelompokkan orang-orang yang memiliki tinggi & berat mirip menjadi satu kelompok.
K-Means adalah algoritma unsupervised learning untuk mengelompokkan data ke dalam K kelompok (cluster) berdasarkan kemiripan data
Pada kesempatan kali ini kita akan mencoba K-Means dengan menggunakan bahasa pemograman Python.
Berikut beberapa Library / Dependency yang kita butuhkan
- Numpy
- Pandas
1. Buat file baru bernama kmeans1.ext
isi file kmeans.txt dengan berikut
Numpy
Pandas
Lalu Jalankan perintah berikut, untuk menginstall libray / dependency
pip install -r requirements.txt
tunggu sampai install semua libraynya
2. Buat folder dataset dan siapkan dataset berupa excel
3. Buat readData.py untuk membaca data dari excel
import pandas as pd
class ReadData:
def __init__(self):
self.data = None
def readDataExcel(self, filepath):
self.data = pd.read_excel(filepath)
return self.data
reader = ReadData()
df = pd.read_excel("datasetskmeans1.xlsx",)
print("Data terbaca:")
print(df)
Hasil program diatas akan menampilkan output seperti berikut :
program mengambil data dari file datasetskmeans1.xlsx dan menyimpannya dalam bentuk array untuk diolah lebih lanjut.
4. Hasil akhir
- Menjalankan algoritman K-Means dengan jumlah cluster default = 2
- Menghasilkan label setiap data ( cluster mana masing-masing data yang masuk )
Komentar
Posting Komentar