K-Means clustering python

Clustering termasuk dalam unsupervised learning (pembelajaran tanpa label), karena data tidak punya label kelas. Algoritma hanya mencari pola dan mengelompokkan secara otomatis.

Misalkan ada data tinggi badan dan berat badan sejumlah orang. Clustering akan mengelompokkan orang-orang yang memiliki tinggi & berat mirip menjadi satu kelompok.

K-Means adalah algoritma unsupervised learning untuk mengelompokkan data ke dalam K kelompok (cluster) berdasarkan kemiripan data

Pada kesempatan kali ini kita akan mencoba K-Means dengan menggunakan bahasa pemograman Python.

Berikut beberapa Library / Dependency yang kita butuhkan

- Numpy

- Pandas

1. Buat file baru bernama kmeans1.ext
isi file kmeans.txt dengan berikut

Numpy
Pandas

Lalu Jalankan perintah berikut, untuk menginstall libray / dependency

pip install -r requirements.txt

tunggu sampai install semua libraynya

2. Buat folder dataset dan siapkan dataset berupa excel



Dari dataset diatas memiliki 3 Atribut yaitu Tinggi Berat dan Cluster.

3. Buat readData.py untuk membaca data dari excel

import pandas as pd

class ReadData:
    def __init__(self):
        self.data = None

    def readDataExcel(self, filepath):
        self.data = pd.read_excel(filepath)
        return self.data

reader = ReadData()
df = pd.read_excel("datasetskmeans1.xlsx",)

print("Data terbaca:")
print(df)

Hasil program diatas akan menampilkan output seperti berikut : 


Data dibaca dari file excel menggunakan class readData, kemudian diproses dan divisualisasikan.

program mengambil data dari file datasetskmeans1.xlsx dan menyimpannya dalam bentuk array untuk diolah lebih lanjut.

4. Hasil akhir 


Class Kmeans akan :

- Menjalankan algoritman K-Means dengan jumlah cluster default = 2

- Menghasilkan label setiap data ( cluster mana masing-masing data yang masuk )

Komentar

Postingan populer dari blog ini

Tree Rule-Based