Il clustering o analisi dei cluster è un metodo di apprendimento senza supervisione utilizzato nel Machine Learning e nell’analisi dei dati che organizza i dati in modo che i punti di dati dello stesso gruppo (o cluster) siano più simili tra loro rispetto a quelli di altri gruppi. Il clustering aiuta a dare un senso a insiemi di dati complessi e di grandi dimensioni, rivelando pattern e tendenze o effettuando previsioni su dati non etichettati.
Il clustering è un metodo di apprendimento non supervisionato che raggruppa i dati in modo che i punti dello stesso gruppo siano più simili tra loro che a quelli di altri gruppi, permettendo di individuare schemi e tendenze nei dati non etichettati.
Il clustering è una tecnica non supervisionata che raggruppa dati non etichettati in base alla loro similarità, mentre la classificazione è un metodo di apprendimento supervisionato che utilizza dati etichettati per assegnare categorie.
Gli algoritmi di clustering più comuni includono il clustering gerarchico, k-means, i modelli di miscela gaussiana, DBSCAN, le mappe auto-organizzanti, il clustering spettrale, i modelli di Markov nascosti e il fuzzy c-means.
Il clustering hard assegna ogni punto dati a un solo cluster (come k-means), mentre il clustering soft consente a ciascun punto dati di appartenere a più cluster con diversi gradi di appartenenza (come i modelli di miscela gaussiana).
Il clustering viene utilizzato per la compressione dei dati, la segmentazione di immagini e dati LiDAR, il rilevamento di anomalie, l’imaging medico (ad esempio rilevamento di tumori e segmentazione dei tessuti), i sistemi informativi geografici e l’analisi di sequenze genetiche in bioinformatica.
MATLAB mette a disposizione funzioni per i principali algoritmi di clustering, strumenti interattivi come la task Cluster Data nel Live Editor e l’app Data Cleaner, capacità di visualizzazione e metodi di valutazione come l’analisi della silhouette per determinare il numero ottimale di cluster.
È possibile utilizzare criteri di valutazione come la gap statistic o l’analisi della silhouette per valutare quanto bene i dati si adattano ai cluster e visualizzare i risultati con strumenti come i dendrogrammi.
Sì, il clustering può essere utilizzato per segmentare le immagini raggruppando regioni di pixel in base a somiglianze di colore o forma. È impiegato, ad esempio, nell’imaging medico per il rilevamento di tumori e nei sistemi geografici per la classificazione dell’uso del suolo.
Risorse
Amplia le tue conoscenze consultando la documentazione, gli esempi, guardando video e molto altro ancora.