Cheat Sheet

Introduzione a Text Analytics Toolbox

Il processo di text mining semantico per estrarre informazioni latenti da diversi tipi di documenti

Text Analytics Toolbox™ fornisce algoritmi e visualizzazioni per pre-elaborazioni, analisi e modellazione dei dati di testo. I modelli creati con il toolbox possono essere utilizzati in applicazioni per sentiment analysis, manutenzione predittiva e topic modeling.

Nome funzione Descrizione
wordcloud Creazione di un grafico a nuvola di parole da un modello bag-of-words o LDA
wordCloudCounts Conteggio delle parole per la creazione di una nuvola di parole
textscatter Grafico a dispersione 2D del testo
textscatter3 Grafico a dispersione 3D del testo
heatmap Creazione di un grafico a mappa di calore
histcounts Conteggio del numero di bin in un istogramma
discretize Raggruppamento di dati in categorie o bin
Nuvola di parole

Visualizzazione

Usa nuvole di parole e grafici a dispersione per riepilogare e validare i risultati.

Apprendimento senza supervisione

Modellazione e previsione

Converti il testo in rappresentazioni numeriche mediante bag-of-words o modelli di word embedding preaddestrati e applica algoritmi specializzati di Machine Learning per la previsione e il topic modeling.

Nome funzione Descrizione
readWordEmbedding Lettura di un word embedding da un file di testo
trainWordEmbedding Addestramento di un word embedding
word2vec/vec2word Mappatura delle parole in vettori di embedding
ldaModel Modello di allocazione latente di Dirichlet (LDA)
lsaModel Modello di analisi semantica latente (LSA)
bagOfWords Modello di bag-of-words
fitlda Fitting di un modello di allocazione latente di Dirichlet (LDA)
fitlsa Fitting di un modello di analisi semantica latente (LSA)
predict Previsione degli argomenti LDA principali dei documenti
fitdist Fitting di un oggetto di distribuzione di probabilità ai dati
fitrlinear Fitting di un modello di regressione lineare a dati ad alta dimensionalità
fitclinear Fitting di un modello di classificazione lineare a dati ad alta dimensionalità
fitcecoc Fitting di modelli multiclasse per classificatori
Nome funzione Descrizione
extractFileText Lettura da PDF, Microsoft Word e testo semplice
textscan Lettura di dati formattati da file di testo o stringhe
readtable Creazione di una tabella a partire da un file
compose Conversione di dati in un array di stringhe formattate
xlsread Lettura di un file di foglio di calcolo Microsoft Excel
webread Lettura del contenuto da un servizio web RESTful
TabularTextDatastore Datastore per file di testo tabellari
FileDatastore Datastore con lettore di file personalizzato
SpreadsheetDatastore Datastore per file di foglio di calcolo
Icone di PDF, file di testo e fogli di calcolo

Importazione

Estrai testo da file Microsoft® Word®, PDF, file di testo e fogli di calcolo.

Pre-elaborazione del testo

Pre-elaborazione

Rimuovi gli artefatti meno utili, come parole comuni, segni di punteggiatura e URL, quindi applica la normalizzazione del testo per ridurre le parole alla loro radice lessicale.

Nome funzione Descrizione
tokenizedDocument Suddivisione dei documenti in insiemi di parole
normalizeWords Rimozione delle flessioni dalle parole mediante lo stemmer di Porter
bagOfWords Modello di bag-of-words
stopWords Elenco di stop word
context Ricerca delle occorrenze delle parole nel contesto in documenti
removeWords Rimozione delle parole selezionate dal documento o dal modello di bag-of-words
removeLongWords Rimozione delle parole lunghe dai documenti o dal modello di bag-of-words
removeShortWords Rimozione delle parole brevi dai documenti o dal modello di bag-of-words
removeInfrequentWords Rimozione delle parole con bassa frequenza dal modello di bag-of-words
erasePunctuation Eliminazione della punteggiatura dal testo e dai documenti
Nome funzione Descrizione
str = "Hello, world" Dichiarazione di una variabile stringa
str = ["Hello","World"] Dichiarazione di un array di stringhe
str = string(C) Conversione di un vettore di caratteri C in una stringa
str2double Conversione di una stringa in numeri double
strlength Restituzione della lunghezza delle stringhe
isstring Determinazione della presenza di un array di stringhe nell’input
join Combinazione di stringhe
split Suddivisione delle stringhe in un array di stringhe
splitlines Suddivisione di una stringa in corrispondenza dei caratteri di nuova riga
replace Ricerca e sostituzione di sottostringhe in un array di stringhe
contains Rilevamento di un pattern nella stringa
erase Eliminazione di sottostringhe all’interno delle stringhe
extractBetween Estrazione di sottostringhe tra indicatori
extractAfter Estrazione della sottostringa dopo una posizione specificata
extractBefore Estrazione della sottostringa prima di una posizione specificata
strcmp Confronto di stringhe
regexp Corrispondenza con un’espressione regolare (distinzione tra maiuscole e minuscole)
"Hello,world"

Stringa

Manipola, confronta e memorizza i dati testuali in modo efficiente.