Introduzione a Text Analytics Toolbox
Text Analytics Toolbox™ fornisce algoritmi e visualizzazioni per pre-elaborazioni, analisi e modellazione dei dati di testo. I modelli creati con il toolbox possono essere utilizzati in applicazioni per sentiment analysis, manutenzione predittiva e topic modeling.
| Nome funzione | Descrizione |
|---|---|
wordcloud |
Creazione di un grafico a nuvola di parole da un modello bag-of-words o LDA |
wordCloudCounts |
Conteggio delle parole per la creazione di una nuvola di parole |
textscatter |
Grafico a dispersione 2D del testo |
textscatter3 |
Grafico a dispersione 3D del testo |
heatmap |
Creazione di un grafico a mappa di calore |
histcounts |
Conteggio del numero di bin in un istogramma |
discretize |
Raggruppamento di dati in categorie o bin |
Visualizzazione
Usa nuvole di parole e grafici a dispersione per riepilogare e validare i risultati.
| Nome funzione | Descrizione |
|---|---|
readWordEmbedding |
Lettura di un word embedding da un file di testo |
trainWordEmbedding |
Addestramento di un word embedding |
word2vec/vec2word |
Mappatura delle parole in vettori di embedding |
ldaModel |
Modello di allocazione latente di Dirichlet (LDA) |
lsaModel |
Modello di analisi semantica latente (LSA) |
bagOfWords |
Modello di bag-of-words |
fitlda |
Fitting di un modello di allocazione latente di Dirichlet (LDA) |
fitlsa |
Fitting di un modello di analisi semantica latente (LSA) |
predict |
Previsione degli argomenti LDA principali dei documenti |
fitdist |
Fitting di un oggetto di distribuzione di probabilità ai dati |
fitrlinear |
Fitting di un modello di regressione lineare a dati ad alta dimensionalità |
fitclinear |
Fitting di un modello di classificazione lineare a dati ad alta dimensionalità |
fitcecoc |
Fitting di modelli multiclasse per classificatori |
| Nome funzione | Descrizione |
|---|---|
extractFileText |
Lettura da PDF, Microsoft Word e testo semplice |
textscan |
Lettura di dati formattati da file di testo o stringhe |
readtable |
Creazione di una tabella a partire da un file |
compose |
Conversione di dati in un array di stringhe formattate |
xlsread |
Lettura di un file di foglio di calcolo Microsoft Excel |
webread |
Lettura del contenuto da un servizio web RESTful |
TabularTextDatastore |
Datastore per file di testo tabellari |
FileDatastore |
Datastore con lettore di file personalizzato |
SpreadsheetDatastore |
Datastore per file di foglio di calcolo |
| Nome funzione | Descrizione |
|---|---|
tokenizedDocument |
Suddivisione dei documenti in insiemi di parole |
normalizeWords |
Rimozione delle flessioni dalle parole mediante lo stemmer di Porter |
bagOfWords |
Modello di bag-of-words |
stopWords |
Elenco di stop word |
context |
Ricerca delle occorrenze delle parole nel contesto in documenti |
removeWords |
Rimozione delle parole selezionate dal documento o dal modello di bag-of-words |
removeLongWords |
Rimozione delle parole lunghe dai documenti o dal modello di bag-of-words |
removeShortWords |
Rimozione delle parole brevi dai documenti o dal modello di bag-of-words |
removeInfrequentWords |
Rimozione delle parole con bassa frequenza dal modello di bag-of-words |
erasePunctuation |
Eliminazione della punteggiatura dal testo e dai documenti |
| Nome funzione | Descrizione |
|---|---|
str = "Hello, world" |
Dichiarazione di una variabile stringa |
str = ["Hello","World"] |
Dichiarazione di un array di stringhe |
str = string(C) |
Conversione di un vettore di caratteri C in una stringa |
str2double |
Conversione di una stringa in numeri double |
strlength |
Restituzione della lunghezza delle stringhe |
isstring |
Determinazione della presenza di un array di stringhe nell’input |
join |
Combinazione di stringhe |
split |
Suddivisione delle stringhe in un array di stringhe |
splitlines |
Suddivisione di una stringa in corrispondenza dei caratteri di nuova riga |
replace |
Ricerca e sostituzione di sottostringhe in un array di stringhe |
contains |
Rilevamento di un pattern nella stringa |
erase |
Eliminazione di sottostringhe all’interno delle stringhe |
extractBetween |
Estrazione di sottostringhe tra indicatori |
extractAfter |
Estrazione della sottostringa dopo una posizione specificata |
extractBefore |
Estrazione della sottostringa prima di una posizione specificata |
strcmp |
Confronto di stringhe |
regexp |
Corrispondenza con un’espressione regolare (distinzione tra maiuscole e minuscole) |