Articoli tecnici

Insight di MathWorks

L’IA nei processi di produzione dei semiconduttori


Autore:

  • Xiaoxing Wang, MathWorks

10 minuti di lettura

Riepilogo

  • L’IA può estrarre schemi utili da serie temporali di dati provenienti da sensori ad alta frequenza nella produzione di semiconduttori.
  • La stima del profilo di incisione può essere formulata come un problema di regressione, e i workflow low-code possono accelerare lo sviluppo e la messa a punto del modello.
  • Il rilevamento non supervisionato delle anomalie, utilizzando caratteristiche estratte dai segnali di vibrazione, può individuare modalità di guasto rare anche con dati etichettati limitati.
  • L'ottimizzazione dei processi spesso implica problemi multiobiettivo (ottimalità di Pareto), che rivelano i compromessi tra obiettivi contrastanti, mentre le considerazioni sull'implementazione riguardano il modo in cui i modelli vengono utilizzati nella pratica.

Introduzione

La produzione di semiconduttori è uno dei settori fondamentali a sostegno dell'economia globale e i suoi processi richiedono un controllo estremamente preciso e complesso. Con il continuo progresso della miniaturizzazione dei dispositivi e delle strutture multistrato, anche per un singolo wafer sono coinvolti molteplici processi e apparecchiature, e piccole variazioni di processo possono influire direttamente sulla resa e sulla qualità. Negli ultimi anni, per far fronte a questa crescente complessità, si è assistito a un'accelerazione degli sforzi verso la “produzione intelligente” che utilizza l'intelligenza artificiale (IA) basata su grandi volumi di dati ottenuti dai processi e dalle apparecchiature di produzione.

Una fonte di informazioni importante nella gestione dei processi di produzione dei semiconduttori è rappresentata dai dati di immagine. Ad esempio, sono stati segnalati sistemi in grado di rilevare anomalie di processo in una fase precoce, classificando le immagini acquisite durante la produzione in tipologie di difetti predefinite.¹ Al contrario, questo articolo si concentra principalmente sui segnali unidimensionali ottenuti dai sensori.

Nella produzione di semiconduttori, un'ampia varietà di dati, come temperatura, pressione, portata e velocità di rotazione, viene registrata come serie temporali ad elevate frequenze di campionamento. Tali dati presentano spesso strutture complesse caratterizzate da elevata dimensionalità, non linearità e rumore. Di conseguenza, può essere difficile comprendere il comportamento complessivo utilizzando solo i metodi statistici convenzionali, e l'IA ha attirato l'attenzione come mezzo efficace per estrarre automaticamente modelli latenti e correlazioni nei dati (Figura 1).

Illustrazione che mostra le definizioni di intelligenza artificiale, Machine Learning e Deep Learning.

Figura 1. Relazione tra IA, Machine Learning e Deep Learning.

Panoramica delle tecnologie di intelligenza artificiale (Machine Learning and Deep Learning)

L'intelligenza artificiale si riferisce a meccanismi che apprendono dai dati per prendere decisioni e fare previsioni. Una delle sue tecnologie principali è il Machine Learning (Figura 2). Il Machine Learning è una metodologia per apprendere automaticamente schemi all'interno dei dati e costruire modelli in grado di prendere decisioni appropriate di fronte a nuovi dati.² Può essere suddiviso in due categorie principali: apprendimento supervisionato, che prevede i risultati a partire da nuovi input, e apprendimento non supervisionato, che estrae strutture e schemi intrinseci nei dati. L'apprendimento supervisionato può essere ulteriormente suddiviso in classificazione, in cui l'output è una categoria discreta, e regressione, in cui l'output è un valore continuo.

Tecniche di Machine Learning: apprendimento senza supervisione (clustering) e apprendimento con supervisione (classificazione e regressione).

Figura 2. Meccanismo del Machine Learning.

Le prestazioni del modello spesso migliorano quando sono disponibili dati di addestramento più rappresentativi. La Figura 3 illustra alcuni algoritmi di Machine Learning rappresentativi. In molti casi, esiste un compromesso tra le prestazioni predittive e l'interpretabilità del modello.³ Storicamente, la creazione di modelli appropriati richiedeva una vasta esperienza in statistica e campi correlati; tuttavia, di recente sono emerse applicazioni low-code di facile utilizzo.

Grafico che mostra algoritmi di Machine Learning raffigurati con l’interpretabilità sull’asse x e il rispettivo potere predittivo sull’asse y.

Figura 3. Algoritmi di Machine Learning rappresentativi che evidenziano il compromesso tra prestazioni predittive e interpretabilità.

Applicazione dell'intelligenza artificiale ai dati dei sensori

Questa sezione presenta tre metodi per applicare l'intelligenza artificiale ai dati dei sensori nella produzione di semiconduttori: stima del profilo di incisione, rilevamento non supervisionato delle anomalie e ottimizzazione del processo.

Stima dei profili di incisione

I processi di produzione dei semiconduttori possono essere suddivisi in linea generale in “processi front-end” in cui i circuiti vengono formati su wafer di silicio, e “processi back-end” in cui i chip IC fabbricati vengono ritagliati e confezionati. Tra questi processi, vengono inserite delle fasi di pulizia per influenzare la resa del dispositivo.⁴ Questi passaggi rimuovono i materiali indesiderati dalla superficie del wafer generati durante la fase di pre-lavorazione tramite incisione chimica. Negli ultimi anni, i processi di pulizia di singoli wafer, in cui i prodotti chimici vengono erogati mentre i singoli wafer ruotano, sono diventati la norma.

In tali processi, la stima della distribuzione radiale della velocità di incisione su un wafer (profilo di incisione) è fondamentale per l'ottimizzazione del processo e il controllo della qualità (Figura 4). Le velocità di incisione dipendono fortemente da variabili della ricetta, tra cui le proprietà chimiche, la temperatura, la velocità di flusso del liquido e la velocità di rotazione del wafer. Poiché il Machine Learning può apprendere le relazioni nei dati ed effettuare previsioni per nuovi input, la stima dei profili di incisione può essere formulata come un problema di regressione utilizzando il raggio del wafer e le variabili della ricetta come input e i profili di incisione come output (Figura 5).

Schema di un processo di pulizia a umido di un singolo wafer con indicazione del flusso dell'ugello, della rotazione del wafer e dei profili di incisione.

Figura 4. Processo di pulizia su singolo wafer e distribuzione della velocità di incisione.

Diagramma che mostra le tabelle dei dati di addestramento e di inferenza utilizzate per costruire e applicare un modello predittivo.

Figura 5. Framework di regressione per stimare il profilo di incisione a partire dalle variabili di processo.

La Figura 6 (in alto e al centro) mostra i risultati dell'addestramento e della stima dei profili di incisione utilizzando l'app low-code Regression Learner di MATLAB®. Come dati di addestramento sono stati utilizzati quattro profili con molteplici variabili di ricetta, mentre come dati di test sono stati utilizzati profili diversi per verificare la generalizzazione del modello. I risultati indicano che il modello è stato addestrato correttamente e non vi sono evidenti segni di overfitting. Tuttavia, l'accuratezza del modello dipende fortemente dalla scelta degli algoritmi e degli iperparametri. Ad esempio, l'ottimizzazione di parametri quali la dimensione minima delle foglie, la funzione kernel e il numero di strati può migliorare ulteriormente le prestazioni predittive. L'ottimizzazione bayesiana è efficace per la messa a punto degli iperparametri perché è in grado di identificare i valori ottimali in modo più efficiente rispetto ai metodi convenzionali di ricerca a griglia o di ricerca casuale. La Figura 6 (in basso) mostra uno strumento che automatizza questo processo, consentendo di ottenere modelli ad alte prestazioni con un minor numero di prove.

Tre schermate MATLAB che mostrano i grafici della velocità di incisione, i risultati della valutazione del modello e i pannelli di ottimizzazione degli iperparametri.

Figura 6. Addestramento del modello (in alto) e validazione (al centro) tramite un'applicazione low-code e ottimizzazione degli iperparametri per vari modelli (in basso).

Rilevamento non supervisionato delle anomalie tramite dati di vibrazione

Il funzionamento stabile delle apparecchiature per la produzione di semiconduttori è essenziale per il mantenimento della qualità del processo, pertanto il monitoraggio delle condizioni delle apparecchiature è indispensabile. Ad esempio, le apparecchiature con componenti rotanti, come gli strumenti di pulizia o di incisione, possono sviluppare anomalie meccaniche nei motori o nei cuscinetti che influiscono negativamente sulla produttività e sulla qualità. Le tecniche di rilevamento delle anomalie che utilizzano segnali di serie temporali, come i dati di vibrazione, sono efficaci perché possono catturare sottili cambiamenti incorporati nei dati che potrebbero non essere rilevati dalle soglie convenzionali o dal controllo statistico di processo.⁵

Quando gli eventi anomali sono rari, è difficile raccogliere dati sui guasti etichettati. In questi casi, l'apprendimento non supervisionato diventa particolarmente prezioso perché i modelli possono essere addestrati utilizzando solo dati relativi al normale funzionamento.

La Figura 7 mostra i dati di vibrazione su tre assi acquisiti da una macchina industriale prima e dopo la manutenzione.⁶ In questo esempio, si presume che i dati prima della manutenzione rappresentino uno stato anomalo, mentre i dati dopo la manutenzione rappresentino uno stato normale. Questa configurazione implica che per l'addestramento del modello vengano utilizzati solo dati relativi allo stato normale, mentre per la validazione del modello vengano utilizzati dati misti, sia normali che anomali. Tuttavia, l'impiego dell'IA non elimina la necessità di preparazione dei dati. In generale, le applicazioni di intelligenza artificiale richiedono la pulizia dei dati (preelaborazione) e l'estrazione delle caratteristiche.

Tre grafici a serie temporali sovrapposti che mostrano i segnali di vibrazione sui canali 1-3, confrontando le condizioni prima e dopo.

Figura 7. Dati di vibrazione su tre assi prima e dopo la manutenzione.

Le caratteristiche sono rappresentazioni numeriche di determinate caratteristiche dei singoli campioni di dati⁷ e possono essere derivate ​​da analisi nel dominio del tempo, nel dominio della frequenza o nel dominio tempo-frequenza. Selezionare le caratteristiche appropriate è una sfida anche per gli esperti di intelligenza artificiale. Di conseguenza, l'analisi esplorativa, come la creazione di istogrammi o il calcolo di statistiche di base quali media e varianza, rappresenta spesso un buon punto di partenza.⁸⁻⁹

Nella Figura 8, vengono calcolate 12 caratteristiche a partire dai dati di vibrazione pre e post-manutenzione, vengono applicati test t a due campioni per valutare le differenze statisticamente significative tra di esse e, infine, viene stilata una classifica di importanza delle caratteristiche. Una volta individuate le caratteristiche più importanti, ci si può aspettare che l'addestramento di un modello utilizzando tali caratteristiche migliori la precisione. Un metodo rappresentativo di apprendimento non supervisionato è l'autoencoder, che sfrutta la struttura delle reti neurali.¹⁰ Negli autoencoder, l'errore di ricostruzione tra input e output viene utilizzato come punteggio di anomalia.

Screenshot di un'applicazione di analisi dati che mostra segnali di serie temporali, distribuzioni istogrammatiche, un grafico a barre dell'importanza delle caratteristiche e tabelle riassuntive.

Figura 8. Analisi delle caratteristiche tramite l'app Diagnostic Feature Designer.

Dai dati vengono estratte caratteristiche a dodici dimensioni, e i dati vengono suddivisi casualmente in set di addestramento e di test con un rapporto di 9:1. L'autoencoder viene addestrato utilizzando solo le caratteristiche dei dati normali (Figura 9). Quando le caratteristiche di test vengono inserite nel modello addestrato, l'errore di ricostruzione (punteggio di anomalia) differisce chiaramente tra le condizioni pre e post-manutenzione (Figura 10). Ciò significa che, sebbene il modello sia stato addestrato solo su dati normali successivi alla manutenzione, è in grado di rilevare anomalie precedenti alla manutenzione applicando una soglia appropriata.

Finestra di avanzamento dell'addestramento che visualizza le curve delle metriche nel corso delle iterazioni di addestramento, insieme allo stato, all'avanzamento e ai dettagli dell'addestramento.

Figura 9. Curva di apprendimento dell'autoencoder (evoluzione della funzione di perdita; ovvero, errore quadratico medio).

Visualizzazione del rilevamento delle anomalie con perdita di ricostruzione nel tempo, distribuzione della perdita con linea di soglia e matrice di confusione delle classi previste.

Figura 10. Valutazione delle prestazioni del modello utilizzando i dati di test (in alto), distribuzioni del punteggio di anomalia per le classi normali e anomale (in basso a sinistra) e matrice di confusione (in basso a destra).

Riferimento 11 introduce un approccio alternativo di rilevamento delle anomalie non supervisionato utilizzando una macchina a vettori di supporto a una classe. Tuttavia, occorre prestare attenzione perché le impostazioni degli iperparametri influenzano significativamente le prestazioni. La Figura 11 illustra come il parametro di scala del kernel influenzi la regione di anomalia (confine decisionale), mostrando che scale del kernel più piccole aumentano la non linearità.¹³

Due grafici a dispersione che confrontano i risultati del rilevamento delle anomalie a scale del kernel di 0,2 e 4,0, con punti normali e regioni anomale ombreggiate.

Figura 11. Variazioni del confine decisionale con diversi valori di scala del kernel; valori più piccoli comportano una maggiore non linearità.

Infine, oltre al rilevamento delle anomalie, la prognostica utilizza dati di osservazione sequenziali per modellare lo stato di salute attuale e futuro delle apparecchiature. Una volta definita una soglia di guasto specifica per l'applicazione, è possibile stimare la vita utile residua (Figura 12). In questo caso, è possibile utilizzare la stima bayesiana per aggiornare i parametri del modello in modo sequenziale.¹⁴⁻¹⁵ I lettori interessati sono invitati a consultare Riferimento 16.

Diagramma che illustra la previsione della vita utile residua, con i valori di salute osservati, una soglia di guasto e le curve di previsione future.

Figura 12. Esempio di previsione della vita utile residua di un'apparecchiatura a partire da segnali di serie temporali.

Ottimizzazione dei processi

Il Deep Learning può essere espresso come un problema di ottimizzazione in cui i parametri (pesi e bias) di funzioni costruite a partire da combinazioni stratificate di trasformazioni lineari e funzioni di attivazione non lineari vengono ottimizzati minimizzando una funzione di perdita.¹⁷ Di conseguenza, questa sezione si concentra sul problema di ottimizzazione.

Nei processi di produzione dei semiconduttori, è spesso necessario ottimizzare simultaneamente molteplici obiettivi, come la velocità di deposizione e l'uniformità dello spessore del film.¹⁸ In questi casi, è necessario identificare le variabili di input ottimali per più funzioni obiettivo; tuttavia, una soluzione ottimale per un obiettivo generalmente non è ottimale per un altro. Questa relazione competitiva implica che il miglioramento di un obiettivo spesso ne peggiora un altro; pertanto, l'obiettivo è identificare soluzioni di compromesso, ovvero soluzioni Pareto-ottimali, che formano un fronte di Pareto.

Una soluzione Pareto ottimale è definita come una soluzione in cui il miglioramento di una qualsiasi funzione obiettivo comporta necessariamente il peggioramento di almeno un'altra funzione obiettivo. La Figura 13 (riquadro) illustra un problema di ottimizzazione a due obiettivi, in cui sia f1f_1f1​ sia f2f_2f2​ devono essere minimizzati, ma sono tra loro in una relazione di compromesso (trade-off). Gli algoritmi genetici sono un metodo ben noto per identificare le soluzioni Pareto-ottimali.¹⁹ In alternativa, un problema di ottimizzazione multiobiettivo può essere convertito in un problema a obiettivo singolo assegnando dei pesi a ciascun obiettivo:

\(F(x) = \alpha f_1(x) + (1 - \alpha) f_2(x) \)

Modificando il peso \( \alpha \), il rapporto di compromesso tra \(f_₁\) e \(f_₂\) viene alterato, generando molteplici soluzioni di Pareto. La figura mostra che i fronti di Pareto ottenuti mediante algoritmi genetici e ottimizzazione bayesiana sono in buon accordo tra loro.

Grafico comparativo di ottimizzazione che mostra f2 rispetto a f1, con punti ottenuti da un algoritmo genetico, un'ottimizzazione bayesiana e una curva di soluzione nota.

Figura 13. Soluzioni Pareto-ottimali di una funzione multiobiettivo bidimensionale.

Sebbene in questo contesto venga presentato un esempio di ottimizzazione multiobiettivo bidimensionale con una sola variabile, la stessa procedura può essere estesa a funzioni obiettivo multidimensionali con più variabili²⁰:

$$ \begin{aligned} \min_{x_1,x_2}\quad& \{f_1(x_1,x_2),\,f_2(x_1,x_2)\} \\[1em] \text{dove}\quad& f_1(x_1,x_2)=x_1^{4}+x_2^{4}+x_1x_2-(x_1x_2)^2-10x_1^{2} \\& f_2(x_1,x_2)=x_1^{4}+x_2^{4}+x_1x_2-(x_1x_2)^2 \\[1em] \text{soggetto a}\quad& 0\le x_1\le5,\qquad -5\le x_2\le0 \end{aligned} $$

La Figura 14 mostra come i problemi di ottimizzazione multiobiettivo possono essere costruiti utilizzando metodi low-code. L'applicazione con interfaccia grafica denominata Live Editor Task consente agli utenti di provare diversi algoritmi di risoluzione tramite operazioni del mouse, mentre le condizioni configurate vengono convertite automaticamente in codice, garantendo la trasparenza del modello.

Screenshot di uno strumento di ottimizzazione che mostra le impostazioni degli obiettivi e dei vincoli, le scelte del risolutore e la configurazione per un algoritmo multiobiettivo.

Figura 14. Costruzione di problemi di ottimizzazione utilizzando metodi low-code.

Distribuzione del sistema

Infine, si consideri l'integrazione del sistema. La posizione di implementazione degli algoritmi sviluppati (dispositivi edge, server o piattaforme cloud) dipende dal volume di trasferimento dati, dai requisiti computazionali e dai vincoli operativi. Se ridurre al minimo il trasferimento dei dati è fondamentale, è necessario eseguire la preelaborazione sull'apparecchiatura di destinazione, trasmettendo ai dispositivi edge solo i dati essenziali per la previsione, in modo da poter poi inoltrare i risultati a un server e condividerli con gli utenti finali.

È inoltre importante considerare come i risultati delle previsioni verranno utilizzati nelle operazioni, ad esempio se verranno visualizzati su PC desktop o tablet portatili, e se gli utenti possiedono una conoscenza sufficiente del settore. Per uno studio di caso dettagliato sull'implementazione, fare riferimento a Riferimento 21.

Conclusione

L'intelligenza artificiale viene sempre più utilizzata nella produzione di semiconduttori per rilevare sottili variazioni di processo e anomalie delle apparecchiature difficili da identificare con i metodi convenzionali. Gli esempi presentati in questo articolo dimostrano come i dati delle serie temporali dei sensori possano essere utilizzati per sviluppare modelli che supportino il miglioramento della qualità e operazioni più affidabili.

Il Machine Learning e il Deep Learning applicati ai dati delle serie temporali possono essere utilizzati per attività quali la stima del profilo di incisione e il monitoraggio basato sulle vibrazioni. Per ottenere risultati affidabili, è fondamentale concentrarsi sulla raccolta di dati rappresentativi, sull'esecuzione di un'attenta preelaborazione ed estrazione delle caratteristiche e sull'utilizzo di competenze specifiche del settore per definire la validazione e le soglie. Quando l'etichettatura risulta difficile, i metodi non supervisionati offrono un'alternativa pratica. Si prevede che la continua crescita della disponibilità di dati e delle capacità dell'intelligenza artificiale aumenterà ulteriormente l'autonomia nell'ottimizzazione dei processi.

Questo studio ha utilizzato MATLAB, Statistics and Machine Learning Toolbox™, Predictive Maintenance Toolbox™, Deep Learning Toolbox™, Optimization Toolbox™ e Global Optimization Toolbox™. I dati utilizzati possono essere scaricati dal sito web MathWorks (vedere i riferimenti 6 e 20).

Riferimenti

  1. Imoto, K., and Nakai, T., “Automated Defect Classification System for Semiconductor Manufacturing Processes Using Deep Learning,” Toshiba Review, Vol. 74, No. 5, 2019.

  2. Sanada, T., and Jimbo, Y., “Single-Wafer Cleaning Technologies in Semiconductor Manufacturing Processes,” NAGARE, Vol. 42, p. 187, 2023.

  3. DeLaus, M. D., “Machine Learning for Automated Anomaly Detection in Semiconductor Manufacturing,” master’s thesis, Massachusetts Institute of Technology (MIT), 2019.

  4. Adachi, Y., “An Introduction to Preprocessing for Machine Learning,” Lec Telecom, p. 30, 2019.

  5. Wang, X., Journal of Measurement Technology, Vol. 48, No. 7, pp. 20–26, 2020.

  6. Konishi, S., Introduction to Multivariate Analysis: From Linear to Nonlinear, Iwanami Shoten, pp. 212–221, 2010.

  7. Gebraeel, N., IEEE Transactions on Automation Science and Engineering, Vol. 3, pp. 382–393, 2006.

  8. Gebraeel, N., et al., IIE Transactions, Vol. 37, pp. 543–557, 2005.

  9. Information-technology Promotion Agency (IPA), AI white paper, Japan, p. 91, 2020.

  10. Moriya, T., “Application of Machine Learning in Semiconductor Manufacturing,” Applied Physics, Vol. 90, No. 5, 2021.

Pubblicato nel 2026


Per saperne di più