Komplett pensumoversikt for maskinlæring for signalbehandling ved NTNU — med forklaringer, sentrale begreper, eksamenstips og vanlige fallgruver. Eksamensoptimalisert basert på tidligere eksamener.
Innhold
Denne studieguiden dekker pensum i TTT4185 Taleteknologi ved NTNU. Faget handler om hvordan datamaskiner analyserer, gjenkjenner og syntetiserer menneskelig tale, og bygger en bro mellom digital signalbehandling, statistisk mønstergjenkjenning og moderne maskinlæring. Pensum kan grovt deles i fire bolker: taleanalyse (kilde-filter-modellen, lineær prediksjon, cepstrum, MFCC og spektrogrammer), automatisk talegjenkjenning (Bayes-klassifikatoren, skjulte Markov-modeller, n-gram-språkmodeller og valg av basisenheter), talesyntese (tekst-til-tale-pipelinen, konkatenasjonssyntese og PSOLA) og dyp læring for tale (flerlags perceptroner, trening med gradientmetode, CD-DNN-HMM, CNN og RNN).
Eksamen består konsekvent av tre store oppgaver som dekker hver sin bolk, der den ene bolken roterer mellom talesyntese og dyp læring fra år til år. Alle deloppgaver teller likt, og det forventes at du både kan forklare begreper presist (drøftende prosa) og gjøre konkrete utregninger — særlig telle frie parametre i nett og n-gram, og lese av grunntone og formanter fra figurer. Studieguiden er organisert slik at hver quiz-temaseksjon henger sammen med en konkret del av eksamen, og den avsluttes med tilleggsseksjoner for de delene av faget som testes hyppigst men ikke fanges av temalisten alene.
Flerlags perceptron (MLP): lagvis affin transformasjon pluss ikke-linearitet. Telling av frie parametre (vekter + bias), valg av aktiveringsfunksjon i utgangslaget (softmax for klassifisering, lineær for regresjon) og universell approksimasjon. Et nesten garantert regneoppgave-tema på eksamen.
Et flerlags perceptron (MLP) er bygd av lag der hvert lag gjør en affin transformasjon etterfulgt av en ikke-lineær aktiveringsfunksjon. La være utgangsvektoren fra lag og være inngangsvektoren til lag . Da er , der er en vektmatrise og en biasvektor, og utgangen blir for en aktiveringsfunksjon .
Et nettverk med ett skjult lag kan i prinsippet approksimere enhver kontinuerlig funksjon mellom inngang og utgang. Problemet er at antallet noder i det skjulte laget da må bli svært stort. Et dypt nettverk oppnår samme uttrykkskraft med langt færre noder per lag, fordi senere lag kan bygge videre på sammensatte representasjoner fra tidligere lag.
Dette er det mest forutsigbare regnespørsmålet i faget. La være antall noder i lag . Et lag som går fra til noder har vekter og bias.
Eksempel: Et nett med lagstørrelser — altså 8 innganger, to skjulte lag med 100 noder hver og 5 utganger. Tell parametrene lagvis:
Totalt frie parametre. Husk alltid å legge til bias for hvert lag — det er her studenter mister poeng.
Valget styres av oppgavetypen. For en klassifikator vil man at utgangene skal være positive og summere til 1, altså en sannsynlighetsfordeling — da bruker man softmax, . For en regresjonsoppgave bruker man et lineært utgangslag, , slik at utgangen kan ta vilkårlige reelle verdier.
Nøkkelformler
Vanlige feil
Eksamenstips
Laster...