Komplett pensumoversikt for datavarehus og datagruvedrift ved NTNU — med forklaringer, sentrale begreper, eksamenstips og vanlige fallgruver. Eksamensoptimalisert basert på tidligere eksamener.
Denne studieguiden dekker hele pensum i TDT4300 Datavarehus og datagruvedrift (Data Warehousing and Data Mining) ved NTNU. Faget bygger på den klassiske læreboka Han, Kamber & Pei Data Mining: Concepts and Techniques, supplert med Tan, Steinbach & Kumar. Det kombinerer to nært beslektede områder: hvordan man bygger og spør mot et datavarehus (OLAP, multidimensjonal modellering), og hvordan man trekker mønstre ut av data via datagruvedrift (klassifisering, klyngeanalyse og assosiasjonsregler).
Eksamen er en skriftlig skoleeksamen på fire timer med hjelpemiddelkode D (kun enkel kalkulator — ingen trykte eller håndskrevne hjelpemidler). Det betyr at du må kunne algoritmene og formlene utenat og utføre regningen for hånd. Erfaringsmessig består besvarelsen av to typer oppgaver:
Regneoppgavene er der de fleste poengene ligger, og de er svært forutsigbare: nesten hver eneste eksamen inneholder en Jaccard-utregning, et stjerneskjema, en GAINsplit-beregning og en frekvent-elementsett-oppgave. Behersker du disse fire mønstrene grundig, har du sikret en stor del av karakteren. Denne guiden går derfor i dybden på den eksakte fremgangsmåten for hver av dem, med egne taleksempler du kan regne etter.
Hva et datavarehus er, hvordan det skiller seg fra operasjonelle databaser, og arkitektur (enterprise warehouse, data mart, virtuelt varehus).
Bill Inmons klassiske definisjon, som ofte testes ord-for-ord: «A data warehouse is a subject-oriented, integrated, time-variant, and nonvolatile collection of data in support of management's decision-making process.» De fire understrekede ordene er kjernen:
Et viktig skille er mellom operasjonelle systemer og analytiske systemer:
En vanlig totrinns-strategi er top-down + bottom-up: bygg en enterprise-modell, men implementer inkrementelt via data marts.
En nettbutikk har to systemer. System A registrerer hver ordre i sanntid, oppdaterer lagerbeholdning og håndterer tusenvis av samtidige kjøp. System B brukes av ledelsen til å analysere «gjennomsnittlig ordreverdi per region per kvartal de siste tre årene».
Svar: System A er OLTP — mange korte oppdateringstransaksjoner, normalisert, sanntid. System B er OLAP — komplekse aggregerende spørringer over historiske data, og typisk implementert som et datavarehus med stjerneskjema. Merk at de tidsvariante (3 år) og emneorienterte (ordre/region) egenskapene gjør B til et lærebokeksempel på et datavarehus.
Nøkkelformler
Vanlige feil
Eksamenstips
Laster...