Azure Synapse Analytics: gids voor beginners

  • Azure Synapse Analytics DP-3012
  • Gepubliceerd door: André Hamer op feb 25, 2024
Blog Alt EN

Azure Synapse Analytics is een platform voor data-integratie en analyse, en bij een eerste project ligt de lastigste keuze vaak niet in het aanmaken van een workspace, maar in bepalen welke onderdelen echt nodig zijn voor de eerste werkende oplossing.

Azure Synapse Analytics is een analyticsplatform in Azure dat data-integratie, SQL-analyse, Apache Spark, data lake-verwerking en koppelingen met BI-tools samenbrengt in één workspace. Voor beginners is het vooral nuttig omdat dezelfde omgeving zowel geschikt is voor het verkennen van bestanden in een data lake als voor het bouwen van herhaalbare datapijplijnen en analytische modellen.

Wat Azure Synapse Analytics wel en niet oplost

Synapse wordt vaak geïntroduceerd als een combinatie van datawarehouse en big data-platform, maar die omschrijving is pas nuttig wanneer de grenzen duidelijk zijn. Het platform vervangt niet automatisch elke losse datatool. Een team dat alleen enkele Excel-bestanden in Power BI wil visualiseren, heeft meestal geen volledige Synapse-omgeving nodig. Een team dat alleen ruwe bestanden goedkoop wil bewaren, kan vaak beginnen met Azure Data Lake Storage Gen2 zonder SQL- of Spark-laag.

Synapse wordt interessanter zodra data uit meerdere bronnen moet worden ingelezen, opgeschoond, gecombineerd en beschikbaar gemaakt voor analyse door verschillende gebruikersgroepen. Een data-analist kan serverless SQL gebruiken om Parquet- of CSV-bestanden direct te bevragen. Een data-engineer kan Spark gebruiken voor zwaardere transformaties en Delta Lake-tabellen. Een BI-team kan vervolgens curated datasets gebruiken in Power BI, zonder dat iedere rapportbouwer de ruwe bronstructuur hoeft te begrijpen.

Voor echte beginners is het verstandig eerst de basisbegrippen rond relationele data, data lakes, transactieverwerking en analytische workloads te begrijpen. Een neutrale opstap daarvoor is de Microsoft Azure Data Fundamentals-route; wie later formele training over Azure-datafundamenten zoekt, kan zich oriënteren op Readynez via bestaande Microsoft-trainingspaden, maar de praktische keuzes in Synapse blijven vooral architectuurkeuzes.

De belangrijkste onderdelen in eenvoudige taal

Een Synapse-workspace is de werkruimte waarin de meeste onderdelen samenkomen. Synapse Studio is de webinterface waarin gebruikers data verkennen, notebooks schrijven, SQL-scripts uitvoeren, pipelines ontwerpen, monitoring bekijken en beveiligingsinstellingen beheren. De workspace koppelt doorgaans aan een Azure Data Lake Storage Gen2-account waarin ruwe en verwerkte data wordt opgeslagen.

Synapse SQL bestaat uit twee belangrijke smaken. Serverless SQL pools zijn bedoeld om bestanden in het data lake direct te bevragen zonder vooraf een datawarehouse te laden. Dedicated SQL pools zijn bedoeld voor relationele datawarehouse-workloads waarbij compute-capaciteit expliciet wordt ingericht en beheerd. Apache Spark pools zijn bedoeld voor gedistribueerde verwerking, notebooks, Python- of Scala-code, machine learning-voorbereiding en Delta Lake-bewerkingen.

Pipelines zorgen voor orkestratie: het kopiëren van data, starten van notebooks, uitvoeren van SQL-stappen en plannen van terugkerende workflows. Deze functie lijkt op bekende data-integratiepatronen uit Azure Data Factory, maar binnen Synapse staat de pipeline naast SQL, Spark en monitoring in dezelfde studio. Dat maakt een proof of concept overzichtelijker, zolang de scope klein blijft.

Onderdeel Rol in een startersarchitectuur Typische keuze
Azure Data Lake Storage Gen2 Opslag voor bronbestanden, verrijkte bestanden en curated datasets. Gebruik mappen of containers voor ruwe, verrijkte en gevalideerde data.
Serverless SQL pool Ad-hoc analyse op bestanden zonder vooraf geladen warehouse. Gebruik voor verkenning, snelle views en lichte BI-scenario's.
Spark pool Transformatie, Delta Lake, notebooks en schaalbare dataverwerking. Gebruik wanneer SQL alleen te beperkt is voor de transformatielogica.
Dedicated SQL pool Relationeel datawarehouse met beheerde compute-capaciteit. Gebruik bij herhaalbare BI-workloads met voorspelbare performance-eisen.
Power BI Rapportage en semantische modellen bovenop voorbereide data. Gebruik pas nadat de dataset voldoende stabiel en begrijpelijk is.

Deze tabel is vaak bruikbaarder dan een architectuurdiagram voor een eerste ontwerp, omdat beginners dan direct zien welk onderdeel welk probleem oplost. Een eenvoudige starteropzet bestaat uit een workspace, een gekoppeld data lake, een serverless SQL-laag voor verkenning, een Spark pool voor transformatie wanneer nodig, pipelines voor planning en Power BI voor rapportage.

Kiezen tussen serverless SQL, dedicated SQL pools en Spark

De eerste technische keuze in Synapse heeft veel invloed op kosten, complexiteit en wachttijd. Serverless SQL is meestal de juiste start voor ad-hoc analyse op bestanden, omdat er geen dedicated compute-pool hoeft te draaien. De keerzijde is dat kosten samenhangen met de hoeveelheid data die queries scannen. Slecht gekozen bestandsindelingen, brede CSV-bestanden en queries zonder filter kunnen daardoor onnodig duur worden.

Dedicated SQL pools passen beter wanneer een organisatie een relationeel warehouse wil opbouwen met terugkerende rapportage, duidelijke modellering en voorspelbare performance-eisen. Deze aanpak vraagt meer ontwerpdiscipline, bijvoorbeeld rond distributie, partitionering, laden en pauzeren van compute wanneer de pool niet nodig is. Voor een kleine proefopstelling is dedicated vaak te zwaar, tenzij het doel expliciet is om een datawarehousepatroon te testen.

Spark is de betere keuze wanneer data eerst inhoudelijk moet worden getransformeerd, opgeschoond of verrijkt voordat SQL-analyse zinvol is. Denk aan grote JSON-bestanden, complexe joins, Delta Lake-tabellen, data science-voorbereiding of transformaties die beter in Python worden uitgedrukt. Spark brengt wel eigen aandachtspunten mee: clusters moeten starten, notebooks moeten beheerd worden en het small-files-probleem kan prestaties merkbaar verslechteren.

Een praktische beslisregel helpt. Gebruik serverless SQL voor snelle verkenning en lichte views op data lake-bestanden. Gebruik Spark voor transformaties, Delta Lake en complexere dataverwerking. Gebruik dedicated SQL pools pas wanneer het datamodel stabiel genoeg is en de workload voldoende voorspelbaar is om ingerichte compute te rechtvaardigen.

Een eerste mini-walkthrough in Synapse Studio

Een zinvolle eerste oefening begint klein: plaats een CSV-bestand in Azure Data Lake Storage Gen2, bekijk het bestand met serverless SQL, schrijf daarna een opgeschoonde Delta Lake-versie met PySpark en bevraag die opnieuw. Dit laat zien hoe Synapse SQL en Spark samenwerken rond dezelfde opslaglaag. Het voorkomt ook een veelgemaakte beginnersfout: direct een groot warehouse bouwen voordat duidelijk is hoe de brondata eruitziet.

  1. Maak een Synapse-workspace en koppel een Data Lake Storage Gen2-account als primaire opslag.
  2. Upload een klein CSV-bestand naar een map voor ruwe data, bijvoorbeeld sales/2026.
  3. Open Synapse Studio en maak een SQL-script dat de data via serverless SQL leest.
  4. Maak een Spark-notebook dat dezelfde data opschoont en als Delta Lake-tabel wegschrijft.
  5. Maak een SQL-view bovenop de curated data en gebruik die als basis voor rapportage.

In Synapse Studio staat deze oefening verspreid over de onderdelen Data, Develop, Integrate en Monitor. Een screenshot van het Data-paneel zou hier de gekoppelde lake-containers tonen; een screenshot van Develop zou het SQL-script en notebook naast elkaar tonen; een screenshot van Monitor zou laten zien welke pipeline- of Spark-runs zijn uitgevoerd. Zonder die schermbeelden blijft de kern hetzelfde: bestanden, code en uitvoering worden in één workspace beheerd.

Het volgende voorbeeld gebruikt serverless SQL om een CSV-bestand direct vanuit het data lake te lezen. Dit is geschikt voor verkenning, maar in productie is Parquet of Delta meestal efficiënter omdat kolomselectie en pruning beter werken. Controleer vooraf of de workspace Managed Identity leesrechten heeft op de betreffende lake-map.

Example — CSV verkennen met serverless SQL

SELECT TOP 100
    SalesOrderNumber,
    OrderDate,
    CustomerName,
    SalesAmount
FROM OPENROWSET(
    BULK 'https://contosolake.dfs.core.windows.net/raw/sales/2026/*.csv',
    FORMAT = 'CSV',
    PARSER_VERSION = '2.0',
    HEADER_ROW = TRUE
) AS sales
WHERE OrderDate >= '2026-01-01';

Deze query laadt de data niet in een warehouse; serverless SQL leest de bestanden op aanvraag. Het leerpunt is dat iedere scan telt voor kosten en performance. Beperk daarom kolommen, filter waar mogelijk en vermijd brede scans over grote mappen wanneer een kleine subset volstaat.

Na de eerste verkenning is het logisch om de ruwe data naar een beter analyseformaat te schrijven. Delta Lake op ADLS Gen2 is hiervoor bruikbaar omdat het tabellen bovenop bestanden mogelijk maakt en goed aansluit op Spark-workloads. Veel teams werken daarbij met medallion-lagen: ruwe brondata, verrijkte data en curated data voor rapportage.

Example — CSV transformeren naar Delta met PySpark

from pyspark.sql.functions import col, to_date

source_path = "abfss://raw@contosolake.dfs.core.windows.net/sales/2026/"
target_path = "abfss://curated@contosolake.dfs.core.windows.net/sales_delta/"

sales_df = (
    spark.read.option("header", "true")
    .option("inferSchema", "true")
    .csv(source_path)
)

clean_sales_df = (
    sales_df
    .withColumn("OrderDate", to_date(col("OrderDate")))
    .withColumn("SalesAmount", col("SalesAmount").cast("decimal(18,2)"))
    .filter(col("SalesAmount").isNotNull())
)

clean_sales_df.write.format("delta").mode("overwrite").save(target_path)

Dit notebook leest ruwe CSV-data, zet datatypes expliciet goed en schrijft een Delta-versie naar een curated map. Controleer na uitvoering in Monitor of de Spark-applicatie succesvol is afgerond en bekijk het aantal geschreven bestanden. Veel kleine bestanden kunnen latere queries vertragen, waardoor compactie of een andere partitioneringsstrategie nodig kan worden.

Lakehouse-denken zonder de complexiteit te vergroten

Een lakehouse in Synapse betekent in de praktijk dat het data lake niet alleen als archief wordt gebruikt, maar als actieve analytische opslaglaag. Ruwe data blijft beschikbaar voor herleidbaarheid, verrijkte data bevat opgeschoonde en gestandaardiseerde velden, en curated data is geschikt voor rapportage of downstream consumptie. Deze indeling helpt vooral wanneer verschillende teams dezelfde data op verschillende volwassenheidsniveaus gebruiken.

Delta Lake maakt dit patroon beheerbaarder doordat Spark tabellen kan schrijven die daarna opnieuw door Spark en, afhankelijk van de gekozen configuratie en mogelijkheden, door Synapse SQL benaderd kunnen worden. Voor beginners is de belangrijkste les niet dat elk project drie perfecte lagen nodig heeft. Het gaat erom dat ruwe brondata niet telkens overschreven wordt door tijdelijke transformaties, en dat rapportages niet rechtstreeks afhankelijk worden van rommelige bronbestanden.

De keuze voor Parquet of Delta in plaats van CSV is een van de eenvoudigste performanceverbeteringen. Kolomgebaseerde bestandsformaten verminderen vaak de hoeveelheid data die analytische queries hoeven te lezen. Partitionering kan helpen wanneer queries vaak filteren op dezelfde velden, zoals datum of regio. Te fijn partitioneren werkt echter averechts, omdat Spark en SQL dan veel kleine bestanden moeten openen.

Kosten en prestaties beheersen vanaf dag één

Synapse kan klein beginnen, maar kosten ontstaan snel wanneer beginners alle engines tegelijk gebruiken zonder duidelijke taakverdeling. Serverless SQL rekent op basis van gescande data, dus bestandsformaat, kolomselectie en filtering zijn belangrijk. Dedicated SQL pools gebruiken ingerichte capaciteit zolang ze actief zijn; pauzeren buiten gebruik is daarom een basishygiëne. Spark pools kunnen autoscale en auto-pause gebruiken, maar notebooks die onnodig vaak clusters starten blijven merkbaar bijdragen aan verbruik.

Performanceproblemen komen bij starters vaak voort uit dezelfde oorzaken. CSV wordt te lang als standaardformaat gebruikt, queries lezen complete mappen terwijl een datumfilter mogelijk is, Spark schrijft grote aantallen kleine bestanden, en data wordt gekopieerd naar een warehouse voordat het datamodel stabiel is. In veel gevallen is de goedkoopste optimalisatie geen grotere pool, maar beter georganiseerde bestanden en een scherpere query.

Observability hoort daarom al in de proof of concept thuis. Synapse Monitor toont pipeline-runs, Spark-applicaties en SQL-activiteiten. Query Performance Insight kan helpen bij dedicated SQL-workloads. Log Analytics is nuttig wanneer operationele teams uitvoering, fouten en verbruik centraal willen volgen. Deze monitoring is niet alleen voor troubleshooting; ze maakt zichtbaar welke notebooks, queries of pipelines de meeste aandacht vragen voordat het project groeit.

Beveiliging en governance voor een eerste omgeving

Een Synapse-proof of concept wordt soms te open ingericht omdat snelheid belangrijker lijkt dan governance. Dat levert later herstelwerk op. De basis begint met Azure RBAC voor toegang tot de workspace en juiste rechten op het Data Lake Storage-account. Daarnaast blijven bestandssysteemrechten, zoals ACL's op mappen, belangrijk wanneer gebruikers of managed identities rechtstreeks data lezen en schrijven.

Managed Identity verdient de voorkeur boven sleutels of hardcoded secrets in notebooks en scripts. Daarmee kan de workspace zelf toegang krijgen tot opslag of andere Azure-services zonder geheimen in code te plaatsen. Voor productieachtige omgevingen zijn managed virtual networks, private endpoints en data exfiltration protection relevante opties om netwerktoegang strakker te begrenzen. Ze maken de omgeving wel complexer, dus het is verstandig ze bewust te ontwerpen in plaats van achteraf toe te voegen.

Governance gaat ook over naamgeving, eigenaarschap en lifecycle. Een eenvoudige conventie voor containers, mappen, pipelines en notebooks voorkomt dat een proefproject verandert in een ondoorzichtige verzameling scripts. Leg vast welke datasets brondata zijn, welke datasets zijn gevalideerd, wie wijzigingen mag doorvoeren en hoe mislukte pipeline-runs worden opgevolgd.

Synapse-vaardigheden in de context van Microsoft Fabric

Microsoft Fabric heeft veel aandacht gekregen als geïntegreerde analyticsomgeving, maar dat maakt Synapse-kennis niet waardeloos. Begrippen zoals lakehouse-opslag, Spark-notebooks, SQL-analyse, pipelines, Delta-tabellen, medallion-lagen en BI-consumptie blijven relevant. Teams die Synapse leren, bouwen daardoor vaardigheden op die ook buiten één interface toepasbaar zijn.

Voor nieuwe projecten is het verstandig om niet alleen naar productnamen te kijken, maar naar het werk dat gedaan moet worden. Moet een team bestaande Azure-data lake-architectuur uitbreiden, dan kan Synapse nog steeds een logische keuze zijn. Moet een organisatie juist één geïntegreerde SaaS-ervaring voor analyse en BI centraler maken, dan kan Fabric in beeld komen. De praktische waarde zit in het begrijpen van data-engineeringpatronen, niet in het onthouden van iedere knop in Synapse Studio.

Veelgemaakte beginnersfouten

Een veelvoorkomende fout is te snel opschalen. Grotere SQL- of Spark-capaciteit maskeert soms slechte bestandsindeling, ontbrekende filters of onduidelijke modellering. Begin daarom met een kleine dataset, meet querygedrag en vergroot pas wanneer het patroon klopt.

Een tweede fout is alles in één laag bewaren. Wanneer ruwe, opgeschoonde en rapportageklare bestanden door elkaar staan, wordt troubleshooting lastig en neemt het risico op foutieve rapportage toe. Een eenvoudige scheiding tussen raw, enriched en curated maakt al veel verschil.

Een derde fout is beveiliging pas na de demo regelen. Zodra echte data wordt gebruikt, horen rechten, identities, logging en netwerkgrenzen onderdeel te zijn van het ontwerp. Dat hoeft een proef niet zwaar te maken; het voorkomt vooral dat verkeerde gewoontes worden gekopieerd naar productie.

Verder leren zonder meteen te groot te bouwen

Een goede volgende stap is een kleine end-to-end oefening: één bronbestand, één serverless SQL-view, één Spark-transformatie naar Delta, één pipeline-run en één Power BI-rapport. Daarmee wordt duidelijk hoe de onderdelen samenwerken zonder dat het project verdrinkt in platformkeuzes. De Microsoft Learn-documentatie over Synapse-overzicht, serverless SQL pools, Spark pools en Delta Lake in Synapse is een nuttige bron om de details per onderdeel na te slaan.

Wie daarna dieper wil leren ontwerpen en implementeren, kan de onderwerpen rond data ingestion, transformatie, opslagoptimalisatie, beveiliging en monitoring verder uitbouwen richting Azure Data Engineer Associate (DP-203)-niveau. Let bij het kiezen van trainingsmateriaal op actuele examencodes en vermijd verouderde of niet-bestaande Synapse-examennamen. Voor vragen over passende vervolgstappen kan contact worden opgenomen; wie daarnaast breder naar Microsoft-productiviteit kijkt, vindt hier ook de bestaande pagina over Copilot voor Microsoft 365.

FAQ

Wat is Microsoft Azure Synapse Analytics?

Microsoft Azure Synapse Analytics is een cloudgebaseerd analyticsplatform dat data lake-analyse, SQL, Spark, pipelines en integratie met BI-tools samenbrengt. Het wordt gebruikt om data uit verschillende bronnen te verkennen, te transformeren en beschikbaar te maken voor rapportage, data-engineering en analytische toepassingen.

Wanneer gebruik je serverless SQL in Synapse?

Serverless SQL is geschikt wanneer data direct vanuit bestanden in het data lake moet worden verkend of bevraagd zonder vooraf een dedicated datawarehouse in te richten. Het past goed bij ad-hoc analyse, eerste dataverkenning en lichte views, maar vereist aandacht voor gescande data, bestandsformaat en filtering.

Wanneer is een dedicated SQL pool zinvol?

Een dedicated SQL pool is zinvol wanneer er een stabiel relationeel datawarehouse nodig is met voorspelbare BI-workloads en performance-eisen. Het vraagt meer beheer dan serverless SQL, onder meer rond laden, modelleren, optimaliseren en pauzeren van compute wanneer de pool niet wordt gebruikt.

Waarvoor gebruik je Apache Spark in Azure Synapse?

Apache Spark wordt gebruikt voor schaalbare datatransformaties, notebooks, Python- of Scala-verwerking, Delta Lake-tabellen en data science-voorbereiding. Het is vooral nuttig wanneer de logica complexer is dan een SQL-query of wanneer grote hoeveelheden bestanden efficiënt moeten worden opgeschoond en verrijkt.

Hoe kan een beginner veilig starten met Synapse?

Begin met een kleine dataset, gebruik Managed Identity in plaats van sleutels in code, geef alleen noodzakelijke rechten op workspace en data lake, en monitor SQL-, Spark- en pipeline-runs vanaf het begin. Bouw eerst een eenvoudige flow van raw naar curated data voordat dedicated pools of complexe netwerkconfiguraties worden toegevoegd.

A group of people discussing the latest Microsoft Azure news

Unlimited Microsoft Training

Krijg onbeperkte toegang tot ALLE LIVE Microsoft-cursussen onder leiding van een instructeur die u wilt - allemaal voor de prijs van minder dan één cursus. 

  • 60+ LIVE cursussen onder leiding van een instructeur
  • Geld-terug-garantie
  • Toegang tot 50+ doorgewinterde instructeurs
  • 50.000+ IT-professionals opgeleid

Winkelwagen

{{item.CourseTitle}}

Prijs: {{item.ItemPriceExVatFormatted}} {{item.Currency}}