SQL Server naar Databricks met Lakeflow Connect
Ingest SQL Server-snapshots en incrementele wijzigingen in governed Unity Catalog-tabellen zonder zelf een custom CDC-framework te bouwen en onderhouden.
Bron
SQL Server
Orders · voorraad · productie · masterdata
Eerste load
Initiële snapshot
volledige bronstateDaarna
Incrementele wijzigingen
Bestemming
Unity Catalog streaming tables
Source-aligned Delta-data klaar voor downstream Lakeflow-transformaties.
Lakeflow Connect scheidt bronreplicatie van downstream manufacturing-transformaties en businesslogica.
Waar Lakeflow Connect past
Gebruik managed ingestie wanneer SQL Server-wijzigingen duurzame Databricks-data moeten worden
Lakeflow Connect is het sterkst wanneer u een onderhouden kopie van SQL Server-data in Delta-tabellen wilt, inclusief initial load, incrementele wijzigingen, deletes, schemahandling en recovery. Het is niet het enige SQL Server-access pattern.
Managed ingestion
Kies Lakeflow Connect wanneer Databricks eigenaar moet zijn van een incrementeel bijgehouden kopie.
Eenvoudige batchextractie
JDBC kan nog steeds geschikt zijn voor kleine referentietabellen met weinig wijzigingen of uitzonderlijke bronnen.
Zero-copy-toegang
Lakehouse Federation past bij geselecteerde live-query-use-cases waar het kopiëren van data weinig waarde toevoegt.
Start met de uitkomst, niet met de connectornaam.
Nodig
Duurzame lokale kopie + doorlopende wijzigingen
Lakeflow Connect
managed snapshot + incrementele ingest
Nodig
Kleine geplande extractie
JDBC-batch
eenvoudige pull waar CDC weinig waarde toevoegt
Nodig
Live bronquery zonder kopiëren
Lakehouse Federation
remote query-pad
Primary key- en historievereisten bepalen de keuze.
Heb je SCD Type 2-historie nodig?
Gebruik CDC
SCD Type 2 vereist source CDC
Heeft de tabel een primary key?
Ja
Change Tracking
Nee
CDC
Change Tracking vs CDC
Geef voorkeur aan Change Tracking voor keyed tables tenzij u CDC-historie nodig heeft
Databricks adviseert Change Tracking voor tabellen met een primary key omdat dit lichter is voor SQL Server. CDC legt iedere operatie vast en werkt ook zonder primary key, maar kan de bron zwaarder belasten.
Change Tracking
Vereist een primary key en registreert welke rijen zijn gewijzigd zonder de volledige operatiehistorie te bewaren.
Change Data Capture
Legt operation history vast en is vereist wanneer Lakeflow Connect SCD Type 2-historie moet publiceren.
Bronimpact is belangrijk
Benchmark snapshots en wijzigingsextractie tegen echte ERP-workloadvensters in plaats van CDC als gratis te beschouwen.
Replicatielifecycle
De eerste load en de changestream zijn twee verschillende operationele fasen
De initiële snapshot creëert de baseline. Incrementele capture houdt daarna de destination actueel. Ontwerp broncapaciteit, retention en recovery voor beide fasen.
1 · Snapshot
Lees de huidige status van de bron
Grote tabellen kunnen een heel ander SQL Server-loadprofiel creëren dan steady-state ingestion.
2 · Wijzigingen volgen
Bescherm het changewindow
CT- of CDC-retentie moet langer zijn dan realistische outages zodat wijzigingen nog beschikbaar zijn wanneer ingestie wordt hervat.
3 · Wijzigingen toepassen
Upsert en delete incrementeel
Lakeflow Connect past bronwijzigingen toe op destination streaming tables met de geconfigureerde keys en SCD-modus.
4 · Afstemmen
Verifieer actualiteit en volledigheid
Volg snapshotvoortgang, CDC-lag, row counts en recovery-events in plaats van alleen jobsucces te monitoren.
Standaard CDC-architectuur
Houd capture continu en plan destination refresh onafhankelijk
De standaard databaseconnectorarchitectuur gebruikt een continuous ingestion gateway plus een aparte managed ingestion pipeline. De gateway beschermt het source change window door snapshot- en changedata continu te stagen.
Gateway op classic compute
Het moet continu blijven draaien en netwerktoegang tot SQL Server hebben.
Unity Catalog-stagingvolume
Geëxtraheerde snapshot- en CDC-data wordt gebufferd tussen source capture en toepassing op de bestemming.
Geplande serverless ingestie
De destination pipeline kan draaien volgens de actualiteitscadans die je consumers daadwerkelijk nodig hebben.
SQL Server
snapshot · CT / CDC
Ingestion-gateway
classic compute
Stagingvolume
buffer snapshot en incrementele wijzigingen
Ingestion-pipeline
serverless compute
Streaming tables
Unity Catalog-destination
resources:
pipelines:
sqlserver_gateway:
continuous: true
gateway_definition:
connection_name: sqlserver_connection
gateway_storage_catalog: main
gateway_storage_schema: ingest_staging
sqlserver_ingestion:
serverless: true
ingestion_definition:
ingestion_gateway_id: ${resources.pipelines.sqlserver_gateway.id}
objects:
- table:
source_catalog: ERP
source_schema: dbo
source_table: ProductionOrder
destination_catalog: main
destination_schema: bronze
Lakeflow Job-trigger
Start één pipeline-update
Fase 1
Extraheer
snapshot of incrementele wijzigingen naar stagingvolume
Fase 2
Toepassen
merge wijzigingen naar destination streaming tables
Slim afsluiten
Stop wanneer bijgewerkt of wanneer de runtimecap is bereikt
Integrated CDC · Beta
Eén pipeline combineert extraction en application per update
Integrated CDC verwijdert de always-on gateway uit de topologie. Iedere getriggerde update haalt wijzigingen op, staget ze en past ze toe voordat de run stopt. De functionaliteit is nog Beta en moet voor de workspace worden ingeschakeld.
Enkele pipeline-resource
De pipeline verwijst direct naar de Unity Catalog SQL Server-connection met connector_type: CDC.
Alleen triggered
Plan terugkerende updates met Lakeflow Jobs. Een uurlijkse interval is voor veel workloads een verstandig startpunt.
Classic of serverless compute
Welke compute mode u ook kiest, deze moet een geldig netwerkpad naar de primaire SQL Server-instance hebben.
Preview deploymentinterfaces
Maak Integrated CDC met API, CLI, notebooks of Declarative Automation Bundles. Aanmaken via de UI is nog niet beschikbaar.
resources:
pipelines:
sqlserver_integrated:
name: sqlserver-integrated-cdc
channel: PREVIEW
catalog: main
schema: bronze
ingestion_definition:
connection_name: sqlserver_connection
connector_type: CDC
objects:
- table:
source_catalog: ERP
source_schema: dbo
source_table: ProductionOrder
table_configuration:
scd_type: SCD_TYPE_1
Connectiviteit
De extractiecompute moet de primaire SQL Server-instance kunnen bereiken
Netwerkontwerp verandert met de Lakeflow Connect-architectuur. Standard CDC bereikt SQL Server vanuit de classic gateway. Integrated CDC kan classic of serverless compute gebruiken, dus het egress-pad moet overeenkomstig worden ontworpen.
Private en on-prem-bronnen hebben expliciete connectiviteit nodig vanuit de compute plane die extractie uitvoert.
SQL Server-bron
on-prem · Azure VM · Azure SQL · Managed Instance
Netwerkpad
Gebruik het pad dat past bij je securityarchitectuur en computemode.
Standaard CDC
Classic gateway
workspace-VNet-pad naar bron
Integrated CDC
Classic of serverless
serverless vereist geconfigureerde serverless networking
Nieuwe databaseconnector-pipelines valideren het SQL Server-TLS-certificaat. Als de server een private CA gebruikt, voeg het CA-certificaat toe aan de Unity Catalog-connection in plaats van validatie in productie uit te schakelen.
Schema en rijhistorie
Weet welke bronwijzigingen automatisch zijn en welke een reset vereisen
Lakeflow Connect verwerkt verschillende veelvoorkomende schemawijzigingen automatisch, maar niet iedere DDL-wijziging kan incrementeel worden toegepast. Full refreshes hebben ook gevolgen wanneer history tracking is ingeschakeld.
Nieuwe kolommen
Kan automatisch worden meegenomen, tenzij je dit uitschakelt of expliciete kolomselectie gebruikt.
Hernoemingen en typewijzigingen
Vereist een volledige refresh van de betreffende doeltabel.
SCD Type 2
Behoudt row versions tijdens normale ingestion, maar een full refresh vervangt de tabel en start de historie vanaf dat punt opnieuw.
Plan de uitzonderingspaden vóór productie.
New column
Automatic on next ingestion
Deleted column
Marked inactive in destination
Column rename
Full refresh required
Data type change
Full refresh required
Source table deleted
Destination remains until removed manually
CT / CDC retention missed
Full refresh affected tables
Snapshotvoortgang
82%
ETA 14mCDC-discoverylag
38 sec
broncommit naar gateway-event
Geüpsert
18,420
meest recente observatievenster
Verwijderd
214
meest recente observatievenster
Gateway-eventlog
snapshotvoortgang · rijen · bytes · CDC-latency · errors · liveness
Illustratieve waarden. Gebruik eventlog-metrics en reconciliatiecontroles uit uw eigen bron en pipeline.
Operations en recovery
Monitor of de data is bijgewerkt, niet alleen of de pipeline groen is
Database-ingestie kan een gezond proces rapporteren terwijl de bestemming nog achterloopt op de bron. Behandel freshness, snapshotvoortgang, retentierisico en reconciliatie als operationele KPI's.
Observeer voortgang per tabel
Gateway-eventlogs tonen counters voor rijen en bytes, snapshotvoortgang en latency van CDC-detectie.
Reconcile business keys en control totals
Vergelijk bron- en doelaantallen of high-water marks zodat stille volledigheidsproblemen zichtbaar worden.
Plan full-refresh-recovery
Gebruik auto full refresh en refresh windows bewust, vooral waar een reset bronbelasting of SCD-historie kan beïnvloeden.
Lees redenen voor voltooiing van Integrated CDC
AI zonder betrouwbare data vergroot onzekerheid in plaats van die te verkleinen.
Veelgemaakte fouten
Behandel managed ingestion niet alsof het een connector zonder ontwerpkeuzes is
Lakeflow Connect verwijdert connectorcode, maar bronconfiguratie, netwerkbereikbaarheid, retention, keys en recovery bepalen nog steeds of ingestion betrouwbaar is.
Vermijd
Enabling CDC on every keyed table by default
Betere default
Use Change Tracking for keyed tables unless CDC history is required
Vermijd
Stopping the standard ingestion gateway between loads
Betere default
Keep the gateway continuous and schedule only the ingestion pipeline
Vermijd
Sizing only for steady-state changes
Betere default
Benchmark the initial snapshot against production SQL Server load
Vermijd
Assuming schema changes are always automatic
Betere default
Plan full refreshes for renames and data type changes
Vermijd
Treating a green pipeline as proof of freshness
Betere default
Monitor lag, snapshot progress and reconciliation controls
Vermijd
Choosing Integrated CDC only because it uses one pipeline
Betere default
Accept the Beta support model deliberately before production use
Hoe Food For Analytics dit implementeert
Titan gebruikt Lakeflow Connect als SQL Server-replicatieboundary
We houden bronreplicatie gescheiden van manufacturingtransformaties. Lakeflow Connect landt eerst bronconforme SQL Server-data; Titan voegt downstream identiteiten, tijdcontext, conformance en businessdataproducten toe.
SQL Server-bron
Leg bronbewijs vast
Gebruik Change Tracking of CDC op basis van keys, historie en bronbelastingsvereisten.
Titan op Azure Databricks
Land een governed bronkopie
Lakeflow Connect beheert snapshot, incrementele wijzigingen, staging en destination streaming tables.
Downstream Titan-model
Voeg later productiecontext toe
Lakeflow-pipelines bouwen de gecontextualiseerde, governed dataproducten die door rapportage, analytics en Ask Titan worden gebruikt.
Voorbeeld uit voedingsproductie
Van een on-prem SQL Server-ERP naar governed manufacturingdata
Een voedingsproducent voert productie-, voorraad-, verkoop- en kostprijsprocessen uit in een on-prem SQL Server-ERP. Deze tabellen hebben niet allemaal dezelfde change-capturestrategie nodig.
Voorbeeldproducent
Eén ERP-database met verschillende datagedragingen
Operationele tabellen hebben vooral huidige state nodig. Geselecteerde financiële of historische tabellen hebben de werkelijke volgorde van wijzigingen nodig.
Capturestrategie
Kies per tabel
Kies niet één replicatiemethode voor de volledige ERP-database.
Productieorders
Huidige order- en productiestatus
Voorraadlots
Huidige hoeveelheid per SKU, batch en locatie
Salesorderregels
Huidige klantvraag en fulfilmentstatus
Kostenrecords
Behoud wijzigingen in de historische kostbasis
Leg alleen vast wat de downstream use case nodig heeft
Lakeflow Connect verzorgt bronreplicatie. Product-, batch-, order- en andere manufacturing-context wordt downstream in Titan toegevoegd.
Illustratief voorbeeld. De capture-methode hangt af van source keys, historievereisten en de SQL Server-configuratie.
FAQ
Veelgestelde vragen
Praktische antwoorden over SQL Server-ingestion met Databricks Lakeflow Connect.
Moet ik Change Tracking of CDC gebruiken voor SQL Server?
Databricks adviseert Change Tracking voor tabellen met een primary key omdat dit lichter is voor de bron. Gebruik CDC wanneer een tabel geen primary key heeft of wanneer je SCD Type 2-historie nodig hebt. Als zowel Change Tracking als CDC ingeschakeld zijn, gebruikt de connector Change Tracking.
Wat is het verschil tussen standaard CDC en Integrated CDC in Lakeflow Connect?
Standaard CDC gebruikt een continu draaiende classic-compute ingestion gateway plus een aparte serverless ingestion pipeline. Integrated CDC is een Beta-architectuur die extractie en toepassing combineert in één getriggerde pipeline-update.
Kan Lakeflow Connect on-premises SQL Server ingesten?
Ja. De SQL Server-connector ondersteunt on-premises bronnen wanneer de extraction compute voldoende netwerkconnectiviteit heeft, bijvoorbeeld via Azure ExpressRoute of VPN.
Kan Lakeflow Connect SCD Type 2-historie behouden?
Ja. SCD Type 2 wordt ondersteund, maar vereist SQL Server CDC op de bron. Een full refresh vervangt de targettabel en verwijdert de eerder bijgehouden rijversies.
Wat gebeurt er wanneer het SQL Server-schema verandert?
Nieuwe kolommen kunnen automatisch worden ingelezen. Verwijderde kolommen worden in de destination als inactief gemarkeerd. Kolomrenames en datatypewijzigingen vereisen een full refresh van de betrokken target table.
Kan ik de standaard ingestion gateway tussen geplande loads stoppen?
Nee. De gateway moet continu draaien zodat bronwijzigingen worden vastgelegd voordat het SQL Server change-retention-venster verloopt. Als wijzigingen verloren gaan, hebben betrokken tabellen een full refresh nodig.
Moet ik Lakeflow Connect of Lakehouse Federation gebruiken voor SQL Server?
Gebruik Lakeflow Connect wanneer Databricks een lokale Delta-copy moet onderhouden voor analytics en downstream dataproducten. Lakehouse Federation is beter geschikt voor geselecteerde zero-copy queries waarbij data in SQL Server moet blijven.
Praktische laag
Ontwerp SQL Server-ingestie rond brongedrag en recovery
We kunnen Change Tracking versus CDC, netwerkbereikbaarheid, snapshot load, retentie en uw beoogde data-productarchitectuur beoordelen voordat u Lakeflow Connect implementeert.