Grundlegende Schulung in Azure Data Factory | Everton Oliveira | Skillshare

Playback-Geschwindigkeit


1.0x


  • 0.5x
  • 0.75x
  • 1x (normal)
  • 1.25x
  • 1.5x
  • 1.75x
  • 2x

Grundlegende Schulung in Azure Data Factory

teacher avatar Everton Oliveira

Schau dir diesen Kurs und Tausende anderer Kurse an

Erhalte unbegrenzten Zugang zu allen Kursen
Lerne von Branchenführern, Ikonen und erfahrenen Experten
Wähle aus einer Vielzahl von Themen, wie Illustration, Design, Fotografie, Animation und mehr

Schau dir diesen Kurs und Tausende anderer Kurse an

Erhalte unbegrenzten Zugang zu allen Kursen
Lerne von Branchenführern, Ikonen und erfahrenen Experten
Wähle aus einer Vielzahl von Themen, wie Illustration, Design, Fotografie, Animation und mehr

Einheiten dieses Kurses

    • 1.

      Einführung

      1:40

    • 2.

      Erste Schritte

      0:43

    • 3.

      Bauteile der Azure Data Factory

      0:41

    • 4.

      Daten mit Azure Data einziehen und umsetzen

      0:56

    • 5.

      Azure Data Factory mit Databricks

      0:55

    • 6.

      Kontinuierliche Integration und kontinuierliche Lieferung (CI/CD) für (CI/CD)

      0:50

    • 7.

      Melde dich für dein Azure kostenloses Konto

      3:51

    • 8.

      Ein Budget erstellen

      4:51

    • 9.

      Wie du Azure Data Factory mit Azure Portal erstellst

      5:31

    • 10.

      Wie du Azure Data Factory mit PowerShell aufbauen

      4:51

    • 11.

      ADF Components – Linked Dienste

      5:48

    • 12.

      ADF Komponenten – Rohrleitungen

      2:59

    • 13.

      ADF Components – Datensätze

      2:47

    • 14.

      ADF Komponenten – Aktivitäten

      3:58

    • 15.

      ADF – Pipeline

      8:00

    • 16.

      ADF – Aktivitätsparameter

      6:24

    • 17.

      4.5.3 ADF Komponenten – globale Parameter

      2:37

    • 18.

      ADF Komponenten – Trigger

      6:35

    • 19.

      ADF Laufzeit

      1:26

    • 20.

      ADF – Self-Hosted Integration

      5:33

    • 21.

      ADF – Verknüpfte Self-Hosted Integration

      5:33

    • 22.

      ADF Laufzeit

      2:53

    • 23.

      Quiz – Modul 3

      0:14

    • 24.

      Wie du Daten mit der Kopierung in Azure Data Se-Gen2 einbringst

      12:58

    • 25.

      Wie du Parquet Dateien von AWS S3 in Azure SQL Datenbank kopiert

      5:16

    • 26.

      ADF Linked Service für Azure SQL-Datenbank

      2:39

    • 27.

      Wie du die Berechtigungen auf Azure SQL DB Grant

      6:09

    • 28.

      Wie du die Berechtigungen auf Azure SQL DB Grant

      8:01

    • 29.

      Parquet in den Data See und Azure SQL

      8:51

    • 30.

      ADF Ausführung

      5:09

    • 31.

      Mapping

      4:04

    • 32.

      Transformationen des Datenflüssen – mehrere Inputs und Ausgaben

      2:02

    • 33.

      Transaktionen des Schema – Schema

      2:29

    • 34.

      Transformationen des Datenflüsse – Formatieren

      0:42

    • 35.

      Transformationen des Datenflüsse – Row

      1:13

    • 36.

      5Mapping Data Flow Transformationen - Ziel

      0:39

    • 37.

      Quelltyp

      3:13

    • 38.

      Source

      1:42

    • 39.

      Aufbesserung Datenfluss Spark

      2:06

    • 40.

      Source typ

      0:55

    • 41.

      Datenschema

      1:22

    • 42.

      Last mit Partitionen optimieren

      1:35

    • 43.

      Datenvorschau

      1:35

    • 44.

      Wie du einen Mapping hinzufügst

      3:28

    • 45.

      Wie du einen a erstellst

      4:01

    • 46.

      Quiz – Modul 5

      0:14

    • 47.

      Projekt Walkthrough – Integration von Azure Data Factory mit Databricks

      1:16

    • 48.

      Wie du Azure Databricks und Importiere

      4:59

    • 49.

      Wie du Azure Databricks und Importiere

      5:23

    • 50.

      Datenübertragung in Databricks und Datenfabrik

      6:09

    • 51.

      Wie du ADF nutzst den Wandel mithilfe eines a verkörperst

      10:54

    • 52.

      Quiz – Modul 6

      0:14

    • 53.

      DevOps – Wie du eine Azure DevOps Organisation und Projekt erstellst

      1:41

    • 54.

      DevOps – Wie man ein Git-Repository in Azure DevOps erstellt

      1:19

    • 55.

      DevOps – So verwirklicht du die Arbeit von Azure DevOps Repository

      3:12

    • 56.

      DevOps – So verfasste man Azure Data Factory mit Branches

      3:18

    • 57.

      DevOps – Zusammenführung von Data Factory Code

      6:08

    • 58.

      DevOps – Wie man eine a für Data Factory in Azure DevOps erstellt

      6:34

    • 59.

      DevOps – Wie man eine Release in Azure DevOps für ADF ausgeführt

      6:17

    • 60.

      Quiz – Modul

      0:14

    • 61.

      Aufarbeitung

      0:58

  • --
  • Anfänger-Niveau
  • Fortgeschrittenes Niveau
  • Fortgeschrittenes Niveau
  • Jedes Niveau

Von der Community generiert

Das Niveau wird anhand der mehrheitlichen Meinung der Teilnehmer:innen bestimmt, die diesen Kurs bewertet haben. Bis das Feedback von mindestens 5 Teilnehmer:innen eingegangen ist, wird die Empfehlung der Kursleiter:innen angezeigt.

393

Teilnehmer:innen

--

Projekte

Über diesen Kurs

TL;DR.

Dieser Kurs führt der Azure Data Factory und wie es bei der Verarbeitung von Daten helfen kann, . Einige Themen der Data Factory für die Prüfung DP-203: Data-Engineering auf Microsoft Azure werden in diesem Kurs behandelt.

BESCHREIBUNG

Azure Data Factory ist ein cloud-basierter serverless ETL (Extrakt, Transformieren und Lasten) Service. Es bietet eine code-free intuitive Benutzeroberfläche für das Erstellen, Orchestern und Monitoring von data-driven Workflows. Mit 80 out-of-the-box

Lerne beim machen

Gemeinsam erfährst du alles was du über die Nutzung von Microsoft Azure Data Factory. Dieser Kurs bereitet dich mit praktischen Lernaktivitäten, Videos und hands-on vor, um dir beim Laufe des Kurses Wissen und praktische Erfahrung zu erwachsen.

Am Ende dieses Kurses haben die Kursteilnehmer:innen Gelegenheit, ein Projekt zu machen, das ihnen helfen wird, zu verstehen, wie ADF funktioniert, was sind die Komponenten die Komponenten sind und wie du ADF und Databricks integrieren kannst.

Student

  • Der Schüler sollte verstehen, wie ADF die Funktionen anderer Technologien orchestrates um Daten zu zu transformieren und zu analysieren
  • Der Kurs sollte erklären und verwenden können, die Komponenten von makeup
  • Der Kurs sollte zwei oder mehr Technologien mit ADF.
  • Der Kurs sollte in der Lage sein, mittlere komplexe data-driven Pipelines erstellen
  • Der Kurs sollte in der Lage sein zu entwickeln, eine a in Azure DevOps, um sie zur Nutzung von Data a

Für wen ist dieser Kurs geeignet:

  • Data
  • Data
  • Business Intelligence
  • Data
  • ETL
  • Software-Entwickler

Das wirst du lernen:

  • Einführung in die Azure Data Factory. Du wirst verstehen, wie es verwendet werden kann, um viele andere Technologien in eine immer wachsende Liste von Connectors zu integrieren.
  • Wie du eine Data Factory von Grund auf eingerichtet kannst, indem du das Azure Portal und PowerShell einstellst.
  • Aktivitäten und Komponenten, die Datenfabrik. Es enthält Pipeline, Datasets, Triggers, Linked Services und mehr.
  • Wie du mit code-free überträgt, einfügen und integrieren kannst.
  • Wie du Azure Data Factory und Databricks integrierst. Wir behandeln dir, wie du ein paar Notizbücher aus in ADF.
  • Azure Data Factory Deployment für die kontinuierliche Integration und kontinuierliche Bereitstellung (CI/CD)

Training der Data Factory Essens – Outline

  1. Einführung
  2. Einführung von Modulen
    1. Erste Schritte
    2. Bauteile der Azure Data Factory
    3. Daten mit Azure Data einziehen und umsetzen
    4. Azure Data Factory mit Databricks
    5. Kontinuierliche Integration und kontinuierliche Lieferung (CI/CD) für (CI/CD)
  3. Erste Schritte
    1. Melde dich für dein Azure kostenloses Konto
    2. Ein Budget erstellen
    3. Wie du Azure Data Factory einstellst
      1. Azure-Portal
      2. Power Shell
  4. Azure Data Factory Komponenten
    1. Linked Dienste
    2. Rohrleitungen
    3. Datasets
    4. Data
    5. Parameter
      1. Pipeline
      2. Aktivitätsparameter
      3. Globale Parameter
    6. Trigger
    7. Integrationszeiten (IR)
      1. Azure IR
      2. Self-hosted IR
      3. Verknüpftes IR
      4. Azure-SSIS
    8. Quiz
  5. Daten einfügen und umsetzen
    1. Daten mit der Copy in den Data Lake Store Gen2
      1. Wie du Parquet Dateien von AWS S3 in Azure SQL Datenbank kopiert
        1. ADF Linked Service für Azure SQL-Datenbank
        2. Wie du die Berechtigungen auf Azure SQL DB Grant
        3. Parquet in S3 in Azure SQL-Datenbank einfügen
      2. Parquet in den Data See und Azure SQL Datenbank (intro)
        1. Parquet in den Data See und Azure SQL
      3. ADF Ausführung
    2. Daten mit dem Mapping umsetzen
      1. Mapping
      2. Transformationen in Abbildung
        1. Mehrere Eingang/Ausgaben
        2. Schema
        3. Formatieren
        4. Row
        5. Ziel
      3. Quelltext einen a hinzufügen
        1. Quelltyp
        2. Source
        3. Aufbesserung Datenfluss Spark
        4. Source typ
        5. Datenschema
        6. Last mit Partitionen optimieren
        7. Datenvorschau
      4. Wie du einen Mapping hinzufügst
      5. Wie du einen a erstellst
    3. Quiz
  6. Azure Data Factory mit Databricks
    1. Projektdurchführung
    2. Wie du Azure Databricks und Importiere
    3. Wie du Daten mit Databricks und der Datenfabrik übertragst
    4. Datenübertragung in Databricks und Datenfabrik
    5. Wie du ADF nutzst den Wandel mithilfe eines a verkörperst
    6. Quiz
  7. Kontinuierliche Integration und kontinuierliche Lieferung (CI/CD) für (CI/CD)
    1. Wie du eine Azure DevOps Organisation und Projekt erstellst
    2. Wie du ein Git-Repository in Azure DevOps erstellst
    3. Wie du Datenfabrik mit Azure DevOps Repository verlinken kannst
    4. Wie du Azure Data Factory mit Branches veröffentlichen
      1. Factory
      2. Merging zur Collaboration
    5. Wie du eine a für die Data in Azure DevOps erstellst
      1. Wie du eine a für Data Factory in Azure DevOps erstellst
      2. Wie du eine Release in Azure DevOps für ADF erstellst
    6. Quiz

Triff deine:n Kursleiter:in

Teacher Profile Image

Everton Oliveira

Kursleiter:in
Level: Beginner

Kursbewertung

Erwartungen erfüllt?
    Voll und ganz!
  • 0%
  • Ja
  • 0%
  • Teils teils
  • 0%
  • Eher nicht
  • 0%

Warum lohnt sich eine Mitgliedschaft bei Skillshare?

Nimm an prämierten Skillshare Original-Kursen teil

Jeder Kurs setzt sich aus kurzen Einheiten und praktischen Übungsprojekten zusammen

Mit deiner Mitgliedschaft unterstützt du die Kursleiter:innen auf Skillshare

Lerne von überall aus

Ob auf dem Weg zur Arbeit, zur Uni oder im Flieger - streame oder lade Kurse herunter mit der Skillshare-App und lerne, wo auch immer du möchtest.

Transkripte

1. Einführung: Hallo liebe Freunde, und willkommen zum Microsoft Azure Data Factory Essentials Training. Mein Name ist durchschnittlich für ein Ion und Microsoft Certified Solutions, die ich berührt habe, und ich bin Microsoft Certified Trainer. Dieser Kurs ist für Anfänger. Sie benötigen keine Thetas-Erfahrung in Azure Data Factory UI beginnen, den Anfang zu bearbeiten , und wir werden uns Schritt für Schritt durch sie arbeiten. Wenn Sie planen, den Microsoft-Datentechniker in Urlaub zu bringen, ist besprechen perfekt für Sie. Da wir einige der Themen, die im Lehrplan der Prüfung behandelt werden, abdecken werden. Sie erfahren alle Grundlagen der Data Factory und wie es bei der Batch-Verarbeitung helfen kann und wie es sich mit der Mini-Audit-Technologie mit allen verfügbaren Anschlüssen verbindet. Nun, wir werden auch Aktivitäten sowie die Komponenten untersuchen , aus denen Azure Data Factory besteht. Zum Beispiel Pipelines, Datasets, Trigger, verknüpfte Services und mehr. Zusätzlich zu der Kompetenzwerden wir die Transformation, werden wir die Transformation, Aufnahme und Integration des Theta-Codebaums mithilfe von Mapping-Datenflüssen erläutern. Es wird ein kleines Projekt geben. Wir werden Azure Data Factory es mit Databricks by Rooney integrieren und fühlen keine Leute aus ADF. Wie cool ist das? Zum Schluss lernen Sie, wie Sie alle Deploys bereitstellen, die während dieses Kurses mit Azure DevOps, Continuous Integration und Continuous Deployment, aka CI-CD lernen . Nun, ich hoffe, Sie bald in diesem Kurs zu sehen, und danke, dass Sie zugesehen haben. 2. Erste Schritte: Hallo, alle. Bevor wir uns die Hände schmutzig machen, werde ich Ihnen einen kleinen Spaziergang durch die Module geben , die wir während dieses Kurses sehen werden. Erstes Modul, wir haben es gestartet. Innerhalb dieses Moduls haben wir ein kostenloses Azure-Konto gesendet. So werden wir sehen, wie wir den größten Teil des Azure-Kontos nutzen können. Wir werden einen Blick werfen. Alle Dienste, die wir kostenlos nutzen können und die Credits, die uns zur Verfügung stehen. Wir werden ein Budget aufstellen, damit wir sicherstellen können, dass unsere freien Karotten, ich immer unter Kontrolle bin. Außerdem werden wir sehen, wie wir eine Azure Data Factory über das Portal und die PowerShell einrichten können . Siehe in der nächsten Lektion. 3. Bauteile der Azure Data Factory: Willkommen beim zweiten Modul des Essentials-Kurses für Azure Data Factory. In diesem Modul werden wir sehen, sind die grundlegenden Elemente, die das Ökosystem der Datenfabrik zusammensetzen. Wir werden durch Linked Services, Pipelines, Datensätze in den verschiedenen Aktivitäten, die uns in ADF zur Verfügung stehen, gehen . Außerdem werden wir Dinge sehen, wie man Objekte wiederverwendet, indem man Menschenmengen erstellt. Wurden auch tief tauchen in die verfügbaren Trigger, um Pipeline Ausführungen schattieren und wie wir jede von ihnen verwenden können, ist Modul voll von guten Inhalten. Und hier starten wir unsere Reise von 0 nach hier in ADF. Und es kann kaum erwarten, dass wir loslegen. 4. Daten mit Azure Data einziehen und umsetzen: Hallo an alle, die Daten mit Azure Data Factory aufnehmen und transformieren. In diesem Modul werden wir unsere Hände schmutzig machen und praktizieren alles, was wir aus dem vorherigen Modul gelernt haben, wo wir wichtige ADF-Komponenten verwenden, um an sehr gebräuchlichen Anwendungsfall zu arbeiten. Zum Beispiel, wie Daten mithilfe der Herzaktivität in ADF in Azure Data Lake Gen2 und wie wir Daten von Amazon S3 in Azure SQL-Datenbanken übertragen können. Wir werden, wir werden diese Transfers Schritt für Schritt einrichten. Im zweiten Teil dieses Moduls werden wir mit dem Mapping von Datenflüssen arbeiten. Mapping Datenflüsse sind ein leistungsfähiges Werkzeug , dem wir einen Spark-Cluster ausführen können, ohne eine einzige Codezeile zu schreiben, werden wir zu jeder einzelnen Transformation in der Zuordnung von Datenflüssen zur Verfügung zu gehen. Zum Beispiel verbindet abgeleitete Klassenzimmer, Suchoperationen und so weiter und so weiter. Danke fürs Zuschauen. 5. Azure Data Factory mit Databricks: Hallo, liebe Freunde. Dieses Modul zeigt, wie die Fabrik es Technikern ermöglichen konnte, ETL-Pipelines in Azure Databricks zu integrieren und ApachesPark für die Transformation und den Prozentsatz von Daten maßstabsgetreu zu nutzen . Wir spielen das im Rollenspiel. Wir sind Teil des Analytics-Teams, das schwer zu berichten war über die Gesamtheit einer Reihe von Verbrechen in mehreren Städten in den USA. Und wir werden sehen, wie wir einen Azure-Datenbank-Suchraum aus dem Portal bereitstellen können , wurde der Arbeitsbereich erstellt. Anschließend erstellen wir einen Apache-Cluster, gefolgt von einigen Notebooks, die uns helfen, mit den Daten zu arbeiten, die wir benötigen. Und dann werden wir die Notebooks an den Cluster anhängen. Auf diese Weise können wir alle Notebooks direkt von Data Factory aus ausführen. Seien Sie versichert, dass dies ein herausfordernder Weg sein wird. Diese Ansicht genoss die Monitore. Ich habe dich bald gesehen. Danke fürs Zuschauen. 6. Kontinuierliche Integration und kontinuierliche Lieferung (CI/CD) für (CI/CD): Hallo, Freunde. Unser letztes Modul, wenn die Augen und den Kuchen, werden wir sehen, was erforderlich ist, um eine Azure DevOps-Pipeline einzurichten , dass wir als kontinuierliche Integration und kontinuierliche Bereitstellung arbeiten , auch bekannt als CISD für Data Factory. Wir werden eine Azure DevOps-Organisation aus der Crowd-App erstellen, die das Erstellen eines positiven Handels, Versionierung von EHR Data Factory würde Zweige und das Verständnis, wie sie Workflow-Wörter für Data Factory freigegeben haben wird auch sehen, wie wir eine CICD-Pipeline in Azure DevOps erstellen können, wie cool ist das? Hier lernen wir, wie man all die coolen Sachen, die wir während dieses Kurses gelernt haben, und eine höhere Umgebung, IE-Produktion, packt . Nun, wir sehen uns im nächsten Modul „Erste Schritte“. 7. Melde dich für dein Azure kostenloses Konto: Hi, wir werden zu vielen Demonstrationen während unseres Fluchs gehen. Und ich würde Ihnen empfehlen, diesen Weg zu folgen. Sie können sicherstellen, dass Sie in der Praxis erfahren, was wir gesehen haben und wie Sie empfehlen, ein kostenloses Microsoft Azure-Konto zu erstellen. Um dies zu tun, können Sie auf Google suchen und dann haben wir den ersten Link hier. Lasst uns darauf klicken. Hier können wir eine Vorstellung davon haben, wie es funktioniert. So erhalten wir $200 Credits, um als Ihre Dienste für 30 Tage zu erkunden. Wenn Sie aus irgendeinem Grund verwenden, alle Ihre Credits vor den 30 Tagen, werden alle Ihre Dienste abgeschaltet werden. Oder wenn Sie das Guthaben von 200 USD für den Zeitraum von 30 Tagen nicht verwenden, verlieren Sie den Rest. Sie können es nicht in Molaren tragen. Sie erhalten jedoch eine Menge beliebter Dienste für 12 Monate, was bedeutet, dass selbst wenn Sie alle Ihre $200 aufbrauchen, Sie immer noch Ihr Konto für 12 Monate haben können. Oh, es sind kostenlose Dienste. Wenn wir also weiter unten scrollen, können wir eine Vorstellung von anderen Diensten haben, die wir in den ersten 12 Monaten nutzen können. Also im Grunde können wir zu virtuellen Maschinen der kleinen Größe kommen. So können wir auch andere Dienste wie Festplatten verwenden, um Ihre virtuellen Maschinen anzuhängen. Blob Storage Load Balancer, wenn wir Load Balancer, Archivspeicher und vieles mehr studieren . Sie erhalten auch immer kostenlose Dienste. Auf der Oberseite der 12 Monate. Sie haben immer wieder Resurfaces, zum Beispiel Event Grid, DevTest Labs und so weiter und so weiter. Wenn Sie sich alle kostenlosen Oberflächenprodukte ansehen, können Sie hier auf diesen Button klicken und dann sollten Sie in der Lage sein, die vollständige Liste zu sehen. Lassen Sie uns jetzt vermasseln und klicken Sie auf Freies Jahr starten, um mit der Erstellung unseres Kontos zu beginnen. Also von hier aus haben Sie ein paar Möglichkeiten. Sie müssen über ein Microsoft-Konto verfügen, um ein kostenloses Azure-Konto erstellen zu können. Wenn Sie keines haben, können Sie jetzt von hier aus einen erstellen. Oder wenn Sie ein GitHub-Konto haben und Sie verwenden möchten, oder ich könnte Konten haben, die Sie auch verwenden können und dann haben Sie hier auch andere Optionen. Ich habe bereits ein bestehendes Konto und wir werden sehen, wie es diesen Prozess durchlaufen kann. Okay, nun lasst uns auf Weiter klicken. Sobald Sie ihr Passwort eingegeben haben, wird es Sie auf die Seite weiterleiten, auf der Sie sich anmelden möchten. Es gibt also nur wenige Dinge, die Sie hier ausfüllen müssen. Zunächst müssen Sie den Details zustimmen, die sie Ihnen zeigen, wie Datenschutzerklärungen , Softwareinformationen usw. Wie Sie müssen, um hier zu nehmen, wenn man, Ich bekomme E-Mails von Microsoft über Angebote, ich werde das in diesem Moment nicht tun. Hier können Sie eine Zusammenfassung der Vorteile haben, die Sie erhalten. Wie Sie Szenen und Irland sehen können, hat es direkt zu meiner aktuellen. Also, Eileen, 70-Jährige, keine $100. Dann können wir auf Weiter klicken. Dann müssen Sie eine Telefonnummer angeben. Microsoft wird Ihnen also eine SMS schicken. Sie können entweder eine Steuer erhalten oder einen Anruf erhalten. Es liegt wirklich an Ihnen, also werde ich Steuern für mich auswählen. Sobald Sie also Ihren Bestätigungscode angegeben haben, müssen Sie eine Kreditkarte angeben. Microsoft bestätigt, dass Sie nach den 30 Tagen nicht in Rechnung gestellt werden. Sie nehmen kein Geld von Ihren Kreditkarten. Dies dient nur zu Validierungszwecken. Sobald die 30 Tage beendet sind, werden Sie gefragt, ob Sie mit einem nutzungsbasierten Modell fortfahren möchten. An dieser Stelle habe ich bereits den Text bekommen, bestätigt den Text von der vorherigen Seite. Jetzt kann ich den Ort sehen, an dem ich Informationen von einem Kreditabsturz bekam. Ich werde nicht weiter von hier gehen, weil ich bereits mein Konto hatte. Sobald Sie mit dieser Option fortfahren, sollten Sie in der Lage sein, mit Ihrem neuen Konto auf das Portal zuzugreifen. So greifen Sie auf das Portal zu. Die Homepage ist Portal azure.com. Dies wird Sie auf die Hauptseite des Portals umleiten. Dann haben Sie hier eine Reihe von Dienstleistungen. Wir werden alle Schritte durchlaufen, die während dieses Kurses verwendet werden. Und bleib dran und bis bald. 8. Ein Budget erstellen: Unsere Freunde, in unserer vorherigen Lektion haben wir ein kostenloses Azure-Konto erstellt, um Cloud-Dienste kostenlos zu nutzen. In dieser Lektion werden wir einen Blick darauf werfen, wie wir ein Budget für unser Abonnement einrichten können , um unsere Credits unter Kontrolle zu haben. ein Budget vorhanden ist, können wir benachrichtigt werden, wenn die Protokolle, unser Abonnement oder eine Ressourcengruppe den Schwellenwert überschreitet, den der Baum definiert. Während dieses Kurses werden wir uns auf die BIA-Fabrik konzentrieren, die nicht sehr bald andere Credits verbrauchen sollte. Aber um jede Überraschung zu vermeiden, Lassen Sie uns ein Budget einrichten, nur damit wir sicherstellen können, dass alles in der Kontrolle ist. Wenn wir in das Suchfeld gehen und nach Kostenmanagement suchen, haben wir hier eine Füllung Optionen. Im linken Fensterbereich. Lassen Sie uns auf Kostenmanagement klicken. Und auch hier auf der linken Seite haben wir. Hier fangen wir an, unsere Budgets zu definieren. So können wir mehr als ein Byte haben und den Bereich für diesen Punkt definieren , dass wir das Abonnement standardmäßig haben, wahrscheinlich werden Sie Ihr Standardabonnement hier haben. Klicken wir auf Hinzufügen, um einen neuen Bucket hinzuzufügen. So können Sie den Umfang des Budgetschritts definieren, den Sie erstellen möchten. Und hier können Sie Futures, zum Beispiel, wenn wir ein Budget für eine bestimmte Ressourcengruppe erstellen wollen, wäre es auch möglich. Daher ist es wichtig, dass wir einen eindeutigen Namen für unser Budget definieren. Und dieser eindeutige Name ist in unserem Abonnement. Sie können also nicht zwei Boote mit dem gleichen Namen haben. Dann haben wir die Reset-Periode. Wir haben zwei Typen. Wir haben Kalendermonate und Rechnungen. Hier haben wir das Erstellungsdatum. Das Erstellungsdatum ist, wenn wir unser Budget erstellen. Und für den nächsten Monat beginnt unser Strand am selben Tag. Hier haben Sie eine kleine Beschreibung darüber, dass auch und Ablaufdatum für diese Budgets. So können Sie es wie 2030 ein Jahr setzen, wenn Sie möchten. Ich werde nur ein Budget aufstellen. Und hier werde ich bei monatlichen Kalendermonaten bleiben. Ich beginne ab dem ersten Juli und bis zum Ablaufdatum, ich werde gehen, wie es ist. Und hier ist die Pilotstudie, die ich einrichten möchte. Stellen Sie sich vor, wir haben $200 Kredit. Das ist unsere Gleichung, beginnt die maximale Menge an Geld, die wir ausgeben können. Und hier haben wir auch einige Prognosen basierend auf Ihrer vorherigen Nutzung. Also lassen Sie uns einfach mit 200 in diesem Beispiel bleiben, in meinem Fall wäre ein 175 Jahre. Und wir können als Nächstes gehen. Dies ist, wo wir unsere Bedingungen definieren, sind Bedingungen sind im Grunde die Schwelle für unsere Budgets. Wir können mehr als einen haben. Und jedes Mal, wenn unsere Kosten über die Schwelle dieses Budgets hinausgehen, werden wir nicht kämpfen. In Ordnung, also holen wir uns die tatsächlichen Kosten. Und dann haben wir hier einen Prozentsatz für den Haushalt. Also werde ich benachrichtigt werden, wenn wir erreichen und das Datum an uns automatisch zurückgekehrt 87 Jahr. Und hier können Sie sehen, dass dieser kleine Punkt die erste Schwelle ist. Jetzt werde ich eine zweite einrichten und eine Benachrichtigung erhalten, wenn wir 80 Prozent bestehen, das ist ein 140 Jahr. Also hier haben wir die zweite Zeile hier, das Maximum. Jetzt müssen wir eine E-Mail-Adresse angeben, damit wir benachrichtigt werden können. Es gibt zwei Möglichkeiten, benachrichtigt zu werden. Eins ist, indem Sie eine Aktionsgruppe einrichten. Wir werden uns das nicht ansehen. Und auch wir haben die Alarmempfänger, was genug ist. So können Sie einfach Ihre E-Mail-Adresse hier eingeben und Sie erhalten eine E-Mail von Microsoft, wenn eine der Schwellenwerte hier erreicht ist. In Ordnung, also würde ich nur als Beispiel, ich werde nur Test machen. Ich werde bei der Standardeinstellung bleiben und die Erstellung treffen. Das war's. So haben wir unsere Spannung erstellt und wir werden benachrichtigt , wenn wir unsere für diese Budgets definierte Schwelle erreichen. Also hier haben wir einen kleinen Fortschrittsbalken. Wenn Sie mit Ihrer Spannung fortschreiten, beginnen Sie mehr Geld auszugeben. Siehst du diese kleine Bar hier, sie fängt an sich zu bewegen. Lassen Sie uns hier klicken. Dies ist nur eine Zusammenfassung unseres Haushalts. Wir haben zwei Schwellen. Das Ablaufdatum im Alter des Patienten, unser Umfang, und die Männchen, dass wir die Benachrichtigungen erhalten. Also, das war's für jetzt Jungs. Wir haben jetzt einen Seelenfrieden. Du wirst nicht unser ganzes Geld am Montag ausgeben. Und wenn Sie irgendwelche Fragen haben, lassen Sie es mich wissen, senden Sie mir eine E-Mail oder Post in den Kommentaren und ich werde Sie so schnell wie möglich kontaktieren. Wir sehen uns in der nächsten Lektion. Danke fürs Zuschauen. 9. Wie du Azure Data Factory mit Azure Portal erstellst: Hallo Leute. Da wir die meiste Zeit verbringen werden, können wir Datenfabriken lesen. Um damit zu beginnen, unsere Instanz von Data Factory zu erstellen, werden wir sehen, wie wir eine Fabrik mit zwei verschiedenen Methoden erstellen können. Die erste Methode wird Spaß Portal sein, und dann die zweite Methode werden wir PowerShell verwenden. Ich werde alle Codes zur Verfügung stellen, und das Dokument wird aus den Unterrichtsressourcen verfügbar sein. Also lasst uns anfangen. Hier haben wir das Portal, das ist die Hauptseite. Und wir können mit der Eingabe von Datenfabriken beginnen. Und wir werden hier die Homepage ihrer Fabrik sehen. Also lasst uns auf Erstellen klicken. Und hier haben wir ein paar Optionen zum Ausfüllen. Und wir werden sie Schritt für Schritt durchgehen. Wie Sie sehen können, haben wir hier oben ein paar Registerkarten. Microsoft verwendet eine Konfiguration nach Registerkarten, während Sie vorwärts bewegen oder Sie sich durch die Schritte bewegen, um Oberflächen zu erstellen oder vorhandene Dienste zu öffnen, haben Sie immer Registerkarten. Lassen Sie uns also beginnen, indem Sie unser Abonnement auswählen. Ich habe nur einen zur Verfügung. Und hier haben wir eine Ressourcengruppe. Eine Ressourcengruppe ist also sehr viel eine Sammlung von Ressourcen, die normalerweise mit dem gleichen Lebenszyklus erstellt werden. Zum Beispiel würde eine virtuelle Maschine Schreibtische und Netzwerkkarten haben. Alles, was für Ubuntu-Maschine benötigt wird, sollte normalerweise innerhalb der gleichen Ressourcengruppe platziert werden. Lassen Sie uns also eine neue Ressourcengruppe für unsere Data Factory erstellen und wir können sie so nennen, wie Sie wollen. Es ist kein global eindeutiger Name erforderlich. Also werde ich auf Erstellen klicken. Und ich würde nur meine pdf, dash RG Ressourcengruppe eingeben . Klicken Sie also auf OK. In der Region wird Ihre Ressource physisch bereitgestellt. In der Regel wird empfohlen, eine Ressource in der Nähe Ihres physischen Standorts zu erstellen. In meinem Fall werde ich Nordeuropa tippen. Also muss ich meiner Ressource einen global eindeutigen Namen geben. Dies liegt daran, dass Sie, wenn Sie auf eine Factory zugreifen, auf eine DNS-Domäne zugreifen, was bedeutet, dass sie global eindeutig sein muss. Ich würde hier nur etwas Zufälliges eingeben. Also nur für uns, um voranzukommen. Und dann haben wir die Möglichkeit, eine Million zu eins auszuwählen. So ist man nur für Kompatibilitätszwecke. Wir sollten immer nehmen, was sie bereit sind zu bewegen, und klicken Sie auf Messgerätekonfiguration. Wir werden durchmachen, was Angst hat und wie es sich integriert. Während relative Fabrik später auf diesen Kurven, in diesem Moment, werden wir nur bleiben beenden konfigurieren, bekommt später. Dann haben wir eine Vernetzung. Hier haben Sie also zwei Möglichkeiten, die selbstgehostete Integrationslaufzeit mit Ihrer Data Factory über einen privaten oder öffentlichen Endpunkt zuverbinden die selbstgehostete Integrationslaufzeit mit Ihrer Data Factory über einen privaten oder öffentlichen Endpunkt zu . Wir werden während Ihrer Aufzeichnungen selbst gehostete Integrationszeit durchlaufen. Lassen Sie uns republikanischen Punkt für jetzt. Und wir möchten das verwaltete virtuelle Netzwerk nicht für die externe Reserve-Integrationslaufzeit aktivieren , dies ist mehr erforderlich, wenn Sie privat auf Ihre Ressourcen zugreifen möchten. Es gibt eine, es gibt einige Konfigurationen, die wir an dieser Stelle nicht verwenden möchten. Also werde ich diese Option nicht kleben. Gehen wir zum Fortgeschrittenen. Hier haben wir die Möglichkeit, Data Factory-Ressourcen mit einem verwalteten Schlüssel zu verschlüsseln. Das bedeutet, dass Sie Ihren eigenen Schlüssel mitbringen, Ihren Schlüssel im Schlüsseltresor platzieren und dann mit diesem Schlüssel Ihre Ressourcen verschlüsseln können. Allerdings standardmäßig, dass eine Fabrik unsere verschlüsselt Ihre Daten im Ruhezustand. Zum Beispiel, wenn es Daten für Datenbewegungen zwischengespeichert oder wenn Sie Ihre verknüpften Dienste erstellen, Iterator standardmäßig verschlüsselt. Wenn Sie auf diese Option klicken, müssen Sie die Adresse Ihres Schlüssels angeben und es wird doppelt verschlüsselt. Und der des verwalteten Azure-Schlüssels haben Sie auch den vom Kunden verwalteten Schlüssel. Da wir an dieser Stelle keinen vom Kunden verwalteten Schlüssel haben, lassen Sie uns einfach bewegen, ohne dieses Kontrollkästchen zu aktivieren. Hier haben wir die Möglichkeit, ein Tags zu erstellen, wenn Sie möchten, wenn Sie zum Beispiel eine Kostenstelle für Ihre Ressourcen oder so etwas zuweisen, wir wählen diese, wir haben im Moment keine Tags. Wir lassen das einfach leer. Und dann haben wir endlich den Ort, an dem wir unsere Konfigurationen offenbaren. Wie Sie sehen können, ist es ziemlich einfach, eine Data Factory zu erstellen, um eine Instanz von Artifactory verfügbar zu machen. Es ist ganz einfach. Wir haben hier nicht viele Konfigurationen zu erledigen. Also lasst uns einfach auf Erstellen klicken und unser erstes Artifactory erstellen. Erstellen. Eine Ressource wurde erfolgreich erstellt. Lassen Sie uns zur Ressource gehen, indem Sie auf diese Schaltfläche klicken. Und hier haben wir die Homepage, dass eine Fabrik, die Instanz, die wir gerade erstellt haben. Hier können Sie also nur Symmetriken sehen. Wir haben nicht die ganze Menge hier. So wird Data Factory wirklich vom Autor Inventar zugegriffen. Dies ist der Ort, an dem Sie ändern und überwachen werden sind alle Ihre Pipelines und Datenflüsse, richtig? Lassen Sie uns also auf Auto klicken und überwachen. Cool. Das ist die Homepage von Data Factory. Wir werden uns auf alle Möglichkeiten eingehen, die wir hier haben. Und wir werden auch hier viel Zeit verbringen. Bleiben Sie dran, und lassen Sie uns sehen, wie wir die gleiche Datenfabrik aus PowerShell erstellen können. Bis bald. 10. Wie du Azure Data Factory mit PowerShell aufbauen: Hallo Leute und willkommen zu einer anderen Lektion. In dieser Lektion werden wir sehen, wie wir eine Data Factory mit PowerShell erstellen können. In unserer letzten Lektion haben wir gesehen, wie wir eine Data Factory aus dem Portal erstellen können. Also lasst uns wieder nach Data Factories suchen. Und das ist die Data Factory, die wir gerade erstellt haben. Lassen Sie uns nun sehen, wie wir mit PowerShell erstellen können. Gehen wir zurück zur Homepage. Und hier in der oberen Bar haben wir Cloud Shell. Lasst uns darauf klicken. Cloud Shell ist ein großartiges Tool, wenn Sie Ihre Azure-Ressourcen programmgesteuert verwalten möchten . So haben Sie die Möglichkeit, bash aus Linux oder PowerShell zu wählen. Hier, was es tut, stellt Azure Ihnen einen Container hinter den Kulissen mit einem nicht gepatchten Speicher zur Verfügung. Ist, Speicher ist ephemer, was bedeutet, wenn Sie mit Ihren Kreationen oder den Dingen, an denen Sie arbeiten, fertig sind werden alle Ihre Daten gelöscht. Hier haben Sie also Ihre Möglichkeiten, Ihre Daten zu erkunden. Zum Beispiel können Sie Schriftarten, Textgröße ändern. Sie können Dateien hochladen und Dateien herunterladen. Sie können auch hier klicken, und es wird Sie auf eine Seite umleiten, auf die Sie zugreifen können, die PowerShell oder die Cloud Shell im Vollbildmodus. Ich sage hier, Sie haben den Redakteur, was ziemlich cool ist. So können Sie und tatsächlich Dateien direkt aus dem Jahr und gespeicherte Dateien bearbeiten. Es sieht also so aus, als würde der Computer für Sie auf Ihre Azure-Umgebung zugreifen. Also lassen Sie uns von hier aus arbeiten und unsere Data Factory erstellen. Ich werde hier meinen VS-Code mit den erforderlichen Befehlen hochziehen, die wir ausführen müssen. Also habe ich hier drei Variablen eingerichtet, und das ist der Data Factory-Name, der Ressourcengruppenname und der Ort, an dem wir unsere Data Factory bereitstellen werden. Wie Sie sehen können, ist dies den Optionen, die wir vom Portal hatten, ziemlich ähnlich. Hier. In diesem Schritt werden wir mit den Werten zu erstellen, die den Variablen zugeordnet sind, jede Ressourcengruppe. Schließlich werden wir unsere Data Factory V2 innerhalb der Ressourcengruppe erstellen, die wir im ersten Schritt hier erstellen. Ok? Also wieder, wir müssen einen eindeutigen Schlüsselnamen angeben, Charlie Data Factory. Also habe ich hier nur einen zufälligen Namen eingegeben. Dann wird mein Ressourcengruppenname mein sein, könnte als Ressourcengruppenstandort innerhalb unseres Theorem sein. Okay, ich werde diese Datei hier zur Verfügung stellen, damit ihr euch herunterladen könnt. Und dann kannst du es von deiner Hand versuchen. Also lasst es uns hier kopieren. Dann gehen wir zurück zum Portal. Jetzt fügen wir das hier ein und drücken dann die Eingabetaste. Wir haben also alle Werte zugeordnet. Wenn eine Überprüfung, können Sie einfach eine der Variablen hier eingeben, so dass unsere Factory ist, Sie können sehen, dass es den Wert zurückgibt, den wir zugewiesen. Jetzt als zweiter Schritt müssen wir unsere Ressourcengruppe erstellen. Also lasst uns das kopieren. Wenn Sie eine Kopie Kommentar wollen, ist es auch in Ordnung. Kehren wir zu der Teilsitzung zurück, die hier gegenübersteht. Und automatisch fügt hier teilweise eine neue Linie wegen der Neigung hinzu. Also lassen Sie uns sehen, um zu betreten, die Ressourcengruppe wurde erstellt. Wie Sie sehen können, ist es ziemlich schnell. Und schließlich müssen wir unsere Data Factory erstellen. Lassen Sie uns das nochmal kopieren. Lasst uns hier Platz einräumen. Drücken Sie die Eingabetaste Und dann geht es um die Schaffung unserer Datenfabrik. Die Fabrik wurde angelegt. Gehen wir zurück zum Portal, zur Homepage und sehen Sie die Ressourcengruppe und auch die Data Factory. Also kommen wir zurück Stück, um diesen anderen Abschnitt hier zu haben, wir können dies minimieren. Dann suchen wir nach Data Factories. Da ich bereits von meinen Forschungsdiensten habe, werde ich darauf klicken. Und wenn Sie auf diese Liste achten, manchmal das Treffen, habe ich nicht die Ressource, die ich gerade erstellt habe. Es ist nur, weil es manchmal nicht sofort ist. Es dauert eine kleine Sekunde, um zu aktualisieren, wenn Sie die Ressource über die API oder PowerShell erstellen. Lasst uns das auffrischen. Und lassen Sie uns den ADF-Namen bestätigen, den wir gerade erstellt haben. Lassen Sie uns auskopieren und dann hier hineinlegen. So ist die Ressource von hier aus sichtbar. Und wenn Sie sich erinnern, ist dies die Ressourcengruppe, die wir gerade erstellt haben. Wenn wir darauf klicken, können wir die Ressource auch aus der Ressourcengruppen-Ansicht sehen und bestätigen, dass sie erfolgreich erstellt wurde. Geh. Jetzt haben wir das, was für uns erforderlich ist, um mit unseren Kurven C abgestimmt und wir sehen uns in der nächsten Lektion. 11. ADF Components – Linked Dienste: Willkommen zu einer anderen Lektion. In dieser Lektion werden wir sehen, wie wir einen verknüpften Dienst in Azure Data Factory erstellen können. Linkerd-Dienst ist ein Schlüsselelement für Story-daten-gesteuerte Workflows, EDF. Es kann verknüpfte Dienste zuordnen, würde Verbindungszeichenfolgen mit Anwendungssoftware verwenden, wo Sie bestimmte Informationen angeben müssen, um eine Verbindung mit einer Datenquelle herzustellen. Zum Beispiel die Adresse der Datenquelle, die Anmeldeinformationen und vor allem, was ist der Treiber für diese Verbindung? Eine SQL Server-Datenbank erfordert einen bestimmten Treiber. Eine NoSQL-Datenbank würde ein anderes Laufwerk benötigen. eine API ist ein weiterer Satz von Brown erforderlich, um die Daten abzurufen oder zu senden. Verknüpfte Dienste in ADF sind ziemlich gleich. Es bietet eine Vielzahl von Anschlüssen, die aus der Box alle erforderlichen Parameter haben, mit denen Sie sich mit den verschiedenen Diensten verbinden können. Und als Voraussetzung für diese Lektion erstellen wir einen Data Lake Storage Gen2. Und auch wir werden das eine Fabrik und den Datensee verknüpfen. Bleiben Sie dran. Ich kenne das Portal. Öffnen wir ADF, um mit verknüpften Diensten zu arbeiten. Und wir werden nur die Fabriken in das Suchfeld eingeben. Und lassen Sie uns den ADF verwenden, den wir zuvor erstellt haben. Klicken Sie auf Ultra und Monitor. Und warten wir, bis es die Seite lädt. Jetzt sind wir auf der Homepage. Gehen wir zum Verwalten auf der linken Seite. Und Sie können sehen, dass der Link am Service die allererste Option im linken Bereich ist. So haben Sie den authentischen kreativen Klick auf neuen oder kreativen Linked Service. Lasst uns darauf klicken. Wie wir sehen können, erscheint es eine große Anzahl von verschiedenen Arten von verknüpften Diensten für Sie zur Auswahl. Im Moment dieser Aufnahme gibt es über 80 verschiedene Arten von verknüpften Diensten. Und wie Sie sehen können, haben Sie native Azure-Dienste sowie Dienste von Drittanbietern wie SAP, hana, Salesforce, sogar Shopify. Für unser Experiment werden wir Data Lake Gen2 verwenden. Da es sich um eine Initiative als Service handelt. Wie Sie sehen können, gibt es wenige Optionen, die Sie eingeben müssen, wie Namensbeschreibung, Integration, Runtime, welche Art von Authentifizierung, die Sie verwenden möchten, und wo sich Ihre Dienste befinden. Da ich keine Speicherkonten erstellt habe, ja. Lassen Sie uns eine erstellen und sehen, wie es funktioniert. Kommen wir zurück zum Portal. Auf das Suchfeld. Ich werde nach Speicherkonten suchen. Und sollte es die erste Option sein? Lassen Sie uns auf Neu klicken. Ich werde nicht auf die verschiedenen Details gehen, die das Speicherkonto zusammenstellen weil unser Ziel hier nur ist, ein Speicherkonto zu erstellen und EDF mit ihm zu verbinden. Ich wähle mein aktuelles Abonnement aus. Ich wähle die Ressourcengruppe aus, die wir zuvor erstellt haben. Ich werde ihm einen Namen geben. Es wird sein, ich werde bei Nordeuropa bleiben, Region. Und Ihre Optionen werden standardmäßig für mich sein und ich überspringen alle diese Optionen, Netzwerke, Datenschutz, und ich werde zu fortgeschritten gehen. Also unter Data Lake Gen2, werde ich sagen, aktivieren. Dies hat bestätigt, dass ich einen Data Lake möchte, also werde ich Tags überspringen und dann überprüfen und erstellen. Cool. Jetzt haben wir unser Speicherkonto erstellt. Also lasst uns zur Ressource gehen. Und es gibt nur eine Sache, die wir hier tun müssen, die ADF berechtigt ist, auf die Daten zuzugreifen, die auf dieser Datenschicht gespeichert werden. Andernfalls können wir die verlinkten Dienste nicht gleichsetzen. wir also Zugangskontrolle. Bei, bei der ländlichen Aufgabe. Ich werde die Rolle namens Blob, Data Contributor wählen. Eine interessante Sache hier ist, dass, wenn Sie eine Data Factory hinter den Kulissen auf Azure Active Directory und Identitäten erstellen , die mit dem gleichen Namen der Data Factory erstellt wurden. Auf diese Weise können Sie die Data Factory selbst autorisieren , auf die Ressource zuzugreifen, anstatt ein neues Konto zu erstellen. Suchen wir also nach dem Namen unserer Datenfabrik. Und da gehst du. Wir haben hier und speichern, und lassen Sie uns warten, in die Welt erstellt wird, die Rolle zugewiesen wurde. Sie können dies für eine Rollenzuweisung bestätigen. Und Sie sehen, dass Sie das Symbol der Data Factory hier haben, und Sie haben auch die Objekt-ID, die diese große Zeichenfolge ist, die aus der Abonnement-ID, dem Ressourcengruppennamen und dem Ressourcentyp besteht dem Ressourcengruppennamen . Großartig, Kommen wir zurück zu ADS. Hier ist immer noch unter einem verlinkten Dienst, Data Lake Gen2 Seite geöffnet, da es einen Namen gibt. Ich werde keine Beschreibung geben. Ich werde bei den Standardoptionen bleiben und unter der Authentifizierungsmethode wird es Identität verwaltet. Dann wähle ich unter meinem Abonnement mein Stipendium und werde nach der neuen Data Factory suchen, die jemals erstellt wurde. Aber Sie können sehen, dass dies noch nicht auf der Liste steht. Dies liegt daran, dass es manchmal ein wenig dauert um die neuen Reserven zu verbreiten, damit wir uns erfrischen können. Und da gehen wir. Es ist hier drin. Wie Sie sehen können, die verwalteten Identitäten, der Name der Data Factory. Dies ist, was wir unter Speicherkonto die Erlaubnis erteilt haben und ist das Objekt AG. Wir können die Verbindung testen. Da gehen wir, erfolgreich. Lassen Sie uns den verknüpften Dienst erstellen. Wir müssen nur veröffentlichen. Okay, wir sind alle bereit. Mal sehen, wie wir dies aus einem Datensatz verwenden können. 12. ADF Komponenten – Rohrleitungen: Hi. Bevor wir in das Set Aktivitäten eintauchen, haben Sie verstanden, was eine Pipeline ist? Eine Pipeline ist nicht t, sondern eine logische Gruppierung von Aktivitäten, die zusammen eine Aufgabe ausführen. Zum Beispiel könnten Sie eine Reihe von Aktivitäten haben, die Protokolldaten aufnehmen und verkleinern. Und dann hätten Sie einen Mapping-Datenfluss, um die Protokolldaten zu analysieren. Die Pipeline ermöglicht es Ihnen , diese Aktivitäten als Set anstatt jeder einzeln zu verwalten . Nehmen wir an, Sie stellen eine Pipeline bereit und diese Pipelines arbeiten als Container, in dem Sie viele Aktivitäten gruppieren können, um einen Sprung zu erreichen. Sobald Sie die Pipeline bereitgestellt haben, können Sie sie mischen. Anstatt Aktivitäten unabhängig zu schattieren. Innerhalb einer Data Factory können Sie über eine oder mehrere Pipelines verfügen. Sie können Pipelines sogar so verschachteln, dass Sie eine Aktivität innerhalb einer Pipeline aufrufen können, die eine zweite Pipeline verursacht, an der dritten Pipeline usw. Mal sehen, wie es in der Praxis funktioniert. So erstellen Sie eine Rohrleitung. Es gibt zwei Möglichkeiten. Einer ist von der Homepage von Data Factory. Sie können auf Pipeline erstellen klicken. Und es würde Sie direkt auf diese Seite umleiten. Oder Sie kommen hierher, um Ihnen anzubieten und klicken Sie auf die Paniermehl hier. Neue Pipeline. Wie Sie sehen können, ist dies im Grunde eine Leinwand und leere Leinwand für Sie, um Ihre komplexen Pipelines zu bauen. Sobald Sie eine Pipeline haben, können Sie ihr einen Namen geben. Es ist wichtig, dass Sie einen Eigennamen angeben, dass Sie ihn nachträglich leicht finden können. Auf der rechten Seite haben Sie das Panel und Sie können es einen Namen geben, Sie können ihm eine Beschreibung geben. Außerdem haben Sie die Möglichkeit, Parallelität festzulegen. Wie Sie sehen können, ist dies die Anzahl der gleichzeitigen Doppeldecker Läufe, die auf einmal abgefeuert werden. E, da die Fabrik eine weiche Grenze hat. So können Sie die Anzahl der Pipelines steuern, die Sie zu einem bestimmten Zeitpunkt ausführen. Und Notation ist im Grunde ein Tag , das angibt, mit welcher Art von Pipeline Sie es zu tun haben. Dies ist etwas, das Sie geben können und es ist sehr nützlich, wenn Sie Dinge wie Monitor betrachten. Sobald Sie entschieden haben, welche Art von Aktivitäten Sie verwenden möchten, können Sie beginnen, sie zu ziehen und abzulegen. In deiner leeren Leinwand. Es gibt nicht viel um die Pipeline. Und wir werden mehr in sie eintauchen, während wir während dieses Kurses weitergehen. Das ist alles für den Moment. Lassen Sie uns mit Datensätzen fortfahren. 13. ADF Components – Datensätze: Jetzt haben wir bereits begonnen, es zu erstellen. Wir müssen einen Datensatz erstellen. Sie haben einen Satz ist ein Name für die Anzeige der Daten, die einfach auf die Daten verweist, die Sie in Ihren Aktivitäten verwenden möchten. Außerdem werden Daten innerhalb der Datenspeicher identifiziert, z. B. Tabellen, Dateien, Ordner und Dokumente. Beispielsweise gibt ein Blob-Datensatz den Blog-Container und die Ordner an. Blob-Speicher, aus dem die Aktivität die Daten lesen soll. Jetzt schauen wir mal, wie wir das schaffen. Werfen wir einen Blick auf die Änderungsoption. Wie Sie sehen können, haben wir noch keinen Datensatz erstellt, also lassen Sie uns einen erstellen. Werfen Sie einen Blick auf die Brotkrumen hier und klicken Sie auf Aktionen. Neuer Datensatz. Für unseren Datensatz, da wir Data Lake Storage Gen2 verwendet haben. Lassen Sie uns diese Option aufteilen. Jetzt, da wir unseren Zeiger auf einen verknüpften Dienst haben, müssen wir angeben, welche Art von Dateien wir verwenden werden. Also lassen Sie mich Dateien auswählen. Klicken Sie auf Weiter. Wir müssen ihm einen Namen geben, Punktwert. Dann sollte unser Link es dient uns zur Verfügung stehen. Lassen Sie uns diese Option wählen. Hier. Ich kann definieren, was die Quelle oder den Speicherort ist, an dem meine Daten gespeichert sind. Da wir noch keinen Ordner oder eine Struktur erstellt haben, würde ich nur bei bekannt bleiben. Klicken wir auf „OK“. Von diesem Panel, wie Sie sehen können, haben wir unsere Objekte erstellt. Hier. Es kann es uns vorbevölkern. Und ich kann die Verbindung noch einmal testen. Von diesen Phagen. Wir könnten bearbeiten, stehlen Dienst, um die Verbindung zu ändern oder die Beschreibung zu ändern, so etwas. Oder ich könnte einen neuen lipophilen Service direkt von hier aus erstellen. Es gibt also viele Einstiegspunkte, an denen wir ein Objekt erstellen können. Lass uns hierher kommen. Es ist eine Art von Komprimierung, mit der ich arbeiten möchte. Es könnte sein, meine Datei auszugeben oder diese Art von Komprimierung zu lesen. Lasst uns zuckernd aussuchen. Hier. Es ist ein ziemlich cool, weil ich kam Browser meine Daten See. Wenn ich Ordner hier hineinführe, wäre ich nicht in der Lage, alle zu erweitern. Ich könnte sogar eine Vorschau meiner Daten anzeigen, wenn ich die Datei ausgewählt hatte. Cool. Moment ist das alles, was wir tun müssen. Lassen Sie uns also auf Veröffentlichen drücken und dann veröffentlichen. Toll, wir sind alle bereit für den Moment. Mal sehen, wie wir mit Aktivitäten arbeiten. 14. ADF Komponenten – Aktivitäten: Cool. Jetzt haben wir unsere beiden grundlegenden Anforderungen, denken Server und dass die Menge, müssen wir eine Möglichkeit, die Daten zu verschieben oder die Daten von Punkt A nach Punkt B mit unserem Verknüpfungs-Service und Datensatz, die wichtigsten Komponenten zu transformieren die Daten von Punkt A nach Punkt B mit unserem Verknüpfungs-Service und Datensatz, damit es funktioniert, dass die Bewegungsaktivitäten, nicht die Transformationsaktivitäten und Kontrollaktivitäten. Für Hosts, die mit Aktivitäten arbeiten, müssen wir zuerst eine Pipeline erstellen. Also lasst uns gehen, um Aktionen zu ändern. Neue Pipeline aus den drei Arten von Aktivitäten, die wir klassifiziert haben. Das ist ein Anfang mit Punkt. Die Bewegungsaktivität. Oder Bewegungsaktivität ist im Allgemeinen mit einer Kopierpunkt-, Punkt- oder Kopieraktivitätsaufgabe verknüpft . Wenn Sie mit Copy Doc arbeiten, können Sie sehen, dass Sie Quelle und Senke haben, die in Ihre Datenquelle und Ihr Ziel übersetzt werden könnten. Wie Sie hier sehen können, ist ein Dataset erforderlich. So fangen wir an, zusammenzustecken sind verknüpfte Dienste und Datensätze. Auch hier brauchen wir einen Datensatz. Es gibt eine Vielzahl von Datensätzen und die Liste entwickelt sich immer für nicht, dass Transformationen Aktivitäten, haben wir verschiedene Optionen. Wir könnten die Daten innerhalb von Data Factory mit eigenen Ressourcen transformieren, die wir Datenfluss nennen oder Datenflüsse abbilden könnten. Mit Spott tun Sie den Beitrag, werden Sie eine große Anzahl von Transformationen haben. Außerdem können Sie Compute-Ressourcen aufrufen, um die Transformationen durchzuführen, damit Sie die Daten erreichen können, z. B. Databricks, Batch Service, Azure, Synapse und andere virtuelle Maschinen. Und die Liste wächst weiter. Sie haben also mehrere Optionen, um mit Transformationen zu arbeiten. Schließlich, mit Kontrolltätigkeiten. Sie können den Fluss Ihrer Aktivitäten so orchestrieren, dass sie auf eine Weise oder eine Reihenfolge ausgeführt werden, die Sie wünschen. Sie könnten Aktivitäten in dieser Sequenz verketten, Verzweigungen und je mehr Dinge. Werfen wir einen Blick, wie es funktioniert. Nehmen wir an, wir wollen in einer bestimmten Reihenfolge ändern, wie Ihre Aktivitäten ausgeführt werden. So könnten Sie sie zusammenstecken und sogar definieren, wann dies ausgeführt werden sollte. Wenn Sie mit der rechten Maustaste auf den Pfeil klicken, können Sie sehen, dass Sie Erfolg haben, Fader Abschluss und mehr, aber es hört nicht auf. Weitere Optionen finden Sie hier. Zum Beispiel, wenn wir beginnen, seine Integration und die Bedingungen, die wir für jeden haben, wir haben, wenn Bedingung, wir haben Schalter, bis. Das sind Kontrollen. Und Sie können sie verwenden, um zu ändern, wie Ihre Pipeline ausgeführt wird. Definiert für jede Aktivität einen sich wiederholenden Kontrollfluss in der Pipeline. Hat Aktivität wird verwendet, um über eine Sammlung zu iterieren und führt angegebene Aktivität ist keine Schleife. Die if-Bedingung kann verwendet werden, um basierend auf einer Bedingung zu verzweigen , die als wahr oder falsch ausgewertet werden kann. Ich bin drunter. Ziemlich nützlich. Aktivität ist diejenige, die aufgerufen wird, führt Pipeline-Aktivität aus. Also lasst uns danach suchen. Führt die Pipeline aus. Aktiviert also ermöglicht es Ihnen, eine andere Pipeline aufzurufen. Aber warum dies nützlich ist, wenn wir über Pipelines sprechen, gibt es eine maximale Grenze von Aktivitäten und eine bestimmte Pipeline. Diese Zahl ist 40. Wenn wir an Big Data Warehouse arbeiten, wo Sie eine Menge von Tabellen erhalten können. Möglicherweise müssen Sie eine Kette von Pipelines erstellen. Das bedeutet, dass Sie hierher kommen und die Ausführung einer Sekunde durch Blinde aufrufen können. Und hier könntest du eine andere Pipeline nennen. Und auch für organisatorische Zwecke, könnten Sie anrufen, sie erwähnten Tabellen hier drin. Sie könnten hier Fakten Tabellen nennen, und so weiter und so weiter. 15. ADF – Pipeline: Hallo da. Im Ökosystem der Datenfabrik können wir verschiedene Objekte erstellen. Zum Beispiel Datasets, Pipelines, Datenflüsse, und die Liste geht weiter. Aber wie erstellen Sie eine dynamische Lösung so, dass Sie eine große Anzahl von Objekten vermeiden können , nur weil sie unterschiedliche Biasparameter haben. Welche Parameter können Sie eine sehr robuste und dynamische Lösung erstellen. Das Erstellen von Hauptsitz-Datasets oder Pipeline ist an sich keine schlechte Sache. Es ist gerade, wenn Sie anfangen, viele der Themen zu erstellen , dass die Dinge ein wenig zeitaufwendig. Und nicht zu erwähnen, es besteht immer die Gefahr von Hauptschweißiterationen, bei denen, wenn Sie anfangen, viele der gleichen Objekte zu erstellen, Sie einfach abstimmen und viele dumme Fehler machen. Wir werden diese Demonstration in drei Teile teilen. Im ersten Teil werden wir eine Pipeline in ein Dataset erstellen. Und wir werden den Wert vom Parameter, den wir in der Pipeline haben, bis zum Dataset übergeben . Der zweite Teil besteht darin, die Parameterwerte zwischen Aktivitäten zu übergeben. Das wäre also interner innerhalb der Pipeline. Und dann der dritte Teil, werden wir einen globalen Parameter in einer Weise verwenden, dass wir einen höheren Umfang haben würden. Übergeben Sie dann den Wert dieses Parameters entweder an eine Pipeline oder zu viele Pipelines oder ein Dataset. Es gibt einige Elemente der Demonstrationen, die wir noch nicht gesehen haben. Zum Beispiel, wie wir einen Data Lake erstellen. Aber keine Sorge, ich gehe hier nur ein bisschen in die Zukunft, um Zeit zu sparen. Aber wir werden während dieses Kurses sehen, wie wir all diese Objekte erstellen. Hier habe ich eine leere Leinwand, die meine Pipeline ist. Also werde ich die Pipeline in PL umbenennen. Für unsere Demonstration werden wir die Daten von einer Rest-API erhalten und diese Daten auf einem verzögerten gespeichert. Also zuerst müssen wir unsere Aktivität bekommen, die wir verwenden können, ist die Kopie Beta. Da du Daten übertragen wolltest. Es gibt zwei wichtige Dinge hier. Wir gehen direkt auf den Punkt. Wir haben Quelle und Spüle. Unsere Quelle wird Rezept sein. Also müssen wir den Datensatz verwenden, da wir noch keinen haben, Lassen Sie uns einen erstellen. Dann werde ich nach Ruhe suchen. Und das sollte dieser hier sein. Lasst uns anklicken. Ok. Okay, wir haben unseren Datensatz erstellt. Jetzt brauchen wir einen verknüpften Service. Sind wir verlinkt Service ist unsere Verbindungszeichenfolge. Und Datasets sind die Art der Verbindung, die wir verwenden werden. Also lassen Sie uns unseren Datensatz öffnen. Und wie Sie sehen können, ist es leer. Also könnten wir übergeben, wenn wir die relative URL von hier wollen. Lassen Sie uns einen neuen verknüpften Dienst erstellen. Als Namenskonvention werde ich wie ls für eine verknüpfte Dienst-API erstellen. Und dann für all diese Optionen, werden wir sie später auf diesem Kurs durchgehen. Wir werden nur bei der automatischen Auflösung und dem Authentifizierungstyp bleiben , den wir anonym verwenden werden. Jetzt müssen wir nur die URL übergeben. Also werde ich nur die URL, die ich bereits habe, und fügen Sie hier ein und wir können die Verbindung testen. Okay, das ist erfolgreich, was großartig ist. Klicken Sie auf Erstellen. Und jetzt haben wir unsere verknüpften Service-Ersteller und unser Datensatz namens Rest verwendet diesen verknüpften Service. Lassen Sie uns also den Namen dieser Datensätze ändern, um mit der RNA-Konvention zu bleiben. Und dann werde ich ds für Data Service setzen. Und die Partitur Rest API. Ruf an. Jetzt kommen wir zu dem Punkt, wo wir anfangen, mit Browsern zu arbeiten. Also lassen Sie uns hierher zurückziehen. Und dann werde ich einen neuen Parameter hinzufügen. Hier. Ich sage diesem Dataset, es wird es von Enter empfangen und dann kann es keinen Standardwert frisch zuweisen. Also haben wir hier drei Felder. Ich werde nur meinen Prompter nennen, uns relative URL. Und mein Standardwert wird Schrägstrich sein. Und das war's. Ich sage, hey, Datasets, Sie haben einen Prompter und einen Standardwert. Wenn nichts übergeben wird, wird dieser Wert hier angenommen. Lass es uns retten. Jetzt. Wir haben unseren Datensatz und unseren verknüpften Service erstellt. Nein, wir müssen zurück in unsere Pipeline. Und wie Sie das sofort sehen können, sobald ich meinem Dataset einen neuen Parameter hinzufüge, wird er hier ausgefüllt. Es erwartet einen Wert für meine Pipeline. Also, was wir hier tun können, können wir hier und überall außerhalb der Aktivitäten klicken. Also wechseln wir in den Umfang. Und wir können diese Informationen hier von unten bekommen. Und wir haben hier ein paar Möglichkeiten. Einer von ihnen ist der Prompter. Lassen Sie uns einen neuen Parameter erstellen und nennen wir es auch relative URL. Zeichenfolge des gleichen Typs. Und ich werde den gleichen Wert übergeben, der die Lautsprecher sind. Ok? Ich werde das nochmal retten. Was hier passiert, ist folgendes. Wir haben einen Parameter, der auf diesem außerhalb des Geltungsbereichs hier erstellt wird. Und meine Aktivität verwendet einen Datensatz, der bereits in schrecklichen ist. Und dieser Datensatz erwartet einen Parameter. Wenn wir hier klicken, können Sie sehen, dass sofort kann ich ABS dynamische Inhalte sehen. Lasst uns darauf klicken. Und aus dem Drop-down-Menü hier haben wir eine Liste verfügbarer Parameter. Wenn ich mehr Parameter aus meiner Pipeline hätte, würde es auch hier aufgelistet werden. Also lasst uns darauf klicken. Und eine interessante hier zu bemerken, der Name kommt als voll qualifiziert. Das ist also der Bereich, in dem meine Pipeline erstellt wurde, aber das ist ziemlich wichtig. Okay, also lasst uns auf Kohle beenden klicken. Jetzt verwenden wir den Prompter, den wir in unserer Pipeline erstellt haben , um diesen Wert an unser Dataset zu übergeben. Jetzt gehen wir weiter und klicken Sie auf Sync. Und wir werden einen neuen Datensatz erstellen, um die Daten zu lernen, die wir gerade von unserer restlichen API erhalten. Okay, also lassen Sie uns weitermachen und einen neuen Datensatz erstellen. Darin. Wir werden Data Lake Gen2 benutzen. Lassen Sie uns darauf klicken und gehen Sie weiter. Und ich werde einen JSON-Typ verwenden. Lasst uns weitermachen. Ich werde nur den Datasee nennen. Dann. Ich habe bereits ein verknüpfter Dienst wird aus einem Datasee erstellt. Und ich werde nur dieses auswählen, aber wir könnten von hier aus eine neue erstellen. Also habe ich gerade diesen ausgewählt. Und dann von hier ist der Pfad, wo ich die Datei speichern werde. Also würde ich einfach diese Informationen hier durchsuchen und sehen, was sind die Container, was sind die Routen Ordner, die ich zur Verfügung habe? Also würde ich einfach hier auf meine CSV klicken. Und diese Daten werden auf der Dachebene des Containers gelandet. Also lasst uns klicken. Ok, großartig. Wir haben jetzt alles, was wir brauchen. Also lasst uns voran gehen und diese Pipeline hier testen und sehen, wie sie sich verhält. Also werde ich einfach gehen und auf das Buch klicken. Sie können sehen, wenn ich wollte, könnte ich diese Informationen auch von hier aus schieben. Und dann wird es an meinen Datensatz weitergegeben. Ich würde nur mit dem Standardwert bleiben und auf OK klicken. Sie können sehen, dass es sich jetzt in der Warteschlange befindet und erfolgreich war. Unsere Pipeline verwendet also die Parameter, die an das Dataset übergeben werden. Jetzt müssen wir den zweiten Teil unserer Demonstration erstellen. 16. ADF – Aktivitätsparameter: Richtig, zum zweiten Teil unserer Demonstration. Jetzt werden wir die Parameter zwischen Aktivitäten verwenden. In dieser Demonstration werden wir die Metadaten der Datei auf dem Daten-See gespeichert bekommen . Und mit diesen Informationen werden wir eine Tabelle auf einem SQL Server füllen. das zu tun, gibt es einen Phasentest, den wir hier machen müssen. Also habe ich eine Dummy-Tabelle, die halten wird, wenn Ihre Felder , zum Beispiel der Elementname, das letzte Änderungsdatum für die Datei. Und wir haben hier einen Überschuss. Dies sind prozedurale grundsätzlich erhält als Parameter, die gleichen Felder, die wir auf unserer Tabelle zur Verfügung haben. Und dann mit diesen Browsern wird eine Tabelle füllen, die wir hier eingefügt haben. Und dann haben wir gerade hier unten eine Select-Anweisung, um die Daten auf unserem Tisch zu validieren. Die Tabelle ist noch nicht erstellt. Wir können dies überprüfen, ich werde sicherstellen, dass die Tabelle nicht existiert und ich werde die Tabelle erstellen. Also lasst uns das machen. Cool. Unsere Tabelle wird erstellt. Wir können die Anzahl der Zeilen überprüfen und die Tabelle ist leer. wir nun sicher, dass wir unsere Prozedur auch erstellt haben , weil dies unsere Tabelle füllen wird. Ich werde alles hier auswählen und einen Prozeduraufruf erstellen oder eine Prozedur gültige Daten sind. Lassen Sie uns nun eine Aktivität namens Metadaten erhalten. Also eigentlich speziell entwickelt, um die Metadaten von Dateien an verschiedenen Orten zu erhalten. In unserem Fall kommen wir zu den Metadaten der Datei, die wir von unserer vorherigen Demonstration hochgeladen haben. Wir können die gleichen Datensätze verwenden, die wir zuvor hatten, TS Data Lake. Und es gibt ein paar Argumente, die wir aus der Datei erhalten können, so dass wir aus der verfügbaren Liste angeben können. Also, wenn wir auf neue klicken, haben wir die Argumente. Und von hier aus können wir weitere Argumente hinzufügen. Wir kriegen den Artikelnamen. Und ich werde einen neuen Elementtyp hinzufügen. Und der letzte Modus fünf. Also insgesamt drei Artikel, die wir bekommen haben. Und nur um hier auf unserem Tisch zu überprüfen. Das sind also Artikelname, Typ und Stimmungsdatei. Cool. Wir haben also alle Argumente, die wir brauchen. Und das wird aus unserer Datei auf unserem Datasee abgerufen werden. Lassen Sie uns voran und erhalten eine andere Aktivität namens Store-Prozedur. Mit dieser Aktivität ermöglicht es uns, eine Oberfläche Sucher auf Datenbanken zu nennen. Klicken wir also hier auf die Screenshots und ziehen Sie sie auf die nächste Aktivität, also stellen Sie sicher, dass sie in einer bestimmten Reihenfolge ausgeführt werden. Dann können wir hier auf unserer Oberflächenbeschlagnahme unsere Datenbank auswählen. Also lassen Sie uns voran und erhalten einen verknüpften Service. Da ich bereits meine Liquid Surface Creators habe, habe ich gerade von hier ausgewählt. Und dann kann ich hier die verfügbaren Oberflächenbeschlagnahmen oder meine Datenbank ziehen. Da du nur einen hattest, können wir das hier bekommen. Es ist cool, weil hier kann ich gut passen geistig die Parameter, die ich übergeben möchte. Oder wenn ich möchte, kann ich den Parameter automatisch aus der Datenbank importieren. Also lasst uns Import drücken. Großartig. Wie Sie sehen können, sind die Parameter, die wir auf unserem Oberflächenmerkmal haben, jetzt von hier aus verfügbar. Cool. Beachten Sie, dass wir diese beiden Kette zusammen haben. Wir müssen unsere Oberflächenbeschlagnahme ändern, um die Parameter zu erhalten, die wir wollen. Das sind also die verfügbaren Parameter und hier sind die Bytes. Wenn wir wollten, könnten wir einen Standardwert übergeben. Aber was wir wollen, ist die Ergebnismenge, die aus den Ghettometadaten kommt. Wenn wir hier klicken, automatisch, fügt dynamischen Inhalt. Lasst uns darauf klicken. Und wir haben die Metadatenausgabe. Das ist also interessant, weil es als Objekt kommt. Damit wir also die Werte der Ergebnismenge der Metadatenaktivität erhalten, müssen wir auf sie als Objekt zugreifen. Also lasst uns darauf klicken. Und ich werde hier auf Fertig stellen klicken. So können wir schnell zu Ihnen zurückkommen, um zu sehen, was die Informationen sind, die wir haben. Also haben wir Artikel, Namen, Elementtyp und weniger modifiziert. Also hier können wir darauf klicken. Dies wird die letzte Änderung sein. Es wird insgesamt sein. Also lasst uns auf OK klicken. Dieser hier wird entweder Name sein. So können wir auf Batch klicken. Geben Sie dann den Elementnamen erneut zusammen ein. Dann haben wir uns endlich identifizieren. Lasst uns darauf klicken. Wählen Sie unsere Ausgabe aus. Dann tippst du Insel, richtig? Großartig. Jetzt übergeben wir die Werte, die dieser Aktivität an die Oberfläche hier Gleichung verbunden sind. Ich werde das retten. Und lassen Sie uns diese Aktivität ausführen. Lassen Sie uns Debug drücken und sehen, wie es aussehen kann. Es ist schief. Frech. Nein. Der erste ist gelungen. Lassen Sie uns die zweite überprüfen. Griechenland. Die Werte unserer Tätigkeit gelangen in Daten wurden erfolgreich an die Oberflächenbeschlagnahme weitergegeben. Wenn wir hier auf Canvas klicken, können wir die Ausführung überprüfen. Klicken Sie hier. Wir können sehen, was die Argumente sind, die wir aus unserer Methodendatenaktivität gewählt haben. Also Elementname, es geschah nicht zuletzt geändert. Das waren also die Ausgabe der Aktivität. Die Eingabe. Wir können sehen, dass wir eine gespeicherte Prozedur hatten und das waren die Werte, die wir an die Oberfläche übergeben haben. Nun, wenn wir zurück zum SQL-Server gehen und wenn wir die Tabelle erneut überprüfen, haben wir jetzt ein neues Volume, das ich kannte Datensätze, aber es ist großartig, so dass wir sehen konnten, wie wir die Werte einer Aktivität an eine andere Aktivität übergeben können , die Parameter verwendet. Das ist großartig. Wir können unseren Code wiederverwenden. 17. 4.5.3 ADF Komponenten – globale Parameter: nun zum dritten Teil dieser Demonstration wechseln, werden wir sehen, wie wir mit globalen Parametern arbeiten können. Ich bin gegangen. Das globale Problem hört nicht auf, weil ich demonstrieren wollte, wie wir den globalen Prominenten nutzen können. Es gibt entweder für Pipelines oder Aktivitäten. Auf der linken Seite haben wir es geschafft. Und hier unten unter der Oper haben wir globale Parameter. Lassen Sie uns auf Neu klicken. Und lassen Sie uns den Namen relative URL und der Wert wird der gleiche sein, wie wir zuvor bereitgestellt haben, was die Lautsprecher sind. Lasst uns auf Speichern drücken. Nun, zurück in die Pipeline, ich habe hier beide Pipelines geöffnet, die wir zuvor gearbeitet haben. Derjenige, den wir die Parameter innerhalb der Pipeline und hier zwischen Aktivitäten übergeben. Also, wenn wir die Aktivität überprüfen und dann überprüfen wir Quelle, können wir sehen, dass wir auf die Aufforderung zurücksetzen. Lasst uns darauf klicken. Und jetzt unter Parametern, die wir vorher haben, haben wir globale Parameter. Und da wir den gleichen Namen gegeben haben, sind das die gleichen, die wir hier sehen. So können wir diese markierte Option hier löschen, die der eigentliche Parameter ist. Dann können wir relative URL auswählen. Wir können sehen, dass wir jetzt einen voll qualifizierten Namen haben, der auf die globalen Parameter verweist. Lasst uns auf Fertig stellen. Und hier, wenn wir in die andere Pipeline gehen, wo wir sie von sprechenden Aktivitäten übergeben, wenn wir hier klicken, können wir sehen, dass die globalen Parameter auch verfügbar sind und wir nicht die Pipeline hier zur Verfügung haben. Das ist die Schönheit der globalen Parameter. Globale Parameter sind sehr wiederverwendbar, entweder zwischen Aktivitäten oder zwischen mehreren Pipelines, anstatt nur auf eine Pipeline beschränkt zu werden. Okay, lassen Sie uns das hier absagen. Gehen wir zurück zu diesem hier. Und da wir jetzt eine globale Parameter verwenden, lassen Sie uns speichern und ausführen und sehen, wie es funktioniert. Lasst uns Debug drücken. Dann kann ich den Parameter zuschreiben, wenn ich will. Und es wird die Pipeline starten. Jetzt ist es im Gange. Großartig. Es ist gemein gelungen. Und damit schließen wir eine weitere Demonstration ab. Ich hoffe, euch gefällt es. Und lassen Sie uns in der nächsten Lektion sehen, wie wir mit Behandlern arbeiten können, ist alt. 18. ADF Komponenten – Trigger: In dieser Lektion werden wir über Azure-Trigger sprechen. Trigger sind ein grundlegendes Element im Ökosystem der Datenfabrik. Einsatz von Triggern ist, wie wir unsere Pipelines nach unseren Anforderungen transportieren können. Im Moment dieser Aufnahme gibt es vier verschiedene Arten von Triggern und wir werden sie jetzt durchgehen. Es gibt hauptsächlich zwei Möglichkeiten, auf bestehende oder neue Trigger zuzugreifen. Wenn Sie ging, um durch Flugzeug zu einem Trigger zugeordnet, wir haben diese Schaltfläche hier ausgelöst werden und wir können auf neue oder Änderungen an Ihrem klicken. Auch auf der linken Seite haben wir es geschafft und unter Autor haben wir Auslöser. Und hier können wir alle verfügbaren Auslöser sehen, die wir innerhalb unserer Data Factory haben. Kommen wir also zu der Pipeline zurück, die wir in unserer vorherigen Demonstration erstellt haben. Und lasst uns auf Neuen Trigger hinzufügen klicken. Und hier können Sie sehen, dass ich wählen könnte, wenn vorhandene Trigger oder ich kann einen neuen erstellen. Da habe ich keine. Lassen Sie uns auf Neu klicken. Ok. Dies ist das Hauptfenster, in dem wir unsere Auslöser einrichten werden. Es gibt hauptsächlich vier verschiedene Arten von Triggern. Wir haben Skelett, wir haben Taumelfenster, wir haben Lagerereignisse und benutzerdefinierte Ereignisse. Also, wenn es um Skalierung geht, diese Rinder entweder ausgelöst, die eine Pipeline auf einem Spaziergang Blick hervorruft. Und die Beziehung zwischen einer Skalierung in einer Pipeline kann 1:n sein. Zum Beispiel kann ich viele Pipelines mit demselben Wasserkocher haben. Könnten alle meine Pipelines wieder auf einer laufen? Ja, sie müssen nur die gleiche Streuung teilen. Ok, jetzt haben wir ein Taumelfenster. Tumbling Window ist ein ausgelöst, die auf einem ziemlich chaotischen Intervall arbeitet , während auch die Bühne beizubehalten. Es könnte als ausgelöst beschrieben werden, die für komplexere Szenarien verwendet werden können. Beispielsweise können Sie Abhängigkeiten zwischen Triggern, zwischen einem anderen Taubling-Fenster erstellen . Und Sie können ein paar Hunde von dem Moment an laufen, als es gescheitert ist. Sie können die Wiederholung von Benutzern für Pipelines festlegen. Und die Beziehung zwischen Ihrem taumelnden Fensterhändler und Pipelines ist immer ein Eins-zu-eins. Sie können nicht das gleiche Zeitfenster für viele Pipelines verwenden, wie wir es mit seinem Vieh tun können. Ein weiteres sehr gutes Merkmal des blauen Fensters. Sie können ein Taubling-Fenster für vergangene und zukünftige Daten führen bedeutet wilden Skandal. Sie können nicht, es ist ein perfektes Gateway und Sie möchten Treibstoffe für Ihr tieferes Haus oder Ihre Datenbanken zurückgeben. Und schließlich ist ein weiteres Element des Taumelfensters die Tatsache, dass es eine Eigenabhängigkeitseigenschaft hat, was bedeutet, dass der Trigger nicht bis zum vorherigen Fenster weitergehen sollte. Wir wissen, dass es erfolgreich abgeschlossen ist. Also musst du das im Sinn haben. Skandal ist immer in der Zukunft. Und w Fenster, können Sie einen definierten Zeitraum haben. Es ist Storage-Ereignis ist eine sehr coole Art von Trigger. Es gibt also viele Anwendungsfälle, in denen Sie auf Ereignisse reagieren möchten , die in Ihrem Speicherkonto auftreten können. Stellen Sie sich beispielsweise vor, Sie warten darauf, dass eine Datei Ihrem Speicherkonto landet, und Sie können diese Datei dann laden. In diesem Fall müssen Sie nicht regelmäßig überprüfen, ob die Datei erfolgreich in das Speicherkonto geladen wurde. Verwendung von historischen Ereignissen ist perfekt, denn wenn ein neues Ereignis in Ihrem Speicherkonto erstellt wird, können Sie diesen Trigger verwenden, um eine Pipeline auszulösen. Diese Speicherereignisse verwenden also hinter den Kulissen Event Grid. Also, wenn Sie erstellen, die ein neues Thema auslösen, generiert iso für Sie hinter den Kulissen. Und wenn du zum Event Grid gehst, kannst du das Event dort stehlen. Jetzt fügen wir es einfach hinzu. Wir haben benutzerdefinierte Veranstaltungen. Also nicht nur für Speicherkonten mehr, es kann jeden Tag sein. Noch größer, großartig, denn Sie können Ihre eigenen Themen definieren und Ihre eigenen Events erstellen. Stellen Sie sich vor, Sie haben eine Anwendung, die eine ganz besondere Art von Ereignis hat und Sie möchten auf Ereignisse reagieren. So können Sie ein benutzerdefiniertes Thema für die Ereigniserstellung erstellen. Und dann können Sie mit den benutzerdefinierten Ereignissen in Data Factory diese Ereignisse abonnieren. Und dann handeln wir, wenn ein neues Ereignis eintritt. Das ist brillant. Jetzt haben wir viel mehr Flexibilität, wenn wir auf Ereignisse reagieren. Also hier, wie Sie sehen können, ist diese Gallo ziemlich einfach für eine Pipeline, so dass Sie nur das Datum und die Uhrzeit definieren. Für Trommelfenster Wir haben mehr Optionen, damit Sie die Wiederholung der Ereignisse wie alle 15 Minuten einstellen können, oder Sie können, wie unsere, ein Enddatum dafür angeben. Nehmen wir an, wollen nur für einen Zeitraum oder für ein Fenster von 30 Minuten laufen. Wenn Sie auf Erweitert klicken, haben Sie hier viel mehr Möglichkeiten. Sie haben also eine maximale Übereinstimmung, die für Data Factory großartig ist. So können Sie das Maximum bewusst definieren, dass einige Daniels Trigger wollen, eine Zahl für Ihre Wiederholungen der Stuhl-Wiederholungsrichtlinie definieren können, dann ist dies auch großartig. So können Sie sich dies als eine Art von Validierung vorstellen, bei der Sie das Integral für Ihre Wiederholung definieren können, was großartig ist. Daher sind Einschränkungen ähnlich wie bei Pipelines. Sie möchten also eine Art von Beschreibungen zu Ihrem Trigger hinzufügen. Hier können Sie eine neue Notation hinzufügen. Und das heißt, ob es aktiviert oder deaktiviert ist. Und lasst uns gehen, um Ereignisse zu speichern sind unzusammenhängende Ereignisse. Sie müssen ein Speicherkonto definieren. Und dann definieren Sie hier den Pfad, den Sie hören möchten. Und hier sind die Ereignisse, die Sie reagieren können wenn eine Blob-Datei erstellt wird oder wenn eine Blob-Datei gelöscht wird, dann können Sie wirklich intelligent, Sie können Steuerdateien nicht ignorieren oder sagen wir Parkett-Dateien, dass sie leer sind. Ok. Sie müssen also nicht, Sie müssen Ihre Pipeline nicht ausführen, weil es nichts laden wird. Ok? Dann die gleichen Permutationen und aktiviert oder deaktiviert und dann benutzerdefinierte Ereignisse. Weil einige Ereignisse, die wir hier haben, das Abonnement und dann haben wir David könnte reden, können nennen. Dies wird außerhalb von Data Factory erstellt. Dann haben Sie Ihre Subjekte, die ähnlich dem ist, was wir für die Speicherkonten haben, wie das, was Sie hören wollen, um zu reagieren. Und dann gegebene Typen, sind alle Zoll, die ich definieren kann. Und damit schließen wir eine weitere Lektion ab. Ich hoffe, Sie haben gemocht. Und wenn Sie irgendwelche Fragen haben, zeigen Sie mir einfach eine Nachricht, geben Sie die Kommentare, und ich werde mich so schnell wie möglich bei Ihnen melden. Danke fürs Zuschauen. 19. ADF Laufzeit: Lassen Sie uns jetzt darüber sprechen, wie wir Integrationslaufzeit sind. Lassen Sie uns sehen, wie es funktioniert und warum dies im Ökosystem von Azure Data Factory so wichtig ist . Also, um zu sehen, wo es sich befindet und wo wir konfigurieren können, verwalten. Und Sie sollten in der Lage sein, Integrationslaufzeiten zu sehen, wie Sie hier sehen können. Wenn Sie eine neue Data Factory erstellen, wird standardmäßig eine Standard-Integrationslaufzeit auf den Punkt gebracht. Und die pünktliche Integration ist eine Recheninfrastruktur, die alle Ihre Aktivitäten hinter den Kulissen ausführt. Es gibt fast drei Arten von Integrationslaufzeiten, aber wir sehen hier ist der andere Typ. Wir können auch den selbst gehosteten Typ und die SSIS-Integrationslaufzeit haben. Was sind also im Grunde die Unterschiede zwischen Kosten und Netzwerkbeschränkungen? Wenn wir Azure Integration Runtime verwenden, ist dies grundsätzlich für die Verwendung zwischen Ressourcen in Azure vorgesehen. Oder zum Beispiel, wenn er ging, um eine Verbindung zu Amazon S3 oder anderen Cloud-Ressourcen. Das Schöne an der Azure Integration Runtime ist, dass sie einen vollständig verwalteten, serverlosen Computing bereitstellt. Im anderen Sinne stellt es Ihnen die gesamte Infrastruktur zur Verfügung. Sie müssen nicht über Softwareinstallation und Patching oder Kapazitätsskalierung nachdenken. Sehen wir uns nun an, wie die selbst gehostete Integrationslaufzeit funktioniert. 20. ADF – Self-Hosted Integration: Wenn Sie nun mit selbst gehosteter Integrationslaufzeit arbeiten möchten, muss diese manuell erstellt werden und damit wir eine neue, selbst gehostete Integrationslaufzeit erstellen können. Sie klicken auf Neu. Und wir haben die Option als xr selbst gehostete Integration Runtime. Gehen wir also voran und klicken Sie auf Weiter. Wie Sie sehen können, haben wir ein paar Optionen zur Auswahl. Und hier können wir mehr Informationen über die selbst gehostete sehen. Und hier haben wir eine verknüpfte Self-Hosted. Beginnen wir also mit dem selbst gehosteten. Mit dem selbst gehosteten, wenn Sie eine Art Datenintegration sicher in einem privaten Netzwerk durchführen möchten , das keine direkte Sichtlinie aus der öffentlichen Umgebung hat. Die selbst gehostete. Das selbst gehostete bedeutet, dass Sie über einen Computing in Ihrem eigenen Netzwerk verfügen. Sie installieren die Integrationslaufzeit auf diesem bestimmten Computerressource, die überprüft werden soll, mit einem Schlüssel, der zum Zeitpunkt der Erstellung bereitgestellt wird. Also lasst uns weitermachen und weitermachen. Sie können ihm einen Namen geben. Wir können es schaffen. Jetzt wird meine selbst gehostete Integrationslaufzeit erstellt. Wie Sie sehen können, habe ich einen Schlüssel und Schlüssel. Dann gibt es mir einen Link, um die Integrationslaufzeit herunterzuladen. Sobald es installiert ist, zeigt es mir an, wie viele Knoten installiert sind, ob es aktualisiert wird oder nicht, wenn es freigegeben ist. Lassen Sie uns also auf Download klicken, um mich auf die Microsoft-Seite weiterzuleiten. Und wir können sehen, dass wir diesen Download-Button haben. Laden wir es herunter. Und ich werde den ersten bekommen. Es ist 700 MB. Also musst du etwas Platz auf deinem Computer haben und anfangen, dieses Video zu pausieren und zurückzukehren. Wann haben Soli? Ich habe auf Installer geklickt und lass uns voran gehen und sehen, wie es aussieht. Ich werde nur als Nächstes sagen. Akzeptieren. Als Nächstes. Es ist ziemlich einfach zu installieren. Ich werde es jetzt installieren. Wenn Sie schließlich die Installation beenden, Dies ist die Seite, die Sie sehen werden. Dies wird Ihre selbst gehostete Integrationslaufzeit mit der anderen validieren. Also komm zurück zu dem, den wir gerade erschaffen haben. Wir werden den Schlüssel holen. Sie können jede von ihnen wählen. Der Grund dafür, dass wir zwei Schlüssel haben, ist aus Sicherheitsgründen. Stellen Sie sich vor, Sie möchten den ersten Schlüssel erneuern, weil Sie sich nicht sicher sind, wer ihn hat. Und wenn ich validiert habe, sollten Sie in der Lage sein, einen der beiden zu greifen und einen von ihnen zu recyceln. Okay, also lasst es uns holen. Die erste. Dann werde ich es hier einfügen, hat validiert. So kann ich Ihnen die Authentifizierungsschlüssel zeigen, die gleich sind. Keine Sorge, dies dient nur zur Demonstration und es wird gelöscht. Ich werde mich registrieren. Nun, es ist sehr veraltet und Sie haben diesen Tool-Tipp hier. Dies ist etwas, das Sie in Ihrem Intranet verwenden möchten. Nehmen wir an, wenn Sie mehr als einen Grad von der Laufzeit im gleichen Netzwerk haben und Sie möchten, dass sie miteinander kommunizieren, sie als Failover verwenden, etwas, das Sie dies aktivieren können und dann gibt es eine Möglichkeit für Sie zu kaufen die Daten, aber lassen Sie es so, wie es im Moment ist. Also lasst uns zu Ende gehen. Cool, es ist jetzt validiert. Wir haben einen Knoten, der erfolgreich registriert wurde. Lassen Sie uns also den Konfigurations-Manager starten. Und so sieht es aus. Es ist ziemlich einfach. Es gibt nicht viel für uns hier zu tun ist nur der Fall. Wenn Sie Probleme mit einer Verbindung beheben möchten. Zum Beispiel haben Sie hier Einstellungen. Wenn Sie einige Proxy-Einstellungen auf Ihrem Computer haben, ist es in der Regel nicht zu tun, da es von den Umgebungsvariablen abgeholt wird. Lassen Sie uns diagnostizieren. Wenn Sie die Protokolle anzeigen möchten oder wenn auf einer Testverbindung, wie sie vom ADF funktionieren würde, können Sie die Quelle abrufen und den Server auswählen. Welche Art von Authentifizierung Sie wollen. Stellen wir uns also vor, ich wähle SQL Server aus, treten auf, um Windows-Authentifizierung auf unserer Basis zu erhalten, die eine SQL-Protokollierung ist. Und ich würde die Anmeldeinformationen ein Jahr übergeben und meine Verbindung bestanden. Okay, Also das ist das Update bei den ADA-Updates es automatisch ist nur für Informationszwecke hier und Hilfe Wenn F finden einige Links für einige Informationen. Also lassen Sie uns das schließen. Ich werde dazu kommen. Und wie Sie sehen können, wird es grün. Ich habe keine VPN-Setup. Es ist ein ziemlich einfaches Setup hier. Und meine Verbindung beruht auf der Konnektivität von der Integrationszeit mit meiner Schlüsselauthentifizierung. Diese kleinen waren kein Jahr. Es wird von Zeit an durch Aktivität auf meinem Integral überwacht. Es zeigt die Auslastung meiner CPU oder die Minute Was ist los mit der Version, den verfügbaren Speicher für mich zu laufen. Grundlegende Informationen und der Durchsatz. Wie viele gleichzeitige Aufträge, die gleichzeitig ausgeführt werden können Wenn Sie mehr Ressourcen bereitstellen, können Sie mehrere gleichzeitige Aufträge gleichzeitig verwenden. Und wenn Sie im Juli viele Dinge haben, wie viel Ressource für Pipelines zur Verfügung steht, wird der Fertigkeit zugewiesen und sie werden weitergehen , bis es eine verfügbare Ressource für sie gibt. Also hier sind die Aktivitäten. Sie können alle Pipelines finden, die Elutionszeit jemals gewonnen hat. Mit Blick auf diese Seite, okay, hier sind die Kinos frei zu filtern, wie lange Sie überprüfen möchten? Normalerweise ist es standardmäßig auf 24 Stunden eingestellt. Das war's. Danke fürs Zuschauen. Bleiben Sie dran. 21. ADF – Verknüpfte Self-Hosted Integration: Hallo, und willkommen zu einer anderen Lektion. Jetzt werden wir über die verknüpfte selbst gehostete Integrationslaufzeit sprechen. Wenn Sie kommen, um es zu schaffen. Sie müssen bemerkt haben, dass, wenn wir als selbst gehostet ausgewählt, gibt es hier eine andere Option, verknüpft selbst gehostete IR. Sie können auf Mehr erfahren klicken. Und wir können sehen, dass es hier eine umfassende Dokumentation gibt. Wenn wir jedoch hier einklicken, die verknüpfte selbstgehostete Integrationslaufzeit, ist dies durchaus nützlich, wenn Sie sich nicht leisten können, mehr als eine selbstgehostete Integrationslaufzeit in Ihrem Unternehmensnetzwerk zu haben . Oder Sie möchten einfach keine weitere Computerforschung aufbauen, um dediziert zu werden, die selbstgehostete Integrationslaufzeit. In diesem Fall können Sie also mit diesen Effektbäumen verknüpfen, um nur eine verknüpfte, selbst gehostete Integrationslaufzeit zu verwenden. Und darüber hinaus kann eine selbst gehostete Integrationslaufzeit nur mit einer Factory verknüpft werden. Dies ist also auch in Szenarien nützlich, wenn Sie eine CICD-Pipeline für eine Data Factories erstellen möchten. Sie verweisen nur auf eine selbst gehostete Integrationslaufzeit, Sie verweisen nur auf eine selbst gehostete Integrationslaufzeit anstatt mehrere selbst gehostete Integrationslaufzeitumgebung verwalten zu müssen. Sehen wir uns an, wie es in der Praxis funktioniert, wie wir das einrichten können. Um dies zu tun, müssen wir zuerst eine andere Data Factory erstellen, weil wir an dieser Stelle nur eine hatten. Gehen Sie also zurück zum Portal, suchen Sie, wo Datenfabriken. Wir hatten bereits ein Jahr, also erschaffen wir ein weiteres. Ich werde diesen Namen einfach kopieren. Erstellen. Wir wählen die gleiche Ressourcengruppe aus, die wir zuvor erstellt haben. Meine Region wird Nordeuropa sein. Ich werde hier nur noch eine Nummer für meinen Namen hinzufügen. Ich werde die Konfiguration überspringen, ich werde das Netzwerk überspringen. Ich aktiviere keine Verschlüsselung. In diesem Fall werde ich mit dir leer leben und K erstellen, damit es Konfiguration bekommt. Ich werde einfach später Git konfigurieren auswählen. Ok. Also mach voran und erschaffe. Okay, das wurde geschaffen. Gehen wir nun zu der Ressourcengruppe, in der sie bereitgestellt wird. Verrückt. Wir können die Uterusfabrik sehen, die wir gerade erschaffen haben. Es ist dieser Wein mit O2 vorne. Okay, das ist die neue Data Factory, die wir gerade erstellt haben. Wie Sie sehen können, verwalten MT, Keine Pipelines, keine Datasets. Wir haben nur eine Integrationslaufzeit. Dies ist d'Azur, eine, die mit all dem neuen Verzeichnis kommt, ist, dass Sie erstellen. Nehmen wir nun an, ich möchte dieselbe selbstgehostete Integrationslaufzeit verwenden , die wir für die andere Data Factory erstellt haben. Um das zu tun, müssen wir ein paar Schritte gehen. Ich möchte zuerst meiner neuen Data Factory erlauben, auf meine OS Data Factory zuzugreifen. Also, wir gehen zu der zuvor erstellten Integrationslaufzeit. Wir konstruieren diese Seite. Wir müssen die selbst gehostete Integrationslaufzeit öffnen, die wir bereits haben. Und dann gibt es eine Registerkarte namens Sharing. Also lasst uns darauf klicken. Und Sie können sehen, dass dies der Ort ist , an dem Sie Berechtigungen für eine andere Data Factory erteilen. Das ist also eine Eins-zu-Eins-Beziehung. Sobald ich dies ausgewählt habe, können Sie sehen, dass es mir alle vorhandenen Datenfabriken bringt , die auf meinem Abonnement oder der Dentin vorhanden sind und verbunden sind. Also wähle ich diesen Kerl hier aus. Dies ist derjenige, den wir gerade erstellt haben, und es wird die Berechtigungen gewähren. Es ist alles bereit. Nun, der zweite Schritt, den ich tun muss, besteht darin, die Ressourcen-ID meiner vorhandenen selbstgehosteten Integrationslaufzeit zu übernehmen . Und dann möchte ich auf meiner neuen Data Factory eine neue selbstgehostete Integrationslaufzeit erstellen. Aber zu diesem Zeitpunkt wird es selbst gehostete Integrationslaufzeit verknüpft werden. Und ich werde auf Weiter klicken. Wie Sie sehen können, gibt es hier nicht viel zu tun. Wir müssen nur im Grunde sagen, dass das beeinflusst, was die Ressource ist, die ich verknüpfen möchte. Dies wird also meine bestehende selbst gehostete Integrationslaufzeit sein, die wir erstellen können. Und das war's. Wie Sie sehen können, gibt es nichts an der Ladung hier. Es gibt keinen Schlüssel zu einem selbst gehosteten auf Ihrem Computer, da dies bereits zuvor getan wurde. Der verwaltete Schlüssel hier ist, dass er mit etwas verknüpft ist , das bereits zuvor eingerichtet wurde. So ist der Typ jetzt selbst gehostet. Und es kommt laufen, weil diese Daten hier auch laufen. Okay, so können Sie selbst gehostete, IR von selbst gehosteten sehen. Und wenn ich hier klicke, kann ich sehen, dass es nur zwei Ressourcen AG gibt. Und der andere, wenn ich auf Match klicke, habe ich die Schlüssel, bezeichnet die Upbeats, den Schatten oder meine selbst gehostete Integrationslaufzeit. Und jetzt kann ich sehen, dass ich meine Berechtigungen Absolventen. Das ist alles für den Moment. Auf diese Weise richten wir eine verknüpfte, selbst gehostete Integrationslaufzeit oder einen Käse für die Funktion ein. Und zum Zuschauen. Wir sehen uns bald. 22. ADF Laufzeit: Werfen wir nun einen Blick auf unsere dritte Option, die ASOR SSIS ist. Gehen wir zu „Neu“. Und hier können wir sehen, dass wir eine zweite Option für Azure SSIS haben. Also lasst uns auf die Verriegelung klicken. Warum brauchen wir also diese dritte Option? So viele Kunden, manchmal finden sie es schwierig, das gesamte SSIS-Paket in nativ ADF-Paket oder Pipelines zu migrieren . Der Grund, warum wir diesen Azure SSIS haben, ist ziemlich viel für Heben und Verschieben von Paketen aus Ihren lokalen Ressourcen zu Azure. Wenn Sie Azure SSIS haben, ist es auch ein vollständig verwalteter Sir. Hinter den Kulissen, das sind Yams gewidmet, um diese als Bewertungspakete auszuführen. Hier können Sie auch beobachten, dass eine Lizenz erforderlich ist , weil Sie SSIS-Komponenten ausführen, was bedeutet, dass Sie eine Lizenz für SQL Server benötigen. So können Sie eine Funktion namens bringen Sie Ihre eigene Lizenz nutzen. Auf diese Weise können Sie Rabatte erhalten, was bedeutet, dass wir Ihre lokalen Lizenzen in der Cloud verwenden. In ähnlicher Weise haben Sie die Möglichkeit, Ressourcen Ihrer eigenen virtuellen Maschinen auf prem auszuwählen. Hier können Sie auch die Anzahl der Knoten auswählen, die für Ihre reine Integrationslaufzeit verfügbar sind. Und Sie können die Art von Maschine wählen, die Sie wollen. Und natürlich, je mehr Ressourcen Sie bereitstellen, mehr wird es Sie am Ende des Monats kosten. Wenn Sie einige Kosten sparen möchten, können Sie diese Integration mit der Zeit pausieren, wie Sie möchten. Hier haben Sie den Speicherort, an dem Sie den Cluster virtueller Maschinen bereitstellen möchten. Idealerweise möchten Sie eine Region auswählen, die in der Nähe Ihres physischen Standorts oder des physischen Speicherorts liegt, in dem Ihre Daten gespeichert sind, indem Sie den richtigen Speicherort Ihrer SSIS-Integrationslaufzeit auswählen, um den Durchsatz auszuführen. Auf diese Weise können Ihre Daten weniger reisen, um zum endgültigen Ziel zu gelangen. Lassen Sie uns nun einen Namen geben und mit der Erstellung unserer Integrationslaufzeit fortfahren. Also werde ich sagen, meine SSIS-Integrationslaufzeit, gehen, um das Datum, den Namen zu kaufen, ist der Name. Okay, ich kann ihm eine Beschreibung geben, die ich will. Ich würde nur sagen, gehen Sie kontinuierlich. Eine interessante Sache, die hier zu bemerken ist, ist die Tatsache , dass wir einen Ort benötigen, um die SSIS-Pakete zu speichern. In diesem Fall benötigen Sie eine SQL Managed Instance oder eine SQL-Datenbank, die als SSIS-DB bereitgestellt werden soll. Und du wirst die Pakete dort aufbewahren. Also in meinem Fall hier habe ich noch keine Instanz erstellt. Also werde ich einfach hier anhalten, weil der Zweck dieser Demonstration ist nur, um Ihnen zu zeigen wie die Verwendung von SSAS und was ist der Zweck davon? Damit schließen wir eine weitere Lektion ab. Danke und bleib dran. Wir sehen uns bald. 23. Quiz – Modul 3: Gut. 24. Wie du Daten mit der Kopierung in Azure Data Se-Gen2 einbringst: In dieser Lektion werden wir die Kopieraktivität verwenden , um Daten von einem Ort zum anderen zu verschieben. Wir verwenden eine Excel -Datei auf meinem Computer als Quelle und den ASU Data Lake, den wir als Ziel erstellt haben. Als zweites Beispiel werden wir einen S3-Bucket in AWS als Quelle und eine SQL Server-Datenbank als Ziel verwenden . Ich werde nicht auf die Details gehen, wie man einen Amazon S3-Buckets einrichtet , weil gerade aus diesem Code, der für die SQL Server-Datenbank gleich ist, wir einfach davon aus, dass alles für uns erstellt wird. Und als Datentechniker müssen wir nur Daten von einem Ort zum anderen verschieben. Also, ohne weiteres, lasst uns anfangen. Hallo, Werfen wir einen Blick durch Objekte, die wir erstellt haben , die wir mit dieser Lektion vorankommen müssen. Lassen Sie uns mit verwalten beginnen, und werfen Sie einen Blick auf den verknüpften Dienst. Sie müssen sicherstellen, dass eine der Optionen, die Sie hier haben ist der Data Lake, den wir zuvor erstellt haben. Cool. Lassen Sie uns nun die Integrationslaufzeiten überprüfen. Und Sie müssen über die selbst gehostete Integrationslaufzeit verfügen. Und es muss einsatzbereit sein. Wenn Sie zwei Objekte hier drin haben und sie alle grün sind, sind Sie gut, Sie sind bereit zu gehen. Jetzt fangen wir an. Zurück zur Homepage. Lassen Sie uns einen verknüpften Dienst mit unserer Excel -Datei erstellen. Gehen Sie also zu „Links und Dienste verwalten“. Klicken Sie auf Neu. Und jetzt werden wir nach Dateisystem suchen. Dies liegt daran, dass die Dateien offensichtlich auf unserem lokalen Computer gespeichert werden. Und wir benötigen einen Dateisystem-verknüpften Dienst um diese Datei zu erhalten und ein Speicherkonto mit dieser Datei zu füllen. Diese Datei ist als Ressource verfügbar, sodass Sie sie aus dem Lektionsbereich herunterladen können. Also ist die Datei so etwas, ist nur ein Beispieldaten, die eine Reihenfolge Art von System nachahmen. Und Sie haben Hilfsmittel und Namen für Menschen. Ich würde diese Datei einfach auf meinem C Laufwerk Temp Ordner speichern und dann werden wir es von dort nehmen. Lassen Sie uns weitermachen und unseren verknüpften Service erstellen. So Kontinuum. Wir werden es benutzen. Dies ist sehr wichtig, damit Ihr Szenario funktioniert, ist es, meine selbst gehostete Integrationslaufzeit auszuwählen. Und jetzt werde ich nur sagen, wo ist der Ort, wo meine Datei gespeichert ist? Und hier ist der Name des Benutzers auf Ihrem Computer. Dies wird Azure Data Factory autorisieren, eine Verbindung mit Ihrer Datei herzustellen. Sie können Ihren eigenen Benutzer verwenden. Hier, ich als Beispiel, werde ich keinen neuen Benutzer erstellen. Ich benutze nur mein eigenes Konto und ich werde meine Verbindung testen. Was weißt du? So wurde es erfolgreich erstellt. Dann können wir weitermachen und die Schöpfung beenden. Und hier sollten wir ein neues Dateisystem Ersteller sehen. Dies ist mein CSV-Gebietsschema-Verstoß. Wie Sie sehen können, haben wir unsere Quelle und unsere Ziele sind wirklich geschaffen. Jetzt müssen wir fortfahren und einen Datensatz erstellen. Gehen Sie auf der linken Seite zum Autor, gehen Sie zu Datasets. Und hier auf den Breadcrumbs Aktionen, neuer Datensatz. Hier müssen wir herausfinden, was das Zeichen der Datensätze ist, mit denen wir es zu tun haben. Denken Sie daran, wir haben einen Link Server als Dateisystem erstellt. Also lassen Sie uns nach Dateisystem suchen. In unserem Fall ist es eine CSV-Datei. Es ist also getrennter Text, den ich als getrennte Datei erstellt habe. Okay, also wählen wir das aus. Das ist mein Dataset-Name. Denken Sie daran, ist nicht der Dateiname, und ich bekomme meine lokale Verbindung hier rein. Ich muss sagen, dass verzweigt ist. Ich könnte Unterordner in meinem Pfad haben, aber da ich keine habe, kann ich diesen Teil einfach ausschließen und sagen, was die Datei ist. Also, da gehst du hin. Es ist jetzt ausgewählt. Ich habe ein paar Optionen zur Auswahl. So könnte ich das Schema importieren oder ein Beispiel aus der Datei erhalten. Ich hätte hier wissen können, wenn wollte etwas später oder einfach nur von Verbindung, Schrägstrich Store. Los, schlüpfen. Jetzt sehen wir mal. Brilliant Wir haben unseren ersten Datensatz. Wir können eine Verbindung herstellen. Es sollte auch so erfolgreich sein. Und hier habe ich viele Dinge, um meine Datei zu manipulieren, wenn ich will. Zum Beispiel, wenn ich die Feldeinrichtungsdatei zitieren wollte , weil anstelle der Zelle Kommas vorhanden sein könnte. Es gibt also eine Menge Dinge, die ich hier tun kann. Also wir Schema und ich kann sagen Import, mein Schema und ich habe Parameter als auch. Es ist alles schon eingestellt. Lassen Sie uns also fortfahren und veröffentlichen, um unseren Datensatz zu speichern. Perfekt, wir haben unsere Suche. Jetzt müssen wir einen weiteren Datensatz für unser Ziel erstellen. Neues Dataset. Ich werde Azure Data Lake auswählen. Markiere ich den Text? Und ich werde sagen, okay, weil ich keinen Speicherort oder keine Datei in meinem Speicherkonto habe, könnte ich eine Ordnerstruktur darin erstellen um eine bestimmte Berechtigungen für einen bestimmten Ordner. Aber lassen Sie uns einfach bei der Standardeinstellung bleiben. Und die Datei sollte auf der Stammebene des Speicherkontos gelöscht werden. Okay, und perfekt, wir hatten unseren zweiten Datensatz. Es ist erschaffen. Also lassen Sie uns hineingehen und es wieder veröffentlichen. Perfekte Veröffentlichungen abgeschlossen. Jetzt müssen wir unsere Pipeline erstellen. Unsere Pipeline erinnern, ist, was wird alle Objekte, die wir gerade erstellt haben, kapseln, das ist der verknüpfte Service, das Dataset hier in der richtigen Größe ist. Jetzt haben wir die Möglichkeit, das für ein bisschen zu verstecken. Also für dieses Beispiel werden wir die Beta-Aktivität Kinderbett und diesen Effektbaum verwenden. Wir haben nur eine Aufgabe, die Quelle und Senke enthält, die Ihr Ziel ist. Hier werden wir die Datensätze auswählen, die wir gerade erstellt haben. Also meine Quelle, wir werden in meinem lokalen Computer sein. Mein Azuri CSV-Testziel wird der Data Lake Gen2 sein. Also lasst uns auf diese Kiste klicken. Es sind beide ausgewählt. Wenn ich nicht in einer bestimmten Datei in meinem Dataset ausgewählt habe, könnte ich Wildcard-Myopathie erhalten und alles unter dieser Datei würde kopiert werden. Ich könnte die Dateien auch auflisten, wenn ich wollte. Sie haben auch eine sehr coole Funktion hier, das sind die Vorschaudaten. Lassen Sie uns darauf klicken und sehen, was zu uns zurückkommt. Brilliant, wenn Sie sich erinnern, das ist die Datei, die wir auf unserem lokalen Computer gespeichert haben. Hier, wie Sie sehen können, behandelt es unseren Header als eine tatsächliche Erholung, richtet die Datei ein, und wir wollen das nicht. Also lassen Sie uns das ausschließen. Hatte es wird die Praxis sein. Einer wird Bestelldatum, Region und so weiter sein, so weiter. Um dies zu tun, müssen wir zurück zu unserem Datensatz, um dieses Problem zu beheben. Lassen Sie uns das noch einmal erweitern, um unsere Datensätze zu sehen. In diesem Fall wird die meine CSV-Datei Test sein. Und hier kann ich konfigurieren, wo die erste Zeile meiner Datei ist? Sie können diese erste Zeile als Kopfzeile auswählen. Okay, es ist alles bereit. Kommen wir zurück zu unserer Pipeline. Und hier auf der Reihe von Dingen können wir wieder, für Ihre Daten, sollten wir die richtige Kopfzeile haben. Schön, es ist alles perfekt und konfigurieren Sie es. Okay, jetzt schauen wir uns unsere Spüle an. Und es gibt nicht viel zuerst zu tun hier ist nur der Fall , dass, wenn wir mit vielen Informationen zu tun haben, übertragen werden, können Sie die Dateierweiterung konfigurieren, die Sie wollen. Sie können das Kopierverhalten konfigurieren. Wenn Sie beispielsweise für den Umgang mit JSON-Dateien die Hierarchie der Datei abflachen möchten. Und hier können Sie sagen, was die Erweiterung ist, die ich in meiner Datei bereit sein werde. Es kann sich ändern, wenn Sie wollen. In meinem Fall werde ich es als CSV-Datei speichern. In meiner Kartierung. Ich muss hier keine Entität machen, weil Studenten bereits importiert haben. Gehen Sie einfach zu Einstellungen. Und hier ist, wie meine 50 mit allen Standardoptionen parallelisiert werden. Und hier sind Benutzereigenschaften und etwas, das ich jetzt keine Ketten machen möchte. Unsere erste Pipeline ist also richtig konfiguriert. Also lassen Sie uns veröffentlichen. Freeland. Wir alle Sets, wir haben unsere Datensätze, Kreative, wir haben unsere Pipelines, wir haben unsere Linked Services erstellt. Das ist ziemlich cool. Lassen Sie uns das jetzt laufen und sehen, wie es funktionieren wird. Jedoch, bevor wir voran gehen, Es gibt einen Hinweis auf Defäkation, die wir auf unserem Datensatz tun müssen, gehen Sie zum Ziel CSV diese Richtung auch. Und wenn Sie sich richtig erinnern, hatte ich leer gelassen. Wir brauchen einen Ordner, um zur Datei zu springen. Wenn ich Browser hier anders hatte, habe ich jetzt einen Ordner und richte den Data Lake ein. Aber Sie müssen dies nicht vorher erstellen. Sie können einfach einen Namen geben, den Sie ein Jahr wollen. Und wenn es nicht existiert, diesen Effekt, schaffen wir das für Sie. Mein CSV-Standort eins. Und dann werde ich das veröffentlichen. Okay, jetzt veröffentlichte Datensätze, das war die einzige Änderung, die ich getan habe. Alles andere ist gleich. Okay, also lasst uns jetzt unsere Pipeline laufen. Okay, damit wir die Pipeline ausführen können, können wir die Debug-Option haben, die heißt, ich möchte das jetzt ausführen, und es hängt nicht von jedem Finger ab. Und dann habe ich auch einen Trigger, was bedeutet, dass ich jetzt auslöse oder ich habe neue und editiere, um einen neuen Trigger zu erstellen. Also lassen Sie uns einfach Debug drücken und gehen Sie weiter und sehen, wie es funktioniert. Okay, unsere Pipeline ist jetzt riesig. Es ist in der Warteschlange der Daten. Und das ist die Schönheit, die, dass Effekt Baum für unsere Tätigkeit geschaffen. Denken Sie daran, dass es hier alles zusammenfasst und alle Teile zusammenfügt, um unsere Daten zu übertragen. Und was weißt du? Unsere Datei wurde übertragen? Denken Sie daran, wir hatten keinen Ordner namens Mäuse ja, Geolocation. Und es wurde sicher geschaffen. So können Sie sehen, es war süß erfolgreich, es wurde erfolgreich übertragen. Nun, in der Dauer, die es für jeden dieser Schritte dauerte, glückliche Tage, haben wir alles eingestellt und unsere Datei sollte auf dem Datensee sein. Aber wie stellen wir sicher, dass es im Data Lake ist? Schauen wir uns mal an. Ich werde zum Portal gehen. Ich würde einfach Portal dot azure.com eingeben. Hier auf der Data Lake Reihe von Dingen werde ich nach Speicherkonten suchen. Und ich habe meinen ADF Data Lake, den wir für dieses Projekt erstellt haben. Und wir haben Storage Explorer Vorschau und wir haben Container. Also, hier in meinem Container, gibt es mein Feuer ein Jahr. Ich komme nur zu meinem Datensatz zurück. Dies ist, wie die Dateien, die ich aufgeteilt. Immer wenn Sie Dateisystem-Hörgeräte sehen, die in einem Container stecken, müssen Sie einen Container haben. Ich werde nur dann Hauptordner hier drin. Ordnen Sie eine Eins. Wie Sie sehen können, zum Data Lake Storage Explorer zurückkehren, gibt es keinen Ordner, der auf der Stammebene definiert wird, so dass Sie sich keine Gedanken über das Erstellen eines neuen Ordners machen müssen. Sie können einfach zurückkommen und Ihrem Dataset einen Namen geben, einen Ordnernamen innerhalb Ihrer Datasets. Veröffentlichen. Okay, toll, es Snow veröffentlicht. Jetzt können wir unsere Pipeline erneut ausführen, unsere Pipeline verzerren und L, es sollte in ein paar Sekunden laufen. So wurde unsere Datei erstellt. So können wir auf zwei Arten überprüfen. Sie können hier anstelle des Datasets erneut aus dem Dateisystem überprüfen Wenn ich zum Speicherkonto zurückkomme, sehe ich meine neuen Speicherorte. Könnte zwei Container erstellt werden. Ich werde diese Zeile auswählen. Und jetzt habe ich einen neuen Ordner und die vorherige Datei, die ich gelöscht hatte. Es muss also eine neue Akte im Jahr geben. Großartig, oder Dateien hier drin, das ist perfekt. Aus unserer Speicher-Explorer-Ansicht können wir mit frisch zurückkommen. Sie können sehen, dass wir einen neuen Ordner und die Dateien hier haben. Cool, das ist alles vorerst. Ich hoffe, Sie haben gemocht. Unser nächstes Beispiel wird es sein, es Bracket-Datei aus Amazon Blutspeicher zu übertragen . Ok. Und dann meine ich nicht, dass diese Datei innerhalb einer Datenbank. Danke. Bleiben Sie dran. 25. Wie du Parquet Dateien von AWS S3 in Azure SQL Datenbank kopiert: Hallo Leute, willkommen zu einer anderen Lektion. Ich hoffe, Sie haben unsere letzte Demonstration genossen. Jetzt werden wir uns ansehen, wie wir Daten von Amazon S3 in SQL Server mit der Kopieraktivität laden können . Dies ist die gleiche Aktivität, die wir zuvor verwendet haben. Der Unterschied besteht jetzt darin, dass der verknüpfte Dienst ein anderes Format hat. Genau wie ein Prereq müssen Sie Ihren eigenen S3-Bucket eingerichtet haben. Das Einrichten von S3-Buckets in AWS ist außerhalb des Geltungsbereichs. Dasselbe für das Einrichten eines SQL Servers. Okay, lass uns die Hände schmutzig machen und sehen, wie das funktioniert. Ich habe hier die AWS. Ich werde aufmachen. Ich habe meine S3, die ich Ozzie Test Training genannt hatte 2020 000. Und wie Sie sehen können, ist der Eimer leer. Bevor wir etwas tun, werden die Daten in Amazon S3 hochgeladen. Ich werde es die Datei zur Verfügung stellen, die ich hier verwende, Es ist nur eine einfache Datei. Also, bevor wir weitermachen und euch zeigen wollen, wie die Akte aussieht. Dies ist ein Projekt, das auf GitHub ist. Hier können Sie eine Vorschau Ihrer Paketdateien anzeigen. Wenn Sie einige Fehler auf Ihrem Computer haben, funktioniert es auch, okay? Also meine Backup-Datei wird Benutzerdaten Punktklammer genannt. Also habe ich gerade diese und diese Show Tabelle hier ausgewählt. Und ich werde die Datei einreichen, weil ich nur schnell sehen möchte, wie es aussieht. Also sehen Sie, hier sind nur eine einfache Daten, Haufen zufälliger Sachen, okay? Es gibt, es gibt genug Daten für uns, um uns herum zu verwirren. Wenn Sie also einen Blick auf diese Websites werfen möchten, wenn Sie eine Chance bekommen, heißt es Ihre online.com Rate. Wir wissen also, wie unsere Akte aussieht. Laden wir diese Datei nun in Amazon S3 hoch. Es ist ziemlich einfach, einfach hochladen oder hochladen hier oben. Deine Wahl. Fügen Sie also Dateien hinzu. Ich werde diese Datei und Benutzerdaten ein nehmen, Es ist ganz wie Modifikatoren, nur ein 100 Kilobyte. Ich werde die Datei hochladen. Es sollte nicht lange dauern. Es ist gelungen. Ok, es ist fertig. Also haben wir unsere Datenstadt auf Amazon S3. Okay, kommen wir zurück zu Azure Data Factory. Ich werde unseren ersten Linkerd-Service einrichten , den wir uns ansehen werden, Amazon S3. Gehen wir also weiter und klicken Sie auf Verwalten und verknüpfte Dienste. Der neue Amazon S3 wird hier oben sein. Ich denke, eine sehr häufige Anforderung, Daten von Amazon S3 zu erfassen. Ich weiß, dass Microsoft eine riesige Menge Geld investiert hat , um diese Konnektivität zuverlässig und schnell zu machen. Gehen wir also weiter und klicken Sie auf Amazon S3 und nennen Sie es als Mein erstes Amazon S3. Wenn Sie sich erinnern, einer der Anwendungsfälle die automatische Auflösung Integrationszeit oder Zurich Integrationslaufzeit das Verschieben von Daten oder der Zugriff auf Ressourcen in verschiedenen Clouds. Dieser Fall hier, würden wir mit meiner Microsoft-Spezifikation Anleihe sprechen uns AWS. Hier haben wir zwei Möglichkeiten. Wir haben den Zugangsschlüssel. Wenn Sie einen Benutzer in AWS erstellen, erhalten Sie einen Zugriffsschlüssel und einen geheimen Schlüssel. Dies ist die erste Option, um sich beim Amazon-Service zu authentifizieren, oder Sie haben temporäre Anmeldeinformationen. Im Grunde ist dies ein Token, das Ihnen gewährt wird und nach einer Weile abläuft. Also werden wir den Zugriffsschlüssel für diesen Fall verwenden. Und ich werde einfach hier einfügen und dieser Schlüssel wird vorübergehend sein. Und ich werde meinen Zugangsschlüssel einfügen, und jetzt bekomme ich meinen geheimen Zugangsschlüssel. Okay, jetzt, wo wir unseren geheimen Zugriffsschlüssel haben, haben wir eine Option hier genannt dient die URL. Im Grunde ist dies, wenn Sie über einen anderen Endpunkt auf S3 zugreifen möchten, können Sie dies auswählen. College hat drei Anschlüsse, die Sie hier zu etwas anderem ändern möchten. Wenn Sie wirklich wissen, was in den meisten Fällen Tränen, wird es leer sein. Nun möchten Sie vielleicht Ihre Verbindung testen, um zu sehen, ob Ihr S3 es existiert oder ob Ihr Benutzer ordnungsgemäß läuft. Okay, also ist es eine gute Idee, den Dateipfad auszuwählen. Hier übergeben wir den Namen unseres Buckets, der ADF Training sein wird oder einfach aus dem Bucket kopiert wird. Also verschwenden wir keine Zeit. Also n hier, da wir kein Verzeichnis innerhalb der Buckets haben, die wir erstellen könnten, wenn wir hinzufügen wollten. Aber es ist auf der Wurzelebene. Okay, also geben wir uns das und testen Sie die Verbindung. Ja, es funktioniert alles. Jetzt sind wir alle bereit, Daten von Amazon S3 zu erhalten. Lassen Sie uns das Jahr erstellen. Und es wurde erschaffen. Jetzt müssen wir uns unsere SQL-Datenbank ansehen. 26. ADF Linked Service für Azure SQL-Datenbank: Ich werde jetzt zum Azure-Portal wechseln. Also würde ich nur suchen oder SQL-Datenbank, die ich erstellt habe. Ich habe eine ziemlich kleine SQL-Datenbank erstellt. Und mal sehen, wie es geht. Sie haben eine Reihe von Konfigurationen. Wie Sie sehen können, habe ich nur 20 Mega-Raum, aber da unser Obermaterial nur ja, 100 KB besetzt , sollte es uns gut gehen. Alles klar, was wir hier jetzt tun müssen, ist folgendes. Wir müssen den Servernamen zu bekommen, so dass wir schaffen bereit sind, als zu dienen. Also werde ich das kopieren, kommen Sie zurück zu Data Factory und klicken Sie auf den neuen Lincoln-Service. Dann werde ich nach SQL suchen. Ich werde nur aus CSER hören SQL-Datenbank auswählen. Und wieder werden wir die Auto-Resolution-Integrationslaufzeit verwenden, okay, weil wir uns innerhalb des Azure-Backbone befinden, gibt es keinen Sinn für uns, zum selbst gehosteten zu kommen und zurückzukommen. Also werden wir, wir können, wenn wir aus irgendeinem Grund ein Band auf einem Samengeld wollen und keine Rechenressourcen von CSER verwenden. Das ist möglich, aber dafür gibt es eine Leistungsstrafe. Also lassen Sie uns einfach bei dieser Option bleiben. Und ich habe gerade für mein Abonnement ausgewählt. Ich werde meine 78 bekommen, weil sie bevölkert wird. Ich musste eigentlich nichts tun. So in Ordnung. Wie Sie sehen können, habe ich hier bereits eine Datenbank erstellt. Das ist ein ADF-Zug ist gleich. Und was ich jetzt tun werde, ist, eine Anmeldeinformationen für meine SQL-Datenbank zu erstellen. Ich habe mein traditionelles Setup nicht, ja. Wie Sie sehen können, habe ich drei und Methoden, um sich bei meiner Datenbank zu authentifizieren. Ich habe SQL-Authentifizierung. Es ist nur ein Benutzer und ein Passwort, das eSight der Datenbank erstellt wird , ist es die Standard-Anmeldeinformationen. Sie haben auch die Managed Identity. Verwaltete Identität ist der Benutzer, der mit Data Factory erstellt wird. Es enthält also den Data Factory-Namen, so dass Sie das Passwort nicht bekommen können, ist es alles hinter den Kulissen. Außerdem erhalten Sie die Möglichkeit, Dienstprinzipaldienstprinzipien wie Anmeldeinformationen eines Dienstkontos zu verwenden . So haben Sie die Mietverhältnisse und Sie haben die Teilnehmer spitz und Service-Prinzip Schlüssel. sind also Dinge, die Sie konfigurieren müssen. Aber was ich hier tun werde, da es weniger Ärger ist zu erstellen und auch sicherer ist die verwaltete Identität. Ich werde nur bei dieser Option bleiben. Ich muss nur sicherstellen, dass meine Datenbank den Zugriff auf dieses Objekt autorisiert hat. Dazu öffne ich mein Management Studio und sehe, wie es konfiguriert ist. 27. Wie du die Berechtigungen auf Azure SQL DB Grant: Okay, ich habe mein Management Studio geöffnet und ich habe mich auf meinem virtuellen SQL Server angemeldet. Und wie Sie hier sehen können, habe ich eine einfache Datenbank erstellt. Diese Datenbank ist leer. Es gibt keine Tabellen, auch keine Logins. Also, was wir hier jetzt tun müssen, ist, einen Benutzer mit dem Namen der Data Factory zu erstellen. Auf diese Weise wird SQL Server verstehen, dass es sich um eine verwaltete Identität handelt. Die Syntax, um den Benutzer zu erstellen, ist also die folgende. Wir werden einen neuen Abfrage-Editor öffnen, okay? Und dann geben wir Benutzer ein. Und ich muss den Namen meiner Data Factory bekommen. Also werde ich einfach zu dieser Fabrik zurückkommen. Ich werde es nochmal kopieren. Der Name des Benutzers, gehen Sie zurück zu Management Studio. Geben Sie hier den Namen des Benutzers ein. Und so funktioniert es von externen Providern. Wie Sie sehen können, gibt es hier kein Passwort, sondern nur einen externen Anbieter, der diesen Benutzer anzeigt, dass ich in Active Directory existieren würde. Es gibt jedoch noch etwas, das wir tun müssen. Erster. Wenn Sie auf Ausführen klicken, wird hier eine Fehlermeldung angezeigt. Es besagt, dass Verbindungen hergestellt werden können, wenn mit Active Directory-Konto. Ok? Wie ich Ihnen am Anfang gezeigt habe, bin ich mit verbunden, und ich sage ein County, das ist eine SQL-Protokollierung. Damit ich einen Benutzer aus dem Active Directory erstellen kann, muss ich mit einem I, einem AD-Konto verbunden sein. Um dies zu tun, werde ich Ihnen schnell zeigen, wie es auf dem Portal innerhalb des Azure AD funktioniert , damit Sie weiterverfolgen können. Okay, das ist etwas außerhalb des Geltungsbereichs dieses Trainings, aber damit du weiterführst, werden wir sehen, wie es funktioniert. Suchen Sie also nach Azure Active Directory. Wenn Sie dazu Rechte haben, suchen Sie natürlich auf der linken Seite auf der linken Seitenach Gruppen und erstellen Sie eine neue Gruppe. Ich werde es uns einfach bei mir nennen. Und dann nehme ich hier die Zahlen auf. Ich werde nach meinem Benutzer suchen, bei dem es sich um einen Benutzer handelt, bei dem ich in einem Moment angemeldet bin. Jetzt müssen wir zum Portal zurückkehren. Und ich werde zu meinem SQL Server gehen und mehrere neu erstellte Active Directory AD-Domäne auswählen. Wie Sie sehen können, wurde kein Active Directory Udemy festgelegt. Ich werde Admin festlegen, und dann werde ich die osmanische Gruppe auswählen, die wir gerade erstellt haben. Wählen Sie aus. Dann „Speichern“. Großartig, es ist jetzt gerettet. zurück in mein Managementstudio komme, sollte ich in der Lage sein, mich mit meinem Konto einloggen zu können. Okay, also lass uns eine neue Verbindung eröffnen, denselben Server. Ein Unterschied wird jetzt universell mit MFA sein. Sie müssen eine der neuesten Versionen von Management Studio verwenden , damit diese Option für Sie verfügbar ist. Ok. Ich glaube, es ist von den 18 Stunden. Das ist also meine E-Mail-Adresse. Ich würde sehen, ob es funktioniert. Ok. Es wird mich zur Eingabe meines Passworts auffordern. Ok, großartig. Ich bin jetzt Connectors noch jetzt bin ich der Udemy dieses Kontos, weil ich nur mein eigenes, eigenes Udemy-Konto eingerichtet habe, das innerhalb der Gruppe als Active Directory-Domäne ist. Also kann ich hier alles tun, anstatt dieses Kontos. Nun, kommen wir zurück und öffnen einen neuen Abfrage-Editor unter meinem neuen Konto, okay, und meine E-Mail. Ich werde die gleichen Aussagen ein wenig vorher kopieren, dann im Grunde in hier und auf Ausführen drücken. Brilliant Okay, es ist jetzt erschaffen. Wir haben ein neues Konto unter einer Datenbank. Okay, dies ist ein in der Datenbank enthaltener Benutzer , der auf ein Objekt in Active Directory verweist. Und dann können Sie sehen, dass hier erstellt wird. Wir müssen diesem Kerl jetzt Berechtigungen gewähren, weil in dem Moment, in dem er nur Berechtigungen hat, um eine Verbindung herzustellen. Also müssen wir gehen und die Erlaubnis zu diesem Kerl. Denken Sie daran, ich habe die Ehre gewährt, dem Benutzer. Weil ich nichts eingeschränkt werden will und ich exekutiert treffen werde. Okay, es ist jetzt als Jenseits gewährt. Kommen wir zurück zur Data Factory und testen. Okay, es ist hier. Es ist dasselbe, wie du siehst. Das ist die Verbindung. Und die Aktion schlägt fehl. Mal sehen, warum es scheitert. Okay, wenn wir noch etwas auswählen, sollten wir eine Nachricht haben. Okay, also ist die Client-API-Adresse nicht berechtigt, auf diesen Server zuzugreifen. Großartig. Dies ist also ein Problem mit einer Firewall. Wir können das schnell beheben. Gehen wir zurück zum Server. Und hier drin sollten Sie die Firewall und die virtuellen Netzwerke haben. Hier habe ich meine Client-IP-Adresse. Was ich hier tun muss, möchte ich nur sicherstellen, dass uns Ressourcen und Ressourcen an den Server zwei ermöglichen. Ja. Also, was bedeutet, dass alle Azure-Dienste, werden Sie in der Lage, meinen Datenbankserver zu erreichen. Also drücken Sie Speichern und es wird aktualisiert, wenn ich Regeln waren, okay, es ist nicht aktualisiert. Also gehen wir zurück zu diesem Effekt-Baum und wir werden es noch einmal testen, erreichen, dass es erfolgreich verbunden ist. Jetzt werde ich einfach überspringen, wie es im Moment ist. Cool. Wir haben unsere Linked Services, unsere Quelle und unsere Zielquelle B, AWS eingerichtet unsere Quelle und unsere Zielquelle B, und zielgerichtet in der SQL-Datenbank eingerichtet. Jetzt müssen wir fortfahren und das Dataset erstellen. 28. Wie du die Berechtigungen auf Azure SQL DB Grant: Hallo an alle. Nachdem wir nun unsere Linked Services erstellt haben, müssen wir unsere Datensätze erstellen. Gehen wir zum Autor. Dann. Klicken Sie auf der linken Seite auf Aktionen und neue Datensätze. Beginnen wir einfach mit Amazon S3, die unsere Quelle ist, wird das. Und dann weiter. Hier müssen wir unseren Beta-Typ auswählen, bei dem es sich um eine Datei handelt. Lassen Sie uns auswählen und verriegeln. Und mein verknüpfter Service wäre mein erster Amazon S3. Dann klicke ich auf OK. Jetzt haben wir unseren Datensatz erstellt oder S3. Lassen Sie uns eine für SQL Server erstellen. Gehen wir rein und zwicken und Nutella suchen. Lassen Sie uns für Azure suchen und hier gebunden können Sie Azure SQL-Datenbank finden. Klicken wir auf das Kontinuum. Dann bekomme ich meinen ersten SQL-Datenbank-Linked Service. Wie Sie sehen können, habe ich keine Tabelle erstellt. Ok. Es ist ziemlich unkompliziert. Wir haben die Zeiger auf unsere Datensätze erstellt. Eine interessante hier zu beachten ist, dass wir hier etwas auswählen müssen, das Baum braucht zu wissen, wo die Daten gesendet werden. Wenn Sie also hier auf Nicht klicken, Sie beim Erstellen unserer Pipeline erhalten Sie beim Erstellen unserer Pipelineeine Fehlermeldung. Da wir also keine Tabelle erstellt haben, ist unser Ziel hier, eine Tabelle zur Raumzeit mit dem gleichen Schema unserer Archivdatei zu erstellen . Um dies zu tun, können wir auf Bearbeiten klicken und dann geben Sie es einen beliebigen Namen, den Sie wollen. Sie müssen zuerst den Schemanamen übergeben. Und dann wird das mein Benutzer oder ein einfacher, okay, so benenne ich meine Tabelle. Cu haben wir unsere beiden Datenquellen erstellt. Jetzt müssen wir unsere Pipeline schaffen, die unsere Aktivitäten auslösen wird. Gehen wir also voran und klicken Sie hier auf Aktionen. Und neue Pipeline. Wir werden auch die Kopieraktivität hier verwenden. Lassen Sie uns die Optionen hier wirklich schnell durchgehen und sehen, was wir brauchen. Also lassen Sie es uns als Kopie nennen. Das ist der Name unserer Tätigkeit. Unsere Quelle wird die S3 sein, die wir gerade erstellt haben. Dann wählen wir das pro Kit aus, und dann haben wir hier ein paar Optionen, aus denen Sie wählen können. In diesem Fall gebe ich Informationen weiter, die ich in meinem Datensatz habe. Aber wenn ich etwas dynamischeres erstellen wollte, könnte ich ein Präfix einer Datei oder eines Platzhalters oder sogar eine Liste von Dateien erhalten. Also hier drin kann ich die Chance bekommen, den S3-Eimer zu erkunden. Bleiben wir einfach bei dieser Option hier drin. Gehen wir weiter und gehen zur Synchronisierung. Sync wird unser Ziel sein, das ist die SQL-Datenbank, die wir erstellt haben. Ich möchte äußere Erstellungstabelle auswählen, okay? Denn wie Sie dies sehen können, erstellt dies automatisch eine Stall an meiner Senke, wenn die Tabelle nicht existiert, was den Namen, den ich auf meinem Dataset hatte. Dies ist, wenn ich die Schriftstellen für ein Zimmer kopieren möchte, Art Automatisierung oder ein Vorbereitungsskriptjahr. Dies ist das Timeout oder mein Batch auf die Stapelgröße, wenn auf einem handverlesenen, dass, sagen wir für eine Grundgesamtheit und 1000 Datensätze pro Batch oder eine andere Zahl. In der Regel werden Sie mit der Standard-Options-Mapping bleiben. Wir können dies leer lassen, da automatisch Data Factory, wir werden die Tabelle basierend auf der Partei der Datei erstellen. Das sind also die Datenintegrationseinheiten. Es kommt zur automatischen Auflösung Integrationszeit. Hier können Sie angeben, was die Leistung Ihrer Auto-Resolution-Integrationslaufzeit ausmacht. Wenn Sie sagen, auto factory basiert auf seinen eigenen Regeln, werden wir mehr Ressourcen, automatische Datenkonsistenz und Überprüfung finden hier nur im Grunde angeben, ob Ihre Wortzahl an der Quelle und der Senke übereinstimmt. Alle zum Verschieben von Dateien über, es wird die Größe der Dateien zu erhalten, die es überprüfen. Binär der Dateien ist, dass wir zusätzliche Dauer Ihrer Gesamtlast hinzufügen, weil am Ende, es ist immer noch notwendig, um die Daten und Systeme Verifizierung zu verarbeiten. Hier ist die Fehlertoleranz. Darum brauchen wir uns keine Sorgen zu machen. Aktivieren Sie Protokollierung, Protokollierung, wenn Sie möchten, sagen wir, wenn Sie eine Fehlertoleranz haben und Datensätze überspringen möchten, und Sie möchten sehen, was die Euro, die passiert ist. Sie können die Protokollierung aktivieren und einen Data Lake oder einen Blob-Speicher angeben , um diese Protokollmeldung abzulegen. Okay, also werde ich dies nicht auswählen und Staging aktivieren, was bedeutet, dass Sie, bevor Sie Ihre Daten in Ihre Datenbank laden, Daten manchmal auf Ihrem Blob Storage oder Data Lake bereitstellen können , abhängig von der Größe Ihrer Last. Dies kann hilfreich sein, da Sie beim Laden in einen Staging-Bereich die Daten parallel laden. Sie können mehr Durchsatz erzielen. Ihre Daten sollten aufgrund der Netzwerkverteilung schneller aus dem Data Lake zu SQL Server gehen. Auch hier hängt es von der Größe Ihres Datasets ab. Sie müssen experimentieren und sehen, wie es geht. Wir werden die Inszenierung nicht aktivieren. Und hier an unserer Quelle können Sie Ihren Datensatz öffnen. Sie müssen nur den Bucket-Namen übergeben, den wir erstellt haben. Und hier kannst du die Verbindung testen, okay? Und Sie können den S3-Bucket erkunden, wenn Sie über ausreichende Berechtigungen verfügen. Lass uns gehen und erkunden. Und hier können Sie den Namen meines S3-Buckets sehen, und ich kann darauf klicken und ich kann alle Dateien sehen, die ich in diesem Bucket habe. Ich werde nur UserData Wine dot auswählen. Und wie Sie sehen können, ist es auf der Roots-Ebene, also muss ich das Verzeichnis nicht angeben. Und ich kann auch eine Vorschau der Daten sehen und sehen, wie es aussieht. Das ist ziemlich gut. Das ist also ein gutes Zeichen, dass wir uns verbinden können und wir erreichen können. Und lassen Sie uns behalten, veröffentlichen oder gut. Lassen Sie uns das laufen und sehen, wie es aussieht. Also zuerst, lassen Sie uns einen kurzen Blick auf unsere SQL Server-Instanz und sehen, ob wir Tabellen erstellt haben. Wie Sie sehen können, sind die Leute leer. Und gehen wir zurück zu diesem Effektbaum in unserer Pipeline und sehen, ob wir eine neue Tabelle haben werden. Wir haben Einblicke in die Datenmenge gemacht. Okay, also lasst uns oben sein. Es steht im Moment in der Warteschlange. Es macht Fortschritte. Und was weißt du? Es ist gelungen? Es ist ein gutes Zeichen. Werfen wir einen kurzen Blick auf unsere SQL Server-Instanz. Lasst uns das auffrischen. Großartig. Unser Tisch ist da. Lassen Sie uns nun einen kurzen Blick auf das Ergebnis dieser Tabelle werfen , die die Ergebnisse dieser Tabelle ausgewählt hat, und sehen, ob die Daten vorhanden sind. Einfache Select Statement und unsere Daten sind hier. Sie können sehen, dass die Tabelle automatisch erstellt wurde. Nur eine Sache, die Sie beachten müssen, ist der Datentyp Ihrer Tabelle. Da es Ihren Tisch im laufenden Betrieb trifft, weiß es nicht wirklich genau, wie viel Platz es Ihren Daten geben sollte, Ihren varchar-Daten, es wird basierend auf Ihrer Parkett-Datei erraten wollen. Wie Sie sehen können, wenn Sie die Tabelle überprüfen, die Datentypen Ihrer Spalten. Alles kam wie jeder varchar max in null. Und lasst uns sehen, Gehalt kam AS Float. Du musst deinen eigenen Urteilsspruch machen. Okay, kommen wir zurück zu unserer Data Factory und fügen wir unserer Pipeline ein wenig Komplexität hinzu. 29. Parquet in den Data See und Azure SQL: Hallo und willkommen zurück. In diesem Anwendungsfall erhalten wir denselben Datensatz von Amazon S3. Aber anstatt die Daten direkt an die Datenbank zu senden, werden wir einen Zoo verwenden, in dem wir unsere Landungen wählen, könnten Sie einen Datensee haben, um alle Ihre Quellen als PDF-Datei vor dem Heiligen in Ihren Kampf und auf diesem Nation. Dies ist ein häufiger Anwendungsfall, da Benutzer Ihre Daten manchmal mit Databricks, HDInsight behandeln möchten . Versuchen wir also, diesen Anwendungsfall nachzuahmen und die gleiche Parkett-Datei zu verwenden, um unsere Datenbank zu übertragen und sicherzustellen, dass die Datei auf dem Datasee existiert. In diesem Beispiel beginnen wir mit der Veröffentlichung von unserem letzten Beispiel. Cool. Gehen wir zurück zum Autor. Lassen Sie uns das erweitern und lassen Sie uns einen neuen Datensatz erstellen, um unsere Parkett-Datei zu übertragen. Ich werde einen neuen Datensatz erstellen. Es wird Amazon S3 sein. Aber anstatt Parkett-Datei zu sein, werde ich binäre Datei auswählen. Also auf diese Weise habe ich nicht zu Egypt Parkett Datei auf Amazon S3 in meinem verknüpften Dienst wird die gleiche sein. Nur mein Dateipfad hier, Sie geben den Namen unseres Buckets an, 2020 0, 0, und das ist leer. Wir können die Buckets von hier aus erkunden, und wir werden die gleiche Datei auswählen. Sehen Sie also, dass Sie dies tun können, wenn Sie das Dataset erstellen, wo es nach der Erstellung keinen wirklich Unterschied zwischen den beiden gibt. Lasst uns anklicken. Ok. Großartig. Wir haben unsere Quelle geschaffen. Jetzt. Wir müssen unsere Landungen auf Datensätzen erstellen, die ein Data Lake Gen2 sein werden. Wählen wir diesen Kerl aus. Dies wird auch eine Binärdatei sein. Fortsetzung. Es wird mein erster verlinkter Dienst sein. Dies ist, wenn ich es in unserem ersten Beispiel erstelle. Also muss ich das Dateisystem auswählen, das ein Container ist. Und Sie können Sie sehen, dass wir zuvor erstellt. Ich will mich nicht anhängen. Selbst wenn es nicht existiert, kann ich ihm hier einen Namen geben und es wird automatisch von Azure Data Factory erstellt. Nun, hier im Inneren werde ich als AWS unser Dateiverzeichnis nennen. In Ordnung, das ist also kreativ. Wir wollen jetzt veröffentlichen, nur um sicherzustellen, dass unsere neuen Datensätze ich erstellt. Was wir hier jetzt tun müssen, ist, dass wir unsere Pipeline erstellen müssen unsere Partei eine Datei von AWS zu Azure Data Lake übertragen wird. Das ist der Name meiner Pipeline. Also werden wir Kopierdaten verwenden. Meine Quelle wird binäre Übertragung AWS zuerst beschafft werden, dann werde ich mit dem Standard in Ihrem Waschbecken gelernt bleiben, ist auf Data Lake Gen2, nicht wahr? Lassen Sie uns diese Option veröffentlichen. Richtig? Lassen Sie uns diese Pipeline jetzt ausführen und sehen, ob wir die Daten in den Clouds übersetzen können. Cool, lass uns gehen und debuggen. Und es wird Geld anfangen. Es ist im Gange. Okay, es ist fehlgeschlagen. Wir können die Fades Nachricht hier überprüfen und so können wir einen kurzen Blick auf den Grund werfen. Es sagt also, dass Dateisystem einen Namen hat, der ungültig ist. Es sagt also, dass es Zeichen enthält, was der Unterstrich ist. Das ist also ziemlich einfach zu lösen. Ich habe das absichtlich gemacht, damit ihr sehen könnt welche Barrieren es manchmal passieren könnte. Gehen wir zurück zu unserem Datensatz und wir können das entfernen. Und lassen Sie uns es als Leihgabe behalten, roh ohne den Unterstrich gleichen Verzeichnis-Site leihen. Gehen wir in unsere Pipeline. Verschiebt Daten in die Lernergebnisse auf, und gehen Sie voran und debuggen. Niedlich, es ist im Gange. Mal sehen. Großartig, es ist gelungen. So eine Möglichkeit, dass wir erkunden können, dass wir zurück zu unserem Landungszonendatensatz kommen und Sie können auf Durchsuchen klicken. Und wenn Sie zurück hierher gehen, denken Sie daran, bevor es nur zwei Container gab, jetzt haben wir einen dritten. Und hier haben wir den AWS-Ordner, Das ist der Ordner hier neu erstellt. Und hier haben wir unsere Party-Akte. Okay, das ist großartig. Jetzt müssen wir diese Datei aus dem Data Lake in die Datenbank verschieben. Bevor wir dies tun, stellen wir sicher, dass die Datei existiert, bevor wir in die Datenbank wechseln, damit wir Fehler vermeiden können , oder wir können hier eine Art von Validierung erstellen , um eine Nachricht an den Anbieter der Daten zu senden. Die Datei existiert nicht. In Ordnung, also gehen wir zurück zu unserer Pipeline. Und nehmen wir eine, eine allgemeine Aktivität, die nachschlagen wird. Eine Nachschlageaktivität. Karriere ist alle Datasets, die als Datenquelle innerhalb von Data Factory unterstützt werden. Sie können auch Tabellen erstellen. Es kann die gespeicherte Prozedur ausführen. Also lassen Sie uns diese Lookup-Aktivität hier verwenden, und wir werden zu Einstellungen gehen und wir müssen unser Quell-Dataset auswählen, das in diesem Fall die Parkett-Datei sein wird, die wir in unsere Landezone übertragen haben. Lassen Sie uns also fortfahren und unseren neuen Datensatz erstellen, denn wie Sie sehen können, steht er uns nicht zur Verfügung. Also gehen wir in Neu und wählen Data Lake Gen2 Fortsetzung. Es wird Parkett-Datei sein. Dann wird es mein erster verlinkter Dienst sein, richtig? Lassen Sie uns also untersuchen, dass verlinkte Server. Gehen wir nach London in RA, das ist unser Container AWS-Ordner, und das sind unsere Daten. Bleiben wir einfach bei der ersten Option. Klicken wir auf „OK“. Alles klar, also nur erste Reihe, das ist okay. Für unsere Probe. Keine Eigenschaften. Dann können wir diesen Kerl in den Lookup wechseln. Lookup stellt sicher, dass die Datei vorhanden ist. Nun, da wir gerade unsere Suche erstellt haben, um sicherzustellen, dass unsere Datei existiert. Kommen wir zurück und holen uns unsere Kopierdaten. Wieder. Das ist ein Schritt. Wir werden die Daten aus dem Data Lake in die Datenbank übertragen. Alles klar, also lasst uns das zusammen ändern und uns unsere Quelle holen. Und wir haben hier eine Quelle gemacht. Kann das, das gleiche Dataset, das wir gerade für die Lookout-Aktivität erstellt haben, da es an der gleichen Position suchen wird. Alles klar, damit wir diesen Datensatz öffnen und bestätigen können, dass es das ist, was wir wollen. Kommen wir zurück in die Pipeline. Und lassen Sie uns unsere Senke auswählen, die wir die Azure SQL DB Senke verwenden, die unser Ziel ist. Auch hier müssen wir eine Tabellenoption angeben, bekannt ist, wenn wir die gespeicherte Prozedur und Auto Create verwenden, um die Tabelle zu erstellen. Wenn es nicht existiert, wird es sich auf den Tisch verlassen. Wir geben es im Datensatz an. Da die Tabelle wir existieren würden, wird es die Erstellung überspringen. In Ordnung, also kommen wir zurück zu unserer Pipeline. Ja, wir sind bereit zu gehen. Also haben wir hier unser Szenario, das ich einrichten werde. So übertragen wir die Daten von Amazon S3-Bucket in den Data Lake , der ein echter Ingenieur ist. Wir haben eine letzte Überprüfung, um sicherzustellen, dass das Feuer korrekt übertragen wurde. Sobald es, ist dies gültige Daten, wie wir die Datei, den Inhalt der Datei in eine Datenbank verschieben . Also, wenn Sie wollen, können Sie dies umbenennen. Also lassen Sie uns Ihren Butan veröffentlichen. Weil abgeschlossen. Und gehen wir weiter und klicken Sie in den Bug. Aber zuerst, lassen Sie uns einfach eine schnelle Städte der Daten machen. Auf unserem Tisch. Wir haben 1000 Aufzeichnungen. Mal sehen, wie viele Aufzeichnungen wir haben werden, nachdem wir unsere Pipeline ausgeführt haben. Also lasst uns Debug drücken. Der erste Schritt ist erfolgreich. Und es wird das zweite auch gelungen überprüfen. Und es wird nun die Daten in die Datenbank verschieben. Es ist im Gange. Auch gelang es gräulich. Lassen Sie uns nun überprüfen, wie viele Datensätze wir in der Datenbank haben. Und ich werde Execute treffen. Machen Sie 1000 Aufzeichnungen, was unser zweiter Versuch ist. Und obere Arcade-Feuer hat eine 1000 Rekorde. So können wir hier sicherstellen, dass alles erfolgreich ausgeführt wurde. Ein Interessantes hier, um jetzt zu bemerken, ist, wie wir alles überwachen, was wir gerade getan haben. unserer nächsten Lektion werden wir überprüfen, wie wir all jene Hinrichtungen überwachen, die wir bereits tun. Und diejenigen, die auch die Vergangenheit führen. Also bleib dran und bis bald. 30. ADF Ausführung: Hallo, und willkommen zu einer anderen Lektion. In dieser Lektion werden wir untersuchen, wie wir die Ausführung von Pipelines überwachen. Sie müssen sich daran erinnern, dass wir in unseren letzten Illustrationen die Fehleroption verwendet haben. Die Debug-Option löst die aktuelle Pipeline aus. Und das ist deine Sitzung. Diese Option ist für etwas, das die Entwickler an einem Feature-Zweig arbeiten oder etwas, das nur für den Moment ist und nicht gesperrt werden sollte. Wenn jemand anderes die Ausführung meiner Pipelines zu einem späteren Zeitpunkt überprüfen möchte, würde diese Exekutionssphäre nicht erscheinen. So, wie wir sicherstellen, dass alles protokolliert wird und wie wir verstehen, die wahre aufgestellt etwas, das wir nicht anwesend waren, als lief. Haben Sie jetzt die Möglichkeit, Trigger zu machen. Trigger jetzt werden wir ausführen, was veröffentlicht wurde und wir werden die Ausführung der Pipeline protokollieren. Also lassen Sie uns jetzt Trigger für die gleiche Pipeline, die wir zuvor gemacht haben. Und Sie können keine Aufzeichnungen finden. Wir können weitermachen und auf OK klicken. Und es wird meine Pipeline wieder ausführen, wie wir es vorher getan haben, aber mit der Option Trigger now wurde unsere Pipeline gestartet. Wir können zum linken Fensterbereich zurückkehren und auf Monitor klicken. Und Sie können sehen, dass es bereits gelungen ist. Hier ist, wo Sie alle Ausführungen Ihrer Pipelines sehen können. Und wenn ich darauf klicke, können Sie sehen, dass die gleichen Aktivitäten erfolgreich ausgeführt wurden. Und Sie können mit diesem kleinen Glas überprüfen, die Details Ihrer Übertragung. Klicken Sie darauf. Sie können sehen, dass meine Übertragung, es kam aus dem Data Lake Gen2 und ging zu meiner Azure SQL-Datenbank. Und hier ist der Durchsatz meiner Übertragung. Und wie viele Aufzeichnungen wurden übertragen. Die P-Verbindungen, das ist etwas, das von ADF gesteuert wird und die Größe der in meine Datenbank geschriebenen Daten. Riesige Anzahl von Dateien lesen die gleiche Menge an eingefrorenen und Aktionen. Und hier sehen Sie eine Aufschlüsselung meiner Aufgaben. Auch dies ist etwas, das hinter den Kulissen ausgeführt wird, das wir keine Kontrolle haben. Dies ist die Warteschlangenzeit, die Pre-comp, das Skript-Übertragungssystem. Wie Sie sehen können, da wir kein Pre-Copy-Skript haben, war es 0. Und dann ist die Übertragung selbst sehr nützlich in jedem, der Zugriff auf meine Datenfabrik hat, das sehen könnte. Wir können sehen, dass sie auch aufladen können. Und das sind die Hinrichtungen meiner Pipelines, wie wenn man angefangen und beendet hat. Die zweite, die meine Datenprüfung ist, und die dritte, die in das Dateiziel eingefügt wird. Wir können es wieder ausführen und sehen diesen eigentlichen Prozessauslöser jetzt. Ok? Und wenn Sie direkt auf den Monitor gehen, können Sie sehen, dass es in Arbeit ist. Sie können darauf klicken. Und Sie können sehen, dass die erste erfolgreich ist. Kann aktualisiert werden. Der zweite ist schief. Jetzt. Es ist im Gange. Wurde erfolgreich sein. Die zweite ist jetzt Cuz und es ist in Bearbeitung und fertig. Okay, also sollten wir 40.000 Aufzeichnungen in unseren Tisch haben, richtig? Es ist also alles gut. Wenn wir also zu unseren Pipelines zurückkommen, können Sie sehen, dass es jetzt protokolliert ist. Jedes Mal, wenn ich meine Data Factory öffnete, sollte ich in der Lage sein, den militärischen Teil zu sehen. Okay, nehmen wir an, Ihre Pipeline ist ebenfalls fehlgeschlagen. In Ordnung, also haben Sie die Möglichkeit, die Pipeline auszuführen und es wird, wir führen von dem Moment aus oder von der Aktivität aus, in der sie gestoppt wurde. Wir müssen Ihre gesamte Pipeline nicht erneut ausführen. Stellen Sie sich vor, Sie arbeiten über Nacht an einem sehr großen Transfer. Und dann musstest du nach Hause gehen und warten. Und du hattest neulich fertig und eine der Statistiken ist fehlgeschlagen, aber all deine massiven Daten wurden bereits übertragen. Dann könntest du einfach auf erneut klicken. Und es würde, wir beginnen von dem Moment, wo Sie fertig sind, was ziemlich cool ist. Hier haben Sie die Möglichkeit, auf Verbrauch zu klicken und zu sehen wie viel die IU Stunde es verbraucht hat. Also, was ist die Bewegung von Aktivitäten. In Ordnung. Wenn wir also mehr Pipelines hätten, würden Sie sehen, wie sie sich überlappen Chartern hier, Sie haben die Möglichkeit, in den letzten sieben Tagen und zyklische benutzerdefinierte Daten auszuwählen , um die Ausführung Ihrer Pipelines zu sehen. Standardmäßig sind es immer 24 Stunden. - Ja. Es ist also ein sehr umfangreiches in ganz einfach für Sie, die Ausführungen Ihrer Pipelines zu untersuchen. Alle von ihnen haben eine VLAN-ID, eine eindeutige Ansichtspunkt-ID. Und auch hier haben Sie die Möglichkeit zu sehen, was der große Faktor war. Ebenfalls wird eine JSON-Datei von Data Factory bestätigt. Dies ist ein sehr gutes Werkzeug, um zu untersuchen und sicherzustellen, dass alles korrekt funktioniert. Ja, das ist alles für die Überwachung und wir sehen uns in der nächsten Lektion. Vielen Dank. Wir sehen uns bald. 31. Mapping: Um mit Datenflüssen zu beginnen, können wir auf die linke Seite kommen. Und wie Sie hier sehen können, haben wir direkt unter Datensätzen Datenflüsse. Datenflüsse können wie jede Pipeline oder jedes Dataset erstellt werden. Wie Sie sehen können, können Sie hier auf die drei Punkte klicken und Sie sehen einen neuen Datenfluss. Lasst uns darauf klicken. Es ist cool, denn wenn es das erste Mal ist, dass Sie einen Datenfluss öffnen, werden Sie hier einen Spaziergang machen, was sehr praktisch ist. Wie Sie sehen können, können wir beginnen, indem wir eine Quelle zum Datenfluss hinzufügen. Klicken wir auf Fertig stellen. Dies ist unser Standort, aber die Fließschmerzen sind in drei Hauptteile unterteilt. Der erste Teil ist die obere Leiste. Standardwert. Die obere Leiste ist sehr wichtig, weil wir dort unsere Workflows validieren können. Zum Beispiel der JSON oder die Logiken, an denen wir arbeiten. Außerdem können wir den Datenfluss-Debug aktivieren, was bedeutet, dass wir unsere Cluster starten , um Spark-Code hinter den Kulissen auszuführen. Der zweite Teil hier ist der Graph. In der Grafik können Sie Ihre Transformationen platzieren. Sie können einen Transformationsstrom erstellen, der die Herkunft der Datenquelle anzeigt , während sie in eine oder mehrere Senken fließt, um eine neue Datenquelle hinzuzufügen, wählen Sie einfach Benutzer hier oben aus, und dann sehen Sie, dass es einen neuen Tipp hier für Sie bringt. Um unseren Dekan mehr Panzer zu starten. der linken Seite der Knoten wird beispielsweise der Transformationstyp angezeigt. der rechten Seite des Knotens werden der Name und die Beschreibung des Datenstroms angezeigt. Also lasst uns auf Weiter klicken. Klicken Sie hier auf dem Knoten auf Konfigurieren, indem Sie mit der rechten Maustaste klicken. Und dann, wenn wir wieder auf Verbinden klicken, wenn Sie auf das kleine Zeichen plus hier ist, wo Sie was für eine neue Transformation. Klicken wir auf Fertig stellen. Und hier hätten wir unsere erste Transformation. Natürlich klicken Sie hier, um eine weitere hinzuzufügen. Und Sie können sehen, dass wir viele Transformationen haben. Wenn Sie mit Integrationsdiensten vertraut sind, würden Sie sich auf einige der Transformationen beziehen, die wir dort haben. Beispiel: Aggregate, Pivot und dann Pivot. sind Dinge, die wir auch Integration Services finden können. Also werden wir zu jeder dieser Transformationen gehen und was sie tun, wie sie funktionieren. Und schließlich haben wir hier unser Konfigurationspanel. Sie können feststellen, dass bei der Auswahl einer der Aufgaben die Optionen und Konfigurationen für die ausgewählte Aufgabe zurückgegeben werden. Wenn Sie einfach draußen klicken und nicht unterhalten auswählen, erhalten Sie die Einstellungen und Parameter spezifisch, die gesamte Ausführung Ihrer Logik. Sie können hier weitere Eingabeaufforderungen hinzufügen, oder Sie können hier verschiedene Einstellungen hinzufügen und so weiter. Wenn Sie zurück zu der Aufgabe auswählen, können Sie sehen, dass wir mehrere Optionen haben. Und diese Optionen können je nach Aufgabe variieren, an der Sie arbeiten. Aber eine Sache, die Sie gemeinsam finden könnten, einfach zu optimieren, die Registerkarte Optimiert enthält Einstellungen für die Konfiguration von Partitionsschemas. So könnten Sie beispielsweise die aktuelle Partitionierung, die Standardpartition oder eine einzelne Partitionverwenden die Standardpartition oder eine einzelne Partition oder eine Partitionierung festlegen. Wir werden durch jede der Optionen gehen und es kann für Sie nützlich sein, das Gemälde auf die Anforderung, die Sie haben. Wenn Sie auf Inspect klicken, ist die Option wo Sie die Daten sehen, an denen Sie arbeiten. Jetzt in die Datenvorschau zu bewegen ist, wo Sie eine interaktive Momentaufnahme der Daten als jede Transformation erhalten können. Das ist ziemlich cool, denn bevor ein innerer Join oder eine Lets sehen eine Aggregation, würden Sie erwarten, eine Art von Daten oder einen Zustand der Daten zu sehen. So könnten Sie darauf klicken und dann einfach zu Ihren Transformationen in C, dem erwarteten Ergebnis, aufruhen , können Sie nur sehen, dass, wenn Sie Ihren Cluster ausgeführt haben können Sie nur sehen, dass, wenn Sie Ihren Cluster ausgeführt habenoder Ihren Debug-Modus auf eins gesetzt haben. 32. Transformationen des Datenflüssen – mehrere Inputs und Ausgaben: Beginnend mit mehreren Ein- und Ausgängen, haben wir uns als erste Option angeschlossen. Wir haben Transformation beigetreten. Sie können Daten aus verschiedenen Datenquellen oder Datenströmen kombinieren, und die Ausgabe der Daten enthält alle Spalten aus beiden Quellen. Abgestimmte Phase auf einem gigantischen Zustand. Die Verknüpfungsbedingungen sind innere Verbindung, linke Verknüpfung, rechte Verbindung, vollständige äußere Verknüpfung in benutzerdefinierter Kreuzverbindung. So haben wir fünf verschiedene Arten von Gelenken. Dann folgen wir dem Riesen, haben wir bedingte Spaltungen. Bedingt Sprache können Sie Zeilen verschiedener Datenströme basierend auf der Übereinstimmungsbedingung weiterleiten . Stellen Sie sich also vor, Sie möchten Ihre Datensätze für eine bestimmte Datenquelle weiterleiten, ist jetzt Bedingung. Ihr Zustand könnte sein, wo der Status aktiviert oder deaktiviert ist. Und basierend auf dieser Bedingung würden Sie die Daten an eine Tabelle oder zwei verschiedene Datasets senden. Dann haben wir X's. Die Achsentransformation ist die weltweite Filtertransformation, die prüft, ob Ihre Daten in einem anderen Dienst oder eStream vorhanden sind. Der Ausgabestrom enthält alle Zeilen und den linken Stream, die entweder im rechten Stream vorhanden sind oder nicht vorhanden sind. Dann haben wir eine Gewerkschaft. Mit der Vereinigung können Sie mehrere Datenströme vertikal kombinieren. Die Ausgabe wäre so, als hätten Sie ein einzelnes Dataset. Stellen Sie sich vor, Sie möchten ein Dataset übereinander setzen, und sie würden wie ein einzelnes Dataset aussehen. Dann, am Ende unserer Kategorie von mehreren Ein- und Ausgängen, haben wir Lookup. Diese Transformation wird verwendet, um Daten aus einer anderen Quelle zu referenzieren. Stellen Sie sich beispielsweise vor, Sie haben eine Faktentabelle zu einer Dimensionstabelle. Die Lookout-Transformation fügt Spalten aus der Übereinstimmung mit den Daten an, in diesem Fall die Dimension an die Quelldaten. In diesem Fall ist die Tatsache, dass, wenn Sie darüber nachdenken, die Suche ziemlich ähnlich wie eine Links-Join-Operation, bei der alle Werte in Ihrem Ausgabe-Stream in zusätzlichen Spalten aus Ihrem Blick Upstream vorhanden sind . 33. Transaktionen des Schema – Schema: Dann ist unsere nächste Gruppe der Schema-Modifikator. Als erste Option haben wir die abgeleitete Spalte. Mit dieser Transformation können Sie neue Spalten generieren oder vorhandene Spalten mit der Datenflussausdruckssprache ändern. Dann haben wir eine Auswahl. Mit select können Sie Spalten umbenennen, löschen oder neu anordnen. Diese Transformation ändert nicht die Rho Beta, sondern wählt aus, welche Spalten nach unten propagiert werden. Nehmen wir an, wenn Sie ein sehr breites Dataset haben und dann nur selektive wenige Felder aus diesem Dataset sagen möchten , die mit dieser Transformation möglich wären. Dann haben wir Aggregat, Aggregat, um verschiedene Arten von Aggregation zu definieren, wie einige Min-Max-Anzahl. Sie müssen vorhandene oder berechnete Spalten kaufen. Dann haben wir Ersatzschlüssel. Surrogat-Tasten, sehr nützlich, wenn Sie mit Dimensionen und Faktentabellen zu tun haben. Sie können diese Transformation verwenden, um Schlüsselwerte zu jeder Zeile der Daten hinzuzufügen und zu inkrementieren. Dies ist nützlich, wenn Animationstabellen entworfen werden. Zum Beispiel in einem Sternschema, das im analytischen Datenmodell verwendet wird. Dann haben Sie Pivot. Pivot können Sie sie als Aggregation klassifizieren, bei eine oder mehrere Gruppierungsspalten ihre eigene Zeile aufweist, sie in einzelne Spalten umwandeln. Dann gehen Sie zu, um, um, Pivotieren und Pivotieren Sie auf die entgegengesetzte Weise, wie Sie Bros in Ihrem Dataset haben. Und Sie möchten sie so transformieren, dass sie als Volumes in unserem breiteren Dataset angezeigt werden . Hier haben wir Fenster. Das ist interessant. Während der Transformation ist, wo Sie eine fensterbasierte Berufe von Spalten in Ihrem Datenstrom definieren . Im Ausdrucks-Generator dieser Transformation können Sie verschiedene Aggregationstypen definieren, die auf diesem Zeitfenster basieren. Dies ist beispielsweise der SQL-over-Klausel sehr ähnlich, in der Sie eine Fensterfunktion im Allgemeinen haben. Zum Beispiel könnten Sie sich im Detail an eine Bleiverzögerung denken. Das sind ähnliche Funktionen. Sie könnten hier finden. In Ihren Ausgaben wird ein neues Feld generiert, das diese Aggregationen enthält. Das ist sehr nützlich. Sie möchten mit verschiedenen Aggregationstypen innerhalb desselben Datasets arbeiten. Dann haben wir Rang. Welchen Rang können Sie basierend auf der bestimmten Bedingung, die Sie angeben können, ein geordnetes Ranking generieren . Sie können so aggregieren, dass Sie Racks innerhalb des Datasets erstellen würden. 34. Transformationen des Datenflüsse – Formatieren: Dann haben wir auch D4-Angelegenheiten. Im Grunde bedeutet die Verwendung der Flatten, dass Sie ein Array nehmen können, das Sie eine haarige Codestruktur haben, z. B. eine JSON-Datei, und Sie können sie dann in einzelne Zeilen aufheben. Das ist sehr nützlich, wenn Sie Ihre JSON-Datei abflachen möchten wenn Sie viele verschachtelte Knoten innerhalb von JSON haben, dann folgen Sie der Sequenz, für die wir parsen. Es ist sehr nützlich, wenn Sie Textspalten, Ihren täglichen Stream, analysieren müssen. Zum Beispiel die beschränkten Angriffe für CSV-Dateien oder XML. Das ist also ziemlich wichtig, wenn Sie mit vielen Strings umgehen müssen und sie formatieren und parsen müssen. 35. Transformationen des Datenflüsse – Row: Dann haben wir Rho Modifikator. Dies ist wichtig, wenn Sie Ihre Daten so anreichern möchten , dass Sie sie mit der Zukunft ändern müssen. Sie haben einen Filter, der auf dieser Bedingung basiert. Genau wie in Excel, Sie haben Zukunft nach Alter oder Telefon deaktiviert Ich filtere nach Zeitstempel, es ist Ihre Wahl. Sie haben auch suchen. Sie können die eingehende Zeile im aktuellen Datenstrom durchsuchen. Angenommen, Sie möchten nach Namen, Alter, nach einem beliebigen Feld suchen . Wir wollen, dass das auch möglich ist. Und dann haben Sie Altarreihe. Sie fügen Richtlinien in Zeilen ein, löschen, aktualisieren und verkleinern. Sie können eine zu vielen Bedingungen hinzufügen. Diese Bedingung sollte in der Reihenfolge der Priorität angegeben werden, da jede Zeile mit der Richtlinie markiert wird, die dem ersten übereinstimmenden Ausdruck entspricht. Sie können also definieren, ob mein regulärer Ausdruck übereinstimmt Ich möchte diesen Datensatz einfügen, wenn er nicht mit meiner ersten Bedingung übereinstimmt, meine zweite Bedingung aktualisiert diese Zeile oder löscht diese Zeile. So kann die äußere Zeile sowohl DDL als auch D und L Aktionen erzeugen, ich denke, die Datenbank, mit der Sie es zu tun haben. Es tut also das gleiche wie die merge-Anweisung und ein wenig mehr. 36. 5Mapping Data Flow Transformationen - Ziel: Und dann endlich hier haben wir diese Nation. Das ist das Gleiche, wie wir es schon bei den Pipelines gesehen haben. Die Senke ist Ihr Ziel, ist Ihr Ort, wo Sie gehen, um Ihre Daten einfügen. Ok? Das sind all die Transformationen, mit denen wir arbeiten können. Denken Sie daran, dass diese Transformationen visuelle Transformationen sind, die hinter den Kulissen, Ich führe nur den Code für Sie aus, alle Optimierungen, um auf Spark-Cluster optimal ausgeführt zu werden. In unserer nächsten Lektion werden wir sehen, wie wir Datenquellen für einige Transformationen verwenden können . Bleiben Sie dran. Wir sehen uns bald. 37. Quelltyp: Hallo Jungs und willkommen zu einer anderen Lektion. In dieser Lektion werden wir sehen, wie wir Datenquellen mit Mapping-Datenflüssen erstellen können . Wir beginnen, wir gehen hier unter Datenflüsse und klicken Sie auf Aktionen und klicken Sie auf neuen Datenfluss. Das ist leer, weil wir von vorne anfangen werden. Also überspringe ich das zuerst, um hier zu kippen. Und wie Sie sehen können, haben wir eine gepunktete Box. Lasst uns darauf klicken. Und ich werde auch diesen ersten Führer überspringen. Hier. Wir haben eine Setup-Optionen in ein paar Male mit verschiedenen Einstellungen, die wir auch wählen können. Beginnen wir also mit den Quelleinstellungen. In der ersten und wichtigsten Entscheidung, die Sie treffen müssen , ist, welcher Datenquellentyp Sie verwenden müssen. So haben wir Datensätze und auch wir haben Inline-Datensatz ist nur eine Entität, die über Datenflüsse und auch Pipelines wiederverwendet werden kann. Wenn Sie sich erinnern, alle diese Datensätze, wir haben sie vor für unsere anderen Demonstrationen erstellt. Das sind also nur Entitäten. Hier, Inline. Es ist etwas, das für jede Datenflusslogik oder jeden Workflow dedizierter ist. Es gibt Vorteile bei der Verwendung beider, aber es gibt Fälle, in denen beide unterstützt werden. Zum Beispiel, hier im Zeilendatensatz, haben wir ein paar Out-Of-Box-Datensätze, aus denen wir wählen können. Und diese Datasets würden mit ein paar Connectors funktionieren, nicht mit allen. Beispielsweise die Inline-Datasets, die Sie nicht sind, die den Azure SQL-Datenbankconnector verwenden , um eine besser definierte Liste zu haben wann Inline-Quelltyp oder -Datasets oder Skype verwendet werden sollen. Ich würde empfehlen, einen Blick auf die Dokumentation zu werfen. Wenn ich zum Beispiel die Dokumentation hier bekomme, können Sie besser sehen, welche Konnektoren in welcher ID die Quelltypen unterstützt. So haben wir Azure SQL-Datenbank. Wie Sie sehen können, wird nur Dataset unterstützt. Aber für diese Typen hier haben wir die Möglichkeit, beide zu verwenden. Ein wichtiges Element bei der Verwendung von Dataset oder Inline ist die Tatsache, dass Inline ein nativer Quelltyp für Spark ist, während Dataset nicht. So sehen Sie manchmal eine bessere Leistung, wenn Sie mit Dateien auf einem größeren See anstatt in einer Datenbank arbeiten oder dieselben Beschaffungsbrände mit Datensätzen lesen. Der Fall, dass es nicht sehr gut ist oder ich immer die wichtigsten sein sollte , ist nur ein Fall , dass was ist der Connector, den Sie verwenden, und Sie müssen einen Urteilsruf machen, welcher von ihnen funktioniert besser? Urin-Demonstration hier, wir werden bei Datensätzen bleiben, weil wir die Daten, die wir zuvor in unsere SQL-Datenbank hochgeladen haben, aufnehmen. Um uns zu beginnen, wählen wir Azure SQL DB aus. Und dieser Kurs synchronisiert es sinkt, weil an diesem anderen Beispiel, wir verwenden als eine Senke, aber jetzt können wir es als Quelle verwenden. 38. Source: Sobald wir andere haben, den Datensatz, wir bereits die wichtige Entscheidung getroffen, die Datensatz für uns 0, 0 ist. Und dann müssen wir hier ein paar Einstellungen konfigurieren. Und wir beginnen mit der Auswahl der Quelleinstellungen. Hier. Zum Beispiel haben wir den Ausgabestream-Namen , der der Name unserer Aufgabe ist. Sie können einen beliebigen Namen angeben oder einfach nur mit diesem Namen bleiben und Beispieldaten hinzufügen. Es akzeptiert weder das noch Unterstriche. Es muss eine einzelne Zeichenfolge sein. Hier haben wir Schema-Drift erlauben. Diese Option ist die Möglichkeit, Data Factory LBL, flexible Schemas zu verriegeln. Und das ist nützlich, wenn sich Ihr Schema häufig ändert. Die Einstellung ermöglicht es, dass die Felder der Einkommensquelle zu den Transformationen fließen , zur Synchronisierung automatisch, so dass Sie die Schemaänderung nicht immer minorly verarbeiten müssen. Außerdem haben wir E für gedriftete Säulentypen. Wir verwenden Option. Sie können Data Factory anweisen, Datentypen für jede neue Discovery-Spalte zu erkennen und zu definieren. Das ist sehr nützlich, als würde es einen Crawler messen. Data Factory hat die Fähigkeit, die Datentypen zu definieren und zu verstehen, wie neue Spalten erscheinen, dann haben wir gültige Datenschema. Wenn, aber es ist Schema ausgewählt ist, der Datenfluss fehl, wenn die eingehenden Suchdaten nicht mit dem Schema des Datensatzes übereinstimmen. Dies ist eine Möglichkeit, um sicherzustellen, dass Sie ein vertrauenswürdiges Schema haben. Dann haben wir Stichprobendaten. Dies ist für Sie, um die Anzahl der Zeilen zu begrenzen, die Sie Gast bekommen, wenn Sie Debuggen oder eine Prüfung. Ihre Logik ist nützlich, wenn Sie sie aus der Pipeline in die Bergamo fließen. 39. Aufbesserung Datenfluss Spark: Okay, hier, wie Sie sehen können, ist der Datensatz ausgegraut. Es ist ausgegraut, weil unser Spark-Cluster nicht läuft. Und das tun wir, indem wir diese Option hier aktivieren. Es kann einige Male bis zu fünf Minuten dauern, da es einen neuen Spark-Cluster für Sie hinter den Kulissen dreht. Also sei geduldig. Lehnen Sie sich zurück, entspannen Sie sich und Sie werden Ihren Cluster haben. Aber bald, Lasst uns darauf klicken. Und wie Sie hier sehen können, habe ich die Möglichkeit, eine Integrationslaufzeit auszuwählen. Das folgt also den gleichen Aspekten, die wir zuvor gesehen haben. Ich könnte hier einen selbst gehostet haben und dann kann ich die Konfiguration für meine Auto-Resolve-Integrationslaufzeit auswählen. Wir werden bei dieser Option bleiben. Dies ist das Buch Time to Live, was bedeutet, dass, wenn mein Debug eine Stunde lang im Leerlauf läuft, es sich jetzt selbst verschieben wird. Dies ist eine nette Funktion für Sie, um Kosten zu sparen und nicht eine riesige Rechnung zu sein. Ich wusste keinen Monat, weil du vergessen hast, nicht weniger Spark-Cluster zu drehen. Also lasst uns auf OK klicken. Sobald wir auf OK klicken, können wir sehen, dass die Erstellung des Clusters initiiert wird. Und dann, wenn Sie hier auf diese Bar achten, wird der Cluster tatsächlich hinter den Kulissen gebaut. Sobald dies erstellt wurde, sehen wir hier ein grünes Kontrollkästchen. An dieser Stelle wissen wir, dass wir über die Rechenressourcen verfügen, damit wir arbeiten können. Dies kann einige Minuten dauern. Du musst also geduldig sein und nur warten, bis es fertig ist. Ich werde dieses Video beschleunigen und wir kommen in einer Sekunde zurück. Gehen Sie jetzt, wir haben unseren Cluster in Betrieb. Und wenn Sie hier überprüfen, die Meldungen Glocke, können Sie sehen, dass unser Cluster etwa sechs Minuten bereit dauerte, was vor BC etwa fünf Minuten erwartet wird, also für uns zu sechs. Also lasst uns hier auf Go K klicken und schließen. Und jetzt haben wir unsere Umgebungen, die hoch sind. Und wir können jetzt testen, dass Ihre Verbindung in Jeffs Theta ist und so weiter und so weiter. 40. Source typ: Wir werden hier zu Circe-Optionen umziehen. Und ernsthafte Optionen können abhängig von der Aufgabe, an der Sie arbeiten, variieren. Also in unserem Fall werden hier Quelldaten sein und hier stellen wir eine Verbindung zu einer SQL-Datenbank her. Und wir können die Suchprozedur ausführen. Wir führen eine Abfrage aus. Die Projektion ist also tatsächlich die Daten, die Sie haben. Jetzt werden wir nur für eine Sekunde in unsere Datenbank zurückkommen, tun das gleiche, was wir erstellt haben. Und wir werden unseren Tisch überprüfen. Wie Sie sehen können, habe ich die Datenbank, die Sie gerade laufen, und die Tabelle, die wir erstellt haben, und wir sagen nur ein paar tausend Datensätze. Also, wenn Sie hier überprüfen, haben wir 4 Tausend Zeilen. Also, was soll ich tun? Ich würde diesen Code einfach kopieren, ist, dass wir Aussagen auswählen, die wir haben. Und wir gehen zurück zu den Quelloptionen. Und ich werde diese Aussage hier einfügen. 41. Datenschema: Die Projektion ist der Dienst oder etwas, das die Datenspaltentypen Formate definiert. Für die meisten Dataset-Typen wie SQL in einem Park ist die Projektion also eine Quelle, die Ihr Schema widerspiegelt, wenn Sie Dateien, die nicht stark typisiert sind, Quelldateien beziehen. Wenn Sie beispielsweise etwas haben, das Jazz CSV-Dateien und Textdateien anstelle von Parkett-Dateien ändern kann , die über ein vordefiniertes Schema verfügen, können Sie hier die Datentypen definieren. Also kann ich entweder zu meinem Schema gesagt werden oder es von hier aus ändern. Jetzt ist unser Fall hier, wir werden nicht in der Lage sein, Entität zu bearbeiten, weil es bereits aus einer Datenbank kommt. Und Data Factory versteht, dass es sich um ein festes Schema handelt. Also, wenn es eine Änderung gibt, wenn Sie auf das Schema geklickt haben, driften Sie es, um nur ein beliebiges Schema zu erstellen. Aber zum Beispiel, wenn Sie mit einer Textdatei zu tun haben und Ihre Textdatei hat kein definiertes Schema. Sie können auf den Text klicken. Hier gibt es eine Möglichkeit, auf das Steuerbemessungsschema zu klicken. Und es würde eine Probe der Daten nehmen und den Datentyp in Ihre Produktion ableiten. Denken Sie daran, wenn Sie ein neues Schema für Ihre Daten definieren oder wenn Sie das Schema ändern, wenn Sie auf vergibt Ablehnung klicken, wird es immer überschrieben, was Sie getan haben. Du musst also vorsichtig sein, wenn du hier eine Menge Dinge aktualisierst. 42. Last mit Partitionen optimieren: Nun gehen wir zur Optimierung, wir haben drei Hauptoptionen, um die Art der Partitionierung auszuwählen, die wir wählen wollten. In den meisten Fällen werden wir wählen Grant-Partitionierung zu verwenden, weil wir den vordefinierten Satz von Regeln verwenden möchten , die Data Factory hat, um den besten Pfad zu wählen, um ihre Daten zu finden. Wenn Sie beispielsweise eine SQL-Datenbank als Quelle haben, können Sie dies ändern. Es hängt von der Art der Partitionierung ab, die Sie haben. So hätten Sie zum Beispiel sechs verschiedene Arten der Partitionierung zur Auswahl. Und dann basierend auf, sagen wir, einer Partition, die Sie in dieser bestimmten Spalte haben. Oder wenn ich eine Abfragebedingung verwende und dann eine Partition basierend darauf erstelle, ist es auch nicht jedes Mal möglich , wenn Sie eine Partition basierend auf den heutigen Feldern erstellen möchten. Manchmal haben Sie einen neuen ganzzahligen Bereich, den wir eine Partitionierung herausfinden wollten. So können Sie Ihre Karrierebedingung nutzen, um dies zu tun. Wenn Sie auf dieser Oberfläche klicken, aber Petition, Das ist eine benutzerdefinierte Partitionierung, Es ist wahrscheinlich, dass EDF, wir werden die Daten am schnellsten lesen. Denn hier kann eine Factory mehrere Anweisungen verwenden und mehrere Verbindungen herstellen, um Ihre Daten und gut entstehen parallel zu erhalten. Was wird das Leistungsjahr für das Lesen hier diktieren , sind die verfügbaren Ressourcen, die Sie haben, n, wie viel gleichzeitige Anweisungen Sie gleichzeitig ausführen können. Die Kleinbuchstaben hier, lassen Sie uns Spalte auswählen. Wenn Sie hier auf das Dropdown-Menü klicken, können Sie sehen, dass wir alle Spalten haben, die wir in Ihrer Tabelle zur Verfügung haben. Nehmen wir also das ID-Feld, und diese werden unsere Partitionsspalte sein. 43. Datenvorschau: Dann zum Inspect wechseln, haben wir ein Beispiel unseres IIS-Schemas. So, wie Sie hier sehen können, zeigt es alle Spalten, die wir haben. Und dann der Datentyp, den wir haben. Wechseln Sie zur Datenvorschau. Es zeigt eine Vorschau unserer Daten basierend auf der Partition, die wir wählen. Dies ist dem Dataset ziemlich ähnlich. Wenn Sie die Daten untersuchen, die Sie haben, Ihren Klicker hier und aktualisieren, können Sie sehen, dass es die Daten aus unserer Tabelle holen wird. Großartig, wie Sie hier sehen können, haben wir ein Beispiel unserer Daten aus der Tabelle, die wir aus unserem Datensatz verwenden. Das ist ziemlich cool, weil Sie hier sehen können, ob alles richtig aussieht, Überprüfung ist auch schön, weil wir uns vorstellen, dass Sie Transformationen machen. Danach. Sie könnten die Daten sehen. An diesem Punkt werden wir Ihren Tag in inneren Riesen vorstellen und Sie wollen die Spalten sehen , die Sie von Ihrem linken Tisch haben, in der rechten Tabelle. Zu diesem Zeitpunkt hätten Sie nur eine Tabelle, um Ihre Daten auszuwählen. Wenn Sie sich jedoch den nächsten Schritt ansehen, würden Sie aus der Datenvorschau alle Spalten entsprechend den von Ihnen gewählten Transformationen sehen. So haben wir unsere Suchdaten erstellt. Wir haben alle Optionen durchlaufen, die wir dafür zur Verfügung haben. Der nächste Schritt, den wir erstellen werden, ist die Synchronisationsseite unserer Transformation. Wenn ich versucht habe, Sie hier zu sehen, wird es sich beschweren, dass wir keine Spüle und Ethanoat haben, um Ihre Pipeline zu retten. Wir haben eine Spüle. Lassen Sie uns also unsere Senke erstellen und vielleicht eine andere Tabelle basierend auf der Quelle in der gleichen Datenbank erstellen. Sekant. 44. Wie du einen Mapping hinzufügst: Okay, Jetzt müssen wir unsere Spüle viele schaffen, wo wir unsere Daten senden wollen. Klicken Sie also hier und ein Pluszeichen. Wir werden alle verfügbaren Transformationen auflisten, die wir haben. In unserem Fall werden wir Ziel verwenden. Und dann die einzige verfügbare Spüle. Klicken Sie darauf. Und dann wieder, wir bekommen hier einen netten Tooltip. Zu diesem Zeitpunkt werden wir das nur schließen. Und hier haben wir ähnliche Optionen, wie wir für die Quelle haben, haben wir wirklich sinken. In unserem Fall müssen wir hier einen Datensatz auswählen, der den Punkt darstellt, an den wir die Daten senden werden. Klicken wir auf Neu, um einen neuen Datensatz basierend auf der beobachteten Datenbank zu erstellen, die wir haben. Also lasst uns auf Neu klicken. Dann haben wir die Möglichkeit, Azure SQL-Datenbank zu wählen. Also lasst uns weitermachen. Da wir bereits unsere Serifen erstellt haben, lasst uns einfach darauf klicken. Und dann werde ich meinen neuen Datensatz sagen. Ok? Hier haben wir die Möglichkeit, eine vorhandene Tabelle auszuwählen, so dass wir nur eine haben. Und dann haben wir auch die Möglichkeit, eine neue Tabelle zu erstellen. Lassen Sie uns also eine neue Tabelle erstellen. Und dann muss ich ihm nur einen Namen und ein Schema geben. Also mein Schema wird DIYBio sein, der Tabellenname wird gesampelt Daten. Das ist, wo ich oft Büffel bekommen. Und wir haben hier einen kleinen Knopf für Fortgeschrittene. Ich möchte nicht, dass ein Idiot Punkt ist, weil es für die Optimierung verwendet werden könnte und so weiter. Ich klicke einfach auf OK. An diesem Punkt haben wir eine Darstellung dieser Tabelle, dass sie nicht wirklich erstellt wurde. - Ja. Dann haben wir Einstellungen. Hier. Wir können die Art der Berechtigungen manipulieren, die wir aus diesem Dataset auswählen möchten. Hier haben wir p Bar Aktionen, wir haben stabile abschneiden die Tabelle neu erstellt, was bedeutet, jedes Mal, wenn wir dies ausführen, könnten wir die Tabelle abschneiden, wenn es einen ganzen Datensatz handelt oder wenn wir es mit einer Schemadrift zu tun haben, Sie möchten sicherstellen, dass Sie es sauberen Tisch haben oder Sie können verlassen und in unseren Tisch neu erstellt. Oder wenn wir es mit inkrementellen Lasten zu tun haben, können Sie einfach Nano auswählen. Hier ist die Chargengröße. Wenn, wenn ich die Anzahl der Zeilen steuern, die als eine Zeit eingefügt werden, wenn es TempDB-Daten verwenden wird, wenn Sie zum Beispiel SQL-Skripte verwenden, verwendet eine vollständige Fauna, sagen wir, erstellt Tabelle davor, wenn wir wollen die Tabelle oder macht etwas mit der Tabelle, erstellen Sie einen Index, der den Index fallen gelassen hat, zum Beispiel, Bild 1 beim Ablegen existiert, bevor die Daten geladen werden. So können Sie die Daten schneller einholen. Die meisten Daten werden geladen, Sie können einen Index erstellen. Sie könnten diese beiden Optionen verwenden. Außerdem haben Sie hier eine schöne Fehlerbehandlung. Sie könnten ein Fehlerkontinuum bei Fehlern und Dingen aus dieser Zuordnung stoppen. Wir müssen uns keine Sorgen um das Mapping machen, denn das wird eins zu eins sein. Ich möchte all diese Säulen, die wir haben, in meine Spüle bringen. Also, das ist okay. Hier können wir wieder PSD-Partitionierung auswählen ist, dass wir haben, Ich werde die Partitionierung wieder einstellen. Ich werde vielleicht weiter partitionieren. Wir werden IT-GAN auswählen und dann etwas überprüfen, dass eine Vorschau. Wir könnten die Daten aktualisieren, um die Daten wieder zu sehen. In Ordnung, also lasst uns veröffentlichen. Es sollte in Ordnung sein, zu diesem Zeitpunkt zu veröffentlichen. Die Daten wurden erfolgreich veröffentlicht. Und an diesem Punkt sollten wir in der Lage sein, die Pipeline auszuführen und zu sehen, ob wir alle Daten in eine neue Tabelle bringen können. 45. Wie du einen a erstellst: Wie führen wir den Mapping-Datenfluss aus? Das ist interessant, weil Sie von der Standardpipeline aus das Buch haben und dann auch jetzt auslösen würden, was Ihnen erlaubt, Ihre Pipelines zu behandeln. Das ist bei Datenflüssen nicht der Fall. Damit Dataflow ausgeführt werden kann, muss er innerhalb der Pipeline ausgeführt werden. Mit anderen Worten, in Vermögenswert durch Leerzeichen. Also lasst uns diese Linien erweitern. Und lasst uns hier auf neue Pipeline klicken. Und dann werden wir Datenflüsse aus den Optionen zu bekommen sind Aktivitäten. Wie Sie sehen können, zeigt es sich wie jede Aufgabe, die wir zur Verfügung hatten. Und weil wir bereits unsere Daten für erstellt haben, können wir es von hier aus aufrufen. Also haben wir Einstellungen. Dann können wir dort für einen, der unser Dataflow ist. Und dann von hier aus können wir wieder wählen, zerlegen jeden Typ, den wir ausführen werden. Wir können nur einen allgemeinen Zweck und dann den kleinsten Cluster, den wir für uns zur Verfügung haben, wir brauchen keinen großen Cluster. Dann haben wir die Möglichkeiten des Bloggens. Wir werden nur mit dem Vorschlag bleiben. Wir müssen bedenken, dass es eine gute Idee sein könnte, mit den verschiedenen Optionen zu arbeiten, wenn Sie diese Sache für die Produktion werben . Je mehr Optionen Sie haben, desto mehr Protokolle erhalten Sie, desto mehr Zeit wird es dauern, alle Aktivitäten auszuführen. Wir haben ähnliche Eigenschaften. Wir können das parallel ausführen, wenn wir wollen. Unsere bleiben einfach bei all den Booten. Hier ist die Inszenierung. Wir brauchen keine Inszenierung. Das schien etwas, wie wir es für die anderen Pipelines getan haben, ist, wenn Sie das Baddeley für einen Blob-Speicher verwenden wollen, um Ihre Daten zu inszenieren, bevor es zu dieser Nation kommt. Und hier Parameter, wir brauchen keine Parameter an dieser Stelle, weil wir keine Parameter für unseren Datenfluss gesetzt haben. Wir werden das nur validieren. Es wurde ungültig gemacht. Ok, Anwälte fanden, also sollten wir das veröffentlichen können, aber bevor wir dem einen Namen geben. Dann können wir jetzt veröffentlichen. Los, es wurde veröffentlicht. Okay, wenn Sie bemerken, unsere Cluster sind, dass Sie rennen. Sie glauben nicht, dass Sie das Buch gefunden haben. Oder wir können einfach entweder neue Tutor, Ich würde einfach auf den Bug an dieser Stelle klicken. Dann sollte unsere Pipeline sofort laufen und unser Datenfluss wird gestartet. Cool. Wir haben hier unsere Pipeline im Gange, und es wird jetzt der Dataflow-Code ausgeführt. Wir können sehen, dass unsere Pipeline mit Erfolg abgeschlossen wurde. Hier ist die, eigentlich die Zeit, die es dauerte, um ihre Patienten. Sie haben vielleicht bemerkt, wie es eine Weile gedauert hat, bis es begann. Aber wieder, dies ist ein Cluster, der bekommt, dass es hinter den Kulissen gegangen ist. Also die ersten paar Minuten oder Sekunden, sollten Sie nicht wirklich in Betracht ziehen, weil Pipeline einfach, leistungsfähiges Werkzeug mit einer massiven Menge an Daten zu arbeiten. Und dann, wenn das läuft, sollte alles wirklich schnell sein. So können wir fortfahren und unsere Datenbank jetzt überprüfen und sehen, ob wir eine Tabelle haben. Kommen wir zurück zu unserer Datenbank und wir haben noch eine hier. Lass uns erfrischen. Wir haben eine andere Tabelle hier drin, und dann können wir die Daten überprüfen, um zu sehen, ob alles da ist. Satellit ist großartig. Wie Sie sehen können, haben wir 4 Tausend Datensätze. So wie wir es in unseren Quelldaten haben. Dies könnte jeden Tag sein, genau wie bei unseren Datasets, die Pipelines verwenden, konnten wir nicht mit einem anderen Connector-Typ arbeiten. Es könnte nicht Oracle sein, könnte Parkett-Datei sein, der Data Lake. Das Schöne hier ist zu sehen und zu verstehen wie wir die Pipelines in den Mapping-Datenflüssen verwenden können , um Daten aufzunehmen und die Daten mithilfe eines Spark-Clusters zu transformieren , ohne eine einzige Codezeile zu schreiben. Das ist sehr mächtig. Lassen Sie uns sehen, wie wir einige Transformationen machen können, wie es funktionieren wird. Bleiben Sie dran. Danke fürs Zuschauen. 46. Quiz – Modul 5: Gut. 47. Projekt Walkthrough – Integration von Azure Data Factory mit Databricks: Hallo Leute, und willkommen zu einer anderen Lektion. Sehen wir uns nun das Dokument für unsere Projekte an. In diesem Dokument enthält eine Schritt-für-Schritt, was von Ihnen benötigt wird , wenn Sie das in Data Factory integrieren möchten. Hier haben wir den Anwendungsfall dafür. Stellen Sie sich also vor, Sie sind Teil eines Analyseteams, das kürzlich einen großen Auftrag erhalten hat , oder analysieren Sie Kriminaldaten für mehrere Metropolen. Das Year-Team hat beschlossen, die Funktionen von Azure Data Factory Databricks zu nutzen , um die erforderlichen Daten zusammenzufassen. Als Ergebnis dieser Musik-Fall, werden Sie verstehen, wie eine gerade Datentransformationen mit Databricks und ADF zu arbeiten. Für dieses Projekt müssen wir haben, dass die Feld-Dinge bereits in Betrieb sind. In unserem Fall haben wir bereits Schritte 12, so dass wir überspringen und direkt vom Schritt Baum beginnen können. Wenn Sie weitermachen und ein neues Speicherkonto erstellen möchten, haben wir hier Schritt für Schritt, wie das geht? Und dann müssen wir die Ergebnisse Namen und Schlüssel von Databricks zu verwenden. Sobald wir das haben, können wir einen neuen Containernamen innerhalb unseres Speicherkontos erstellen. Beginnen wir also direkt mit Azure Databricks Workspace und sehen Sie, wie wir das aus dem Portal erstellen können. Lasst uns anfangen. 48. Wie du Azure Databricks und Importiere: Ich ziehe wieder hierher zum Portal und suche nach anderen Ziegeln. Wir können einfach hier auf den Button klicken. Dann werden Sie Ihre Abonnements durchsuchen. Ich habe nur einen zur Verfügung. Lassen Sie uns eine neue Ressourcengruppe im College erstellen. Dann werde ich aufgefordert, meinem Arbeitsbereich einen Namen zu geben. Dann muss ich hier meine Region auswählen, es wird Nordeuropa sein. Dann habe ich in erster Linie zwei verschiedene Arten von Preisstufen. Also habe ich das getan ApachesPark, und dann habe ich Premium. Was es mir ermöglicht, mehr Granularität in Bezug auf die Sicherheit und den Zugriff im Inneren zu haben , ist mein Arbeitsbereich. Das ist ein Sicherheitsstandard. Hier haben wir eine Option, mit den Standardoptionen zu bleiben, was bedeutet, dass wir öffentliche Endpunkte verwenden, um sich mit unserer Umgebung zu verbinden. Oder wenn Sie über eine Strukturinfrastruktur verfügen, können Sie ein vorhandenes virtuelles Netzwerk auswählen. Also lassen Sie uns einfach bei Nein bleiben. Dann fortgeschritten, wir haben nicht die Möglichkeit, es ist an dieser Stelle auszuwählen. Wenn Sie dann einige Tags hinzufügen möchten, ist dies wichtig, denn wenn Sie an dieser Stelle eine DAG erstellen, können Sie immer dann, wenn eine neue Ressource ein Spawn aus Databricks Workspace ist, leicht von den Tags identifizieren, die von der Forschung geerbt wird Basis. Okay, also lassen Sie uns überprüfen. Wir können es schaffen. Großartig, unser Arbeitsbereich ist einsatzbereit. Also lasst uns zur Ressource gehen. Und dann, wie Sie sehen können, haben wir ein Portal, um tatsächlich den Databricks-Arbeitsbereich zu starten , den ich gelesen habe, ist ein Produkt, das nicht im Besitz von Microsoft ist. Es ist tief integriert, aber nicht im Besitz von Microsoft. Aus diesem Grund haben wir einen Service, der es uns ermöglicht, sich mit dem eigentlichen Databricks-Arbeitsbereich zu verbinden. Lasst uns auf allein für den Raum klicken. Und dann können wir auf den ersten Blick sehen, wie es aussieht. Es wird mich als mein Azure Active Directory-Konto zuweisen. Großartig, So sieht es aus. Kommen wir zurück zu unserer Dokumentation. Sobald dies erstellt wurde, haben wir hier noch ein paar weitere Schritte zu durchlaufen. Wir haben den Arbeitsbereich gestartet, und dann innerhalb des Arbeitsbereichs können wir die linke Leiste sehen, Workspace-Benutzer auswählen und so weiter. Werfen wir einen Blick hier, wie es aussieht. Hier. Home Workspace sollte Ihnen die gleichen Optionen geben. Wenn Sie Workspace auswählen und hier direkt zu Ihrem Benutzernamen gehen, haben Sie die Möglichkeit, zu importieren. Sie haben sich entschieden, ein neues Notizbuch zu erstellen. Sie haben die Möglichkeit, ein vorhandenes Notebook zu klonen. Und wenn Sie ein vorhandenes exportieren möchten, ist von dieser Option hier. Nun, unser Fall, werden wir an dieser Stelle nichts entwickeln. Wir werden nur Ports in bestehenden Notizbuch von der Microsoft GitHub Webseite essen. Also lassen Sie uns importieren, gehen zurück zur Dokumentation, wir haben auf die Platte geklickt, und dann gehen wir zu dieser URL und laden Sie das Notebook herunter. Klicken Sie hier, und ich werde einfügen. Und es wird für mich sofort herunterladen, wo Sie zurück zum Portal. Ich werde durchstöbern. Großartig. Ich ging zu meinen Download-Ordnern und wähle dann die Datei aus, die ich gerade heruntergeladen habe. Und jetzt können Sie sehen, dass dies verletzt wird, und wir können es importieren. Sobald Sie Ihre Notizbücher importieren. Auf den ersten Blick werden Sie vielleicht nichts sofort sehen, aber eigentlich ist jeder schon wichtig. Sie können entweder einen Arbeitsbereich oder ein Kätzchen zu Hause auswählen. Wenn wir uns unter Workspace befinden, können Sie Ihren Benutzer auswählen. Dann werden Sie sehen, dass Sie hier einen neuen Ordner haben. Der Ordner enthält die Notizbücher, die wir gerade importiert haben, und wir hatten enthält einen anderen Ordner. Dann können Sie sehen, hier haben wir verschiedene Optionen klicken Sie hier auf die Erste Schritte. Zurück zu unserer Dokumentation gibt es eine Video-Erklärung für jedes der Notizbücher. Das Notizbuch „Erste Schritte“. Es zeigt Ihnen, wie Sie ein neues Speicherkonto einrichten, wie wir es zuvor getan haben, wir können dieses Gerät überspringen. Dann ist das zweite Notizbuch die Datenaufnahme. Es wird hier gehen, Sie Schritt für Schritt, wie Sie Daten aus einem Pub Kick zählt mit Data Factory in ein Speicherkonto aufnehmen können. Dann enthält das dritte Notizbuch Anweisungen zum Erstellen Konnektivität zwischen Data Factory und Databricks Workspace. Lassen Sie uns also unsere Hände schmutzig machen und sehen, wie das gemacht werden kann. 49. Wie du Azure Databricks und Importiere: Zurück zu unserem Arbeitsbereich, wie Sie hier sehen können, ist nur ein Schritt für Schritt, wie Sie ein Speicherkonto erstellen. Und eine Datenfabrik. Das ist ein übersprungenes Notebook, weil wir es bereits getan haben, bevor und wir haben beide Oberflächen fördern. Wenn Sie dann hier auf das Ohr klicken, haben Sie die Notizbuchliste. Also, um hier auf dem Arbeitsbereich wieder zu schließen, und dann haben Sie Datenaufnahme. Diese Aufnahme zeigt, wie wir das Buch und die Daten aufnehmen können, und dann gibt es uns ein SaaS-Token, um eine Verbindung mit einem Speicherkonto herzustellen, damit wir diese Daten aufnehmen können. Also lasst uns das von Data Factory machen. Und von der Homepage haben wir die Cop Daten. Lasst uns darauf klicken. Sie können hier sehen, wir folgen Schritt für Schritt. Und dann haben wir den Becherassistenten, den wir gerade angeklickt haben. Jetzt geben wir unserer Pipeline einen Namen. Wählen wir dies und eine Kopie aus. Wir wählen jetzt die Pronomen aus. Als Nächstes. Dann ist dies der zweite Schritt. Wir müssen eine neue Verbindung herstellen. Wenn Sie also hier auf neue Verbindung klicken, suchen wir nach Speicher. Und klicken Sie auf Blob-Speicher. Wieder, zurück zu hier, können wir Buchhandlungen auswählen, können wir fortfahren. Dann müssen wir einen Namen dafür behalten. Und dann müssen wir Authentifizierungskarte auswählen, die wir die SAS-URI verwenden werden. Also werde ich umbenennen wird perfekt Datensatz sein. Wenn Sie zweimal klicken, Mach dir keine Sorgen, es wird reformieren, die den ganzen Schmerz. Aber das ist okay. Wenn Sie das Format dieser Informationen angezeigt haben, können Sie einfach hier im linken Bereich klicken und es wird zurückkehren. Lassen Sie uns also dieses Buch-Dataset hervorheben. Das wird der Name unseres verlinkten Dienstes sein. Dann haben wir die Integrationslaufzeit wird die gleiche sein. Dann haben wir die Authentifizierungsmethode. Es wird Sazzy dein Auge sein. Jetzt werden wir diese Sizer kopieren. Ich gehe zurück zu unserem verknüpften Dienst und es wird hier eingefügt. Sie können sehen, dass es bereits erstellt wurde. Dann können wir unsere Verbindung testen. Es gibt jetzt eine Verbindung. Großartig, Test erfolgreich getestet. Kommen wir zurück zu unserem Notizbuch. Dann. Wir haben diesen Test durchgeführt, die Verbindung, es ist beendet, so dass wir die Erstellung unseres Linked Service beenden können. Das ist, was wir jetzt auswählen werden, dann e seine nächste. Jetzt müssen wir unseren Ordner auswählen, den Speicherort der Daten innerhalb des verknüpften Dienstes, den wir gerade erstellt haben. Gehen wir zurück hierher, um das Buch zu bezeichnen, um den richtigen Ort zu finden. Sie können sehen, der angegebene Ort ist Schulung Kriminaldaten 2016. Also lassen Sie uns diese durchsuchen, dann haben wir Training. Es ist die nächste Charge. Kriminaldaten, nicht 16, das ist, was wir wollen. Wir werden diesen Ordner auswählen. Wir müssen eine binäre Kopie auswählen und dann weiter gehen. Wir müssen sicherstellen, dass wir eine vermutlich auch binäre Kopie ausgewählt haben. Sie müssen sich im Moment keine Sorgen um einen kommerziellen Typ machen, da die Daten bereits Park-Fall sind, daher sind sie standardmäßig komprimiert. Und wir können auf Weiter klicken. Hier. Sie können sehen, dass ich diesen Schritt fertig ist, was ein Service ist. Jetzt müssen wir uns auf diese Nation konzentrieren. Wir müssen eine neue Verbindung für unser Ziel schaffen. Verwenden wir eine bestehende Verbindung, die wir bereits haben, Heilige, wir haben eine zuvor erstellt, so dass wir dieses neue Speicherkonto nicht erstellen müssen. Das ist es hat diesen Lastkahn übersprungen. Kommen Sie zurück zu unserer Schöpfung hier. Und wir haben meine erste, lasst uns darauf klicken. Wir werden AD verbunden. Wir müssen den Schlüssel oder irgendetwas nicht abrufen, da wir bereits über verwaltete Identität verbunden sind. So können wir einen der Ordner oder eine kann den Ordnernamen eingeben, die ich möchte, so dass es in Echtzeit erstellt wird. Lassen Sie uns zum Notizbuch gehen und werfen Sie einen Blick auf die Anforderungen dieser Nation Namen. Lassen Sie uns das kopieren. Und hier sind der Ordnerpfad. Lasst uns das stützen. Und dann müssen wir uns um nichts kümmern. Sie können einfach mit den Standardoptionen bleiben. Jetzt müssen wir nur hineingehen und wir werden bei allen Standardoptionen bleiben. Hier ist die Übersichtsseite, aber alles, was wir gerade getan haben, ist okay. Wir gehen einfach als Nächstes. Und dann wird es zu schaffen oder mit dem Flugzeug. Es wird alles für uns tun. Ruf an, es ist fertig. Also haben wir eine Pipeline. Wir nehmen einen öffentlichen Datensatz auf. Lassen Sie uns beenden. Cool. Gehen wir zu der Pipeline, die wir gerade erstellt haben, wählen Sie Pipeline und dann haben wir Laborpipeline. Hier. Sie werden sehen, dass es einige seltsame Namen hat. Also lasst uns einfach schnell hierher gehen und sehen, ob alles in Ordnung ist. Jetzt können wir diese Daten laden. Wir können die Pipeline betreiben, um die Öffentlichkeit die Entsättigung in unseren Datensee aufzunehmen. Lassen Sie uns auf das Buch klicken und es wird die Pipeline starten. Cool, die Daten wurden übertragen. Werfen wir einen Blick und sehen, wie es aussieht. Großartig. Wir haben Entzündungen von Khomeini fliegen uns lesen, dass Daten, die Größe der Daten, die Anzahl der Verbindungen und alles. Toll, es sieht gut aus. Wenn wir zu unserem Datensatz gehen, sollten wir, wenn neue Ordner haben. Jetzt habe ich Lake gemacht. 50. Datenübertragung in Databricks und Datenfabrik: Wenn wir zu unserem Datensatz gehen, sollten wir in der Lage sein, alle übermittelten Daten zu validieren. Lassen Sie uns also unsere Kopieraufgabe hervorheben. Dann geh in unsere Spüle. Wir haben unseren Datensatz. Öffnen wir den Datensatz. Und dann von hier aus können wir durchsuchen, was der Inhalt des Datensatzes ist. So sofort können wir sehen, dass wir in unserem Datensatz die Ordner haben, die wir gerade erstellt haben. Und dann haben wir hier die Root-Ebene im Ordner. Dann haben wir alle Daten, die wir von der Quelle gesehen haben, als wir uns mit SAS-Token authentifiziert haben. Also sind alle Akten hier. Das ist großartig. Lasst uns anklicken. Ok. Und jetzt, da wir unsere Daten haben, Lassen Sie uns funktionieren trotz dieser spielen, McCrea hatte gespeichert. Großartig. Pipeline wurde jedoch gespeichert. Nun gehen wir zurück zu unserem Arbeitsbereich und sehen, was unsere Notebooks wie wir den Monitor-Teil der Pipeline ausgeführt haben, die wir gerade getan haben, dann haben wir sichergestellt, dass die Dateien in den Blob-Speicher übertragen wurden. Also ist alles in Ordnung. Wir haben den richtigen Ordnernamen. Dann können wir untersuchen, hat Daten nicht erraten. Dann haben wir diesen Teil des Notizbuchs. Hier fangen wir also an, mit Databricks zu arbeiten , um zu sehen, was mit unseren Speicherkonten, Daten usw. vor sich geht. Hier müssen wir ein paar Optionen ausfüllen. Beginnen wir mit dem Namen, der, den wir verwenden. Also hier, von hier aus, aus unserem Datensatz, können wir uns überprüfen. Also, wenn Sie eine Bearbeitung haben, und dann haben wir hier den Namen unseres Speicherkontos. Lassen Sie uns einfach sicherstellen, dass alles richtig eingerichtet ist. Dann können wir nicht den Namen unseres Speicherkontos. Jetzt müssen wir den Schlüssel für dieses Speicherkonto erhalten. Diese sind also auch Teil unserer Dokumentation. Wenn Sie es hier überprüfen, sollten Sie nicht in der Lage sein, den richtigen Ort zu finden, an dem Sie das Speicherkonto erhalten. Gehen wir zum Portal. Also bekommst du einen Test. Lassen Sie uns nach unserem Speicherkonto suchen, ist die erste Option hier für mich. Und wir haben Zugang T's. Lasst uns darauf klicken. Dann werde ich meine Schlüssel zeigen und dann werde ich die erste Option kopieren, die ich habe. Und dann würden wir diesen Wert hier platzieren. Dann können wir das retten. Aber bevor wir diesen Code ausführen, muss ich einen Cluster erstellen , der tatsächlich ausgeführt wird. Mein Code ist die Rechenressource. Es wird die Operation durchführen. Um dies zu tun, lassen Sie uns die folgenden Schritte ausführen. Hier im linken Bereich, wenn Sie auf Cluster auswählen, können wir sehen, dass wir im Moment keine Cluster ausgeführt haben. Wir haben keinen Cluster erstellt, ja. Also müssen wir einen Cluster erstellen und unser Notebook an den Cluster anhängen. Lass uns das machen. Ich werde ihm nur einen Namen geben. Ich würde einen einzelnen Knoten bekommen. Dann werde ich diesen Cluster bekommen, den wir zur Verfügung haben, was für einen Kurs für eine tangentiale Erinnerung ist. Aber es muss Optionen. Stellen Sie sicher, dass alles in Ordnung ist. Und lasst uns auf Cluster erstellen klicken. - Klasse. Unser Cluster ist jetzt hochgefahren. Auf keinen Fall. Du wirst hier ein bisschen Platz sein, weil es ein paar Minuten dauern kann, bis es ärgerlich ist. Aber dann läuft es auch. Sie können den Code mit unserem Cluster ausführen. Weil Sie hier sehen können, haben wir keine Bücher. Wir haben alle Notizbücher an diesen Cluster angeschlossen. Wie Sie sehen können, haben wir keine Notizbücher sind an drei Bindestriche befestigt. Dann, wenn man einige Bibliotheken hinzufügt und so weiter, so weiter, können Sie hier zu anderen 1000 gehen. Gehen wir also zurück zu unserem Arbeitsbereich und der Datenaufnahme. Hier, unser Notizbuch. Also müssen wir das anhängen, wie Sie hier sehen können, es ist losgelöst. Wenn wir hier klicken, können wir jetzt den Cluster auswählen, den wir bereits haben, den, den wir gerade erstellt haben. Also lasst uns hier klicken. Und diese werden unser Notizbuch an diesen Cluster anbringen. Wenn Sie diese Zelle auswählen, können Sie die Zelle und nur die Zelle ausführen. Sie können die Option haben, alle Zellen auszuführen, wenn Sie möchten. Aber an dieser Stelle wollen wir nur die Variablen zuweisen, die Werte, die wir ersetzt haben. Also, um sicherzustellen, dass wir diese Handwerker am Ende und am Anfang hierher bewegen. Wir haben also nur die Werte, die wir wollen. Dann können wir das erledigen. Lassen Sie uns weiter hier auf der Play-Taste gehen und dann Zelle ausführen. Wie Sie sehen können, war es ziemlich schnell weil nur die Werte den Variablen zugewiesen wurden. Wir werden das überspringen. Dies ist nur, wenn Sie den Inhalt der Blutspeicherung sehen möchten, wir haben dies bereits getan, also werden wir diesen Teil einfach überspringen. Und dann lesen wir hier unsere perkussive Datei, die Kriminaldaten, New York 716 Daten Boston in unsere Datenflüsse. Okay, also markieren wir die Zelle und starten die Zelle. Und dann, tut mir leid, ich stehe auf DataFrame. So können wir dies in unseren DataFrame ausführen. Okay, das sieht gut aus. Jetzt haben wir die beiden, die Straftat erstellt haben, und wir können tatsächlich den Datenrahmen anzeigen. Lassen Sie uns die Zelle ausführen und erstellen. Wir können den Inhalt der Datei sehen. Auch hier können wir laufen, um sicherzustellen, dass es in Ordnung ist. Kratzen. Also hier haben wir die Beta-Freunde einen für den Bogen erstellt. Und dann möchten Sie für Boston, Sie können verschiedene Namen für Ihre Daten Freunde verwenden. Und der nächste Halt ist die Transformation. Wir werden also das andere Notizbuch auswählen, um die Transformation dieser Daten durchzuführen. 51. Wie du ADF nutzst den Wandel mithilfe eines a verkörperst: Der nächste Schritt für uns ist hier, mit den Datentransformationen zu beginnen. So können Sie hier klicken und wir werden mit dem dritten Notizbuch aufgefordert. Es ist ein beschreibendes Buch, das uns zeigt, wie wir die Datentransformation erreichen können. Der erste Schritt besteht also darin, tatsächlich ein Zugriffstoken zu erhalten. Und dann als zweiten Schritt werden wir eine Aktivität in ADF erstellen, um sich mit dem Notebook zu verbinden, das hier auf Databricks bereitgestellt wird. Dann schauen wir uns die Aktivitäten zusammen an. Wir werden die Pipeline veröffentlichen und die Pipeline ausführen. Sobald es ausgeführt wird, können wir tatsächlich von Data Factory validieren, ob es erfolgreich ist oder nicht. Wir werden dann zum direkten Arbeitsbereich zurückkehren und die Ausführung unserer Transformationen überprüfen. Also lasst uns hierher zurückkommen und damit beginnen, unser Zugriffstoken zu erstellen. Klicken wir hier auf die Benutzereinstellungen. Dann haben wir ein neues Token generiert. Lasst uns darauf klicken. Und Sie müssen diesem Token einen Namen geben. Also behalte einfach schwarzen Token. Und hier ist die Lebensdauer meines Token. Sie können zu einer beliebigen Zahl wechseln. Ich werde 30 Tage setzen und sie erzeugen. Dies ist also wichtig, dass Sie dies zu diesem Zeitpunkt kopieren weil dies der einzige Moment ist, in dem Sie dieses Token sehen werden. Also lassen Sie uns das schneiden. Ich drücke Control C. Und dann schließe ich das vorerst. Und ich werde mein Reden hier retten. Was sind meine Aktie Dinge Schöpfer? Kommen wir zurück zu unserem Notizbuch. Und dann können Sie sehen, dass wir zu unserer Datenfabrik zurückkehren und unseren verknüpften Service erstellen müssen. Gehen wir zurück zu dem, einer Fabrik. Es, Lassen Sie uns hier eine Databricks Aktivität greifen, und dann werden wir OK wählen. Dann von hier aus können Sie sehen, wir haben ein paar Optionen. Wir können einen verknüpften Dienst auswählen , der der Arbeitsbereich ist, an dem wir gerade arbeiten, in den Einstellungen, in denen wir den Standort unseres Notebooks festlegen können. Beginnen wir also mit der Erstellung eines neuen Links beim Service. Sie können jeden Namen geben, den Sie wollen. Ich würde nur US Azure Databricks behalten. Ich werde eine Zoom Zoom Integration Runtime verwenden. Hier. Sie können den Arbeitsbereich aus dem Abonnement abrufen. Ich wähle mein Abonnement und wähle dann meinen Arbeitsbereich aus. An dieser Stelle sollten Sie sehen, wo Arbeitsbereich genau hier. Wir haben drei Optionen von Clustern. Wir haben die Option und wählen Sie einen neuen Cluster. Wir können eine vorhandene oder eine Inzidenz für verwenden, da wir bereits unseren Cluster erstellt haben, lassen Sie uns Bestehende Verzeichniscluster auswählen. Unser Authentifizierungstyp wird Zugriffstoken sein. Wir verwenden das Token, das wir gerade aus dem Databricks-Arbeitsbereich erstellt haben. Wir werden diesen Token einfach kopieren. Dann sollten wir in der Lage sein, den Cluster zu sehen, den wir erstellt haben. Und es ist genau hier. Wählen wir das aus und testen wir unsere Verbindung. Lassen Sie uns auf Erstellen klicken. Großartig, es ist jetzt erschaffen worden. So können wir hier Schritt für Schritt überprüfen, was wir gerade von dem verlinkten Service gemacht haben. Und dann haben wir die Standorte unserer Notizbücher. Dies ist also die Registerkarte Einstellungen. Wir müssen Ihre Benutzer auswählen, und dies wird Ihr Benutzerkonto sein. Und dann müssen wir tatsächlich auf das Notizbuch statt nur auf den Ordner zeigen. Also, was Sie hier tun können, können wir zurück zu Räumen gehen. Klicken Sie auf Includes. Wenn Sie diese Option markieren, haben Sie das gesamte Verzeichnis, in dem Sie sich gerade befinden. Wenn Sie also nur diesen und Kaffee markieren, können Sie die URL wie gewünscht erhalten. Kommen wir zurück zu unserem okay, da wir diese Informationen haben, gehen wir zurück zu dieser Fabrik und fügen Sie diese Informationen hier ein. Wir haben den Standort unseres Notizbuchs. Gehen wir zu den Basisparametern. An diesem Punkt benötigen wir 20, ein paar Parameter, die als Argument an unser Notebook übergeben werden. Das ist also ziemlich wichtig. Es wird sehen, dass wir diese Informationen auch hier haben. Wir brauchen also den Kontonamen, den Kontoschlüssel und den Containernamen. Wir können diese Informationen von meinem Speicherkonto, von Eigenschaften und dem Portal abrufen. Dann werde ich hier einen Parameter hinzufügen und ich werde zweite, dritte hinzufügen. Jetzt wird unser zweiter Parameter Kontoschlüssel sein. Und es wird einen Containernamen geben. Lassen Sie uns nun die Werte für diese Parameter abrufen. Hier im Portal habe ich nach dem Speicherkonto gesucht. Wir wollen die Zugangsschlüssel. Premier, Sie haben zwei Informationen, die wir brauchen, um Schlüssel zu zeigen. Dann können wir im Grunde Kontoschlüssel gleich hier. Jetzt können wir den Kontonamen bekommen. Wir können Ihr Rot hier einfügen. Und dann brauchen wir den Container. Unser Container ist DWT. Dann kleben wir es hier ein. Großartig. Wir haben alle Informationen, die wir brauchen. Also, was wir tun werden, werden wir die beiden miteinander verketten. Wir stellen also sicher, dass wir die richtige Reihenfolge haben, d.h. wir werden die darin enthaltenen Daten importieren. Wir werden diese Daten verarbeiten. Sobald dies geschehen ist, können wir endlich unsere Pipeline veröffentlichen. Klicken wir also auf Veröffentlichen, um sicherzustellen, dass alles gespeichert ist. Unsere Pipeline ist jetzt veröffentlicht. Jetzt werden wir diese Pipeline ausführen. Klicken wir jetzt auf Trigger und folgen Sie der Ausführung unserer Pipeline. Wenn wir zu überwachen gehen, sollten wir eine neue KI in Arbeit sehen. Lasst uns live mit dem Flugzeug anklicken, okay? Oder wenn unsere Kunden versagt haben. Werfen wir einen Blick und sehen, ob wir das beheben können. Lassen Sie uns auf Spiegel klicken. Und wir können sehen, dass es einen Fehler mit unserem Weg gibt. Es muss mit Schrägstrich beginnen. Wenn wir zurückgehen und auf die Dokumentation achten, sollten wir mit Schrägstrich Benutzer beginnen. Und wenn Sie direkt aus dem Notizbuch selbst kopieren, erhalten Sie einen Arbeitsbereich und sollten nicht enthalten sein. Gehen wir zurück zu unserer Pipeline. Und wenn wir die Pipeline überprüfen und sehen, was wir haben, sehen wir, dass dies enthalten ist, also sollten wir keinen Arbeitsbereich einschließen. Lassen Sie uns das löschen. Lassen Sie uns unsere Pipeline nochmals veröffentlichen. Großartig, es wird veröffentlicht. Jetzt lassen Sie es uns nochmal laufen und sehen, wie es aussehen wird. Gehen wir zu überwachen. Lasst uns ihn falsch anklicken. Für unseren Zweck schneit, werden wir zuerst die Daten kopieren und dann unser Notizbuch ausführen. Es ist gelungen, und wir können überprüfen, was die Ausgabe unseres Notebooks ist. Lasst uns hierher kommen. Und wir haben hier ein wenig Informationen über die Lauf-ID. Dann haben wir das Ziel unserer Daten, die Service-Raten ausgeführt. Das ist ziemlich cool. Eine weitere interessante Sache hier zu bemerken ist, dass, wenn Sie das kleine Glas hier hervorheben, wir ein wenig Informationen haben können. Wenn Sie die Notebook-Aktivität auswählen, können wir auf die falsche Seite Löschheaps gehen, indem wir uns zum Arbeitsbereich leiten, klicken wir darauf und wir können die Aktivität überprüfen, die von der Pipeline ausgeführt wurde. Hier können wir sehen, wie lange jede der Zellen dauerte, um fertig zu werden. Sie erstellen also die Datenrahmen. Wir normalisieren die Datenrahmen für jede Stadt, die Audit-Transformationen bei der Erstellung eines einzigen DataFrame. Und schließlich exportierten wir die Preppers-Daten in eine persistente Tabelle. Und dann von hier haben wir bereits einen Tisch. Wie Sie sehen können, kam der Start als OK, und die Daten wurden als Tabelle beibehalten. Kommen wir zurück zu unserer Dokumentation. Und ist sehen wir nur sehr kämpfen die Ausführung unseres Notebooks als sechs Schritt hier, können wir einen Blick auf die Daten mit diesem Notebook. Wenn Sie hier bemerken, hat es keine Bücher getrennt. Sie können also vor dem Ausführen an den Cluster anhängen. Lasst uns hierher kommen. Und ich werde mich an meinen ersten Cluster anschließen, und es ist jetzt angehängt. Also, was ich tun kann, kann ich die Tischmorde bekommen, diejenige, die ich gerade aus der Transformation erschaffen habe. Und wir können diesen Zell-pH-Wert ermitteln. Wir haben die Ausgabe der Tabelle. Dann ist das etwas exponentiell. Was wir sehen sollten, könnten wir zuerst mehrere Tabellen überprüfen, wenn wir wollen, zum Beispiel, New York oder eine andere Tabelle. Kommen wir wieder zurück zu den OEM-Seiten. In diesem Fall, da wir gewinnen Park ist, ist dies ziemlich einfach für uns, weil es einfach die Programmiersprache ausführen kann , mit der Sie besser vertraut sind. Also in diesem Fall hier sind wir ein SQL geboren, um die gleichen Ausgaben aus dem Verkauf von beiden zu erhalten. Lassen Sie uns auf Run Zelle klicken. Lassen Sie uns erstellen, wir haben die Ausgabe unserer Daten. In diesem Fall hier beschränken wir BI Desktop ersten 20 Datensätze. Das ist ziemlich cool. Dann, wenn Sie hierher zurückkommen, können wir etwas Aggregation mit diesen Daten machen. Dies sind die transformierten Daten, die nicht die Rohdaten sind. Klicken wir noch einmal hier, führen Sie diese Zelle aus. Wir kommen wieder in einen DataFrame. Und lassen Sie uns, Lassen Sie uns diese Datenrahmen anzeigen. Kommen wir her, und wir verkaufen uns. Und was weißt du? Wir haben eine visuelle Information über unsere Aggregation. Das ist die Kraft von Databricks und Data Factory zusammen. Sobald Sie die Daten in Data Factory geladen haben, können Sie all diese Transformationen mit Databricks erstellen und beide miteinander integrieren. Ziemlich einfach. Herzlichen Glückwunsch, wir haben gerade unser Labor in unserem Projekt abgeschlossen. In unserem nächsten Modul werden wir sehen, wie wir in die Produktion einbringen können. All das coole Zeug, das wir gerade mit einer CICD-Pipeline von Azure DevOps gemacht haben. Danke fürs Zuschauen. Wir sehen uns bald. 52. Quiz – Modul 6: Gut. 53. DevOps – Wie du eine Azure DevOps Organisation und Projekt erstellst: Hallo Leute, und willkommen zu einer anderen Lektion. In dieser Lektion werden wir sehen, wie es eine Azure DevOps-Organisation und ein Projekt erstellen kann. So können wir damit beginnen, unsere Repositories und Pipelines zu erstellen. Hier im Portal können Sie nach Azure DevOps suchen. Wählen Sie dann Azure DevOps-Organisationen aus. Und hier unten können Sie meine Azure DevOps-Organisation sehen. Lasst uns darauf klicken. Sie werden mit dieser Seite aufgefordert. Ich werde einige der Informationen hier verwischen. Und dann lassen Sie uns auf Neue Organisation erstellen klicken. Dann können Sie Ihrer Organisation einen Namen geben. Wählen wir eine Region in der Nähe Ihres physischen Standorts aus. In meinem Fall werde ich UK Salz auswählen. In Ordnung, Leute, jetzt, wo Sie Ihre Organisation erstellt haben, ist es Zeit, ein Projekt zu erstellen. Mit einfachen Worten, die Organisation ist die übergeordnete Ebene eines Projekts. Wenn Sie dann Repositories und Pipelines erstellen , gehören diese Elemente zu einem Projekt. Lassen Sie uns also anfangen, unsere ersten Projekte zu erstellen und es als PDF zu benennen. Es wird privat sein. Das ist in Ordnung. Klicken Sie dann auf Projekt erstellen. Dies ist das erste Bild unserer Projekte. Wie Sie sehen können, kommt es und T und die meisten unsere Aufgabe wird aus dem linken Bereich hier auf Repositories und Pipelines durchgeführt werden . Ihrer nächsten Lektion werden wir sehen, wie wir ein Repository erstellen können , das alle JSON-Dateien aus unserer Data Factory, CH enthält und bis bald. 54. DevOps – Wie man ein Git-Repository in Azure DevOps erstellt: Okay Leute, das ist die Zeit, unser erstes Repository zu erstellen , um den Code aus unserer Fabrik wiederherzustellen. Klicken Sie im linken Bereich auf Repos. Und dann hier, wie Sie sehen können, kommt es mit einem Standard-Repository mit dem gleichen Namen wie unser Projekt. In diesem Fall ist es noch nicht initialisiert. Es gibt keine Einheit, keine Dateien überhaupt. Deshalb sehen wir nichts. Aber lassen Sie uns einen neuen Web-Bot erstellen und sehen, wie er ihn initialisieren kann. Klicken wir hier im Dropdown-Menü und klicken Sie auf Neues Repository. Und lasst uns einfach einen Namen geben. Also werde ich uns ihre edf QuickBooks geben, du bist einer. Und dann werden wir eine Readme-Datei hinzufügen, um das Repository zu initiieren. Lassen Sie uns auf Erstellen klicken. Lassen Sie uns unseren ersten Bericht erstellen erstellt. Und dann, wenn wir auf die linke Seite Zweige gehen, können wir sehen, dass wir unsere Standard-Zweig-Ersteller haben. Zurück zum letzten Jahr. Vielleicht hätten wir einen Master-Zweig als Standardname. Microsoft hat begonnen, diese Standardnamen zu ändern, Domäne statt Master. Das ist okay, Lassen Sie uns mit mir arbeiten und dann sehen, wie es unsere Data Factory mit diesem Repository verbinden kann. Das ist alles vorerst. Wir sehen uns in der nächsten Lektion. 55. DevOps – So verwirklicht du die Arbeit von Azure DevOps Repository: Hallo Leute, willkommen zu einer anderen Lektion. In unserer letzten Lektion konnten wir sehen, wie es einen Webball erstellen kann. Lassen Sie uns nun unsere Data Factory mit diesem Repository verbinden. Dafür, Kommen wir zurück zum Portal und gehen Sie zurück zu unserer Datenfabrik. Nun, da wir hier auf der Homepage unserer Data Factory sind, haben Sie vielleicht bemerkt, dass wir etwas namens Setup-Repository haben. Oder wenn Sie gehen, um zu verwalten, wir haben auch eine gute Konfiguration. Kommen wir zurück zur Startseite und klicken Sie auf Setup Code-Repository. Dann von hier haben wir die Arten von Repositories zur Verfügung, da wir ein Git-Repository erstellt haben, lassen Sie uns auf Hazard DevOps Git klicken. Dann haben wir unser Verzeichnis, dann haben wir DevOps-Konto. Das ist die Organisation, die wir geschaffen haben. Dann wird der Projektname , der ADF sein wird. Dann müssen wir entweder ein neues Repository erstellen oder auf vorhandene klicken. Wir setzen literarische, da wir bereits Stunden erstellt, Lassen Sie uns vorhandene verwenden und wählen Sie dann Azure AD F Repo ein. Und dann haben wir das Collaboration-Angebot. Jetzt unser Fall hier, wir wollen wählen Sie die Haupt, die unsere Standard-Zweig ist. Und dann haben wir, was man Publish Zweig nennt. Dies ist ein Zweig verwendet Data Factory. unseren nächsten Lektionen werden wir mehr auf Details eingehen. Dann ist dies unser Root-Ordner. Dies ist der Ort, an dem Data Factory Ordner ablegt und versucht, Ordner zu lesen. Also lassen Sie uns einfach mit der Wurzelebene bleiben. Und das hier ist an dieser Stelle ziemlich wichtig. Da haben wir eine Menge Demonstrationen und Erstellen von Pipelines, wir haben bereits Elemente in unserer Data Factory, und das ist zu niedrig, wenn diese Elemente in unsere ag, um den Baum zu widersetzen, Lassen Sie uns sicherstellen, dass dies ausgewählt ist. Dann ist dies der Ort, an dem wir die vorhandenen Objekte aus unserer API, der Fabrik auf den Schraubenschlüssel, importieren . Wir werden die Zusammenarbeit Zweig verwenden, die ARE Fälle Domäne. Das ist alles, was es benötigt wird. Lassen Sie uns auf Übernehmen klicken und sehen, ob wir unsere Data Factory mit dem Repository verknüpfen können, das wir gerade erstellt haben. Das nennt man jetzt Ribose verbunden. Und wenn wir alle im linken Bereich auswählen, können wir sehen, dass wir hier ein neues Element haben, das der Arbeitsbereich ist. Von hier aus können Sie in verschiedenen Feature-Marken arbeiten. Sie können eine neue Marke für Ihre Kollegen erstellen. Und niemand würde das Wort überlappen und Sie würden viele Fehler vermeiden. Ich werde auf Neu erstellen klicken, und ich habe meinen Namen und speichern. Wie Sie sehen können, erstelle ich einen neuen Zweig aus dem Haupt, die Elemente enthält, die wir wichtig sind. Von hier aus kann ich mit jeder Aufgabe arbeiten, die ich will, und es würde den Hauptzweig nicht beeinflussen. Das ist alles für jetzt, wir haben gesehen, wie wir unsere Datenfabrik mit dem Ripple Garn verbinden können. Nächste Lektion werden wir sehen, wie wir mit den Franzosen arbeiten können. Bleiben Sie dran. Wir sehen uns bald. Danke fürs Zuschauen. 56. DevOps – So verfasste man Azure Data Factory mit Branches: Hallo Leute, willkommen zu einer anderen Lektion. Azure Data Factory kann als primärer ETL-Dienst zum Push-, Abfrage- und Transformieren von Daten in Azure betrachtet werden. Das Ziel dieser Lektion ist es zu erklären wie die Freigabe zwischen Umgebungen ist, zum Beispiel Entwicklung und Produktion auftreten und wie wir die Repositories nutzen können , die wir zwei Versionen unseres Codes erstellt haben. Das Bild, das wir hier vor Blasen haben, zeigt den Lebenszyklus der ETL-Pipelines wird in Azure Data Factory mit einem Git-Repository bereitgestellt. Im ersten Schritt haben wir 12 für die Sandbox, da dies der Moment ist , in dem die Data Factory mit einem Git-Repository verknüpft ist. Dann können die Entwickler beginnen, in Feature-Zweig zu arbeiten. Und dann nehmen wir an, dass John Entwickler an einer neuen Funktion arbeitet. Er schafft dann einen neuen Zweig. Sobald er mit all den Ketten zufrieden ist, alles, was er getan hat. Anschließend wird eine Pull-Anforderung erstellt, um diesen Code in den Master-Zweig zusammenzuführen. Master-Zweig, in unserem Fall, wie es vorher sehen konnte, ist der Hauptzweig. Die Namenskonvention hat sich für diesen Code zu dem aus seinem Zweig in den Hauptzweig herausgegebenen geändert , weil er genehmigt werden muss. Normalerweise gibt es Richtlinien, die verhindern, dass Entwickler direkt ohne Genehmigung zusammenführen können. Dies ist der Moment, in dem der Code überprüft wird und wenn alles in Ordnung ist, wird der Code zusammengeführt. Schließlich, wie Sie hier sehen können, haben wir unsere Codierung, unser Hauptzweig, wenn wir die Datenfabrik mit einem Git-Repository in einem neuen Zweig verknüpfen, wird hinter den Kulissen erstellt, aber es ist noch nicht sichtbar. Wie Sie sich vielleicht aus unserer letzten Lektion erinnern, konnten wir sehen, dass wir nur einen Zweig hatten, den Hauptzweig. Wenn wir auf die Aktion von in Data Factory veröffentlicht klicken, werden wir dies visuell in unserer Fabrik durchgehen. Hat der Code aus dem Hauptzweig geht an einen Zweig namens ADF veröffentlicht. Und dann können wir an dieser Stelle den Zweig aus dem Projektarchiv sehen. Wie Sie hier sehen können. Das ist etwas, das bereits in Artifactory ist. Einige der Elemente, sie werden manuell ausgeführt, wenn Sie vom Entwickler oder als Ergebnis einer Aktion sind. Beispielsweise klicken Sie auf die Schaltfläche Veröffentlichen, sobald sich der Code im ADF in diesem Zweig befindet. Dies ist der Code, der bereit ist, an die Produktion gesendet werden. Auf der Seite von Azure DevOps erstellen wir hier die Release-Pipeline, um diesen Code zu betrachten und zu patchen, um ihn für die Produktion freizugeben. Alle Elemente, die wir innerhalb von Data Factory haben, zum Beispiel Pipelines, verknüpfte Dienste, Datenflüsse. Jedes einzelne Element, das wir haben, wird als JSON-Notation erstellt. Das ist also unser Code und das ist es, was hier wieder glücklich wird, eingesetzt zu werden. Dann haben wir freigegeben wird kann manuell oder automatisch sein. Es hängt davon ab, wie Sie erstellen, dass Sie Azure DevOps veröffentlichen. Und dann ist hier, wenn der Code an eine Produktion gesendet wird, die eine Fabrik , manchmal, sehr kompliziert mit vielen Schritten aussehen könnte. Aber wenn man von der visuellen betrachtet, ist es ziemlich einfach zu verstehen, wenn man einmal oder zweimal tut. Lassen Sie uns also zurück zu dieser Fabrik und sehen, wie dies visuell vom Datenportal und auch von Azure DevOps funktioniert . 57. DevOps – Zusammenführung von Data Factory Code: Okay Leute, jetzt bin ich hier auf dem Portal, wenn es um CISD-Bereitstellungen geht. Die einzige Umgebung, die wir mit einem GET-Repository verknüpfen , ist der Entwicklungsfonds Audio-Umgebungen. Wir würden nur den Code erhalten, den wir im Git-Repository veröffentlichen. Okay, jetzt wechseln wir zu unserer Datenfabrik, haben wir die Data Factory, an der wir bisher gearbeitet haben. Wir haben unsere Pipelines hier drin und ich habe meine Filiale. Das ist also mein Feature-Zweig. Okay, schauen wir uns unser Diagramm an und sehen, wie wir das Schritt für Schritt machen. In unserem Fall haben wir bereits diesen Typ verwiesen, da wir bereits Details zugeordnet haben und dann unsere Pipelines in unserem Feature-Zweig erstellt haben. Jetzt müssen wir eine Pull-Anfrage erstellen, um unsere Codes mit dem Master-Zweig zusammenzuführen. wir einen Blick auf unser Repository auf Azure DevOps, um zu sehen ob wir einen Code haben, in dem ich meine Azure DevOps geöffnet habe. Ich werde die Projekte öffnen, die wir erstellt haben. Dann werde ich hier auf der linken Seite mein Repository überprüfen. Dann haben wir dieses Repository erstellt. Wie Sie sehen können, habe ich hier ein paar Artikel. Wir haben erstellt, dies waren die Commits, die wir zuvor getan haben. Wir haben unsere Hauptniederlassung. Ich habe keinen Zweig namens ADF und beschreiben Veröffentlichen. Wenn Sie sich hier erinnern, ist dies der Zweig, der automatisch erstellt wird. Also an dieser Stelle haben wir einen Code hier in unserem Hauptzweig. Lassen Sie uns eine Pull-Anfrage erstellen, um das zu verschieben, was wir in unserem Feature-Zweig haben , von meinem Durchschnitt wird in den Hauptzweig verzweigt, okay? Von hier aus können Sie hier auf das Dropdown-Menü klicken und auf „Pull Request erstellen“ klicken. Es wird mich zu Azure DevOps umleiten. Und dann kann ich von hier aus eine Pull-Anfrage erstellen. Aber wie Sie sehen können, da wir bereits getan haben, wenn anfänglich zusammengeführt oder keine Änderung für mich auch, um in den Hauptzweig zu verschmelzen. Und wir werden einfach etwas in Data Factory hinzufügen , nur damit diese Änderung hier abgeholt wird. Und wir können sehen, wie wir eine Pull-Anfrage erstellen und entstehen. Gut, komm zurück in die Data Factory. Wir haben unsere Pipeline, also werde ich nur eine der Pipelines hier klonen. Und wir können weitermachen und eine neue Pull-Anfrage erstellen. Also klicken Sie einfach hier auf Brotkrumen Aktion und wir können klonen. Also haben wir einen Klon unserer Pipeline. Der Name wird am Ende kopiert. Wir haben jetzt und Umzug wurde abgeholt. Was wir tun können, können wir alles retten. Also rette ich gegen meinen Zweig. Hier draußen wird es grau. Ich kann nichts veröffentlichen. Dies ist also einer der Gründe, warum wir den Debug-Modus nur für eine neue Pipelines ausführen können , weil mein Code noch nicht veröffentlicht wurde. Lassen Sie uns nun eine Pull-Anfrage erstellen, um meine Kopie in den Master-Zweig zu verschmelzen. Wenn ich meine, meine Streiche zwei Hauptzweig ändere, können Sie sehen, dass ich nicht die Pipeline habe, die ich gerade geklont habe, weil sie noch nicht zusammengeführt wurde. Also zweigt mein Feature vor meinem Hauptzweig. Nun, lasst uns noch einmal hier klicken und eine Pull-Anfrage erstellen. Es wird gehen und mich wieder zurückziehen. Und wie Sie sehen können, bringt es mich hier auf diese Seite, die es von Integrator ProQuest ist, also kann ich eine Beschreibung oder irgendetwas hinzufügen, dass eine ID, aber normalerweise nimmt es die Änderung in, dass ich getan habe. Also werde ich gehen und eine Schöpfung bekommen. Ich habe hier eine neue Pull-Anfrage, und das ist aktiv. Das ist der Status. Wenn Sie hier wieder auf der linken Seite Anfrage klicken, so dass Sie sehen können, dass Sie Geist haben, Sie haben Schauspieler, Sie haben eine aufgegeben abgeschlossen. Also werde ich weitermachen und meine Anfragen genehmigen. Normalerweise hätten Sie diese Berechtigung für unsere Unternehmensumgebung nicht. Also werde ich voran gehen und Anfragen genehmigen. Und dann nehmen wir an, jemand anderes hat es gerade getan. Es ist meine Pflicht, hierher zu kommen und zu vollenden. Also und dann würde ich einfach gehen und die Zusammenführung abschließen. Zusammenführen eines Pull-Requests Großartig, es ist keine Verschmelzung. Kommen wir zurück und lassen Sie uns überprüfen, ob wir das jetzt in den Hauptzweig haben , der hier ist. So erstellen wir einen Pull-Request. Der dritte Schritt unseres, unser Workflow. Jetzt, da wir unseren Code hier haben, ist es Zeit zu polieren. So können wir diesen Code tatsächlich in Data Factory veröffentlichen. Und wenn wir die Pipeline mit einem Trigger ausführen möchten oder wenn Sie den Code in die Produktionsumgebung bereitstellen möchten, ist in dieser Version der Daten. Dies ist der Moment, hier können Sie das tun. Gehen wir also voran und klicken Sie auf Veröffentlichen. Denk dran, du musst von deinem Hauptzweig rennen. Wenn interessant zu bemerken, bevor ich voran gehe und einen Code veröffentlichen, ist, dass mein Zweig, alles verschwunden ist. Das liegt an der Art der verschmolzenen, die sie während meines Auftretens taten. Es gab hier ein Häkchen. Und dann sagt einer der großen Box, dass, wenn Sie Ihr Venture löschen wollten, so ist dies eine gute Praxis für Sie zu beginnen. Immer sauber. Sie können also sehen, dass ich auf dem Hauptzweig bin und jetzt ist es nicht mehr ausgegraut. Ich kann weitermachen und meinen Code veröffentlichen. Es wird voran gehen und den Code veröffentlichen. Und dann wird es mir eine Zusammenfassung davon geben. Also habe ich hier nur eine Änderung. Und dann gehe ich weiter und klicke auf Veröffentlichen. Okay, mein Verleger wurde erfolgreich. Wie Sie sehen können, erscheint es jetzt ARM-Vorlagen zu generieren. Also dies ist der Moment, in dem ADF und beschreiben Publisher in all meinen Pipelines in unserem Audit Jason erstellt wird , dass ich das meine Datenfabrik zusammenstellen muss. Okay, jetzt zurück zum Projektarchiv, jetzt haben wir gemacht, lasst uns diese Seite gräulich aktualisieren. Jetzt, wie Sie sehen können, haben wir die F-Politur. Damit können wir unseren Workflow hier beenden, weil unser Code einsatzbereit ist. Wir sind glücklich und das ist die Version, die wir live gehen wollen. Jetzt werden wir sehen, wie wir eine Release-Pipeline erstellen können, um diesen Code zu veröffentlichen. Produktionsdaten-Factory. Bleiben Sie dran und sehen Sie bald. Danke fürs Zuschauen. 58. DevOps – Wie man eine a für Data Factory in Azure DevOps erstellt: Hallo Leute, willkommen zu einer anderen Lektion. In dieser Lektion werden wir sehen, wie wir Azure DevOps verwenden können , um von Jalousien freigegeben zu erstellen, die ich auf Azure DevOps veröffentlicht habe, ist das primäre Tool, das von verschiedenen Abteilungen verwendet wird, um diese Factory-Objekte von der Entwicklung bis zur quasi Umweltproduktion Umgebung und so weiter, so weiter. wir nun zu unserem Azure DevOps-Konto. Ich bin auf der Homepage meines KDF-Projekts. Also, um mit der Erstellung unserer Release-Pipelines zu beginnen, Kommen wir zurück hierher in den linken Bereich. Und wie Sie sehen können, haben wir das, was man eine Veröffentlichung nennt. Lasst uns darauf klicken. Großartig. Es wird leer sein, weil wir noch nichts erschaffen haben. Also lasst uns auf mu durch Leerzeichen klicken. Großartig. Der erste Schritt hier zeigt mir mein Artefakt und Bühne. Es ist alles ausgegraut, weil ich etwas auswählen muss , wo ich den Code bekomme und welche Aufgaben ich verwenden möchte. Also hier haben Sie eine Reihe von Optionen out of the box für Sie zur Auswahl. Wenn wir also mit einer Anwendungsentwicklung arbeiten, ist es sehr wahrscheinlich, dass Sie hier eine Option für Sie haben. Wir gehen einfach voran und klicken hier ganz oben auf leere Lücke. Und dann machen wir es einfach selbst. Also werde ich das hier auch schließen. Wir haben ein Artefakt hinzugefügt, daher wird dies unser ADF veröffentlichter Zweig aus dem Repository sein. Lasst uns darauf klicken. Dann haben Sie hier verschiedene Optionen, um Ihren Code zu erhalten. Hier könnte gebaut werden. Dann haben Sie das Repository ist, wenn wir schnell bekommen Hub oder Entzündungen, Sie haben auch die Möglichkeit. In unserem Fall wäre es ein Zoo Repositories bekommen, Lassen Sie uns unsere Projekte wählen ADF sein. Dann wird dies die Quelle sein. Die Quelle ist das Repository. Dies ist derjenige, den wir erstellt und unseren Code gespeichert haben. Dann haben wir den Standard-Zweig. Dies ist der endgültige Ort unserer Daten. So haben wir Haupt- und ADF veröffentlicht. In diesem Fall werden wir ADF veröffentlicht auswählen. Wieder einmal sind wir in diesem Stadium hier und wir entwickeln und bekommen die Daten aus unseren Artefakten von ADF veröffentlicht, okay, wir wählen die EDF-Lösung und dann wollen wir die neueste Version. O ist die neueste Version des Zweigs. Und von hier aus, wenn ich die Quellbereiche ändere, bleibe ich normalerweise nur bei dieser Option. Klicken Sie einfach auf die Kante. Jetzt, großartig. Dies ist der Ort unseres Codes. Dies sind die Daten, die wir in unserer Umgebung veröffentlichen werden. Hier sind die Heftklammern. Sie können mehrere Etappen in Ostasien als Umgebung haben. Zum Beispiel, wenn ich diese vier oder Produktion ändere, können Sie einen beliebigen Namen geben und immer mehr hinzufügen. Sobald Sie einen Vorgang ausgeführt haben, können Sie klonen und wir verwenden die Aufgabe, die Sie erstellt haben. Und Yara Fall, wir werden nur mit dem Produkt bleiben weil wir nur eine Produktionsdaten-Fabrik erstellt haben. Hier ist nun die Zeit, die Aufgaben zu erstellen. Azure DevOps stellt Ihnen kostenlos einen Agenten zur Verfügung, was bedeutet, dass Sie eine Rechenressource hinter der Szene haben, die Ihren Code verarbeitet. Wir werden bei all diesen Optionen bleiben. Wie Sie sehen können, haben wir die Azure Pipelines Agents, und dann erhalten wir einen Gati-Container mit Visual Studio 2017, Windows 2016. Wir können bei anderen Standardoptionen bleiben. Dann werden wir hier auf das Pluszeichen klicken, um eine neue Bereitstellung hinzuzufügen. Und dann ist die Aufgabe, die wir wollen, es nennt sich unvollendeter Planet. Klicken wir hier zweimal, 1, 2 und Y2. Weil wir hier unsere benachbarten validieren wollen, wollen wir einfach nicht sofort bereitstellen und einen Fehler bekommen. Eine der Optionen hier für uns ist es, eine Validierung statt Bereitstellungen zu tun, Lassen Sie uns alle Optionen ausfüllen, die wir hier tun müssen. Dies ist also die Verbindung, die wir haben, um eine Verbindung herzustellen, was bedeutet, dass wir sie mit unserem Abonnement verbinden müssen. Aber das ist, wird mein Standard-Abonnement sein. Dann fühlte ich mich aufstehen. Großer Börsengang versucht, meine Azure DevOps eine Verbindung zu meinem Abonnement herzustellen. Dann habe ich hier die Abonnements. Dann habe ich die Aktion erstellen oder aktualisieren Sie eine Ressourcengruppe, Azure. Und wir wollen, wir wollen nicht löschen und Ressourcengruppe. Und jetzt müssen wir die Ressourcengruppen auswählen, die wir wollen. Dies ist die zweite Option. Und wir haben den Standort. Auch hier muss dies ein Standort in Ihrer Nähe sein oder an dem Sie Ihre Fabrik entwickeln. Dann haben wir die Vorlage. Das wollten wir veröffentlichen. Also lasst uns hier anstatt Seite. Und dann haben wir das Repo, und dann haben wir den Namen des Projektarchivs, das die Data Factory sein wird. Dann haben wir die Datenfabrik, ich bin fertig. Das ist es, was wir wollten. Dies ist der Code, den wir in die Produktion gehen. Sie sind nicht mal nah dran, weil es schon abgeholt ist. Dann die Template-Parameter. Das sind die Parameter. Lassen Sie uns nun Parameter für die Factory auswählen. Sobald wir unsere Parameterdatei ausgewählt haben, ist dies der Bereitstellungsmodus. Das ist, wo ich Ihnen schon erwähnt habe. Wir haben eine inkrementelle abgeschlossen, löscht vollständig alles, was nicht Teil Ihrer ARM-Vorlage ist. Dies ist unsere ARM-Vorlage und wir haben nur über eine Fabrik. Es kann alle Inhalte Ihrer Ressourcengruppe löschen. Das ist also gefährlich, nach Frankreich zu gehen, um inkrementelle auszuwählen, wenn Sie spielen wollten. Da dies unsere erste Aufgabe ist, werden wir nur die Validierung auswählen. Das ist also großartig. Dies ist unsere erste Aufgabe, die abgeschlossen wurde. Dann können wir weitermachen und ihm einen Namen geben. Sagen Sie davon. Dann können wir hier auswählen. Jetzt werden wir nur bei den gleichen Optionen bleiben, die wir bereits erstellt haben. Da wir bereits autorisiert haben, können wir von Service-Verbindungen erhalten. Dann wählen wir unser Abonnement aus. Unsere Aktion wird es sein, Ihre Ressourcengruppe zu erstellen oder zu aktualisieren. Dann wählen wir wieder die gleiche Ressourcengruppe aus, die wir zuvor ausgewählt haben. Und wir müssen den Standort hier auswählen. Dann müssen wir wieder eine Vorlage auswählen. Und jetzt der Umfang. Diese werden umgesetzt. Und dann ist das alles. Wir werden das retten. Und wir werden unseren Code ausführen. Mal sehen, wie das gemacht werden kann. 59. DevOps – Wie man eine Release in Azure DevOps für ADF ausgeführt: Großartig, Nun, da unsere Pipeline fertig ist, lassen Sie uns eine kurze Überprüfung hier machen. Und die Pipelines, wir haben wieder unsere Artefakte, das ist unser Code. Das ist die Bühne. Dies ist der Ort, an dem wir unseren Code bereitstellen möchten. Dann haben wir hier dieses kleine Schild. Wie Sie sehen können, ist dies zu sagen, ob wir Continuous Deployment Trigger verwenden möchten. Indem wir dies aktivieren, wollen wir sagen, wann immer es einen neuen Schub zu unserem Zweig gibt, meine ich ADF und beschreiben öffentlichen Zweig. Dies wird diese Pipeline auslösen. Dies wird den Code ausführen. Okay, bleiben wir bei der kontinuierlichen Bereitstellung. Dann hier, wenn Sie hier klicken, ist dies der Ort. Wenn Sie Genehmiger für Bindestrich hinzufügen möchten. Stellen wir uns also vor, Sie möchten die Genehmigung vor der Bereitstellung von bestimmten Personen auswählen. Also schalten Sie diese Option im neuen Typ ein, den Namen der Leute hier. Und dann ist der Code nur Bereitstellung. Wird bereitgestellt, wenn es genehmigt ist. Okay, lass uns schließen. Das wollen wir nicht. Bleiben wir bei diesem Beispiel. Jetzt. Lassen Sie uns unsere Pipeline laufen und sehen, ob wir unsere Pipelines in die Produktion sehen werden. Bevor wir laufen, haben wir nur die Pipeline gespeichert. Also lasst uns sparen. Und jetzt können wir auf Erstellen klicken. Lassen Sie uns gehen und klicken Sie hier auf diesen Hyperlink. Okay, wenn dies also Ihre neue Azure DevOps-Organisation ist, haben Sie hier möglicherweise eine Fehlermeldung wie Sie erhalten, um Schritt zu tun. Lassen Sie uns Jahr erkundet, es sei denn, Sie können sehen und größer direkt in die Box. Wenn Sie hier klicken, können Sie sehen, dass wir keinen Host bei Frühwarnung England haben. Das bedeutet, dass wir keine kostenlose Compute-Ressource haben und wenn unserer Organisation zur Verfügung steht, fordert eine kostenlos von Microsoft an, indem Sie hier eine E-Mail mit dem Namen Ihrer Organisation an diese Adresse senden. Ihre Organisation ist nur der Name der Root-Ebene Ihrer Azure DevOps. So können Sie einfach hierher kommen, um mit abgeflachten Kopie zu tun und die E-Mail an diese Adresse zu senden. Und Sie sollten Recompute Research für Sie erhalten, um Ihre Pipelines auszuführen. Ok? An diesem Punkt habe ich bereits eine E-Mail an Microsoft gesendet und ich bekam eine Antwort zurück und Mekkaner vollständig eingerichtet, damit ich die Pipelines, die ich brauche, fortsetzen und ausführen kann. Eigentlich habe ich keine Antwort für Microsoft. Ich kam gerade zurück zum Portal und Testsets, um zu sehen, ob es funktionierte und alles eingerichtet war. Es dauerte ungefähr zwei Tage, bis ich hierher zurückkam und getestet habe. Also lassen Sie uns voran und klicken Sie auf ADF. Okay, ich soll nur klar im Kopf haben, was wir erreichen wollen. Wir werden unsere Pipelines von der Entwicklungsumgebung in die Produktionsumgebung verlagern. Sie müssen sich daran erinnern, dass dies die Data Factory ist in der wir die selbst gehostete Integrationslaufzeit erstellt haben. Es verbindet sich mit einem und es ist leer. Es ist wichtig, dass Sie dieselbe Data Factory verwenden , da dieser Data Factory eine Berechtigung zugeordnet ist. Und wenn Sie nur eine andere Data Factory auswählen, wird wahrscheinlich ein Fehler angezeigt, da die Berechtigungen nicht korrekt konfiguriert sind. Okay, gehen wir zurück zu unseren Azure DevOps, und klicken Sie auf Pipelines und Releases. Und hier haben wir immer noch den gleichen Status. Klicken wir auf Bearbeiten, da wir immer noch sicherstellen müssen , dass wir unsere Pipelines auf das richtige Ziel veröffentlichen. Hier haben wir die Aufgabe, die die Bereitstellung ist. Und hier validieren wir die ARM-Vorlagen und hier verwenden wir ARM-Vorlagen, um woanders zu veröffentlichen. Wenn wir jedoch nicht die Variablen ändern, die mit dem JSON kommen, wird es nur versuchen, in der gleichen Datenfactory bereitzustellen, da die exportierte ARM-Vorlage alle Variablennamen aus der Entwicklungsumgebung enthält. Es ist also wichtig, dass du es änderst. Klicken wir hier zuerst auf die übergeordnete Platte braun. Sie können sehen, dass Azure DevOps, bringt uns alle Variablen und Werte bereits ausgefüllt, was ziemlich cool ist. Hier wird es das Ziel unserer Bereitstellung sein, die neuen Data Factories. Es ist der gleiche Name, aber das Hinzufügen einer Zahl zu am Ende. Dies ist also der Ort, an dem wir unsere Pipelines einsetzen werden. Ok? Also lasst uns auf OK klicken. Und Sie können sehen, dass es sich automatisch mit allen Parametern hier ausfüllt. Wenn Sie möchten, können Sie einfach alles auswählen und kopieren. Und von hier aus, da wir nur validieren und es ist alles eine Nachbildung untereinander. Wir können einfach hier einfügen, oder Sie können einfach hier auf Paniermehl klicken und die Aufgabe wiederholen. Es liegt an dir, nur um Zeit zu sparen. Ok? Sie müssen also nur sicherstellen, dass es nur hier Validierung ist. Hier stellen Sie inkrementell die Bereitstellung für Ihre Zielressourcengruppe bereit. Lassen Sie uns also auf Speichern klicken. Und lasst uns unsere Freilassung laufen. Lassen Sie uns auf Erstellen klicken. Okay, lasst uns hier auf den Hyperlink klicken. Und jetzt bedeuten unsere Releases in der Warteschlange. Und lasst uns auf Logs klicken, damit wir verfolgen können, was hier vor sich geht. Die ersten beiden Schritte sind in der Regel ziemlich schnell, weil es ein Computer ist, der hinter. Es sind einige Umgebungsvariablen definiert. Dann verlieren wir den Code nicht lokal an den Computer. Dann wird es die I'm Tim-Seite validieren. Wir berühren nur den JSON. Wir stellen nichts bereit. Und hier wird der Code für unser Ziel bereitgestellt. Die Bereitstellung wurde erfolgreich abgeschlossen und wir können die Data Factory validieren. Klicken wir hier 0, 2, und lassen Sie uns Pipelines überprüfen. Lassen Sie uns auffrischen. Wir haben unsere Pipelines hier in unseren Zielumgebungen. Wir können zwischen den beiden überprüfen. Denken Sie daran, es ist 0, 2 war leer. Und jetzt in diesem Jahr, 0, 1, die unsere Quelle war, sind Pipelines in Datensätzen alle übereinstimmen. Und wir haben eine vollständige Kopie unserer Entwicklungsumgebung, so dass wir sicher sein können, dass der Code validiert und für einen Prozess in der Produktionsumgebung bereitgestellt wurde . Das ist in Ordnung. Ich hoffe, Sie haben diese Demonstration genossen. Danke fürs Zuschauen. Wir sehen uns das nächste Mal. 60. Quiz – Modul: Gut. 61. Aufarbeitung: Herzlichen Glückwunsch zum Abschluss dieses Kurses. Ich bin sehr froh zu sehen, dass du es bis zum Ende geschafft hast. Es gab viel zu gehen, aber du hast es geschafft. Ich hoffe, Sie haben etwas gelernt, das Ihnen helfen kann, einen Unterschied in Ihrem Arbeitsleben zu machen. Meine Empfehlung für die nächsten Schritte wäre, die Dokumente zu lesen. Es gibt viele gute Inhalte, vor allem von Microsoft auf GitHub und auf der Microsoft Learn Plattform veröffentlicht. auch daran, Sie können nur reparieren, was Sie lernen, indem Sie üben. Also probiere das Zeug aus, experimentiere. Auf diese Weise können Sie die ADF-Pipelines besser ändern. Ich hoffe wirklich, dass Sie diesen Kurs genossen haben und bitte hinterlassen Sie eine Rezension, wenn Sie können. Es bedeutet mir eine Menge zu sehen, euch gefiel es und ich hoffe euch bald in einer anderen Kurven des Geistes zu sehen sind die besten. Wir sehen uns bald. Danke fürs Zuschauen.