Entrepôt à entrepôt
Sur cette page
Oui, Athia se connecte directement à votre entrepôt ou lac de données. Il lit à partir de Snowflake, Databricks, BigQuery ou Redshift, y compris les tables Lakehouse sur Databricks Unity Catalog et les données externes exposées via votre entrepôt. L'administrateur de votre entrepôt accorde l'accès à un ensemble défini de tables ou de vues, et Athia les lit selon une cadence convenue. Il n’y a aucun pipeline à construire, aucune exportation à planifier et aucun format de fichier à convenir. Lorsque vos modèles changent, vous changez la vue.
Si vous modélisez déjà les paiements dans votre entrepôt, c'est généralement le moins de travail pour les données les plus complètes. Les jointures entre les tentatives, les règlements, les frais et les litiges sont déjà effectuées, et l'historique et le flux récurrent proviennent de la même subvention, il n'y a donc pas de remplissage séparé à organiser.
Ce que votre administrateur d'entrepôt configure#
Quatre choses, sur chaque plateforme :
- Une identité machine dédiée. Un utilisateur, un compte de service ou un principal de service créé pour Athia, jamais un compte personnel, donc l'accès survit aux changements de personnel et apparaît proprement dans votre journal d'audit.
- Accès en lecture, limité aux objets nommés. Deux sortes, et la seconde est la plus souvent oubliée : l'autorisation de lire le lignes, et la permission de lire le métadonnées, les entrées de catalogue qui permettent à Athia de découvrir quelles tables et colonnes existent. Sans l'octroi de métadonnées, les schémas n'apparaissent pas du tout lorsque la connexion est établie.
- Une décision sur la manière dont les changements sont détectés. Voir ci-dessous. c'est celui qui affecte votre facture.
- Un chemin réseau. Comment Athia arrive à l'entrepôt.
Par plateforme#
| Plateforme | Identité | Il faut également | Chemin réseau |
|---|---|---|---|
| Flocon de neige | Un utilisateur avec un rôle dédié, s'authentifiant par bi-clé ou mot de passe | Utilisation sur la base de données et le schéma, sélection sur les objets de paiement et utilisation sur le calcul qui exécute les lectures | Liste verte de votre politique réseau ou connectivité privée sur les forfaits qui la prennent en charge |
| BigQuery | Un compte de service | Lecture des métadonnées des ensembles de données et des tables, lecture des données des tables et rôle permettant d'exécuter des tâches de requête. Un ensemble de données de travail pour les objets de travail, dans le même région comme source | Médiatisé par IAM, il n'y a donc pas d'étape de liste d'autorisation IP |
| Briques de données | Un jeton ou un principal de service sur Unity Catalog | Utilisation des schémas dans le catalogue afin que les schémas soient résolus, et lecture sur les tables Delta | Ajoutez les adresses d'Athia à la liste blanche sur votre espace de travail |
| Redshift | Un utilisateur de base de données | Sélectionnez sur les vues du catalogue système ainsi que sur les tableaux de paiement | Une règle entrante de groupe de sécurité ou une connectivité privée |
Les déclarations de subvention exactes sont émises par votre équipe Athia pour votre plateforme et votre portée, elles diffèrent suffisamment entre ces quatre-là pour qu'un script générique ne soit pas utile.
Comment les changements sont détectés et combien cela coûte#
C'est la décision à prendre avant la rédaction de la subvention, car elle détermine à la fois la subvention et les frais de fonctionnement.
Suivi des modifications. L'entrepôt lui-même enregistre ce qui a changé et Athia ne lit que le delta. C'est l'option la moins chère et la plus rapide, et sur les grandes tables, c'est la différence entre une synchronisation qui coûte des centimes et une qui coûte de l'argent réel.
Analyse complète avec comparaison. Athia lit les objets sélectionnés à chaque cycle et détermine ce qui a changé. Aucun suivi des modifications n’est nécessaire. C'est la bonne réponse lorsque la politique interdit toute écriture sur les objets source. mais vous payez pour analyser les données à chaque synchronisation, et ce coût évolue en fonction de la taille de la table et de la fréquence de synchronisation.
Décidez-en avant la rédaction de la subvention#
- Scope. Quelles bases de données, catalogues, ensembles de données et schémas. Décidez également si la subvention énumère des tables spécifiques ou couvre de futures tables : énumérez et les tables créées après l'intégration restent invisibles jusqu'à ce que quelqu'un réexécute la subvention.
- Suivi des modifications ou analyse complète. Comme ci-dessus. Le modifier plus tard signifie revenir à votre administrateur.
- Posture du réseau. Point de terminaison public avec une liste verte ou une connectivité privée. Les options privées peuvent comporter des prérequis : un niveau de plan particulier, un point de terminaison à provisionner, une région à épingler.
- Calculer et gratter l'emplacement. Quel entrepôt ou cluster exécute les lectures, et donc qui les paie. Sur BigQuery, également là où se trouve l'ensemble de données de travail, car il doit être co-régional avec la source.
Ce qui ne va généralement pas#
| Ce que tu vois | Généralement parce que |
|---|---|
| Les schémas n'apparaissent pas lorsque la connexion est établie | La lecture des métadonnées n'a pas été autorisée, seule la ligne a été lue |
| Les nouvelles tables n'apparaissent jamais | La subvention énumérait les tableaux plutôt que de couvrir les futurs |
| Les coûts d'entrepôt augmentent après la mise en service | Le suivi des modifications n'a jamais été activé, chaque synchronisation est donc une analyse complète |
| Une table échoue lors de la synchronisation plutôt qu'au moment de l'octroi | Il s'agit d'un type d'objet qui ne peut pas être lu, les tables externes et les tables partitionnées qui nécessitent un filtre de partition sont les coupables habituels. |
| Une table se synchronise lentement ou est refusée | Il n'a pas de clé primaire. Les tableaux sans tableau sont lus moins efficacement et certaines plates-formes limitent leur taille. |
Limites à connaître lorsque vous effectuez la portée#
- Les clés primaires sont importantes. Confirmez lesquelles de vos tables de paiement en ont une avant de finaliser la liste.
- Types d'objets. Les tables externes et les tables requises par le filtre de partition ne sont généralement pas lisibles. Les vues le sont généralement par un chemin plus lent que les tables.
- Briques de données nécessite Unity Catalog et des tables au format Delta.
- Types de données exotiques, les structures imbriquées, les intervalles, la géographie peuvent être convertis ou ignorés. Si un champ dont vous avez besoin en fait partie, augmentez-le pendant la définition de la portée plutôt qu'après le premier chargement.
Connexes#
- Transfert de données hors ligne, ce chemin par rapport aux fichiers et comment les deux se comparent aux connecteurs en temps réel.
- Intégrer Athia, tous les chemins d'intégration et la quantité d'historique à envoyer.
- Dictionnaire de données Athia, les champs sur lesquels Athia réfléchit et comment la dénomination est mappée lors de l'ingestion.
- Fichiers (SFTP ou S3), l'alternative lorsqu'une subvention directe n'est pas possible.