Aller au contenu principal
Sur cette page

Oui, Athia se connecte directement à votre entrepôt ou lac de données. Il lit à partir de Snowflake, Databricks, BigQuery ou Redshift, y compris les tables Lakehouse sur Databricks Unity Catalog et les données externes exposées via votre entrepôt. L'administrateur de votre entrepôt accorde l'accès à un ensemble défini de tables ou de vues, et Athia les lit selon une cadence convenue. Il n’y a aucun pipeline à construire, aucune exportation à planifier et aucun format de fichier à convenir. Lorsque vos modèles changent, vous changez la vue.

Si vous modélisez déjà les paiements dans votre entrepôt, c'est généralement le moins de travail pour les données les plus complètes. Les jointures entre les tentatives, les règlements, les frais et les litiges sont déjà effectuées, et l'historique et le flux récurrent proviennent de la même subvention, il n'y a donc pas de remplissage séparé à organiser.

Ce que votre administrateur d'entrepôt configure#

Quatre choses, sur chaque plateforme :

  1. Une identité machine dédiée. Un utilisateur, un compte de service ou un principal de service créé pour Athia, jamais un compte personnel, donc l'accès survit aux changements de personnel et apparaît proprement dans votre journal d'audit.
  2. Accès en lecture, limité aux objets nommés. Deux sortes, et la seconde est la plus souvent oubliée : l'autorisation de lire le lignes, et la permission de lire le métadonnées, les entrées de catalogue qui permettent à Athia de découvrir quelles tables et colonnes existent. Sans l'octroi de métadonnées, les schémas n'apparaissent pas du tout lorsque la connexion est établie.
  3. Une décision sur la manière dont les changements sont détectés. Voir ci-dessous. c'est celui qui affecte votre facture.
  4. Un chemin réseau. Comment Athia arrive à l'entrepôt.

Par plateforme#

PlateformeIdentitéIl faut égalementChemin réseau
Flocon de neigeUn utilisateur avec un rôle dédié, s'authentifiant par bi-clé ou mot de passeUtilisation sur la base de données et le schéma, sélection sur les objets de paiement et utilisation sur le calcul qui exécute les lecturesListe verte de votre politique réseau ou connectivité privée sur les forfaits qui la prennent en charge
BigQueryUn compte de serviceLecture des métadonnées des ensembles de données et des tables, lecture des données des tables et rôle permettant d'exécuter des tâches de requête. Un ensemble de données de travail pour les objets de travail, dans le même région comme sourceMédiatisé par IAM, il n'y a donc pas d'étape de liste d'autorisation IP
Briques de donnéesUn jeton ou un principal de service sur Unity CatalogUtilisation des schémas dans le catalogue afin que les schémas soient résolus, et lecture sur les tables DeltaAjoutez les adresses d'Athia à la liste blanche sur votre espace de travail
RedshiftUn utilisateur de base de donnéesSélectionnez sur les vues du catalogue système ainsi que sur les tableaux de paiementUne règle entrante de groupe de sécurité ou une connectivité privée

Les déclarations de subvention exactes sont émises par votre équipe Athia pour votre plateforme et votre portée, elles diffèrent suffisamment entre ces quatre-là pour qu'un script générique ne soit pas utile.

Comment les changements sont détectés et combien cela coûte#

C'est la décision à prendre avant la rédaction de la subvention, car elle détermine à la fois la subvention et les frais de fonctionnement.

Suivi des modifications. L'entrepôt lui-même enregistre ce qui a changé et Athia ne lit que le delta. C'est l'option la moins chère et la plus rapide, et sur les grandes tables, c'est la différence entre une synchronisation qui coûte des centimes et une qui coûte de l'argent réel.

Analyse complète avec comparaison. Athia lit les objets sélectionnés à chaque cycle et détermine ce qui a changé. Aucun suivi des modifications n’est nécessaire. C'est la bonne réponse lorsque la politique interdit toute écriture sur les objets source. mais vous payez pour analyser les données à chaque synchronisation, et ce coût évolue en fonction de la taille de la table et de la fréquence de synchronisation.

Décidez-en avant la rédaction de la subvention#

  • Scope. Quelles bases de données, catalogues, ensembles de données et schémas. Décidez également si la subvention énumère des tables spécifiques ou couvre de futures tables : énumérez et les tables créées après l'intégration restent invisibles jusqu'à ce que quelqu'un réexécute la subvention.
  • Suivi des modifications ou analyse complète. Comme ci-dessus. Le modifier plus tard signifie revenir à votre administrateur.
  • Posture du réseau. Point de terminaison public avec une liste verte ou une connectivité privée. Les options privées peuvent comporter des prérequis : un niveau de plan particulier, un point de terminaison à provisionner, une région à épingler.
  • Calculer et gratter l'emplacement. Quel entrepôt ou cluster exécute les lectures, et donc qui les paie. Sur BigQuery, également là où se trouve l'ensemble de données de travail, car il doit être co-régional avec la source.

Ce qui ne va généralement pas#

Ce que tu voisGénéralement parce que
Les schémas n'apparaissent pas lorsque la connexion est établieLa lecture des métadonnées n'a pas été autorisée, seule la ligne a été lue
Les nouvelles tables n'apparaissent jamaisLa subvention énumérait les tableaux plutôt que de couvrir les futurs
Les coûts d'entrepôt augmentent après la mise en serviceLe suivi des modifications n'a jamais été activé, chaque synchronisation est donc une analyse complète
Une table échoue lors de la synchronisation plutôt qu'au moment de l'octroiIl s'agit d'un type d'objet qui ne peut pas être lu, les tables externes et les tables partitionnées qui nécessitent un filtre de partition sont les coupables habituels.
Une table se synchronise lentement ou est refuséeIl n'a pas de clé primaire. Les tableaux sans tableau sont lus moins efficacement et certaines plates-formes limitent leur taille.

Limites à connaître lorsque vous effectuez la portée#

  • Les clés primaires sont importantes. Confirmez lesquelles de vos tables de paiement en ont une avant de finaliser la liste.
  • Types d'objets. Les tables externes et les tables requises par le filtre de partition ne sont généralement pas lisibles. Les vues le sont généralement par un chemin plus lent que les tables.
  • Briques de données nécessite Unity Catalog et des tables au format Delta.
  • Types de données exotiques, les structures imbriquées, les intervalles, la géographie peuvent être convertis ou ignorés. Si un champ dont vous avez besoin en fait partie, augmentez-le pendant la définition de la portée plutôt qu'après le premier chargement.