Magazzino a Magazzino
In questa pagina
Sì, Athia si connette direttamente al vostro magazzino o al lago dati. Legge da Snowflake, Databricks, BigQuery o Redshift, compresi i tavoli della Lakehouse su Databricks Unity Catalog e i dati esterni esposti attraverso il vostro magazzino. Il vostro amministratore di magazzino concede l'accesso a un set definito di tabelle o viste, e Athia legge da loro su una cadenza concordata. Non c'è nessuna pipeline da costruire, nessuna esportazione per programmare e nessun formato di file da concordare. Quando i tuoi modelli cambiano, cambi la vista.
Se già si modellano i pagamenti nel vostro magazzino, questo è di solito il minimo lavoro per i dati più completi. I legami tra tentativi, insediamento, commissioni e controversie sono già fatti, e la storia e il feed ricorrente provengono dalla stessa sovvenzione, quindi non c'è alcuna backfill separata per organizzare.
Cosa si configura il tuo amministratore del magazzino#
Quattro cose, su ogni piattaforma:
- Una macchina dedicata identità. Un utente, un account di servizio o un preside di servizio creato per Athia, non è mai un account di una persona, quindi l'accesso sopravvive alle modifiche del personale e si presenta in modo pulito nel registro di audit.
- Leggi l'accesso, per gli oggetti di nome. Due tipi, e il secondo è quello più spesso dimenticato: il permesso di leggere il righe, e il permesso di leggere metadati, le voci del catalogo che permettono Athia scoprire quali tabelle e colonne esistono. Senza la sovvenzione dei metadati, gli schemi non appaiono affatto quando la connessione è impostata.
- Una decisione su come vengono rilevate le modifiche. Vedi di seguito. Questo è quello che colpisce il tuo conto.
- Un percorso di rete. Come Athia raggiunge il magazzino.
Per piattaforma#
| Piattaforma | Identità | Anche le esigenze | Percorso di rete |
|---|---|---|---|
| Fiocco di neve | Un utente con un ruolo dedicato, autenticando con coppia chiave o password | Utilizzo sul database e schema, selezionare gli oggetti di pagamento e l'utilizzo sulla calcola che esegue le letture | La tua politica di rete consente lista, o connettività privata su piani che lo supportano |
| BigQuery | Un account di servizio | Dataset e tabella metadati leggere, i dati della tabella leggere, e un ruolo che può eseguire lavori di query. Un set di dati di lavoro per oggetti graffi, nel regione come fonte | IAM-mediato, quindi non c'è un passo per la lista di permessi IP |
| Databrick | Un gettone o un servizio principale su Unity Catalog | Uso dello schema attraverso il catalogo così gli schemi si risolvono, più leggere sulle tabelle Delta | Gli indirizzi di Athia sul tuo spazio di lavoro |
| Redshift | Un utente di database | Selezionate le viste del catalogo di sistema e le tabelle di pagamento | Una regola di inbound del gruppo di sicurezza, o connettività privata |
Le dichiarazioni di sovvenzione esatte sono emesse dal vostro team Athia per la vostra piattaforma e la portata, differiscono abbastanza tra questi quattro che uno script generico non è utile.
Come vengono rilevate le modifiche e quali costi#
Questa è la decisione di prendere prima che la sovvenzione sia scritta, perché determina sia la sovvenzione che il costo di esecuzione.
Cambiamo tracciamento. Il magazzino stesso registra ciò che è cambiato, e Athia legge solo il delta. Questa è l'opzione più economica e veloce, e su grandi tavoli è la differenza tra una sincronizzazione che costa centesimi e uno che costa soldi veri.
Scansione completa con confronto. Athia legge gli oggetti selezionati ogni ciclo e funziona fuori ciò che è cambiato. Non è necessario tracciare modifiche. Questa è la risposta giusta in cui la politica vieta qualsiasi scrittura sugli oggetti di origine. ma paghi per scansionare i dati su ogni sincronizzazione, e che costano scale con dimensioni della tabella e quante volte si sincronizza.
Decidi questi prima che la sovvenzione sia scritta#
- Scope. Quali database, cataloghi, dataset e schemi. Decidi anche se la sovvenzione enumera tabelle specifiche o copre quelle future: enumerate, e tabelle create dopo il soggiorno di bordo invisibile fino a quando qualcuno non ri-corre la sovvenzione.
- Cambiare il tracciamento o la scansione completa. Come sopra. Cambiarlo in seguito significa tornare al tuo amministratore.
- Postura di rete. Punto di ritrovo pubblico con una lista di permessi o connettività privata. Le opzioni private possono portare prerequisiti: un particolare piano di livello, un punto di partenza per la fornitura, una regione da pin.
- Compute e gratta e posizione. Quale magazzino o cluster gestisce le letture, e quindi chi paga per loro. Su BigQuery, anche dove vive il dataset di lavoro, poiché deve essere co-regionale con la fonte.
Che cosa comunemente va storto#
| Cosa vedi | Di solito perché |
|---|---|
| Gli schemi non appaiono quando la connessione è impostata | Metadati letti non è stato concesso, solo la riga lettura |
| Nuovi tavoli non si presentano mai | La sovvenzione è stata enumerata piuttosto che coprire le future |
| Magazzino costi salire dopo go-live | Cambiare il tracciamento non è mai stato abilitato, quindi ogni sincronizzazione è una scansione completa |
| Una tabella non riesce a sincronizzarsi piuttosto che a tempo di concessione | È un tipo di oggetto che non può essere letto, tabelle esterne e tabelle divisorie che richiedono un filtro di partizione, sono i soliti colpevoli |
| Un tavolo si sincronizza lentamente o viene rifiutato | Non ha una chiave primaria. Tavoli senza uno sono letti meno efficiente e alcune piattaforme limitano quanto grandi possono essere |
Limiti che vale la pena sapere quando si è di portata#
- Le chiavi principali sono importanti. Confermare quale delle vostre tabelle di pagamento hanno uno prima di finalizzare l'elenco.
- Tipi di oggetti. Le tabelle esterne e le tabelle richieste dal filtro delle partizioni non sono generalmente leggibili. Le viste di solito sono, da un percorso più lento rispetto ai tavoli.
- Databrick richiede tabelle Unity Catalog e Delta-format.
- Tipi di dati esotici, strutture nidificate, intervalli, geografia, possono essere convertite o ignorate. Se un campo di cui hai bisogno è uno di questi, sollevalo durante lo scoping piuttosto che dopo il primo carico.
Correlato#
- Trasferimento dati Offline, questo percorso contro i file, e come entrambi confrontano con i connettori in tempo reale.
- Integrazione di Athia, tutti i percorsi di integrazione e quanta storia inviare.
- Athia Data Dictionary, i campi Athia ragioni oltre, e come il nome è mappato su ingerito.
- File (SFTP o S3), l'alternativa in cui non è possibile un contributo diretto.