Armazém para Armazém
Nesta página
Sim, o Athia se conecta diretamente ao seu warehouse ou data lake. Ele lê Snowflake, Databricks, BigQuery ou Redshift, incluindo tabelas lakehouse no Databricks Unity Catalog e dados externos expostos por meio de seu warehouse. O administrador do warehouse concede acesso a um conjunto definido de tabelas ou visualizações, e Athia as lê em uma cadência acordada. Não há pipeline para construir, nenhuma exportação para agendar e nenhum formato de arquivo para concordar. Quando seus modelos mudam, você muda a visualização.
Se você já modela pagamentos em seu warehouse, isso geralmente é o que dá menos trabalho para obter dados mais completos. As junções entre tentativas, liquidação, taxas e disputas já foram feitas, e o histórico e o feed recorrente vêm da mesma concessão, portanto não há preenchimento separado para organizar.
O que o administrador do seu warehouse configura#
Quatro coisas, em todas as plataformas:
- Uma identidade de máquina dedicada. Um usuário, conta de serviço ou entidade de serviço criada para Athia, nunca uma conta pessoal, portanto, o acesso sobrevive às mudanças de equipe e aparece de forma limpa em seu log de auditoria.
- Acesso de leitura, com escopo para objetos nomeados. Dois tipos, e o segundo é o mais esquecido: permissão para ler o linhase permissão para ler o metadados, as entradas do catálogo que permitem ao Athia descobrir quais tabelas e colunas existem. Sem a concessão de metadados, os esquemas não aparecem quando a conexão é configurada.
- Uma decisão sobre como as alterações são detectadas. Veja abaixo. este é o que afeta sua conta.
- Um caminho de rede. Como Athia chega ao armazém.
Por plataforma#
| Plataforma | Identidade | Também precisa | Caminho de rede |
|---|---|---|---|
| Floco de neve | Um usuário com uma função dedicada, autenticando por par de chaves ou senha | Uso no banco de dados e esquema, seleção nos objetos de pagamento e uso na computação que executa as leituras | Sua lista de permissões de política de rede ou conectividade privada em planos compatíveis |
| BigQuery | Uma conta de serviço | Leitura de metadados de conjunto de dados e tabelas, leitura de dados de tabelas e uma função que pode executar trabalhos de consulta. Um conjunto de dados funcional para objetos de trabalho, no mesma região como a fonte | Mediado por IAM, portanto não há etapa de lista de permissões de IP |
| Blocos de dados | Um token ou entidade de serviço no Unity Catalog | Uso de esquema em todo o catálogo para que os esquemas sejam resolvidos e lidos nas tabelas Delta | Coloque os endereços de Athia na lista de permissões no seu workspace |
| Desvio para o vermelho | Um usuário de banco de dados | Selecione nas visualizações do catálogo do sistema, bem como nas tabelas de pagamento | Uma regra de entrada de grupo de segurança ou conectividade privada |
As declarações de concessão exatas são emitidas pela equipe Athia para sua plataforma e escopo. Elas diferem o suficiente entre essas quatro para que um script genérico não seja útil.
Como as mudanças são detectadas e quanto custa#
Esta é a decisão a tomar antes de a subvenção ser redigida, porque determina tanto a subvenção como os custos de funcionamento.
Rastreamento de alterações. O próprio warehouse registra o que mudou e Athia lê apenas o delta. Esta é a opção mais barata e rápida, e em mesas grandes é a diferença entre uma sincronização que custa centavos e outra que custa dinheiro real.
Verificação completa com comparação. Athia lê os objetos selecionados a cada ciclo e descobre o que mudou. Nenhum rastreamento de alterações é necessário. Esta é a resposta certa onde a política proíbe qualquer gravação em objetos de origem. mas você paga para verificar os dados em cada sincronização, e esse custo varia de acordo com o tamanho da tabela e a frequência com que você sincroniza.
Decida isso antes que a concessão seja escrita#
- Scope. Quais bancos de dados, catálogos, conjuntos de dados e esquemas. Decida também se a concessão enumera tabelas específicas ou cobre tabelas futuras: enumere e as tabelas criadas após a integração permanecem invisíveis até que alguém execute novamente a concessão.
- Alterar rastreamento ou verificação completa. Como acima. Alterá-lo mais tarde significa voltar ao seu administrador.
- Postura em rede. Endpoint público com uma lista de permissões ou conectividade privada. As opções privadas podem ter pré-requisitos: um nível de plano específico, um endpoint para provisionar, uma região para fixar.
- Calcule e raspe a localização. Qual warehouse ou cluster executa as leituras e, portanto, quem paga por elas. No BigQuery, também onde reside o conjunto de dados de trabalho, já que deve ser co-regional com a origem.
O que geralmente dá errado#
| O que você vê | Geralmente porque |
|---|---|
| Os esquemas não aparecem quando a conexão é configurada | A leitura de metadados não foi concedida, apenas leitura de linha |
| Novas tabelas nunca aparecem | A concessão enumerou tabelas em vez de cobrir as futuras |
| Os custos do armazém aumentam após a entrada em operação | O rastreamento de alterações nunca foi ativado, então cada sincronização é uma verificação completa |
| Uma tabela falha na sincronização e não no momento da concessão | É um tipo de objeto que não pode ser lido, tabelas externas e tabelas particionadas que requerem um filtro de partição são os culpados comuns |
| Uma tabela sincroniza lentamente ou é recusada | Não possui chave primária. Tabelas sem uma são lidas com menos eficiência e algumas plataformas limitam o tamanho delas |
Limites que vale a pena conhecer ao definir o escopo#
- As chaves primárias são importantes. Confirme quais de suas tabelas de pagamento possuem uma antes de finalizar a lista.
- Tipos de objetos. Tabelas externas e tabelas exigidas por filtro de partição geralmente não são legíveis. As visualizações geralmente são feitas por um caminho mais lento que as tabelas.
- Blocos de dados requer catálogo do Unity e tabelas no formato Delta.
- Tipos de dados exóticos, estruturas aninhadas, intervalos e geografia podem ser convertidos ou ignorados. Se um campo que você precisa for um desses, aumente-o durante a definição do escopo, e não após o primeiro carregamento.
Relacionado#
- Transferência de dados off-line, esse caminho em relação aos arquivos e como ambos se comparam aos conectores em tempo real.
- Integrando Athia, todos os caminhos de integração e quanto histórico enviar.
- Dicionário de dados Athia, os campos que Athia raciocina e como a nomenclatura é mapeada na ingestão.
- Arquivos (SFTP ou S3), a alternativa caso não seja possível uma subvenção direta.