Todas as fontes no Google Cloud Storage, em formatos de arquivo abertos.
A Dataddo é a camada de dados pronta para usar do Google Cloud Storage. Carregue dados de mais de 400 fontes de negócio como Parquet, CSV, JSON ou JSONL particionados no seu próprio bucket - governados e prontos para análise - para que as tabelas externas do BigQuery e o Spark possam consultá-los imediatamente. Sem pipelines para construir.
Onde o Google Cloud Storage se encaixa na sua arquitetura de dados
Sources
Business / DB / File / Streaming Connectors
450+ available, any direction
HubSpot
Google Ads
Google Sheets
Salesforce
SAP S/4HANA
Oracle
Microsoft Dynamics 365
AWS S3
Azure SQL
Google Cloud SQL
MySQL
PostgreSQL
IBM Db2
+ any other
Your existing stack
Orchestration
Monitoring
Governance & Lineage
IAM & SSO
Dataddo Platform
Speed
Security
Governance
Control Plane
UI
Visual workspace for teams to build, run and monitor pipelines
API
Programmatic interface to embed Dataddo in your own stack and workflows
MCP
Dedicated interface for AI & agents to access governed data in context
Data Plane
Isolated deployment
Hyperscalers
AWSAzureGoogle Cloud
Isolated deployment
EU Cloud Providers
HetznerOVHcloudSTACKIT
Isolated deployment
On-Prem
KubernetesOpenShift
Data + Metadata
Destinations
DWH / Data Lake / Lakehouse
Snowflake
Databricks
Microsoft Fabric
Google BigQuery
Amazon Redshift
Azure Synapse
Oracle
IBM Db2
Universal PostgreSQL
Universal MySQL
+ any other
Data + Metadata
Consumption
AI & Agents / Analytics
Claude
Gemini
OpenAI
Mistral
BottleCap AI
Power BI
Tableau
Looker Studio
Databox
+ any other
Sources
Business / DB / File / Streaming Connectors
450+ available, any direction
Orchestration
Monitoring
Governance & Lineage
IAM & SSO
Dataddo Platform
Speed
Security
Governance
Control Plane
Data Plane
Destinations
DWH / Data Lake / Lakehouse
Consumption
AI & Agents / Analytics
ETLELTReverse ETLCDCData Streaming
Any direction, any workload
FORMATOS ABERTOS E PARTICIONAMENTO
Carregue dados do Google Cloud Storage em formatos abertos, particionados para consulta
Cada execução do fluxo grava dados governados no Google Cloud Storage como um arquivo aberto - Parquet colunar para análise, ou CSV, JSON e JSONL baseados em linhas para intercâmbio - dispostos em partições por data, para que motores como Athena, Trino, BigQuery e Spark os leiam como um dataset limpo e varram apenas o que precisam.
Parquet, CSV, JSON e JSONL
Grave no Google Cloud Storage no formato que o seu motor espera - Parquet colunar e compacto para análise rápida no Athena, Trino, Spark e BigQuery, além de CSV, JSON e JSONL baseados em linhas para intercâmbio que qualquer ferramenta consegue ler.
Mais de 400 conectores gerenciados
Plataformas de marketing, vendas, finanças, produto e publicidade - além de bancos de dados e arquivos - tudo mantido para você e pronto para chegar ao Google Cloud Storage imediatamente.
Datasets particionados por data
Cada execução chega como o seu próprio arquivo datado, para que o Google Cloud Storage seja organizado como um dataset particionado e os motores de consulta reduzam a leitura apenas aos arquivos de que precisam.
Snapshot ou estado mais recente
Mantenha cada execução como um snapshot datado, ou mantenha apenas o arquivo mais recente - a estratégia de nomenclatura de arquivos é o seu gerenciamento de estado, escolhido por fluxo.
Carregue o histórico completo
Faça backfill de intervalos de datas históricos no Google Cloud Storage sob demanda - popule um novo lake com tudo o que você tem, ou recarregue um intervalo para preencher uma lacuna.
Dados limpos e governados
Combine e reformate fontes e deixe o Data Quality Firewall barrar registros incorretos e a detecção de PII mascarar campos sensíveis antes que qualquer coisa chegue ao Google Cloud Storage.
COM VS. SEM
Quem assume o trabalho quando algo muda na origem
Mantenha as mesmas fontes fluindo para o Google Cloud Storage - e veja quem assume quando uma API, um esquema ou um endpoint muda:
Sem a Dataddo
Com a Dataddo
Resultado para você
Mudança de API ou autenticação
Você descobre a falha e corre para corrigi-la.
Atualizamos o conector e restauramos o pipeline - muitas vezes antes de você perceber.
Os arquivos continuam chegando ao Google Cloud Storage
Schema drift
As colunas mudam e os pipelines quebram ou corrompem dados silenciosamente.
Detectado automaticamente e tratado por regras configuráveis.
Apenas dados limpos chegam ao Google Cloud Storage
Endpoint descontinuado
Você reconstrói a integração.
Nós cuidamos da atualização - o contrato de dados se mantém.
As suas cargas no Google Cloud Storage continuam funcionando
Conector inexistente
Você cria e mantém uma integração personalizada.
Nós a criamos e mantemos, com um SLA de ~4 semanas.
Qualquer fonte pode chegar ao Google Cloud Storage
Degradação silenciosa
Você descobre quando um relatório ou a execução de um modelo falha.
O monitoramento proativo detecta anomalias e atrasos primeiro.
Problemas detectados antes que o seu lake leia arquivos incorretos
Depuração
Você vasculha logs espalhados por ferramentas desconectadas.
Históricos de execução, inspeção de payloads e linhagem de ponta a ponta em um só lugar.
Diagnóstico mais rápido, menos tempo de inatividade
CASOS DE USO
O que as equipes de dados constroem no Google Cloud Storage
Um data lake mostra o seu valor quando alimenta trabalho real. Estas são formas comuns de as equipes aproveitarem o Google Cloud Storage, e os conectores da Dataddo que mantêm cada uma abastecida - tudo entregue em formatos abertos, no seu agendamento.
Unifique os dados de marketing e publicidade
Entregue dados de campanhas, investimento e web analytics de cada canal no Google Cloud Storage para atribuição, relatórios e modelagem de mix de marketing entre ferramentas.
Google Ads
Facebook Ads
Google Analytics 4
YouTube Analytics
+ 400 mais
Descarregue os bancos de dados para analytics
Replique bancos de dados operacionais no Google Cloud Storage para que consultas analíticas e históricas pesadas rodem no lake em vez dos seus sistemas de produção.
PostgreSQL
MySQL
SQL Server
Oracle
MongoDB
+ 400 mais
Alimente data science, ML e IA
Entregue grandes datasets brutos como Parquet para engenharia de atributos, treinamento de modelos e exploração em notebooks com Spark, pandas ou o seu stack de ML.
Mantenha um histórico de longo prazo e econômico de dados de SaaS, CRM e finanças em formatos abertos para conformidade e auditoria, sem as contas de armazenamento de um warehouse.
Em quais formatos de arquivo a Dataddo pode gravar no Google Cloud Storage?
Parquet, CSV, JSON e JSONL. Cada execução do fluxo grava um arquivo no formato que você escolher, com controles no nível do formato - delimitador, cabeçalho e formato de data do CSV, ou a unidade de timestamp de Parquet, JSON e JSONL.
Como funciona o particionamento?
Cada execução do fluxo chega como o seu próprio arquivo datado, para que o Google Cloud Storage seja organizado como um dataset particionado por data. Os motores de consulta então leem apenas as partições de que precisam, em vez de varrer tudo, o que mantém as consultas rápidas e os custos previsíveis.
Como o Dataddo se autentica no Google Cloud Storage?
De duas formas: fazendo login com uma conta Google (OAuth) ou enviando uma chave JSON de conta de serviço com a role Storage Object Admin (leitura e gravação) no bucket de destino.
Onde o Dataddo grava no GCS e em qual formato?
No projeto, no bucket e no caminho que você definir (o caminho deve terminar com barra; use / para a raiz do bucket), como CSV, JSON, JSONL, Parquet, XML ou XLSX. Os nomes de arquivo usam tokens como {{objectLabel}} e {{today|Ymd}}, com o padrão {{objectLabel}}-{{today|Ymd}}.
Cada execução do Dataddo sobrescreve o arquivo no GCS ou adiciona um novo?
Você escolhe. insert grava um novo arquivo por execução, então nomes com data criam um histórico de snapshots, enquanto truncate_insert substitui o arquivo com o nome resolvido. Nomes de arquivo estáticos são sobrescritos a cada execução.
A Dataddo pode adicionar ou substituir arquivos?
Sim. O modo insert continua gravando novos arquivos, e o create-new-or-replace sobrescreve o arquivo com o mesmo nome. Para formatos de tabela de lakehouse como o Apache Iceberg, a Dataddo aplica modos de escrita no estilo warehouse à própria tabela.
Como meus dados são protegidos?
A Dataddo tem as certificações SOC 2 Type II e ISO 27001. Os dados são criptografados em trânsito e em repouso, a PII pode ser mascarada ou convertida em hash, e há residência de dados disponível na UE ou nos EUA. Você conecta o Google Cloud Storage com as suas próprias chaves ou uma role assumida.
Isso vai aumentar a minha fatura de armazenamento?
As cargas incrementais gravam apenas dados novos ou alterados, e o Parquet colunar comprime bem - assim você armazena e varre menos. Você controla o agendamento e o layout de particionamento, o que mantém previsíveis os custos de armazenamento e de consulta.
Fico preso a um fornecedor?
Não. Os dados chegam em formatos de arquivo abertos em um bucket que é seu, e os pipelines são independentes de armazenamento - você pode adicionar ou trocar de object store, ou apontar as mesmas fontes para um warehouse, sem reconstruir nada.