Seminários Técnicos

Nas Semanas 13 a 15, cada Squad apresenta um aprofundamento sobre um tema do roadmap de Engenharia de Dados que os Encontros não cobrem.

O Seminário existe porque o plano da disciplina é uma escolha, e escolha deixa coisa de fora. Nuvem gerenciada, Spark, séries temporais e busca léxica são temas legítimos que os Encontros não cobrem — ou cobrem só de raspão. O Seminário é onde a turma recupera parte disso, com uma Squad assumindo o papel de quem estudou o assunto a fundo.

Formato

Duração
20 minutos de apresentação + 10 de arguição
Público
Turma, docência e monitoria — perfil técnico e de gestão
Quando
Semanas 13 a 15, em sessão própria ao lado do Encontro conceitual
Peso
Compõe, com a defesa final, os 15% de Seminário Técnico + defesa.

Inscrição

  1. A Squad escolhe um tema desta lista, ou propõe outro, até a Semana 10.
  2. Tema é exclusivo por Oferta: a primeira Squad a inscrever fica com ele.
  3. Tema proposto fora da lista precisa de aval da docência — o critério é estar no roadmap de Engenharia de Dados e fora do que os Encontros cobrem.
  4. A ordem de apresentação nas Semanas 13 a 15 é sorteada na Semana 11.

Temas disponíveis

Cada tema abaixo é um bloco do roadmap de Engenharia de Dados que a disciplina deliberadamente não aprofunda. A coluna da direita diz onde ele está em relação ao plano — é o argumento de que o tema não é redundante.

Temas de Seminário Técnico disponíveis, com a relação de cada um com o plano da disciplina
Tema Relação com o plano Squad
Spark e processamento distribuído em cluster Quando o dado não cabe em uma máquina: modelo de execução, shuffle, particionamento e o custo real de sair do DuckDB. Compare com a plataforma da própria Squad — a que volume a mudança se pagaria? Processamento distribuído — introdutório no plano, remetido a eletiva Disponível
Nuvem gerenciada, IaC e Kubernetes para plataformas de dados O que muda ao sair do Docker Compose: serviços gerenciados, custo por consulta, infraestrutura como código e o que se perde em portabilidade. Nuvem e IaC — fora do escopo do plano, remetido a Computação em Nuvem / DevOps Disponível
Bancos de séries temporais e dados de sensor TimescaleDB, InfluxDB e ClickHouse: compressão, downsampling, política de retenção e por que série temporal justifica motor próprio. Famílias especializadas — o livro-texto não percorre as famílias de banco de dados Disponível
Motores de busca textual: Elasticsearch e OpenSearch Índice invertido, BM25, analisadores para português e a fronteira com a busca vetorial, que ficou fora do plano. Busca — fora do escopo do livro-texto e do plano Disponível
Data mesh e contratos entre domínios na prática A tese organizacional além do slogan: onde o mesh resolve, onde ele só renomeia o problema, e o que um contrato de dados precisa ter para valer. Arquiteturas organizacionais — conceitual nas Semanas 4 e 13 Disponível
Privacidade diferencial e dados sintéticos Além da privacidade da Semana 14: garantia formal, orçamento de privacidade e o compromisso com utilidade do dado. Governança — aprofundamento além da Semana 14 Disponível
Bancos de dados embarcados e o computador de ponta SQLite, DuckDB no navegador via WASM e sincronização com o servidor: o que o dado ganha ao morar perto de quem o usa. Acréscimo — fora do roadmap clássico Disponível
Observabilidade de dados e detecção de anomalia em pipeline Além dos testes do Projeto Integrado: perfilamento contínuo, detecção estatística de desvio e o custo de alarme falso na confiança do time. Qualidade e observabilidade — elemento subjacente no plano, sem Semana própria Disponível
Formatos de tabela aberta em disputa: Iceberg, Delta e Hudi Como cada um resolve transação, evolução de esquema e compactação; o que trava a Squad em cada escolha e o estado da interoperabilidade. Lakehouse — a disciplina usa um formato, não compara os três Disponível
Feature stores e o desvio entre treino e serviço Feature skew, viagem no tempo em feature, e por que o problema é de engenharia de dados antes de ser de aprendizado de máquina. Dados para IA — mencionado na Semana 13 Disponível
Busca vetorial, embeddings e RAG Chunking, embeddings, distância e índices aproximados (HNSW, IVF): o compromisso entre recall e latência, medido no corpus da própria Squad. Compare com busca léxica no PostgreSQL que vocês já têm. Dados não estruturados e IA — fora do escopo do livro-texto Disponível
Famílias não relacionais: documento, chave-valor, colunar largo e grafo O que cada família otimiza e o que cobra em troca. Escolha uma carga real da plataforma da Squad e compare com a opção nula: continuar no PostgreSQL. NoSQL — o livro-texto apenas menciona as famílias Disponível

Tema fora desta lista precisa de aval da docência. O critério é duplo: estar no roadmap de Engenharia de Dados, e estar fora do que os Encontros cobrem.

Como se avalia

A avaliação de Seminário tem quatro critérios. O que mais surpreende quem apresenta é o de comunicação para público misto: a banca tem perfil técnico e de gestão, e uma apresentação que só serve a uma das duas metades perde nota mesmo estando tecnicamente correta.

O antídoto é simples de dizer e difícil de fazer: para cada mecanismo que você explicar, diga qual decisão ele permite tomar.