Seminários Técnicos
Nas Semanas 13 a 15, cada Squad apresenta um aprofundamento sobre um tema do roadmap de Engenharia de Dados que os Encontros não cobrem.
O Seminário existe porque o plano da disciplina é uma escolha, e escolha deixa coisa de fora. Nuvem gerenciada, Spark, séries temporais e busca léxica são temas legítimos que os Encontros não cobrem — ou cobrem só de raspão. O Seminário é onde a turma recupera parte disso, com uma Squad assumindo o papel de quem estudou o assunto a fundo.
Formato
- Duração
- 20 minutos de apresentação + 10 de arguição
- Público
- Turma, docência e monitoria — perfil técnico e de gestão
- Quando
- Semanas 13 a 15, em sessão própria ao lado do Encontro conceitual
- Peso
- Compõe, com a defesa final, os 15% de Seminário Técnico + defesa.
Inscrição
- A Squad escolhe um tema desta lista, ou propõe outro, até a Semana 10.
- Tema é exclusivo por Oferta: a primeira Squad a inscrever fica com ele.
- Tema proposto fora da lista precisa de aval da docência — o critério é estar no roadmap de Engenharia de Dados e fora do que os Encontros cobrem.
- A ordem de apresentação nas Semanas 13 a 15 é sorteada na Semana 11.
Temas disponíveis
Cada tema abaixo é um bloco do roadmap de Engenharia de Dados que a disciplina deliberadamente não aprofunda. A coluna da direita diz onde ele está em relação ao plano — é o argumento de que o tema não é redundante.
| Tema | Relação com o plano | Squad |
|---|---|---|
| Spark e processamento distribuído em cluster Quando o dado não cabe em uma máquina: modelo de execução, shuffle, particionamento e o custo real de sair do DuckDB. Compare com a plataforma da própria Squad — a que volume a mudança se pagaria? | Processamento distribuído — introdutório no plano, remetido a eletiva | Disponível |
| Nuvem gerenciada, IaC e Kubernetes para plataformas de dados O que muda ao sair do Docker Compose: serviços gerenciados, custo por consulta, infraestrutura como código e o que se perde em portabilidade. | Nuvem e IaC — fora do escopo do plano, remetido a Computação em Nuvem / DevOps | Disponível |
| Bancos de séries temporais e dados de sensor TimescaleDB, InfluxDB e ClickHouse: compressão, downsampling, política de retenção e por que série temporal justifica motor próprio. | Famílias especializadas — o livro-texto não percorre as famílias de banco de dados | Disponível |
| Motores de busca textual: Elasticsearch e OpenSearch Índice invertido, BM25, analisadores para português e a fronteira com a busca vetorial, que ficou fora do plano. | Busca — fora do escopo do livro-texto e do plano | Disponível |
| Data mesh e contratos entre domínios na prática A tese organizacional além do slogan: onde o mesh resolve, onde ele só renomeia o problema, e o que um contrato de dados precisa ter para valer. | Arquiteturas organizacionais — conceitual nas Semanas 4 e 13 | Disponível |
| Privacidade diferencial e dados sintéticos Além da privacidade da Semana 14: garantia formal, orçamento de privacidade e o compromisso com utilidade do dado. | Governança — aprofundamento além da Semana 14 | Disponível |
| Bancos de dados embarcados e o computador de ponta SQLite, DuckDB no navegador via WASM e sincronização com o servidor: o que o dado ganha ao morar perto de quem o usa. | Acréscimo — fora do roadmap clássico | Disponível |
| Observabilidade de dados e detecção de anomalia em pipeline Além dos testes do Projeto Integrado: perfilamento contínuo, detecção estatística de desvio e o custo de alarme falso na confiança do time. | Qualidade e observabilidade — elemento subjacente no plano, sem Semana própria | Disponível |
| Formatos de tabela aberta em disputa: Iceberg, Delta e Hudi Como cada um resolve transação, evolução de esquema e compactação; o que trava a Squad em cada escolha e o estado da interoperabilidade. | Lakehouse — a disciplina usa um formato, não compara os três | Disponível |
| Feature stores e o desvio entre treino e serviço Feature skew, viagem no tempo em feature, e por que o problema é de engenharia de dados antes de ser de aprendizado de máquina. | Dados para IA — mencionado na Semana 13 | Disponível |
| Busca vetorial, embeddings e RAG Chunking, embeddings, distância e índices aproximados (HNSW, IVF): o compromisso entre recall e latência, medido no corpus da própria Squad. Compare com busca léxica no PostgreSQL que vocês já têm. | Dados não estruturados e IA — fora do escopo do livro-texto | Disponível |
| Famílias não relacionais: documento, chave-valor, colunar largo e grafo O que cada família otimiza e o que cobra em troca. Escolha uma carga real da plataforma da Squad e compare com a opção nula: continuar no PostgreSQL. | NoSQL — o livro-texto apenas menciona as famílias | Disponível |
Tema fora desta lista precisa de aval da docência. O critério é duplo: estar no roadmap de Engenharia de Dados, e estar fora do que os Encontros cobrem.
Como se avalia
A avaliação de Seminário tem quatro critérios. O que mais surpreende quem apresenta é o de comunicação para público misto: a banca tem perfil técnico e de gestão, e uma apresentação que só serve a uma das duas metades perde nota mesmo estando tecnicamente correta.
O antídoto é simples de dizer e difícil de fazer: para cada mecanismo que você explicar, diga qual decisão ele permite tomar.