Skip to content
View 1pedroosilva's full-sized avatar
🎯
Focusing
🎯
Focusing

Block or report 1pedroosilva

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
1pedroosilva/README.md

Engenharia de dados em Databricks, com um agente de código no processo.

Os três repositórios abaixo são um pipeline, as regras que escrevi para o agente trabalhar nele e um experimento que mede se essas regras mudam o resultado.

O pipeline da CVM gera as regras que viram skills. As skills orientam o agente no pipeline. Uma versão congelada das skills é medida na avaliação, e o resultado decide o que sai.

Demonstrações financeiras anuais das companhias abertas, do ZIP que a CVM publica até tabelas Silver em Delta Lake. O layout da fonte muda entre anos e a companhia republica valores corrigidos sem aviso, por isso a Bronze guarda toda versão e a Silver resolve a vigente na leitura. Captura, histórico e tratamento já rodam; a Gold ainda não existe. Jobs e ambientes declarados em Asset Bundles, Ruff e pytest a cada push. Etapa por etapa, no portfólio.

14 skills para o que as nativas não cobrem: estratégia de gravação, nomenclatura, onde nasce um arquivo novo, como revisar um notebook. Cada uma saiu de um erro que o agente repetia no pipeline da CVM. No começo nenhuma era acionada. Testei três hipóteses sobre a causa, uma por vez, e as três caíram (protocolo). O projeto, no portfólio.

Um pipeline sobre dados de interrupção de energia da ANEEL, construído duas vezes no mesmo workspace: com as skills congeladas em 6c7933e e com elas desligadas. Os mesmos 12 pedidos, na mesma ordem, em 24 sessões com transcrição completa e o raciocínio do agente. Com o primeiro de dois temas fechado, as skills acertam onde o arquivo nasce e que nome ele recebe. Nenhum dos dois braços percebeu que escrevia num catálogo inexistente. As 24 sessões.

Linha do tempo de agosto e setembro de 2026: o pipeline da CVM começa em 8 de agosto, as skills saem dele em 15 de agosto, a versão avaliada é congelada em 6 de setembro e as 24 sessões da avaliação acontecem entre 5 e 14 de setembro.

Datas tiradas dos commits dos três repositórios.

Para ler primeiro

  • evolucao_projeto.md: as decisões do pipeline com data, inclusive as que voltaram atrás, e o motivo de cada volta.
  • 6b104fc: o agente acrescentou 48 linhas ao próprio arquivo de instruções, que proíbe exatamente isso. O commit seguinte desfaz.
  • lessons_learned.md: uma correlação que entrou na documentação como requisito e saiu depois de testada.

Databricks, PySpark, Delta Lake, Unity Catalog, Asset Bundles, GitHub Actions, pytest, Ruff.

portfólio   linkedin   e-mail

Pinned Loading

  1. genie-skills-eval genie-skills-eval Public

    Avaliacao experimental das Databricks Genie Skills — execucao com e sem skills, artefatos e transcricoes preservados

    HTML

  2. databricks-genie-skills databricks-genie-skills Public

    Habilidades personalizadas para o Databricks Genie Code (Assistente de IA) – Investigação, padrões de projeto e melhores práticas para o desenvolvimento de habilidades de agentes.

    HTML

  3. projeto-cvm-dados-financeiros projeto-cvm-dados-financeiros Public

    Pipeline de dados financeiros da CVM — arquitetura medalhão em Databricks/PySpark

    Python