Pular para o conteúdo

Sobre o autor

Esta documentação, e o AI Agent Eval Harness que ela descreve, são trabalho de Waldemar Szemat, Arquiteto de Soluções de IA e Fractional Head of AI.

A maioria dos pilotos de GenAI nunca chega à produção. Levá-los até lá e mantê-los funcionando em escala é o meu foco: sistemas de IA orientados à medição, harnesses de avaliação, governança de IA e geração aumentada por recuperação para domínios regulados como o da saúde.

Este projeto é uma prova de trabalho pública e trilíngue: um agente conversacional de saúde orientado à medição e com arquitetura cite-or-refuse para adesão à medicação, junto a um harness de avaliação com gating em CI, construído e avaliado sobre dados 100% sintéticos. É uma referência de capacidade e prontidão, não um dispositivo médico. Leia o resumo executivo para a versão curta.

  • Avaliação de LLMs e calibração de juízes (gates de qualidade e segurança em CI)
  • Governança e prontidão de IA (HIPAA, EU AI Act, NIST AI RMF, ISO/IEC 42001, SOC 2, MITRE ATLAS)
  • Geração aumentada por recuperação (recuperação híbrida, parent-document retrieval, imposição de citação)
  • IA para saúde e outros domínios regulados

Parte do portfólio de Waldemar Szemat · szemat.pro
GitHub · LinkedIn