notícia corporativa inova/ai.inova.in

Aurora estrutura ingestão e curadoria de dados para IA em saúde pública

A Inova incorporou ao Aurora fluxos para receber arquivos JSONL, catalogar datasets, explorar registros e aplicar regras de curadoria com acesso separado por organização.

Arte de notícia corporativa para Aurora estrutura ingestão e curadoria de dados para projetos de IA em saúde pública

A Inova incorporou ao Aurora, sua infraestrutura soberana de IA para saúde pública, um fluxo para receber, organizar e preparar datasets antes de seu uso em análises. A atualização inclui o Data Hub, responsável por catalogar arquivos JSONL e permitir a exploração dos registros, e o Data Quality, voltado à criação de recortes e aplicação de regras de curadoria.

A mudança importa para gestores públicos de saúde, hospitais e equipes de TI porque separa etapas que costumam aparecer misturadas em projetos de dados: entrada, armazenamento, consulta e preparação. Na prática, um arquivo pode ser enviado em partes, sem que todo o conteúdo precise ser carregado de uma vez na memória do navegador. O sistema registra o dataset por organização, seu estado de processamento e informações como tamanho, contagem de linhas e checksum.

Depois da validação, o dataset entra em uma fila de ingestão. O conteúdo é armazenado em um warehouse analítico ClickHouse, enquanto o catálogo e os metadados permanecem no MySQL. O fluxo prevê estados como “queued”, “ingesting”, “ready” e “ingest_failed”. O status “ready” indica que o conjunto está disponível para exploração no warehouse, segundo as estruturas criadas no código.

O Data Hub também oferece consulta de estrutura e de registros, com busca, cursor, ordenação e filtros. O limite de exploração é de até 100 registros por consulta, conforme a documentação técnica do módulo; a análise pesada fica separada no Data Quality.

No segundo estágio, o Data Quality trabalha sobre datasets já prontos no Data Hub. O usuário pode definir um recorte com filtros e colunas, criar rotinas e executar análises. A primeira rotina implementada associa uma expressão regular a um campo e aplica uma tag aos registros correspondentes. Os resultados ficam vinculados ao dataset, à regra, à rotina e à execução.

O controle de acesso também foi dividido. A permissão `data.view` permite visualizar datasets, enquanto `data.import` é necessária para importar ou remover dados. No Data Quality, `analysis.view` permite consultar regras e resultados; `analysis.manage` é exigida para criar, editar, excluir ou executar regras. As permissões são avaliadas dentro da organização correspondente.

Com a atualização, o painel do Aurora passa a apresentar os módulos em quatro camadas: Ingestão, Curadoria, Modelos e Aplicações. O estado de navegação do usuário — incluindo abas, workspace e explorações abertas — também pode ser restaurado a partir do perfil no servidor. O diff não informa clientes, métricas de desempenho ou disponibilidade comercial geral das novas capacidades.

Inova Comunicações

Central de chamados

Conte o que está acontecendo

Não inclua senhas, dados de pacientes ou outras informações sensíveis.