Aurora permite definir proporções de treino, validação e teste no Dataset Studio
O Aurora passou a permitir divisões personalizadas de datasets e a exibir evidências sobre exemplos, grupos, sobreposição, duplicatas removidas e linhas sem chave em cada particionamento.
O Aurora passou a permitir que usuários do módulo Dataset Studio definam as proporções de dados destinadas a treino, validação e teste. A configuração precisa somar 100%, e o sistema deixa de aplicar uma divisão fixa quando uma tarefa é criada ou editada. A mudança interessa a gestores públicos de saúde, hospitais e equipes de TI que preparam datasets para projetos de inteligência artificial.
Além da configuração, o módulo passou a exibir uma área de evidência do particionamento. O painel informa quantos exemplos e grupos foram destinados a cada parte, compara a proporção solicitada com a obtida e mostra quantos grupos aparecem em mais de uma partição. Também registra duplicatas exatas removidas e linhas sem chave declarada.
A divisão usa a chave do grupo e uma semente estável. Isso mantém cada grupo inteiro em uma única partição, embora a proporção final possa variar conforme o tamanho dos grupos. A própria tela sinaliza que a verificação comprova a separação dos grupos identificados, mas não detecta relações ausentes na chave ou textos semelhantes.
O Dataset Studio também passou a preservar decisões tomadas durante a análise de conflitos. Grupos podem ser classificados como resolvidos, com um rótulo canônico, ou excluídos, e essas decisões continuam associadas à tarefa depois de novas pré-validações. O usuário pode consultar esse histórico mesmo quando um conflito não reaparece no processamento seguinte.
Na prática, a alteração separa duas informações que antes poderiam ser confundidas: o que foi tratado em uma rodada específica e quais decisões permanecem vigentes para a tarefa. O resultado da pré-validação passa a mostrar grupos resolvidos e excluídos, além dos conflitos ainda identificados. Com isso, a revisão do dataset ganha uma visão conjunta da distribuição dos dados e das decisões aplicadas ao conjunto analisado.