Aurora passa a retomar fine-tuning após o teto de GPU
O Aurora permite devolver à fila um treino interrompido pelo teto de GPU e retomá-lo do checkpoint preservado. O painel também identifica treinos sem sinal ou sem avanço e informa o custo de uma interrupção.
O Aurora passou a permitir que um treino de fine-tuning interrompido ao atingir o teto de GPU volte à fila e continue a partir do checkpoint preservado. A mudança interessa a gestores públicos de saúde, hospitais e equipes de TI que acompanham o uso de infraestrutura soberana de IA: em vez de iniciar outro treinamento, o operador pode informar um novo teto total de GPU e retomar o trabalho existente.
A opção aparece na área de acompanhamento do treino. O novo teto precisa superar o consumo acumulado, com uma margem mínima de 60 segundos, e o consumo anterior continua contabilizado. Assim, o orçamento não é reiniciado a cada continuação. A operação exige a permissão de gestão de fine-tuning e fica registrada em auditoria.
O painel também ganhou sinais mais específicos sobre o andamento dos trabalhos. “Sem sinal” identifica a ausência de heartbeat do executor — a máquina responsável pela execução —, enquanto “Travado” indica que há comunicação, mas o número de passos do treino não avança durante a fase de treinamento. A mesma informação aparece no selo do job e na lista de executores, permitindo relacionar o treino à máquina que o executa.
Jobs ainda na fila não recebem o rótulo de travados, e estados terminados não herdam alertas de heartbeats antigos. A regra considera o intervalo de medição antes de indicar falta de avanço, evitando tratar como problema uma pausa compatível com a coleta de informações.
Outra mudança é a exibição da cadência dos checkpoints. O Aurora informa a quantidade de passos e, quando há uma medição de duração disponível, uma estimativa de tempo até o próximo ponto de retomada. Se o primeiro checkpoint não couber no teto de GPU definido para o treino, o painel apresenta o alerta e os números correspondentes.
Na operação dos executores, o Aurora também passou a distinguir perda de contato com a plataforma de falha do próprio job. Quando a comunicação não pode ser mantida, o trabalho é abandonado pelo executor e pode voltar à fila sem consumir uma tentativa por um erro de transporte. O contrato entre servidor e executor usa lease de 180 segundos e heartbeat de 30 segundos, com a parada do executor antes de uma eventual reentrega do trabalho.