Quando uma tecnologia falha, o instinto humano é criar um atalho — mas atalhos mal concebidos podem aprofundar a ferida em vez de a sarar. Foi o que aconteceu nos exames nacionais portugueses: o sistema de leitura de códigos QR falhou, a solução alternativa falhou ainda mais, e os erros propagaram-se silenciosamente por todo o processo de classificação digital, lembrando-nos que a automação sem robustez é uma promessa frágil quando está em jogo a avaliação de milhares de estudantes.
Relatório Deloitte: Sistema de recurso para falhas de QR também gerou erros nos exames
A solução criada para diminuir erros acabou por aumentá-los
O que é que realmente correu mal? Parece que havia um plano B que piorou as coisas.
Exatamente. O sistema principal lia códigos QR. Quando falhava, em vez de deixar para correção manual, criaram um sistema alternativo que lia números convencionais. Mas esse sistema alternativo era muito pior.
Pior em que sentido? Qual era a taxa de erro?
O relatório diz "níveis de reconhecimento substancialmente inferiores", mas não dá números concretos. Sabemos que aumentou os erros, mas não sabemos por quanto.
E esses erros — propagaram-se?
Sim. Se um número convencional fosse lido incorretamente, esse erro passava para a fase seguinte, depois para a outra. Páginas da mesma prova acabavam com números diferentes.
Quantas provas foram afetadas? O relatório diz isso?
Não. Diz que houve "situações em que páginas de uma mesma prova apresentavam números convencionais distintos", mas não quantifica.
Como é que resolveram?
Desenvolveram um novo algoritmo para ler os códigos QR. Releram tudo na primeira fase. Na segunda fase, funcionou bem o suficiente.
Bem o suficiente significa o quê? Ainda havia muitos erros?
Na segunda fase, só precisaram de intervenção manual em casos residuais — códigos danificados ou ilegíveis. Mas o relatório não diz qual era a taxa de erro antes e depois.
Havia outros problemas além dos códigos QR?
Sim. Dificuldades em ler respostas de escolha múltipla, porque os alunos marcavam de formas diferentes. Folhas de continuação não foram digitalizadas. O volume de incidências ultrapassou a capacidade de resposta.
As incidências concentraram-se em que disciplinas?
Português, Física e Química A, Matemática A e Biologia e Geologia. Mas novamente, não há números sobre quantas incidências ou qual era o impacto real.
O que aprendemos com isto?
Que um sistema automático que falha precisa de um plano B bem pensado. Neste caso, o plano B foi pior que deixar para manual desde o início.
The Pulse
- O sistema de leitura de QR nos exames nacionais colapsou na primeira fase, forçando as equipas a improvisar uma solução alternativa que se revelou ainda menos fiável.
- A solução de recurso — ler o número convencional impresso sob o código QR — tinha taxas de reconhecimento substancialmente inferiores, multiplicando os erros em vez de os conter.
- Os erros não ficaram circunscritos: propagaram-se pela agregação de dados e separação de perguntas, chegando a marcar páginas da mesma prova com identidades distintas, como se fossem de alunos diferentes.
- Um novo algoritmo foi desenvolvido ainda a tempo de releer os dados da primeira fase e de reduzir drasticamente a intervenção manual na segunda fase, mas o dano inicial já estava feito.
- O relatório da Deloitte aponta falhas críticas adicionais — folhas de continuação não digitalizadas, volume de incidências acima da capacidade de resposta — e conclui que o sistema 'automático' dependeu afinal, e em larga medida, do trabalho humano.
Quando uma tecnologia falha, o instinto humano é criar um atalho — mas atalhos mal concebidos podem aprofundar a ferida em vez de a sarar. Foi o que aconteceu nos exames nacionais portugueses: o sistema de leitura de códigos QR falhou, a solução alternativa falhou ainda mais, e os erros propagaram-se silenciosamente por todo o processo de classificação digital, lembrando-nos que a automação sem robustez é uma promessa frágil quando está em jogo a avaliação de milhares de estudantes.
Um relatório da Deloitte, divulgado pelo Ministério da Educação, revela como o sistema de correção digital dos exames nacionais falhou duas vezes seguidas na primeira fase. Quando o mecanismo principal não conseguia ler os códigos QR que identificam cada prova, as equipas do EduQA passaram a tentar ler o número convencional impresso por baixo — uma alternativa que, segundo a Deloitte, funcionava muito pior e acabou por aumentar os erros que pretendia resolver.
O impacto foi em cascata: cada leitura incorreta do número convencional contaminava as fases seguintes do processo — a agregação de dados, a separação de perguntas, a identificação das provas. Houve casos em que páginas da mesma prova ficaram associadas a números distintos, como se pertencessem a alunos diferentes. O mecanismo alternativo foi descontinuado, mas os erros já se tinham propagado.
A resposta passou pelo desenvolvimento de um novo algoritmo de leitura de QR, aplicado ainda durante a primeira fase para identificar divergências. Na segunda fase, o sistema funcionou suficientemente bem para que a intervenção manual ficasse limitada a casos residuais — códigos danificados ou ilegíveis.
O relatório identifica outros problemas: dificuldades no reconhecimento automático de respostas de escolha múltipla, divergências entre ficheiros digitalizados e a plataforma de classificação, e falhas críticas no tratamento de folhas de continuação, algumas das quais nem chegaram a ser digitalizadas. As disciplinas mais afetadas foram Português, Física e Química A, Matemática A e Biologia e Geologia. No final, o sistema concebido para automatizar a correção revelou-se profundamente dependente da intervenção humana para não colapsar.
O sistema que deveria automatizar a correção dos exames nacionais falhou duas vezes na primeira fase — primeiro na leitura dos códigos QR, depois no mecanismo criado para contornar esse problema inicial. Um relatório da Deloitte, divulgado pelo Ministério da Educação nesta terça-feira, traça o caminho exato dessa cascata de erros e explica como uma solução improvisada terminou por piorar as coisas.
Quando o sistema principal não conseguia ler os códigos QR que identificam cada prova, a equipa do Instituto de Educação, Qualidade e Avaliação (EduQA) recorria à correção manual. Para reduzir essa carga de trabalho, foi introduzido um mecanismo alternativo: em vez de ler o código QR, o sistema tentaria ler o número convencional impresso por baixo dele — o mesmo número que garante o anonimato das provas. Mas este plano tinha um defeito fundamental. Segundo a Deloitte, o reconhecimento automático desse número convencional funcionava muito pior do que a leitura do código QR. A solução criada para diminuir erros acabou por aumentá-los.
O impacto foi ainda mais grave porque esses erros não ficaram isolados. Quando o sistema lia incorretamente um número convencional, esse erro propagava-se por todo o processo seguinte — na agregação de dados, na separação de perguntas, em tudo. Houve casos em que diferentes páginas da mesma prova acabaram marcadas com números convencionais distintos, como se fossem provas diferentes. O mecanismo foi descontinuado, mas o estrago já estava feito.
A resposta foi desenvolver um novo algoritmo de leitura dos códigos QR. Ainda durante a primeira fase, este algoritmo foi aplicado para reler todos os códigos já processados e identificar divergências. Na segunda fase, o novo sistema funcionou bem o suficiente para que as equipas do centro de digitalização recorressem à identificação manual apenas em casos residuais — quando os códigos estavam danificados, rasurados ou completamente ilegíveis.
Mas o relatório da Deloitte identifica outros problemas que também prejudicaram o processo. Houve dificuldades em interpretar automaticamente as respostas de escolha múltipla, porque os alunos marcavam as suas opções de formas diferentes — nem sempre de um modo que o sistema conseguisse reconhecer com segurança. Nestes casos, as folhas foram encaminhadas para validação humana. A Deloitte também encontrou divergências entre os ficheiros digitalizados e o que aparecia na Plataforma de Classificação e Supervisão, sem conseguir determinar com precisão a origem de todas essas falhas.
Os problemas concentraram-se sobretudo em Português, Física e Química A, Matemática A e Biologia e Geologia. O relatório classifica como críticas as falhas no tratamento das folhas de continuação — algumas em branco não foram sequer digitalizadas — e o facto de o volume de incidências reportadas pelos classificadores ter ultrapassado a capacidade de resposta. Identificou ainda cinco outras falhas de criticidade média, relacionadas com a qualidade da impressão, o ritmo do processamento inicial, páginas em falta ou anuladas, versões incorretamente atribuídas nos ficheiros de classificação, parametrizações incompletas e limitações na gestão dos classificadores.
Durante a primeira fase, foram implementadas intervenções técnicas — novos mecanismos de controlo, ferramentas de suporte, procedimentos para reforçar a rastreabilidade e a qualidade dos dados. Segundo a Deloitte, estas medidas permitiram detetar mais cedo situações de não conformidade, reduzir o risco de provas incompletas e tornar o tratamento mais eficiente. O relatório não oferece números sobre quantas provas foram afetadas ou quantas correções foram necessárias, mas deixa claro que o sistema que deveria ser automático terminou por depender fortemente da intervenção humana para funcionar.
Notable Quotes
A solução acabou, assim, por introduzir erros adicionais na identificação e na consistência das provas, que se propagaram às fases seguintes de processamento— Relatório da Deloitte