Serviços   O conteúdo desse portal pode ser acessível em Libras usando o VLibras

Cidacs-RL: algoritmo genético melhora vinculação de dados em saúde

Escrito por Lívia Oliveira  em 21 de agosto de 2026

O algoritmo otimizado reduziu em 90% os falsos positivos da vinculação de dados. 

Integrar dados está no próprio nome do Centro. Para os pesquisadores do Centro de Integração de Dados e Conhecimentos para Saúde (Cidacs/Fiocruz Bahia), reunir informações de diferentes bases de saúde é essencial para produzir novas evidências sobre a população brasileira. Mas essa tarefa enfrenta um desafio: os sistemas de informação nem sempre possuem um identificador único capaz de indicar que registros pertencem à mesma pessoa. Um novo estudo produzido pelo Cidacs propõe uma estratégia para tornar esse processo mais preciso, utilizando algoritmos genéticos para otimizar os parâmetros do Cidacs-RL, ferramenta desenvolvida para a vinculação de grandes e diferentes bases de dados. O método reduziu em 90% os falsos positivos. 

Os algoritmos genéticos são métodos computacionais inspirados no processo de evolução genética, e são utilizados para encontrar boas soluções em problemas que envolvem muitas possibilidades. Em vez de testar todas as combinações existentes, o algoritmo avalia diferentes soluções, seleciona as que apresentam melhor desempenho e, a partir delas, gera novas combinações, repetindo o processo até chegar a uma configuração considerada adequada. 

A pesquisa, intitulada “Optimizing Record Linkage Parameters with Genetic Algorithms for Health Data Integration”, e publicada no Anais do XXVI Simpósio Brasileiro de Computação Aplicada à Saúde (SBCAS), avaliou a vinculação de registros do Sistema de Informações sobre Nascidos Vivos (SINASC) e do Sistema de Informações sobre Mortalidade (SIM), geridos pelo Ministério da Saúde. 

No geral, os falsos positivos passaram de 295 para 29. Ao mesmo tempo, a precisão do processo aumentou de 0,70 para 0,96 e a acurácia, ou seja, o grau de exatidão, passou de 0,89 para 0,99. 

“Os resultados demonstram que a estratégia de otimização proposta melhora a qualidade da vinculação no fluxo de trabalho do Cidacs-RL, principalmente por meio da redução de correspondências falsamente positivas, mantendo, ao mesmo tempo, um recall extremamente alto”, apontaram os autores. 

Na prática, o sistema que vincula diferentes bases de dados para as pesquisas passou a errar menos no que tange dizer que eram as mesmas pessoas. Assim, com a nova configuração, caiu o número de registros de pessoas diferentes que eram vinculados por engano, enquanto a capacidade de identificar os pares que realmente correspondiam à mesma pessoa permaneceu alta. 

Processo de otimização 

Como os bancos podem apresentar diferenças ou informações inconsistentes, como o nome, nome da mãe, data de nascimento, sexo e município, o CIDACS-RL calcula um índice de similaridade entre os dados das diferentes bases para estimar se dois registros correspondem ao mesmo indivíduo. Nesse processo, cada informação recebe um peso, e a combinação desses valores ajuda a determinar se um possível par deve ou não ser considerado uma correspondência. 

Para avaliar os resultados, os pesquisadores utilizaram um conjunto de pares de registros que já tinham sido revisados e classificados como correspondências verdadeiras ou falsas. A configuração otimizada foi comparada aos parâmetros originais do sistema. 

“Implementamos um conjunto de decisões hierárquicas elaborado para reduzir a subjetividade, minimizar vieses sistemáticos e garantir classificações consistentes dos pares entre os avaliadores”, destacam.  

A melhoria também foi observada individualmente nos estados do Sul do Brasil analisados, como Paraná, Santa Catarina e Rio Grande do Sul. A redução dos falsos positivos variou entre 88% e 98%, enquanto o sistema teve uma taxa de recuperação das correspondências verdadeiras próxima de 98%. 

Algoritmos genéticos e próximos passos 

O desafio encontrado pelos pesquisadores foi justamente encontrar a melhor combinação dos pesos e de penalidades para discordâncias entre os registros. Em bases de dados de grande escala, testar manualmente todas as possibilidades pode ser caro e demorado. Para contornar esse problema, o estudo utilizou um algoritmo genético. 

No Cidacs-RL, o algoritmo foi capaz de explorar diferentes combinações de parâmetros e identificar aquelas que apresentam melhor desempenho. Apesar dos resultados, os pesquisadores destacam que a estratégia ainda depende da construção de uma base de referência com registros revisados manualmente. Como próximos passos, o estudo aponta a possibilidade de utilizar outras técnicas para reduzir a necessidade de revisão manual e aumentar a eficiência de todo o processo. 

Pesquisador(es): Pablo Pita, Katie Harron, Islame F. C. Fernandes, José Augusto Duarte, Gabriel Fernandes Rocha, Pablo Ivan Ramos, Samila Sena, Roberto Carreiro, Fernanda Silva Eustáquio, George Dantas Cardozo, Carlos José Cardoso dos Santos, Leandro Ribeiro, Sarah Sena, Bethânia de Araújo Almeida, Mauricio Barreto, Robespierre Dantas da Rocha Pita.

[mc4wp_form id="2531"]
Acessar o conteúdo