Quem é parente de quem na política brasileira

Extração de laços de família do Dicionário Histórico-Biográfico Brasileiro com agentes de modelos de linguagem

Felipe Lamarca

IESP-UERJ · Em parceria com a FGV CPDOC, com financiamento da CAPES

25 de setembro de 2026

Resumo

Este artigo descreve a construção de uma rede de parentescos entre as pessoas do Dicionário Histórico-Biográfico Brasileiro (DHBB), da FGV CPDOC. A partir de 6.998 verbetes biográficos, agentes do modelo Claude Sonnet leram os parágrafos que tratam de família e registraram cada laço afirmado no texto, com o termo usado e o trecho literal que o comprova. Uma etapa de resolução de entidades transformou as menções em pessoas únicas, com regras genealógicas para não fundir homônimos de gerações diferentes. Agentes do modelo Claude Opus anotaram às cegas, a partir do texto integral, uma amostra estratificada de 202 verbetes, e um terceiro agente adjudicou as divergências. Na amostra-ouro, a extração alcança precisão de 99,7% e revocação de 98,1%, contra 97,4% e 89,1% da primeira versão do projeto, baseada em modelos Llama. A rede final reúne 26.186 pessoas e 22.568 laços. Entre os verbetados, 25,5% têm pelo menos um parente que também tem verbete, proporção que chega a 37,1% entre as mulheres. A rede está disponível em uma interface web em que cada ligação carrega a sua fonte.

1 Introdução

Laços de família atravessam a história política brasileira. Filhos sucedem pais em mandatos, casamentos aproximam grupos regionais e sobrenomes se repetem ao longo de gerações de legisladores. A literatura sobre dinastias políticas mostra que esses laços não são curiosidade biográfica: em linha com Dal Bó et al. (2009) e Querubin (2016), ter um parente no poder parece aumentar, em maior ou menor grau, as chances de chegar a ele. Estudar essas redes, no entanto, exige dados que raramente existem de forma sistemática.

O Dicionário Histórico-Biográfico Brasileiro (Abreu et al. 2001) é uma fonte privilegiada para essa empreitada. Seus verbetes biográficos costumam informar de quem a pessoa é filha, com quem se casou e quais parentes também tiveram vida pública. Essa informação, porém, está dispersa em texto corrido, espalhada por milhares de verbetes escritos por autores diferentes ao longo de décadas.

Este trabalho apresenta a segunda versão de um projeto que transforma esse texto em uma rede. De forma antecipada, é possível destacar três achados. De saída, agentes de modelos de linguagem extraem laços de parentesco com precisão de 99,7% e revocação de 98,1% quando comparados a uma leitura independente do texto integral, e um filtro de parágrafos por vocabulário de parentesco reduz o texto lido a 11% do total sem perda mensurável de revocação. Em segundo lugar, a etapa mais delicada foi a identificação das pessoas: nomes que se repetem de avô para neto só se separam com regras genealógicas, que olham gerações e datas. Por fim, a rede resultante indica que cerca de um quarto dos verbetados tem um parente também verbetado, com proporção maior entre as mulheres.

Este trabalho se divide em dez seções, além desta introdução. A seção 2 descreve o DHBB como fonte e a atualização do corpus. A seção 3 resume a primeira versão do projeto. As seções 4 e 5 descrevem a extração e a resolução de entidades, e a seção 6, a validação. A seção 7 apresenta a rede, a seção 8 descreve a visualização, e as seções 9 a 11 discutem limitações, reprodutibilidade e custo, e considerações finais.

2 O DHBB como fonte

O DHBB reúne verbetes biográficos e temáticos sobre a história política brasileira a partir de 1930. A FGV CPDOC mantém uma versão pública do dicionário no GitHub (FGV CPDOC 2024), com um arquivo por verbete, cabeçalho de metadados (título, natureza, sexo, cargos e autoria) e o texto em Markdown. Partimos do repositório no commit de 1º de abril de 2025, que contém 7.863 verbetes, dos quais 6.890 biográficos.

O site do CPDOC, no entanto, já exibia verbetes que ainda não estavam no repositório. Para identificá-los, cruzamos três listas de endereços: (i) a busca do próprio site, percorrida página a página; (ii) o índice de páginas arquivadas pelo Wayback Machine; e (iii) os verbetes do repositório, casados por nome, título e início do texto. Os candidatos restantes foram baixados um a um, com intervalo de cinco segundos entre requisições e com autorização do CPDOC. Desse processo resultaram 110 verbetes biográficos novos, sobretudo de parlamentares eleitos entre 2014 e 2022, além de 15 endereços alternativos de verbetes que já estavam no repositório. Descontadas duas duplicatas, o corpus final tem 6.998 verbetes biográficos.

A leitura do corpus revelou uma inconsistência nos metadados. Em 12 verbetes, o campo de sexo diverge da filiação descrita na primeira frase do texto (por exemplo, “filha de” em um verbete marcado como masculino). É pouco em proporção, mas pesa em qualquer análise por sexo. Adotamos a filiação textual como critério e registramos a divergência.

3 Da primeira à segunda versão

A primeira versão do projeto (Lamarca 2024) usava modelos Llama pela API da Groq. Para caber na janela de contexto dos modelos, cada verbete passava por um filtro de frases que mencionavam entidades do tipo pessoa, identificadas por um modelo de reconhecimento de entidades, e os verbetes mais longos eram quebrados em pedaços. O modelo respondia, para cada par de pessoas, qual era o parentesco, e a resposta “nenhum” era a mais frequente. O resultado tinha três problemas: (i) formatos de saída que variavam entre rodadas; (ii) nenhuma evidência verificável para cada laço; e (iii) nomes nunca padronizados, de modo que “Vargas” e “Getúlio Vargas” apareciam como pessoas diferentes.

A segunda versão preserva a ideia central (ler o texto e registrar laços) e muda o resto: o modelo, a unidade de leitura, o esquema de saída, a verificação, a identificação das pessoas e a validação. A seção 6 compara as duas versões na mesma amostra de referência.

4 Extração

Figura 1 resume as etapas. As subseções a seguir detalham cada uma.

flowchart TD
  A[Repositório cpdoc/dhbb<br/>+ site do CPDOC] --> B[Corpus<br/>6.998 verbetes]
  B --> C[Filtro de parágrafos<br/>vocabulário de parentesco]
  C --> D[Agentes Sonnet<br/>240 lotes]
  D --> E[Portão automático<br/>evidência literal]
  E --> F[Resolução de entidades<br/>regras genealógicas]
  F --> G[Rede e site]
  B --> H[Amostra-ouro<br/>anotação Opus às cegas]
  H -. adjudicação e métricas .-> E
Figura 1: Etapas do pipeline, do verbete à rede.

4.1 Filtro de parágrafos

Os verbetes do DHBB têm tamanhos muito diferentes. A mediana é de cerca de quatro mil caracteres, mas o verbete de Getúlio Vargas passa de 640 mil. A informação de parentesco, por outro lado, se concentra em poucos lugares: a primeira frase costuma trazer a filiação (“filho de X e de Y”) e os últimos parágrafos, o casamento e os filhos. Laços com outras figuras públicas aparecem de forma esparsa ao longo da trajetória.

Por isso, o agente não lê o verbete inteiro. Ele recebe (i) o primeiro parágrafo; (ii) todo parágrafo que contém algum dos 151 termos do vocabulário de parentesco (pai, irmã, casou-se, genro, sobrinho-neto e outros); e (iii) o parágrafo anterior, quando a frase de parentesco não traz nenhum nome próprio (“Seu irmão também foi deputado”). O termo precisa aparecer em minúsculas ou em início de frase, para que o sobrenome “Filho” ou o “Colégio Pais de Carvalho” não disparem o filtro. Os parágrafos entram inteiros, sem cortes. Com isso, o texto lido cai para 11% do total.

A escolha foi testada antes de ser adotada. Em cinco verbetes escolhidos por serem difíceis, anotamos os parentescos a partir do texto integral e comparamos duas leituras do mesmo modelo, uma com o texto filtrado e outra com o texto integral. A leitura filtrada encontrou os 39 laços do gabarito e custou metade dos tokens. A leitura integral encontrou 38: o laço que faltou (“Benjamim Vargas, irmão de Getúlio”) estava no meio de um verbete de 25 mil caracteres sobre outra pessoa. Nesse teste, o filtro não custou nenhum laço, e a leitura integral custou um. A validação da seção 6 confirma o resultado em escala: nenhuma das 711 relações da referência estava fora dos parágrafos filtrados.

4.2 Esquema e vocabulário

Cada verbete gera uma lista de pessoas e uma lista de relações. O verbetado é sempre p0, e cada relação tem a forma “X é tipo de Y”, com um tipo neutro em gênero tirado de um vocabulário controlado de 33 tipos (genitor, filho, cônjuge, cunhado, consogro e outros). Para cada tipo, o vocabulário registra a relação inversa (genitor e filho), a diferença de geração (+1 para genitor, 0 para cônjuge) e o grupo (consanguíneo em linha reta, colateral, conjugal, afinidade, compadrio ou indeterminado).

Além do tipo, cada relação guarda o termo literal do texto (“filha”, “casou-se”, “genro”), um qualificador opcional (ex, viuvez, segundas núpcias, lado paterno ou materno) e até dois trechos copiados do verbete como evidência. As regras de conteúdo são restritivas. Só entra o que o texto afirma: “casou-se com Maria, filha de João” gera Maria cônjuge do verbetado e Maria filha de João, mas não “João sogro do verbetado”, a menos que o texto use a palavra “sogro”. Laços políticos com nomes de parentesco (“padrinho político”, “herdeiro político”) ficam de fora, assim como parentes sem nome que não ligam o verbetado a ninguém (“teve três filhos”). Relações entre terceiros entram quando afirmadas, o que permite, por exemplo, registrar “Ernâni Amaral Peixoto, genro de Vargas” a partir do verbete de Canrobert Pereira da Costa.

4.3 Agentes e orquestração

A extração não usou nenhuma API de modelo. Os verbetes filtrados foram empacotados em 240 lotes de até 30 verbetes (ou 40 mil caracteres), e cada lote foi entregue a um agente do modelo Claude Sonnet, lançado por um roteiro de orquestração no Claude Code. O agente lê as instruções e o lote, escreve um arquivo com uma linha JSON por verbete e devolve a lista de identificadores processados, o que permite detectar verbetes pulados. Um modelo maior (Claude Opus) coordenou o processo e fez a anotação de referência.

As instruções foram ajustadas em um piloto de 64 verbetes, comparando a extração com uma anotação independente. No piloto, a precisão foi de 100,0% e a revocação, de 98,0%. As quatro relações que faltaram seguiam o mesmo padrão (“casou-se com X, com quem teve dois filhos, um deles Y”), e a regra correspondente foi acrescentada às instruções antes de congelá-las.

Um detalhe operacional teve efeito grande sobre o custo. Na primeira tentativa da rodada completa, os agentes herdaram um nível alto de esforço de raciocínio e chegaram a gastar 64 mil tokens de raciocínio em uma única etapa, o que tornava cada lote lento (cerca de 25 minutos) e caro. Interrompemos a rodada depois de sete lotes, testamos níveis menores de esforço em dois lotes do piloto e retomamos com o nível baixo de esforço de raciocínio. A qualidade no piloto foi a mesma (precisão de 100% e revocação entre 97% e 100% nos três níveis testados), em cerca de um quinto do tempo.

4.4 Verificação automática

Toda relação passa por um portão programático. A relação é reprovada quando (i) um trecho de evidência não existe, caractere por caractere, no verbete (com espaços normalizados); (ii) o tipo está fora do vocabulário; (iii) o termo literal é incompatível com o tipo e com a sua inversa; ou (iv) liga uma pessoa a ela mesma. Quando o agente reescreve levemente um trecho (trocando “e de” por “e”, por exemplo), o portão procura no verbete o trecho mais parecido e, se a semelhança passar de 92%, substitui a evidência pelo texto literal. Incoerências de sexo (o termo “filha” para alguém marcado como homem) e de datas (um genitor nascido depois do filho) geram avisos. Na rodada completa, o portão aprovou 23.820 relações e reprovou 36.

Uma checagem adicional, barata, cobre o corpus inteiro. Uma expressão regular extrai os pais da primeira frase (“filho de X e de Y”) em 10.359 ocorrências. Os agentes encontraram 99,9% desses pais. As poucas diferenças vinham, na maioria, da própria expressão regular (em “filho do fazendeiro Antônio Balbino”, ela pula o pai e captura o avô citado adiante).

5 Resolução de entidades

A extração produz menções, isto é, pessoas dentro de um verbete. A rede precisa de pessoas únicas. A resolução de entidades (Christen 2012) resolve dois problemas: ligar uma menção ao verbetado que tem verbete próprio e juntar menções à mesma pessoa sem verbete feitas em verbetes diferentes.

Os nomes são normalizados (sem acentos, sem partículas como “de” e “dos”) e grafias antigas são equiparadas (Osvaldo e Oswaldo, Luís e Luiz). Uma menção é ligada a um verbetado quando o nome completo normalizado coincide e há um único candidato sem conflito de sexo ou de datas. Nomes parciais só são ligados com corroboração: o verbete do candidato menciona de volta o verbetado atual, ou os anos de nascimento são compatíveis. Menções a pessoas sem verbete são fundidas entre verbetes quando têm nome compatível e o mesmo tipo de laço com a mesma pessoa (o pai comum de dois irmãos verbetados, por exemplo), ou quando o nome completo é longo e raro. Os 241 casos ambíguos foram adjudicados por agentes, a partir de um dossiê com o contexto da menção e os dados de cada candidato.

A família Vargas ilustra por que regras genealógicas são necessárias. Nomes se repetem de uma geração para outra: o pai de Getúlio se chamava Manuel do Nascimento Vargas, e o sobrinho, Manuel do Nascimento Vargas Neto; o filho caçula, Manuel Antônio, aparece em alguns verbetes apenas como “Manuel Vargas”. Em versões iniciais da resolução, o pai e o filho caçula chegaram a ser fundidos, porque ambos estavam ligados a Getúlio. Sufixos como Filho, Júnior e Neto são tratados como traço distintivo, e um nome com sufixo de um lado só nunca é ligado automaticamente. A ligação a um verbetado também respeita a geração: se a menção é pai do verbetado, o candidato precisa ter nascido entre 12 e 70 anos antes dele, e os limites crescem com o grau (avós, bisavós). Essa restrição rejeitou 621 ligações, como a do avô “Albano do Prado Pimentel Franco” ao neto homônimo nascido em 1940. Fusões estruturais, por sua vez, exigem o mesmo tipo de laço com a mesma pessoa (ambos filhos de Getúlio, e não um pai e um filho) e nascimentos estimados compatíveis.

Duas regras estreitas cobrem formas de citação comuns no DHBB. Mulheres aparecem ora com o nome de solteira, ora com o de casada: a filha de Ernâni Amaral Peixoto e Alzira Vargas é “Celina Vargas do Amaral Peixoto” em um verbete e “Celina do Amaral Peixoto Moreira Franco” em outro. As duas menções são unidas quando o prenome é pouco comum (o que exclui Maria, Ana e similares), há um sobrenome em comum, o laço com a mesma pessoa é o mesmo e o candidato é único. Pessoas citadas só pelo sobrenome (“genro de Vargas”) são ligadas ao verbetado que tem o mesmo laço com a mesma pessoa, também só quando o candidato é único.

Ao todo, 2.655 de 23.195 menções nomeadas foram ligadas a verbetados, e 1.294 fusões juntaram menções a pessoas sem verbete. O mesmo fato pode aparecer em dois verbetes (“A, pai de B” no verbete de B e “B, filho de A” no verbete de A); esses registros viram uma só aresta com várias fontes, o que ocorre em 1.076 laços. Pares com tipos de geração incompatíveis (tio em um verbete e primo em outro) são sinalizados como contradição. Quando um dos lados tem várias fontes e o outro, uma só, o laço minoritário é descartado. Ao final, restaram 16 contradições.

Uma auditoria às cegas mediu a qualidade dessa etapa. Um agente Opus julgou, sem saber a decisão tomada, três amostras de pares: ligações feitas a verbetados, fusões de pessoas sem verbete e menções não ligadas cujo nome se parece com o de algum verbetado. A precisão das ligações foi de 96,3% e a das fusões, de 100,0%. Entre os nomes parecidos não ligados, 6,2% eram de fato a mesma pessoa. A auditoria foi repetida a cada revisão das regras, com amostras novas, e a precisão das ligações variou entre 96% e 99% nas três rodadas, oscilação compatível com amostras de 80 casos. A última rodada antecede um ajuste final que apenas remove ligações (a restrição de geração passou a valer também para parentes de parentes, como o pai da esposa), de modo que os números acima são um limite inferior da precisão. Trata-se de uma estratégia deliberadamente conservadora: preferimos deixar separadas duas menções à mesma pessoa a fundir duas pessoas diferentes.

6 Validação

6.1 Desenho

A validação compara a extração com uma anotação de referência feita de forma independente. Antes de qualquer extração, sorteamos três amostras disjuntas, com semente fixa: (i) desenvolvimento, com 64 verbetes, usada para ajustar as instruções; (ii) ouro, com 202 verbetes, avaliada uma única vez com as instruções congeladas; e (iii) reserva, com 64 verbetes, guardada para o caso de as instruções mudarem depois do ouro (o que não aconteceu). A amostra-ouro foi estratificada por sexo, tamanho do verbete e presença de parentesco fora do primeiro parágrafo, com sobreamostragem de mulheres e de verbetes com parentesco espalhado pelo texto.

A referência foi produzida por agentes do modelo Claude Opus, com até cinco verbetes cada, lendo o texto integral, sem filtro, e com instruções diferentes das da extração: percorrer o verbete parágrafo por parágrafo e listar todos os parentes antes de montar as relações. Trata-se de uma decisão para reduzir erros correlacionados entre os dois modelos. As regras de pareamento foram fixadas antes da anotação. Pessoas são alinhadas dentro do verbete pelo nome, relações são comparadas com a direção normalizada pela relação inversa, e a métrica estrita exige o mesmo tipo de laço.

As divergências entre extração e referência foram então julgadas às cegas por um terceiro agente Opus, que recebeu o verbete integral e cada afirmação sem saber quem a tinha feito. Junto com as divergências, o juiz recebeu 100 relações sorteadas entre as concordâncias, para estimar erros comuns aos dois modelos.

6.2 Resultados

Antes da adjudicação, a extração acertou 695 das 711 relações da referência, deixou 14 de fora e registrou 19 que a referência não tinha: precisão de 97,3% e revocação de 98,0%. A adjudicação mudou a leitura da precisão. Das 19 relações que só a extração tinha, 18 estavam corretas, isto é, eram laços que a referência deixou passar. As 14 relações que só a referência tinha eram de fato faltas da extração. Entre as concordâncias auditadas, 99 de 100 estavam corretas.

Com a referência corrigida pela adjudicação, a precisão é de 99,7% (intervalo de confiança de 95% por bootstrap de verbetes: 99,4% a 100,0%) e a revocação, de 98,1% (96,8% a 99,3%). Figura 2 mostra o recorte por grupo de parentesco antes da adjudicação. Os laços conjugais têm a revocação mais alta; os colaterais (irmãos, tios, primos), a mais baixa.

Figura 2: Precisão e revocação por grupo de parentesco na amostra-ouro, antes da adjudicação (métrica estrita).

As faltas se concentram em um padrão: relações entre terceiros enterradas no meio de verbetes longos. Os irmãos Konder citados no verbete de Marieta Konder, “Pedro Collor, seu irmão mais novo” no verbete de outra pessoa e relações ditas por título nobiliárquico (“filha dos barões de Dourados”) são exemplos. O único erro da extração é um caso clássico de correferência: em “Clemente Mariani, sogro de seu filho”, o agente registrou Mariani como sogro do próprio verbetado.

O filtro de parágrafos não custou nenhuma relação: 0 das relações da referência estavam fora dos parágrafos que o agente leu. A extração também é estável: uma segunda rodada independente sobre a amostra-ouro concorda com a primeira em F1 de 0,987, e 189 dos 202 verbetes saíram idênticos.

A primeira versão do projeto, medida contra a mesma referência (com pareamento flexível, porque ela não distinguia a direção dos laços), tem precisão de 97,4% e revocação de 89,1%, e não tinha saída para 15 dos 202 verbetes da amostra. A precisão é equivalente. O ganho da segunda versão está na revocação, na evidência verificável de cada laço e na padronização das pessoas.

7 A rede

A rede final reúne 26.186 pessoas e 22.568 laços. Dos 6.998 verbetados, 6.587 têm pelo menos um laço registrado. Os laços de filiação dominam, com 14.090 registros, seguidos de 5.896 casamentos (Figura 3). Irmãos, tios, primos e avós aparecem em número bem menor, o que reflete a forma dos verbetes: a filiação e o casamento do verbetado são quase obrigatórios, enquanto os demais parentes só aparecem quando têm alguma relevância pública.

Figura 3: Tipos de laço mais frequentes na rede.

Definimos família como um componente conexo de laços de sangue (linha reta e colateral). Casamentos entre famílias diferentes aparecem como alianças. Há 5.324 famílias com três pessoas ou mais. A maior, em número de verbetados, é a família Vargas, com 24 verbetados entre 104 pessoas. A família com mais gerações de verbetados é a Andrada: 6 gerações, com verbetados nascidos entre 1862 e 1956. A pessoa com mais parentes registrados é Osvaldo Euclides de Sousa Aranha, com 19 laços. A distribuição do tamanho das famílias tem cauda longa (Figura 4): poucas famílias grandes e milhares de famílias de três ou quatro pessoas, em geral o verbetado e os pais.

Figura 4: Tamanho das famílias (componentes de sangue), por posto, em escala logarítmica.

Do ponto de vista substantivo, 25,5% dos verbetados têm pelo menos um parente que também tem verbete no DHBB. A proporção é maior entre as mulheres (37,1%, em 280 verbetadas) do que entre os homens (25,0%, em 6.306 verbetados). Trata-se de um resultado consistente com a ideia de que laços familiares são um caminho de entrada mais frequente para mulheres na elite política, embora a diferença também possa refletir a forma como os verbetes sobre mulheres são escritos. Ao longo das coortes de nascimento (Figura 5), a proporção cai de cerca de 29% entre os nascidos na década de 1880 para cerca de 20% entre os nascidos nas décadas de 1950 e 1960, e volta a subir nas coortes mais recentes. A leitura dessas coortes pede cautela, porque o DHBB cobre de modo seletivo as gerações mais novas, e um político jovem tem mais chances de ter o pai ou o avô já verbetado.

Figura 5: Proporção de verbetados com pelo menos um parente verbetado, por década de nascimento.

A análise não tem pretensão causal e assume apenas um caráter exploratório. A rede é, antes de tudo, uma fonte para pesquisas que queiram testar hipóteses sobre dinastias políticas com dados brasileiros.

8 Visualização

A rede está disponível em um site estático, sem servidor, publicado no GitHub Pages. A página inicial apresenta o projeto e algumas histórias tiradas dos dados. O explorador permite buscar uma pessoa e ver a sua rede de parentes a um ou dois passos de distância, com expansão sob demanda (Figura 6).

O desenho segue as convenções de genealogia. Quadrados representam homens e círculos, mulheres, e formas preenchidas indicam pessoas com verbete no DHBB. As gerações ficam em camadas, com os mais velhos acima, em um layout no estilo de Sugiyama et al. (1981): a geração de cada pessoa é calculada primeiro pelos laços verticais (pais, filhos, avós) e depois pelos de mesma geração, a ordem dentro de cada camada reduz cruzamentos pelo método do baricentro, e cônjuges ficam lado a lado, com os irmãos de cada um nas pontas. As cores distinguem três grupos (sangue, casamento e afinidade), com uma paleta validada para daltonismo, e casamentos também são tracejados. O painel lateral lista os parentes da pessoa selecionada com o trecho do verbete que comprova cada laço e o verbete de onde ele saiu. A renderização usa Cytoscape.js (Franz et al. 2016).

Figura 6: O explorador: a rede de Ernâni Amaral Peixoto, com os pais acima, a esposa Alzira Vargas e os irmãos de cada um na mesma camada, e a filha e o genro abaixo. O painel mostra a evidência de cada laço.

9 Limitações

A rede só enxerga o que os verbetes dizem. O DHBB privilegia a elite política pós-1930 e trata as famílias de modo desigual: alguns verbetes detalham avós e primos, outros não citam nem os pais. A ausência de uma ligação, portanto, não significa ausência de parentesco. A resolução de entidades segue uma estratégia conservadora, que protege a precisão da rede, mas subestima o tamanho das famílias.

Do ponto de vista dos modelos, a extração não é determinística: agentes não permitem fixar a temperatura, e duas leituras do mesmo lote divergem em casos de fronteira (a concordância entre rodadas foi de 0,987 em F1). A validação usa modelos como referência. É verdade que a referência foi produzida com instruções diferentes, a partir do texto integral, e que as divergências foram adjudicadas por um terceiro agente; no entanto, erros comuns aos modelos poderiam passar despercebidos, e a auditoria das concordâncias só estima sua frequência. Uma auditoria humana de uma subamostra seria o próximo passo natural.

10 Reprodutibilidade e custo

Todo o código, as instruções dos agentes (versionadas), os lotes de entrada, as saídas brutas dos agentes, as anotações de referência e os vereditos de adjudicação estão no repositório do projeto. O corpus é regenerável a partir do commit registrado do repositório cpdoc/dhbb e dos verbetes baixados do site. As etapas são numeradas (01_coletar.py a 08_artigo.py) e cada uma grava a sua saída em disco, de modo que a resolução de entidades, as métricas, o site e este texto podem ser refeitos sem nenhuma chamada a modelos.

O custo é medido em tokens processados pelos agentes. Ao todo, os subagentes processaram 30,5 milhões de tokens: 25,0 milhões com o modelo Sonnet e 5,6 milhões com o modelo Opus, sem contar o agente coordenador. A rodada completa de extração custou 17,1 milhões, cerca de 2,4 mil tokens por verbete. A primeira tentativa, com esforço alto de raciocínio, consumiu cerca de 5,5 milhões em apenas sete lotes, o que mostra que o nível de esforço é um parâmetro de custo de primeira ordem nesse tipo de tarefa.

11 Considerações finais

Este trabalho mostrou que agentes de modelos de linguagem extraem laços de parentesco de verbetes biográficos com precisão e revocação próximas das de uma leitura independente do texto integral, feita por outro modelo, desde que três condições estejam presentes: instruções restritivas, que só aceitam o que o texto afirma; evidência literal verificável para cada laço; e uma validação independente, com adjudicação das divergências. O filtro de parágrafos reduziu o texto lido a 11% do total sem custo mensurável de revocação, o que torna a empreitada viável para dicionários inteiros.

A etapa mais delicada foi a identificação das pessoas. Em elites em que nomes passam de avô para neto, a semelhança de nomes não basta, e regras genealógicas (gerações, datas e o tipo de laço com pessoas em comum) foram necessárias para evitar fusões erradas, como a do pai e do filho caçula de Getúlio Vargas, que chegaram a virar uma pessoa só em versões iniciais.

Do ponto de vista substantivo, a rede indica que cerca de um quarto dos verbetados do DHBB tem um parente também verbetado, com proporção maior entre as mulheres. Uma agenda de pesquisa natural é cruzar a rede com dados eleitorais e de carreira (mandatos, partidos, estados), para estimar a vantagem de pertencer a uma família política no Brasil, e estender o método a outros dicionários biográficos, como o de políticos da Primeira República.

Referências

Abreu, Alzira Alves de, Israel Beloch, Fernando Lattman-Weltman, e Sérgio Tadeu de Niemeyer Lamarão, org. 2001. Dicionário Histórico-Biográfico Brasileiro pós-1930. 2º ed. Editora FGV; CPDOC.
Christen, Peter. 2012. Data Matching: Concepts and Techniques for Record Linkage, Entity Resolution, and Duplicate Detection. Springer.
Dal Bó, Ernesto, Pedro Dal Bó, e Jason Snyder. 2009. “Political Dynasties”. The Review of Economic Studies 76 (1): 115–42.
FGV CPDOC. 2024. DHBB: Dicionário Histórico-Biográfico Brasileiro. Repositório GitHub.
Franz, Max, Christian T. Lopes, Gerardo Huck, Yue Dong, Onur Sumer, e Gary D. Bader. 2016. “Cytoscape.js: A Graph Theory Library for Visualisation and Analysis”. Bioinformatics 32 (2): 309–11.
Lamarca, Felipe. 2024. Extração de parentescos do Dicionário Histórico-Biográfico Brasileiro. Repositório GitHub.
Querubin, Pablo. 2016. “Family and Politics: Dynastic Persistence in the Philippines”. Quarterly Journal of Political Science 11 (2): 151–81.
Sugiyama, Kozo, Shojiro Tagawa, e Mitsuhiko Toda. 1981. “Methods for Visual Understanding of Hierarchical System Structures”. IEEE Transactions on Systems, Man, and Cybernetics 11 (2): 109–25.