Limitações e vieses¶
O mapa-da-ciencia descreve uma literatura a partir de títulos, resumos e afiliações, com modelos abertos que rodam num computador comum. Cada etapa tem limites próprios, documentados na página dela. Esta página junta os que pesam na leitura do conjunto, para a seção de limitações de um artigo que use o método.
O corpus¶
- O SciELO não é a ciência política brasileira. O piloto cobre 10 revistas do SciELO Brasil. Ficam de fora os livros, as teses, os anais de congressos, as revistas fora do SciELO e o que pesquisadores brasileiros publicam no exterior. Um tópico "em queda" no SciELO pode estar migrando para revistas estrangeiras. Veja Fontes de dados.
- As revistas pesam de forma diferente. Cada revista publica um número diferente de artigos por ano, e uma revista que muda de periodicidade ou abre um dossiê desloca as proporções do corpus inteiro. A vista Tópicos mostra os pequenos múltiplos por revista para separar o efeito de uma revista do da área.
- Só artigos. Resenhas, editoriais e erratas ficam de fora (670 registros no piloto). É uma escolha do recorte, que muda o que "a literatura" quer dizer.
- Metadados com erros. DOIs trocados, anos de publicação que não batem com o fascículo e afiliações incompletas existem nas fontes. A coleta confere o casamento entre fontes e marca as suspeitas de duplicata, mas não corrige a fonte.
Resumos, não artigos¶
- Tópicos e classificação leem só o título e o resumo. Um resumo é o que o autor escolheu destacar, no espaço de umas 200 palavras. Uma técnica de pesquisa, um período ou um recorte que o artigo deixa claro, mas o resumo não menciona, sai como "não informado".
- Idioma. Os tópicos usam o resumo em inglês de 97% dos artigos do piloto; os outros entram pelo resumo em português ou espanhol (2,2%) ou só pelo título (0,4%), marcados. A classificação lê o resumo em português. Um resumo em inglês traduzido às pressas pode não dizer o mesmo que o original. Veja Como os tópicos são construídos.
Tópicos¶
- Os tópicos dependem dos parâmetros. O número e o tamanho dos tópicos vêm do agrupamento (HDBSCAN) e dos seus parâmetros, calibrados no piloto (ADR 0007). Outra calibração daria outra granularidade: os tópicos são uma descrição útil do corpus, não categorias naturais.
- Ruído. No piloto, um terço dos documentos não entra no núcleo de nenhum tópico; 22,5% são reatribuídos por vizinhança e 11% ficam sem tópico. Os sem tópico tendem a ser os artigos mais singulares.
- Estabilidade. O ARI entre três sementes é 0,89 no piloto: os tópicos grandes são estáveis, mas fronteiras entre tópicos vizinhos mudam com a semente.
- Rótulos. Os nomes dos tópicos foram escritos por um modelo de linguagem a partir de palavras-chave e títulos representativos. Leia o tópico pelos documentos, não só pelo nome, e corrija o que precisar no
rotulos.yaml. - Tendências e comparações múltiplas. Com dezenas de tópicos testados, alguns aparecem "em alta" ou "em queda" por acaso, mesmo com o intervalo de 95%. A vista avisa disso, e a tendência é uma inclinação média no período, que não vê mudanças de direção. Veja Em alta e em queda.
Geografia¶
- Cobertura desigual no tempo. Nos primeiros anos do piloto, as afiliações vêm quase só como texto livre e mais autores ficam sem afiliação. Comparar a geografia de 2010 com a de 2024 exige olhar a cobertura por ano, que a vista mostra.
- O casamento das instituições erra pouco, mas erra. 93,9% dos vínculos do piloto foram ligados a uma instituição, com precisão de 99,8% numa amostra lida à mão. Os erros que sobram se concentram em nomes parecidos no mesmo país. Veja Geografia da produção.
- Contagem fracionária é uma escolha. Cada artigo vale 1, dividido entre autores e afiliações. A contagem inteira (cada instituição recebe 1 por artigo) favorece as instituições que publicam em equipes grandes; as duas estão no contrato.
Classificação e validação¶
- Modelos pequenos. O modelo padrão (
qwen3.5:9b) roda num notebook com 16 GB de memória. Modelos maiores concordariam mais com uma leitura humana; o preço é o hardware. A comparação entre modelos (McNemar) mede isso no seu corpus. - A evidência mostra de onde, não se está certo. O modelo cita o trecho que justifica a resposta, e a conferência diz se o trecho está mesmo no resumo (94,8% literal no piloto). Uma evidência literal com a categoria errada continua errada. Veja Classificação ancorada em evidência.
- A referência do piloto não é uma pessoa. No piloto, a amostra de 200 artigos foi codificada às cegas por outro modelo (Claude), como codificador de referência. O kappa mede a concordância com essa leitura, não com um especialista; ele varia de 0,37 (técnica de pesquisa) a 0,93 (Brasil como caso). Uma codificação humana da mesma amostra é o próximo passo, e o painel tem a vista para isso. Veja Desenho da validação.
- Uma rodada, um codebook. As métricas valem para o codebook de exemplo, como ele está. Mudar uma definição pede classificar e medir de novo.
- Variáveis fracas. Uma variável com kappa baixo (a técnica, no piloto) não deve ser usada sozinha numa análise sem revisão: leia as divergências, reescreva as definições e meça de novo (Ler kappa e PABAK).
Reprodutibilidade¶
- O mesmo projeto, com o mesmo modelo (o digest do manifesto), a mesma semente e os mesmos parâmetros, reproduz a classificação a partir do cache. Rodar do zero em outra máquina pode mudar algumas respostas: a geração com temperatura 0 é determinística no mesmo hardware, mas não garantidamente entre GPUs diferentes. O UMAP também varia entre máquinas (o
numbausa otimizações que dependem do processador), e por isso as posições no mapa não são comparadas entre máquinas, só os agrupamentos. Veja Reprodutibilidade. - As fontes mudam: a ArticleMeta e o OpenAlex corrigem registros, e uma nova coleta pode trazer outros números. As respostas brutas ficam guardadas em
brutos/, e o manifesto registra quando cada coleta foi feita.