mapa-da-ciencia¶
O mapa-da-ciencia é um observatório da literatura científica. Ele coleta milhares de artigos, começando pelo SciELO, e usa modelos de linguagem que rodam no seu próprio computador para responder a três perguntas sobre um campo de pesquisa:
- Sobre o que se escreve, e como isso muda no tempo? Os artigos viram pontos num mapa, agrupados por proximidade de assunto. Cada grupo é um tópico com nome e descrição, e dá para acompanhar como cada tópico cresce ou encolhe ano a ano.
- Como se pesquisa? Um modelo lê cada resumo e o classifica segundo um codebook escrito por você (método, recorte geográfico, subárea...). Ele sempre copia o trecho do resumo que justifica cada resposta. Você codifica uma amostra, e o sistema mede o quanto o modelo concorda com você.
- Onde se produz? O mapa das afiliações dos autores por UF, país e instituição, com contagem fracionária.
Tudo aparece num painel interativo, que pode ser publicado como site estático para acompanhar um artigo ou uma apresentação.
Versão 1.0.0
O projeto chegou à versão 1.0.0: a coleta de artigos do SciELO e do OpenAlex, os tópicos com rótulos em português escritos por um modelo local, o mapa navegável dos documentos, a evolução dos tópicos no tempo, a geografia da produção, com contagem fracionária, e a classificação dos resumos por um codebook, com a evidência de cada resposta e a validação numa amostra. Tudo também roda pela interface, com o progresso ao vivo, e o projeto vira um site estático, com figuras prontas para artigo e slides. A demo é o piloto publicado, e a abertura do site conta o que ele mostra. Veja o plano de marcos.
Por onde começar¶
- Ver funcionando. O tutorial Explorar o exemplo em 5 minutos abre o painel com dados sintéticos.
- Instalar. O guia Instalar e escolher os modelos explica o Ollama, os perfis de modelo e
mapa diagnostico. - Começar um projeto. O guia Criar um projeto mostra
mapa novo,mapa.yamle a escolha das revistas. - Entender o método. A seção Explicações cobre fontes, modelos locais, reprodutibilidade e licenças.
Princípios¶
- Modelos locais. Nenhum resumo sai da sua máquina para ser processado: embeddings e classificação rodam no Ollama. As únicas chamadas externas são as da coleta de metadados públicos.
- Rastreável. Cada classificação vem com o trecho literal que a justifica, e cada execução grava um manifesto com versões, modelos e parâmetros.
- Validado. A qualidade da classificação é medida contra codificação humana (kappa de Cohen, PABAK), e não presumida.
- Aberto. Código sob licença MIT. As decisões técnicas ficam registradas, com evidência, na seção Decisões.
Sobre¶
O projeto sucede o SciELO-Summarizer, criado no SICSS Brasil 2024. É um projeto independente, sem vínculo oficial com o SciELO, o OpenAlex ou o IBGE, cujos dados públicos ele usa.