Pular para conteúdo

Configuração do projeto (mapa.yaml)

Cada projeto tem um mapa.yaml na raiz da pasta. mapa novo cria um já preenchido e comentado. Campos desconhecidos são recusados, para pegar erros de digitação. Veja também o guia Criar um projeto.

ConfigProjeto

Conteúdo do mapa.yaml.

Campo Tipo Padrão Descrição
versao_config 1 1 Versão do formato deste arquivo.
nome texto obrigatório Identificador em minúsculas, sem acento.
titulo texto obrigatório Título exibido no painel e no site publicado.
descricao texto "" Um parágrafo sobre o recorte e o objetivo do projeto.
fontes Fontes obrigatório De onde vêm os artigos. Pode combinar mais de uma fonte.
recorte Recorte obrigatório Período e idiomas do corpus.
modelos Modelos valores padrão da seção Modelos locais de cada papel. mapa novo preenche conforme a memória da máquina.
topicos ConfigTopicos valores padrão da seção Parâmetros do agrupamento em tópicos. Os padrões vêm da calibração no piloto (ADR 0007); para outro
validacao Validacao valores padrão da seção Amostra de resumos codificados por pessoas para medir a qualidade da classificação.

Fontes

De onde vêm os artigos. Pode combinar mais de uma fonte.

Campo Tipo Padrão Descrição
scielo FonteScielo ou vazio vazio Coleta pela ArticleMeta do SciELO, revista a revista.
openalex FonteOpenAlex valores padrão da seção Enriquecimento (citações, licença) e busca por termo no OpenAlex.
importar lista de caminho vazio Arquivos RIS, CSV ou BibTeX exportados do search.scielo.org, ou listas de DOIs (.txt), relativos à pasta do projeto. Os da pasta importados/ entram sempre, sem precisar listar aqui.

FonteScielo

Coleta pela ArticleMeta do SciELO, revista a revista.

Campo Tipo Padrão Descrição
colecao texto "scl" Coleção do SciELO (scl = Brasil).
revistas lista de texto vazio ISSNs das revistas; vazio num projeto só com artigos importados.
tipos lista de texto ["research-article", "review-article"] Tipos de documento incluídos (document_type da ArticleMeta).

FonteOpenAlex

Enriquecimento (citações, licença) e busca por termo no OpenAlex.

Campo Tipo Padrão Descrição
enriquecer sim/não true Casar cada artigo com o OpenAlex para obter citações e licença.
consulta texto ou vazio vazio Busca por termo no título e no resumo, via OpenAlex. Com revistas no recorte, busca só nelas; sem revistas, em todo o SciELO. O corpus passa a ser os resultados da busca, e não as revistas inteiras.

Recorte

Período e idiomas do corpus.

Campo Tipo Padrão Descrição
anos par de inteiro e inteiro obrigatório Primeiro e último ano de publicação, inclusive.
idioma_analise "pt" \ "en" \ "es"
idioma_exibicao "pt" \ "en" \ "es"

Modelos

Modelos locais de cada papel. mapa novo preenche conforme a memória da máquina.

Campo Tipo Padrão Descrição
embeddings ModeloEmbeddings valores padrão da seção Modelo que transforma título e resumo em vetores (base dos tópicos e do mapa).
classificacao ModeloLLM valores padrão da seção Modelo de linguagem usado para classificar resumos ou nomear tópicos.
rotulos ModeloLLM valores padrão da seção Modelo de linguagem usado para classificar resumos ou nomear tópicos.

ModeloEmbeddings

Modelo que transforma título e resumo em vetores (base dos tópicos e do mapa).

Campo Tipo Padrão Descrição
provedor "ollama" "ollama" No MVP, só o Ollama local.
modelo texto "qwen3-embedding:0.6b" Nome do modelo no Ollama (ver ADR 0004).
num_ctx inteiro 2048 Contexto em tokens. Título e resumo cabem com folga em 2.048; o que passar é truncado. Contextos maiores ocupam mais memória.
lote inteiro 32 Textos por requisição ao Ollama.

ModeloLLM

Modelo de linguagem usado para classificar resumos ou nomear tópicos.

Campo Tipo Padrão Descrição
provedor "ollama" "ollama" No MVP, só o Ollama local.
modelo texto "qwen3.5:9b" Nome do modelo no Ollama (ver mapa diagnostico).
num_ctx inteiro 8192 Janela de contexto pedida ao Ollama.
temperatura número 0.0 0 = respostas determinísticas (recomendado).
pensar sim/não false Liga o modo de raciocínio do modelo (mais lento).
concorrencia inteiro 1 Chamadas simultâneas ao Ollama.
semente inteiro 7 Semente do gerador, para resultados reprodutíveis.

ConfigTopicos

Parâmetros do agrupamento em tópicos. Os padrões vêm da calibração no piloto (ADR 0007); para outro corpus, scripts/calibrar_topicos.py refaz a grade.

Campo Tipo Padrão Descrição
vizinhos inteiro 15 Vizinhos de cada documento no grafo do UMAP: mais vizinhos, estrutura mais global.
min_dist número 0.0 Distância mínima entre pontos no UMAP de 5 dimensões, usado no agrupamento.
min_dist_mapa número 0.1 A mesma distância no mapa de 2 dimensões: maior, pontos mais espalhados.
min_cluster_size inteiro ou vazio vazio Menor tópico, em documentos. Vazio: automático, 1 a cada 200 documentos (mínimo 10).
min_samples inteiro 5 Quão conservador é o HDBSCAN: maior, mais documentos ficam de fora dos tópicos.
votos_minimos inteiro 3 Um documento que o HDBSCAN deixou sem tópico vai para o tópico com mais vizinhos seus no núcleo, se forem pelo menos estes (entre os vizinhos mais próximos). Menos que isso, fica sem tópico.
selecao "eom" \ "leaf" "leaf"
macrotemas inteiro 7 Quantos macrotemas, no máximo (grupos de tópicos próximos, com cores bem distintas). Com poucos tópicos são menos, para que cada macrotema reúna em média ao menos 3 tópicos.
sementes lista de inteiro [42, 7, 2024] A primeira gera os tópicos; as demais medem a estabilidade (ARI entre as execuções).

Validacao

Amostra de resumos codificados por pessoas para medir a qualidade da classificação.

Campo Tipo Padrão Descrição
n inteiro 200 Tamanho da amostra para codificação humana.
estratificar_por "topico" \ "ano" \ "revista"
semente inteiro 7 Semente do sorteio da amostra.
codificadores lista de texto vazio Nomes de quem vai codificar.