Ir para o conteúdo
ParlaIberoOs debates do plenário, fala por fala

Ferramentas

Duas ferramentas abertas. Uma serve para fazer perguntas aos dados sem programar. A outra, para construir um corpus como este.

Perguntar aos dados a partir de um assistente de IA

Um assistente de IA, como o Claude, pode consultar os 16 corpora por você. Escreva a pergunta com suas palavras. O assistente busca, conta e devolve números, passagens e gráficos.

Faz isso com um conector aberto, o parlaibero-mcp. MCP é o padrão com que os assistentes usam ferramentas externas. Funciona com Claude, ChatGPT no aplicativo para computador, Antigravity, OpenCode, Cursor e outros.

Como instalar

Você precisa do uv, um instalador gratuito de Python. Depois, no Claude Code, uma linha:

claude mcp add parlaibero -s user -- uvx parlaibero-mcp

Para outros programas, o LEIA-ME (README.md) do repositório traz a configuração.

Ver o repositório

Os dados são baixados do Harvard Dataverse para o seu computador e consultados ali. Suas perguntas não saem do seu computador para nós. Os 16 países ocupam cerca de 26,6 GB; El Salvador, 98 MB.

O que você pode pedir

  • Quantas vezes uma palavra ou uma frase é dita, ano a ano, em uma câmara ou em várias.
  • Quando um termo aparece pela primeira vez em cada câmara, e quem o disse.
  • Quais palavras distinguem dois grupos: deputadas e deputados, dois partidos, dois períodos.
  • Quanto fala cada grupo diante do seu peso na câmara.
  • As passagens em seu contexto, para lê-las.
  • A série pronta para R ou Python, seu gráfico e a citação de cada conjunto.

Do que ele avisa

O conector conhece os limites medidos de cada corpus e os informa. Avisa quando um ano tem pouca base, quando quem preside domina uma comparação e quando documentos lidos no plenário inflam uma contagem.

Conta e busca; não interpreta. A leitura, e citar cada conjunto com seu DOI e sua edição, cabem a quem pergunta.

Exemplos

Perguntas reais, escritas como você as escreveria. Abaixo, o que o assistente faz e o que devolve.

Uma câmara

  1. “Quando se fala de vacância presidencial no plenário do Peru?”

    Conta a palavra ano a ano, por milhão de palavras ditas.

    Uma série com picos em 2017, 2018, 2020 e 2022: os anos das moções de vacância. Com seu gráfico, pronto para um artigo.

    ngram_viewer

  2. “Na Cámara de Diputados do México, quem fala de paridade (“paridad”)?”

    Conta a palavra por sexo desde 2014 e a divide por tudo o que cada grupo diz.

    As deputadas a dizem 74,8 vezes por milhão de palavras; os deputados, 22,3.

    term_frequency

  3. “Quais palavras distinguem deputadas e deputados no Congreso de los Diputados da Espanha entre 2016 e 2023?”

    Compara o vocabulário dos dois grupos. Avisa que quem preside domina a comparação e a repete sem a presidência.

    Com a presidência, vence o vocabulário das votações: votación, votos e pausa. Sem ela, entre as primeiras: mujeres, violencia, personas e igualdad.

    distinctive_words

Várias câmaras

  1. “Quando a palavra “feminicidio”, ou “femicidio”, chega a cada câmara?”

    Busca as duas formas ao mesmo tempo e data sua primeira aparição em cada câmara, com o turno de palavra que a contém.

    Chega a treze câmaras entre 2001 e 2018. Se a busca for só por “feminicidio”, a Guatemala quase desaparece depois de 2009: sua lei diz “femicidio”.

    term_counter · ngram_viewer

  2. “Compare quanto se fala de mudança climática nas câmaras da Espanha, de Portugal e da América Latina.”

    Soma as formas em espanhol e em português e desenha uma linha por câmara.

    Cinco câmaras têm seu máximo em 2019, o ano da cúpula do clima de Madri.

    ngram_viewer

  3. “Fala-se mais de corrupção na Argentina ou na Espanha?”

    Antes de comparar, revisa a base. Avisa que na Argentina 54% das palavras estão em turnos de palavra com mais de dez mil, quase sempre documentos lidos.

    Sem esses turnos de palavra, a taxa da Argentina em 2010 passa de 18,6 para 31,3 por milhão; a da Espanha não muda. A comparação honesta é a segunda.

    coverage · ngram_viewer

Primeira aparição de “feminicidio” ou “femicidio” no plenário de cada câmara
  1. Costa Rica2001
  2. Panamá2002
  3. República Dominicana2002
  4. México2003
  5. Guatemala2004
  6. Chile2005
  7. Peru2007
  8. Colômbia2008
  9. Uruguai2008
  10. Argentina2009
  11. Equador2011
  12. Paraguai2016
  13. El Salvador2018

Ano do primeiro turno de palavra que contém qualquer uma das duas formas, na edição publicada de cada conjunto. Medido pelo conector.

Cada resposta traz a edição dos dados que usou. O assistente também pode escrever uma nota de métodos com tudo o que executou.

Construir ou reproduzir um corpus

O método com que os 16 corpora foram construídos está publicado. São vinte e uma skills — arquivos de instruções que o Claude Code segue passo a passo — e o código que elas executam.

Levam um Diário de sessões do PDF escaneado ou do HTML até as 16 colunas do ParlaIbero. Reconhecimento de texto, limpeza, oradores, vinculação com o cadastro e documentação, com um registro de cada decisão.

Para quem

Para pesquisar. Reproduza o processo de um país, revise uma decisão de método ou acrescente anos, comissões ou outra câmara no mesmo formato.

Para um parlamento ou um organismo. Converta os Diários da sua câmara em uma tabela consultável, um turno de palavra por linha, sem depender de nós.

Ver o método, passo a passo

Requer Claude Code, Python e, para os PDF escaneados, Ollama, que reconhece o texto no seu computador. As skills estão escritas em espanhol.

git clone https://github.com/rodrodr/parlaibero-tools.git
cd parlaibero-tools
bash install_skills.sh

É o método tal como foi aplicado, em sua versão atual; não é um aplicativo fechado. A cópia exata do código que produziu cada edição publicada é guardada à parte.

Ver o repositório

O código é aberto, com licença MIT. Se usá-lo em um trabalho, cite o software como indica seu arquivo CITATION.cff e cite também o conjunto de cada país com seu DOI.