Saltar al contenido
ParlaIberoLos debates del pleno, turno por turno

Herramientas

Dos herramientas abiertas. Una sirve para preguntar a los datos sin programar. La otra, para construir un corpus como este.

Preguntar a los datos desde un asistente de IA

Un asistente de IA, como Claude, puede consultar los 16 corpus por usted. Escriba la pregunta con sus palabras. El asistente busca, cuenta y le devuelve cifras, pasajes y gráficos.

Lo hace con un conector abierto, parlaibero-mcp. MCP es el estándar con el que los asistentes usan herramientas externas. Funciona con Claude, ChatGPT en su aplicación de escritorio, Antigravity, OpenCode, Cursor y otros.

Instalarlo

Necesita uv, un instalador gratuito de Python. Después, en Claude Code, una línea:

claude mcp add parlaibero -s user -- uvx parlaibero-mcp

Para otros programas, el LÉAME (README.md) del repositorio trae la configuración.

Ver el repositorio

Los datos se descargan de Harvard Dataverse a su equipo y se consultan allí. Sus preguntas no salen de su equipo hacia nosotros. Los 16 países ocupan unos 26,6 GB; El Salvador, 98 MB.

Lo que puede pedirle

  • Cuántas veces se dice una palabra o una frase, año a año, en una cámara o en varias.
  • Cuándo aparece un término por primera vez en cada cámara, y quién lo dijo.
  • Qué palabras distinguen a dos grupos: diputadas y diputados, dos partidos, dos periodos.
  • Cuánto habla cada grupo frente a su peso en la cámara.
  • Los pasajes en su contexto, para leerlos.
  • La serie lista para R o Python, su gráfico y la cita de cada conjunto.

Lo que le avisa

El conector conoce los límites medidos de cada corpus y los dice. Avisa cuando un año tiene poca base, cuando quien preside domina una comparación y cuando documentos leídos en el pleno inflan un recuento.

Cuenta y busca; no interpreta. La lectura, y citar cada conjunto con su DOI y su edición, son de quien pregunta.

Ejemplos

Preguntas reales, escritas como las escribiría usted. Debajo, lo que hace el asistente y lo que devuelve.

Una cámara

  1. «¿Cuándo se habla de vacancia presidencial en el Congreso de Perú?»

    Cuenta la palabra año a año, por millón de palabras dichas.

    Una serie con picos en 2017, 2018, 2020 y 2022: los años de las mociones de vacancia. Con su gráfico, listo para un artículo.

    ngram_viewer

  2. «En la Cámara de Diputados de México, ¿quién habla de paridad?»

    Cuenta la palabra por sexo desde 2014 y la divide por todo lo que dice cada grupo.

    Las diputadas la dicen 74,8 veces por millón de palabras; los diputados, 22,3.

    term_frequency

  3. «¿Qué palabras distinguen a diputadas y diputados en el Congreso de los Diputados entre 2016 y 2023?»

    Compara el vocabulario de los dos grupos. Avisa de que quien preside domina la comparación, y la repite sin la presidencia.

    Con la presidencia, gana el vocabulario de las votaciones: votación, votos y pausa. Sin ella, entre las primeras: mujeres, violencia, personas y igualdad.

    distinctive_words

Varias cámaras

  1. «¿Cuándo llega la palabra feminicidio, o femicidio, a cada parlamento?»

    Busca las dos formas a la vez y fecha su primera aparición en cada cámara, con el turno que la contiene.

    Llega a trece cámaras entre 2001 y 2018. Si se busca solo «feminicidio», Guatemala casi desaparece después de 2009: su ley dice «femicidio».

    term_counter · ngram_viewer

  2. «Compara cuánto se habla de cambio climático en los parlamentos de España, Portugal y América Latina.»

    Suma las formas en español y en portugués, y dibuja una línea por cámara.

    Cinco cámaras tienen su máximo en 2019, el año de la cumbre del clima de Madrid.

    ngram_viewer

  3. «¿Se habla más de corrupción en Argentina o en España?»

    Antes de comparar, revisa la base. Avisa de que en Argentina el 54 % de las palabras está en turnos de más de diez mil, casi siempre documentos leídos.

    Sin esos turnos, la tasa de Argentina en 2010 pasa de 18,6 a 31,3 por millón; la de España no cambia. La comparación honesta es la segunda.

    coverage · ngram_viewer

Primera aparición de «feminicidio» o «femicidio» en el pleno de cada cámara
  1. Costa Rica2001
  2. Panamá2002
  3. República Dominicana2002
  4. México2003
  5. Guatemala2004
  6. Chile2005
  7. Perú2007
  8. Colombia2008
  9. Uruguay2008
  10. Argentina2009
  11. Ecuador2011
  12. Paraguay2016
  13. El Salvador2018

Año del primer turno de palabra que contiene cualquiera de las dos formas, en la edición publicada de cada conjunto. Lo mide el conector.

Cada respuesta lleva la edición de los datos que usó. El asistente le puede escribir también una nota de métodos con todo lo que ha ejecutado.

Construir o reproducir un corpus

El método con el que se construyeron los 16 corpus está publicado. Son veintiuna skills —archivos de instrucciones que Claude Code sigue paso a paso— y el código que ejecutan.

Llevan un Diario de sesiones desde el PDF escaneado o el HTML hasta las 16 columnas de ParlaIbero. Reconocimiento de texto, limpieza, oradores, vinculación con el padrón y documentación, con un registro de cada decisión.

Para quién

Para investigar. Reproduzca el proceso de un país, revise una decisión de método o añada años, comisiones u otra cámara con el mismo formato.

Para un parlamento o un organismo. Convierta los Diarios de su cámara en una tabla consultable, turno por turno, sin depender de nosotros.

Ver el método, paso a paso

Pide Claude Code, Python y, para los PDF escaneados, Ollama, que reconoce el texto en su equipo. Las skills están escritas en español.

git clone https://github.com/rodrodr/parlaibero-tools.git
cd parlaibero-tools
bash install_skills.sh

Es el método tal como se aplicó, en su versión actual; no es una aplicación cerrada. La copia exacta del código que produjo cada edición publicada se conserva aparte.

Ver el repositorio

El código es abierto, con licencia MIT. Si lo usa en un trabajo, cite el software como indica su archivo CITATION.cff y cite además el conjunto de cada país con su DOI.