Herramientas
Dos herramientas abiertas. Una sirve para preguntar a los datos sin programar. La otra, para construir un corpus como este.
Preguntar a los datos desde un asistente de IA
Un asistente de IA, como Claude, puede consultar los 16 corpus por usted. Escriba la pregunta con sus palabras. El asistente busca, cuenta y le devuelve cifras, pasajes y gráficos.
Lo hace con un conector abierto, parlaibero-mcp. MCP es el estándar con el que los asistentes usan herramientas externas. Funciona con Claude, ChatGPT en su aplicación de escritorio, Antigravity, OpenCode, Cursor y otros.
Instalarlo
Necesita uv, un instalador gratuito de Python. Después, en Claude Code, una línea:
claude mcp add parlaibero -s user -- uvx parlaibero-mcpPara otros programas, el LÉAME (README.md) del repositorio trae la configuración.
Los datos se descargan de Harvard Dataverse a su equipo y se consultan allí. Sus preguntas no salen de su equipo hacia nosotros. Los 16 países ocupan unos 26,6 GB; El Salvador, 98 MB.
Lo que puede pedirle
- Cuántas veces se dice una palabra o una frase, año a año, en una cámara o en varias.
- Cuándo aparece un término por primera vez en cada cámara, y quién lo dijo.
- Qué palabras distinguen a dos grupos: diputadas y diputados, dos partidos, dos periodos.
- Cuánto habla cada grupo frente a su peso en la cámara.
- Los pasajes en su contexto, para leerlos.
- La serie lista para R o Python, su gráfico y la cita de cada conjunto.
Lo que le avisa
El conector conoce los límites medidos de cada corpus y los dice. Avisa cuando un año tiene poca base, cuando quien preside domina una comparación y cuando documentos leídos en el pleno inflan un recuento.
Cuenta y busca; no interpreta. La lectura, y citar cada conjunto con su DOI y su edición, son de quien pregunta.
Ejemplos
Preguntas reales, escritas como las escribiría usted. Debajo, lo que hace el asistente y lo que devuelve.
Una cámara
«¿Cuándo se habla de vacancia presidencial en el Congreso de Perú?»
Cuenta la palabra año a año, por millón de palabras dichas.
Una serie con picos en 2017, 2018, 2020 y 2022: los años de las mociones de vacancia. Con su gráfico, listo para un artículo.
ngram_viewer«En la Cámara de Diputados de México, ¿quién habla de paridad?»
Cuenta la palabra por sexo desde 2014 y la divide por todo lo que dice cada grupo.
Las diputadas la dicen 74,8 veces por millón de palabras; los diputados, 22,3.
term_frequency«¿Qué palabras distinguen a diputadas y diputados en el Congreso de los Diputados entre 2016 y 2023?»
Compara el vocabulario de los dos grupos. Avisa de que quien preside domina la comparación, y la repite sin la presidencia.
Con la presidencia, gana el vocabulario de las votaciones: votación, votos y pausa. Sin ella, entre las primeras: mujeres, violencia, personas y igualdad.
distinctive_words
Varias cámaras
«¿Cuándo llega la palabra feminicidio, o femicidio, a cada parlamento?»
Busca las dos formas a la vez y fecha su primera aparición en cada cámara, con el turno que la contiene.
Llega a trece cámaras entre 2001 y 2018. Si se busca solo «feminicidio», Guatemala casi desaparece después de 2009: su ley dice «femicidio».
term_counter·ngram_viewer«Compara cuánto se habla de cambio climático en los parlamentos de España, Portugal y América Latina.»
Suma las formas en español y en portugués, y dibuja una línea por cámara.
Cinco cámaras tienen su máximo en 2019, el año de la cumbre del clima de Madrid.
ngram_viewer«¿Se habla más de corrupción en Argentina o en España?»
Antes de comparar, revisa la base. Avisa de que en Argentina el 54 % de las palabras está en turnos de más de diez mil, casi siempre documentos leídos.
Sin esos turnos, la tasa de Argentina en 2010 pasa de 18,6 a 31,3 por millón; la de España no cambia. La comparación honesta es la segunda.
coverage·ngram_viewer
- Costa Rica2001
- Panamá2002
- República Dominicana2002
- México2003
- Guatemala2004
- Chile2005
- Perú2007
- Colombia2008
- Uruguay2008
- Argentina2009
- Ecuador2011
- Paraguay2016
- El Salvador2018
Año del primer turno de palabra que contiene cualquiera de las dos formas, en la edición publicada de cada conjunto. Lo mide el conector.
Cada respuesta lleva la edición de los datos que usó. El asistente le puede escribir también una nota de métodos con todo lo que ha ejecutado.
Construir o reproducir un corpus
El método con el que se construyeron los 16 corpus está publicado. Son veintiuna skills —archivos de instrucciones que Claude Code sigue paso a paso— y el código que ejecutan.
Llevan un Diario de sesiones desde el PDF escaneado o el HTML hasta las 16 columnas de ParlaIbero. Reconocimiento de texto, limpieza, oradores, vinculación con el padrón y documentación, con un registro de cada decisión.
Para quién
Para investigar. Reproduzca el proceso de un país, revise una decisión de método o añada años, comisiones u otra cámara con el mismo formato.
Para un parlamento o un organismo. Convierta los Diarios de su cámara en una tabla consultable, turno por turno, sin depender de nosotros.
Pide Claude Code, Python y, para los PDF escaneados, Ollama, que reconoce el texto en su equipo. Las skills están escritas en español.
git clone https://github.com/rodrodr/parlaibero-tools.git
cd parlaibero-tools
bash install_skills.shEs el método tal como se aplicó, en su versión actual; no es una aplicación cerrada. La copia exacta del código que produjo cada edición publicada se conserva aparte.
El código es abierto, con licencia MIT. Si lo usa en un trabajo, cite el software como indica su archivo CITATION.cff y cite además el conjunto de cada país con su DOI.