Open Data Jalisco ya es funcional: avances del buscador semántico y el agente de IA

Construir software en el papel es fácil; enfrentarlo a la realidad de la burocracia digital, estructuras inconsistentes y gigabytes de información pública es otra historia. Hace unas semanas les presenté el manifiesto de Open Data Jalisco (ODJ) como una respuesta al dolor de cabeza que significa buscar información en los portales de transparencia actuales. Hoy, el proyecto ha dejado de ser solo una idea: la versión base ya está corriendo.
El camino ha sido un reto técnico enorme, principalmente porque nunca había hecho scraping a esta escala. He tenido que sumergirme por completo en el procesamiento de datos, modelos de búsqueda semántica y Machine Learning. El resultado es un sistema que empieza a ver la luz y que demuestra que la tecnología correcta puede devolverle el poder de la información a la ciudadanía.
Lo que ya funciona: Tala, Tequila y el Artículo 8
Actualmente, ODJ ya tiene indexados los primeros bloques de datos de los municipios de Tala y Tequila, enfocándonos específicamente en el Artículo 8 (la información fundamental que, por ley, los sujetos obligados deben tener accesible y actualizada).
Para lograr que esta masa de datos sea realmente útil y no un vertedero de PDFs, refinamos el flujo de ingesta con mejoras críticas:
-
Filtros de utilidad y privacidad: Durante el proceso de indexación, implementamos reglas para verificar y excluir documentos que no aportan valor a la consulta ciudadana o que contienen datos altamente sensibles que no deben ser amplificados (por ejemplo, las declaraciones patrimoniales detalladas de los trabajadores).
-
Cambio de modelo de embeddings: Migramos el modelo de representación vectorial para mejorar la precisión y el contexto de las capturas, permitiendo que el buscador entienda mejor qué estás intentando encontrar.
-
Interfaz de usuario (UI) real: Diseñamos una interfaz funcional y limpia para que la experiencia de usuario deje de depender de la terminal y sea intuitiva para cualquiera.
Si quieres ver el buscador semántico en acción y cómo redirecciona de forma transparente a la página de la fuente oficial, puedes ver este breve test:
El Agente Inteligente: Búsquedas profundas sin prisa
Uno de los avances que más me entusiasma es el desarrollo de un agente funcional y modificable. Cualquier usuario puede levantar el proyecto de forma local, ingresar su propia API key y comenzar a conversar con los datos del municipio.
Para asegurar que el agente no se rinda ante consultas complejas que requieren cruzar información entre múltiples documentos, lo configuré con parámetros robustos: un límite de 20 iteraciones y 1,000 segundos de timeout. Es un margen amplio, sí, pero una búsqueda profunda y certera en el histórico municipal lo vale completamente.
Puedes ver cómo se comporta el agente resolviendo una consulta en este video:
La tarea abismal: Infraestructura y lo que viene
No voy a romantizar el proceso: indexar y procesar los documentos de los municipios es una tarea titánica. Hablamos de horas y horas de procesamiento local que exprimen los recursos de cualquier computadora de escritorio. El sistema ya es completamente usable por cualquiera de forma local porque está dockerizado (lo que significa que configurarlo es sumamente sencillo, incluso si no sabes programar), pero el objetivo ideal a mediano plazo es mover todo esto a una arquitectura con una API REST alojada en una VPS robusta para centralizar el buscador semántico y, eventualmente, el chat.
La Fase 2 viene con los retos más pesados:
-
Seguir indexando más municipios de Jalisco.
-
Diseñar e implementar los buckets o almacenes de datos definitivos que nos permitan versionar y preservar los documentos históricos de manera inmutable.
Una herramienta de todos, hecha por todos
ODJ nació para resolver un problema real: la ofuscación de los sistemas de transparencia tradicionales. Al estructurar y vectorizar esta información, no solo mejoramos una barra de búsqueda; estamos construyendo un framework de trabajo para auditorías ciudadanas, consultas de investigadores, material de apoyo para estudiantes o herramientas de consulta interna para la propia municipalidad.
Llevo más de un año trabajando de cerca con inteligencia artificial, pero este reto en particular me apasiona porque el impacto es directo en nuestro entorno.
Por eso, la invitación a colaborar sigue abierta para todos. No importa si no sabes escribir una sola línea de código; el proyecto necesita personas que ayuden en la investigación, en la validación de la información, en la indexación o en el testeo de la interfaz. Si eres developer, los scrapers y los parsers te están esperando.
Tanto si eres un perfil técnico como un nocoder, eres bienvenido. Puedes clonar el repositorio, revisar la UI dockerizada y empezar a auditar tu municipio en:
Porque recuerda: La política empieza desde la ciudadanía activa.