He construido un informativo económico completamente automatizado y ejecutándose en local
Llevo un tiempo desarrollando Macro Diario, un experimento para ver hasta dónde se puede llegar automatizando la producción de contenido con Python + modelos de IA.
La particularidad es que todo el procesamiento de IA se ejecuta en local, pero tampoco intento utilizar IA para absolutamente todo. Cuando una tarea se puede resolver mejor con código tradicional, la hago de forma determinista.
El pipeline actualmente hace algo parecido a esto:
Noticias → recopilación mediante RSS
LLM local → selección y análisis de noticias
LLM local → generación del guion
LLM de control → validación del contenido
Pipeline de imágenes → búsqueda + validación multimodal
TTS local → generación de la narración
Python + OpenCV → renderizado del vídeo
Selenium → publicación automática en YouTube y TikTok
Una de las partes que más trabajo me ha llevado es la selección de imágenes.
No genero las imágenes directamente con IA.
Para cada noticia, el sistema utiliza diferentes estrategias:
- Para algunas imágenes, recorta el propio titular de la noticia y lo utiliza como consulta de búsqueda.
- Para otras, un LLM ejecutándose en local genera queries más descriptivas a partir del contenido de la noticia.
- Las imágenes se buscan automáticamente.
- Posteriormente pasan por un modelo de visión local, que comprueba si realmente son relevantes para la noticia.
- Las imágenes que no cumplen los criterios se descartan.
Así tengo un pequeño pipeline de:
noticia → query → búsqueda → imágenes candidatas → visión → validación → imagen final
Otra parte curiosa es el renderizado del presentador.
En lugar de utilizar una IA de vídeo, tengo un personaje 2D y OpenCV analiza el audio para determinar cuándo debe moverse la boca.
El renderizador selecciona entre 6 sprites diferentes de boca según la señal de audio y los sincroniza con la narración.
Por tanto:
audio → análisis → sincronización → sprite → OpenCV → vídeo
Mientras que los LLM se utilizan donde realmente aportan valor:
noticias → análisis → guion → queries → control → validación
Todo el procesamiento de IA se ejecuta localmente.
Y finalmente he automatizado también la publicación mediante Selenium, de forma que el pipeline puede producir el contenido y publicarlo automáticamente en YouTube y TikTok.
Actualmente ya tengo 4 vídeos largos y 31 Shorts publicados.
El proyecto me está sirviendo como un pequeño laboratorio para experimentar con:
- Python
- LLMs locales
- agentes
- modelos de visión
- procesamiento de audio
- OpenCV
- TTS
- recuperación y validación de imágenes
- automatización
- pipelines multimodales
- Selenium
Y una de las cosas que estoy intentando mantener como principio es:
no utilizar IA simplemente porque pueda utilizarse IA.
Si una tarea es más fiable, rápida o reproducible con código tradicional, prefiero resolverla así.
El resultado final es Macro Diario, un canal de noticias económicas en español.
Si hay interés, puedo enseñar cómo está estructurado el pipeline completo y algunas de las decisiones técnicas que he tomado para hacerlo funcionar completamente en local.
¿Alguien más está montando sistemas de agentes o pipelines multimodales completamente en local?