En resumen: OpenMontage es un sistema de producción de video agéntico de código abierto que se ejecuta dentro de su asistente de codificación de IA existente. Once flujos de producción, más de 100 herramientas, más de 60 integraciones con proveedores y más de 700 archivos de habilidades y conocimientos toman una solicitud desde la investigación hasta el guion, los activos, la edición y el renderizado. 55.047 estrellas al 1 de septiembre de 2026. Dos cosas que debe saber antes de empezar: es AGPL-3.0, no MIT como la mayoría en esta categoría, y es uno de los sistemas de agentes con más dependencia de API que puede instalar, con dinero real asociado a cada reintento.
Este es un análisis en profundidad de una herramienta de nuestro resumen de cinco herramientas de agentes de IA de código abierto que vale la pena instalar en 2026.
La mayoría de las herramientas de "video con IA" le dan un clip a partir de un solo prompt. OpenMontage le da a su agente de codificación un departamento de producción: una etapa de investigación, una etapa de guion, un plan de escena, generación de activos, una edición y una composición final, con puntos de aprobación humana intermedios.
Es el proyecto más inusual en la ola actual de herramientas de agentes, y el más instructivo, porque es aquel en el que el trabajo del agente tiene un costo en dólares asociado a cada paso y el diseño tiene que tomar eso en serio.
Qué hace realmente
Abres el repositorio en Claude Code, Cursor, Copilot, Windsurf o Codex y describes lo que quieres:
Haz un video explicativo animado de 60 segundos sobre cómo aprenden las redes neuronales
El agente luego ejecuta un flujo de trabajo fijo:
investigación -> propuesta -> guion -> plan_de_escena -> activos -> edición -> composición
Cada etapa tiene una habilidad de director, que es un archivo de instrucciones en markdown que enseña al agente cómo ejecutar esa etapa específica. El agente lee la habilidad, usa las herramientas, revisa su propia salida, guarda puntos de control del estado y se detiene para la aprobación humana en los puntos de decisión creativa.

La etapa de investigación es la parte que lo diferencia de los "juguetes" de prompt-a-video. Antes de escribir una sola palabra del guion, el agente realiza entre 15 y 25 búsquedas web en YouTube, Reddit, Hacker News, sitios de noticias y fuentes académicas, y luego produce un informe de investigación estructurado con citas. El guion se basa en lo que encontró en lugar de en lo que el modelo recuerda.
Los flujos de trabajo
La tabla del README enumera once flujos de trabajo de producción completos, aunque la descripción del repositorio anuncia doce:
| Flujo de trabajo | Produce | Bueno para |
|---|---|---|
| Explicativo Animado | Investigación, narración, visuales, música | Tutoriales, desgloses de temas |
| Animación | Gráficos en movimiento, tipografía cinética | Redes sociales, demostraciones de productos |
| Avatar Portavoz | Video con presentador | Comunicaciones corporativas, formación |
| Cinemático | Tráilers, avances, ediciones de ambiente | Películas de marca |
| Fábrica de Clips | Clips cortos clasificados de una fuente larga | Reutilización de contenido largo |
| Montaje Documental | Edición temática a partir de metraje gratuito indexado | Ensayos en video, metraje B-roll real |
| Híbrido | Metraje fuente más visuales generados | Mejora de metraje existente |
| Localización y Doblaje | Subtítulos, doblaje, traducción | Distribución multilingüe |
| Reutilización de Podcast | Momentos destacados en video | Marketing de podcasts |
| Demostración de Pantalla | Grabaciones de pantalla pulidas | Demostraciones de productos, documentación |
| Persona Hablando | Video de orador basado en metraje | Presentaciones, entrevistas |
El Montaje Documental es el técnicamente interesante. En lugar de animar imágenes estáticas, construye un corpus indexado por CLIP a partir de material de archivo gratuito y archivos abiertos, incluyendo Pexels, Archive.org, NASA, Wikimedia y Unsplash, recupera clips de movimiento reales mediante coincidencia semántica y los corta en una línea de tiempo real. Eso le da un video terminado a partir de metraje real sin API de generación de pago involucradas, lo cual es una afirmación materialmente diferente de la mayoría de los paquetes de video de IA gratuitos.
Para los equipos que publican contenido para desarrolladores, Demostración de Pantalla y Fábrica de Clips son los que se amortizan más rápido. Se lanza una versión, existe el registro de cambios, y convertirlo en un tutorial generalmente requiere una persona con habilidades de edición y una tarde libre.
Backlot, y por qué importan los puntos de aprobación
El chat te dice lo que dijo el agente. Backlot es un tablero local que muestra lo que está haciendo la producción: etapas que se iluminan, el guion apareciendo como una página de guion, tarjetas de escena mientras se generan los activos, y cada decisión del proveedor y dólar gastado visible.
python -m backlot open # biblioteca de cada proyecto en disco
python -m backlot open <project-id> # tablero en vivo de una producción
python scripts/backlot_simulate_run.py # ver una ejecución simulada primero
El tablero se abre automáticamente cuando comienza una producción, y deriva todo de los archivos que el flujo de trabajo ya escribe, en lugar de necesitar informes separados.
La parte importante es que el storyboard es una puerta real. La generación de activos se pausa en una hoja de contacto escena por escena que muestra tomas, prompts, costo por activo y puntuaciones de calidad, para que apruebes los elementos visuales antes del renderizado, en lugar de después de haber gastado el dinero. Los puntos de aprobación del guion se mantienen hasta que respondes. Cuando una ejecución termina, la reproducción recorre toda la producción desde sus marcas de tiempo.
Los puntos de aprobación antes del gasto son el diseño correcto para cualquier sistema de agentes con un presupuesto asociado, y la mayoría de las herramientas de agentes no los tienen. Una tarea que no puede comenzar hasta que un humano lo diga es la propiedad de seguridad más útil en toda esta categoría.
Empezar con un video de referencia
La otra idea realmente buena aquí: puedes darle algo que te guste en lugar de escribir el prompt perfecto.
Pega un video de YouTube, Short, Reel, TikTok o un clip local y el agente analiza la transcripción, el ritmo, las escenas, los fotogramas clave y el estilo, luego regresa con dos o tres conceptos diferenciados, un camino de herramientas honesto, estimaciones de costos y una muestra antes de que comience la producción completa.
Aquí tienes un YouTube Short que me encanta. Hazme algo similar, pero sobre
el versionado de API.
Lo que regresa nombra lo que mantiene de la referencia, lo que cambia, cuánto costará con la duración deseada y cómo se verá con los proveedores que tienes configurados actualmente. Costo antes del compromiso, que es el tema de todo el proyecto.
Instalación
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup
Los requisitos previos son Python 3.10 o posterior, FFmpeg, Node.js 18 o posterior, y un asistente de codificación de IA que pueda leer archivos y ejecutar código. Luego, abre el proyecto en tu agente y describe lo que quieres.
La configuración del proveedor es opcional e incremental. Cada capacidad es compatible con alternativas locales de código abierto junto con API de pago, y un selector puntuado clasifica a los proveedores según siete dimensiones: adecuación a la tarea, calidad de la salida, control, fiabilidad, eficiencia de costos, latencia y continuidad, luego elige una coincidencia. No estás atado a un proveedor, y puedes ejecutar una cantidad significativa de esto sin nada de pago configurado.
A escala: el propio video de demostración del proyecto, siete mundos generados utilizando tres modelos de imagen y cuatro modelos de video, reporta un costo de generación de fuente de aproximadamente $5.
Lee la licencia antes de construir sobre ella
Esto es lo que diferencia a OpenMontage de todo lo demás en esta categoría, y es fácil pasarlo por alto.
OpenMontage es AGPL-3.0. agency-agents, Agent-Reach, Orca y codebase-memory-mcp son todos MIT. La diferencia no es cosmética.
La cláusula de red de la AGPL significa que si ejecutas una versión modificada como un servicio de red, estás obligado a ofrecer el código fuente de tus modificaciones a los usuarios de ese servicio. Construir una herramienta interna sobre ella está bien. Envolverlo en un producto SaaS y cobrar por ello es una decisión legal que tu empresa debe tomar deliberadamente, no un detalle para pasar por alto en un README.
Esa es una elección legítima de los mantenedores, y es la licencia haciendo exactamente para lo que existe. Solo toma la decisión con tu equipo legal en lugar de descubrirlo durante la debida diligencia.
Lo que nadie te advierte: esto es un proyecto de integración de API
Esto es lo que realmente afecta a la gente en la segunda semana, y no es el trabajo creativo.
OpenMontage orquesta más de 60 integraciones de proveedores. Generación de video, generación de imágenes, texto a voz, música, mezcla de audio, subtítulos, mejora, análisis. Cada una de ellas es una API de terceros con su propia autenticación, cuotas, formato de error y perfil de latencia. El agente no está escribiendo un video; está ejecutando un trabajo distribuido a través de una docena de servicios de pago y uniendo los resultados.
Eso produce un conjunto específico de modos de falla que cualquier persona que haya integrado API de pago reconocerá:
- La generación de video es de larga duración y asíncrona. Envías un trabajo y consultas por un resultado que llega en minutos, no en milisegundos. Los agentes manejan esto mal por defecto, ya sea por tiempo de espera o por quedarse en un bucle. Los patrones que funcionan están en el manejo de operaciones de API de larga duración con agentes de IA.
- Un reintento ingenuo cuesta dinero real. Reintentar una solicitud de generación que ya tuvo éxito pero que agotó el tiempo de espera en la respuesta significa pagar dos veces por el mismo clip. Este es precisamente el problema que las claves de idempotencia existen para resolver, y vale la pena leer las claves de idempotencia para agentes de IA antes de dejar que un agente reintente algo que genere costos.
- Los errores de cuota y límite de velocidad deben distinguirse de las fallas reales. Un agente que trata un 429 como un 500 recurrirá a un proveedor peor cuando debería haber esperado. Esa distinción reside en el formato de error, que es el tema de cómo diseñar mensajes de error de API para agentes de IA, y el lado de la recuperación está en la recuperación de errores de agentes de IA.
- Las API de los proveedores cambian sin avisar. Un campo de respuesta se mueve, el flujo de trabajo se rompe a mitad de la producción, y te enteras por un renderizado que se ve mal en lugar de por un error. Consulta qué sucede cuando los cambios de API rompen los agentes de IA.
El proyecto se toma esto en serio, lo cual es a su favor. Hay estimación de costos antes de la ejecución, límites de gasto, umbrales de aprobación por acción, validación previa a la composición para detectar planes rotos antes de malgastar tiempo de GPU, auto-revisión obligatoria post-renderizado usando ffprobe con extracción de fotogramas y análisis de audio, y un rastro de decisiones auditable para cada elección y fallback de proveedor.
Esa es una capa de integración mejor diseñada de lo que tienen la mayoría de los servicios de producción. También es un buen argumento para tratar tus propias integraciones de proveedores con la misma disciplina, que es donde Apidog se gana su lugar en una pila como esta. Si estás añadiendo un proveedor, o envolviendo OpenMontage detrás de tu propio servicio, tener el contrato escrito como una especificación OpenAPI, simulado a partir de esa especificación para que puedas probar las ramas de falla sin pagar por llamada, y cubierto por pruebas de contrato que fallan en CI es la diferencia entre un flujo de trabajo que se degrada con elegancia y uno que quema presupuesto en reintentos. Probar una API costosa, lenta y no determinista contra un mock en lugar del servicio en vivo es el mayor ahorro de costos aquí, y Apidog genera esos mocks a partir de la especificación, incluyendo las respuestas de error. Más sobre la forma general de esto en usar tu especificación OpenAPI como herramientas de agente.
La producción es un deporte de equipo, y Backlot es local
La segunda brecha es organizacional, más que técnica.
Backlot es un buen tablero. También es un tablero local, en una máquina, para una sola producción. Eso está bien cuando estás haciendo un video para ti. El trabajo de video en una empresa no es así. Un guion necesita un revisor experto en la materia. Los visuales necesitan a alguien de la marca. Las afirmaciones necesitan a alguien que pueda confirmar que son ciertas. El corte final necesita la aprobación de quien sea el propietario del canal.
Los puntos de aprobación de OpenMontage se pausan para un humano. No tienen concepto de qué humano, no hay cola para la persona cuya aprobación estás esperando, y no hay registro posterior de quién aprobó qué. Cuando se lanza el video y alguien pregunta quién aprobó la afirmación de precios en la escena cuatro, la respuesta es una marca de tiempo en una carpeta de proyecto local.
Sharkly es la capa que soluciona esa forma, y la producción de video se mapea en ella de manera inusualmente limpia:
- La tarea es el registro. El progreso, las llamadas a herramientas y los resultados se transmiten a ella, y la salida del agente se almacena como comentarios a los que puedes responder. Los comentarios sobre el guion aterrizan en la tarea, no en el terminal de alguien, y siguen ahí dentro de tres meses.
- Un Equipo es un agente líder más otros agentes y personas, funcionando con el líder primero. Ese es literalmente el modelo de producción: un director que lee el informe, decide qué especialistas involucrar y combina sus resultados. Sharkly lo ejecuta de esa manera por diseño, en lugar de que todos los agentes comiencen a la vez.
- Una tarea en Backlog no inicia una ejecución. Puedes poner en cola un mes de trabajo de video sin gastar un céntimo, y luego liberar los elementos a medida que se aprueban. Para un flujo de trabajo donde iniciar una ejecución significa pagar a los proveedores de generación, esa puerta importa más de lo habitual.
- Un Agente es una configuración guardada. Instrucciones, entorno de ejecución, habilidades, repositorios, ambiente. Tu configuración de OpenMontage ajustada, con los proveedores en los que confías y los límites de presupuesto que elegiste, se convierte en algo reutilizable en lugar de una copia local en un portátil.
- La ejecución es "trae tu propio". Conectas una Computadora, que puede ser tu portátil, un servidor o un contenedor, y Sharkly utiliza el Runtime ya instalado en ella. El renderizado de video requiere una máquina con disco y CPU reales, y ser explícito sobre qué máquina ejecuta el trabajo es una característica aquí, no una sobrecarga.
- El trabajo del repositorio se ejecuta en un worktree separado por tarea. Dos producciones a la vez no colisionan.

La versión corta: OpenMontage automatiza la producción. No automatiza las aprobaciones, la asignación ni el registro. En un equipo, esas son las partes que realmente impiden el lanzamiento.
Quién debería instalar esto
Evaluación honesta.
Vale la pena si publicas contenido para desarrolladores regularmente y has estado pagando por la edición o prescindiendo de ella. Demostración de Pantalla, Fábrica de Clips y Localización son los flujos de trabajo con el retorno más claro. Un registro de cambios a un video tutorial, o una charla de conferencia a una docena de clips para redes sociales, paga la configuración en una semana.
Vale la pena si quieres una salida de metraje real sin API de generación de pago. El flujo de trabajo de Montaje Documental es genuinamente inusual y el enfoque de corpus de archivo gratuito funciona.
Omítelo si necesitas un video ocasionalmente. El costo de configuración, la configuración del proveedor y la curva de aprendizaje no se amortizan con tres videos al año.
Omítelo si la AGPL es un problema para cómo pretendes usarlo. Decide eso primero, no después de haber construido un flujo de trabajo sobre él.
Preguntas frecuentes
¿Necesito claves de API de pago? No. Cada capacidad es compatible con alternativas de código abierto o locales, y Montaje Documental se basa en archivos gratuitos. Los proveedores de pago te ofrecen mayor calidad y más opciones de generación. Empieza sin nada de pago configurado y añade proveedores cuando te encuentres con un obstáculo.
¿Qué asistentes de codificación funcionan? Se mencionan Claude Code, Cursor, Copilot, Windsurf y Codex. Cualquier cosa que pueda leer archivos y ejecutar código debería funcionar, ya que el flujo de trabajo es Python más archivos de habilidades en markdown.
¿Cuánto cuesta realmente un video? Depende completamente del flujo de trabajo y los proveedores. La propia demostración de siete mundos del proyecto reporta un costo de generación de aproximadamente $5. Montaje Documental utilizando archivos gratuitos se acerca a cero. El sistema estima antes de ejecutar y aplica límites de gasto, por lo que lo sabes antes de comprometerte.
¿Es la licencia AGPL un problema para mí? El uso interno, los proyectos personales y el trabajo de código abierto están bien. Ejecutar una versión modificada como un servicio para otros activa la cláusula de red y sus obligaciones de código fuente. Consulta a tu equipo legal antes de construir un producto sobre ella.
¿Puede editar mi propio metraje, o solo generar? Ambos. Persona Hablando, Híbrido, Demostración de Pantalla, Fábrica de Clips y Localización funcionan con el metraje que proporcionas. La generación es una opción, no el único modo.
¿En qué se diferencia esto de un framework de agentes? Es una biblioteca de habilidades en el mismo sentido que agency-agents, limitada a un dominio y entregada con herramientas reales. No es una infraestructura de orquestación como Strands o AgentKit. Es una biblioteca de habilidades y herramientas específicas de dominio que hace que un agente de codificación existente sea competente en la producción de video. Una capa diferente.
Conclusión
OpenMontage es lo más ambicioso en la tabla de clasificación actual de herramientas de agentes, y está mejor diseñado de lo que suele ser habitual en la categoría: puntos de aprobación antes del gasto, estimación de costos antes de la ejecución, auto-revisión después del renderizado y un rastro de decisiones auditable. Si publicas contenido para desarrolladores, los flujos de trabajo de Demostración de Pantalla y Fábrica de Clips por sí solos pueden justificar la configuración.
Ten claras dos cosas. La licencia es AGPL-3.0, lo cual es una decisión, no una nota al pie. Y debajo del trabajo creativo, esta es una integración de API grande, costosa y de larga duración, lo que significa que se aplican las disciplinas aburridas: un contrato escrito, mocks contra los que puedes probar ramas de falla sin pagar, reintentos idempotentes y manejo de errores que distingue una cuota de una interrupción. Para eso sirve Apidog. Todo lo relacionado con quién aprobó qué y cuándo, para eso sirve Sharkly.
El agente puede dirigir el video. No debería ser también el único registro de que el video fue aprobado.
