Café con IA

Gemini Notebook + Google Flow = Videos gratis

Cómo montar un motor de documentales animados estilo Vox con Gemini Notebook y Google Flow

Gemini Notebook + Google Flow = Videos gratis
Gemini Notebook + Google Flow = Videos gratis Café con IA

Hay un tipo de vídeo que lleva meses funcionando muy bien en YouTube, TikTok e Instagram: el documental explicativo con estética de collage de papel. Recortes con bordes rasgados, fotos de archivo en blanco y negro, tramas de semitono, un titular gigante en mayúsculas y una voz tranquila que te explica algo en sesenta segundos. Es el sello visual que popularizó Vox, y hasta hace poco hacía falta un equipo de motion graphics y bastantes horas de After Effects para conseguirlo.

Ya no. En este tutorial vas a montar una máquina que hace ese trabajo sola: le dices un tema, te devuelve el guion, el storyboard, los prompts de vídeo y el prompt de música. Tú solo copias, pegas y montas.

La clave está en separar bien dos herramientas. Gemini Notebook piensa. Google Flow fabrica. Si entiendes eso, el resto es mecánico.


Lo que vas a tener al final

Un cuaderno que se queda montado para siempre. Cada vez que quieras un vídeo nuevo, escribes “hola”, contestas cinco preguntas y en un minuto tienes todo el paquete de producción listo.

El resultado son clips de diez segundos, con la locución ya dentro y sincronizada, la tipografía en pantalla ya puesta, y el sonido de papel de fondo. Solo se añade la música al final.


Antes de empezar:

Cada clip consume créditos de Flow, y una pieza de sesenta segundos son seis clips. Los números concretos de créditos que da Google cambian con frecuencia según el plan y el momento, así que mira tu saldo antes de lanzar nada. Más abajo te explico cómo partir el trabajo si no te cabe de una tacada.

Por cierto, si te suena el nombre “NotebookLM” y no encuentras “Gemini Notebook”: es la misma herramienta. Google la renombró el 16 de julio de 2026 y todo sigue igual, con los mismos cuadernos, las mismas fuentes y la misma dirección. Solo cambió el nombre y el logo.


Paso 1. Crea el cuaderno

Entra en Gemini Notebook y crea un cuaderno nuevo. Ponle un nombre que reconozcas dentro de tres meses, algo como “Motor documentales Vox”.

Este cuaderno va a ser tu plantilla permanente. No lo vas a crear de nuevo cada vez.


Paso 2. Pega el motor en las Fuentes

Aquí es donde mucha gente se lía, así que vamos despacio. El texto largo que viene ahora no es lo que le vas a pedir a la IA. Son las instrucciones de cómo tiene que trabajar. Se pega una vez y no se toca más.

Haz clic en Añadir fuentes → Texto copiado. Pega el bloque completo que tienes justo debajo y dale a Insertar.

Te lo dejo en un link de Google Drive. Cópialo entero, de la primera línea a la última:

Master Prompt Vox Gemini Notebook


Paso 3. Pega la versión corta en la Personalización

El campo de personalización del chat es corto y el motor completo no cabe. No pasa nada: el motor ya vive en las Fuentes. Lo que va aquí es solo el interruptor que le dice al cuaderno que lo use.

Haz clic en Configurar cuaderno → busca donde dice Define el objetivo, el estilo o el rol de la conversación → elige Personalizado → pega esto y guarda:

Actúa según el documento “MASTER PROMPT — MOTOR DE DOCUMENTALES ANIMADOS

ESTILO VOX (MODO LOTE)” que tienes como fuente. Síguelo al pie de la letra.

En cuanto empiece la conversación, y sin que yo te lo pida, haz las 7

preguntas de la FASE 1 juntas y numeradas. No propongas ideas de vídeos.

No generes nada hasta que yo conteste.

Cuando conteste, entrega en un solo mensaje los bloques de la FASE 3:

guion y escaleta, prompt de storyboard y prompt de lote para Google Flow

siempre; el prompt de música solo si he pedido música. Aplica la MATRIZ

DE AUDIO según mis respuestas 6 y 7. Los prompts en inglés; el guion y la

locución en español de España.

Nunca entregues prompts de vídeo sueltos escena por escena: todo va

dentro del bloque de lote.

Con esto el cuaderno queda montado. Ya no vuelves a tocarlo.


Paso 4. Arranca la conversación

Escribe “hola” en el chat. Te va a responder con siete preguntas:

  1. El tema. Cuanto más concreto, mejor. “La inteligencia artificial” no sirve. “Por qué los chips de IA se fabrican casi todos en el mismo sitio” sí.

  2. El formato. Vertical 9:16 para TikTok, Reels y Shorts. Horizontal 16:9 para YouTube.

  3. La duración. De treinta segundos a tres minutos.

  4. El tono. Periodístico y sobrio, divulgativo y cercano, o tensión informativa.

  5. La voz del narrador. Masculina, femenina, u otra que describas.

  6. Con música o sin música. Si dices que no, el motor no te da el prompt de música y refuerza a cambio el diseño de sonido de papel dentro de los clips.

  7. Quién pone la voz. Si la genera el modelo, sale ya sincronizada dentro de cada clip y te ahorras el trabajo de cuadrarla. Si la pones tú, recibes los clips mudos y un guion cronometrado para grabar.

Si algo te da igual, escribe “tú decides” y lo resuelve solo.

Un consejo sobre la primera pregunta, porque es la que decide si el vídeo funciona: no des un tema, da un ángulo. Un tema es una etiqueta. Un ángulo tiene tensión, alguien a quien le pasa algo, y una respuesta que no es obvia. La diferencia entre las dos cosas es la diferencia entre un vídeo que se ve entero y uno que se abandona a los cuatro segundos.


Paso 5. Entiende lo que te devuelve

Aquí está la parte que confunde a todo el mundo la primera vez. El cuaderno te devuelve tres o cuatro bloques, según si has pedido música, y cada uno va a un sitio distinto. Dos o tres de ellos son prompts que pegarás en otras herramientas. Uno no se pega en ningún lado.

Bloque

Qué es

Dónde va

1️⃣ Guion y escaleta

La tabla con la locución, los rótulos y qué se ve en cada escena

En ningún sitio. Es para que lo leas tú. Si pones tú la voz, es también lo que vas a grabar

2️⃣ Prompt de storyboard

En inglés, genera la lámina de referencia visual

En el propio Gemini Notebook

3️⃣ Prompt de lote

En inglés, genera todos los clips de golpe

En Google Flow

4️⃣ Prompt de música

En inglés, genera la pista de fondo. Solo aparece si has pedido música

En Flow Music

La regla que te evita perderte: en Gemini Notebook pegas instrucciones, en Flow pegas resultados. El motor del paso 2 son instrucciones y por eso solo va al cuaderno. Lo que va a Flow te lo escribe el cuaderno, y cambia con cada vídeo.

Y no te saltes el bloque 1. Es el único momento del proceso en que puedes corregir gratis. Léelo entero: si el gancho es flojo o hay una cifra que no te cuadra, dilo ahora y pide que lo reescriba. Cuando llegues a Flow, cada corrección cuesta créditos.


Paso 6. Genera la lámina de storyboard

Copia el bloque 2️⃣ y, en el mismo chat del cuaderno, escribe crea esta imagen: seguido del prompt. Te va a devolver una lámina con todos los paneles numerados, uno por escena.

Si en tu país todavía no está activa esa función de generación de imágenes, hay una vía alternativa: ve a Infografía, haz clic en el triangulito para desplegar las opciones, elige Vertical, pega el prompt y dale a generar. Descarga la imagen desde los tres puntitos.

Y ahora la parte importante, la que la mayoría se salta: revisa la lámina antes de seguir. Dos cosas concretas.

Que los números de panel se lean con claridad. Todo el paso siguiente depende de que el agente de Flow sepa qué panel corresponde a qué escena. Si los números están borrosos o cortados, mezclará escenas.

Que los rótulos estén bien escritos. Los modelos de imagen y vídeo siguen fallando al dibujar texto: Google reconoce abiertamente que el renderizado exacto de texto sigue siendo un punto débil de Omni. Si en la lámina pone MAS CARO QUE NUNCE, el clip heredará la errata. Regenerar la lámina es barato. Regenerar un clip, no.


Paso 7. Genera todos los vídeos de una vez en Google Flow

Este es el paso que ahorra el trabajo de verdad.

Entra en Google Flow desde ordenador. No desde el móvil: las funciones avanzadas como la edición por lotes y el Creador de escenas solo están disponibles en la versión de escritorio.

  1. Asegúrate de tener seleccionada la opción de agente.

  2. En ajustes, comprueba que el modelo activo es Gemini Omni Flash y guarda.

  3. Sube la lámina de storyboard: el botón de + → Subir archivos multimedia → Añadir a la petición.

  4. Pega el bloque 3️⃣ entero.

  5. Envía. Se abrirá una ventana avisándote de los créditos que va a consumir. Apruébala.

El prompt de lote está construido para que el agente devuelva todos los clips numerados de una vez, en lugar de tener que ir pidiéndolos de uno en uno. Le prohíbe expresamente fundirlos en un solo vídeo, pararse después del primero o pedirte confirmación entre tomas.

Hay un detalle de diseño que quizá no salte a la vista pero que es el que sostiene todo: dentro del prompt, la locución se describe como una única grabación de estudio cortada en trozos. No como seis locuciones distintas. Esa frase es lo que hace que la voz no cambie entre el clip 2 y el clip 3, que es el fallo más feo y más difícil de arreglar después.


Paso 8. La música, aparte (si la quieres)

Si en la pregunta 6 dijiste que no, sáltate este paso entero: tus clips ya salen de Flow con la locución y el sonido de papel dentro, y la pieza está terminada. Un aviso si vas por ese camino: sin música, cualquier salto de ruido de fondo entre clips se oye mucho más. Revísalo con auriculares antes de dar el vídeo por bueno.

Si dijiste que sí, sigue leyendo.

Podría parecer más cómodo dejar que el modelo genere también la música dentro de cada clip. No lo hagas, y la razón es puramente práctica: seis clips generados por separado dan seis piezas musicales en tonalidades y tempos distintos, que cortan en seco cada diez segundos. Se nota inmediatamente y no tiene arreglo en el montaje.

Una sola pista continua por debajo de todo. Por eso el bloque 4️⃣ existe.

Dentro de Google Flow tienes el botón de Flow Music. Pega ahí el prompt y genera. También funciona en Suno o en Udio si lo prefieres. Descarga en MP3.

El prompt ya viene con la instrucción que más importa y que casi nadie pone: dejar hueco en la mezcla para la voz. Una pista con el rango medio saturado se pelea con la locución y te obliga a bajarla tanto que deja de oírse.


Paso 8 bis. Si pones tú la voz

Si en la pregunta 7 elegiste ponerla tú, tus clips salen de Flow mudos: solo con el sonido de papel. Esto es intencionado, no un fallo.

Al final de la respuesta del cuaderno tienes el guion de locución cronometrado, con el texto de cada escena en su propio bloque para copiar y pegar limpio, y un bloque final con todo el guion seguido por si prefieres generarlo de una pasada.

Grábalo con tu voz o pásalo por el TTS que uses, y luego lo sincronizas en el editor escena por escena con los timecodes. Un truco que ahorra tiempo: si una línea se te va de los diez segundos, recorta la respiración de entrada antes de tocar el vídeo.

La ventaja de este camino es que la voz nunca cambia entre clips, que es el fallo más difícil de arreglar del camino automático. La desventaja es que ya no terminas dentro de Google: necesitas CapCut o equivalente sí o sí.


Paso 9. Monta

Tienes dos caminos.

El Creador de escenas de Flow te deja ordenar los clips en una secuencia, cambiarlos de orden, recortar el principio y el final de cada uno, previsualizar todo seguido y descargar el resultado. Para el vídeo se basta solo.

Lo que no hace es mezclar audio. Si vas sin música, con eso terminas. Si llevas música, la montas fuera: CapCut, o el editor que uses. Coloca los clips por número, la música por debajo, y bájala entre doce y quince decibelios respecto a la voz. Ese es el rango en el que la música se siente sin taparte.


Control de calidad: nueve cosas que mirar

Con la locución y la tipografía generadas por el modelo, hay que revisar cosas que antes no existían. Repasa cada clip:

  • ¿Han salido clips separados, o los ha fundido en uno solo?

  • ¿Están numerados y en orden?

  • ¿El rótulo está escrito exactamente como en el guion?

  • ¿Se ha colado el número de panel de la lámina en algún encuadre?

  • ¿Hay texto o subtítulos que no pediste?

  • ¿La voz es la misma en todos los clips?

  • ¿Se oye música que no pediste?

  • ¿Se corta alguna sílaba al principio o al final?

  • ¿El papel, la textura y la paleta son idénticos entre clips?

Si algo falla, no repitas el lote entero. Relanza solo ese clip con esta plantilla, cambiando lo que está entre corchetes:

Regenerate ONE shot only: SCENE_[XX].

Keep it identical in style, typography, narrator voice and audio treatment

to the other clips already generated in this conversation. This shot must

cut seamlessly between SCENE_[XX-1] and SCENE_[XX+1].

Duration: 10 seconds. Aspect ratio: [9:16 / 16:9].

Reference: panel [XX] of the attached storyboard sheet. The panel index

circle must not appear in the video.

On-screen text — render exactly these words, nothing else: “[RÓTULO]”

Scene: [...]

Motion: [...]

Narration — speak exactly as written, same voice as the other clips:

“[locución]”

Audio: narration plus subtle paper sound design only. NO music.

Fix in this pass: [qué falló, por ejemplo: the on-screen text was

misspelled / the narrator voice was different / background music was added]


Si vas justo de créditos

Un vídeo de sesenta segundos son seis clips. Si tu plan no te da para tanto en un día, tienes dos salidas.

La buena: haz vídeos de treinta segundos. Son tres clips. Y para TikTok, Reels y Shorts, treinta segundos no es un apaño: es una duración perfectamente competitiva, muchas veces mejor que el minuto. Si vas a publicar sobre todo en vertical, ponlo como tu duración por defecto.

La otra: parte el lote en tandas. Lanza hoy las escenas 1 a 3 y mañana las 4 a 6. Funciona, pero con dos condiciones que no son negociables. La primera: el bloque GLOBAL SPEC va idéntico, palabra por palabra, en las dos tandas. Es lo que mantiene la voz, el papel y la paleta iguales entre un día y otro. La segunda: mantén la numeración original. La segunda tanda es SCENE_04, SCENE_05 y SCENE_06, no vuelvas a empezar por el uno.

Añade además una línea en la cabecera de la segunda tanda diciendo que son las tomas 4 a 6 de una secuencia de 6, y que mantenga el ritmo y la energía de las anteriores. El modelo tiende a arrancar cada tanda con más brío del que traía, y en el corte se nota.

Lo que no te recomiendo es ir saltando entre cuentas de Google para estirar el límite gratuito. Más allá de que las condiciones de uso suelen contemplar ese tipo de práctica, es la peor opción posible para el resultado: todo el diseño del lote se apoya en que el agente planifica las escenas en una sola pasada y arrastra contexto. Cambiar de cuenta rompe eso del todo.


Los cinco errores que vas a cometer la primera vez

Pegar el motor en el chat en lugar de en las Fuentes. El chat tiene memoria corta y acabará ignorándolo a mitad de conversación. Va en Fuentes, y el interruptor corto en Personalización.

Saltarte la revisión del guion. Es gratis corregir en el bloque 1 y cuesta créditos corregir en Flow. Léelo.

Dar por buena una lámina con los rótulos mal escritos. El error se propaga a todos los clips que dependan de ese panel.

Pedir clips con voz del modelo y luego intentar doblarlos. La locución de Omni va fundida dentro del clip y no se puede separar de la imagen. Si quieres tu propia voz, dilo en la pregunta 7 antes de lanzar el lote, no después.

Poner demasiado texto en pantalla. El motor limita a cuatro palabras por rótulo y a un solo elemento de texto por plano, y no es un capricho: es donde más fallan estos modelos, y además el estilo Vox funciona precisamente porque respira.


Una nota sobre el estilo

Si comparas tu primer resultado con un vídeo real de Vox, probablemente notes que el tuyo se ve demasiado limpio. Es el error clásico.

El director de arte de Vox lo explicó bien en su día: no quieres que se vea perfecto, porque entonces empieza a parecer un anuncio en lugar de una pieza editorial. Por eso el motor pide de forma explícita bordes que no encajan del todo y texturas que no están perfectamente limpias. Si tu vídeo sale impoluto, no ha salido bien. Vuelve a lanzarlo insistiendo en lo hecho a mano.


Y ahora, a producir

El montaje se hace una vez. A partir de ahí, cada vídeo son cinco preguntas y cuatro copiar-pegar.

Lo que va a marcar la diferencia entre tus vídeos y el resto no va a ser la herramienta, porque la herramienta la tiene todo el mundo. Va a ser el ángulo que elijas en la primera pregunta.

Suscríbete a "Café con IA" para recibir actualizaciones directamente en tu correo
Café con IA

Suscríbete a Café con IA para reaccionar

Suscribirse

Comentarios

Aún no hay comentarios. ¡Sé el primero en comentar!

Suscríbete a Café con IA para recibir actualizaciones directamente en tu correo