Café con IA

Speak to Window: así dicta y responde por ti Gemini viendo tu pantalla

Cómo activar la nueva función de Gemini que transcribe tu voz y escribe con el contexto de lo que ves en pantalla

Speak to Window: así dicta y responde por ti Gemini viendo tu pantalla Café con IA

Si sigues escribiendo a mano cada email, cada nota y cada lista de la compra, estás perdiendo el tiempo. Llevamos años con apps de dictado por voz, pero Google acaba de meter una función en Gemini que va un paso más allá.

Se llama Speak to Window y no se limita a transcribir lo que dices. También ve lo que tienes en la pantalla y responde con ese contexto, algo que ninguna de las apps de dictado que conozco hacía hasta ahora.

Llevo varios días probándola y aquí te explico cómo activarla y 5 casos de uso reales que le he sacado: dictar y corregir texto, responder emails leyendo el mensaje original, resumir PDFs en lenguaje sencillo, leer webs enteras y generar prompts a partir de lo que ves en pantalla.

Qué la hace diferente de Whisper Flow o Mac Whisper

Yo mismo uso una app de dictado que os enseñaré pronto (Typeless), y hay otras muy conocidas como Mac Whisper o Whisper Flow. Todas hacen lo mismo: transcriben tu voz en texto. Pero se quedan ahí.

Speak to Window, además de transcribir, ve lo que tienes en pantalla y puede leerlo, entenderlo y usarlo como contexto para escribir la respuesta. Esa es la diferencia real: no solo pasa tu voz a texto, sino que sabe de qué estás hablando.


Cómo activarla paso a paso

Por ahora Speak to Window solo funciona en la app de Gemini para Mac. Google ya ha confirmado que llegará a Windows en las próximas semanas, así que si usas Windows, esto te sirve igual para cuando esté disponible.

Tiene que ser desde la aplicación, no desde la web de Gemini, porque necesita permisos de micrófono y de compartir pantalla que el navegador no puede darte.

  1. Descarga la app de Gemini para Mac e inicia sesión.

  2. Acepta los permisos que te pide: acceso al micrófono y a compartir pantalla, entre otros.

  3. Ve a Configuración (Settings) y busca la opción Speak to Window.

  4. Elige cómo quieres activar el dictado: mantener pulsada una tecla mientras hablas, o pulsar una vez para empezar y otra para terminar. Yo elegí la opción personalizada (custom) y puse mi propia combinación.

  5. Activa el 'uso de razonamiento' (reasoning of use), la opción que permite que el dictado corrija errores y use el contexto de la pantalla.

Si tu Mac está en español, la app te aparecerá directamente en español. A mí me sale en inglés porque tengo el sistema operativo en inglés, pero el funcionamiento es idéntico.


Caso 1: dictado normal, con corrección de errores incluida

El uso más básico es el que ya conoces de cualquier app de dictado: hablas y se convierte en texto, en un Word, en Notas, en Gemini o en cualquier sitio donde puedas escribir.

Pero aquí está el detalle bueno: si te equivocas, tartamudeas o rectificas a media frase, Gemini lo detecta y lo limpia. Le dicté un email pidiendo un informe sobre camisetas, luego me corregí a mitad de frase diciendo que en realidad quería hablar de calcetines y no de pantalones, y reescribió el email entero ya corregido, sin dejar rastro del error.

Además detecta el formato según dónde estés escribiendo. Si le dictas una lista de la compra (leche, pan, atún, huevos y harina), la pone automáticamente en formato de lista. Si es un email, respeta el formato de email. No tienes que decirle nada de esto, lo hace solo.


Caso 2: responder emails leyendo el mensaje original

Aquí es donde se nota la diferencia real con el resto de apps de dictado. Con la ventana de respuesta a un email abierta, activé Speak to Window y le dije que había recibido una propuesta de colaboración, que preguntara por los plazos de entrega y los precios.

No transcribió literalmente lo que dije: leyó todo el email original en pantalla y escribió una respuesta completa, dirigiéndose por su nombre a la persona que había escrito (Lilian), algo que yo no le había dicho en ningún momento. Eso demuestra que estaba leyendo de verdad el contenido de la pantalla, no solo mi voz.

Una vez te acostumbras a pulsar una tecla y hablar, difícilmente vuelves a escribir a mano: corrige los errores y formatea según sea un email, una lista o un documento.


Caso 3: resumir PDFs complicados en lenguaje sencillo

Con un PDF de la Constitución Española abierto en pantalla, le pedí que me resumiera lo que decía entre las páginas 10 y 20 porque la terminología me resultaba complicada.

El resultado no fue copiar el texto de esas páginas: lo reescribió en lenguaje claro y sencillo, explicando página por página de qué trataba cada bloque. Esto funciona igual con una factura de la luz en JPG, un libro o cualquier documento que tengas abierto.


Caso 4: leer webs enteras con todos sus datos

Gemini no se limita a documentos: también lee páginas web completas. Entré en Will It Run AI, una web que te dice qué modelos de IA puedes correr en local según tu ordenador, llena de columnas con parámetros, VRAM, velocidad, etc.

Le pedí que me explicara qué significaba toda esa información porque no entendía nada, y me devolvió una explicación completa de cada columna: qué es VRAM, qué son los parámetros, qué indica el contexto. Todo sin copiar y pegar nada, solo dictando la pregunta con la web abierta.


Caso 5: generar prompts a partir de lo que ves en pantalla

Este es el que más me ha sorprendido. Estando en Artificial Analysis AI, una web de benchmarks que compara modelos de IA en audio, vídeo, imagen y texto, le pedí que me generara un prompt completo para crear un gráfico visual con esos datos usando la función Canvas de Gemini.

Gemini leyó la web, redactó el prompt y lo pegó directamente en el cuadro de Canvas. El resultado no fue una imagen estática: fue una infografía interactiva, con los modelos organizados por top 10, filtrable solo por Anthropic o solo por OpenAI, con buscador de modelos y orientación vertical u horizontal. Básicamente creó una web funcional a partir de una pregunta hablada.


Lo que te llevas

  • Speak to Window está disponible ya en la app de Gemini para Mac; llega a Windows en las próximas semanas.

  • Solo funciona desde la app, no desde la web, porque necesita permisos de micrófono y de compartir pantalla.

  • Corrige errores y rectificaciones sobre la marcha, y adapta el formato (lista, email, documento) sin que se lo pidas.

  • Su diferencia real frente a Mac Whisper o Whisper Flow es que lee el contenido de la pantalla: PDFs, webs, emails completos.

  • Puedes usarlo para generar prompts completos a partir de lo que ves, como un gráfico interactivo hecho con Canvas de Gemini.


Todos los vídeos, en mi canal de YouTube.

Suscríbete a "Café con IA" para recibir actualizaciones directamente en tu correo
Café con IA

Suscríbete a Café con IA para reaccionar

Suscribirse

Comentarios

Aún no hay comentarios. ¡Sé el primero en comentar!

Suscríbete a Café con IA para recibir actualizaciones directamente en tu correo