Gemini llega al Mac como dictado: mantienes la tecla Fn y escribe en cualquier ventana

Gemini llega al Mac como dictado: mantienes la tecla Fn y escribe en cualquier ventana
Fuente: blog.google

Google ha metido a Gemini en el Mac como sistema de dictado. Mantienes pulsada la tecla Fn, hablas, y el texto aparece en la ventana que tengas delante, segun el blog de Google. Con una segunda opcion activada, Gemini ve lo que hay en pantalla y actua sobre ello.

Puntos clave

  • Se dispara manteniendo pulsada la tecla Fn, y funciona en cualquier ventana de macOS, no solo dentro de la app de Gemini.
  • Modo por defecto: dictado inteligente. Transcribe, elimina muletillas y aplica formato solo. No es transcripcion literal.
  • Modo opcional con razonamiento de Gemini activado: entiende el contexto de la pantalla y ejecuta tareas mas complejas.
  • Con razonamiento puede resumir archivos, imagenes y documentos, redactar y reescribir texto seleccionado, y generar o editar imagenes hablando.
  • Arranca en ingles, con mas idiomas anunciados sin fecha. Despliegue global para todos los usuarios de la app de Gemini para macOS. Se descarga en gemini.google/mac.

La diferencia entre transcribir y dictar bien

El detalle que hace util esta funcion es que el modo por defecto no transcribe literalmente. Quita los "eh", los "o sea", las frases que empiezas y abandonas, y aplica formato.

Cualquiera que haya usado dictado nativo sabe por que eso importa. El dictado clasico te devuelve exactamente lo que dijiste, incluidas las dudas, y limpiar ese texto cuesta casi el mismo tiempo que habria costado escribirlo. Un modelo que reconstruye la intencion en lugar de transcribir el sonido cambia el resultado: hablas mal, sale bien escrito.

Es la misma logica que hace que los nuevos modelos de transcripcion de OpenAI presuman de comportarse con ruido y acentos. El objetivo ya no es reconocer sonidos, es entender lo que la persona queria decir.

El segundo modo es otra cosa

Activar el razonamiento de Gemini convierte el atajo en algo distinto de un dictado. El modelo ve el contexto de la pantalla, y con eso puede resumir un documento que tengas abierto, reescribir el parrafo que has seleccionado o generar una imagen sin que salgas de la aplicacion en la que estas.

Eso es un agente de escritorio con una puerta de entrada muy comoda, y encaja en el movimiento que llevan todos esta semana. Perplexity acaba de llevar su agente Personal Computer a Windows, donde toca archivos locales y Microsoft 365. Google entra por el atajo de teclado en lugar de por una aplicacion nueva, que es una via menos vistosa y probablemente mas efectiva.

La razon es la friccion. Un agente que vive en su propia ventana requiere que cambies de contexto para usarlo. Un agente que se invoca con una tecla que ya tienes debajo del dedo no requiere nada.

Lo que falta

Google no dice que modelo lo mueve, y eso importa para latencia y para coste. Tampoco hay fechas para el espanol, lo que en la practica deja la funcion fuera de la mayoria de equipos en Espana hasta que llegue.

Por qué importa

Este es de los cambios que no parecen estrategicos y acaban moviendo mas horas que un proyecto grande. La entrada de texto por voz bien resuelta es entre tres y cuatro veces mas rapida que teclear para cualquiera que no sea mecanografo. En un dia con muchos correos, notas de reunion y mensajes internos, eso son horas reales.

Lo que conviene medir antes de decidir nada es donde escribe tu equipo. Si el volumen esta en correo y documentos sueltos, esto tiene sentido en cuanto llegue el espanol. Si el volumen esta dentro de un CRM o un ERP con campos estructurados, un atajo de dictado global aporta menos que una integracion en la herramienta.

Y una nota sobre el modo con razonamiento: al activarlo le das a Gemini visibilidad de lo que tienes en pantalla. En un portatil con datos de cliente delante, esa decision no es de productividad, es de politica de datos, y toca revisarla antes de desplegarlo al equipo y no despues.


Relacionado