Consejos y trucos

Saca el máximo partido a DijiFlow Dictate

Unos pocos ajustes marcan una gran diferencia en precisión, velocidad y comodidad. Estas son nuestras formas favoritas de afinar la aplicación a tu voz, tu idioma y tu equipo.

Tu micrófono importa más que cualquier ajuste de la aplicación. Un micrófono de solapa con pinza — la pequeña pinza que se sujeta a la camisa o al cuello — es una de las mejoras más baratas y de mayor impacto que puedes hacer para la precisión. Se coloca cerca de la boca, mantiene una distancia estable cuando te mueves y rechaza gran parte del ruido ambiente que confunde al micrófono integrado de un portátil.

En resumen: casi cualquier micrófono externo que se acerque más a tu boca que el integrado de tu portátil mejorará notablemente tus resultados.

El umbral de silencio es lo que le indica a DijiFlow la diferencia entre tu voz y el ruido de fondo. Ajustarlo bien para tu sala es el único cambio que evita la mayoría de las palabras perdidas y los disparos en falso. Usa la prueba de micrófono integrada para afinarlo.

  1. 1 Abre Ajustes y haz clic en Probar el micrófono.
  2. 2 Habla con normalidad y observa el medidor de nivel — mientras hablas, debería situarse aproximadamente entre el centro y la derecha del medidor.
  3. 3 Ahora quédate en silencio — el nivel debería bajar y quedarse por debajo de la línea blanca. Dónde debe situarse esa línea depende de lo ruidosa que sea tu sala.
  4. 4 Arrastra el filtro de silencio para mover la línea blanca hacia arriba o hacia abajo. Esa línea blanca es tu umbral de silencio — todo lo que quede por debajo se trata como silencio.
  5. 5 Arrastra la sensibilidad del micrófono para cambiar hasta qué altura marca tu voz en el medidor, de modo que tu habla supere la línea con holgura.

Busca una separación clara: tu voz muy por encima de la línea blanca y tu silencio muy por debajo. Vuelve a comprobarlo siempre que cambies de sala o de micrófono.

DijiFlow puede aprender las palabras que son propias de ti — nombres, jerga, marcas — y corregirlas automáticamente. Como esto ocurre después de la transcripción, afina el resultado sin sesgar nunca lo que el modelo realmente oye.

  1. 1 Abre la pestaña Vocabulario.
  2. 2 Marca los campos que se apliquen a ti, para que se carguen los paquetes de términos adecuados.
  3. 3 Añade tus propios términos personalizados — nombres de compañeros, tu empresa, nombres de productos y cualquier palabra que digas a menudo.
  4. 4 Si la aplicación sigue oyendo mal una palabra concreta, añade la ortografía correcta a tus términos personalizados y empezará a acertarla.

Piensa en tus términos personalizados como una lista viva: cada vez que algo salga mal, añade la versión correcta y dejará de ocurrir.

Los modelos más grandes son más precisos, pero son más lentos y usan más memoria — RAM en Mac, VRAM en Windows. Hay un punto óptimo para cada equipo, así que merece la pena descargar un par y probar cuál te sigue el ritmo.

  1. 1 Para el inglés, small o medium suele ser el punto óptimo. En equipos de gama más baja, base todavía funciona bien.
  2. 2 Para otros idiomas o un uso mixto/multilingüe, recomendamos encarecidamente medium o large — los modelos pequeños pierden precisión rápidamente fuera del inglés.
  3. 3 Descarga unas cuantas tallas y pruébalas con tu propia voz para ver cuál maneja tu equipo con comodidad.

Si un modelo más grande te resulta lento, baja una talla — un modelo rápido que de verdad usas es mejor que uno preciso que evitas.

Pulsar para hablar debería resultar cómodo — algo que puedas mantener sin pensar. El mejor atajo es aquel cerca del cual ya descansan tus dedos, e incluso puedes sacarlo por completo del teclado.

  1. 1 Grandes combinaciones de teclas para probar: Ctrl+Space, Alt+Space o Shift+Space (sobre todo en Windows).
  2. 2 En Mac, Cmd+Space lo ocupa Spotlight — o bien reasignas Spotlight en Ajustes del Sistema → Teclado → Funciones rápidas de teclado → Spotlight y usas Cmd+Space, o simplemente usas Shift+Space o Ctrl+Space.
  3. 3 Truco avanzado: asigna pulsar para hablar y Intro / salto de línea a los botones de atrás y adelante del ratón — por ejemplo Shift+Atrás para un salto de línea y Shift+Adelante para Intro (o asígnalos directamente en el software de tu ratón).

Configura los botones del ratón y podrás dictar casi por completo con el ratón — sin teclado. En Windows usa la utilidad del fabricante de tu ratón; en Mac, una herramienta de reasignación como las de los ratones gaming funciona bien.

El reconocimiento de voz solo es tan bueno como lo que llega al micrófono. Un ventilador soplando directamente hacia el micro, una sala abarrotada o música sonando cerca reducirán la precisión — a menudo más de lo que la gente espera.

Si el ruido es inevitable, sube tu umbral de silencio para adaptarlo al entorno, de modo que la aplicación no se dispare constantemente por el fondo — y vuelve a bajarlo cuando estés de nuevo en un sitio tranquilo.

La Optimización dinámica de memoria es el ajuste al que recurrir cuando andas justo de RAM (Mac) o VRAM (Windows). Carga y descarga modelos a medida que cambias, de forma que solo hay un modelo activo a la vez — lo que mantiene ágil un equipo más modesto.

  1. 1 Si los modelos van lentos o tu equipo está justo de memoria, activa la Optimización dinámica de memoria en Ajustes.
  2. 2 A partir de ese momento, DijiFlow mantiene en memoria solo el modelo que estás usando y descarga los demás entre cambios.

Aviso: ejecutar una transcripción de archivo Y dictado en directo a la vez irá más lento si la memoria es escasa — pero con suficiente RAM/VRAM va perfectamente fluido.

Si tu equipo tiene margen — a grandes rasgos, más de 8 GB de RAM o 12 GB de VRAM — puedes mantener dos modelos cargados y cambiar entre ellos al instante con distintos atajos de teclado. Es una de las cosas más productivas que hacen los usuarios avanzados.

  1. 1 ¿Bilingüe? Asigna el inglés a un atajo y tu otro idioma a un segundo — cambia de idioma sin tocar ningún ajuste.
  2. 2 ¿Un solo idioma? Asigna dos tamaños de modelo — uno rápido para dictado ágil y otro más preciso para cuando puedas esperar un momento.
  3. 3 Con el Q mode puedes incluso mezclar idiomas dentro de una misma frase una vez que le cojas el truco.

Esto brilla cuando escribes un correo en un idioma mientras chateas o programas en otro — todo en la misma sesión, sin líos.

En las reuniones, la precisión importa más que la velocidad, así que elige el modelo más preciso que puedas — aunque sea más lento. Ten en cuenta que la transcripción automática y la identificación de hablantes nunca son perfectas al 100 % y por sí solas quizá no capten una reunión entera de forma limpia. El truco está en entregar la transcripción a un gran modelo de IA para consolidarla en algo útil.

  1. 1 Transcribe la reunión con identificación de hablantes, usando el mejor modelo que tengas.
  2. 2 Si sabes cuántas personas hablaron, indica el número de hablantes — hace que la identificación sea mucho más precisa (consulta el consejo sobre el número de hablantes).
  3. 3 Pega la transcripción terminada en un gran modelo de IA — ChatGPT, Gemini, Claude, DeepSeek o Kimi — y usa el prompt ya preparado de abajo para obtener un resumen limpio y consolidado.
Prompt de reunión listo para pegar
Me estás ayudando a convertir una grabación de reunión en bruto en algo que realmente pueda usar.

A continuación tienes una transcripción generada automáticamente a partir de audio o vídeo, con identificación automática de los hablantes. Dos cosas que debes tener en cuenta al leerla:
- Las etiquetas de los hablantes ("Hablante 1", "Hablante 2", etc.) y alguna palabra suelta pueden ser erróneas. Cuando una etiqueta o una palabra contradiga claramente el contexto de la conversación, fíate del contexto y corrígela sin más.
- Normalmente se te da bien deducir quién es quién a partir de la propia conversación, así que infiere los nombres cuando puedas.

Opcional — si ya sé quién es quién, los asignaré aquí (si no, déjalo en blanco):
- Hablante 1 =
- Hablante 2 =
- Hablante 3 =

Por favor, lee toda la transcripción y dame un resumen claro y bien organizado con estas secciones:
1. Resumen general — dos o tres frases sobre de qué trató la reunión y el resultado global.
2. Puntos clave de la discusión — los temas principales, agrupados de forma lógica, con los detalles importantes bajo cada uno.
3. Decisiones — lo que realmente se acordó (y por quién, si está claro).
4. Tareas — agrupadas por persona: de qué se encarga cada una y cualquier plazo mencionado.
5. Bloqueos y riesgos — todo lo que se planteó como problema, dependencia o preocupación.
6. Preguntas abiertas — todo lo que quedó sin resolver o que necesita seguimiento.

Sé conciso y fácil de leer de un vistazo. Prefiere viñetas cortas antes que párrafos largos. Si algo no queda claro o falta en la transcripción, dilo con franqueza en lugar de adivinar.

Transcripción:
[pega aquí tu transcripción]

Bueno saberlo: puedes seguir dictando en otras aplicaciones mientras un archivo se transcribe en segundo plano.

DijiFlow no es solo para tu propia voz — puede transcribir cualquier archivo de vídeo o audio que sueltes en él, con identificación de hablantes incluida. Eso hace que sea fácil convertir una charla, una entrevista o una clase en texto.

  1. 1 Descarga el vídeo con cualquier descargador de YouTube en línea.
  2. 2 Arrastra y suelta el archivo descargado en DijiFlow como vídeo — él se encarga del resto.

El mismo arrastrar y soltar funciona con cualquier archivo de audio o vídeo local, no solo con YouTube.

Si tu equipo tiene una GPU Intel o AMD, asegúrate de que DijiFlow realmente la esté usando — la aceleración por hardware es muchísimo más rápida que ejecutar en la CPU.

  1. 1 Abre la pestaña GPU.
  2. 2 Asegúrate de que la aceleración Intel o AMD esté seleccionada y aparezca como funcionando.

Advertencia para las GPU Intel: suelen estar integradas en la CPU y comparten una memoria limitada. Si quieres velocidad en una GPU Intel, carga modelos más pequeños o activa la Optimización dinámica de memoria para que los modelos quepan.

Cuando transcribes una reunión o un archivo con varias personas, la identificación de hablantes tiene que adivinar cuántas voces distintas hay. Puedes ayudarla enormemente diciéndoselo de antemano.

Si sabes exactamente cuántas personas hablan en la grabación, indica ese número antes de transcribir — la identificación de hablantes se vuelve mucho más precisa cuando no tiene que adivinar.