Aproveite ao máximo o DijiFlow Dictate
Alguns pequenos ajustes fazem uma grande diferença na precisão, na velocidade e no conforto. Aqui estão nossas maneiras favoritas de afinar o aplicativo para a sua voz, o seu idioma e a sua máquina.
Seu microfone importa mais do que qualquer configuração isolada do aplicativo. Um microfone de lapela com clipe — aquele pequeno clipe que se prende à sua camisa ou gola — é uma das melhorias mais baratas e mais impactantes que você pode fazer na precisão. Ele fica perto da sua boca, mantém uma distância constante enquanto você se move e rejeita boa parte do ruído do ambiente que atrapalha o microfone embutido de um notebook.
Em resumo: quase qualquer microfone externo que chegue mais perto da sua boca do que o embutido no notebook vai melhorar visivelmente os seus resultados.
O limite de silêncio é o que informa ao DijiFlow a diferença entre você falando e o ruído de fundo. Acertá-lo para o seu ambiente é o único ajuste que evita a maioria das palavras perdidas e dos disparos falsos. Use o teste de microfone embutido para calibrá-lo.
- 1 Abra as Configurações e clique em Testar o microfone.
- 2 Fale normalmente e observe o medidor de nível: enquanto você fala, ele deve ficar mais ou menos entre o meio e a parte direita do medidor.
- 3 Agora fique em silêncio: o nível deve cair e permanecer abaixo da linha branca. A posição ideal dessa linha depende de quão barulhento é o seu ambiente.
- 4 Arraste o filtro de silêncio para mover a linha branca para cima ou para baixo. Essa linha branca é o seu limite de silêncio: tudo abaixo dela é tratado como silêncio.
- 5 Arraste a sensibilidade do microfone para mudar o quão alto a sua voz aparece no medidor, de modo que a sua fala ultrapasse a linha com folga.
Busque uma diferença nítida: a sua fala bem acima da linha branca e o seu silêncio bem abaixo dela. Verifique novamente sempre que mudar de ambiente ou de microfone.
O DijiFlow consegue aprender as palavras que são específicas de você — nomes, jargões, marcas — e corrigi-las automaticamente. Como isso acontece depois da transcrição, ele apura o resultado sem nunca influenciar o que o modelo de fato ouve.
- 1 Abra a aba Vocabulário.
- 2 Marque as áreas que se aplicam a você, para que os pacotes de termos certos sejam carregados.
- 3 Adicione seus próprios termos personalizados — nomes de colegas, sua empresa, nomes de produtos e quaisquer palavras que você diga com frequência.
- 4 Se o aplicativo continuar entendendo errado uma palavra específica, adicione a grafia correta aos seus termos personalizados e ele passará a acertá-la.
Pense nos seus termos personalizados como uma lista sempre em crescimento: toda vez que algo sair errado, adicione a versão correta e isso deixa de acontecer.
Modelos maiores são mais precisos, mas são mais lentos e usam mais memória — RAM no Mac, VRAM no Windows. Existe um ponto de equilíbrio para cada máquina, então vale a pena baixar alguns e testar qual consegue acompanhar você.
- 1 Para o inglês, small ou medium costuma ser o ponto ideal. Em máquinas mais modestas, base ainda funciona bem.
- 2 Para outros idiomas ou uso misto/multilíngue, recomendamos fortemente medium ou large — modelos menores perdem precisão rapidamente fora do inglês.
- 3 Baixe alguns tamanhos e teste-os com a sua própria fala para ver qual a sua máquina lida com folga.
Se um modelo maior parecer lento, desça um tamanho — um modelo rápido que você realmente usa vale mais do que um preciso que você evita.
O push-to-talk deve ser natural — algo que você consiga segurar sem pensar. O melhor atalho é aquele perto de onde seus dedos já descansam, e você pode até movê-lo totalmente para fora do teclado.
- 1 Ótimas combinações de teclado para experimentar: Ctrl+Space, Alt+Space ou Shift+Space (especialmente no Windows).
- 2 No Mac, Cmd+Space é usada pelo Spotlight — você pode reatribuir o Spotlight em Ajustes do Sistema → Teclado → Atalhos de Teclado → Spotlight e usar Cmd+Space, ou simplesmente usar Shift+Space ou Ctrl+Space.
- 3 Jogada de mestre: associe o push-to-talk e o Enter / nova linha aos botões voltar e avançar do seu mouse — por exemplo Shift+Voltar para uma nova linha e Shift+Avançar para Enter (ou configure-os diretamente no software do seu mouse).
Configure as associações do mouse e você poderá ditar quase inteiramente com o mouse — sem precisar do teclado. No Windows, use o utilitário do fabricante do seu mouse; no Mac, uma ferramenta de remapeamento como as usadas para mouses de jogos funciona bem.
O reconhecimento de fala é tão bom quanto o que chega ao microfone. Um ventilador soprando direto no microfone, uma sala cheia ou música tocando por perto vão todos derrubar a precisão — muitas vezes mais do que as pessoas esperam.
Se o ruído for inevitável, aumente o seu limite de silêncio para se adequar ao ambiente, de modo que o aplicativo não seja disparado o tempo todo pelo ruído de fundo — depois baixe-o de novo quando voltar a um lugar silencioso.
A Otimização Dinâmica de Memória é a configuração para usar quando você está com pouca RAM (Mac) ou VRAM (Windows). Ela carrega e descarrega os modelos conforme você alterna, de modo que apenas um modelo fica ativo por vez — o que mantém uma máquina mais leve responsiva.
- 1 Se os modelos parecerem lentos ou a sua máquina estiver com pouca memória, ative a Otimização Dinâmica de Memória nas Configurações.
- 2 A partir daí, o DijiFlow mantém na memória apenas o modelo que você está usando e descarrega os outros entre as alternâncias.
Atenção: executar a transcrição de um arquivo E o ditado ao vivo ao mesmo tempo vai ficar mais lento se a memória estiver apertada — mas com RAM/VRAM suficiente fica perfeitamente fluido.
Se a sua máquina tem folga — algo em torno de mais de 8 GB de RAM ou 12 GB de VRAM — você pode manter dois modelos carregados e alternar entre eles instantaneamente com atalhos diferentes. É uma das coisas mais produtivas que os usuários avançados fazem.
- 1 Bilíngue? Associe o inglês a um atalho e o seu outro idioma a um segundo — troque de idioma sem mexer em nenhuma configuração.
- 2 Um só idioma? Associe dois tamanhos de modelo — um rápido para ditado ágil e um mais preciso para quando você puder esperar um instante.
- 3 Com a Q mode você pode até misturar idiomas dentro de uma mesma frase, depois de pegar o jeito.
Isso brilha quando você escreve um e-mail em um idioma enquanto conversa ou programa em outro — tudo na mesma sessão, sem ficar ajustando nada.
Em reuniões, a precisão importa mais do que a velocidade, então escolha o modelo mais preciso que puder — mesmo que seja mais lento. Lembre-se de que a transcrição automática e a identificação de quem fala nunca são 100% perfeitas e, sozinhas, podem não capturar uma reunião inteira de forma limpa. O truque é entregar a transcrição a um grande modelo de IA para consolidá-la em algo útil.
- 1 Transcreva a reunião com identificação de quem fala, usando o melhor modelo que você tem.
- 2 Se você souber quantas pessoas falaram, defina o número de interlocutores — isso torna a identificação muito mais precisa (veja a dica sobre número de interlocutores).
- 3 Cole a transcrição pronta em um grande modelo de IA — ChatGPT, Gemini, Claude, DeepSeek ou Kimi — e use o prompt pronto abaixo para obter um resumo limpo e consolidado.
Você está me ajudando a transformar a gravação bruta de uma reunião em algo que eu realmente consiga usar.
Abaixo está uma transcrição gerada automaticamente a partir de áudio ou vídeo, incluindo a identificação automática de quem fala. Duas coisas a ter em mente ao lê-la:
- Os rótulos de quem fala ("Speaker 1", "Speaker 2" e assim por diante) e uma palavra ou outra podem estar errados. Onde um rótulo ou uma palavra claramente conflita com o contexto da conversa, confie no contexto e corrija discretamente.
- Você costuma ser bom em descobrir quem é quem pela própria conversa, então deduza os nomes onde puder.
Opcional — se eu já souber quem é quem, vou indicar aqui (caso contrário, deixe em branco):
- Speaker 1 =
- Speaker 2 =
- Speaker 3 =
Por favor, leia a transcrição inteira e me dê um resumo claro e bem organizado com estas seções:
1. Visão geral — duas ou três frases sobre o que foi a reunião e o resultado geral.
2. Principais pontos discutidos — os temas principais, agrupados de forma lógica, com os detalhes importantes sob cada um.
3. Decisões — o que foi de fato acordado (e por quem, se estiver claro).
4. Itens de ação — agrupados por pessoa: pelo que cada uma é responsável e qualquer prazo que tenha sido mencionado.
5. Impedimentos e riscos — tudo o que foi levantado como problema, dependência ou preocupação.
6. Perguntas em aberto — tudo o que ficou sem solução ou que precisa de acompanhamento.
Mantenha o texto conciso e fácil de ler. Prefira tópicos curtos a parágrafos longos. Se algo não estiver claro ou faltar na transcrição, diga isso abertamente em vez de adivinhar.
Transcrição:
[cole sua transcrição aqui]
Bom saber: você pode continuar ditando em outros aplicativos enquanto um arquivo é transcrito em segundo plano.
O DijiFlow não serve só para a sua própria voz — ele pode transcrever qualquer arquivo de vídeo ou áudio que você arrastar para dentro dele, com identificação de quem fala. Isso facilita transformar uma palestra, uma entrevista ou uma aula em texto.
- 1 Baixe o vídeo com qualquer downloader online de YouTube.
- 2 Arraste e solte o arquivo baixado no DijiFlow como vídeo — ele cuida do resto.
O mesmo arrastar e soltar funciona para qualquer arquivo de áudio ou vídeo local, não só do YouTube.
Se a sua máquina tem uma GPU Intel ou AMD, garanta que o DijiFlow esteja de fato usando-a — a aceleração por hardware é drasticamente mais rápida do que rodar na CPU.
- 1 Abra a aba GPU.
- 2 Confirme que a aceleração Intel ou AMD está selecionada e aparece como funcionando.
Aviso sobre GPUs Intel: elas costumam ser integradas à CPU e compartilham uma memória limitada. Se você quer velocidade em uma GPU Intel, carregue modelos menores ou ative a Otimização Dinâmica de Memória para que os modelos caibam.
Quando você transcreve uma reunião ou um arquivo com várias pessoas, a identificação de quem fala precisa adivinhar quantas vozes distintas existem. Você pode ajudá-la enormemente informando isso de antemão.
Se você sabe exatamente quantas pessoas falam na gravação, defina esse número antes de transcrever — a identificação de quem fala fica muito mais precisa quando não está adivinhando.