Tips och tricks

Få ut mesta möjliga av DijiFlow Dictate

Några små justeringar gör stor skillnad för träffsäkerhet, hastighet och komfort. Här är våra favoritsätt att finjustera appen efter din röst, ditt språk och din dator.

Din mikrofon spelar större roll än någon enskild inställning i appen. En myggmikrofon med clip — den lilla klämman som fästs på skjortan eller kragen — är en av de billigaste och största förbättringar du kan göra för träffsäkerheten. Den sitter nära munnen, håller ett jämnt avstånd när du rör dig och stänger ute mycket av rumsljudet som ställer till det för en laptops inbyggda mikrofon.

Kort sagt: nästan vilken extern mikrofon som helst som kommer närmare munnen än laptopens inbyggda förbättrar dina resultat märkbart.

Tystnadströskeln är det som talar om för DijiFlow skillnaden mellan att du talar och bakgrundsljud. Att få den rätt för ditt rum är den enda justering som förhindrar de flesta tappade ord och falska utlösningar. Använd det inbyggda mikrofontestet för att ställa in den.

  1. 1 Öppna Inställningar och klicka på Testa mikrofonen.
  2. 2 Tala normalt och håll koll på nivåmätaren — medan du talar bör den ligga ungefär mellan mitten och den högra delen av mätaren.
  3. 3 Var nu tyst — nivån bör sjunka och hålla sig under den vita linjen. Var linjen behöver ligga beror på hur bullrigt ditt rum är.
  4. 4 Dra i tystnadsfiltret för att flytta den vita linjen upp eller ner. Den vita linjen är din tystnadströskel — allt under den behandlas som tystnad.
  5. 5 Dra i mikrofonkänsligheten för att ändra hur högt din röst når på mätaren, så att ditt tal med god marginal klarar linjen.

Sikta på ett tydligt glapp: ditt tal med god marginal ovanför den vita linjen och din tystnad väl under den. Kontrollera det på nytt varje gång du byter rum eller mikrofon.

DijiFlow kan lära sig orden som är specifika för dig — namn, fackuttryck, varumärken — och rätta dem automatiskt. Eftersom detta sker efter transkriptionen skärper det resultatet utan att någonsin påverka vad modellen faktiskt hör.

  1. 1 Öppna fliken Ordlista.
  2. 2 Kryssa i de områden som gäller dig, så att rätt termpaket läses in.
  3. 3 Lägg till dina egna anpassade termer — kollegors namn, ditt företag, produktnamn och alla ord du säger ofta.
  4. 4 Om appen hela tiden hör ett visst ord fel, lägg till den korrekta stavningen bland dina anpassade termer så börjar den skriva det rätt.

Se dina anpassade termer som en löpande lista: varje gång något blir fel lägger du till den rätta versionen och det slutar hända.

Större modeller är mer träffsäkra, men de är långsammare och använder mer minne — RAM på Mac, VRAM på Windows. Det finns en optimal balans för varje dator, så det är värt att ladda ner ett par och testa vilken som hänger med dig.

  1. 1 För engelska är small eller medium oftast den optimala balansen. På svagare datorer fungerar base fortfarande bra.
  2. 2 För andra språk eller blandad/flerspråkig användning rekommenderar vi starkt medium eller large — mindre modeller tappar träffsäkerhet snabbt utanför engelskan.
  3. 3 Ladda ner några storlekar och testa dem på ditt eget tal för att se vad din dator klarar bekvämt.

Om en större modell känns trög, gå ner en storlek — en snabb modell som du faktiskt använder slår en träffsäker som du undviker.

Push-to-talk ska kännas obesvärat — något du kan hålla nere utan att tänka. Det bästa kortkommandot är ett som fingrarna redan vilar nära, och du kan till och med flytta det helt bort från tangentbordet.

  1. 1 Bra tangentkombinationer att prova: Ctrl+Space, Alt+Space eller Shift+Space (särskilt på Windows).
  2. 2 På Mac är Cmd+Space upptaget av Spotlight — antingen omtilldelar du Spotlight i Systeminställningar → Tangentbord → Kortkommandon → Spotlight och använder Cmd+Space, eller så använder du helt enkelt Shift+Space eller Ctrl+Space.
  3. 3 Proffsgrepp: bind push-to-talk och Retur / ny rad till musens bakåt- och framåtknappar — till exempel Shift+Bakåt för ny rad och Shift+Framåt för Retur (eller ställ in dem direkt i musens programvara).

Ställ in musbindningarna så kan du diktera nästan helt med musen — inget tangentbord behövs. På Windows använder du din mustillverkares verktyg; på Mac fungerar ett ommappningsverktyg som de för spelmöss bra.

Taligenkänning är aldrig bättre än det som når mikrofonen. En fläkt som blåser rakt in i mikrofonen, ett fullt rum eller musik som spelas i närheten drar alla ner träffsäkerheten — ofta mer än man tror.

Om ljudet är oundvikligt, höj din tystnadströskel så att den matchar miljön, så att appen inte hela tiden utlöses av bakgrunden — sänk den sedan igen när du är tillbaka någonstans tyst.

Dynamisk minnesoptimering är inställningen att ta till när du har ont om RAM (Mac) eller VRAM (Windows). Den laddar in och laddar ur modeller när du växlar, så att bara en modell är aktiv åt gången — vilket håller en lättare dator responsiv.

  1. 1 Om modeller känns långsamma eller din dator har ont om minne, aktivera Dynamisk minnesoptimering i Inställningar.
  2. 2 Från och med då behåller DijiFlow bara modellen du använder i minnet och laddar ur de andra mellan växlingarna.

Observera: att köra en filtranskription OCH livediktering samtidigt blir långsammare om minnet är knappt — men med tillräckligt med RAM/VRAM går det alldeles smidigt.

Om din dator har marginal — ungefär mer än 8 GB RAM eller 12 GB VRAM — kan du hålla två modeller inladdade och växla mellan dem direkt med olika snabbtangenter. Det är en av de mest produktiva sakerna avancerade användare gör.

  1. 1 Tvåspråkig? Bind engelska till en snabbtangent och ditt andra språk till en annan — byt språk utan att ändra en inställning.
  2. 2 Ett enda språk? Bind två modellstorlekar — en snabb för snabb diktering och en mer träffsäker för när du kan vänta en stund.
  3. 3 Med Q mode kan du till och med blanda språk inom en och samma mening när du väl vant dig.

Detta briljerar när du skriver ett mejl på ett språk medan du chattar eller kodar på ett annat — allt i samma session, utan något fipplande.

För möten är träffsäkerhet viktigare än hastighet, så välj den mest träffsäkra modell du kan — även om den är långsammare. Kom ihåg att automatisk transkription och talaridentifiering aldrig är 100 % perfekta och på egen hand kanske inte fångar ett helt möte rent. Knepet är att lämna över transkriptionen till en stor AI-modell som konsoliderar den till något användbart.

  1. 1 Transkribera mötet med talaridentifiering, med den bästa modell du har.
  2. 2 Om du vet hur många som talade, ställ in antalet talare — det gör identifieringen mycket mer träffsäker (se tipset om antal talare).
  3. 3 Klistra in den färdiga transkriptionen i en stor AI-modell — ChatGPT, Gemini, Claude, DeepSeek eller Kimi — och använd den färdiga prompten nedan för att få en ren, konsoliderad sammanfattning.
Färdig mötesprompt att klistra in
Du hjälper mig att förvandla en rå mötesinspelning till något jag faktiskt kan använda.

Nedan finns en transkription som genererats automatiskt från ljud eller video, inklusive automatisk talaridentifiering. Två saker att ha i åtanke när du läser den:
- Talaretiketterna ("Speaker 1", "Speaker 2" och så vidare) och enstaka ord kan vara fel. Där en etikett eller ett ord tydligt krockar med samtalets sammanhang, lita på sammanhanget och rätta det diskret.
- Du är oftast bra på att räkna ut vem som är vem utifrån själva samtalet, så härled namn där du kan.

Valfritt — om jag redan vet vem som är vem anger jag det här (lämna annars tomt):
- Speaker 1 =
- Speaker 2 =
- Speaker 3 =

Läs hela transkriptionen och ge mig en tydlig, välorganiserad sammanfattning med dessa avsnitt:
1. Översikt — två eller tre meningar om vad mötet handlade om och det övergripande resultatet.
2. Viktiga diskussionspunkter — huvudämnena, logiskt grupperade, med de viktiga detaljerna under vart och ett.
3. Beslut — vad som faktiskt bestämdes (och av vem, om det är tydligt).
4. Åtgärdspunkter — grupperade per person: vad var och en ansvarar för och eventuell deadline som nämndes.
5. Hinder och risker — allt som togs upp som ett problem, ett beroende eller en oro.
6. Öppna frågor — allt som lämnades olöst eller som behöver följas upp.

Håll det kortfattat och lätt att överblicka. Föredra korta punktlistor framför långa stycken. Om något är oklart eller saknas i transkriptionen, säg det rakt ut i stället för att gissa.

Transkription:
[klistra in din transkription här]

Bra att veta: du kan fortsätta diktera i andra appar medan en fil transkriberas i bakgrunden.

DijiFlow är inte bara till för din egen röst — den kan transkribera vilken video- eller ljudfil som helst som du släpper i den, komplett med talaridentifiering. Det gör det enkelt att förvandla ett föredrag, en intervju eller en föreläsning till text.

  1. 1 Ladda ner videon med valfri YouTube-nedladdare online.
  2. 2 Dra och släpp den nedladdade filen i DijiFlow som en video — den sköter resten.

Samma dra-och-släpp fungerar för vilken lokal ljud- eller videofil som helst, inte bara YouTube.

Om din dator har en Intel- eller AMD-GPU, se till att DijiFlow verkligen använder den — hårdvaruacceleration är dramatiskt snabbare än att köra på processorn.

  1. 1 Öppna fliken GPU.
  2. 2 Se till att Intel- eller AMD-acceleration är vald och visas som fungerande.

Varning för Intel-GPU:er: de är oftast inbyggda i processorn och delar på ett begränsat minne. Vill du ha fart på en Intel-GPU, ladda in mindre modeller eller aktivera Dynamisk minnesoptimering så att modellerna får plats.

När du transkriberar ett möte eller en fil med flera personer måste talaridentifieringen gissa hur många olika röster det finns. Du kan hjälpa den enormt genom att tala om det i förväg.

Om du vet exakt hur många personer som talar i inspelningen, ställ in det antalet innan du transkriberar — talaridentifieringen blir mycket mer träffsäker när den inte behöver gissa.