Получите максимум от DijiFlow Dictate
Несколько небольших настроек заметно улучшают точность, скорость и удобство. Вот наши любимые способы настроить приложение под ваш голос, ваш язык и ваш компьютер.
Микрофон важнее любой отдельной настройки в приложении. Петличный микрофон-клипса — небольшая клипса, которая крепится к рубашке или воротнику, — это одно из самых дешёвых и самых существенных улучшений точности. Он находится близко ко рту, сохраняет стабильное расстояние при движении и отсекает большую часть шума помещения, который сбивает встроенный микрофон ноутбука.
Коротко: почти любой внешний микрофон, который окажется ближе ко рту, чем встроенный в ноутбук, заметно улучшит результат.
Порог тишины — это то, что помогает DijiFlow отличить вашу речь от фонового шума. Правильная настройка под ваше помещение — это единственная регулировка, которая предотвращает большинство пропущенных слов и ложных срабатываний. Используйте встроенную проверку микрофона, чтобы точно её настроить.
- 1 Откройте Настройки и нажмите «Проверить микрофон».
- 2 Говорите как обычно и следите за индикатором уровня — во время речи он должен находиться примерно между серединой и правым краем шкалы.
- 3 Теперь помолчите — уровень должен упасть и оставаться ниже белой линии. Где именно должна проходить эта линия, зависит от того, насколько шумно в вашем помещении.
- 4 Перетаскивайте фильтр тишины, чтобы поднять или опустить белую линию. Эта белая линия и есть ваш порог тишины — всё, что ниже неё, считается тишиной.
- 5 Перетаскивайте чувствительность микрофона, чтобы изменить, насколько высоко ваш голос отображается на шкале, чтобы речь уверенно поднималась выше линии.
Стремитесь к чёткому разрыву: речь заметно выше белой линии, тишина заметно ниже. Перепроверяйте настройку при смене помещения или микрофона.
DijiFlow может запомнить слова, характерные именно для вас, — имена, жаргон, бренды — и исправлять их автоматически. Поскольку это происходит после расшифровки, результат становится точнее, но модель при этом никак не смещается в том, что она действительно слышит.
- 1 Откройте вкладку «Словарь».
- 2 Отметьте подходящие вам области, чтобы загрузились нужные наборы терминов.
- 3 Добавьте свои собственные термины — имена коллег, название компании, названия продуктов и любые слова, которые вы часто произносите.
- 4 Если приложение постоянно неправильно распознаёт какое-то конкретное слово, добавьте его правильное написание в свои термины — и оно начнёт распознаваться верно.
Считайте свои термины постоянно пополняемым списком: каждый раз, когда что-то распознаётся неправильно, добавляйте правильный вариант — и ошибка перестанет повторяться.
Более крупные модели точнее, но медленнее и потребляют больше памяти — RAM на Mac и VRAM на Windows. Для каждого компьютера есть свой оптимальный вариант, поэтому стоит скачать пару моделей и проверить, какая из них успевает за вами.
- 1 Для английского small или medium обычно оптимальны. На слабых компьютерах base тоже работает хорошо.
- 2 Для других языков или смешанного/многоязычного использования настоятельно рекомендуем medium или large — за пределами английского меньшие модели быстро теряют точность.
- 3 Скачайте несколько размеров и проверьте их на своей речи, чтобы понять, с чем ваш компьютер справляется без труда.
Если более крупная модель кажется медленной, спуститесь на размер ниже — быстрая модель, которой вы действительно пользуетесь, лучше точной, которую вы избегаете.
«Нажми и говори» должно быть без усилий — то, что можно удерживать не задумываясь. Лучшее сочетание — то, рядом с которым уже лежат ваши пальцы, и его можно даже полностью вынести за пределы клавиатуры.
- 1 Хорошие сочетания клавиш для проверки: Ctrl+Space, Alt+Space или Shift+Space (особенно на Windows).
- 2 На Mac Cmd+Space занято Spotlight — либо переназначьте Spotlight в Системных настройках → Клавиатура → Сочетания клавиш → Spotlight и используйте Cmd+Space, либо просто используйте Shift+Space или Ctrl+Space.
- 3 Продвинутый приём: назначьте «нажми и говори» и Enter / перенос строки на кнопки «назад» и «вперёд» вашей мыши — например Shift+Back для переноса строки и Shift+Forward для Enter (или задайте их прямо в программе мыши).
Настройте привязки мыши — и диктовать можно почти полностью мышью, без клавиатуры. На Windows используйте утилиту производителя мыши; на Mac хорошо подойдёт программа для переназначения, как для игровых мышей.
Распознавание речи настолько хорошо, насколько хорош звук, доходящий до микрофона. Вентилятор, дующий прямо в микрофон, переполненная комната или играющая рядом музыка снижают точность — часто сильнее, чем ожидают.
Если шума не избежать, поднимите порог тишины под окружение, чтобы приложение не срабатывало постоянно от фона, — а затем снова опустите его, когда вернётесь в тихое место.
Динамическая оптимизация памяти — это настройка, к которой стоит обратиться, когда не хватает RAM (Mac) или VRAM (Windows). Она загружает и выгружает модели при переключении, так что одновременно активна только одна модель — благодаря чему более слабый компьютер остаётся отзывчивым.
- 1 Если модели работают медленно или компьютеру не хватает памяти, включите Динамическую оптимизацию памяти в Настройках.
- 2 После этого DijiFlow держит в памяти только используемую модель, а остальные выгружает при переключении.
Учтите: одновременная расшифровка файла И живая диктовка будут тормозить, если памяти мало, — но при достаточном объёме RAM/VRAM всё работает совершенно плавно.
Если у компьютера есть запас — примерно больше 8 GB RAM или 12 GB VRAM — вы можете держать загруженными две модели и мгновенно переключаться между ними разными горячими клавишами. Это один из самых продуктивных приёмов опытных пользователей.
- 1 Говорите на двух языках? Назначьте английский на одну горячую клавишу, а второй язык — на другую, и переключайтесь между языками без изменения настроек.
- 2 Один язык? Назначьте два размера модели — быструю для скорой диктовки и более точную для случаев, когда можно немного подождать.
- 3 С «Q mode» вы можете даже смешивать языки в пределах одного предложения, когда привыкнете.
Это особенно удобно, когда вы пишете письмо на одном языке, а общаетесь в чате или пишете код на другом — всё в одном сеансе, без лишней возни.
Для встреч точность важнее скорости, поэтому выбирайте самую точную модель, какую можете, — даже если она медленнее. Помните, что автоматическая расшифровка и определение говорящих никогда не бывают идеальными на 100% и сами по себе могут не передать всю встречу чисто. Приём в том, чтобы передать расшифровку большой ИИ-модели, которая соберёт из неё нечто полезное.
- 1 Расшифруйте встречу с определением говорящих, используя лучшую доступную модель.
- 2 Если вы знаете, сколько человек говорило, укажите число говорящих — это заметно повышает точность определения (см. совет о числе говорящих).
- 3 Вставьте готовую расшифровку в большую ИИ-модель — ChatGPT, Gemini, Claude, DeepSeek или Kimi — и используйте готовый промпт ниже, чтобы получить чистое, сводное резюме.
Ты помогаешь мне превратить сырую запись встречи в нечто действительно полезное.
Ниже приведена расшифровка, автоматически созданная из аудио или видео, включая автоматическое определение говорящих. Учитывай две вещи при чтении:
- Метки говорящих («Speaker 1», «Speaker 2» и так далее) и отдельные слова могут быть неверными. Там, где метка или слово явно противоречит контексту разговора, доверяй контексту и молча исправляй.
- Обычно ты хорошо определяешь, кто есть кто, по самому разговору, поэтому угадывай имена, где это возможно.
По желанию — если я уже знаю, кто есть кто, я укажу это здесь (иначе оставь пустым):
- Speaker 1 =
- Speaker 2 =
- Speaker 3 =
Прочитай всю расшифровку и дай мне понятное, хорошо структурированное резюме со следующими разделами:
1. Обзор — два-три предложения о том, чему была посвящена встреча и каков общий итог.
2. Ключевые темы обсуждения — основные вопросы, логически сгруппированные, с важными деталями по каждому.
3. Решения — что именно было согласовано (и кем, если это ясно).
4. Задачи — сгруппированные по людям: за что каждый отвечает и какие сроки упоминались.
5. Препятствия и риски — всё, что было названо проблемой, зависимостью или поводом для беспокойства.
6. Открытые вопросы — всё, что осталось нерешённым или требует продолжения.
Пиши кратко и так, чтобы легко было просмотреть. Предпочитай короткие пункты длинным абзацам. Если что-то неясно или отсутствует в расшифровке, прямо скажи об этом, а не угадывай.
Расшифровка:
[вставьте вашу расшифровку сюда]
Полезно знать: вы можете продолжать диктовать в других приложениях, пока файл расшифровывается в фоне.
DijiFlow — не только для вашего голоса: он может расшифровать любой видео- или аудиофайл, который вы в него перетащите, с определением говорящих. Это позволяет легко превратить выступление, интервью или лекцию в текст.
- 1 Скачайте видео с помощью любого онлайн-загрузчика YouTube.
- 2 Перетащите скачанный файл в DijiFlow как видео — остальное он сделает сам.
То же перетаскивание работает для любого локального аудио- или видеофайла, а не только для YouTube.
Если в вашем компьютере есть видеокарта Intel или AMD, убедитесь, что DijiFlow действительно её использует — аппаратное ускорение значительно быстрее работы на CPU.
- 1 Откройте вкладку «GPU».
- 2 Убедитесь, что выбрано ускорение Intel или AMD и что оно отображается как работающее.
Предупреждение для видеокарт Intel: обычно они встроены в CPU и используют ограниченную общую память. Если нужна скорость на видеокарте Intel, загружайте модели поменьше или включите Динамическую оптимизацию памяти, чтобы модели помещались.
Когда вы расшифровываете встречу или файл с несколькими людьми, определению говорящих приходится угадывать, сколько различных голосов присутствует. Вы можете сильно ему помочь, указав это заранее.
Если вы точно знаете, сколько человек говорит в записи, укажите это число перед расшифровкой — определение говорящих становится намного точнее, когда ему не приходится гадать.