充分发挥 DijiFlow Dictate 的实力
只需几处小小的调整,就能让准确度、速度和使用体验大不相同。下面是我们最喜欢的一些方法,帮你根据自己的声音、语言和电脑来微调这款应用。
麦克风对结果的影响,胜过应用中任何一项设置。夹在衬衫或衣领上的小小领夹式麦克风,是你在提升准确度上能做的最便宜、也最见效的升级之一。它离你的嘴很近,在你走动时能与嘴保持稳定的距离,并挡掉许多会干扰笔记本内置麦克风的环境噪音。
简而言之:只要是能比笔记本内置麦克风更靠近你嘴部的外接麦克风,几乎都会让效果明显变好。
静音阈值用来告诉 DijiFlow 区分你在说话还是背景噪音。针对你所在的房间把它调准,是防止大多数漏词和误触发的关键一步。用内置的麦克风测试来把它调到位。
- 1 打开“设置”,点击“测试麦克风”。
- 2 正常说话,同时观察电平表——说话时,指示大致应落在电平表中间到右侧之间。
- 3 现在保持安静——电平应当下降,并停留在白线以下。这条线该放在哪里,取决于你的房间有多吵。
- 4 拖动静音过滤器,把白线上下移动。这条白线就是你的静音阈值——线以下的一切都会被当作静音。
- 5 拖动麦克风灵敏度,改变你的声音在电平表上显示的高度,让说话声轻松越过这条线。
目标是留出清晰的落差:说话声远高于白线,静音时远低于白线。每次更换房间或麦克风时都重新检查一下。
DijiFlow 能学习专属于你的词语——人名、行话、品牌——并自动加以纠正。由于这一步发生在转录之后,它只会让结果更清晰,而绝不会影响模型实际听到的内容。
- 1 打开“词汇表”标签页。
- 2 勾选适用于你的领域,以便加载合适的术语包。
- 3 添加你自己的自定义词条——同事的名字、你的公司、产品名称,以及任何你常说的词。
- 4 如果某个特定的词应用总是听错,把正确写法添加到你的自定义词条里,它就会开始识别正确。
把你的自定义词条当成一份不断更新的清单:每当出现错误,就添加正确的版本,这个错误便不再发生。
更大的模型更准确,但速度更慢、也更耗内存——Mac 上是 RAM,Windows 上是 VRAM。每台电脑都有一个最佳平衡点,所以值得下载几个来测试,看哪一个能跟上你的节奏。
- 1 对于英语,small 或 medium 通常是最佳平衡点。在配置较低的电脑上,base 也能用得不错。
- 2 对于其他语言,或混合/多语言使用,我们强烈建议 medium 或 large——离开英语后,较小的模型准确度会迅速下降。
- 3 下载几种尺寸,用你自己的说话方式测试,看你的电脑能轻松驾驭哪一个。
如果更大的模型感觉迟钝,就降一个尺寸——一个你真正会用的快速模型,胜过一个你避而不用的准确模型。
按键说话应当毫不费力——是你可以不假思索就按住的键。最好的快捷键,是你手指本就搁在附近的那一个,你甚至可以把它完全移到键盘之外。
- 1 值得一试的好组合:Ctrl+Space、Alt+Space 或 Shift+Space(尤其是在 Windows 上)。
- 2 在 Mac 上,Cmd+Space 已被 Spotlight 占用——你可以在“系统设置 → 键盘 → 键盘快捷键 → Spotlight”中重新指定 Spotlight,再使用 Cmd+Space;或者干脆使用 Shift+Space 或 Ctrl+Space。
- 3 进阶玩法:把按键说话和 Enter/换行绑定到鼠标的后退和前进键——例如 Shift+后退 换行,Shift+前进 表示 Enter(或直接在鼠标软件里绑定)。
设置好鼠标绑定后,你几乎可以完全用鼠标来听写,无需键盘。在 Windows 上使用鼠标厂商的工具;在 Mac 上,使用类似游戏鼠标那样的按键重映射工具就很好用。
语音识别的好坏,取决于到达麦克风的声音。风扇直吹麦克风、人声嘈杂的房间、附近播放的音乐,都会拉低准确度——往往比人们预想的还要严重。
如果噪音无法避免,就把静音阈值调高以匹配环境,让应用不会被背景声不停触发——等你回到安静的地方,再把它调低。
动态内存优化,是在你 RAM(Mac)或 VRAM(Windows)不足时应当求助的设置。它会随着你的切换加载和卸载模型,因此任何时刻都只有一个模型处于活动状态——从而让配置较低的电脑保持流畅。
- 1 如果模型感觉很慢,或者电脑内存吃紧,就在“设置”中打开动态内存优化。
- 2 此后,DijiFlow 只会把你正在使用的模型留在内存中,并在切换之间卸载其余的模型。
温馨提示:同时进行文件转录和实时听写,在内存吃紧时会变慢——但只要 RAM/VRAM 足够,就会非常顺畅。
如果你的电脑有富余——大致超过 8 GB 的 RAM 或 12 GB 的 VRAM——你就可以同时加载两个模型,并用不同的热键在它们之间即时切换。这是高级用户最能提升效率的做法之一。
- 1 会两种语言?把英语绑定到一个热键,把你的另一种语言绑定到第二个热键——无需改动设置即可切换语言。
- 2 只用一种语言?绑定两种模型尺寸——快速听写用一个快的,能稍等片刻时用一个更准的。
- 3 用上 Q mode,熟悉之后你甚至能在同一个句子里混用多种语言。
当你用一种语言写邮件,同时用另一种语言聊天或写代码时,这一点尤其出色——全部在同一个会话里完成,无需来回折腾。
对于会议,准确度比速度更重要,所以请选你能用的最准确的模型——哪怕它更慢。请记住,自动转录和说话人识别永远不可能 100% 完美,单靠它们未必能干净利落地记录下整场会议。窍门在于把转录文本交给一个大型 AI 模型,让它整理成真正有用的内容。
- 1 用你手头最好的模型,开启说话人识别来转录会议。
- 2 如果你知道有多少人发言,就设置说话人数量——这会让识别准确得多(参见“设置说话人数量”提示)。
- 3 把完成的转录文本粘贴到大型 AI 模型中——ChatGPT、Gemini、Claude、DeepSeek 或 Kimi——并使用下面现成的提示词,得到一份干净、整合过的总结。
你要帮我把一段原始的会议录音整理成真正能用的内容。
以下是一份根据音频或视频自动生成的转录文本,其中包含说话人的自动识别。阅读时请记住两点:
- 说话人标签(“Speaker 1”“Speaker 2”等)以及个别词语可能有误。当某个标签或词语明显与对话的语境不符时,请以语境为准,悄悄地加以更正。
- 你通常很擅长仅凭对话本身判断谁是谁,因此请在可能的地方推断出人名。
可选 —— 如果我已经知道谁是谁,我会在这里对应起来(不清楚就留空):
- Speaker 1 =
- Speaker 2 =
- Speaker 3 =
请通读整份转录文本,按以下几个部分给我一份清晰、条理分明的总结:
1. 概述 —— 用两三句话说明这次会议的主题以及总体结果。
2. 主要讨论要点 —— 把主要话题按逻辑归类,并在每一类下列出重要细节。
3. 决定事项 —— 实际达成一致的内容(如果清楚的话,还有由谁决定)。
4. 行动事项 —— 按人分组:各自负责什么,以及提到的任何截止时间。
5. 阻碍与风险 —— 被提出的任何问题、依赖关系或顾虑。
6. 待解决的问题 —— 任何尚未解决、或需要后续跟进的事项。
请写得简洁、便于快速浏览。相比长段落,优先使用简短的要点。如果转录文本中有不清楚或缺失的地方,请直接说明,而不要凭空猜测。
转录文本:
[在此粘贴你的转录文本]
顺便一提:当某个文件在后台转录时,你仍可以在其他应用中继续听写。
DijiFlow 不只用于你自己的声音——你拖进去的任何视频或音频文件,它都能转录,并附带说话人识别。这让你可以轻松把一场演讲、访谈或讲座变成文字。
- 1 用任意在线 YouTube 下载工具把视频下载下来。
- 2 把下载好的文件作为视频拖放到 DijiFlow 中——其余的交给它处理。
同样的拖放操作适用于任何本地音频或视频文件,不只是 YouTube。
如果你的电脑有 Intel 或 AMD 显卡,请确认 DijiFlow 确实在使用它——硬件加速比在 CPU 上运行要快得多。
- 1 打开“GPU”标签页。
- 2 确认已选中 Intel 或 AMD 加速,并显示为正常工作。
Intel 显卡注意:它们通常集成在 CPU 中,共享有限的内存。如果想在 Intel 显卡上获得速度,请加载更小的模型,或启用动态内存优化,让模型能够放得下。
当你转录一场有多人参与的会议或文件时,说话人识别必须猜测其中有多少个不同的声音。事先告诉它,就能给它极大的帮助。
如果你确切知道录音里有多少人发言,请在转录之前设好这个数字——当它不必猜测时,说话人识别会准确得多。