Mẹo & thủ thuật

Tận dụng tối đa DijiFlow Dictate

Chỉ vài điều chỉnh nhỏ cũng tạo nên khác biệt lớn về độ chính xác, tốc độ và sự thoải mái. Dưới đây là những cách chúng tôi tâm đắc nhất để tinh chỉnh ứng dụng cho phù hợp với giọng nói, ngôn ngữ và máy của bạn.

Micro của bạn quan trọng hơn bất kỳ thiết lập đơn lẻ nào trong ứng dụng. Một chiếc micro cài áo (lavalier) — chiếc kẹp nhỏ gắn vào áo hoặc cổ áo — là một trong những nâng cấp rẻ nhất và hiệu quả nhất mà bạn có thể làm để cải thiện độ chính xác. Nó nằm gần miệng, giữ khoảng cách ổn định khi bạn di chuyển, và loại bỏ phần lớn tiếng ồn trong phòng vốn hay làm micro tích hợp của laptop bị nhiễu.

Nói ngắn gọn: hầu như bất kỳ micro rời nào đưa được gần miệng bạn hơn so với micro tích hợp của laptop đều sẽ cải thiện kết quả một cách rõ rệt.

Ngưỡng im lặng là thứ cho DijiFlow biết sự khác nhau giữa lúc bạn đang nói và tiếng ồn nền. Chỉnh đúng ngưỡng này cho căn phòng của bạn là điều chỉnh duy nhất giúp ngăn phần lớn tình trạng rớt chữ và kích hoạt nhầm. Hãy dùng bài kiểm tra micro tích hợp để căn chỉnh.

  1. 1 Mở Cài đặt và nhấp Kiểm tra micro.
  2. 2 Nói bình thường và quan sát thanh đo mức — khi bạn nói, nó nên nằm khoảng giữa phần giữa và phần bên phải của thanh đo.
  3. 3 Bây giờ hãy im lặng — mức tín hiệu sẽ giảm và nằm dưới đường trắng. Đường đó cần nằm ở đâu là tùy vào phòng của bạn ồn đến mức nào.
  4. 4 Kéo bộ lọc im lặng để dịch đường trắng lên hoặc xuống. Đường trắng đó chính là ngưỡng im lặng của bạn — mọi thứ bên dưới nó đều được coi là im lặng.
  5. 5 Kéo độ nhạy micro để thay đổi mức mà giọng bạn hiển thị trên thanh đo, sao cho tiếng nói vượt qua đường một cách thoải mái.

Hãy nhắm đến một khoảng cách rõ ràng: tiếng nói của bạn cao hơn hẳn đường trắng, còn lúc im lặng thì thấp hơn hẳn. Kiểm tra lại mỗi khi bạn đổi phòng hoặc đổi micro.

DijiFlow có thể học những từ đặc thù của riêng bạn — tên riêng, thuật ngữ, thương hiệu — và tự động sửa chúng. Vì việc này diễn ra sau khi chép lời, nó làm kết quả sắc nét hơn mà không hề làm lệch những gì mô hình thực sự nghe được.

  1. 1 Mở thẻ Từ vựng.
  2. 2 Đánh dấu các lĩnh vực phù hợp với bạn để nạp đúng các gói thuật ngữ.
  3. 3 Thêm các từ tùy chỉnh của riêng bạn — tên đồng nghiệp, công ty của bạn, tên sản phẩm, và bất kỳ từ nào bạn hay nói.
  4. 4 Nếu ứng dụng cứ nghe nhầm một từ cụ thể, hãy thêm cách viết đúng vào các từ tùy chỉnh của bạn và nó sẽ bắt đầu nhận đúng.

Hãy xem các từ tùy chỉnh của bạn như một danh sách luôn được cập nhật: mỗi khi có gì đó ra sai, hãy thêm phiên bản đúng và lỗi ấy sẽ không còn tái diễn.

Mô hình lớn hơn thì chính xác hơn, nhưng chậm hơn và tốn nhiều bộ nhớ hơn — RAM trên Mac, VRAM trên Windows. Mỗi máy đều có một điểm cân bằng lý tưởng, nên rất đáng để tải về vài mô hình và thử xem cái nào theo kịp bạn.

  1. 1 Với tiếng Anh, small hoặc medium thường là lựa chọn cân bằng nhất. Trên các máy cấu hình thấp, base vẫn chạy tốt.
  2. 2 Với các ngôn ngữ khác, hoặc dùng lẫn nhiều ngôn ngữ, chúng tôi rất khuyến nghị medium hoặc large — ngoài tiếng Anh, các mô hình nhỏ hơn mất độ chính xác rất nhanh.
  3. 3 Hãy tải vài kích cỡ và thử với chính giọng nói của bạn để xem máy bạn kham được cái nào một cách thoải mái.

Nếu một mô hình lớn hơn có cảm giác ì ạch, hãy hạ xuống một cỡ — một mô hình nhanh mà bạn thực sự dùng vẫn hơn một mô hình chính xác mà bạn né tránh.

Nhấn-để-nói nên thật nhẹ nhàng — thứ bạn có thể giữ mà không cần suy nghĩ. Phím tắt tốt nhất là phím mà ngón tay bạn vốn đã đặt gần đó, và bạn thậm chí có thể chuyển hẳn nó ra khỏi bàn phím.

  1. 1 Những tổ hợp phím đáng thử: Ctrl+Space, Alt+Space, hoặc Shift+Space (nhất là trên Windows).
  2. 2 Trên Mac, Cmd+Space đã bị Spotlight chiếm — bạn có thể gán lại Spotlight trong Cài đặt Hệ thống → Bàn phím → Phím tắt bàn phím → Spotlight rồi dùng Cmd+Space, hoặc đơn giản là dùng Shift+Space hay Ctrl+Space.
  3. 3 Chiêu nâng cao: gán nhấn-để-nói và Enter/xuống dòng cho nút lùi và tiến trên chuột của bạn — ví dụ Shift+Nút lùi để xuống dòng và Shift+Nút tiến cho Enter (hoặc gán trực tiếp trong phần mềm chuột).

Sau khi thiết lập gán chuột, bạn gần như có thể đọc chép hoàn toàn bằng chuột — không cần bàn phím. Trên Windows, hãy dùng tiện ích của hãng chuột; trên Mac, một công cụ gán lại phím kiểu dành cho chuột chơi game hoạt động rất tốt.

Nhận dạng giọng nói chỉ tốt ngang với những gì đến được micro. Một chiếc quạt thổi thẳng vào micro, một căn phòng đông người, hay tiếng nhạc phát gần đó đều sẽ kéo độ chính xác xuống — thường nhiều hơn người ta tưởng.

Nếu không tránh được tiếng ồn, hãy nâng ngưỡng im lặng cho khớp với môi trường để ứng dụng không bị tiếng nền kích hoạt liên tục — rồi hạ lại khi bạn về nơi yên tĩnh.

Tối ưu hóa Bộ nhớ Động là thiết lập cần tìm đến khi bạn thiếu RAM (Mac) hoặc VRAM (Windows). Nó nạp và giải phóng các mô hình khi bạn chuyển đổi, nên tại một thời điểm chỉ có một mô hình hoạt động — nhờ vậy một chiếc máy nhẹ ký vẫn phản hồi nhanh.

  1. 1 Nếu các mô hình có cảm giác chậm hoặc máy bạn eo hẹp bộ nhớ, hãy bật Tối ưu hóa Bộ nhớ Động trong Cài đặt.
  2. 2 Từ đó trở đi, DijiFlow chỉ giữ trong bộ nhớ mô hình bạn đang dùng và giải phóng các mô hình còn lại giữa những lần chuyển đổi.

Lưu ý: chạy đồng thời một tác vụ chép lời từ tệp VÀ đọc chép trực tiếp sẽ chậm lại nếu bộ nhớ eo hẹp — nhưng với đủ RAM/VRAM thì hoàn toàn mượt mà.

Nếu máy bạn còn dư sức — cỡ hơn 8 GB RAM hoặc 12 GB VRAM — bạn có thể giữ hai mô hình cùng được nạp và chuyển đổi giữa chúng ngay lập tức bằng các phím nóng khác nhau. Đây là một trong những cách hiệu quả nhất mà người dùng thành thạo hay làm.

  1. 1 Dùng song ngữ? Gán tiếng Anh cho một phím nóng và ngôn ngữ kia cho phím thứ hai — chuyển ngôn ngữ mà không cần đổi thiết lập.
  2. 2 Chỉ một ngôn ngữ? Gán hai cỡ mô hình — một cỡ nhanh để đọc chép nhanh và một cỡ chính xác hơn cho lúc bạn có thể chờ một chút.
  3. 3 Với Q mode, khi đã quen bạn thậm chí có thể trộn nhiều ngôn ngữ ngay trong một câu.

Cách này tỏa sáng khi bạn viết email bằng một ngôn ngữ trong khi trò chuyện hay lập trình bằng một ngôn ngữ khác — tất cả trong cùng một phiên, không phải loay hoay.

Với các cuộc họp, độ chính xác quan trọng hơn tốc độ, vậy nên hãy chọn mô hình chính xác nhất mà bạn có — dù nó chậm hơn. Hãy nhớ rằng chép lời tự động và nhận diện người nói không bao giờ hoàn hảo 100% và tự thân chúng có thể không ghi lại trọn vẹn cả cuộc họp một cách gọn gàng. Bí quyết là đưa bản chép lời cho một mô hình AI lớn để hợp nhất thành thứ hữu ích.

  1. 1 Chép lời cuộc họp có bật nhận diện người nói, dùng mô hình tốt nhất bạn có.
  2. 2 Nếu bạn biết có bao nhiêu người đã nói, hãy đặt số người nói — điều đó giúp việc nhận diện chính xác hơn nhiều (xem mẹo về số người nói).
  3. 3 Dán bản chép lời hoàn chỉnh vào một mô hình AI lớn — ChatGPT, Gemini, Claude, DeepSeek hoặc Kimi — và dùng câu lệnh có sẵn bên dưới để nhận một bản tóm tắt gọn gàng, đã được hợp nhất.
Câu lệnh họp sẵn để dán
Bạn đang giúp tôi biến một bản ghi âm cuộc họp thô thành thứ tôi thực sự có thể dùng được.

Dưới đây là một bản chép lời được tạo tự động từ âm thanh hoặc video, bao gồm cả việc tự động nhận diện người nói. Có hai điều cần lưu ý khi bạn đọc:
- Nhãn người nói ("Speaker 1", "Speaker 2", v.v.) và đôi chỗ từ ngữ có thể sai. Ở đâu một nhãn hoặc một từ rõ ràng mâu thuẫn với ngữ cảnh cuộc trò chuyện, hãy tin vào ngữ cảnh và lặng lẽ sửa lại.
- Bạn thường rất giỏi trong việc tự suy ra ai là ai từ chính cuộc trò chuyện, nên hãy suy đoán tên khi có thể.

Tùy chọn — nếu tôi đã biết ai là ai, tôi sẽ ánh xạ họ ở đây (nếu không thì để trống):
- Speaker 1 =
- Speaker 2 =
- Speaker 3 =

Hãy đọc toàn bộ bản chép lời và cho tôi một bản tóm tắt rõ ràng, được sắp xếp mạch lạc theo các mục sau:
1. Tổng quan — hai hoặc ba câu về nội dung cuộc họp và kết quả chung.
2. Các điểm thảo luận chính — những chủ đề chính, được nhóm theo logic, kèm những chi tiết quan trọng dưới mỗi chủ đề.
3. Quyết định — những gì thực sự đã được thống nhất (và do ai, nếu rõ).
4. Hạng mục hành động — nhóm theo từng người: họ phụ trách gì, và mọi thời hạn đã được nhắc đến.
5. Trở ngại & rủi ro — bất cứ điều gì được nêu ra như một vấn đề, sự phụ thuộc hoặc mối lo ngại.
6. Câu hỏi còn bỏ ngỏ — bất cứ điều gì chưa được giải quyết hoặc cần theo dõi tiếp.

Hãy viết ngắn gọn và dễ đọc lướt. Ưu tiên các gạch đầu dòng ngắn hơn là các đoạn văn dài. Nếu có điều gì không rõ hoặc thiếu trong bản chép lời, hãy nói thẳng thay vì đoán mò.

Bản chép lời:
[dán bản chép lời của bạn vào đây]

Điều hữu ích cần biết: bạn có thể tiếp tục đọc chép trong các ứng dụng khác trong khi một tệp đang được chép lời ở chế độ nền.

DijiFlow không chỉ dành cho giọng nói của riêng bạn — nó có thể chép lời bất kỳ tệp video hoặc âm thanh nào bạn thả vào, kèm nhận diện người nói. Điều đó giúp bạn dễ dàng biến một buổi nói chuyện, phỏng vấn hay bài giảng thành văn bản.

  1. 1 Tải video xuống bằng bất kỳ công cụ tải YouTube trực tuyến nào.
  2. 2 Kéo và thả tệp đã tải vào DijiFlow dưới dạng video — phần còn lại nó tự lo.

Vẫn thao tác kéo-thả đó dùng được cho bất kỳ tệp âm thanh hoặc video cục bộ nào, không riêng gì YouTube.

Nếu máy bạn có GPU Intel hoặc AMD, hãy chắc chắn rằng DijiFlow thực sự đang dùng nó — tăng tốc phần cứng nhanh hơn hẳn so với chạy trên CPU.

  1. 1 Mở thẻ GPU.
  2. 2 Đảm bảo tăng tốc Intel hoặc AMD đã được chọn và hiển thị là đang hoạt động.

Cảnh báo với GPU Intel: chúng thường được tích hợp trong CPU và dùng chung phần bộ nhớ hạn chế. Nếu muốn có tốc độ trên GPU Intel, hãy nạp các mô hình nhỏ hơn hoặc bật Tối ưu hóa Bộ nhớ Động để các mô hình vừa đủ chỗ.

Khi bạn chép lời một cuộc họp hay một tệp có nhiều người, việc nhận diện người nói phải đoán xem có bao nhiêu giọng nói khác nhau. Bạn có thể giúp nó rất nhiều bằng cách cho biết trước.

Nếu bạn biết chính xác có bao nhiêu người nói trong bản ghi, hãy đặt con số đó trước khi chép lời — việc nhận diện người nói trở nên chính xác hơn nhiều khi không phải đoán.