Recapo
Recap & Faceless

Cách thêm lồng tiếng AI vào bất kỳ video nào

Tìm hiểu cách thêm lồng tiếng vào video theo ba cách - ghi trực tiếp, tải lên âm thanh hoặc sử dụng chuyển văn bản thành giọng nói AI - cùng với kịch bản, thiết lập micrô, đồng bộ hóa và giảm âm thanh.

Cách thêm lồng tiếng AI vào bất kỳ video nào

Để thêm lồng tiếng vào video, bạn có ba lộ trình thực tế: ghi lại giọng nói của bạn trực tiếp trong khi cảnh quay phát, tải lên lời tường thuật bạn đã ghi ở nơi khác hoặc tạo bản nhạc chuyển văn bản thành giọng nói AI từ kịch bản viết. Hướng dẫn này bao gồm cả ba bên trong trình duyệt - không cần cài đặt - và vượt qua hướng dẫn "nhấp vào nút micrô" mà hầu hết các trang công cụ dừng lại. Điều thực sự làm cho một người lồng tiếng trở nên chuyên nghiệp là nghề thủ công: viết một kịch bản thở, đặt micrô để nó không bị cắt, đồng bộ hóa lời tường thuật với các đoạn cắt của bạn và giảm âm nhạc để mọi từ luôn rõ ràng. Nếu bạn xuất bản lên YouTube, TikTok, Shorts hoặc Reels, thì thủ thuật đó sẽ tách phần lồng tiếng có nội dung là "AI slop" với phần lồng tiếng mà người xem ở lại.

Bài học chính

  1. Chẩn đoán công việc âm thanh trước: trích xuất, dọn dẹp, tách thân, lồng tiếng và âm lượng là những nhiệm vụ khác nhau.
  2. Sử dụng quy trình ít phá hủy nhất để giải quyết vấn đề và kiểm tra một kẹp cứng trước khi lô.
  3. Việc xóa nhạc hoặc trích xuất âm thanh không xóa quyền đối với cảnh quay của người khác.
  4. Sắp xếp âm thanh nguồn để bản chép lời, chú thích, thuyết minh và xuất luôn có thể theo dõi được.

Ba cách để thêm lồng tiếng vào video

Trước khi bạn chạm vào một nút, hãy quyết định phương pháp nào trong ba phương pháp phù hợp với video của bạn. Họ đánh đổi khác nhau về thời gian, khả năng kiểm soát và mức độ liên quan đến tiếng nói của chính bạn.

Phương pháp Tốt nhất cho Những gì bạn cần Đánh đổi chính

Ghi lại trực tiếp qua cảnh quayPhản ứng, bình luận, kênh định hướng cá tínhMột micrô và một căn phòng yên tĩnhChi phí thi lại theo thời gian thực
Tải lên tệp được ghi sẵnNgười dẫn chương trình podcast, bất kỳ ai có âm thanh phòng thuMP3 / WAV / M4A đã hoàn thànhBạn chỉnh sửa hai thứ riêng biệt
Chuyển văn bản thành giọng nói AIGiải thích vô danh, tóm tắt, hướng dẫn, đa ngôn ngữMột kịch bản chặt chẽNghe có vẻ rô bốt nếu bạn không điều chỉnh nó

Hầu hết các nhà sáng tạo kết hợp các phương pháp - giọng nói AI cho một bản tóm tắt không có khuôn mặt, một bản trực tiếp cho phần giới thiệu cá nhân. Quy trình làm việc bên dưới áp dụng cho cả ba, vì việc chỉnh sửa, đồng bộ hóa và trộn đều diễn ra sau khi âm thanh tồn tại.

Phương pháp 1: Ghi lại phần lồng tiếng trực tiếp trên video của bạn

Ghi âm trong khi bạn xem cảnh quay là cách nhanh nhất để có được lời tường thuật phản ứng với nội dung trên màn hình. Đây là mặc định cho bình luận, cảm xúc và bất kỳ kênh nào mà giọng nói của bạn là sản phẩm.

** Từng bước: **

  1. Mở dự án của bạn và xem xét nơi tường thuật nên bắt đầu.
  2. Đặt mức micrô của bạn trước (xem hộp thiết lập bên dưới) - thực hiện kiểm tra 10 giây và kiểm tra xem bạn không đạt đỉnh.
  3. Phát cảnh quay và nói lời thoại của bạn khi video quay. Xem hình ảnh giữ cho nhịp độ của bạn trung thực.
  4. Nếu bạn mò mẫm một dòng, hãy tiếp tục và đánh dấu dấu thời gian - quay lại một clip sẽ nhanh hơn là bắt đầu lại toàn bộ cảnh quay.
  5. Cắt bớt không khí chết ở đầu và đuôi, sau đó di chuyển đoạn âm thanh để từ đầu tiên của bạn rơi vào cảnh quay mà bạn đang mô tả.

Thiết lập micrô khắc phục 80% âm thanh kém:

  1. Lấy micrô cách miệng của bạn 6–10 inch, hơi lệch trục để tiếng nổ (âm thanh "p" và "b") không đập.
  2. Thu âm trong căn phòng nhỏ nhất được trang bị nội thất mềm mại mà bạn có - một tủ quần áo với quần áo đánh bại một văn phòng lớn vang dội.
  3. Nhắm mức đầu vào của bạn sao cho giọng nói bình thường đạt đỉnh khoảng −12 đến −6 dB, không bao giờ chạm vào 0.
  4. Tắt quạt, AC và thông báo. Tiếng ồn trong phòng gần như không thể loại bỏ sạch sẽ sau khi thực tế.

Nếu bản live của bạn vẫn còn tiếng rít, tiếng vo ve hoặc sàn không nhất quán, hãy chạy qua quá trình dọn dẹp trước khi bạn trộn — hướng dẫn của chúng tôi về cách dọn dẹp âm thanh cho video bao gồm thứ tự các thao tác để bạn không xử lý quá mức và làm cho giọng nói của mình phát ra âm thanh dưới nước.

Phương pháp 2: Tải lên phần lồng tiếng được ghi âm trước

Nếu bạn đã tường thuật ở đâu đó - podcast, bản ghi nhớ điện thoại, phiên micrô USB chuyên dụng - bạn chỉ cần đưa âm thanh đã hoàn thành vào dự án của mình. Điều này giữ cho việc ghi âm và chỉnh sửa là hai bước sạch sẽ, dễ kiểm soát hơn so với nói chuyện trực tiếp qua một đoạn cắt thô.

  1. Xuất lời tường thuật của bạn dưới dạng MP3, WAV hoặc M4A.
  2. Tải video và tệp âm thanh lên cùng một dự án trình duyệt. Recapo chấp nhận MP4, MOV và các định dạng phổ biến khác, với tối đa 6GB cho mỗi tác vụ, vì vậy các phiên quay dài và cảnh quay 4K đều phù hợp.
  3. Thả bản giọng nói vào lớp riêng của nó bên dưới video.
  4. Tách tường thuật ở các ngắt câu tự nhiên để bạn có thể trượt từng đoạn để khớp với hình ảnh — các bước đồng bộ hóa đầy đủ nằm trong phần tiếp theo.
  5. Sau khi vị trí bị khóa, hãy tạo phụ đề từ bản giọng nói để các từ có thể đọc được khi tắt âm thanh.

Bước cuối cùng đó quan trọng hơn âm thanh của nó - một phần lớn lượt xem nguồn cấp dữ liệu xảy ra bị tắt tiếng, vì vậy văn bản trên màn hình là cách bạn giữ nguyên thông điệp. Sử dụng phụ đề tự động để phiên âm phần lồng tiếng và ghi phụ đề rõ ràng, được đồng bộ hóa; nếu phụ đề là mới đối với bạn, cách thêm phụ đề vào video hướng dẫn về kiểu dáng và thời gian.

Phương pháp 3: Tạo lồng tiếng chuyển văn bản thành giọng nói AI

Chuyển văn bản thành giọng nói AI là công cụ cho các kênh, bản tóm tắt và hướng dẫn vô danh mà bạn không thể hoặc sẽ không ghi âm. Bạn dán kịch bản, chọn giọng nói và có được một bản tường thuật rõ ràng - không có micrô, không quay lại, không có tiếng ồn trong phòng. TTS thô nghe có vẻ rô bốt trừ khi bạn điều chỉnh nó, đó chính xác là những gì phần tiếp theo đề cập.

** Quy trình cơ bản: **

  1. Viết hoặc dán tập lệnh của bạn vào trình tạo lồng tiếng. Giữ câu ngắn gọn - TTS đọc dấu câu theo nghĩa đen và các đoạn dài sẽ khiến bạn nghẹt thở.
  2. Chọn giọng nói phù hợp với giọng điệu của kênh. Thử giọng hai hoặc ba trên cùng một đoạn trước khi cam kết; Cùng một kịch bản có thể cảm thấy ấm áp hoặc lâm sàng tùy thuộc vào giọng nói.
  3. Tạo bản nhạc và nghe từ đầu đến cuối để tìm bất kỳ từ nào sai.
  4. Sửa các từ sai ở cấp độ tập lệnh (xem bên dưới), chỉ tạo lại dòng đó và thả nó vào dòng thời gian của bạn.
  5. Thêm phụ đề từ cùng một tập lệnh để văn bản và âm thanh luôn phù hợp.

Nếu bạn đang xây dựng xung quanh một kịch bản - biến một bài báo, một bản tóm tắt hoặc một bản tóm tắt thành video được tường thuật - lộ trình video chuyển văn bản thành giọng nói cho phép kịch bản và giọng nói sống cùng nhau và Recapo cũng có thể giúp soạn thảo các bản tóm tắt và kịch bản từ video nguồn trước khi bạn tạo giọng nói. Để thiết lập hoàn toàn không có khuôn mặt, cách tạo video không có khuôn mặt cho thấy cách lồng tiếng, chú thích và hình ảnh kết hợp với nhau thành một định dạng kênh có thể xuất bản.

Ba thông số làm cho giọng nói AI nghe giống con người

Đây là phần công cụ trang đích bỏ qua. Có được một giọng nói AI tự nhiên phụ thuộc vào việc kiểm soát ba điều: tốc độ, tạm dừng và phát âm. Khắc phục những điều này và 90% sự cố "giọng nói robot" biến mất.

1. Tốc độ (tốc độ nói). TTS mặc định thường đọc nhanh một chút để tường thuật. Làm chậm lại một bậc cho người giải thích và hướng dẫn nơi người xem cần tiếp thu thông tin; Giữ cho nó nhanh hơn để tóm tắt năng lượng cao. Đọc to kịch bản của riêng bạn với bộ đếm thời gian trước - nếu bạn không thể nói nó một cách thoải mái ở tốc độ đó, AI cũng không nên.

2. Tạm dừng (ngắt câu). TTS tạm dừng trên dấu câu, vì vậy dấu câu là công cụ tính thời gian của bạn. Sử dụng dấu chấm, không phải dấu phẩy, nơi bạn muốn có một nhịp điệu thực sự. Chia một câu dài thành hai câu ngắn để thêm hơi thở. Một ngắt dòng chuyên dụng hoặc dấu chấm lửng mua một khoảng dừng dài hơn trước khi một câu nói hoặc thay đổi cảnh.

3. Phát âm (từ mơ hồ). Tiếng Anh có đầy đủ các từ đồng âm mà AI có thể đoán sai - "đọc", "chì", "sống", "bass", "record", "present", "tea", "wind". Tên thương hiệu, từ viết tắt và con số cũng vậy. Hai bản sửa lỗi:

Loại từ vấn đề Ví dụ Sửa chữa

Đồng âm"Đọc" (quá khứ và hiện tại)Viết lại câu hoặc đánh vần theo ngữ âm ("đỏ")
Từ viết tắt"SQL", "GIF"Viết nó theo cách bạn muốn: "phần tiếp theo", "jif"
Số/ngày"Thập niên 1990", "1,5 triệu USD"Viết "mười chín chín mươi", "một phẩy năm triệu"
Tên thương hiệubất kỳ chính tả bất thường nàoĐánh vần nó theo ngữ âm và thử giọng

Chỉ tạo lại dòng đã sửa thay vì toàn bộ bản nhạc - nó nhanh hơn và giữ nguyên thời gian còn lại của bạn.

Cách đồng bộ hóa tường thuật với các đoạn cắt của bạn

Cho dù bạn sử dụng phương pháp nào, đồng bộ hóa là điều khiến tường thuật cảm thấy có chủ ý thay vì dán vào. Mục tiêu: người xem nghe thấy từ đó ngay khi họ nhìn thấy sự vật mà nó mô tả.

  1. ** Neo dòng đầu tiên.** Trượt đoạn giọng nói để từ mở đầu rơi vào cảnh quay mở đầu của bạn, không phải trước nó.
  2. Cắt phụ đề. Nếu bạn đã tạo phụ đề, hãy sử dụng chúng làm điểm đánh dấu trực quan — mỗi khối phụ đề cho bạn biết chính xác nơi bắt đầu của cụm từ, vì vậy bạn có thể cắt cảnh quay để đạt được những nhịp điệu đó.
  3. ** Khớp cắt thành cụm từ, không phải giây.** Khi bạn nói "và sau đó nó bị hỏng", đoạn cắt cho thứ bị hỏng sẽ rơi vào "ngắt quãng". Di chuyển hình ảnh, không phải âm thanh, để sắp xếp chúng.
  4. ** Để lại một nhịp im lặng khi thay đổi cảnh.** Khoảng cách một phần tư giây trước khi một phần mới đọc là ngắt đoạn văn.
  5. Xem một lần ở tốc độ tối đa khi nhắm mắt, sau đó tắt tiếng. Nếu nó hoạt động theo cả hai cách - chỉ âm thanh và chỉ hình ảnh - đồng bộ hóa của bạn là ổn định.

Đặc biệt đối với dạng ngắn, đồng bộ chặt chẽ là không thể thương lượng - không có chỗ để trôi dạt. Nếu bạn đang định hình lại cảnh quay ngang cho nguồn cấp dữ liệu dọc trong khi bạn đang ở đó, hãy thực hiện thay đổi kích thước dọc sau khi đồng bộ hóa để thời gian tường thuật của bạn không bị thay đổi.

Giảm âm nhạc và trộn các cấp độ để mọi từ đều rõ ràng

Lồng tiếng cạnh tranh với âm nhạc âm lượng đầy đủ là lý do phổ biến nhất khiến lời tường thuật trở nên lầy lội. "Ducking" có nghĩa là tự động hạ thấp nhạc bất cứ khi nào giọng nói đang nói, sau đó đưa nó trở lại trong các khoảng trống.

** Các cấp độ mục tiêu để nhắm đến: **

  1. Giọng nói đứng đầu là yếu tố to nhất - coi nó là tài liệu tham khảo của bạn.
  2. Nhạc nền: thả nó khoảng 15–20 dB dưới giọng nói trong khi phát tường thuật. Nó nên được cảm nhận, không phải được nghe.
  3. Trong khoảng trống im lặng giữa các dòng, hãy để âm nhạc dâng lên trở lại để không có cảm giác như nó rơi ra.
  4. Hiệu ứng âm thanh: ngắn gọn và mạnh mẽ, không bao giờ được duy trì dưới lời nói.

** Một thứ tự trộn đơn giản: **

  1. Trước tiên, hãy tự xác định mức độ giọng nói phù hợp.
  2. Thêm nhạc và kéo nó xuống cho đến khi bạn có thể nghe thấy mọi phụ âm của lời tường thuật.
  3. Nghe lần cuối trên loa điện thoại, không phải tai nghe - hầu hết khán giả của bạn đang sử dụng điện thoại, nơi âm trung lầy lội xuất hiện tồi tệ nhất.

Nếu bản nhạc bạn chọn có giọng hát hoặc một phần liên tục chống lại lời tường thuật của bạn, thì việc loại bỏ nó thường dễ dàng hơn - xem cách xóa nhạc khỏi video và xây dựng lại với một nền nhạc cụ sạch hơn.

Lồng tiếng theo trường hợp sử dụng

Các công cụ giống nhau phục vụ các định dạng rất khác nhau. Dưới đây là cách tiếp cận ba điều phổ biến nhất.

  1. Video giải thích và tóm tắt. Tập lệnh đầu tiên. Viết toàn bộ lời tường thuật, tạo giọng nói AI, sau đó cắt hình ảnh để phù hợp - bạn chỉnh sửa hình ảnh thành giọng nói chứ không phải ngược lại. Bản tóm tắt hoặc kịch bản được soạn thảo từ video nguồn cung cấp cho bạn bản nháp để cắt thay vì trang trống.
  2. Lồng tiếng nói chuyện và lồng tiếng cá nhân. Ghi âm trực tiếp để cá tính của bạn thể hiện được, sau đó dọn dẹp âm thanh và thêm chú thích. Đừng xử lý quá mức giọng nói thành một thứ gì đó giả tạo.
  3. Hướng dẫn và cách thực hiện. Tốc độ là tất cả — người xem tạm dừng và tua lại, vì vậy giọng nói AI chậm hơn một chút với các ngắt rõ ràng sẽ đánh bại việc đọc nhanh, tràn đầy năng lượng. Đồng bộ hóa tường thuật của mọi bước với hành động chính xác trên màn hình.

Cho dù bạn đang ở định dạng nào, hãy tạo lồng tiếng, chú thích và định hình lại thành một lần để thời gian khóa lại với nhau trước khi bạn xuất.

Câu hỏi thường gặp

Làm cách nào để thêm lồng tiếng vào video trực tuyến miễn phí? Sử dụng trình chỉnh sửa dựa trên trình duyệt để không cần cài đặt. Tải video của bạn lên, sau đó ghi lại lời tường thuật ngay tại chỗ, thả vào tệp được ghi sẵn hoặc tạo giọng nói AI từ kịch bản — tất cả trong cùng một dự án. Chi tiết giá cho Recapo trực tiếp trên trang định giá; Bản thân quy trình làm việc chạy hoàn toàn trong trình duyệt của bạn.

Tôi có thể ghi âm lồng tiếng trực tiếp trên video của mình không? Đúng. Chà đến điểm xuất phát của bạn, đặt mức micrô của bạn, phát cảnh quay và nói lời thoại của bạn khi nó cuộn. Xem hình ảnh trong khi bạn nói chuyện giữ cho nhịp độ của bạn phù hợp với các đoạn cắt. Cắt tỉa đầu và đuôi sau đó để từ đầu tiên rơi vào ảnh bên phải.

Tại sao lồng tiếng AI của tôi nghe giống robot? Hầu như luôn luôn là một trong ba điều: đọc quá nhanh, bỏ qua những khoảng dừng bạn cần hoặc phát âm sai một từ mơ hồ. Làm chậm tốc độ một bậc, sử dụng dấu chấm thay vì dấu phẩy mà bạn muốn có nhịp điệu thực sự và sửa các từ đồng âm, từ viết tắt và số ở cấp độ tập lệnh, sau đó chỉ tạo lại dòng đó.

Làm cách nào để giữ cho âm nhạc không át đi lời tường thuật? Tránh âm nhạc - hạ nó xuống khoảng 15–20 dB dưới giọng nói bất cứ khi nào lời tường thuật đang phát và để nó tăng trở lại trong các khoảng trống. Đặt mức giọng nói trước, sau đó chỉ bật nhạc cho đến khi bạn vẫn có thể nghe thấy mọi phụ âm. Các bản nhạc cụ gọn gàng hơn nhiều so với những bản nhạc có giọng hát.

Tôi có nên thêm phụ đề nếu tôi đã có lồng tiếng không? Đúng. Một phần lớn lượt xem nguồn cấp dữ liệu bị tắt tiếng, vì vậy phụ đề giữ nguyên thông điệp của bạn cho người xem im lặng và củng cố thông điệp cho những người khác. Tạo chúng từ cùng một tập lệnh hoặc bản giọng nói để văn bản và âm thanh luôn đồng bộ hoàn hảo.

Bắt đầu thêm lồng tiếng của bạn

Cho dù bạn ghi âm trực tiếp, tải lên bản quay đã hoàn thành hay tạo giọng nói AI từ tập lệnh, toàn bộ quá trình sẽ chạy trong trình duyệt của bạn — tường thuật, chú thích, đồng bộ hóa và xuất ở một nơi, trên các tệp lên đến 6GB. Chọn phương pháp phù hợp với video của bạn, điều chỉnh tốc độ, tạm dừng và phát âm, giảm âm nhạc và gửi nó. Tạo tài khoản Recapo miễn phí của bạn và thêm lồng tiếng vào video tiếp theo của bạn ngay hôm nay.

Tài liệu tham khảo và nguồn chính thức

  1. Tài liệu FFmpeg
  2. Trợ giúp YouTube: Bản quyền trên YouTube
  3. Cài đặt mã hóa tải lên được đề xuất trên YouTube


Bài viết đề xuất

Xem tất cả