Subtitles & Captions

ถอดเสียงเป็นข้อความพร้อมเวลาประทับ

เรียนรู้วิธีถอดเสียงเป็นข้อความพร้อมเวลาประทับและป้ายชื่อลําโพง จากนั้นตรวจสอบผลลัพธ์และส่งออกเป็น TXT, SRT หรือ VTT

ถอดเสียงเป็นข้อความพร้อมเวลาประทับ — Recapo

ถอดเสียงเป็นข้อความ — คู่มือนี้อธิบายเวิร์กโฟลว์ การแลกเปลี่ยน ข้อจํากัด และการตรวจสอบที่สําคัญก่อนส่งออก

บทถอดความที่มีประโยชน์ไม่ใช่แค่ชุดคําพูด Timestamps ช่วยให้คนกลับไปดูการบันทึกต้นฉบับ และป้ายลําโพงจะบอกว่าใครพูดอะไร เมื่อรวมกันแล้ว พวกเขาช่วยให้การสัมภาษณ์ การประชุม พอดแคสต์ การบันทึกงานวิจัย และคําบรรยายวิดีโอเป็นเรื่องง่ายขึ้นในการทบทวนและนํากลับมาใช้ใหม่

การถอดเสียงอัตโนมัติสามารถสร้างร่างแรกที่แข็งแกร่งได้ แต่การตรวจสอบโดยมนุษย์ยังคงสําคัญ โดยเฉพาะเมื่อบันทึกเสียงมีเสียงรบกวน สําเนียง คําศัพท์พิเศษ หรือเสียงพูดที่ทับซ้อนกัน

บันทึกประสบการณ์: เพิ่มตัวอย่าง Recapo ที่มีเอกสารสําหรับการบรรยายโดยผู้พูดเดี่ยว การสัมภาษณ์สองคน และการประชุมหลายคน จดบันทึกภาษา ระยะเวลา สภาพเสียง รูปแบบผลลัพธ์ และทบทวนผลการตรวจ

ตั้งค่าเสียงก่อนถอดความ

คุณภาพของบทถอดเสียงเริ่มต้นจากการบันทึกเสียง ก่อนอัปโหลด:

  • ถ้าเป็นไปได้ ใช้ไฟล์ต้นฉบับ;
  • ฟังชิ้นส่วนที่ขาดหายหรือเสียหาย;
  • ระบุภาษาพูด;
  • บันทึกวิทยากรที่คาดหวังและคําศัพท์ทางเทคนิค;
  • การยืนยันว่าคุณได้รับอนุญาตให้ดําเนินการบันทึก;
  • ลดเสียงรบกวนพื้นหลังที่หลีกเลี่ยงได้ที่ต้นทาง แทนที่จะต้องพึ่งพาการทําความสะอาดทีหลัง

การพูดที่ชัดเจนและใกล้ชิดโดยทั่วไปจะสังเกตได้ง่ายกว่าการพูดในห้องที่มีเสียงก้องกังวาน ลําโพงที่ทับซ้อนกันนั้นยากมาก เพราะมีหลายเสียงที่เติมเต็มช่วงเวลาเดียวกัน

วิธีถอดเสียงเป็นข้อความ

1. อัปโหลดไฟล์เสียงอย่างเป็นทางการ

ใช้เครื่องมือถอดเสียง Recapo ที่แปลแล้วได้ ](/th/tools/audio-to-text/) หลังจากตรวจสอบภาษาไฟล์ที่รองรับ รูปแบบ และขีดจํากัด

ก่อนเผยแพร่ ให้เปลี่ยนคําว่า "วางแผน" หลังจากที่แต่ละหน้าผลิตภัณฑ์ที่แปลแล้วได้รับการยืนยันโดยตรง

2. เลือกภาษาที่ถูกต้อง

เลือกภาษาที่ใช้ในบันทึก หากเสียงเปลี่ยนภาษาเป็นประจํา ให้ตรวจสอบวิธีที่เครื่องมือจัดการกับเสียงพูดหลายภาษา และคาดว่าจะมีการแก้ไขเพิ่มเติมด้วยมือ

3. เปิดใช้งานการตรวจจับเวลาและลําโพงหากมี

สามารถแสดงเวลาประทับสําหรับแต่ละช่วง ประโยค หรือคําใบ้คําบรรยาย การตรวจจับลําโพงสามารถระบุเสียงเป็น ลําโพง 1, ลําโพง 2 และอื่น ๆ ป้ายเหล่านี้ยังต้องได้รับการตรวจสอบจากมนุษย์ เพราะระบบสามารถรวมลําโพงสองตัวหรือแยกคนหนึ่งเป็นหลายป้ายได้

4. ทบทวนขณะฟัง

อย่าตรวจสอบข้อความแยกกัน เล่นเสียงและตรวจสอบ:

  • ชื่อและองค์กร;
  • ตัวเลข วันที่ และราคา;
  • คําศัพท์และตัวย่อในอุตสาหกรรม;
  • ข้อจํากัดโทษ;
  • การเปลี่ยนผู้พูด;
  • คําพูดที่พูดระหว่างการขัดจังหวะ;
  • ส่วนที่ถูกทําเครื่องหมายว่าไม่แน่ใจ

การตรวจทานรายละเอียดที่มีผลกระทบสูงก่อนจะทําให้ถอดความปลอดภัยต่อการนํากลับมาใช้ใหม่

5. ส่งออกรูปแบบที่ถูกต้อง

เลือกผลลัพธ์ตามงานถัดไป:

  • TXT: ถอดความง่าย ๆ ที่สามารถแก้ไขได้โดยไม่ต้องใช้โครงสร้างคําบรรยายเวลา
  • SRT: คําบรรยายที่ใช้กันอย่างแพร่หลาย พร้อมหมายเลขลําดับและเวลาประทับ
  • VTT: รูปแบบข้อความเวลาที่เน้นเว็บ ซึ่งยังสามารถบรรจุการตั้งค่าคิวและข้อมูลเมตาได้ด้วย

ข้อกําหนด WebVTT W3C กําหนดรูปแบบ Web Video Text Tracks สําหรับข้อความที่จัดเรียงตามเวลา เช่น คําบรรยาย คําบรรยาย และข้อมูลเมตาที่เกี่ยวข้อง

เวลาประทับควรแม่นยําแค่ไหน?

ความถี่ที่แน่นอนของเวลาประทับขึ้นอยู่กับวิธีการใช้บันทึกการสนทนา

  • การวิจัยและทบทวน: การประทับเวลาในระดับย่อหน้าหรือสวิตช์ผู้พูดอาจเพียงพอ
  • ข้อความวิดีโอ: คําแนะนําควรสอดคล้องกับคําพูดที่พูดมากขึ้น
  • ตรวจสอบการอ้างอิง: เวลาประทับควรช่วยให้ค้นหาประโยคต้นฉบับได้ง่ายขึ้น
  • การแก้ไขบันทึก: เวลาประทับสามารถระบุส่วนที่ต้องตัด กราฟ หรือ B-roll

เวลาที่มากเกินไปอาจทําให้บันทึกการอ่านมีเสียงรบกวน ถ้ามีน้อยเกินไป การบันทึกเสียงยาว ๆ ก็อาจใช้งานยาก

วิธีตรวจสอบป้ายผู้พูด

สร้างแผนที่ลําโพงแบบง่ายก่อนเปลี่ยนแบบทั่วโลก:

การติดฉลากอัตโนมัติบุคคลที่ได้รับการยืนยันบทบาทหมายเหตุ
ผู้พูด 1[ชื่อ]พิธีกรเปิดการบันทึก
ผู้พูด 2[ชื่อ]แขกรับเชิญไมโครโฟนที่เงียบกว่า
ผู้พูด 3[ชื่อ]ผู้ดําเนินรายการปรากฏหลังเวลา 12:30 น.

ฟังทุกการเปลี่ยนผ่านของผู้พูดที่สําคัญ อย่าคิดว่าป้ายกํากับทั้งหมดจะคงที่หลังจากพูดซ้ําซ้อนหรือเงียบไปนาน

สาเหตุทั่วไปของข้อผิดพลาดในการถอดความ

เสียงพื้นหลังและเสียงสะท้อน

เสียงรบกวนสามารถกลบพยัญชนะได้ ขณะที่เสียงสะท้อนในห้องอาจทําให้ขอบเขตของคําพร่ามัว ไมโครโฟนที่ใกล้กว่าและสภาพแวดล้อมที่เงียบกว่ามักจะช่วยได้มากกว่าการแก้ไขอย่างรุนแรงหลังการบันทึก

คําพูดที่ทับซ้อนกัน

เมื่อสองคนพูดพร้อมกัน ทั้งการถอดเสียงและการแยกผู้พูดจะดูไม่น่าเชื่อถือเท่าเดิม ทําเครื่องหมายส่วนที่ไม่แน่ใจไว้สําหรับการทบทวนโดยมนุษย์

ชื่อที่กําหนดเองและคําศัพท์

คํานามคุณสมบัติอาจไม่พบได้บ่อยในโมเดลภาษาทั่วไป เตรียมรายการสะกดคําและตรวจสอบแต่ละกรณี

ภาษาผสม

การเปลี่ยนแปลงของภาษาสามารถส่งผลต่อการจดจําและเครื่องหมายวรรคตอน ตรวจสอบว่าเวิร์กโฟลว์ภาษาเดียวหรือหลายภาษาตรงกับบันทึกหรือไม่

ไฟล์ต้นฉบับคุณภาพต่ํา

การตัดเสียง ระดับเสียงต่ํามาก ช่องสัญญาณขาดหายไป และเสียงที่ถูกบีบอัดสูง สามารถลบข้อมูลที่ระบบถอดเสียงไม่สามารถกู้คืนได้เต็มที่

เวิร์กโฟลว์การควบคุมคุณภาพ

ใช้สองแทร็ก:

  1. เนื้อหาการส่งผ่าน: ความหมายที่ถูกต้อง ชื่อ หมายเลข คําศัพท์ทางเทคนิค และตัวตนของผู้พูด
  2. การนําเสนอที่ผ่านการประมวลผล: เครื่องหมายวรรคตอน ย่อหน้า ตัวพิมพ์ใหญ่ ความยาวคํา และรูปแบบที่ถูกต้อง

สําหรับการสัมภาษณ์ที่ละเอียดอ่อน เอกสารทางกฎหมาย การสนทนาเกี่ยวกับสุขภาพ หรือการตัดสินใจทางการเงิน ให้ใช้ผู้ตรวจสอบที่มีคุณสมบัติเหมาะสมและปฏิบัติตามข้อกําหนดด้านความเป็นส่วนตัวที่เกี่ยวข้อง การผลิตอัตโนมัติไม่ควรเป็นพื้นฐานเดียวสําหรับการตัดสินใจที่มีความเสี่ยงสูง

คําถามที่พบบ่อย

ระบบถอดเสียงอัตโนมัติสามารถระบุผู้พูดทุกคนได้หรือไม่?

มันสามารถเสนอป้ายลําโพงได้ แต่เสียงที่ทับซ้อนกัน เสียงคล้ายกัน และการเปลี่ยนแปลงของสภาพเสียงอาจทําให้เกิดข้อผิดพลาดได้ ตรวจสอบฉลากด้วยตนเอง

ควรส่งออก SRT หรือ VTT ดี?

เลือกตามสภาพแวดล้อมการเผยแพร่ SRT พบได้ทั่วไปในแพลตฟอร์มตัดต่อและวิดีโอ; VTT ออกแบบมาสําหรับข้อความบนเว็บที่มีเวลาจํากัด ยืนยันข้อกําหนดปลายทาง

ฉันสามารถถอดเสียงเป็นวิดีโอแทนเสียงได้ไหม?

ใช่ เมื่อเวิร์กโฟลว์รองรับการรับสัญญาณวิดีโอ ใช้เวิร์กโฟลว์ถอดความวิดีโอในเครื่อง; กระบวนการรีวิวก็คล้ายกัน ขณะที่วิดีโอยังให้บริบทภาพสําหรับการสลับลําโพง

ถอดความพร้อมสําหรับการตีพิมพ์โดยอัตโนมัติหรือไม่?

ไม่ใช่ ตรวจสอบชื่อ หมายเลข คําศัพท์พิเศษ เวลา และป้ายชื่อของผู้พูด คําบรรยายคุณภาพสําหรับการตีพิมพ์อาจต้องตรวจสอบความยาวบรรทัดและความเร็วในการอ่านด้วย

ฉันควรทําอย่างไรกับการบันทึกลับนี้?

ตรวจสอบแนวปฏิบัติด้านความเป็นส่วนตัว การเก็บรักษา และการลบบริการจริงก่อนอัปโหลด อย่าพึ่งพาสมมติฐานหรือคํากล่าวทางการตลาดที่ยังไม่ได้รับการยืนยัน

เปลี่ยนบันทึกให้เป็นเอกสารงานที่มีประโยชน์

การถอดเสียงช่วยประหยัดเวลามากที่สุดเมื่อผลลัพธ์ถูกออกแบบสําหรับขั้นตอนถัดไป เพิ่มเวลาที่รองรับการนําทาง ตรวจสอบป้ายผู้พูด ตรวจสอบรายละเอียดเสียงที่มีผลกระทบสูง และส่งออกรูปแบบที่ตรงกับเวิร์กโฟลว์สุดท้าย

CTA: อัปโหลดไฟล์เสียงที่คุณได้รับอนุญาตให้ประมวลผล จากนั้นส่งออกและตรวจสอบบทถอดเสียงในรูปแบบที่คุณต้องการ

เอกสารอ้างอิง

ถอดเสียงเป็นข้อความพร้อมเวลาประทับ 1 详情图

ถอดเสียงเป็นข้อความพร้อมเวลาประทับ 2 详情图

ถอดเสียงเป็นข้อความพร้อมเวลาประทับ