ถอดเสียงเป็นข้อความพร้อมเวลาประทับ
เรียนรู้วิธีถอดเสียงเป็นข้อความพร้อมเวลาประทับและป้ายชื่อลําโพง จากนั้นตรวจสอบผลลัพธ์และส่งออกเป็น TXT, SRT หรือ VTT

ถอดเสียงเป็นข้อความ — คู่มือนี้อธิบายเวิร์กโฟลว์ การแลกเปลี่ยน ข้อจํากัด และการตรวจสอบที่สําคัญก่อนส่งออก
บทถอดความที่มีประโยชน์ไม่ใช่แค่ชุดคําพูด Timestamps ช่วยให้คนกลับไปดูการบันทึกต้นฉบับ และป้ายลําโพงจะบอกว่าใครพูดอะไร เมื่อรวมกันแล้ว พวกเขาช่วยให้การสัมภาษณ์ การประชุม พอดแคสต์ การบันทึกงานวิจัย และคําบรรยายวิดีโอเป็นเรื่องง่ายขึ้นในการทบทวนและนํากลับมาใช้ใหม่
การถอดเสียงอัตโนมัติสามารถสร้างร่างแรกที่แข็งแกร่งได้ แต่การตรวจสอบโดยมนุษย์ยังคงสําคัญ โดยเฉพาะเมื่อบันทึกเสียงมีเสียงรบกวน สําเนียง คําศัพท์พิเศษ หรือเสียงพูดที่ทับซ้อนกัน
บันทึกประสบการณ์: เพิ่มตัวอย่าง Recapo ที่มีเอกสารสําหรับการบรรยายโดยผู้พูดเดี่ยว การสัมภาษณ์สองคน และการประชุมหลายคน จดบันทึกภาษา ระยะเวลา สภาพเสียง รูปแบบผลลัพธ์ และทบทวนผลการตรวจ
ตั้งค่าเสียงก่อนถอดความ
คุณภาพของบทถอดเสียงเริ่มต้นจากการบันทึกเสียง ก่อนอัปโหลด:
- ถ้าเป็นไปได้ ใช้ไฟล์ต้นฉบับ;
- ฟังชิ้นส่วนที่ขาดหายหรือเสียหาย;
- ระบุภาษาพูด;
- บันทึกวิทยากรที่คาดหวังและคําศัพท์ทางเทคนิค;
- การยืนยันว่าคุณได้รับอนุญาตให้ดําเนินการบันทึก;
- ลดเสียงรบกวนพื้นหลังที่หลีกเลี่ยงได้ที่ต้นทาง แทนที่จะต้องพึ่งพาการทําความสะอาดทีหลัง
การพูดที่ชัดเจนและใกล้ชิดโดยทั่วไปจะสังเกตได้ง่ายกว่าการพูดในห้องที่มีเสียงก้องกังวาน ลําโพงที่ทับซ้อนกันนั้นยากมาก เพราะมีหลายเสียงที่เติมเต็มช่วงเวลาเดียวกัน
วิธีถอดเสียงเป็นข้อความ
1. อัปโหลดไฟล์เสียงอย่างเป็นทางการ
ใช้เครื่องมือถอดเสียง Recapo ที่แปลแล้วได้ ](/th/tools/audio-to-text/) หลังจากตรวจสอบภาษาไฟล์ที่รองรับ รูปแบบ และขีดจํากัด
ก่อนเผยแพร่ ให้เปลี่ยนคําว่า "วางแผน" หลังจากที่แต่ละหน้าผลิตภัณฑ์ที่แปลแล้วได้รับการยืนยันโดยตรง
2. เลือกภาษาที่ถูกต้อง
เลือกภาษาที่ใช้ในบันทึก หากเสียงเปลี่ยนภาษาเป็นประจํา ให้ตรวจสอบวิธีที่เครื่องมือจัดการกับเสียงพูดหลายภาษา และคาดว่าจะมีการแก้ไขเพิ่มเติมด้วยมือ
3. เปิดใช้งานการตรวจจับเวลาและลําโพงหากมี
สามารถแสดงเวลาประทับสําหรับแต่ละช่วง ประโยค หรือคําใบ้คําบรรยาย การตรวจจับลําโพงสามารถระบุเสียงเป็น ลําโพง 1, ลําโพง 2 และอื่น ๆ ป้ายเหล่านี้ยังต้องได้รับการตรวจสอบจากมนุษย์ เพราะระบบสามารถรวมลําโพงสองตัวหรือแยกคนหนึ่งเป็นหลายป้ายได้
4. ทบทวนขณะฟัง
อย่าตรวจสอบข้อความแยกกัน เล่นเสียงและตรวจสอบ:
- ชื่อและองค์กร;
- ตัวเลข วันที่ และราคา;
- คําศัพท์และตัวย่อในอุตสาหกรรม;
- ข้อจํากัดโทษ;
- การเปลี่ยนผู้พูด;
- คําพูดที่พูดระหว่างการขัดจังหวะ;
- ส่วนที่ถูกทําเครื่องหมายว่าไม่แน่ใจ
การตรวจทานรายละเอียดที่มีผลกระทบสูงก่อนจะทําให้ถอดความปลอดภัยต่อการนํากลับมาใช้ใหม่
5. ส่งออกรูปแบบที่ถูกต้อง
เลือกผลลัพธ์ตามงานถัดไป:
- TXT: ถอดความง่าย ๆ ที่สามารถแก้ไขได้โดยไม่ต้องใช้โครงสร้างคําบรรยายเวลา
- SRT: คําบรรยายที่ใช้กันอย่างแพร่หลาย พร้อมหมายเลขลําดับและเวลาประทับ
- VTT: รูปแบบข้อความเวลาที่เน้นเว็บ ซึ่งยังสามารถบรรจุการตั้งค่าคิวและข้อมูลเมตาได้ด้วย
ข้อกําหนด WebVTT W3C กําหนดรูปแบบ Web Video Text Tracks สําหรับข้อความที่จัดเรียงตามเวลา เช่น คําบรรยาย คําบรรยาย และข้อมูลเมตาที่เกี่ยวข้อง
เวลาประทับควรแม่นยําแค่ไหน?
ความถี่ที่แน่นอนของเวลาประทับขึ้นอยู่กับวิธีการใช้บันทึกการสนทนา
- การวิจัยและทบทวน: การประทับเวลาในระดับย่อหน้าหรือสวิตช์ผู้พูดอาจเพียงพอ
- ข้อความวิดีโอ: คําแนะนําควรสอดคล้องกับคําพูดที่พูดมากขึ้น
- ตรวจสอบการอ้างอิง: เวลาประทับควรช่วยให้ค้นหาประโยคต้นฉบับได้ง่ายขึ้น
- การแก้ไขบันทึก: เวลาประทับสามารถระบุส่วนที่ต้องตัด กราฟ หรือ B-roll
เวลาที่มากเกินไปอาจทําให้บันทึกการอ่านมีเสียงรบกวน ถ้ามีน้อยเกินไป การบันทึกเสียงยาว ๆ ก็อาจใช้งานยาก
วิธีตรวจสอบป้ายผู้พูด
สร้างแผนที่ลําโพงแบบง่ายก่อนเปลี่ยนแบบทั่วโลก:
| การติดฉลากอัตโนมัติ | บุคคลที่ได้รับการยืนยัน | บทบาท | หมายเหตุ |
|---|---|---|---|
| ผู้พูด 1 | [ชื่อ] | พิธีกร | เปิดการบันทึก |
| ผู้พูด 2 | [ชื่อ] | แขกรับเชิญ | ไมโครโฟนที่เงียบกว่า |
| ผู้พูด 3 | [ชื่อ] | ผู้ดําเนินรายการ | ปรากฏหลังเวลา 12:30 น. |
ฟังทุกการเปลี่ยนผ่านของผู้พูดที่สําคัญ อย่าคิดว่าป้ายกํากับทั้งหมดจะคงที่หลังจากพูดซ้ําซ้อนหรือเงียบไปนาน
สาเหตุทั่วไปของข้อผิดพลาดในการถอดความ
เสียงพื้นหลังและเสียงสะท้อน
เสียงรบกวนสามารถกลบพยัญชนะได้ ขณะที่เสียงสะท้อนในห้องอาจทําให้ขอบเขตของคําพร่ามัว ไมโครโฟนที่ใกล้กว่าและสภาพแวดล้อมที่เงียบกว่ามักจะช่วยได้มากกว่าการแก้ไขอย่างรุนแรงหลังการบันทึก
คําพูดที่ทับซ้อนกัน
เมื่อสองคนพูดพร้อมกัน ทั้งการถอดเสียงและการแยกผู้พูดจะดูไม่น่าเชื่อถือเท่าเดิม ทําเครื่องหมายส่วนที่ไม่แน่ใจไว้สําหรับการทบทวนโดยมนุษย์
ชื่อที่กําหนดเองและคําศัพท์
คํานามคุณสมบัติอาจไม่พบได้บ่อยในโมเดลภาษาทั่วไป เตรียมรายการสะกดคําและตรวจสอบแต่ละกรณี
ภาษาผสม
การเปลี่ยนแปลงของภาษาสามารถส่งผลต่อการจดจําและเครื่องหมายวรรคตอน ตรวจสอบว่าเวิร์กโฟลว์ภาษาเดียวหรือหลายภาษาตรงกับบันทึกหรือไม่
ไฟล์ต้นฉบับคุณภาพต่ํา
การตัดเสียง ระดับเสียงต่ํามาก ช่องสัญญาณขาดหายไป และเสียงที่ถูกบีบอัดสูง สามารถลบข้อมูลที่ระบบถอดเสียงไม่สามารถกู้คืนได้เต็มที่
เวิร์กโฟลว์การควบคุมคุณภาพ
ใช้สองแทร็ก:
- เนื้อหาการส่งผ่าน: ความหมายที่ถูกต้อง ชื่อ หมายเลข คําศัพท์ทางเทคนิค และตัวตนของผู้พูด
- การนําเสนอที่ผ่านการประมวลผล: เครื่องหมายวรรคตอน ย่อหน้า ตัวพิมพ์ใหญ่ ความยาวคํา และรูปแบบที่ถูกต้อง
สําหรับการสัมภาษณ์ที่ละเอียดอ่อน เอกสารทางกฎหมาย การสนทนาเกี่ยวกับสุขภาพ หรือการตัดสินใจทางการเงิน ให้ใช้ผู้ตรวจสอบที่มีคุณสมบัติเหมาะสมและปฏิบัติตามข้อกําหนดด้านความเป็นส่วนตัวที่เกี่ยวข้อง การผลิตอัตโนมัติไม่ควรเป็นพื้นฐานเดียวสําหรับการตัดสินใจที่มีความเสี่ยงสูง
คําถามที่พบบ่อย
ระบบถอดเสียงอัตโนมัติสามารถระบุผู้พูดทุกคนได้หรือไม่?
มันสามารถเสนอป้ายลําโพงได้ แต่เสียงที่ทับซ้อนกัน เสียงคล้ายกัน และการเปลี่ยนแปลงของสภาพเสียงอาจทําให้เกิดข้อผิดพลาดได้ ตรวจสอบฉลากด้วยตนเอง
ควรส่งออก SRT หรือ VTT ดี?
เลือกตามสภาพแวดล้อมการเผยแพร่ SRT พบได้ทั่วไปในแพลตฟอร์มตัดต่อและวิดีโอ; VTT ออกแบบมาสําหรับข้อความบนเว็บที่มีเวลาจํากัด ยืนยันข้อกําหนดปลายทาง
ฉันสามารถถอดเสียงเป็นวิดีโอแทนเสียงได้ไหม?
ใช่ เมื่อเวิร์กโฟลว์รองรับการรับสัญญาณวิดีโอ ใช้เวิร์กโฟลว์ถอดความวิดีโอในเครื่อง; กระบวนการรีวิวก็คล้ายกัน ขณะที่วิดีโอยังให้บริบทภาพสําหรับการสลับลําโพง
ถอดความพร้อมสําหรับการตีพิมพ์โดยอัตโนมัติหรือไม่?
ไม่ใช่ ตรวจสอบชื่อ หมายเลข คําศัพท์พิเศษ เวลา และป้ายชื่อของผู้พูด คําบรรยายคุณภาพสําหรับการตีพิมพ์อาจต้องตรวจสอบความยาวบรรทัดและความเร็วในการอ่านด้วย
ฉันควรทําอย่างไรกับการบันทึกลับนี้?
ตรวจสอบแนวปฏิบัติด้านความเป็นส่วนตัว การเก็บรักษา และการลบบริการจริงก่อนอัปโหลด อย่าพึ่งพาสมมติฐานหรือคํากล่าวทางการตลาดที่ยังไม่ได้รับการยืนยัน
เปลี่ยนบันทึกให้เป็นเอกสารงานที่มีประโยชน์
การถอดเสียงช่วยประหยัดเวลามากที่สุดเมื่อผลลัพธ์ถูกออกแบบสําหรับขั้นตอนถัดไป เพิ่มเวลาที่รองรับการนําทาง ตรวจสอบป้ายผู้พูด ตรวจสอบรายละเอียดเสียงที่มีผลกระทบสูง และส่งออกรูปแบบที่ตรงกับเวิร์กโฟลว์สุดท้าย
CTA: อัปโหลดไฟล์เสียงที่คุณได้รับอนุญาตให้ประมวลผล จากนั้นส่งออกและตรวจสอบบทถอดเสียงในรูปแบบที่คุณต้องการ
เอกสารอ้างอิง

