타임스탬프가 포함된 오디오-텍스트 전사본
오디오를 타임스탬프와 스피커 라벨이 붙은 텍스트로 옮기는 방법을 배우고, 결과를 검토한 후 TXT, SRT, VTT로 내보내세요.

오디오-텍스트 전사본 — 이 가이드는 내보내기 전에 중요한 워크플로우, 교환, 제한 사항 및 점검을 설명합니다.
유용한 성적표는 단순한 단어 덩어리 그 이상입니다. 타임스탬프는 사람들이 원본 녹음으로 돌아가는 데 도움을 주고, 스피커 라벨은 누가 무슨 말을 했는지 표시합니다. 이 두 자료는 인터뷰, 회의, 팟캐스트, 연구 녹음, 동영상 자막을 검토하고 재사용할 수 있도록 돕습니다.
자동 전사는 강력한 초고를 만들 수 있지만, 녹음에 소음, 억양, 특수 어휘, 중복 음성 등이 있을 때는 인간 검토가 여전히 중요합니다.
경험 노트: 단일 화자 내러티브, 2인 인터뷰, 다인 회의에 대한 문서화된 Recapo 예시를 추가하세요. 언어, 재생 시간, 음향 상태, 출력 형식, 검토 결과를 기록하세요.
전사 전에 오디오 설정하세요
녹취록의 품질은 녹음에서 시작됩니다. 업로드 전:
- 가능하면 원본 파일을 사용하세요;
- 누락되거나 손상된 부품을 듣는 것;
- 구어체 식별;
- 예상 연사 및 전문 용어를 기록하고;
- 녹음 처리 허가를 받았다는 확인;
- 나중에 청소에 의존하기보다는 피할 수 있는 배경 소음을 줄이세요.
명확하고 가까운 말은 공명하는 방 안에서의 말보다 일반적으로 더 쉽게 알아볼 수 있습니다. 서로 겹치는 화자는 여러 목소리가 같은 순간을 채우기 때문에 매우 어렵습니다.
오디오를 텍스트로 전사하는 방법
1. 공식 오디오 파일 업로드
지원되는 파일 언어, 형식, 제한을 확인한 후 ](/ko/tools/audio-to-text/) 현지화된 Recapo 오디오 전사 도구를 사용하세요.
게시 전에 각 현지화된 제품 페이지가 직접 검증된 후 "계획됨"을 교체하세요.
2. 올바른 언어 선택
녹음에서 사용된 언어를 선택하세요. 오디오가 자주 언어를 바꾼다면, 도구가 다국어 음성을 어떻게 처리하는지 검토하고 추가적인 수동 수정을 예상하세요.
3. 가능하다면 타임스탬프 및 스피커 감지 기능을 활성화합니다
각 구간, 문장, 또는 캡션 힌트마다 타임스탬프가 표시될 수 있습니다. 스피커 감지는 소리를 스피커 1, 스피커 2 등으로 라벨링할 수 있습니다. 이 라벨들은 여전히 인간의 검증이 필요한데, 시스템은 두 명의 화자를 합치거나 한 사람을 여러 라벨로 나눌 수 있기 때문입니다.
4. 듣는 동안 복습
텍스트를 따로 검토하지 마세요. 오디오를 재생하고 확인해 보세요:
- 명칭과 조직;
- 수치, 날짜, 가격;
- 업계 용어 및 약어;
- 형량 제한;
- 의장 교체;
- 방해 중에 나온 말들;
- 불확실로 표시된 부분들.
먼저 고유 세부사항을 교정하는 것이 성적표를 재사용할 수 있도록 더 안전하게 만듭니다.
5. 올바른 형식을 내보내기
다음 작업을 기준으로 출력물을 선택하세요:
- TXT: 시간 캡션 구조 없이도 편집할 수 있는 간단한 대본입니다.
- SRT: 시퀀스 번호와 타임스탬프가 포함된 널리 사용되는 자막 큐입니다.
- VTT: 웹 중심의 시간 텍스트 형식으로, 큐 설정과 메타데이터도 포함할 수 있습니다.
WebVTT W3C 명세서는 자막, 자막 및 관련 메타데이터와 같은 시간에 맞춰진 텍스트를 위한 웹 비디오 텍스트 트랙 형식을 정의합니다.
타임스탬프는 얼마나 정확해야 할까요?
타임스탬프의 정확한 빈도는 전사본이 어떻게 사용되는지에 따라 달라집니다.
- 조사 및 검토: 단락 단위의 타임스탬프나 화자 전환으로 충분할 수 있습니다.
- 비디오 텍스트: 지시는 말과 더 밀접하게 일치해야 합니다.
- 인용 확인: 타임스탬프가 원본 문장을 찾기 쉽게 도와줄 것입니다.
- 편집 노트: 타임스탬프는 컷, 그래프, B-롤이 필요한 섹션을 표시할 수 있습니다.
타임스탬프가 너무 많으면 낭독 기록이 잡음이 생길 수 있습니다. 너무 적으면 긴 녹음을 탐색하기 어렵게 만들 수 있습니다.
스피커 라벨 검토 방법
전역 교체를 만들기 전에 간단한 스피커 맵을 만드세요:
| 자동 라벨링 | 검증된 인물 | 역할 | 주석 |
|---|---|---|---|
| 화자 1 | [이름] | 진행자 | 녹음 파일을 열어 |
| 화자 2 | [이름] | 손님 | 더 조용한 마이크 |
| 화자 3 | [이름] | 모더레이터 | 오후 12시 30분 이후에 등장합니다. |
중요한 모든 연사 전환을 들어보세요. 겹치는 연설이나 긴 침묵 후에도 모든 라벨이 일관된다고 가정하지 마세요.
전사 오류의 일반적인 원인
배경 소리와 에코
소음은 자음을 가릴 수 있고, 방 안의 메아리는 단어 경계를 흐릴 수 있습니다. 녹음 후 공격적인 교정보다 마이크가 가까이 있고 조용한 환경이 보통 더 도움이 됩니다.
겹치는 말
두 사람이 동시에 말할 때는 전사와 화자 분리 모두 신뢰성이 떨어집니다. 불확실한 부분은 인간 검토를 위해 표시하세요.
사용자 이름 및 어휘
속성 명사는 일반 언어 모델에서 흔하지 않을 수 있습니다. 맞춤법 목록을 준비하고 각 항목을 확인하세요.
혼합 언어
언어 변화는 인식과 구두점에 영향을 줄 수 있습니다. 단일 언어 또는 다국어 워크플로우가 기록과 일치하는지 확인하세요.
불량한 소스 파일
클리핑, 매우 낮은 볼륨, 누락된 채널, 그리고 고도로 압축된 오디오는 전사 시스템으로 완전히 복구할 수 없는 정보를 제거할 수 있습니다.
품질 관리 워크플로우
두 개의 트랙을 사용하세요:
- 전달 내용: 화자의 올바른 의미, 이름, 번호, 전문 용어, 신원.
- 처리된 프레젠테이션: 구두점, 단락, 대문자, 큐 길이, 올바른 서식.
민감한 인터뷰, 법률 자료, 건강 관련 대화, 재정 결정의 경우, 자격 있는 심사자를 이용하고 관련 개인정보 보호 요건을 준수하세요. 자동화된 출력만이 고위험 결정의 유일한 근거가 되어서는 안 됩니다.
자주 묻는 질문
자동 전사가 모든 화자를 식별할 수 있나요?
스피커 라벨을 제안할 수는 있지만, 겹치는 소리, 비슷한 소리, 오디오 상태 변화는 오류를 일으킬 수 있습니다. 라벨은 수동으로 확인하세요.
SRT 내보내야 할까요, 아니면 VTT 내보내야 할까요?
출판 환경에 따라 선택하세요. SRT 편집 및 비디오 플랫폼에서 흔히 볼 수 있습니다; VTT 제한된 시간 내에 웹 기반 텍스트를 위해 설계되었습니다. 목적지 요구 사항을 확인하세요.
오디오 대신 영상을 전사할 수 있나요?
네, 워크플로우가 비디오 입력을 지원할 때요. 로컬 영상 전사 워크플로우를 활용하세요; 검토 과정도 비슷하며, 영상은 화자 전환을 위한 시각적 맥락도 제공합니다.
성적표가 자동으로 출판 준비가 되나요?
아니요. 연사의 이름, 번호, 특별 용어, 타임스탬프, 라벨을 검토하세요. 출판용 자막은 줄 길이와 읽기 속도도 확인해야 할 수 있습니다.
비밀 녹음은 어떻게 해야 할까요?
업로드 전에 서비스의 실제 개인정보 보호, 유지, 삭제 관행을 반드시 확인하세요. 검증되지 않은 마케팅 가정이나 진술에 의존하지 마세요.
기록을 유용한 업무 문서로 바꾸세요
전사는 다음 단계에 맞게 출력이 설계될 때 가장 많은 시간을 절약합니다. 내비게이션을 지원하는 타임스탬프, 스피커 라벨 검증, 영향력 높은 오디오 세부 정보 검토, 최종 워크플로우에 맞는 내보내기 형식 추가.
CTA: 처리할 권한이 있는 오디오 파일을 업로드한 후, 필요한 형식으로 내보내고 검토하세요.
참고문헌

