文字起こしと字幕用に音声を抽出する方法
確定動画から長さを変えずに音声を抽出し、タイムコード付きマスターと発話中心の文字起こし用コピーを保存し、字幕作成前に映像と照合します。

確定動画から長さを変えずに音声を抽出し、タイムコード付きマスターを保存し、発話中心の文字起こし用コピーを準備します。字幕を作る前に文字起こしを映像と照合してください。音声抽出は引き継ぎ工程であり、字幕準備の終点ではありません。
実務上の目標は、1つの処理画面を成功したように見せることではありません。編集、エンコード、プラットフォームへのアップロード、ローカライズを経た後も、視聴者が意図したメッセージを理解できる状態を保つことです。本ガイドでは、最初に診断し、影響が最も少ない変更を行い、実際の納品物を検証するという管理されたワークフローとして扱います。
視聴者が困っていることから始める

制作者は通常、「字幕の見た目がおかしい」「声に違和感がある」「音が悪い」といった制作上の症状を伝えますが、それだけでは診断になりません。視聴者が何をできないのかを確認してください。文を読めないのか、話者を特定できないのか、単語を聞き取れないのか、順序を追えないのか、演技を信頼できないのか、CTAに沿って行動できないのか。答えによって、必要な根拠が決まります。
- 安定したタイムコードを使える程度に動画版が確定しているか確認する。
- 最良のチャンネルと、音楽や効果音が発話を隠しているかを特定する。
- 出力にソースタイムコード、話者分離、単純な文字起こしのどれが必要か決める。
タイムコード、症状、考えられる原因、重大度、担当者、合格テストを記した短い課題ログを作成します。編集者、翻訳者、レビュアーの間で「もっときれいに」といった主観的なメモを回すより効率的です。
良い結果の基準を決める
ファイルに手を加える前に、明確な公開基準を設定します。
| ゲート | 確認すること | 根拠 |
|---|---|---|
| 意味 | 事実、固有名詞、数値、否定、条件、意図が維持されているか | ソース比較とネイティブまたは分野専門家のレビュー |
| 知覚 | 初見の視聴者が重要な瞬間を一度で理解できるか | 初見の聞き手または視聴者によるテスト |
| 技術 | 同期、エンコード、チャンネル、フォント、必要形式が維持されているか | ファイル検査と最終レンダーの再生 |
| 連続性 | 編集した区間が同じ作品の一部として自然か | 切り替わり部分のA/Bレビュー |
| 配信 | 配信先プラットフォームで正しく表示・再生されるか | 非公開アップロードまたは代表的なデバイスでのテスト |
| 再現性 | 別の担当者が承認済みの結果を再現できるか | バージョン管理した設定、用語集、判断ログ |
品質ゲートには中止条件も必要です。重要語が聞き取れないまま、保護すべき意味が変わる、文字方向やタイミングが崩れる、処理の不自然さが目につく場合は、強い補正を重ねてはいけません。別の方法または素材の差し替えに切り替えます。
完全なワークフロー

1. ソース動画を確定し識別する
バージョン付きファイル名を使い、長さ、フレームレート、言語、編集日を記録します。後の映像変更では字幕を再コンフォームします。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
2. 誤ったトリミングなしで抽出する
開始時刻、長さ、チャンネル構成を維持します。文字起こし用に無音を除く場合も、同期した別マスターを残します。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
3. 適切な音声形式を選ぶ
非圧縮引き継ぎが有用ならWAV、容量が重要なら対応する高品質圧縮形式を使い、変換の繰り返しを避けます。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
4. 発話中心のコピーを準備する
クリーンなチャンネルを選び、一定のマスキングを控えめに減らし、必要な場合だけ音楽を分離します。原本は根拠と難しい語句の確認用に残します。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
5. 話者とタイミング要件を意識して文字起こしする
対応していればタイムスタンプと話者ラベルを要求し、可能なら固有名詞と専門用語の用語集を渡します。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
6. 動画と照合して文字起こしを修正する
数値、固有名詞、否定、話者交代、画面で示す手順を確認します。聞き取れない内容を捏造せず明示します。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
7. 読みやすい字幕に分割する
修正済みの語句を意味単位のキューにし、発話、ショット変更、映像負荷に合わせてタイミングを設定します。文字起こし行が自動的に良い字幕になるわけではありません。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
8. 書き出して往復テストを行う
配信先でSRTまたはVTTを開き、動画全体の同期を確認し、修正済み文字起こしを翻訳元として保存します。
画面に成功メッセージが出ただけで、この段階を承認してはいけません。保存したソースと結果を比較し、最も難しい区間を検査し、採用版を生んだ設定または判断を記録します。この段階でタイミング、表現、チャンネル、画面内テキストが変わった場合は、再生成が必要な後工程の素材をすべて記録します。
実例
29.97fps、ステレオ音声の90分インタビューで、クリーンなゲストマイクは主に右チャンネルです。チームは同期WAVを保存し、良い方のチャンネルからモノラル発話コピーを作り、タイムスタンプ付きで文字起こしし、映像を見ながら会社名を修正します。字幕は別途分割し、終盤でずれを確認します。
この例が示すのは、影響が最も大きい制約から解決し、その後に全体を再評価するという一般原則です。各段階で次の工程が利用できる根拠が変わるため、処理順は重要です。いきなり書き出すワークフローでは原因が隠れ、後の修正コストが高くなる可能性があります。
結果を客観的に評価する方法
3段階でレビューします。
パス1:技術的な切り分け
短く再現可能な区間で、対象の不具合だけを検査します。設定を固定し、原本と比較し、複数の変数を同時に変えないでください。音声は音量を揃えてから聞きます。字幕やグラフィックでは、同じフレーム、倍率、レンダラーを使います。
パス2:物語とタスクの文脈
修正箇所の前後を含むシーン全体を視聴します。文、音、グラフィックが役割を果たしていることを確認してください。局所的には技術的にきれいでも、ジョークを削除する、警告を弱める、製品デモを隠す、不自然な切り替わりを生む場合があります。
パス3:最終納品
エンコード済みの納品物を最初から最後まで確認します。可能なら代表的なデバイスと配信先プラットフォームでテストしてください。冒頭数秒、最も難しい区間、切り替わり、結末を検証します。ランダムな抜き取り確認は、既知のリスク箇所を確認したうえで補助的に行う場合にのみ有効です。
不具合は重大度で管理します。
- ブロッカー: 言語間違い、メディア欠落、事実変更、権利問題、同期不良、読めないテキスト、必要な発話が聞き取れない状態。
- 重大: 用語の反復ミス、明白な不自然さ、トーンの不統一、目立つ音量変化、CTAの不具合。
- 軽微: 理解に影響しない単発の見た目上の問題。
- 好み: ブリーフに違反しないスタイル上の代案。
多数の好みの指摘で、1件のブロッカーを見失わないようにしてください。
関連ワークフローを使う場所
不具合が上流にある場合は、関連ワークフローで音声認識を改善する範囲だけクリーンアップするところから始めます。ソース側の問題を残したまま症状だけ磨くことを防げます。
最初の処理が安定したら、元ミックスがない場合に会話を分離することで次の実務層に進めます。現在の診断で追加処理が必要と分かった箇所にのみ使ってください。
納品前に、翻訳後に字幕キューを再調整する必要があります。技術的に正しい中間ファイルでも、文脈では失敗する可能性があるため、この引き継ぎは重要です。
最後に、最終音声と字幕を一緒に確認することで、公開ワークフロー全体の中で判断を検証します。
これらのリンクは引き継ぎを示すもので、すべてのツールを使う義務ではありません。ワークフローは必要な範囲に保ちます。ソースがすでに明瞭で有効なら、処理を追加することで価値よりリスクが増える場合があります。
Recapoを工程に組み込む方法
Recapoの現行関連制作ツールは、このワークフローの中心的な処理を効率化できます。ソースのコピーに対して使用し、代表的なサンプルから始め、出力はバージョン付きの名前で保存します。自動化は、レビュー可能な候補を短時間で作るときに最も価値を発揮します。
ただし、次の作業を代替するものではありません。
- ソースのバージョン管理。
- ネイティブ言語または分野専門家による判断。
- 権利と同意の確認。
- 視聴者のタスクに紐づく合格テスト。
- 最終エンコード済みファイルの検査。
- ソースにそもそも情報が収録されていない場合の人による判断。
再現可能なチーム工程にするには、ソース、ツール出力、設定またはプロンプト、人が加えた修正、承認状況、最終書き出しをまとめて保存します。この記録により、次のプロジェクトで同じ診断を繰り返さずに済みます。
よくある失敗と復旧方法
古い編集版から抽出し、後で何百ものずれたキューを直す
失敗する理由: 目に見える1つの症状だけを最適化し、意味、タイミング、明瞭さ、配信時の挙動を検証していないためです。
修正方法: 最小限の代表サンプルに戻り、1つの変数だけを変更して同じ条件で比較します。最終的な文脈でも問題がないことを確認してから採用します。
タイムコード対応表を残さず無音を除く
失敗する理由: 目に見える1つの症状だけを最適化し、意味、タイミング、明瞭さ、配信時の挙動を検証していないためです。
修正方法: 最小限の代表サンプルに戻り、1つの変数だけを変更して同じ条件で比較します。最終的な文脈でも問題がないことを確認してから採用します。
低品質ダウンロードを繰り返し変換する
失敗する理由: 目に見える1つの症状だけを最適化し、意味、タイミング、明瞭さ、配信時の挙動を検証していないためです。
修正方法: 最小限の代表サンプルに戻り、1つの変数だけを変更して同じ条件で比較します。最終的な文脈でも問題がないことを確認してから採用します。
生の文字起こしを字幕キューとして公開する
失敗する理由: 目に見える1つの症状だけを最適化し、意味、タイミング、明瞭さ、配信時の挙動を検証していないためです。
修正方法: 最小限の代表サンプルに戻り、1つの変数だけを変更して同じ条件で比較します。最終的な文脈でも問題がないことを確認してから採用します。
画面のUIや話者を見ずに語句を修正する
失敗する理由: 目に見える1つの症状だけを最適化し、意味、タイミング、明瞭さ、配信時の挙動を検証していないためです。
修正方法: 最小限の代表サンプルに戻り、1つの変数だけを変更して同じ条件で比較します。最終的な文脈でも問題がないことを確認してから採用します。
実務で使えるチーム引き継ぎ
有効な引き継ぎパッケージには次を含めます。
- ソースのファイル名とチェックサムまたはバージョン。
- 対象範囲の正確なタイムコード。
- 対象言語、市場、プラットフォーム、必要に応じてアスペクト比。
- 承認済みの文字起こし、用語集、発音、音声リファレンス。
- 処理方法と設定。
- 既知の制限と意図的に許容した残留成分。
- 処理前後のサンプル。
- 最終合格基準。
- レビュアー名とレビュー日。
- 最終書き出しと編集可能なソース。
大量制作では、新しい形式または言語の最初の1件はすべて確認し、その後は定型案件を抜き取り、フラグ付きの例外は全件検査します。サンプリングが安全なのは、工程が安定し、ブロッカーのエスカレーション経路がある場合だけです。
最終チェックリスト
承認前に次を確認します。
- 正しいソースと配信先バージョンを使用した。
- 原本が保存されている。
- 処理前に問題を分類した。
- 保護すべき意味、固有名詞、数値、タイミングが正しい。
- 難しい区間とクリーンな区間の両方で設定をテストした。
- 新たな不自然さが元の不具合より目立っていない。
- 切り替わりと連続性が自然である。
- 字幕、音声、グラフィック、映像が一致している。
- 最終エンコード済みファイルを確認した。
- 代表的なデバイスまたはプラットフォームで挙動をテストした。
- 権利、開示、アクセシビリティ要件を確認した。
- 判断と再利用可能な設定を記録した。
よくある質問
最も強い自動設定を使うべきですか?
通常は使いません。強い処理は、有用な発話の細部、自然な環境音、文字組みの構造、演技のニュアンスまで取り除く場合があります。合格テストを通過できる、影響が最も少ない変更から始めます。
波形、文字起こし、プレビューだけで承認できますか?
どの表現も単独では品質を証明できません。波形では意味が分からず、文字起こしではタイミングを証明できず、エディターのプレビューではプラットフォーム上の挙動を証明できません。完成した映像と音声を確認してください。
すべての言語や録音で同じ設定を使うべきですか?
設定ではなく、同じ品質ゲートを使います。言語によって構文、文字方向、長さ、演技が異なり、録音によって部屋、マイク、ノイズ、ダイナミクスが異なります。
ソースを本当に復旧できない場合はどうすればよいですか?
欠けた情報を捏造したり、制限を隠したりしてはいけません。再収録、差し替え、元ソースへの復帰、編集の変更、不確実性の開示を行います。見た目がきれいな出力でも、収録されなかった内容は復元できません。
ワークフローを拡張するには?
代表的な1件を安定させ、判断を記録し、再利用可能な用語集またはプリセットを作り、例外キューを管理します。候補生成と機械的チェックは自動化し、意味、自然さ、公開リスクは人が確認します。
まとめ
確定動画から長さを変えずに音声を抽出し、タイムコード付きマスターを保存し、発話中心の文字起こし用コピーを準備します。字幕を作る前に文字起こしを映像と照合してください。音声抽出は引き継ぎ工程であり、字幕準備の終点ではありません。
信頼できる手順はシンプルです。ソースを保存し、視聴者が直面する問題を診断し、短い代表区間でテストし、影響が最も少ない修正を行い、最終納品物だけを承認します。この順序により、品質が高まり、チームが再現できる工程になります。
参考資料
- Recapo:文字起こしと字幕用に音声を抽出する方法、2026年8月26日参照。
- 上記でリンクした内部ワークフロー資料(同じRecapo編集バッチ向けに作成)。