নির্মাতাদের AI বর্ণনা: স্ক্রিপ্ট থেকে তৈরি ভিডিও
AI বর্ণনার ছয় ধাপ: স্ক্রিপ্ট, কণ্ঠ, দৃশ্য, ক্যাপশন, কভার ও পর্যালোচনা। বাংলা ও হিন্দির উচ্চারণ, সময় এবং চূড়ান্ত export ঠিক রাখুন।

Recapo.ai সম্পাদকীয় দল · মূল তথ্য যাচাই: ১০ জুলাই ২০২৬ · এই সংস্করণ পর্যালোচনা: ১৪ সেপ্টেম্বর ২০২৬
AI বর্ণনার প্রক্রিয়া লিখিত ধারণাকে মুখ না দেখিয়ে তৈরি ভিডিওতে বদলায়: স্ক্রিপ্ট, AI ভয়েসওভার, দৃশ্য, ক্যাপশন, উল্লম্ব ফ্রেম, কভার ও এক্সপোর্ট। YouTube, TikTok, Shorts ও Instagram Reels-এর জন্য সপ্তাহে কয়েকটি ভিডিও বানালে সঠিক ক্রম ও কম অপ্রয়োজনীয় ফাইল স্থানান্তর সময় বাঁচাতে পারে। এই গাইড প্রতিটি ধাপের সিদ্ধান্ত ও পুনর্ব্যবহারযোগ্য কাঠামো দেয়। সম্ভব হলে সম্পর্কিত কাজ কাছাকাছি রাখুন, তবে প্রায় পুরো autopilot আশা করবেন না: তথ্য, উচ্চারণ, দৃশ্যের অর্থ ও চূড়ান্ত ফাইল পর্যালোচনা দরকার থাকে।
AI বর্ণনার প্রক্রিয়া এক নজরে
Explainer, top-10 তালিকা, “কীভাবে কাজ করে” ভিডিও ও recap-এর জন্য এই ছয় ধাপ উপযোগী ভিত্তি। সব ফরম্যাটে ক্রম হুবহু এক হবে না; রেকর্ড করা demonstration-এ দৃশ্য আগে থেকেই ঠিক থাকতে পারে। পুনরাবৃত্ত কাঠামো ও settings রেখে প্রতিবার নতুন প্রক্রিয়া বানানোর কাজ কমান।
| ধাপকী করবেনপরের ধাপকে কী দেবেনসময় কোথায় যায় | |||
| 1. স্ক্রিপ্ট | বলার উপযোগী শুরু ও গল্প লিখুন | পরিষ্কার, বলা যায় এমন স্ক্রিপ্ট | বেশি দীর্ঘ লেখা, মূল কথা দেরিতে আনা |
| 2. ভয়েসওভার | AI TTS দিয়ে বর্ণনা | যাচাই করা voice track | ভুল উচ্চারণ ঠিক করে আবার বানানো |
| 3. দৃশ্য | বর্ণনার সময়ে clips ও B-roll যোগ | কণ্ঠের সঙ্গে মেলা rough cut | অপ্রাসঙ্গিক বা অকারণে স্থির দৃশ্য |
| 4. ক্যাপশন ও reframe | লেখা ঠিক, প্রয়োজনে burn-in ও 9:16 | যাচাই করা captioned vertical draft | হাতে subtitle সময় ঠিক করা |
| 5. কভার ও export | উপযুক্ত thumbnail/cover ও render | পর্যালোচনার চূড়ান্ত ভিডিও | প্রতি destination-এ অপরিকল্পিত আবার export |
| 6. প্রকাশ ও মাপা | প্রকাশ, retention দেখা, শিক্ষা লেখা | পরের স্ক্রিপ্টের প্রমাণ | তথ্য না দেখা বা কারণ না বুঝে ধরে নেওয়া |
বর্ণনাপ্রধান ভিডিওতে কণ্ঠ আগে স্থির করলে তার সঙ্গে দৃশ্য কাটা যায়। Demonstration বা প্রমাণপ্রধান ভিডিওতে আগে দৃশ্যের সীমা স্থির করে কণ্ঠ মেলাতে হতে পারে। Apps-এর মাঝে স্থানান্তরে সময় যায়, কিন্তু AI processing ও সংশোধনও ব্যয়বহুল হতে পারে। সময় মেপে প্রকৃত বাধা কমান।

ধাপ 1 — AI কণ্ঠ স্বচ্ছন্দে বলতে পারে এমন স্ক্রিপ্ট লিখুন
বর্ণনার স্ক্রিপ্ট শুধু ব্লগ জোরে পড়া নয়। দীর্ঘ বাক্য ও অস্পষ্ট বিরাম TTS-এ একঘেয়ে বা তাড়াহুড়ো শোনাতে পারে। শুরুতে দর্শকের প্রশ্ন পরিষ্কার করে শোনার জন্য লিখুন।
- Hook দিয়ে শুরু: প্রথম লাইন লাভ বা টান জানাক—“এই ভিডিওগুলি একইভাবে শুরু হয় কেন, দেখুন।” ভিডিও hook লেখার নির্দেশিকা-তে পুনর্ব্যবহারযোগ্য কাঠামো আছে।
- এক বাক্যে একটি মূল ধারণা: ছোট পরিষ্কার বাক্য প্রায়ই শোনা ও দৃশ্যের কাট বাছায় সাহায্য করে; সব engine-এ একই ফল না ধরে নমুনা শুনুন।
- কঠিন শব্দের উচ্চারণ ঠিক করুন: নাম, ব্র্যান্ড ও acronyms-এ pronunciation dictionary, phoneme বা সমর্থিত alias চেষ্টা করুন। দরকারে শুধু TTS কপিতে ধ্বনিগত spelling দিন; প্রকাশ্য স্ক্রিপ্ট ও ক্যাপশনে সঠিক নাম রাখুন। প্রথমবার ঠিক হবে নিশ্চিত নয়।
- দৃশ্যের সংকেত দিন: ছবি বদলাতে পারে এমন জায়গায় line break বা আলাদা নির্দেশ রাখুন। এগুলি edit map; বলার টেক্সটে অচাওয়া নির্দেশ পাঠাবেন না।
- দৈর্ঘ্যের বাজেট: ইংরেজির প্রাথমিক উদাহরণে মিনিটে 150 শব্দ ধরলে 60 সেকেন্ডে প্রায় 150 শব্দ। বাংলা/হিন্দিতে সর্বজনীন নিরাপদ হার নয়; নির্বাচিত কণ্ঠের নমুনায় pauses-সহ সময় মাপুন। 400 শব্দ লিখে পরে গুঁজে না দিয়ে লক্ষ্য দৈর্ঘ্য ধরে খসড়া করুন।
Hook, প্রতিশ্রুতি, তিনটি মূল পয়েন্ট, পরিণতি ও call to action-এর রূপরেখা রাখতে পারেন। এটি প্রথম reusable template; এতে “80% তৈরি” হওয়ার নির্দিষ্ট মাপ নেই। বিষয় অনুযায়ী পয়েন্টের সংখ্যা বদলান।
ধাপ 2 — AI ভয়েসওভার তৈরি করুন
কণ্ঠ বাছুন এবং ব্যবহারের ধারাবাহিকতা ঠিক করুন। চেনা প্রধান কণ্ঠ ব্র্যান্ডের অংশ হতে পারে; অন্য ভাষা বা ফরম্যাটে আলাদা কণ্ঠও যুক্তিযুক্ত। ভাষা, উচ্চারণ, স্বর ও দরকারি ব্যবহারের অধিকার দেখুন।
বর্ণনা তৈরির দুটি সাধারণ পথ আছে; নির্বাচিত browser workspace-এ সংশ্লিষ্ট বিকল্প আছে কি না দেখুন:
| পদ্ধতিকোন কাজে উপকারীকীভাবে করবেন | ||
| স্ক্রিপ্ট থেকে কণ্ঠ | বর্ণনানির্ভর ভিডিও | Text-to-Speech Video-র মতো টুলে স্ক্রিপ্ট ও কণ্ঠ দিন; Recapo-র বর্তমান ফর্ম দৃশ্য-উৎসও চায় এবং উৎসের দৈর্ঘ্য তিন মিনিট বলে |
| তৈরি কাটে voiceover | আগে থাকা ফুটেজে বর্ণনা | Voiceover Maker-এ ফুটেজ ও স্ক্রিপ্ট দিন; Recapo-র বর্তমান উৎসসীমা তিন মিনিট ও প্রতি ফাইল 2GB, output ও মূল audio-র অবস্থা দেখুন |
পরিষ্কার ও স্বাভাবিক take-এর জন্য:
- একটি প্রধান কণ্ঠ ও exact settings লিখুন: ভাষা, উপলব্ধ model/version, গতি ও pronunciation নির্দেশ রাখুন, যাতে একই ফল আবার তৈরি সহজ হয়।
- তৈরি পুরো কণ্ঠ স্ক্রিপ্টের সঙ্গে মেলান: নাম ও দ্রুত বলা সংখ্যার সঙ্গে বাদ পড়া শব্দ, নেতিবাচক অর্থ, জোর ও আবেগ দেখুন। দরকারি লাইন ঠিক করে বানিয়ে সংযোগ শুনুন।
- গতি দেখুন: লাইন নিঃশ্বাসহীন দৌড়ালে বাক্য ভাগ বা pause দিন। পুরো track ধীর করা সব সমস্যার সমাধান নয়।
অনুমোদিত voice track রাখুন। আলাদা audio export থাকলে নিন; শুধু ভিডিও পেলে পরের editor-এ সমর্থিত উপায়ে audio ব্যবহার করুন। দৃশ্যের সময় সেই track-এ মেলান। স্বর, গতি ও ধারাবাহিকতার জন্য YouTube ভিডিওতে AI voiceover-এর নির্দেশিকা দেখুন।

ধাপ 3 — বর্ণনার সঙ্গে মেলা দৃশ্য বানান
কণ্ঠ স্থির হলেও দৃশ্য বাছা সৃজনশীল ও তথ্যভিত্তিক কাজ। প্রতি তিন থেকে পাঁচ সেকেন্ডে বদল একটি প্রাথমিক editing পরীক্ষা হতে পারে, retention-এর নিয়ম নয়। দরকারি demonstration বা diagram-এ বেশি সময় লাগে; শুধু স্থির বলে কাটবেন না।
ফরম্যাট অনুযায়ী দৃশ্যের উৎস বাছুন:
- Recap, মন্তব্য ও reaction-এ দীর্ঘ উৎসের ছোট অংশ নিন। দীর্ঘ ভিডিও থেকে ছোট ক্লিপ তৈরির AI দরকারি অংশ সাজেস্ট করতে পারে; উৎস ও ব্যবহারের অধিকার দেখে বর্ণনার পয়েন্টে কাটুন।
- Explainer ও তালিকার ভিডিওতে B-roll, screen recording এবং stock বা licensed footage স্ক্রিপ্টের সঙ্গে মেলান।
- মুখবিহীন tutorial-এ screen capture ও মূল নির্দেশের text cards দিন; দরকারি কাজ পরিষ্কার দেখা চাই।
বর্ণনাপ্রধান কাটে এই ক্রম নিন:
- আগে timeline-এ পুরো অনুমোদিত voiceover রাখুন।
- প্রথম ধাপের প্রতিটি দৃশ্য-সংকেতে উপযুক্ত দৃশ্য বসান।
- পরের বলা ধারণা শুরুতে প্রয়োজনীয় কাট মেলান; প্রতি line break-এ বদল বাধ্যতামূলক নয়।
- পুরো গতিতে দেখুন। পাঁচ সেকেন্ডের বেশি বদলহীন অংশ পর্যালোচনার সংকেত: দৃশ্য উপকারী হলে রাখুন, নিষ্ক্রিয় হলে ঠিক করুন।
দীর্ঘ উৎসকে বর্ণনাযুক্ত Shorts করা মূল কাজ হলে মুখ না দেখিয়ে ভিডিও তৈরির নির্দেশিকা-র batch ও sourcing পদ্ধতি এই ধাপে কাজে আসে।
ধাপ 4 — ক্যাপশন, উল্লম্ব ফ্রেম ও কভার
কিছু দর্শক শব্দ ছাড়া দেখেন; সঠিক ক্যাপশন অভিগম্যতা ও বোঝায় সাহায্য করে। এই ধাপে মূল edit-এর বিভিন্ন destination-এর আকারও তৈরি হয়। সব output-এ দর্শক একই অর্থ পাবেন কি না দেখুন।
- ক্যাপশন বানান: চূড়ান্ত voice track থেকে auto-transcription নিয়ে শব্দ ও সময় দেখুন, contrast, ছোট অর্থপূর্ণ লাইন ও দরকারি animation বাছুন। স্থির social চেহারায় burn-in উপকারী; selectable track চাইলে আলাদা রাখুন। কণ্ঠ থেকে তৈরি হলেও timing নিজে থেকে ঠিক নিশ্চিত নয়।
- 9:16-এ reframe: TikTok, Shorts ও Reels-এর উল্লম্ব সংস্করণে প্রতি ক্লিপের জরুরি অংশ রাখুন। দরকারে padding বা অন্য layout নিন।
- কভার বানান: ছোট করলেও পাঠযোগ্য cover/thumbnail রাখুন। একটি ভিত্তি পুনর্ব্যবহার করা যায়, কিন্তু platform-এর crop ও cover প্রক্রিয়া অনুযায়ী আলাদা সংস্করণ লাগতে পারে।
একটি পরিষ্কার 9:16 ফাইল একাধিক platform-এ ব্যবহার হতে পারে। কিন্তু আলাদা দৈর্ঘ্য, UI safe zone, caption, audio অধিকার বা cover-এর প্রয়োজন সম্পাদনা ও আবার render চাইতে পারে; শুধু publish-time বদল ভাববেন না।
প্রক্রিয়া পুনর্ব্যবহারযোগ্য করুন: batch, templates ও QA
একটি ভিডিও শেষ করে পরেরটি শুরুর বদলে একই ধাপ একসঙ্গে করলে কারও সময় বাঁচতে পারে। Batch-এর আকার নিজের পর্যালোচনার ক্ষমতা অনুযায়ী নিন; ভুল পুরো সিরিজে ছড়ানোর আগে প্রথম নমুনা অনুমোদন করুন।
| Batchএক বসায় কী করবেনকেন উপকারী হতে পারে | ||
| স্ক্রিপ্টের দিন | রূপরেখায় 5–10 স্ক্রিপ্ট খসড়া | ভাবনা ও লেখার মনোযোগ এক থাকে; সংখ্যা উদাহরণ |
| উৎপাদনের দিন | আগে voiceovers, পরে rough cuts | একই tool ও settings-এ পরিচালনার কাজ কমে |
| চূড়ান্ত পর্যালোচনার দিন | Caption, reframe, cover ও export পরীক্ষা | একই মানদণ্ড চলে; এটি মনোযোগ দিয়ে করার মান যাচাইয়ের কাজ |
পরিমাণ বাড়লেও মান রাখার দুটি অভ্যাস:
- প্রতি ভিডিওর নির্দিষ্ট QA তালিকা: প্রথম লাইন বিষয় ও প্রতিশ্রুতি পরিষ্কার করুক; পাঁচ সেকেন্ডের বেশি স্থির দৃশ্যের উপযোগিতা দেখুন; ফোনে ক্যাপশন পড়ুন; নাম ঠিক শুনুন; thumbnail ছোট করে দেখুন। সঙ্গে অর্থ, উৎসের অধিকার ও চূড়ান্ত audio/video sync দেখুন।
- Retention থেকে শিক্ষা: দর্শক কোথায় ছাড়েন দেখে পরের স্ক্রিপ্টে কারণ পরীক্ষা করুন। পতন সব সময় ধীর দৃশ্যের প্রমাণ নয়; বিষয়, দর্শক ও বিতরণও দেখুন। ষষ্ঠ ধাপের শিক্ষা প্রথমে পৌঁছাক।
কোথায় প্রক্রিয়া ভাঙে এবং কীভাবে ঠিক করবেন
এগুলি সম্ভাব্য কারণ ও পরীক্ষা, নিশ্চিত রোগনির্ণয় নয়। লক্ষণ দেখে যেখানে সমস্যা শুরু হয়ে থাকতে পারে সেই ধাপে ফিরুন।
| লক্ষণসম্ভাব্য কারণকী দেখবেন/সংশোধন করবেন | ||
| কণ্ঠ robotic বা তাড়াহুড়ো | দীর্ঘ বাক্য, ভুল voice/model, গতি বা pauses | ছোট বাক্য, উপযুক্ত কণ্ঠ ও বিরামের নমুনা তুলনা |
| নামের ভুল উচ্চারণ | TTS নাম ভুল পড়ে | Pronunciation সহায়তা বা TTS-only phonetic spelling; ক্যাপশনে সঠিক নাম |
| প্রথম 5 সেকেন্ডে দর্শক চলে যান | অস্পষ্ট শুরু বা দর্শক/বিষয়ের mismatch | মূল লাভ আগে দিন; title, cover ও traffic source-ও দেখুন |
| মাঝে retention কমে | অপ্রাসঙ্গিক দৃশ্য, পুনরাবৃত্তি বা কঠিন ব্যাখ্যা | 3–5 সেকেন্ডে বদল বিকল্প হিসেবে দেখুন; উপকারী দীর্ঘ দৃশ্য রাখুন |
| ক্যাপশন audio-র পরে | ক্যাপশনের পরে voice edit, ভুল offset বা ASR timing | কণ্ঠ চূড়ান্ত করে আবার align ও শেষ ফাইল পরীক্ষা |
| Crop-এ বিষয় কাটা | ভুল reframe position বা চলন্ত বিষয় অনুসরণ না করা | প্রতি ক্লিপের 9:16 ফ্রেম ঠিক, দরকারে padding |
কারণ যে ধাপে, ভুল সেখানে ঠিক করুন। স্ক্রিপ্টে নাম ভুল হলে শুধু শেষ render পুনরাবৃত্তি কাজে আসবে না। অপরিকল্পিত সংশোধনে দুই ঘণ্টার কাজ পাঁচ ঘণ্টা হতে পারে—এটি সময়হানির উদাহরণ, মাপা benchmark নয়।
Recapo কোথায় কাজে আসতে পারে
Recapo ব্রাউজারে AI ভিডিও সম্পাদনা ও সম্পর্কিত transcription, captions, clipping, summary/script, voiceover, reframe এবং cover টুল দেয়। MP4, MOV ও সাধারণ ফরম্যাট বলা আছে। বর্তমান প্রকাশ্য পৃষ্ঠায় প্রতি ফাইল 2GB; মূল মোট 6GB প্রতি কাজের সীমা নিশ্চিত নয়। Text-to-Speech Video ও Voiceover Maker উৎসের দৈর্ঘ্য তিন মিনিট বলে। প্রতি ধাপের সীমা ও স্থানান্তর আলাদা দেখুন।
Recapo একটি বিকল্প। শুধু captions চাইলে নির্দিষ্ট কাজের টুলও যথেষ্ট হতে পারে। প্রতি সপ্তাহে স্ক্রিপ্ট, কণ্ঠ, clips, captions, vertical crop ও cover চাইলে চার-পাঁচ সেবার মধ্যে স্থানান্তর কমানো উপকারী হতে পারে। তবু প্রকাশ্য editor পৃষ্ঠার এক-chat ভাষা ও আলাদা টুলের FAQ থাকায় পুরো workflow নিজে পরীক্ষা করুন। Pricing বর্তমান পৃষ্ঠায় দেখুন এবং একটি প্রকৃত স্ক্রিপ্টে সময়, output ও সংশোধন মাপুন।
সাধারণ প্রশ্ন
নির্মাতাদের AI narration workflow কী?
স্ক্রিপ্ট থেকে মুখ না দেখিয়ে ভিডিও তৈরির পুনর্ব্যবহারযোগ্য প্রক্রিয়া: পরিষ্কার শুরু, AI voiceover, সংশ্লিষ্ট দৃশ্য, ক্যাপশন, প্রয়োজনে উল্লম্ব reframe ও কভার। সব ধাপে AI আবশ্যক নয়; উদ্দেশ্য প্রতি upload-এ অপ্রয়োজনীয় নতুন ব্যবস্থা এড়ানো।
স্ক্রিপ্ট, voiceover ও সম্পাদনায় আলাদা টুল দরকার?
নিতে পারেন। কিছু সেবা সরাসরি যুক্ত, অন্যটিতে export ও re-upload লাগে। কম জায়গায় কাজ করলে স্থানান্তর কমতে পারে, কিন্তু একটি workspace হলেই মান বা গতি নিশ্চিত নয়। সমর্থিত ফরম্যাট, নিয়ন্ত্রণ ও প্রকৃত মোট সময়ে বাছুন।
বর্ণনার স্ক্রিপ্ট কত দীর্ঘ হবে?
আগে সময় ঠিক করুন। ইংরেজির উদাহরণে মিনিটে 150 শব্দে 60 সেকেন্ডের জন্য প্রায় 150 ও পাঁচ মিনিটে 750 শব্দ হয়। বাংলা/হিন্দি, pauses, সংখ্যা ও নির্বাচিত কণ্ঠে প্রকৃত সময় বদলাবে। নমুনা তৈরি করে নিজের হার মেপে লিখুন।
AI বর্ণনা robotic শোনানো আটকাব কীভাবে?
এক মূল ধারণার বাক্য লিখুন, সঠিক ভাষা/কণ্ঠ বাছুন, কঠিন নামে pronunciation নির্দেশ দিন এবং গতি ও pauses শুনুন। সংশোধিত লাইন আবার বানিয়ে আশপাশের কণ্ঠের সঙ্গে মেলান। TTS-এর ধ্বনিগত spelling ক্যাপশনে দেবেন না। Engine আবেগ বা উচ্চারণ সামলাতে না পারলে অন্য কণ্ঠ বা মানুষের রেকর্ডিং নিন।
সব faceless ফরম্যাটে এই ধাপ চলে?
Explainer, তালিকা, recap ও tutorial-এ ভিত্তিটি উপকারী, কিন্তু শুধু দৃশ্যের উৎস নয়, ক্রমও বদলাতে পারে। বর্ণনাপ্রধান ভিডিওতে স্ক্রিপ্ট ও কণ্ঠ আগে, সঠিক demonstration-এ footage-এর সময় আগে স্থির হতে পারে। সবার ক্ষেত্রে অর্থ, synchronization ও শেষ পর্যালোচনা রাখুন।
পুরো প্রক্রিয়া পরীক্ষা করবেন? বিনামূল্যে অ্যাকাউন্ট খুলুন, প্রকৃত স্ক্রিপ্ট ও ব্যবহারের অধিকার আছে এমন দৃশ্য-উৎস নিয়ে উপলব্ধ টুলে AI voiceover, clips, captions, 9:16 ও cover করে export করুন। প্রতি ধাপের সীমা, সময় ও শেষ ফাইল দেখুন। প্রকাশে বর্তমান AI disclosure নিয়ম প্রয়োগ করুন: YouTube-এ বাস্তব ব্যক্তি বা ঘটনাকে অর্থপূর্ণভাবে বদলানো বাস্তবসম্মত AI কনটেন্টে disclosure লাগতে পারে; শুধু script সহায়তা বা নিজের কণ্ঠ clone-এর মতো উদাহরণ আলাদা। নিচের সরকারি নির্দেশনার সঙ্গে নিজের ব্যবহার মেলান।
তথ্যসূত্র ও সরকারি উৎস
- YouTube: AI দিয়ে বদলানো বা তৈরি কনটেন্টের প্রকাশ
- YouTube সহায়তা: সাবটাইটেল ও ক্যাপশন যোগ
- YouTube: প্রস্তাবিত upload encoding settings
- Recapo.ai: পণ্য ও বর্তমান আপলোড সীমা
- Recapo.ai: AI Video Editor


