مسیر پیشنهادی برای کسی است که استفاده از خط فرمان را میپذیرد و میخواهد فایل صوتی را برای پردازش به یک سرویس آنلاین نفرستد. اگر فقط یک یادداشت کوتاه روی گوشی دارید، این مسیر ممکن است بیش از نیازتان پیچیده باشد. نصب اولیه و دریافت مدل اینترنت میخواهد؛ هدف از «آفلاین» در این نوشته، پردازش بعدی با ابزار و مدل دریافتشده روی رایانه است، نه نصب بدون اینترنت یا تضمین امنیت همه برنامههای نصبشده.
پاسخ کوتاه: برای تبدیل صوت فارسی چه لازم داریم؟
به فایل صوتی سالم، محیط اجرای Python، ابزار FFmpeg و بسته رسمی openai-whisper نیاز دارید. یک مدل چندزبانه انتخاب میکنید، زبان را فارسی و وظیفه را رونویسی میگذارید و خروجی متنی یا زیرنویس میگیرید. مدلهای دارای پسوند en مخصوص انگلیسیاند و انتخاب مناسبی برای این کار نیستند. راهنمای رسمی نصب و مدلها در مخزن Whisper در دسترس است. این مقاله گزارش آزمون سرعت یا مقایسه تجربی مدلها نیست؛ دستورها از مستندات پروژه و مثالها برای آموزش تنظیم شدهاند.
قبل از نصب، نتیجه مورد انتظار را در یک جمله بنویسید. مثلاً «از این مصاحبه، متن وفادار به گفتار و زیرنویس فارسی برای نسخه نهایی ویدیو میخواهم». همین تعریف ساده جلوی چند اشتباه را میگیرد: خلاصه را جای رونویسی تحویل نمیدهید، ترجمه را با متن فارسی اشتباه نمیگیرید و زیرنویس نسخه خام را روی ویدیوی تدوینشده نمیگذارید. پیشنهاد عملی ما این است که اول یک نمونه کوتاه را تا مرحله تحویل پیش ببرید، بعد فایل اصلی را وارد چرخه کنید.
رونویسی، متن ویرایششده و زیرنویس یک چیز نیستند
رونویسی وفادار برای مراجعه به منبع
در رونویسی وفادار، اصل این است که خواننده بفهمد واقعاً چه گفته شده است. اگر گوینده جملهای را ناتمام رها کرده، شما نباید برای زیباتر شدن متن نتیجه آن را حدس بزنید. اگر عددی مبهم است، علامت ابهام همراه زمان بگذارید. برای مثال، «ارسال سفارش در [عدد نامفهوم؛ دقیقه ۰۴:۱۲] روز انجام میشود» از یک عدد خوشظاهر اما اشتباه بهتر است. این نسخه مرجع بازبینی است و بهتر است جدا از متنی نگه داشته شود که قرار است در سایت منتشر کنید.
نسخه خواندنی برای وب و نسخه زماندار برای ویدیو
نسخه خواندنی میتواند تکیهکلامها و تکرارهای بیاثر را کمتر کند، اما نباید معنی را عوض کند. جمله «فکر کنم هفته بعد آماده بشه» نباید به «هفته آینده آماده میشود» تبدیل شود؛ قطعیت تازهای به حرف گوینده افزودهاید. زیرنویس محدودیت دیگری هم دارد: متن باید در زمان حضور روی تصویر خوانده شود. بنابراین متن مناسب مقاله الزاماً زیرنویس مناسب نیست. سه نام جدا مانند «رونویسی خام»، «متن بازبینیشده» و «زیرنویس نهایی» انتخاب کنید تا نسخهها هنگام ارسال برای همکار جابهجا نشوند.
آمادهسازی فایل قبل از اجرای مدل
یک نسخه اصلی دستنخورده نگه دارید
پوشهای برای پروژه بسازید و فایل ضبطشده را در بخش ورودی نگه دارید. روی یک کپی کار کنید؛ حذف سکوت، تغییر بلندی صدا و برش فایل را روی نسخه اصلی انجام ندهید. نام فایل باید بهسادگی قابل تشخیص باشد، مثلاً interview-original.mp3 و interview-sample.wav. در یک یادداشت کوتاه بنویسید فایل از کجا آمده، نسخه ویدیو کدام است و قرار است چه خروجیای تحویل شود. این اطلاعات وقتی چند بار خروجی میگیرید از انتخاب اشتباه فایل جلوگیری میکند و بازگشت به مرحله قبلی را ممکن نگه میدارد.
صدای ابتدا، میانه و پایان را گوش کنید. بررسی کنید فایل واقعاً گفتار دارد، انتهای آن قطع نشده و صدای نفر دوم آنقدر کم نیست که نتوانید بشنوید. اگر موسیقی روی حرفها قرار گرفته، صرفاً بزرگتر کردن مدل را درمان قطعی فرض نکنید. اول نسخهای با صدای گفتار واضحتر را از منبع بخواهید. برای ضبطهای بعدی، پیشنهاد ما نزدیکتر کردن میکروفون به گوینده، حذف مزاحمت محیط و ضبط آزمایشی کوتاه است؛ نتیجه همان نمونه را با گوش ارزیابی کنید، نه فقط با شکل موجی که نرمافزار نمایش میدهد.

نمونه آزمایشی باید نماینده فایل باشد
سی ثانیه اول همیشه نمونه خوبی نیست؛ ممکن است فقط معرفی برنامه یا موسیقی باشد. قطعهای انتخاب کنید که گفتار معمول، یک اسم خاص و کمی از دشواری واقعی فایل را داشته باشد. اگر مصاحبه دو نفره است، از حرف هر دو نفر نمونه بگیرید. برای محتوای آموزشی، بخشی با اصطلاح تخصصی انتخاب کنید. هدف این نیست که مدل را در آسانترین شرایط موفق نشان دهید، بلکه میخواهید پیش از صرف زمان برای فایل کامل بفهمید خروجی چقدر ویرایش میخواهد و کدام نوع خطا باید در بازبینی جدیتر گرفته شود.
نصب Whisper و بررسی آماده بودن محیط
برای جزئیات سازگاری نسخههای Python و PyTorch به راهنمای رسمی همان نسخه مراجعه کنید. یک محیط مجازی جدا، نصب این پروژه را از بستههای کارهای دیگر جدا نگه میدارد. نمونه زیر برای ساخت محیط در ویندوز است؛ پس از ساخت، بدون تغییر سیاست اجرای PowerShell میتوان مفسر داخل آن را مستقیماً فراخوانی کرد. اگر فرمان py پیدا نشد، ابتدا نصب و مسیر Python را بررسی کنید. این دستورها فایل صوتی شما را حذف یا بازنویسی نمیکنند.
py -m venv .venv
.venv\Scripts\python.exe -m pip install -U openai-whisper
ffmpeg -version
.venv\Scripts\whisper.exe --help
در macOS یا لینوکس، معمولاً ساخت محیط با python3 -m venv .venv انجام میشود و فایلهای اجرایی محیط در شاخه bin قرار میگیرند. FFmpeg را از مسیرهای معرفیشده در وبسایت رسمی FFmpeg متناسب با سیستمعامل نصب کنید. صفحه راهنمای ابزار باید بدون خطای «فرمان پیدا نشد» نمایش داده شود. داشتن آیکن یک برنامه با نام مشابه در دسکتاپ کافی نیست؛ فرمان مورد نیاز باید از محیطی که تبدیل را اجرا میکنید قابل دسترسی باشد.
اگر نصب با خطا تمام شد، متن آخرین خطا را بخوانید و همان مسئله را حل کنید. چند دستور ناشناس از انجمنهای مختلف را پشت سر هم اجرا نکنید؛ بعداً معلوم نمیشود کدام تغییر مشکل را ایجاد کرده است. نام محیط، نسخه Python و دستور ناموفق را در یادداشت پروژه ثبت کنید. اطلاعات حساس، مسیرهای خصوصی و نام افراد را پیش از فرستادن گزارش خطا برای دیگران حذف کنید. در رایانه کاری نیز محدودیت نصب نرمافزار را دور نزنید؛ از مسئول مجاز همان محیط کمک بگیرید.
اولین تبدیل صوت به متن فارسی با Whisper
برای نمونه اولیه، فایل sample.mp3 را در پوشه کاری بگذارید. این مثال مدل چندزبانه small را با پردازنده مرکزی اجرا میکند و همه قالبهای خروجی پشتیبانیشده را در پوشه جدا مینویسد. انتخاب small در اینجا یک نقطه شروع آموزشی است، نه ادعای بهترین دقت فارسی روی هر دستگاه. در اجرای اول، اگر وزن مدل موجود نباشد دریافت میشود. گزینههای خط فرمان را میتوانید در کد رسمی بخش transcribe بررسی کنید.
.venv\Scripts\whisper.exe "sample.mp3" --model small --language fa --task transcribe --device cpu --fp16 False --output_format all --output_dir "output-sample"
پس از پایان، فقط به پیام موفقیت تکیه نکنید. فایل متنی را باز کنید، از داشتن محتوای فارسی مطمئن شوید و دو یا سه جمله را با صدای اصلی تطبیق دهید. سپس زیرنویس را همراه همان فایل پخش کنید. اگر خروجی خالی است یا فقط جملهای تکراری دارد، هنوز آماده پردازش انبوه نیستید. نام فایل ورودی، محل خروجی و تنظیمات را کنترل کنید. برای اجرای فایل کامل، نام sample.mp3 و پوشه خروجی را عوض کنید تا خروجی آزمایش و پروژه اصلی با هم مخلوط نشوند.
چه زمانی سراغ مدل دیگر برویم؟
اول خطاها را دستهبندی کنید. اگر فقط نام یک شرکت اشتباه است، ممکن است اصلاح هدفمند آن از اجرای دوباره کل فایل بهتر باشد. اگر جملههای معمول هم پیوسته غلطاند، نمونه را با مدل دیگری مقایسه کنید. اگر متن درست است اما دستگاه بسیار کند کار میکند، مسئله شما سرعت است، نه لزوماً دقت. معیار تصمیم را زمان کل کار قرار دهید: آمادهسازی، پردازش و ویرایش. مدلی که خروجی را زودتر میدهد ولی بازبینی بیشتری میخواهد، الزاماً پروژه را زودتر تمام نمیکند.
برای مقایسه منصفانه، همان قطعه صوتی را بدون تغییر کیفیت ورودی به دو مدل بدهید. در یک جدول ساده، زمان اجرا، خطاهای معنایی، اسمهای اشتباه و زمان اصلاح را ثبت کنید. این اعداد مربوط به نمونه و رایانه شما هستند؛ آنها را به همه فایلهای فارسی تعمیم ندهید. اگر موضوع یا گوینده عوض شد، آزمایش کوتاه را تکرار کنید. جدول سرعت مستندات پروژه نیز جای اندازهگیری روی دستگاه خودتان را نمیگیرد، چون شرایط سختافزار و فایل یکسان نیست.
اصلاح خطاهای فارسی بدون تحریف گفتار
نامها، عددها و جملههای منفی را اول بررسی کنید
همه اشتباهها اهمیت یکسان ندارند. جابهجایی «ی» و «ي» ظاهر متن را ناهماهنگ میکند، اما حذف «نـ» از «نمیشود» معنی را برعکس میکند. در دور اول بازبینی، نام افراد، نام محصول، تاریخ، مقدار، واحد و جملههای منفی را کنترل کنید. بعد به نشانهگذاری و فاصلهها برسید. اگر منبعی برای املای نام ندارید، از حدس زدن پرهیز کنید. زمان همان بخش را یادداشت کنید تا صاحب محتوا بتواند سؤال مشخصی را پاسخ دهد، نه اینکه کل مصاحبه را دوباره بخواند.
مثال آموزشی: گوینده میگوید «این فایل را برای مشتری نفرستادیم» اما خروجی «این فایل را برای مشتری فرستادیم» است. یک اصلاح نگارشی خودکار ممکن است هر دو جمله را کاملاً درست بداند. تنها مراجعه به صدا اختلاف را حل میکند. همین قاعده برای «پانزده» و «پنجاه» یا «میلیون» و «میلیارد» هم مهم است. پیشنهاد میکنیم خطاهای معنایی را با برچسب جدا ثبت کنید؛ شمارش همه غلطها در یک ستون، اهمیت این تفاوتها را پنهان میکند.
واژهنامه پروژه، نه فهرست کلمات تحمیلی
قبل از ویرایش، فهرستی کوتاه از نامها و اصطلاحات واقعی پروژه تهیه کنید. برای هر مورد، شکل نوشتاری مورد توافق را ثبت کنید و اگر تلفظ ابهام دارد به بخش مربوط در صدا ارجاع دهید. در Whisper گزینه initial_prompt میتواند برای فراهم کردن زمینه و واژههای خاص به کار رود؛ تضمینی برای درست نوشتن نیست. توضیح این گزینه در کد رسمی آمده است. واژهنامه را با اطلاعاتی پر نکنید که احتمال میدهید گوینده گفته باشد؛ ابتدا وجود آنها در پروژه را تأیید کنید.
در مرحله ویرایش، برای هر اصطلاح یک تصمیم ثابت بگیرید. اگر نام نرمافزار را لاتین مینویسید، در نیمه دوم متن بیدلیل به آوانویسی فارسی تغییرش ندهید. عددها را نیز مطابق مقصد تحویل یکدست کنید. با این حال، کد سفارش، شماره نسخه و رشته فنی را صرفاً برای زیبایی تغییر ندهید. یکدستسازی باید خواندن را آسان کند، نه اینکه شناسهای را خراب کند. در متنهای طولانی، جستوجوی شکلهای مختلف همان نام میتواند موارد جاافتاده را پیدا کند؛ نتیجه جایگزینی دستهجمعی را هم بازبینی کنید.
چرا مدل گاهی در سکوت جمله میسازد؟
در کارت رسمی مدل، تولید متنی که واقعاً در صوت گفته نشده و همچنین تکرار متن از محدودیتهای Whisper شمرده شده است. بنابراین روان بودن یک جمله نشانه وجود آن در فایل نیست. این محدودیت برای بازبینی بخشهای سکوت، موسیقی و صدای نامفهوم مهم است. توضیح کامل در کارت مدل Whisper آمده است. هیچ تنظیمی را بدون بررسی خروجی به عنوان راهحل قطعی همه خطاها معرفی نکنید.
روش پیشنهادی ما برای مواجهه با چنین بخشهایی ساده است: ابتدا زمان جمله مشکوک را پیدا کنید، چند ثانیه قبل و بعد را بشنوید و تصمیم را براساس فایل اصلی بگیرید. اگر گفتاری وجود ندارد، جمله ساختهشده را حذف کنید. اگر گفتار نامفهوم است، از برچسب ابهام استفاده کنید. اگر سکوت طولانی را از نسخه مخصوص رونویسی میبرید، توجه داشته باشید که زمانهای آن نسخه دیگر مستقیماً با ویدیوی اصلی برابر نیست. برای زیرنویس، هماهنگی زمان را فدای تمیز شدن ظاهری متن نکنید.
ساخت زیرنویس قابل استفاده، فراتر از گرفتن SRT
خروجی SRT را کنار ویدیوی همان نسخه باز کنید. در بازبینی اول، دنبال این باشید که هر قطعه همزمان با جمله مربوط دیده شود. در بازبینی دوم، فقط خوانایی را بررسی کنید: آیا برای خواندن جمله فرصت هست؟ آیا شکست سطر وسط ترکیب نامأنوس قرار گرفته؟ آیا زیرنویس روی نوشته مهم ویدیو میافتد؟ اینها تصمیمهای ویرایشیاند و خروجی گرفتن خودکار بهتنهایی آنها را حل نمیکند. اگر مخاطب بیشتر با موبایل میبیند، نسخه نهایی را روی صفحه کوچک هم ببینید.

جمله را براساس معنی تقسیم کنید
مثلاً جمله «برای دریافت خروجی درست، ابتدا زبان فایل را مشخص کنید و سپس نتیجه را بازبینی کنید» را میتوان در مرز دو بخش معنایی تقسیم کرد. شکستن آن بعد از «را» یا جدا کردن «خروجی» از «درست» خواندن را سختتر میکند. برای همه ویدیوها یک عدد ثابت به عنوان طول مجاز هر سطر تعیین نکنید؛ اندازه تصویر، فونت، مخاطب و دستورالعمل مقصد مؤثرند. اگر مقصد انتشار راهنمای زیرنویس دارد، آن راهنما مبنای تنظیم باشد و سپس خوانایی واقعی را بررسی کنید.
تدوین و زیرنویس باید نسخه یکسان داشته باشند
اگر تدوینگر چند ثانیه از وسط ویدیو حذف کند، زیرنویس قبلی از همان نقطه ممکن است جابهجا شود. تغییر عنوان فایل مشکل را حل نمیکند. در تحویل نهایی، نام نسخه ویدیو را کنار نام زیرنویس ثبت کنید و پس از هر تغییر تدوین، نقاط قبل و بعد از برش را ببینید. اگر همه زیرنویسها به یک اندازه جابهجا هستند، احتمالاً با یک تأخیر ثابت روبهرو هستید؛ اگر اختلاف بهتدریج زیاد میشود یا بعد از برش شروع میشود، باید تطبیق نسخه و زمانبندی را دقیقتر بررسی کنید.
گفتوگوی چندنفره را چطور مدیریت کنیم؟
رونویسی کلمات را با شناسایی قطعی گوینده یکی ندانید. نامگذاری خودکار افراد به بررسی جدا نیاز دارد و نباید از خروجی ساده این دستور انتظار تأیید هویت داشت. برای پروژهای که نام اشخاص اهمیت دارد، در ابتدا فقط برچسبهای کاری مانند «گوینده اول» و «گوینده دوم» بگذارید و هر انتساب را از منبع قابل اتکا تأیید کنید. صدای مشابه، حرف زدن همزمان و جملههای کوتاه میتواند تصمیم شنونده را هم دشوار کند؛ ابهام را با اعتمادبهنفس ظاهری پنهان نکنید.
برای مصاحبههای بعدی، پیشنهاد میکنیم گویندگان در ابتدای ضبط خودشان را معرفی کنند و اگر تجهیزات اجازه میدهد صداها جداگانه ثبت شوند. این پیشنهاد یک روش تولید محتواست، نه تضمین تشخیص بیخطا. در فایل موجود، زمانی که دو نفر همزمان حرف میزنند، همان بخش را برای بازبینی علامت بزنید. اگر از محتوای مصاحبه نقلقول میسازید، تنها بخشهایی را انتخاب کنید که هم متن و هم گوینده آن روشن است. جذاب بودن جمله مجوز نسبت دادن احتمالی آن به شخص نیست.
حریم خصوصی در اجرای محلی را جدی بگیرید
پیش از پردازش، درباره رضایت ضبط و استفاده از محتوا مطمئن شوید. اجرای محلی به معنی داشتن اجازه برای رونویسی هر مکالمه نیست. اگر فایل متعلق به سازمان است، قواعد همان سازمان درباره نگهداری و دسترسی را رعایت کنید. کارت مدل نیز نسبت به رونویسی افراد بدون رضایت و کاربردهای پرخطر هشدار میدهد. این راهنما برای تولید متن و زیرنویس است و خروجی خودکار را برای تصمیم پزشکی، حقوقی یا تصمیم مهم درباره افراد معتبر فرض نمیکند.
محلی بودن ابزار فقط یک بخش از مسیر داده است. ممکن است پوشه پروژه با یک فضای ابری همگام شود یا نسخه خروجی را در پیامرسان بفرستید. بنابراین مسیر فایل را از دریافت تا تحویل رسم کنید: چه کسی به اصل صدا دسترسی دارد، متن کجا ذخیره میشود و چه زمانی نسخههای کاری پاک خواهند شد؟ برای آزمایش تنظیمات از فایل غیرحساس استفاده کنید. اگر قرار است متن را برای خلاصهسازی به ابزار دیگری بدهید، آن مرحله انتقال تازهای است و باید جداگانه مجاز و بررسی شده باشد.
یک گردش کار پیشنهادی برای مصاحبه آموزشی
فرض کنید مصاحبهای درباره آموزش عکاسی دارید. در آغاز، نسخه نهایی ویدیو و فهرست املای نام دوربینها را دریافت کنید. یک نمونه شامل گفتار هر دو نفر انتخاب کنید و خروجی اولیه بگیرید. بعد از کنترل نامها و جملههای مهم، فایل کامل را پردازش کنید. متن خام را نگه دارید و نسخه دوم را برای ویرایش بسازید. در این نسخه، پاراگرافها را براساس موضوع جدا کنید، اما جملههای تازه یا توضیحاتی را که در مصاحبه نیست به نام گوینده ننویسید.
سپس از همان خروجی زماندار، زیرنویس را اصلاح کنید و روی ویدیوی نهایی ببینید. برای مقاله وب، بخشهای لازم را با تیترهای مستقل تنظیم کنید و اگر توضیح تکمیلی خودتان را اضافه میکنید آن را از نقلقول جدا نگه دارید. بسته تحویل بهتر است شامل متن خام، متن تأییدشده، زیرنویس نهایی و یادداشت ابهامها باشد. این سناریو مثال آموزشی است و ادعای انجام آزمایش روی مصاحبه واقعی یا صرفهجویی مشخص در زمان ندارد.
از متن تأییدشده چطور استفاده کنیم؟
پس از بازبینی میتوانید از متن برای پیدا کردن موضوعهای مقاله، ساخت فهرست پرسشها یا آمادهسازی یادداشت درس استفاده کنید. اگر میخواهید بین متنهای طولانی جستوجو کنید، راهنمای چت با فایلها در AnythingLLM مسیر دیگری را معرفی میکند؛ آن مرحله جای تأیید رونویسی را نمیگیرد. اگر نیاز اصلی شما کار روی موبایل است، معرفی برنامه ویرا برای اندروید را ببینید. انتخاب ابزار بعدی باید از نیاز واقعی شما بیاید، نه صرفاً اضافه کردن یک سرویس دیگر.
برای تبدیل مصاحبه به مقاله، از خودتان بپرسید کدام سؤال خواننده در صوت واقعاً پاسخ گرفته است. متن را براساس آن سؤال مرتب کنید و قسمتهای حاشیهای را جدا بگذارید. اگر پاسخ ناقص است، نیاز به تحقیق تکمیلی دارید؛ مدل نباید شکاف را با نقلقول ساختگی پر کند. برای هر نقلقول مهم، زمان منبع را در نسخه کاری نگه دارید. این کار حتی وقتی زمانها در مقاله منتشر نمیشوند، بررسی بعدی و اصلاح احتمالی را بسیار سادهتر میکند.
چکلیست تحویل و معیار قبول خروجی
معیار قبول را قبل از شروع تعیین کنید. برای یک یادداشت شخصی ممکن است چند واژه نامفهوم قابل قبول باشد، ولی در یک آموزش منتشرشده، نام ابزار و دستور اجرایی باید بررسی شود. پیشنهاد ما این است که یک نفر متن را همراه صدا بازبینی کند و در پروژههای مهم، فرد دیگری فقط بخشهای حساس و مبهم را کنترل کند. این بازبینی باید وظیفه مشخص داشته باشد؛ جمله «یک نگاه بینداز» معمولاً معلوم نمیکند چه چیزی واقعاً تأیید شده است.
- ورودی و زیرنویس مربوط به یک نسخه ویدیو هستند.
- عددها، نامها، واحدها و جملههای منفی با صوت تطبیق داده شدهاند.
- جملههای ساختهشده در سکوت و تکرارهای بیمنبع حذف شدهاند.
- ابهامها علامت دارند و به جای آنها حدس منتشر نشده است.
- ابتدا، میانه، پایان و محل برشهای ویدیو از نظر هماهنگی بررسی شدهاند.
- مجوز استفاده از صدا و مسیر تحویل فایل روشن است.
پرسشهای متداول
آیا Whisper برای فارسی دقت صددرصد دارد؟
خیر. در این مقاله هیچ درصدی برای دقت فارسی وعده داده نمیشود. کیفیت را روی نمونه واقعی خودتان بررسی کنید و خطاهای مهم را جدا از غلطهای ظاهری بشمارید. حتی متنی که بیشتر جملههای آن درست است ممکن است یک عدد یا نفی مهم را اشتباه نوشته باشد. برای انتشار، مراجعه به فایل صوتی همچنان بخشی از کار است.
آیا بدون کارت گرافیک هم میتوان شروع کرد؟
مثال این راهنما برای اجرای CPU تنظیم شده است، اما زمان اجرا را باید روی دستگاه خودتان بسنجید. برای شروع، نمونه کوتاه و مدل کوچکتر را امتحان کنید. اگر هدف شما پردازش حجم زیاد است، پیش از خرید سختافزار زمان کل کار و نیاز واقعی را اندازه بگیرید؛ این مقاله توصیه خرید یا تضمین سرعت ارائه نمیکند.
چرا خروجی فارسی به انگلیسی تبدیل شده است؟
وظیفه انتخابشده را کنترل کنید؛ برای نگه داشتن زبان گفتار باید رونویسی را بخواهید، نه ترجمه. در دستور این راهنما task برابر transcribe است و language برابر fa قرار دارد. همچنین نام مدل را بررسی کنید تا نسخه مخصوص انگلیسی انتخاب نشده باشد. اگر از رابط دیگری استفاده میکنید، برچسب گزینهها ممکن است متفاوت باشد.
آیا گرفتن SRT یعنی زیرنویس آماده انتشار است؟
نه. SRT خروجی زماندار اولیه است. باید متن، شکست سطر، زمان نمایش و هماهنگی با نسخه نهایی ویدیو را بررسی کنید. اگر تدوین تغییر کند، دوباره تطبیق لازم میشود. زیرنویسی که در فایل متنی مرتب به نظر میرسد ممکن است هنگام پخش بسیار سریع یا دیر نمایش داده شود.
با جمله نامفهوم چه کنیم؟
چند ثانیه قبل و بعد را گوش کنید و در صورت امکان از صاحب محتوا بپرسید. اگر ابهام باقی ماند، آن را با زمان مشخص ثبت کنید. پاسخ مدل دوم بهتنهایی تأیید جمله نیست؛ ممکن است همان حدس را تکرار کند. در متن منتشرشده، حذف بخشی که قابل تأیید نیست از نسبت دادن یک جمله نادرست بهتر است، به شرط آنکه حذف معنی نقلقول را تحریف نکند.
جمعبندی
تبدیل صوت به متن فارسی با Whisper زمانی مفید است که خروجی خودکار را شروع کار بدانید. نمونه کوتاه بگیرید، تنظیمات را ثبت کنید، متن را با صدا بسنجید و زیرنویس را روی نسخه نهایی ویدیو ببینید. برای فایل بعدی، همان معیارهای تأیید را دوباره به کار ببرید، نه اینکه نتیجه خوب یک آزمایش را تضمین همیشگی فرض کنید. کیفیت نهایی از ترکیب ورودی مناسب، انتخاب متناسب ابزار و بازبینی روشن به دست میآید.
تاریخ بررسی منابع: ۲۴ سپتامبر ۲۰۲۶. منابع فنی: مخزن رسمی Whisper، کد transcribe، کارت مدل و وبسایت FFmpeg که در بخشهای مرتبط پیوند شدهاند. تصاویر این مقاله تصویرسازی اختصاصی تولیدشده با هوش مصنوعیاند و نمای واقعی محیط نرمافزار نیستند.

