صفحه اصلی > نرم‌افزارهای AI و نرم‌افزارهای ویندوز و دسکتاپ : تبدیل صوت به متن فارسی با Whisper؛ راهنمای اجرای آفلاین و ساخت زیرنویس

تبدیل صوت به متن فارسی با Whisper؛ راهنمای اجرای آفلاین و ساخت زیرنویس

تصویرسازی میکروفون و لپ‌تاپ با موج صدا که به برگه‌های متن تبدیل می‌شود
یک فایل مصاحبه دارید و می‌خواهید هم متن قابل ویرایش آن را تحویل بگیرید، هم زیرنویسی که روی ویدیو بنشیند. مشکل معمولاً فقط پیدا کردن دکمه «تبدیل» نیست: اسم مهمان اشتباه نوشته می‌شود، جمله‌های سکوت به متن راه پیدا می‌کنند و زیرنویس چند ثانیه از صدا عقب می‌ماند. در این راهنما تبدیل صوت به متن فارسی با Whisper را به یک فرایند قابل بررسی تقسیم می‌کنیم؛ از آماده کردن فایل و اجرای محلی تا اصلاح متن و تحویل زیرنویس.

مسیر پیشنهادی برای کسی است که استفاده از خط فرمان را می‌پذیرد و می‌خواهد فایل صوتی را برای پردازش به یک سرویس آنلاین نفرستد. اگر فقط یک یادداشت کوتاه روی گوشی دارید، این مسیر ممکن است بیش از نیازتان پیچیده باشد. نصب اولیه و دریافت مدل اینترنت می‌خواهد؛ هدف از «آفلاین» در این نوشته، پردازش بعدی با ابزار و مدل دریافت‌شده روی رایانه است، نه نصب بدون اینترنت یا تضمین امنیت همه برنامه‌های نصب‌شده.

پاسخ کوتاه: برای تبدیل صوت فارسی چه لازم داریم؟

به فایل صوتی سالم، محیط اجرای Python، ابزار FFmpeg و بسته رسمی openai-whisper نیاز دارید. یک مدل چندزبانه انتخاب می‌کنید، زبان را فارسی و وظیفه را رونویسی می‌گذارید و خروجی متنی یا زیرنویس می‌گیرید. مدل‌های دارای پسوند en مخصوص انگلیسی‌اند و انتخاب مناسبی برای این کار نیستند. راهنمای رسمی نصب و مدل‌ها در مخزن Whisper در دسترس است. این مقاله گزارش آزمون سرعت یا مقایسه تجربی مدل‌ها نیست؛ دستورها از مستندات پروژه و مثال‌ها برای آموزش تنظیم شده‌اند.

قبل از نصب، نتیجه مورد انتظار را در یک جمله بنویسید. مثلاً «از این مصاحبه، متن وفادار به گفتار و زیرنویس فارسی برای نسخه نهایی ویدیو می‌خواهم». همین تعریف ساده جلوی چند اشتباه را می‌گیرد: خلاصه را جای رونویسی تحویل نمی‌دهید، ترجمه را با متن فارسی اشتباه نمی‌گیرید و زیرنویس نسخه خام را روی ویدیوی تدوین‌شده نمی‌گذارید. پیشنهاد عملی ما این است که اول یک نمونه کوتاه را تا مرحله تحویل پیش ببرید، بعد فایل اصلی را وارد چرخه کنید.

رونویسی، متن ویرایش‌شده و زیرنویس یک چیز نیستند

رونویسی وفادار برای مراجعه به منبع

در رونویسی وفادار، اصل این است که خواننده بفهمد واقعاً چه گفته شده است. اگر گوینده جمله‌ای را ناتمام رها کرده، شما نباید برای زیباتر شدن متن نتیجه آن را حدس بزنید. اگر عددی مبهم است، علامت ابهام همراه زمان بگذارید. برای مثال، «ارسال سفارش در [عدد نامفهوم؛ دقیقه ۰۴:۱۲] روز انجام می‌شود» از یک عدد خوش‌ظاهر اما اشتباه بهتر است. این نسخه مرجع بازبینی است و بهتر است جدا از متنی نگه داشته شود که قرار است در سایت منتشر کنید.

نسخه خواندنی برای وب و نسخه زمان‌دار برای ویدیو

نسخه خواندنی می‌تواند تکیه‌کلام‌ها و تکرارهای بی‌اثر را کمتر کند، اما نباید معنی را عوض کند. جمله «فکر کنم هفته بعد آماده بشه» نباید به «هفته آینده آماده می‌شود» تبدیل شود؛ قطعیت تازه‌ای به حرف گوینده افزوده‌اید. زیرنویس محدودیت دیگری هم دارد: متن باید در زمان حضور روی تصویر خوانده شود. بنابراین متن مناسب مقاله الزاماً زیرنویس مناسب نیست. سه نام جدا مانند «رونویسی خام»، «متن بازبینی‌شده» و «زیرنویس نهایی» انتخاب کنید تا نسخه‌ها هنگام ارسال برای همکار جابه‌جا نشوند.

آماده‌سازی فایل قبل از اجرای مدل

یک نسخه اصلی دست‌نخورده نگه دارید

پوشه‌ای برای پروژه بسازید و فایل ضبط‌شده را در بخش ورودی نگه دارید. روی یک کپی کار کنید؛ حذف سکوت، تغییر بلندی صدا و برش فایل را روی نسخه اصلی انجام ندهید. نام فایل باید به‌سادگی قابل تشخیص باشد، مثلاً interview-original.mp3 و interview-sample.wav. در یک یادداشت کوتاه بنویسید فایل از کجا آمده، نسخه ویدیو کدام است و قرار است چه خروجی‌ای تحویل شود. این اطلاعات وقتی چند بار خروجی می‌گیرید از انتخاب اشتباه فایل جلوگیری می‌کند و بازگشت به مرحله قبلی را ممکن نگه می‌دارد.

صدای ابتدا، میانه و پایان را گوش کنید. بررسی کنید فایل واقعاً گفتار دارد، انتهای آن قطع نشده و صدای نفر دوم آن‌قدر کم نیست که نتوانید بشنوید. اگر موسیقی روی حرف‌ها قرار گرفته، صرفاً بزرگ‌تر کردن مدل را درمان قطعی فرض نکنید. اول نسخه‌ای با صدای گفتار واضح‌تر را از منبع بخواهید. برای ضبط‌های بعدی، پیشنهاد ما نزدیک‌تر کردن میکروفون به گوینده، حذف مزاحمت محیط و ضبط آزمایشی کوتاه است؛ نتیجه همان نمونه را با گوش ارزیابی کنید، نه فقط با شکل موجی که نرم‌افزار نمایش می‌دهد.

تصویرسازی دو میکروفون و ضبط‌کننده با موج‌های صوتی آبی و نارنجی
تصویرسازی آماده‌سازی صدای گفت‌وگو؛ کیفیت ورودی را پیش از پردازش بررسی کنید.

نمونه آزمایشی باید نماینده فایل باشد

سی ثانیه اول همیشه نمونه خوبی نیست؛ ممکن است فقط معرفی برنامه یا موسیقی باشد. قطعه‌ای انتخاب کنید که گفتار معمول، یک اسم خاص و کمی از دشواری واقعی فایل را داشته باشد. اگر مصاحبه دو نفره است، از حرف هر دو نفر نمونه بگیرید. برای محتوای آموزشی، بخشی با اصطلاح تخصصی انتخاب کنید. هدف این نیست که مدل را در آسان‌ترین شرایط موفق نشان دهید، بلکه می‌خواهید پیش از صرف زمان برای فایل کامل بفهمید خروجی چقدر ویرایش می‌خواهد و کدام نوع خطا باید در بازبینی جدی‌تر گرفته شود.

نصب Whisper و بررسی آماده بودن محیط

برای جزئیات سازگاری نسخه‌های Python و PyTorch به راهنمای رسمی همان نسخه مراجعه کنید. یک محیط مجازی جدا، نصب این پروژه را از بسته‌های کارهای دیگر جدا نگه می‌دارد. نمونه زیر برای ساخت محیط در ویندوز است؛ پس از ساخت، بدون تغییر سیاست اجرای PowerShell می‌توان مفسر داخل آن را مستقیماً فراخوانی کرد. اگر فرمان py پیدا نشد، ابتدا نصب و مسیر Python را بررسی کنید. این دستورها فایل صوتی شما را حذف یا بازنویسی نمی‌کنند.

py -m venv .venv
.venv\Scripts\python.exe -m pip install -U openai-whisper
ffmpeg -version
.venv\Scripts\whisper.exe --help

در macOS یا لینوکس، معمولاً ساخت محیط با python3 -m venv .venv انجام می‌شود و فایل‌های اجرایی محیط در شاخه bin قرار می‌گیرند. FFmpeg را از مسیرهای معرفی‌شده در وب‌سایت رسمی FFmpeg متناسب با سیستم‌عامل نصب کنید. صفحه راهنمای ابزار باید بدون خطای «فرمان پیدا نشد» نمایش داده شود. داشتن آیکن یک برنامه با نام مشابه در دسکتاپ کافی نیست؛ فرمان مورد نیاز باید از محیطی که تبدیل را اجرا می‌کنید قابل دسترسی باشد.

اگر نصب با خطا تمام شد، متن آخرین خطا را بخوانید و همان مسئله را حل کنید. چند دستور ناشناس از انجمن‌های مختلف را پشت سر هم اجرا نکنید؛ بعداً معلوم نمی‌شود کدام تغییر مشکل را ایجاد کرده است. نام محیط، نسخه Python و دستور ناموفق را در یادداشت پروژه ثبت کنید. اطلاعات حساس، مسیرهای خصوصی و نام افراد را پیش از فرستادن گزارش خطا برای دیگران حذف کنید. در رایانه کاری نیز محدودیت نصب نرم‌افزار را دور نزنید؛ از مسئول مجاز همان محیط کمک بگیرید.

اولین تبدیل صوت به متن فارسی با Whisper

برای نمونه اولیه، فایل sample.mp3 را در پوشه کاری بگذارید. این مثال مدل چندزبانه small را با پردازنده مرکزی اجرا می‌کند و همه قالب‌های خروجی پشتیبانی‌شده را در پوشه جدا می‌نویسد. انتخاب small در اینجا یک نقطه شروع آموزشی است، نه ادعای بهترین دقت فارسی روی هر دستگاه. در اجرای اول، اگر وزن مدل موجود نباشد دریافت می‌شود. گزینه‌های خط فرمان را می‌توانید در کد رسمی بخش transcribe بررسی کنید.

.venv\Scripts\whisper.exe "sample.mp3" --model small --language fa --task transcribe --device cpu --fp16 False --output_format all --output_dir "output-sample"

پس از پایان، فقط به پیام موفقیت تکیه نکنید. فایل متنی را باز کنید، از داشتن محتوای فارسی مطمئن شوید و دو یا سه جمله را با صدای اصلی تطبیق دهید. سپس زیرنویس را همراه همان فایل پخش کنید. اگر خروجی خالی است یا فقط جمله‌ای تکراری دارد، هنوز آماده پردازش انبوه نیستید. نام فایل ورودی، محل خروجی و تنظیمات را کنترل کنید. برای اجرای فایل کامل، نام sample.mp3 و پوشه خروجی را عوض کنید تا خروجی آزمایش و پروژه اصلی با هم مخلوط نشوند.

چه زمانی سراغ مدل دیگر برویم؟

اول خطاها را دسته‌بندی کنید. اگر فقط نام یک شرکت اشتباه است، ممکن است اصلاح هدفمند آن از اجرای دوباره کل فایل بهتر باشد. اگر جمله‌های معمول هم پیوسته غلط‌اند، نمونه را با مدل دیگری مقایسه کنید. اگر متن درست است اما دستگاه بسیار کند کار می‌کند، مسئله شما سرعت است، نه لزوماً دقت. معیار تصمیم را زمان کل کار قرار دهید: آماده‌سازی، پردازش و ویرایش. مدلی که خروجی را زودتر می‌دهد ولی بازبینی بیشتری می‌خواهد، الزاماً پروژه را زودتر تمام نمی‌کند.

برای مقایسه منصفانه، همان قطعه صوتی را بدون تغییر کیفیت ورودی به دو مدل بدهید. در یک جدول ساده، زمان اجرا، خطاهای معنایی، اسم‌های اشتباه و زمان اصلاح را ثبت کنید. این اعداد مربوط به نمونه و رایانه شما هستند؛ آن‌ها را به همه فایل‌های فارسی تعمیم ندهید. اگر موضوع یا گوینده عوض شد، آزمایش کوتاه را تکرار کنید. جدول سرعت مستندات پروژه نیز جای اندازه‌گیری روی دستگاه خودتان را نمی‌گیرد، چون شرایط سخت‌افزار و فایل یکسان نیست.

اصلاح خطاهای فارسی بدون تحریف گفتار

نام‌ها، عددها و جمله‌های منفی را اول بررسی کنید

همه اشتباه‌ها اهمیت یکسان ندارند. جابه‌جایی «ی» و «ي» ظاهر متن را ناهماهنگ می‌کند، اما حذف «نـ» از «نمی‌شود» معنی را برعکس می‌کند. در دور اول بازبینی، نام افراد، نام محصول، تاریخ، مقدار، واحد و جمله‌های منفی را کنترل کنید. بعد به نشانه‌گذاری و فاصله‌ها برسید. اگر منبعی برای املای نام ندارید، از حدس زدن پرهیز کنید. زمان همان بخش را یادداشت کنید تا صاحب محتوا بتواند سؤال مشخصی را پاسخ دهد، نه اینکه کل مصاحبه را دوباره بخواند.

مثال آموزشی: گوینده می‌گوید «این فایل را برای مشتری نفرستادیم» اما خروجی «این فایل را برای مشتری فرستادیم» است. یک اصلاح نگارشی خودکار ممکن است هر دو جمله را کاملاً درست بداند. تنها مراجعه به صدا اختلاف را حل می‌کند. همین قاعده برای «پانزده» و «پنجاه» یا «میلیون» و «میلیارد» هم مهم است. پیشنهاد می‌کنیم خطاهای معنایی را با برچسب جدا ثبت کنید؛ شمارش همه غلط‌ها در یک ستون، اهمیت این تفاوت‌ها را پنهان می‌کند.

واژه‌نامه پروژه، نه فهرست کلمات تحمیلی

قبل از ویرایش، فهرستی کوتاه از نام‌ها و اصطلاحات واقعی پروژه تهیه کنید. برای هر مورد، شکل نوشتاری مورد توافق را ثبت کنید و اگر تلفظ ابهام دارد به بخش مربوط در صدا ارجاع دهید. در Whisper گزینه initial_prompt می‌تواند برای فراهم کردن زمینه و واژه‌های خاص به کار رود؛ تضمینی برای درست نوشتن نیست. توضیح این گزینه در کد رسمی آمده است. واژه‌نامه را با اطلاعاتی پر نکنید که احتمال می‌دهید گوینده گفته باشد؛ ابتدا وجود آن‌ها در پروژه را تأیید کنید.

در مرحله ویرایش، برای هر اصطلاح یک تصمیم ثابت بگیرید. اگر نام نرم‌افزار را لاتین می‌نویسید، در نیمه دوم متن بی‌دلیل به آوانویسی فارسی تغییرش ندهید. عددها را نیز مطابق مقصد تحویل یکدست کنید. با این حال، کد سفارش، شماره نسخه و رشته فنی را صرفاً برای زیبایی تغییر ندهید. یکدست‌سازی باید خواندن را آسان کند، نه اینکه شناسه‌ای را خراب کند. در متن‌های طولانی، جست‌وجوی شکل‌های مختلف همان نام می‌تواند موارد جاافتاده را پیدا کند؛ نتیجه جایگزینی دسته‌جمعی را هم بازبینی کنید.

چرا مدل گاهی در سکوت جمله می‌سازد؟

در کارت رسمی مدل، تولید متنی که واقعاً در صوت گفته نشده و همچنین تکرار متن از محدودیت‌های Whisper شمرده شده است. بنابراین روان بودن یک جمله نشانه وجود آن در فایل نیست. این محدودیت برای بازبینی بخش‌های سکوت، موسیقی و صدای نامفهوم مهم است. توضیح کامل در کارت مدل Whisper آمده است. هیچ تنظیمی را بدون بررسی خروجی به عنوان راه‌حل قطعی همه خطاها معرفی نکنید.

روش پیشنهادی ما برای مواجهه با چنین بخش‌هایی ساده است: ابتدا زمان جمله مشکوک را پیدا کنید، چند ثانیه قبل و بعد را بشنوید و تصمیم را براساس فایل اصلی بگیرید. اگر گفتاری وجود ندارد، جمله ساخته‌شده را حذف کنید. اگر گفتار نامفهوم است، از برچسب ابهام استفاده کنید. اگر سکوت طولانی را از نسخه مخصوص رونویسی می‌برید، توجه داشته باشید که زمان‌های آن نسخه دیگر مستقیماً با ویدیوی اصلی برابر نیست. برای زیرنویس، هماهنگی زمان را فدای تمیز شدن ظاهری متن نکنید.

ساخت زیرنویس قابل استفاده، فراتر از گرفتن SRT

خروجی SRT را کنار ویدیوی همان نسخه باز کنید. در بازبینی اول، دنبال این باشید که هر قطعه هم‌زمان با جمله مربوط دیده شود. در بازبینی دوم، فقط خوانایی را بررسی کنید: آیا برای خواندن جمله فرصت هست؟ آیا شکست سطر وسط ترکیب نامأنوس قرار گرفته؟ آیا زیرنویس روی نوشته مهم ویدیو می‌افتد؟ این‌ها تصمیم‌های ویرایشی‌اند و خروجی گرفتن خودکار به‌تنهایی آن‌ها را حل نمی‌کند. اگر مخاطب بیشتر با موبایل می‌بیند، نسخه نهایی را روی صفحه کوچک هم ببینید.

تصویرسازی نوار فیلم، هدفون و ذره‌بین روی کارت زیرنویس
تصویرسازی بازبینی زیرنویس؛ متن زمان‌دار باید با نسخه نهایی ویدیو تطبیق داده شود.

جمله را براساس معنی تقسیم کنید

مثلاً جمله «برای دریافت خروجی درست، ابتدا زبان فایل را مشخص کنید و سپس نتیجه را بازبینی کنید» را می‌توان در مرز دو بخش معنایی تقسیم کرد. شکستن آن بعد از «را» یا جدا کردن «خروجی» از «درست» خواندن را سخت‌تر می‌کند. برای همه ویدیوها یک عدد ثابت به عنوان طول مجاز هر سطر تعیین نکنید؛ اندازه تصویر، فونت، مخاطب و دستورالعمل مقصد مؤثرند. اگر مقصد انتشار راهنمای زیرنویس دارد، آن راهنما مبنای تنظیم باشد و سپس خوانایی واقعی را بررسی کنید.

تدوین و زیرنویس باید نسخه یکسان داشته باشند

اگر تدوینگر چند ثانیه از وسط ویدیو حذف کند، زیرنویس قبلی از همان نقطه ممکن است جابه‌جا شود. تغییر عنوان فایل مشکل را حل نمی‌کند. در تحویل نهایی، نام نسخه ویدیو را کنار نام زیرنویس ثبت کنید و پس از هر تغییر تدوین، نقاط قبل و بعد از برش را ببینید. اگر همه زیرنویس‌ها به یک اندازه جابه‌جا هستند، احتمالاً با یک تأخیر ثابت روبه‌رو هستید؛ اگر اختلاف به‌تدریج زیاد می‌شود یا بعد از برش شروع می‌شود، باید تطبیق نسخه و زمان‌بندی را دقیق‌تر بررسی کنید.

گفت‌وگوی چندنفره را چطور مدیریت کنیم؟

رونویسی کلمات را با شناسایی قطعی گوینده یکی ندانید. نام‌گذاری خودکار افراد به بررسی جدا نیاز دارد و نباید از خروجی ساده این دستور انتظار تأیید هویت داشت. برای پروژه‌ای که نام اشخاص اهمیت دارد، در ابتدا فقط برچسب‌های کاری مانند «گوینده اول» و «گوینده دوم» بگذارید و هر انتساب را از منبع قابل اتکا تأیید کنید. صدای مشابه، حرف زدن هم‌زمان و جمله‌های کوتاه می‌تواند تصمیم شنونده را هم دشوار کند؛ ابهام را با اعتمادبه‌نفس ظاهری پنهان نکنید.

برای مصاحبه‌های بعدی، پیشنهاد می‌کنیم گویندگان در ابتدای ضبط خودشان را معرفی کنند و اگر تجهیزات اجازه می‌دهد صداها جداگانه ثبت شوند. این پیشنهاد یک روش تولید محتواست، نه تضمین تشخیص بی‌خطا. در فایل موجود، زمانی که دو نفر هم‌زمان حرف می‌زنند، همان بخش را برای بازبینی علامت بزنید. اگر از محتوای مصاحبه نقل‌قول می‌سازید، تنها بخش‌هایی را انتخاب کنید که هم متن و هم گوینده آن روشن است. جذاب بودن جمله مجوز نسبت دادن احتمالی آن به شخص نیست.

حریم خصوصی در اجرای محلی را جدی بگیرید

پیش از پردازش، درباره رضایت ضبط و استفاده از محتوا مطمئن شوید. اجرای محلی به معنی داشتن اجازه برای رونویسی هر مکالمه نیست. اگر فایل متعلق به سازمان است، قواعد همان سازمان درباره نگهداری و دسترسی را رعایت کنید. کارت مدل نیز نسبت به رونویسی افراد بدون رضایت و کاربردهای پرخطر هشدار می‌دهد. این راهنما برای تولید متن و زیرنویس است و خروجی خودکار را برای تصمیم پزشکی، حقوقی یا تصمیم مهم درباره افراد معتبر فرض نمی‌کند.

محلی بودن ابزار فقط یک بخش از مسیر داده است. ممکن است پوشه پروژه با یک فضای ابری همگام شود یا نسخه خروجی را در پیام‌رسان بفرستید. بنابراین مسیر فایل را از دریافت تا تحویل رسم کنید: چه کسی به اصل صدا دسترسی دارد، متن کجا ذخیره می‌شود و چه زمانی نسخه‌های کاری پاک خواهند شد؟ برای آزمایش تنظیمات از فایل غیرحساس استفاده کنید. اگر قرار است متن را برای خلاصه‌سازی به ابزار دیگری بدهید، آن مرحله انتقال تازه‌ای است و باید جداگانه مجاز و بررسی شده باشد.

یک گردش کار پیشنهادی برای مصاحبه آموزشی

فرض کنید مصاحبه‌ای درباره آموزش عکاسی دارید. در آغاز، نسخه نهایی ویدیو و فهرست املای نام دوربین‌ها را دریافت کنید. یک نمونه شامل گفتار هر دو نفر انتخاب کنید و خروجی اولیه بگیرید. بعد از کنترل نام‌ها و جمله‌های مهم، فایل کامل را پردازش کنید. متن خام را نگه دارید و نسخه دوم را برای ویرایش بسازید. در این نسخه، پاراگراف‌ها را براساس موضوع جدا کنید، اما جمله‌های تازه یا توضیحاتی را که در مصاحبه نیست به نام گوینده ننویسید.

سپس از همان خروجی زمان‌دار، زیرنویس را اصلاح کنید و روی ویدیوی نهایی ببینید. برای مقاله وب، بخش‌های لازم را با تیترهای مستقل تنظیم کنید و اگر توضیح تکمیلی خودتان را اضافه می‌کنید آن را از نقل‌قول جدا نگه دارید. بسته تحویل بهتر است شامل متن خام، متن تأییدشده، زیرنویس نهایی و یادداشت ابهام‌ها باشد. این سناریو مثال آموزشی است و ادعای انجام آزمایش روی مصاحبه واقعی یا صرفه‌جویی مشخص در زمان ندارد.

از متن تأییدشده چطور استفاده کنیم؟

پس از بازبینی می‌توانید از متن برای پیدا کردن موضوع‌های مقاله، ساخت فهرست پرسش‌ها یا آماده‌سازی یادداشت درس استفاده کنید. اگر می‌خواهید بین متن‌های طولانی جست‌وجو کنید، راهنمای چت با فایل‌ها در AnythingLLM مسیر دیگری را معرفی می‌کند؛ آن مرحله جای تأیید رونویسی را نمی‌گیرد. اگر نیاز اصلی شما کار روی موبایل است، معرفی برنامه ویرا برای اندروید را ببینید. انتخاب ابزار بعدی باید از نیاز واقعی شما بیاید، نه صرفاً اضافه کردن یک سرویس دیگر.

برای تبدیل مصاحبه به مقاله، از خودتان بپرسید کدام سؤال خواننده در صوت واقعاً پاسخ گرفته است. متن را براساس آن سؤال مرتب کنید و قسمت‌های حاشیه‌ای را جدا بگذارید. اگر پاسخ ناقص است، نیاز به تحقیق تکمیلی دارید؛ مدل نباید شکاف را با نقل‌قول ساختگی پر کند. برای هر نقل‌قول مهم، زمان منبع را در نسخه کاری نگه دارید. این کار حتی وقتی زمان‌ها در مقاله منتشر نمی‌شوند، بررسی بعدی و اصلاح احتمالی را بسیار ساده‌تر می‌کند.

چک‌لیست تحویل و معیار قبول خروجی

معیار قبول را قبل از شروع تعیین کنید. برای یک یادداشت شخصی ممکن است چند واژه نامفهوم قابل قبول باشد، ولی در یک آموزش منتشرشده، نام ابزار و دستور اجرایی باید بررسی شود. پیشنهاد ما این است که یک نفر متن را همراه صدا بازبینی کند و در پروژه‌های مهم، فرد دیگری فقط بخش‌های حساس و مبهم را کنترل کند. این بازبینی باید وظیفه مشخص داشته باشد؛ جمله «یک نگاه بینداز» معمولاً معلوم نمی‌کند چه چیزی واقعاً تأیید شده است.

  • ورودی و زیرنویس مربوط به یک نسخه ویدیو هستند.
  • عددها، نام‌ها، واحدها و جمله‌های منفی با صوت تطبیق داده شده‌اند.
  • جمله‌های ساخته‌شده در سکوت و تکرارهای بی‌منبع حذف شده‌اند.
  • ابهام‌ها علامت دارند و به جای آن‌ها حدس منتشر نشده است.
  • ابتدا، میانه، پایان و محل برش‌های ویدیو از نظر هماهنگی بررسی شده‌اند.
  • مجوز استفاده از صدا و مسیر تحویل فایل روشن است.

پرسش‌های متداول

آیا Whisper برای فارسی دقت صددرصد دارد؟

خیر. در این مقاله هیچ درصدی برای دقت فارسی وعده داده نمی‌شود. کیفیت را روی نمونه واقعی خودتان بررسی کنید و خطاهای مهم را جدا از غلط‌های ظاهری بشمارید. حتی متنی که بیشتر جمله‌های آن درست است ممکن است یک عدد یا نفی مهم را اشتباه نوشته باشد. برای انتشار، مراجعه به فایل صوتی همچنان بخشی از کار است.

آیا بدون کارت گرافیک هم می‌توان شروع کرد؟

مثال این راهنما برای اجرای CPU تنظیم شده است، اما زمان اجرا را باید روی دستگاه خودتان بسنجید. برای شروع، نمونه کوتاه و مدل کوچک‌تر را امتحان کنید. اگر هدف شما پردازش حجم زیاد است، پیش از خرید سخت‌افزار زمان کل کار و نیاز واقعی را اندازه بگیرید؛ این مقاله توصیه خرید یا تضمین سرعت ارائه نمی‌کند.

چرا خروجی فارسی به انگلیسی تبدیل شده است؟

وظیفه انتخاب‌شده را کنترل کنید؛ برای نگه داشتن زبان گفتار باید رونویسی را بخواهید، نه ترجمه. در دستور این راهنما task برابر transcribe است و language برابر fa قرار دارد. همچنین نام مدل را بررسی کنید تا نسخه مخصوص انگلیسی انتخاب نشده باشد. اگر از رابط دیگری استفاده می‌کنید، برچسب گزینه‌ها ممکن است متفاوت باشد.

آیا گرفتن SRT یعنی زیرنویس آماده انتشار است؟

نه. SRT خروجی زمان‌دار اولیه است. باید متن، شکست سطر، زمان نمایش و هماهنگی با نسخه نهایی ویدیو را بررسی کنید. اگر تدوین تغییر کند، دوباره تطبیق لازم می‌شود. زیرنویسی که در فایل متنی مرتب به نظر می‌رسد ممکن است هنگام پخش بسیار سریع یا دیر نمایش داده شود.

با جمله نامفهوم چه کنیم؟

چند ثانیه قبل و بعد را گوش کنید و در صورت امکان از صاحب محتوا بپرسید. اگر ابهام باقی ماند، آن را با زمان مشخص ثبت کنید. پاسخ مدل دوم به‌تنهایی تأیید جمله نیست؛ ممکن است همان حدس را تکرار کند. در متن منتشرشده، حذف بخشی که قابل تأیید نیست از نسبت دادن یک جمله نادرست بهتر است، به شرط آنکه حذف معنی نقل‌قول را تحریف نکند.

جمع‌بندی

تبدیل صوت به متن فارسی با Whisper زمانی مفید است که خروجی خودکار را شروع کار بدانید. نمونه کوتاه بگیرید، تنظیمات را ثبت کنید، متن را با صدا بسنجید و زیرنویس را روی نسخه نهایی ویدیو ببینید. برای فایل بعدی، همان معیارهای تأیید را دوباره به کار ببرید، نه اینکه نتیجه خوب یک آزمایش را تضمین همیشگی فرض کنید. کیفیت نهایی از ترکیب ورودی مناسب، انتخاب متناسب ابزار و بازبینی روشن به دست می‌آید.

تاریخ بررسی منابع: ۲۴ سپتامبر ۲۰۲۶. منابع فنی: مخزن رسمی Whisper، کد transcribe، کارت مدل و وب‌سایت FFmpeg که در بخش‌های مرتبط پیوند شده‌اند. تصاویر این مقاله تصویرسازی اختصاصی تولیدشده با هوش مصنوعی‌اند و نمای واقعی محیط نرم‌افزار نیستند.

نویسنده و مدیر محتوای ترفندا؛ علاقه‌مند به هوش مصنوعی، ابزارهای دیجیتال و ترفندهای کاربردی برای ساده‌تر کردن زندگی روزمره. در ترفندا تلاش می‌کنم ابزارها، اپلیکیشن‌ها و روش‌های هوشمندی را معرفی کنم که به کاربران کمک می‌کنند سریع‌تر یاد بگیرند، بهتر انتخاب کنند و از تکنولوژی استفاده مفیدتری داشته باشند.
مقالات مرتبط

دانلود Gemma 3 و Gemma 3n؛ نصب و اجرای هوش مصنوعی گوگل

دانلود Gemma 3 و Gemma 3n؛ اجرای مدل هوش مصنوعی گوگل روی…

دانلود AnythingLLM؛ چت با فایل‌های PDF با هوش مصنوعی

تصور کنید کتابخانه‌ای از هزاران فایل PDF، اسناد کاری و مقالات تحقیقاتی…

دیدگاهتان را بنویسید