تبدیل صوت به متن فارسی با Whisper؛ راهنمای اجرای محلی
اجرای محلی Whisper برای تبدیل صدای فارسی؛ از آمادهکردن Python و FFmpeg تا خروجی متنی، زیرنویس و بازبینی خطاها، بدون نیاز به API.
فهرست مطالب
- ویسپر چیست و نسخهٔ رایگان آن چه تفاوتی دارد؟
- پیشنیازها و انتخاب مدل برای شروع
- نصب ویسپر در ویندوز، بدون تغییر تنظیمات امنیتی
- ۱. Python و FFmpeg را آماده کنید
- ۲. یک محیط جدا بسازید
- تبدیل فایل فارسی به متن و زیرنویس
- چطور خروجی فارسی را قابل استفاده کنیم؟
- خطاهای رایج و روش برگشت
- حریم خصوصی و حدود استفاده
- جمعبندی: اول یک نمونهٔ کوتاه، بعد فایل کامل
- پرسشهای متداول
برای تبدیل صوت به متن فارسی با ویسپر، لازم نیست حتماً فایل را در یک سایت ناشناس بارگذاری کنید. نسخهٔ متنباز Whisper را میتوان روی کامپیوتر اجرا کرد؛ با این حال نصب اولیه، توان پردازشی و بازبینی خروجی بر عهدهٔ شماست. این راهنما مسیر اجرای محلی در ویندوز را توضیح میدهد، نه سرویسهای تجاری با نام مشابه.
[ez-toc]
پاسخ کوتاه: مدل چندزبانه، زبان fa و وظیفهٔ transcribe را انتخاب کنید. نخست یک نمونهٔ کوتاه را تبدیل و با صدای اصلی مقایسه کنید؛ هیچ مدل گفتاربهمتنی را برای نامها، اعداد و نقلقولها بدون بازبینی نپذیرید.
ویسپر چیست و نسخهٔ رایگان آن چه تفاوتی دارد؟
Whisper یک مدل تشخیص گفتار است؛ یعنی صدای انسان را به متن تبدیل میکند. فارسی در فهرست زبانهای آن با کد fa آمده است. نسخهٔ متنباز با API یکسان نیست: API سرویسی ابری برای استفادهٔ برنامهنویسان است و هزینه و شرایط دسترسی جداگانه دارد. این آموزش به کلید API نیاز ندارد. فهرست رسمی زبانها و راهنمای سرویس ابری OpenAI این دو مسیر را مشخص میکنند.
«رایگان» در اینجا به معنای نداشتن هزینهٔ خرید مدل متنباز است، نه حذف هزینهٔ اینترنت، برق یا سختافزار. نام Whisper روی یک اپلیکیشن هم بهتنهایی نشان نمیدهد که برنامه رسمی، رایگان یا آفلاین است.
پیشنیازها و انتخاب مدل برای شروع
به Python، بستهٔ openai-whisper و ابزار FFmpeg نیاز دارید. FFmpeg فایل صوتی را برای پردازش میخواند. راهنمای مخزن، Python نسخههای ۳٫۸ تا ۳٫۱۱ را در محدودهٔ سازگاری موردانتظار ذکر کرده است؛ برای این مسیر، Python 3.11 انتخاب محافظهکارانهای است، نه ادعای ناسازگاری قطعی نسخههای جدیدتر. راهنمای نصب رسمی
برای اولین آزمایش، مدل چندزبانهٔ small را پیشنهاد میکنیم؛ این یک نقطهٔ شروع تحریریهای است، نه نتیجهٔ بنچمارک فارسی رادیوتک. اگر منابع محدود بود، base را امتحان کنید. پسوند .en مخصوص انگلیسی است و برای صوت فارسی مناسب نیست. زمان پردازش به مدل، دستگاه و فایل بستگی دارد؛ وعدهٔ تبدیل هر ساعت صوت در چند دقیقه قابل تعمیم نیست.

نصب ویسپر در ویندوز، بدون تغییر تنظیمات امنیتی
۱. Python و FFmpeg را آماده کنید
Python را از صفحهٔ رسمی نسخههای ویندوز تهیه کنید. برای FFmpeg به صفحهٔ رسمی دانلود بروید و از پیوند ارائهدهندهٔ Windows builds استفاده کنید؛ خود پروژه، کد منبع را عرضه میکند و ساختهای آماده را به ارائهدهندگان معرفیشده ارجاع میدهد. پوشهٔ bin همان نسخه را به Path حساب کاربری اضافه و ترمینال را دوباره باز کنید.
py -3.11 --version
ffmpeg -version
نتیجهٔ موردانتظار، نمایش نسخهٔ هر دو ابزار است. اگر دستور پیدا نشد، ابتدا نصب و مسیر همان ابزار را اصلاح کنید؛ خاموشکردن آنتیویروس یا اجرای فایل ناشناس راهحل نیست.
۲. یک محیط جدا بسازید
در پوشهای مخصوص همین پروژه، ترمینال باز کنید و دستورهای زیر را اجرا کنید. محیط مجازی، بستههای این پروژه را از سایر پروژههای Python جدا میکند. استفادهٔ مستقیم از مسیر مفسر، نیاز به فعالسازی محیط در PowerShell را حذف میکند. مستندات محیط مجازی Python
py -3.11 -m venv .venv
.\.venv\Scripts\python.exe -m pip install --upgrade pip
.\.venv\Scripts\python.exe -m pip install -U openai-whisper
.\.venv\Scripts\whisper.exe --help
نمایش راهنمای دستور آخر یعنی ابزار در همین محیط نصب شده است. این دستورها بر اساس مستندات تنظیم شدهاند؛ رادیوتک در این مقاله ادعای اجرای آزمایش روی دستگاه شما ندارد.
تبدیل فایل فارسی به متن و زیرنویس
یک کپی کوتاه از صدای خودتان را با نام sample.mp3 در پوشهٔ پروژه قرار دهید. سپس این فرمان را اجرا کنید:
.\.venv\Scripts\whisper.exe "sample.mp3" --model small --language fa --task transcribe --device cpu --fp16 False --output_format all --output_dir "transcripts-test"
گزینهٔ cpu پردازش را روی پردازنده انجام میدهد و fp16 False حالت عددی نامناسب CPU را غیرفعال میکند. زبان را فارسی و کار را پیادهسازی گفتار تعیین کردهایم، نه ترجمه. پوشهٔ خروجی جداست تا نتیجهٔ آزمایش با نسخههای قبلی مخلوط نشود. جزئیات این گزینهها در کد رسمی فرمان تبدیل آمده است.
در اولین اجرا ممکن است مدل دانلود شود. پایان پردازش باید به ایجاد فایل خروجی منجر شود؛ صرف دیدهشدن نوار پیشرفت نشانهٔ آمادهبودن متن نیست. فایل TXT برای متن ساده و SRT یا VTT برای زیرنویس کاربرد دارد. زمانبندی زیرنویس و نمایش راستبهچپ را در پخشکنندهٔ مقصد هم بررسی کنید. کد نویسندههای خروجی
چطور خروجی فارسی را قابل استفاده کنیم؟
خروجی مدل، نسخهٔ نهایی نقلقول نیست. کارت مدل رسمی احتمال تولید عباراتی را مطرح میکند که در صوت گفته نشدهاند؛ این خطا را «توهم مدل» مینامند. همچنین کیفیت میان زبانها و گویشها یکسان نیست. محدودیتهای اعلامشدهٔ Whisper
روش پیشنهادی رادیوتک این است: صدای اصلی را کنار متن نگه دارید، نام اشخاص و شرکتها را جدا علامت بزنید و اعداد، تاریخها و جملههای منفی را دوباره بشنوید. برای بخش نامفهوم بنویسید «نامفهوم»؛ حدس مدل را جای صدای گوینده ننشانید. نیمفاصله و نشانهگذاری را پس از تطبیق معنا اصلاح کنید.

خطاهای رایج و روش برگشت
| مشکل | اقدام پیشنهادی |
|---|---|
| فایل یا FFmpeg پیدا نمیشود | نام و مسیر فایل، گیومهها و خروجی دستور بررسی نسخهٔ FFmpeg را کنترل کنید. |
| پردازش بسیار کند است | با Ctrl+C متوقف کنید؛ نمونهٔ کوتاهتر یا مدل base را در پوشهٔ خروجی جدید امتحان کنید. |
| متن به انگلیسی برمیگردد | گزینهٔ transcribe، زبان fa و نبودن پسوند .en را بررسی کنید. |
| جملههای تکراری یا نامفهوم | همان بازه را گوش دهید؛ سکوت و صدای همزمان را با دقت بازبینی کنید، نه اینکه متن را قطعی بدانید. |
تبدیل، جایگزین فایل صوتی اصلی نمیشود. برای بازگشت، پردازش را متوقف و خروجی ناقص همان آزمایش را کنار بگذارید. اگر ابزار را نمیخواهید، پس از پشتیبانگیری از صوت و متن، فقط محیط .venv اختصاصی این پروژه را حذف کنید؛ پاککردن کل پوشهٔ کار لازم نیست.
حریم خصوصی و حدود استفاده
مسیر محلی این آموزش با ارسال صوت به API فرق دارد، اما از این موضوع نباید امنیت هر برنامهٔ ثالثی با نام Whisper را نتیجه گرفت. برای ضبط و پردازش صدای دیگران رضایت بگیرید و نسخههای حساس را در پوشهٔ اشتراکی عمومی نگذارید. طبق کارت مدل، این ابزار برای تصمیمگیریهای پرخطر مناسب نیست. متن پزشکی، حقوقی یا مالی باید با صوت اصلی و نظر متخصص مربوط بازبینی شود؛ این راهنما توصیهٔ تخصصی آن حوزهها نیست.
جمعبندی: اول یک نمونهٔ کوتاه، بعد فایل کامل
مزیت اجرای محلی، داشتن کنترل بیشتر بر فرایند است؛ هزینهٔ آن هم نصب و مدیریت منابع دستگاه است. با یک نمونهٔ کوتاه شروع کنید، خروجی را بسنجید و فقط اگر برای کار شما قابل استفاده بود سراغ فایل طولانی بروید. معیار موفقیت، متن قابل اعتماد پس از بازبینی است، نه صرفاً تولید سریع چند صفحه.
پرسشهای متداول
آیا ویسپر از فارسی پشتیبانی میکند؟
بله؛ کد فارسی fa است. از مدل چندزبانه استفاده کنید و کیفیت همان فایل را جداگانه بررسی کنید.
آیا تبدیل صوت به متن ویسپر کاملاً رایگان است؟
نسخهٔ متنباز هزینهٔ خرید مدل ندارد، اما سختافزار و دانلود بر عهدهٔ شماست. سرویس ابری یا برنامهٔ ثالث ممکن است پولی باشد.
بدون کارت گرافیک هم میتوان از آن استفاده کرد؟
بله؛ مسیر CPU در این آموزش آمده است. سرعت به دستگاه و مدل وابسته است و برای فایل طولانی ممکن است مناسب نباشد.
چرا بهجای متن فارسی ترجمهٔ انگلیسی میگیرم؟
وظیفه باید transcribe باشد، نه translate. همچنین زبان fa و مدل بدون پسوند .en را انتخاب کنید.
آیا متن نهایی و زیرنویس به بازبینی نیاز دارند؟
بله؛ نامها، اعداد، جملههای نامفهوم و زمانبندی را با صدای اصلی تطبیق دهید. خروجی مدل تضمین صحت نیست.