رفتن به محتوای اصلی
رادیوتک
تازه‌ترین مطالب
جست‌وجوی رادیوتکدر مقاله‌ها، پادکست، پرامپت و محصولات
حساب رادیوتکورود، ثبت‌نام و بازیابی رمز بدون خروج از سایت
مقاله

تبدیل صوت به متن فارسی با Whisper؛ راهنمای اجرای محلی

اجرای محلی Whisper برای تبدیل صدای فارسی؛ از آماده‌کردن Python و FFmpeg تا خروجی متنی، زیرنویس و بازبینی خطاها، بدون نیاز به API.

میکروفون، هدفون و لپ‌تاپ روی میز ضبط پادکست
فهرست مطالب
  1. ویسپر چیست و نسخهٔ رایگان آن چه تفاوتی دارد؟
  2. پیش‌نیازها و انتخاب مدل برای شروع
  3. نصب ویسپر در ویندوز، بدون تغییر تنظیمات امنیتی
  4. ۱. Python و FFmpeg را آماده کنید
  5. ۲. یک محیط جدا بسازید
  6. تبدیل فایل فارسی به متن و زیرنویس
  7. چطور خروجی فارسی را قابل استفاده کنیم؟
  8. خطاهای رایج و روش برگشت
  9. حریم خصوصی و حدود استفاده
  10. جمع‌بندی: اول یک نمونهٔ کوتاه، بعد فایل کامل
  11. پرسش‌های متداول

برای تبدیل صوت به متن فارسی با ویسپر، لازم نیست حتماً فایل را در یک سایت ناشناس بارگذاری کنید. نسخهٔ متن‌باز Whisper را می‌توان روی کامپیوتر اجرا کرد؛ با این حال نصب اولیه، توان پردازشی و بازبینی خروجی بر عهدهٔ شماست. این راهنما مسیر اجرای محلی در ویندوز را توضیح می‌دهد، نه سرویس‌های تجاری با نام مشابه.

[ez-toc]

پاسخ کوتاه: مدل چندزبانه، زبان fa و وظیفهٔ transcribe را انتخاب کنید. نخست یک نمونهٔ کوتاه را تبدیل و با صدای اصلی مقایسه کنید؛ هیچ مدل گفتاربه‌متنی را برای نام‌ها، اعداد و نقل‌قول‌ها بدون بازبینی نپذیرید.

ویسپر چیست و نسخهٔ رایگان آن چه تفاوتی دارد؟

Whisper یک مدل تشخیص گفتار است؛ یعنی صدای انسان را به متن تبدیل می‌کند. فارسی در فهرست زبان‌های آن با کد fa آمده است. نسخهٔ متن‌باز با API یکسان نیست: API سرویسی ابری برای استفادهٔ برنامه‌نویسان است و هزینه و شرایط دسترسی جداگانه دارد. این آموزش به کلید API نیاز ندارد. فهرست رسمی زبان‌ها و راهنمای سرویس ابری OpenAI این دو مسیر را مشخص می‌کنند.

«رایگان» در اینجا به معنای نداشتن هزینهٔ خرید مدل متن‌باز است، نه حذف هزینهٔ اینترنت، برق یا سخت‌افزار. نام Whisper روی یک اپلیکیشن هم به‌تنهایی نشان نمی‌دهد که برنامه رسمی، رایگان یا آفلاین است.

پیش‌نیازها و انتخاب مدل برای شروع

به Python، بستهٔ openai-whisper و ابزار FFmpeg نیاز دارید. FFmpeg فایل صوتی را برای پردازش می‌خواند. راهنمای مخزن، Python نسخه‌های ۳٫۸ تا ۳٫۱۱ را در محدودهٔ سازگاری موردانتظار ذکر کرده است؛ برای این مسیر، Python 3.11 انتخاب محافظه‌کارانه‌ای است، نه ادعای ناسازگاری قطعی نسخه‌های جدیدتر. راهنمای نصب رسمی

برای اولین آزمایش، مدل چندزبانهٔ small را پیشنهاد می‌کنیم؛ این یک نقطهٔ شروع تحریریه‌ای است، نه نتیجهٔ بنچمارک فارسی رادیوتک. اگر منابع محدود بود، base را امتحان کنید. پسوند .en مخصوص انگلیسی است و برای صوت فارسی مناسب نیست. زمان پردازش به مدل، دستگاه و فایل بستگی دارد؛ وعدهٔ تبدیل هر ساعت صوت در چند دقیقه قابل تعمیم نیست.

ضبط‌کنندهٔ صوتی متصل به لپ‌تاپ روی میز کار
تصویر مفهومی ساخته‌شده با هوش مصنوعی؛ نمای واقعی رابط Whisper نیست.

نصب ویسپر در ویندوز، بدون تغییر تنظیمات امنیتی

۱. Python و FFmpeg را آماده کنید

Python را از صفحهٔ رسمی نسخه‌های ویندوز تهیه کنید. برای FFmpeg به صفحهٔ رسمی دانلود بروید و از پیوند ارائه‌دهندهٔ Windows builds استفاده کنید؛ خود پروژه، کد منبع را عرضه می‌کند و ساخت‌های آماده را به ارائه‌دهندگان معرفی‌شده ارجاع می‌دهد. پوشهٔ bin همان نسخه را به Path حساب کاربری اضافه و ترمینال را دوباره باز کنید.

py -3.11 --version
ffmpeg -version

نتیجهٔ موردانتظار، نمایش نسخهٔ هر دو ابزار است. اگر دستور پیدا نشد، ابتدا نصب و مسیر همان ابزار را اصلاح کنید؛ خاموش‌کردن آنتی‌ویروس یا اجرای فایل ناشناس راه‌حل نیست.

۲. یک محیط جدا بسازید

در پوشه‌ای مخصوص همین پروژه، ترمینال باز کنید و دستورهای زیر را اجرا کنید. محیط مجازی، بسته‌های این پروژه را از سایر پروژه‌های Python جدا می‌کند. استفادهٔ مستقیم از مسیر مفسر، نیاز به فعال‌سازی محیط در PowerShell را حذف می‌کند. مستندات محیط مجازی Python

py -3.11 -m venv .venv
.\.venv\Scripts\python.exe -m pip install --upgrade pip
.\.venv\Scripts\python.exe -m pip install -U openai-whisper
.\.venv\Scripts\whisper.exe --help

نمایش راهنمای دستور آخر یعنی ابزار در همین محیط نصب شده است. این دستورها بر اساس مستندات تنظیم شده‌اند؛ رادیوتک در این مقاله ادعای اجرای آزمایش روی دستگاه شما ندارد.

تبدیل فایل فارسی به متن و زیرنویس

یک کپی کوتاه از صدای خودتان را با نام sample.mp3 در پوشهٔ پروژه قرار دهید. سپس این فرمان را اجرا کنید:

.\.venv\Scripts\whisper.exe "sample.mp3" --model small --language fa --task transcribe --device cpu --fp16 False --output_format all --output_dir "transcripts-test"

گزینهٔ cpu پردازش را روی پردازنده انجام می‌دهد و fp16 False حالت عددی نامناسب CPU را غیرفعال می‌کند. زبان را فارسی و کار را پیاده‌سازی گفتار تعیین کرده‌ایم، نه ترجمه. پوشهٔ خروجی جداست تا نتیجهٔ آزمایش با نسخه‌های قبلی مخلوط نشود. جزئیات این گزینه‌ها در کد رسمی فرمان تبدیل آمده است.

در اولین اجرا ممکن است مدل دانلود شود. پایان پردازش باید به ایجاد فایل خروجی منجر شود؛ صرف دیده‌شدن نوار پیشرفت نشانهٔ آماده‌بودن متن نیست. فایل TXT برای متن ساده و SRT یا VTT برای زیرنویس کاربرد دارد. زمان‌بندی زیرنویس و نمایش راست‌به‌چپ را در پخش‌کنندهٔ مقصد هم بررسی کنید. کد نویسنده‌های خروجی

چطور خروجی فارسی را قابل استفاده کنیم؟

خروجی مدل، نسخهٔ نهایی نقل‌قول نیست. کارت مدل رسمی احتمال تولید عباراتی را مطرح می‌کند که در صوت گفته نشده‌اند؛ این خطا را «توهم مدل» می‌نامند. همچنین کیفیت میان زبان‌ها و گویش‌ها یکسان نیست. محدودیت‌های اعلام‌شدهٔ Whisper

روش پیشنهادی رادیوتک این است: صدای اصلی را کنار متن نگه دارید، نام اشخاص و شرکت‌ها را جدا علامت بزنید و اعداد، تاریخ‌ها و جمله‌های منفی را دوباره بشنوید. برای بخش نامفهوم بنویسید «نامفهوم»؛ حدس مدل را جای صدای گوینده ننشانید. نیم‌فاصله و نشانه‌گذاری را پس از تطبیق معنا اصلاح کنید.

هدفون، دفتر باز و قلم برای بازبینی متن پیاده‌شده
تصویر مفهومی ساخته‌شده با هوش مصنوعی؛ بازبینی شنیداری بخشی از فرایند است.

خطاهای رایج و روش برگشت

مشکل اقدام پیشنهادی
فایل یا FFmpeg پیدا نمی‌شود نام و مسیر فایل، گیومه‌ها و خروجی دستور بررسی نسخهٔ FFmpeg را کنترل کنید.
پردازش بسیار کند است با Ctrl+C متوقف کنید؛ نمونهٔ کوتاه‌تر یا مدل base را در پوشهٔ خروجی جدید امتحان کنید.
متن به انگلیسی برمی‌گردد گزینهٔ transcribe، زبان fa و نبودن پسوند .en را بررسی کنید.
جمله‌های تکراری یا نامفهوم همان بازه را گوش دهید؛ سکوت و صدای هم‌زمان را با دقت بازبینی کنید، نه اینکه متن را قطعی بدانید.

تبدیل، جایگزین فایل صوتی اصلی نمی‌شود. برای بازگشت، پردازش را متوقف و خروجی ناقص همان آزمایش را کنار بگذارید. اگر ابزار را نمی‌خواهید، پس از پشتیبان‌گیری از صوت و متن، فقط محیط .venv اختصاصی این پروژه را حذف کنید؛ پاک‌کردن کل پوشهٔ کار لازم نیست.

حریم خصوصی و حدود استفاده

مسیر محلی این آموزش با ارسال صوت به API فرق دارد، اما از این موضوع نباید امنیت هر برنامهٔ ثالثی با نام Whisper را نتیجه گرفت. برای ضبط و پردازش صدای دیگران رضایت بگیرید و نسخه‌های حساس را در پوشهٔ اشتراکی عمومی نگذارید. طبق کارت مدل، این ابزار برای تصمیم‌گیری‌های پرخطر مناسب نیست. متن پزشکی، حقوقی یا مالی باید با صوت اصلی و نظر متخصص مربوط بازبینی شود؛ این راهنما توصیهٔ تخصصی آن حوزه‌ها نیست.

جمع‌بندی: اول یک نمونهٔ کوتاه، بعد فایل کامل

مزیت اجرای محلی، داشتن کنترل بیشتر بر فرایند است؛ هزینهٔ آن هم نصب و مدیریت منابع دستگاه است. با یک نمونهٔ کوتاه شروع کنید، خروجی را بسنجید و فقط اگر برای کار شما قابل استفاده بود سراغ فایل طولانی بروید. معیار موفقیت، متن قابل اعتماد پس از بازبینی است، نه صرفاً تولید سریع چند صفحه.

پرسش‌های متداول

آیا ویسپر از فارسی پشتیبانی می‌کند؟

بله؛ کد فارسی fa است. از مدل چندزبانه استفاده کنید و کیفیت همان فایل را جداگانه بررسی کنید.

آیا تبدیل صوت به متن ویسپر کاملاً رایگان است؟

نسخهٔ متن‌باز هزینهٔ خرید مدل ندارد، اما سخت‌افزار و دانلود بر عهدهٔ شماست. سرویس ابری یا برنامهٔ ثالث ممکن است پولی باشد.

بدون کارت گرافیک هم می‌توان از آن استفاده کرد؟

بله؛ مسیر CPU در این آموزش آمده است. سرعت به دستگاه و مدل وابسته است و برای فایل طولانی ممکن است مناسب نباشد.

چرا به‌جای متن فارسی ترجمهٔ انگلیسی می‌گیرم؟

وظیفه باید transcribe باشد، نه translate. همچنین زبان fa و مدل بدون پسوند .en را انتخاب کنید.

آیا متن نهایی و زیرنویس به بازبینی نیاز دارند؟

بله؛ نام‌ها، اعداد، جمله‌های نامفهوم و زمان‌بندی را با صدای اصلی تطبیق دهید. خروجی مدل تضمین صحت نیست.