تبدیل گفتار به متن · OpenAI

Whisper

تبدیل گفتار چندزبانه به متن با تشخیص زبان و ترجمه اختیاری به انگلیسی.

OpenAI Whisper تشخیص و ترجمه زبان نمونه API

متن استخراج‌شده

متن پس از پردازش فایل نمایش داده می‌شود.

آماده برای تبدیل گفتارفایل صوتی را انتخاب و مدل را اجرا کنید.

قیمت استفاده

این مدل با تنظیم فعلی تقریباً ۱۷ اعتبار برای هر اجرای معمول هزینه دارد، یا حدود ۵۸ اجرا با ۱٬۰۰۰ اعتبار. هزینه واقعی بسته به فایل متفاوت است.
هزینه تقریبی هر اجرا۱۷ اعتبار
تعداد تقریبی اجرا با ۱٬۰۰۰ اعتبار~۵۸
زمان معمول پردازش~21 sec

تنظیمات مدل

فایل صوتی الزامی است؛ سایر گزینه‌ها را فقط در صورت نیاز تغییر دهید.

audio
فایلی انتخاب نشده است

یک فایل صوتی رایج با حداکثر حجم ۲۴ مگابایت انتخاب کنید.

transcription

متن ساده برای بیشتر کاربردها مناسب است.

language

auto برای تشخیص خودکار؛ یا کد/نام زبان را وارد کنید.

initial_prompt

برای نام‌های خاص، اصطلاحات تخصصی یا موضوع فایل مفید است.

temperature

مقداری بین ۰ و ۱؛ مقدار پیش‌فرض صفر است.

patience

اختیاری؛ خالی یعنی تنظیم پیش‌فرض مدل.

suppress_tokens

فهرست شناسه توکن‌ها با کاما؛ مقدار -1 تنظیم پیش‌فرض است.

temperature_increment_on_fallback

مقداری بین ۰ و ۱.

compression_ratio_threshold

اگر نسبت فشرده‌سازی از این مقدار بیشتر شود، decoding ناموفق تلقی می‌شود.

logprob_threshold

مقداری بین منفی ۲۰ و صفر.

no_speech_threshold

مقداری بین ۰ و ۱ برای تشخیص بخش‌های بدون گفتار.

راهنمای مدل

Whisper

مدل عمومی تشخیص گفتار OpenAI برای تبدیل فایل صوتی به متن، شناسایی زبان و ترجمه اختیاری گفتار به انگلیسی است.

معرفی Whisper

Whisper یک مدل تشخیص گفتار چندمنظوره است که با مجموعه بزرگی از فایل‌های صوتی متنوع آموزش دیده است. این مدل می‌تواند گفتار چندزبانه را به متن تبدیل کند، زبان فایل را تشخیص دهد و در صورت نیاز محتوای گفتاری را به انگلیسی ترجمه کند.

معماری مدل از نوع Transformer دنباله‌به‌دنباله است و چند وظیفه صوتی را در یک جریان واحد انجام می‌دهد؛ در نتیجه بخش‌هایی مانند تشخیص زبان، تبدیل گفتار و شناسایی سکوت بدون نیاز به چند مدل جداگانه انجام می‌شوند.

قابلیت‌های اصلی

  • تبدیل گفتار چندزبانه به متن
  • تشخیص خودکار زبان فایل صوتی
  • ترجمه اختیاری گفتار به زبان انگلیسی
  • بخش‌بندی متن بر اساس زمان شروع و پایان جمله‌ها
  • تشخیص بخش‌های سکوت یا بدون گفتار
  • استفاده از متن اولیه برای هدایت بهتر شروع پیاده‌سازی

نسخه مورد استفاده

مدل این صفحه همان openai/whisper است. اجرای فعلی آن از موتور جدیدتر large-v3 استفاده می‌کند تا کیفیت و رفتار خروجی ثابت و قابل پیش‌بینی باقی بماند.

تنظیمات ورودی

  • audio: فایل صوتی الزامی برای تبدیل به متن
  • transcription: انتخاب قالب خروجی مانند متن ساده، SRT یا VTT
  • translate: ترجمه خروجی به انگلیسی در صورت فعال‌بودن
  • language: تعیین زبان فایل یا انتخاب حالت تشخیص خودکار
  • temperature: کنترل میزان آزادی مدل در نمونه‌برداری
  • patience: تنظیم صبر الگوریتم جست‌وجوی پرتو برای یافتن نتیجه بهتر
  • suppress_tokens: توکن‌هایی که نباید در خروجی ظاهر شوند
  • initial_prompt: متن راهنما برای پنجره ابتدایی پردازش
  • condition_on_previous_text: استفاده از متن قبلی برای حفظ پیوستگی میان بخش‌ها
  • آستانه‌های فشرده‌سازی، احتمال، سکوت و افزایش دما برای کنترل رفتار fallback

قیمت‌گذاری

  • قیمت تقریبی هر اجرا و تعداد تقریبی اجرا با اعتبار خدمات در کارت قیمت بالای صفحه نمایش داده می‌شود.
  • هزینه واقعی می‌تواند با توجه به فایل صوتی و زمان پردازش تغییر کند.
  • پس از پایان، هزینه همان اجرا به‌صورت جداگانه نمایش داده می‌شود.

چطور نتیجه بهتری بگیریم؟

  • فایل صوتی واضح و با نویز کمتر انتخاب کنید.
  • اگر زبان را می‌دانید، آن را مشخص کنید؛ در غیر این صورت حالت خودکار را نگه دارید.
  • برای نام‌های خاص، اصطلاحات تخصصی یا موضوع مشخص از initial_prompt استفاده کنید.
  • ترجمه را فقط زمانی فعال کنید که خروجی انگلیسی لازم دارید.
  • در فایل‌های طولانی condition_on_previous_text معمولاً به حفظ پیوستگی کمک می‌کند.
  • اگر خروجی تکراری یا ناپایدار شد، تنظیمات دما و آستانه‌های fallback را با احتیاط تغییر دهید.