تولید گفتار · Google

Gemini 3.1 Flash TTS

تبدیل متن به گفتار طبیعی و بیان‌محور با ۳۰ صدا، بیش از ۷۰ زبان و کنترل دقیق لحن، سرعت، لهجه و احساس.

۳۰ صدای آماده بیش از ۷۰ زبان لحن و تگ‌های اجرایی

فایل صوتی

فایل صوتی پس از اجرای مدل نمایش داده می‌شود.

آماده برای ساخت گفتارمتن، صدا و زبان را انتخاب کنید.

قیمت استفاده

هزینه هر اجرا به طول متن و مدت فایل صوتی بستگی دارد.
پرداخت براساس مصرف
هر ۱۰۰۰ توکن ورودی۷ اعتبار
هر ۱۰۰۰ توکن خروجی صوتی۱۴۰ اعتبار
توکن ورودی با ۱٬۰۰۰ اعتبار~۲۱۲٬۷۶۵
توکن خروجی با ۱٬۰۰۰ اعتبار~۱۰٬۶۳۸

تنظیمات گفتار

متن را وارد کنید، صدا و زبان را انتخاب کنید و فایل صوتی را بسازید.

text
0 / 4000 بایت UTF-8

تگ‌هایی مانند [laughing]، [whispering]، [shouting] و [long pause] داخل متن قابل استفاده‌اند.

voice

هر صدا شخصیت و جنس بیان متفاوتی دارد.

prompt
18 / 4000 بایت UTF-8

برای نمونه: آرام و حرفه‌ای، شاد و پرانرژی، یا صمیمی و دوستانه.

language_code

زبان موردنظر را از فهرست انتخاب کنید.

مجموع متن و راهنما: 18 / 8000 بایت UTF-8
هزینه نهایی بعد از تولید و براساس میزان استفاده محاسبه می‌شود.
راهنمای مدل

Gemini 3.1 Flash TTS

مدل سریع و بیان‌محور تبدیل متن به گفتار گوگل است که با ۳۰ صدای آماده، بیش از ۷۰ زبان، راهنمای سبک و تگ‌های درون‌متنی، صدایی طبیعی و متناسب با کاربرد تولید می‌کند.

معرفی مدل

Gemini 3.1 Flash TTS متن را به فایل صوتی طبیعی تبدیل می‌کند و به‌جای محدودکردن کاربر به چند تنظیم عددی، اجازه می‌دهد شیوه اجرا را با زبان طبیعی توضیح دهد. می‌توانید شخصیت گوینده، فضای صحنه، لحن، سرعت، لهجه و احساس موردنظر را در راهنمای سبک مشخص کنید.

تأخیر پایین مدل آن را برای کاربردهایی مانند روایت کتاب صوتی، وویس‌اور تبلیغاتی، پادکست، محتوای آموزشی، دسترس‌پذیری، دستیارهای صوتی و تجربه‌های تعاملی مناسب می‌کند.

ورودی‌ها و محدودیت‌ها

  • text: متن اصلی گفتار و تگ‌های اجرایی؛ حداکثر ۴۰۰۰ بایت UTF-8
  • voice: انتخاب یکی از ۳۰ صدای آماده؛ صدای پیش‌فرض Kore است
  • prompt: توضیح سبک، لحن، سرعت، لهجه، احساس و شخصیت گوینده؛ حداکثر ۴۰۰۰ بایت UTF-8
  • language_code: زبان خروجی که از فهرست آماده انتخاب می‌شود
  • مجموع حجم UTF-8 متن و راهنمای سبک نباید از ۸۰۰۰ بایت بیشتر شود
  • مدت فایل صوتی خروجی در سطح مدل حداکثر حدود ۶۵۵ ثانیه است

پشتیبانی جهانی از زبان‌ها

مدل برای استفاده چندزبانه طراحی شده است. در AllModelsAI کافی است زبان موردنظر را از فهرست انتخاب کنید تا کد مناسب به‌صورت خودکار برای مدل ارسال شود.

زبان‌های پشتیبانی‌شده شامل انگلیسی، فارسی، عربی، فرانسوی، آلمانی، اسپانیایی، پرتغالی، ایتالیایی، هلندی، ژاپنی، کره‌ای، هندی، اردو، روسی، لهستانی، رومانیایی، ترکی، تایلندی، ویتنامی، اندونزیایی و ده‌ها زبان دیگر است.

راهنمای سبک چگونه نوشته شود؟

  • مشخص کنید چه کسی صحبت می‌کند؛ برای نمونه گوینده مستند، مجری رادیو، مدرس، شخصیت داستانی یا گوینده تبلیغات
  • فضای صحنه را توضیح دهید؛ محیط، مخاطب و اتفاقی که در لحظه رخ می‌دهد می‌تواند روی اجرای صوت اثر بگذارد
  • یادداشت کارگردانی اضافه کنید؛ لحن، لهجه، سرعت، شدت انرژی، ریتم و احساس موردنظر را روشن بنویسید
  • به‌جای دستورهای کلی مانند «پرانرژی»، نتیجه موردنظر را توصیف کنید؛ مثلاً «لبخند در صدا شنیده شود و ریتم سریع اما واضح باشد»

نمونه راهنمای سبک

AUDIO PROFILE: Jaz R., "The Morning Hype"

THE SCENE: A glass-walled studio overlooking the London skyline.
The red ON AIR light is on and the presenter is moving with the music.

DIRECTOR'S NOTES:
- Style: Bright, sunny, inviting; the smile must be audible.
- Accent: Brixton, London.
- Pace: Energetic, fast and clear, with no dead air.

تگ‌های درون‌متنی

[laughing] That is hilarious! [whispering] But do not tell anyone.

تگ‌ها داخل کروشه نوشته می‌شوند و برای کنترل لحظه‌ای اجرای بخش‌های مختلف متن کاربرد دارند. مدل بسیاری از توضیح‌های طبیعی را تفسیر می‌کند، اما بهتر است تگ‌های سفارشی قبل از استفاده گسترده آزمایش شوند؛ بعضی تگ‌های نامعمول ممکن است به‌جای اعمال‌شدن، خوانده شوند.

صداهای غیرکلامی، سبک و مکث

  • [sigh]: افزودن صدای آه؛ [laughing]: خنده؛ [uhm]: مکث و صدای تردید
  • [whispering]: نجوا؛ [shouting]: صدای بلند؛ [sarcasm]: لحن طعنه‌آمیز؛ [robotic]: اجرای رباتیک
  • [extremely fast]: افزایش شدید سرعت؛ [excitedly]، [bored]، [reluctantly]، [singing] و [asmr] برای حالت‌های توصیفی
  • [short pause]: حدود ۲۵۰ میلی‌ثانیه؛ [medium pause]: حدود ۵۰۰ میلی‌ثانیه؛ [long pause]: حدود یک ثانیه یا بیشتر

۳۰ صدای آماده

  • زنانه: Zephyr روشن، Kore قاطع، Leda جوان، Aoede روان، Callirrhoe خودمانی، Autonoe روشن، Despina نرم و Erinome شفاف
  • زنانه: Laomedeia پرانرژی، Achernar ملایم، Gacrux پخته، Pulcherrima جسور، Vindemiatrix لطیف و Sulafat گرم
  • مردانه: Puck پرانرژی، Charon اطلاع‌رسان، Fenrir هیجان‌پذیر، Orus قاطع، Enceladus نفس‌دار و Iapetus شفاف
  • مردانه: Umbriel خودمانی، Algenib خش‌دار، Algieba نرم، Schedar متعادل، Achird دوستانه و Zubenelgenubi غیررسمی
  • مردانه: Sadachbia سرزنده، Sadaltager آگاه، Alnilam قاطع و Rasalgethi اطلاع‌رسان

هزینه استفاده

  • هزینه هر اجرا به طول متن و مدت فایل صوتی بستگی دارد
  • قیمت توکن‌های ورودی و خروجی به‌صورت شفاف در صفحه مدل نمایش داده می‌شود
  • پس از تولید فایل، هزینه همان اجرا در کنار خروجی نمایش داده می‌شود

نکته‌های گرفتن خروجی بهتر

  • متن، راهنمای سبک و تگ‌ها را هم‌جهت نگه دارید؛ متن ترسناک با راهنمای آرام معمولاً نتیجه متناقض می‌دهد
  • بیش از حد جزئیات تحمیل نکنید؛ کمی آزادی به مدل اغلب خروجی طبیعی‌تری ایجاد می‌کند
  • متنی با واژگان و احساس روشن، اجرای واقعی‌تری نسبت به جمله‌های خنثی تولید می‌کند
  • برای لحظه‌های دقیق از تگ و برای حال‌وهوای کلی از prompt استفاده کنید
  • نشانه‌گذاری، ویرگول، نقطه و نقطه‌ویرگول روی تنفس و مکث‌های طبیعی اثر می‌گذارند
  • برای تولید چند زبان، زبان هر اجرا را متناسب با همان متن انتخاب کنید