معرفی Whisper
Whisper یک مدل تشخیص گفتار چندمنظوره است که با مجموعه بزرگی از فایلهای صوتی متنوع آموزش دیده است. این مدل میتواند گفتار چندزبانه را به متن تبدیل کند، زبان فایل را تشخیص دهد و در صورت نیاز محتوای گفتاری را به انگلیسی ترجمه کند.
معماری مدل از نوع Transformer دنبالهبهدنباله است و چند وظیفه صوتی را در یک جریان واحد انجام میدهد؛ در نتیجه بخشهایی مانند تشخیص زبان، تبدیل گفتار و شناسایی سکوت بدون نیاز به چند مدل جداگانه انجام میشوند.