Free speech to text online مشارکتکنندگان ویکیپدیا.
تبدیل گفتار به متن با رونویسی هوش مصنوعی. پروندههای صوتی را بارگذاری کنید، از میکروفون خود ضبط کنید یا یک نشانی وب را بچسبانید. بیش از ۱۰۰ زبان، مدلهای باز، دقت بیش از ۹۸٪.
۱. بارگذاری ضبط گفتار
بارگذاری یک پرونده صوتی یا ویدئویی، چسباندن یک نشانی وب، یا ضبط گفتار از میکروفون خود.
2. هوش مصنوعی گفتار را به متن تبدیل میکند
مدل Whisper را که با صدای شما سازگار است انتخاب کنید. تشخیص سخنران و تشخیص خودکار زبان شامل میشود.
3. صادرات رونوشت خود
دانلود در 6 قالب. اشتراک لینک های رونوشت با پخش صدا.
مدلهای گفتار به متنName
مدل هوش مصنوعی را که با نیازهای شما سازگار است انتخاب کنید یا اجازه دهید ما بهترین را انتخاب کنیم.
تبدیل گفتار به متن در بیش از ۱۰۰ زبان
آماده تبدیل گفتار به متن هستید ؟
شروع آزاد →پرسشهای متداول
STT.ai ضبط شما را از طریق یک مدل هوش مصنوعی اجرا میکند که به صدا گوش میدهد و متن قابل ویرایش با مهر زمان و برچسبهای سخنران را تولید میکند - تایپ کردن نیازی نیست.
یک مدل آکوستیک موج صدا را به فونمها نگاشت میکند، سپس یک مدل زبانی آنها را به احتمال کلمات و نشانه گذاری جمعآوری میکند.STT.ai این کار را بر روی GPU با خانواده Whisper (Large V3 و Turbo) انجام میدهد، بنابراین یک ساعت ضبط معمولاً در ۲-۳ دقیقه انجام میشود.
بله. هر بازدیدکننده ۶۰۰ دقیقه رایگان در ماه دریافت میکند بدون نیاز به ثبت نام برای اولین پرونده شما. برنامههای پرداختی از ۹ دلار در ماه شروع میشود و فایلهای طولانیتر، رونوشتهای خصوصی و پردازش اولویت را اضافه میکند.
در گفتار واضح بهترین مدلهای ما به دقت ۹۵-۹۷٪ میرسند (۳-۵٪ نرخ خطای کلمه در معیارها). دقت با نویز پس زمینه، لهجه سنگین، گفتار متقاطع یا صدای با نرخ بیت پایین کاهش مییابد - استفاده از یک میکروفون مناسب و یک اتاق ساکت بزرگترین تفاوت را ایجاد میکند.
بله. به میکروفون خود صحبت کنید و STT.ai رونوشت را به صورت زنده از طریق ابزار رونوشت زنده پخش میکند. همچنین میتوانید یک ضبط تمام شده را برای رونوشت دسته جمعی بارگذاری کنید اگر در حین صحبت کردن به آن کلمه به کلمه نیاز ندارید.
STT.ai بیش از ۱۰۰ زبان را تشخیص میدهد و زبان گفتاری را برای اکثر صداها به صورت خودکار تشخیص میدهد. همچنین میتوانید زبان را برای یک افزایش دقت کوچک به صورت دستی تنظیم کنید، و ضبطهای زبان مخلوط با تغییر میان کلیپها مدیریت میشوند.
بله. فهرستبندی بلندگو هر صدا را برچسب میزند) بلندگو ۱ ، بلندگو ۲ ،... ( و میتوانید آنها را در ویرایشگر تغییر نام دهید. این در هر مدل و زبان پشتیبانیشده کار میکند.
STT.ai بیش از ۲۰ فرمت را از جمله MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM و AVI پشتیبانی میکند.
STT.ai هر دو را انجام میدهد - رونویسی و دیاریزاسیون گوینده - اما این دو اصطلاح وظایف متفاوتی را توصیف میکنند.
بله. صدا به صورت پیشفرض پردازش و حذف میشود. برنامههای حرفهای رمزگذاری سمت کارگزار را اضافه میکنند ، بنابراین رونوشتها بدون کلید شما حتی برای STT.ai قابل خواندن نیستند ، و دادههای شما هرگز بدون انتخاب صریح برای آموزش مدل استفاده نمیشود.
بله. STT.ai یک API REST با Python و Node.js SDKs به علاوه یک سرور MCP برای Claude و Cursor دارد. سطح API رایگان شامل ۱۰۰ دقیقه / ماه است، با پرداخت ثانیه ای در آنجا.
بله. هر رونوشت در یک ویرایشگر درونی باز میشود که در آن میتوانید کلمات اشتباه شنیده شده را تصحیح کنید ، بلندگوها را تغییر نام دهید ، مهرهای زمانی را تنظیم کنید ، و یادداشتها را اضافه کنید. ویرایشها در هر قالب صادراتی باقی میمانند.