مستنسخ صوت
استنساخ أي صوت من مقطع صوت قصير. تحميل 3-10 ثوان من الكلام، وكتابة نصك، وإنشاء صوت في نفس الصوت.
Clone: يوفر مقطع مرجعي لمدة 3-10 ثوان. Preset: يختار من الأصوات المتعددة اللغات المجمعة.
تحميل مرجع صوتي
MP3, WAV, M4A, FLAC
وتشمل اللغات المسبقة في برنامج VibeVoice الإنكليزية والألمانية والفرنسية واليابانية والكورية والبولندية والبرتغالية والإسبانية والإيطالية والهولندية.
500 حرف كحد أقصى
0/500
يستخدم رصيدا واحدا لكل جيل
الصوت المولد
هذا السجل الصوتي تم إنتاجه بواسطة الذكاء الاصطناعي. يتضمن ملف WAV الذي تم تنزيله كشفاً مقروءاً آلياً (RIFF INFO chunk) وفقاً للمادة 50 من قانون الاتحاد الأوروبي للذكاء الاصطناعي. لا تقدم هذا السجل الصوتي كتسجيل لشخص حقيقي دون موافقته.
سياسة الذكاء الاصطناعي
كيف يعمل
1
تحميل المرجع
توفر 3-10 ثوان من الكلام الواضح من الصوت الذي تريد استنساخه.
2
الذكاء الاصطناعي يحلل الصوت
F5-TTS يستخرج خصائص الصوت: النبرة، النغمة، أسلوب الكلام، اللحن.
3
توليد الكلام
نصك سيتم قراءته بالصوت المستنسخ. تحميل النتيجة في WAV.
استنساخ الصوت للاستخدام الشخصي والمأذون به فقط. لا تستنسخ الأصوات بدون موافقة المتكلم.
هل تحتاج إلى النص الكامل، وليس مجرد أداة؟
تحميل الصوت أو الفيديو، أو لصق رابط - الذكاء الاصطناعي نسخ في 100 + لغات مع الكشف عن المتحدث. 10 دقائق مجانية في اليوم، لا التسجيل.
الأسئلة الشائعة
استنساخ الصوت يجري في متصفحك: لصق URL، تحميل ملف، أو تسجيل من ميكروفونك. STT.ai يختار نموذج AI ويعيد النص في أقل من 5 دقائق. تصدير ك TXT، SRT، VTT، DOCX، JSON، أو PDF.
نعم — كل زائر يحصل على 600 دقيقة مجانية للبدء على STT.ai، ويمكن استخدامها ل استنساخ الصوت مثل أي تدفق عمل آخر. الخطط المدفوعة التي تبدأ من $5/شهر تفتح الملفات الأطول، والنسخ الخاصة، وقائمة الانتظار ذات الأولوية.
استنساخ الصوت يعمل على نفس نماذج الذكاء الاصطناعي مثل بقية STT.ai - أفضل نماذجنا تصل إلى 95-97% دقة على الكلام النظيف (3-5% معدل خطأ الكلمات على المعايير المرجعية). تغيير النماذج في الهواء مباشرة إذا كانت المرة الأولى أقل من هدفك.
استنساخ الصوت يمكن أن يعمل على أي من STT.ai 10+ النماذج - STT.ai Enhanced (أكثر دقة)، و Whisper Large V3 (99 لغات)، و NVIDIA Canary (#1 WER على الدعم langs)، و Whisper Turbo (سريع)، و Moonshine (خفيف الوزن)، وأكثر.
نعم، كل نسخة مصدرة في شكل SRT أو VTT - يعمل مع يوتيوب، فيميو، تيك توك، VLC، وكل مشغل الفيديو الرئيسي. أداة تسجيل النصوص الفرعية تغطيهم على الفيديو كترجمات شفوية.
نعم، تقوم خدمة تسجيل المتحدثين تلقائياً بوضع علامات على كل صوت (المتحدث 1، المتحدث 2،...) ويمكنك إعادة تسميتها في المحرر المتكامل، وهي تعمل عبر جميع النماذج واللغات.
معظم استنساخ الصوت الأعمال تنتهي في أقل من 5 دقائق. ملف صوت لمدة ساعة واحدة عادة ما ينتهي في 2-3 دقائق مع أسرع نماذجنا. السرعة تعتمد على النموذج المختار وحمل وحدة المعالجة الرسومية الحالية.
استنساخ الصوت يقبل أكثر من 20 صيغة — MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM, AVI, وغيرها. الخرج إلى TXT, SRT, VTT, DOCX, JSON, أو PDF.
نعم. الملفات الصوتية المقدمة إلى استنساخ الصوت يتم معالجتها وحذفها بشكل افتراضي. الخطط المهنية تضيف تشفير جانب العميل - حتى لو تم اختراق قاعدة بيانات STT.ai، نسختك غير قابلة للقراءة بدون مفتاحك. البيانات لا تستخدم أبدا لتدريب النموذج دون اختيار صريح.
نعم. STT.ai يقدم REST API مع Python و Node.js SDKs، بالإضافة إلى خادم MCP لـ Claude و Cursor - كلها قابلة للاستخدام لـ استنساخ الصوت تدفقات العمل.
نعم، كل نسخة من النص تفتح في محرر متكامل حيث يمكنك تصحيح الكلمات، وإعادة تسمية المتكلمين، وتعديل الختم الزمني، وإضافة ملاحظات. جميع التغييرات يتم حفظها تلقائياً.
تصدير إلى DOCX أو PDF للبريد الإلكتروني. خطط Pro تضاف كلمة المرور المحمية والروابط الدائمة - مفيدة لعمل العميل.
STT.ai يتعامل مع 1300+ منصات بما في ذلك يوتيوب، فيميو، تيك توك، SoundCloud، Zoom، Google Meet، مضيفي البث، وأكثر.