Vapaa puhe tekstiin verkossa
Muunna puhe tekstiksi tekoälyllä varustetulla transkriptiolla. Lataa äänitiedostoja, tallenna mikrofonista tai liitä URL. 100+ kieltä, 10+-malleja, 98%+ tarkkuutta.
1. Lataa puheäänitys
Lataa ääni- tai videotiedosto, liitä URL tai tallenna puhe mikrofonistasi.
2. tekoäly muuntaa puheen tekstiksi
Valitse 10+ tekoälymallista. Kaiuttimen havainnointi ja kielen automaattinen havainnointi mukaan lukien.
3. Vie transcript
Lataa 6 muodossa. Jaa transkriptiolinkit ääni toistolla.
Puhe tekstimalleille
Valitse tarvitsemasi tekoälymalli – tai anna meidän valita paras.
Tekstipuhe 100+ kielellä
Puhe tekstille Käytä tapauksia
Oletko valmis kääntämään puheen tekstiksi?
Aloita ilmaiseksi →Usein kysyttyjä kysymyksiä
Puhe tekstiin (jota kutsutaan myös puheentunnistukseksi tai ASR:ksi) muuntaa puheäänen automaattisesti kirjoitetuiksi sanoiksi. STT.ai ohjaa äänitettäsi tekoälymallilla, joka kuuntelee äänen ja lähtöjen muokattavissa olevaa tekstiä aikaleimalla ja kaiuttimen tarroilla – ei tarvitse kirjoittaa.
Akustinen malli kartoittaa ääniaaltomuodon fonemeille, sitten kielimalli kokoaa ne todennäköisimpiin sanoihin ja välimerkit. GPU:lla STT.ai tekee tämän Whisper Large V3:n ja NVIDIA Canaryn mallien avulla, joten tunnin mittainen äänitys tehdään yleensä 2-3 minuutissa.
Kyllä. Jokainen vierailija saa 600 vapaaminuuttia, jolloin ensimmäiseen tiedostoon ei tarvitse kirjautua. Maksaminen alkaa 5 dollarista kuukaudessa ja lisää pidempiä tiedostoja, yksityisiä dokumentteja ja ensisijaista käsittelyä.
Puhtaalla puheella parhaat mallimme saavuttavat 95–97 prosentin tarkkuuden (3–5 prosentin Word Error Rate on requirements). Tarkkuus putoaa taustamelun, raskaan korostuksen, ristipuheen tai matalabittisen äänen avulla, kunnollisella mikrofonilla ja hiljaisella huoneella on suurin ero.
Kyllä. Puhu mikrofoniin ja STT.ai lähettää transkriptin suorana live-trancription-työkalun kautta. Voit myös ladata valmiin nauhoitteen erän transkriptiota varten, jos et tarvitse sitä sana kerrallaan puhuessasi.
STT.ai tunnistaa 100+-kieltä ja havaitsee puhekielen automaattisesti suurimmalle osalle äänistä. Voit myös asettaa kielen manuaalisesti pientä tarkkuuskorotusta varten, ja sekakielisiä tallenteita käsitellään vaihtamalla keskileveyttä.
Kyllä. Kaiuttimen diarisointi merkitsee jokaisen äänen (kaiuttimet 1, Speaker 2,...) ja voit nimetä ne uudelleen editorissa. Tämä toimii kaikilla tuetuilla malleilla ja kielillä.
STT.ai hyväksyy 20+ formaattia, kuten MP3, WAV, M4A, FLAC, OGG, MP4, MKV, MOV, WebM ja AVI. Output to TXT, SRT, VTT, DOCX, JSON tai PDF.
Puhe tekstiin kirjoittaa, mitä sanoi sanoiksi; äänentunnistus (puhujan tunnistaminen) ratkaisee, mitä WHO sanoi. STT.ai tekee molemmat – transkriptio ja puhujan diarisointi – mutta termit kuvaavat erilaisia tehtäviä.
Kyllä. Ääni käsitellään ja poistetaan oletuksena. Pro suunnittelee lisäävänsä asiakaspuolen salauksen niin, että selostukset ovat lukukelvottomia ilman avainta, jopa STT.ai:een, eikä dataasi koskaan käytetä mallikoulutukseen ilman nimenomaista opt-in-mahdollisuutta.
Kyllä. STT.ai:ssa on REST-rajapinta, jossa on Python ja Node.js SDKs sekä MCP-palvelin Claudelle ja Cursorille. Vapaa API-taso sisältää 100 minuuttia kuukaudessa, ja sekuntilaskutus ylittää sen.
Kyllä. Jokainen transkripti avautuu sisäänrakennetussa editorissa, jossa voi korjata väärin kuultuja sanoja, nimetä kaiuttimet uudelleen, säätää aikaleimat ja lisätä muistiinpanoja. Muokkautuu joka vientimuodossa.