STT.ai Enhanced

STT.ai 在支付分层上运行此模型。 这是 STT.ai 增强后的模式。 免费转录使用Whiseper large v3 Turbo, 速度更快 。 见计划 → · 与低语涡轮自由连接 →
4.2%
WER
99
语文
15.9x
速度
MIT
许可证

关于 STT.ai Enhanced

STT.ai 增强型是我们最准确和最快的语音到文字模式。 它建在具有专有性优化的尖端变压器结构上,以100+种语言提供行业领先的单词错误率。 用于制作抄写、实时字幕和企业应用程序的理想。
✦ 解锁增强型模型

Get access to our most accurate model with any paid plan — Whisper large-v3, 99 languages, and speaker diarization.

视图计划 →
模型信息
  • 提供者OpenAI (hosted by STT.ai)
  • 建筑结构-
  • 许可证MIT
  • 更新Aug 2026

常见问题

STT.ai Enhanced 是一个语音到文字模型,由 OpenAI (hosted by STT.ai). STT.ai 以自己的 GPU 运行,用于支付计划的账户,它是 STT.ai 增强级背后的模型。 免费转录使用Whiseper 大型 v3 Turbo, 同一家庭较快的检查站。

根据标准基准,STT.ai Enhanced人达到约4.2%的字错误率。 现实世界的准确性取决于音质、口音和语言;对于吵闹或口音录音,预期WER会高出几个百分点。

STT.ai Enhanced是一种溢价模式,包括任何以9美元/月计的已付STT.ai计划。它无法在免费级别上使用:免费匿名上传,而由Whiseper Turbo操作。

STT.ai Enhanced根据MIT号许可开放源码许可证发放。您可以通过自己的硬件自行托管STT.ai Enhanced,或者使用我们的托管版本,这两种版本都可以在商业上使用。

STT.ai Enhanced 支持 99 种语言。自动检测为大多数音频选择正确的语言;您也可以手动指定小精度升降。

STT.ai Enhanced 处理我们GPUs上大约15.9x的实时音频。 1小时的音频文件在3分钟内完成; 较长的文件排队, 完成后通过电子邮件通知 。

STT.ai Enhanced 具有 1.55B 参数。 大模型往往更准确,但更慢; STT.ai 主机在 GPU STT.ai Enhanced GPU 上, 所以参数计数不会影响您的客户端性能 。

STT.ai Enhanced 接受每种格式的 STT.ai 支持 - MP3、 WAV、 M4A、 FLAC、 OGG、 MP4、 MKV、 MOV、 WebM、 AVI 等。 输出为 TXT、 SRT、 VTT、 DOCX、 JSON 或 PDF 。

Yes. Speaker diarization runs alongside STT.ai Enhanced for every transcription — each speaker is labeled and you can rename them in the editor afterwards.

是的,STT.ai Enhanced在我们的私人基础设施中运行——音频被默认地处理和删除。Pro+添加客户端加密,这样笔录就无法读取,没有您的密钥,二等兵云云让你在自己的VPC中完全自行托管STT.ai Enhanced。

使用对比工具运行 STT.ai Enhanced 相对于同一音频上的其他支持模式, 您可以看到 WER 、 区段计数、 扬声标签和信任度, 并肩得分 。 最常用的比对是 STT.ai Enhanced vs Whiseper large V3 比较 。

是的, 在付费计划中。 指定“ stt-ai-enhanced” 作为 / v1/ trancamp 端点上的模型参数。 没有活动计划的密钥将被送达 Whiseper 大型 v3 Turbo 。 请求仍然成功; 它只是运行自由模式 。

是的,因为STT.ai Enhanced有MIT的许可证,你可以自行托管它。STT.ai的开放源码页面列出了项目回购和重量。大多数生产团队使用我们的主机版本来跳过GPU采购、模型互换和操作。