NVIDIA Canary
STT.ai 不运行此模型。 此页面是此模型的参考信息 。
与我们所运行的模型进行翻转 →
3.5%
WER
4
语文
45.0x
速度
CC-BY-4.0
许可证
关于 NVIDIA Canary
NVIDIA 加那利是一个1B参数模型,优于英文、德文、法文和西班牙文本。它建于Nemo框架,使用带有变压器解码器的快速编码编码器,支持自动语文探测和翻译。
模型信息
- 提供者NVIDIA
- 建筑结构-
- 许可证CC-BY-4.0
- 更新Mar 2026
常见问题
NVIDIA Canary是NVIDIA.STT.ai目前没有运行的NVIDIA Canary的语音对文本模式。本页是该模式的参考信息。对于STT.ai的转录,选手向Whiper家庭(Turbo,大V3,中小)提供选手。
根据标准基准,NVIDIA Canary人达到约3.5%的字错误率。 现实世界的准确性取决于音质、口音和语言;对于吵闹或口音录音,预期WER会高出几个百分点。
NVIDIA Canary号不能提供STT.ai号,它自己的许可证条款是自己经营的。STT.ai号免费车位覆盖我们经营的低语模式——600分钟开始,然后每月免费加装。
NVIDIA Canary根据CC-BY-4.0号许可开放源码许可证发放。您可以通过自己的硬件自行托管NVIDIA Canary,或者使用我们的托管版本,这两种版本都可以在商业上使用。
NVIDIA Canary 支持 4 种语言。自动检测为大多数音频选择正确的语言;您也可以手动指定小精度升降。
NVIDIA Canary 处理我们GPUs上大约45.0x的实时音频。 1小时的音频文件在1分钟内完成; 较长的文件排队, 完成后通过电子邮件通知 。
NVIDIA Canary 具有 1B 参数。 大模型往往更准确,但更慢; STT.ai 主机在 GPU NVIDIA Canary GPU 上, 所以参数计数不会影响您的客户端性能 。
NVIDIA Canary 接受每种格式的 STT.ai 支持 - MP3、 WAV、 M4A、 FLAC、 OGG、 MP4、 MKV、 MOV、 WebM、 AVI 等。 输出为 TXT、 SRT、 VTT、 DOCX、 JSON 或 PDF 。
Yes. Speaker diarization runs alongside NVIDIA Canary for every transcription — each speaker is labeled and you can rename them in the editor afterwards.
Yes. NVIDIA Canary runs in our managed environment — audio is processed and deleted by default and never used for training without explicit opt-in. Pro plans add client-side encryption for transcripts at rest.
使用对比工具运行 NVIDIA Canary 相对于同一音频上的其他支持模式, 您可以看到 WER 、 区段计数、 扬声标签和信任度, 并肩得分 。 最常用的比对是 NVIDIA Canary vs Whiseper large V3 比较 。
是, 请指定“ nvidia-canary” 为 / v1/ trancant 端点上的模型参数。 Python 和 Node.js SDKs 包括 NVIDIA Canary 个示例。 免费 API 级包括 100 分钟/ 月 。
是的,因为NVIDIA Canary有CC-BY-4.0的许可证,你可以自行托管它。STT.ai的开放源码页面列出了项目回购和重量。大多数生产团队使用我们的主机版本来跳过GPU采购、模型互换和操作。