同一套可靠的 Vocce 流水线,专注这一件事。免费开始,需要更多时再升级,套餐每月 9.90 美元起。
一小时的对话,落到纸上大约 9000 字。手打出来差不多要一整个工作日,想在录音里翻到某一句原话更是另一种折磨。把 音频转成文字,你得到的是可以读、可以搜、可以直接粘贴的内容——通常几分钟就搞定。
人们手里的录音很少是干净的:手机搁在桌上录的、两个人同时说话的、讲师在教室另一头讲的。Vocce 对所有文件执行同一套流程——先归一化响度、压制噪声,再以词级时间戳进行转写——你不需要在开始前调任何参数。
最终你会得到:用于记笔记的纯文本、视频用的 SRT 或 VTT 字幕、提炼了决策和待办事项的摘要,以及供下游工具使用的 JSON 格式。每个文件的前三分钟免费试听效果,转写失败不扣费。
响度归一化和噪声压制在转写之前执行,所以说话声音小或空调嗡嗡响都不会变成一段空白。
每一行都锚定在音频上。长文件被切段、并行转写、再拼接回来——四小时的录音在拼接处也不会错位。
英语、中文、西班牙语、印地语、阿拉伯语等数十种语言——自动检测,也可以手动指定,不靠运气。
TXT、Markdown、DOCX、SRT、VTT,以及一套干净的 JSON 结构供脚本和 Agent 使用——不是那种只能看不能导出的封闭框。
模型拿不准的词会被标记出来,而不是悄悄编造——你知道哪十秒值得再听一遍。
在浏览器里跑,或者用 REST API、CLI、MCP Server 发出完全相同的请求——随便接。
把采访和节目转成可搜索、可引用的逐字稿,带时间戳——直接用于文章、shownotes 和剪辑。
把讲座、研讨会和田野录音转成文字,可以快速浏览、标注和引用,不用花几个小时反复听。
把通话录音一次性丢进来,拿到干净的文本和 Agent 可直接处理的 JSON——你的工具链自动接手。
把 MP3、M4A、WAV 或任何常见音频文件拖入上方工具。Vocce 会先降噪,再进行语音识别,最终返回带时间戳的逐字稿,并提供 TXT、DOCX、SRT 和 JSON 导出。前 3 分钟免费试用,无需绑定银行卡。
MP3、M4A、WAV、AAC、FLAC、OGG、WMA 均可直接使用——MP4、MOV 等视频文件也没问题,Vocce 会自动提取并归一化其中的音频轨道。
音频在转写之前会先降噪和响度归一化——准确率的关键就在这里。每次任务都会附带一份质量报告,不确信的词会被标记出来,而不是凭空猜测。
可以——这正是预处理环节的作用。电话录音、带口音的说话声、嘈杂房间——直接丢进来就行,你不需要提前做任何处理。
多人场景的说话人分离功能即将上线。目前每一行都带有时间戳,两人采访的来回对话依然一目了然。
可以。长文件会被切段、并行转写、再拼接回连续的时间戳——四小时的录音在拼接处也不会漂移。
文件仅用于你的任务处理,不会用于训练任何模型。你导出所需内容后,工作副本会自动过期——不会在任何地方被发布。
每个文件可免费预览前 3 分钟并查看质量报告。免费版每月可处理 30 分钟,付费方案从 $9.90/mo 起——转写失败的任务不收费。