동일한 신뢰할 수 있는 Vocce 파이프라인, 이 작업에 집중합니다. 무료로 시작하고, 더 필요하면 월 $9.90부터.
1시간 대화는 보통 9,000단어 분량입니다. 손으로 일일이 받아 적으면 하루 중大半이 사라지고, 녹음 파일을 뒤져 특정 대목을 찾는 것도 꽤 고역이죠. 오디오를 텍스트로 변환하면 읽고, 검색하고, 바로 붙여넣을 수 있는 결과물이 몇 분 만에 나옵니다.
사람들이 실제로 가지고 있는 녹음은 대부분 지저분합니다. 테이블 위에 올려둔 핸드폰, 동시에 말하는 두 목소리, 강의실 건너편에서 들리는 강의. Vocce는 모든 파일을 같은 과정으로 처리합니다 — 음량을 정규화하고, 노이즈를 줄이고, 단어 단위 타임스탬프와 함께 텍스트로 변환합니다. 별도 설정은 필요 없습니다.
결과물은 노트용 일반 텍스트, 영상과 함께 쓸 SRT나 VTT, 결정사항과 할 일을 추려낸 요약, 그리고 다른 도구가 바로 쓸 수 있는 JSON 형식으로 제공됩니다. 처음 3분은 무료로 품질을 확인할 수 있고, 실패한 작업은 요금이 청구되지 않습니다.
음량 정규화와 노이즈 제거가 음성 인식보다 먼저 실행됩니다. 작게 말하는 발표자나 에어컨 소리가 빈 공백으로 남지 않는 이유입니다.
모든 문장이 오디오의 정확한 지점에 고정됩니다. 긴 파일은 분할되어 병렬로 처리된 후 이어붙여지므로, 4시간짜리 녹음도 중간에서 밀리지 않습니다.
영어, 중국어, 스페인어, 힌디어, 아랍어 등 수십 개 언어를 자동 감지하거나, 직접 언어를 지정할 수도 있습니다.
TXT, Markdown, DOCX, SRT, VTT, 그리고 스크립트와 에이전트에 바로 넣을 수 있는 JSON — 복사해서 옮길 필요 없이 바로 내보내세요.
모델이 확신하지 못한 단어는 조용히 지어내지 않고 따로 표시됩니다. 어느 10초 구간을 다시 들어볼지 바로 알 수 있습니다.
브라우저에서 실행하든, REST API, CLI, 또는 에이전트에 연결된 MCP 서버로 동일한 요청을 보내든 결과는 같습니다.
인터뷰와 에피소드를 검색 가능하고 인용할 수 있는 대본으로 만드세요. 기사, 쇼노트, 클립 제작에 바로 쓸 수 있습니다.
강의, 세미나, 현장 녹음을 텍스트로 변환해 훑어보고 메모하고 인용하세요. 몇 시간씩 다시 듣지 않아도 됩니다.
통화 녹음을 업로드하면 깔끔한 텍스트와 에이전트가 자동으로 처리할 수 있는 JSON이 함께 나옵니다.
MP3, M4A, WAV, 또는 일반적인 오디오 파일을 위 도구에 끌어넣으세요. Vocce가 오디오를 정리하고 음성 인식을 실행한 후 타임스탬프가 포함된 대본과 TXT, DOCX, SRT, JSON 파일을 제공합니다. 처음 3분은 무료이며 카드 등록이 필요 없습니다.
MP3, M4A, WAV, AAC, FLAC, OGG, WMA를 직접 지원합니다. MP4나 MOV 같은 비디오 파일도 가능합니다. Vocce가 자동으로 오디오 트랙을 추출하고 정리합니다.
음성 인식 전에 오디오를 정리하고 음량을 정규화하는 과정이 정확도의 대부분을 결정합니다. 모든 작업에는 품질 보고서가 제공되며, 불확실한 단어는 추측 대신 표시됩니다.
네, 바로 그걸 위해 정리 과정이 있습니다. 통화 녹음, 악센트가 있는 발음, 시끄러운 공간의 녹음도 그대로 넣으세요. 사전 처리할 필요가 없습니다.
여러 명이 말한 녹음에서 화자를 구분하는 기능은 준비 중입니다. 현재는 모든 문장에 타임스탬프가 찍히므로, 두 사람 인터뷰라도 대화 흐름을 따라가기 쉽습니다.
네. 긴 파일은 분할되어 병렬로 처리된 후 연속된 타임스탬프와 함께 이어붙여집니다. 4시간짜리 녹음도 중간에서 밀리지 않습니다.
파일은 작업을 위해서만 처리되며 모델 학습에 사용되지 않습니다. 필요한 결과물을 내보내면 작업 파일은 자동으로 삭제됩니다. 어디에도 게시되지 않습니다.
모든 파일은 품질 보고서와 함께 3분 무료 미리보기를 제공합니다. 무료 티어는 월 30분이며, 유료 플랜은 $9.90/mo부터 시작합니다. 실패한 작업은 요금이 청구되지 않습니다.