지저분한 오디오 입력.
깔끔한 JSON 출력.
한 번의 호출로 4시간짜리 파일, 화자 구분 문제, 포맷 지옥을 해결하고 에이전트에 안정적인 스키마를 전달합니다. ffmpeg도, 모니터링도 필요 없습니다.
한 번의 호출로 4시간짜리 파일, 화자 구분 문제, 포맷 지옥을 해결하고 에이전트에 안정적인 스키마를 전달합니다. ffmpeg도, 모니터링도 필요 없습니다.
Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.
Ngoài kia bao nhiêu câu ca tình nhân thơ tháng Các thế gian nghe như con sông trôi ngẹn ngào Và anh buồn sai bao nhiêu lệch trên bức trấn Để biết em rời đi không khi nào về lại Nói đi em bao dân gió trong đời oan cháy Mà sao em văn thân đi suốt kinh doanh
누구나 Whisper를 호출할 수 있습니다. 하지만 주변 시스템을 구축하는 데 몇 주가 소모됩니다. Vocce는 그 부분을 책임지므로 에이전트나 자동화가 한 번의 호출로 결과를 신뢰할 수 있습니다.
4시간짜리 녹음 파일을 분할하고, 병렬로 텍스트 변환한 후, 이음새에서 드리프트 없이 연속적이고 정확한 타임스탬프로 재조립합니다.
10GB+ 업로드 처리 가능전체 파일에서 일관된 안정적인 화자 맵을 제공하며, 신뢰도가 낮은 세그먼트는 조용히 추측하지 않고 플래그를 표시합니다.
speaker_map.json동일한 작업을 다시 보내도 동일한 job_id를 반환합니다. 일시적인 백엔드 장애는 자동으로 재시도되며, 실패한 작업은 청구되지 않습니다.
정확히 한 번 실행 의미론MOV, M4A, WebM, 비정상 비트레이트, 정규화되지 않은 오디오가 포함된 비디오 — Vocce가 정리하고, 음량을 정규화하고, ASR에 맞게 압축하며, URL이나 업로드를 모두 처리합니다. ffmpeg를 건드릴 필요가 없습니다.
20+ 포맷 · 정리 · 정규화 · 압축완료된 결과를 웹훅, 큐 또는 자동화로 푸시합니다. 출력 스키마는 MCP, CLI, API, 모든 노드에서 동일합니다.
agent.v1 스키마한 번의 작업으로 다운스트림 도구가 필요로 하는 모든 아티팩트를 구조화되고 버전 관리된 안정적인 형태로 반환합니다.
{
"speaker_turns": [
{ "speaker": "A", "start": 12.4, "text": "..." }
],
"chapters": ["Problem", "Decision", "Next steps"],
"artifacts": ["transcript.md", "subtitles.srt"]
}실제 발견은 사람들이 개발하는 곳에서 이루어집니다: MCP 레지스트리, 자동화 마켓플레이스, 그리고 CI. 모든 채널에서 안정적인 도구 이름과 단일 스키마를 제공합니다.
{
"mcpServers": {
"vocce": {
"command": "npx",
"args": ["@vocce/transcribe-mcp"],
"env": { "VOCCE_API_KEY": "vc_..." }
}
}
}깊이 있게, 넓게 확장하는 하나의 예시입니다. 동일한 기본 요소로 팟캐스트 게시, 리서치 인터뷰, 컴플라이언스 자막까지 지원하지만 — 팀이 가장 먼저 비용을 지불하는 워크플로우는 바로 이것입니다.
통화 녹음 파일을 업로드하거나 URL을 Vocce에 지정하세요. 오디오를 정리하고, 화자를 분리하고, objection, commitment, next step을 추출한 후 구조화된 요약을 웹훅을 통해 HubSpot, Salesforce 또는 Notion으로 바로 푸시합니다. 재녹음, 수동 메모, 파이프라인 연결 작업이 필요 없습니다.
저희는 솔직합니다: 가장 저렴한 STT도, 미팅 봇도 아닙니다. 중간에서 신뢰성 있는 레이어를 제공합니다.
Deepgram, AssemblyAI, Whisper는 텍스트만 제공합니다. 청킹, 화자 분리 연결, 재시도, 전달은 직접 구축해야 합니다. Vocce가 그 레이어입니다.
Otter와 TurboScribe는 대시보드에서 사람이 사용하도록 만들어졌습니다. Vocce는 코드에서 호출하도록 설계되었으며, 안정적인 스키마와 웹훅을 제공합니다.
직접 만든 ffmpeg + 큐 + ASR 스크립트는 새벽 2시에 4시간짜리 파일에서 멈춥니다. Vocce는 그 스크립트의 유지관리 버전입니다.
파일을 업로드하고 무료 3분 미리보기를 받으세요: 품질 리포트, 첫 번째 자막 라인, 에이전트 JSON 샘플을 확인할 수 있습니다. 내보내기가 필요할 때는 팩 단위로 결제하거나 API를 연결하세요.
동일한 신뢰성 있는 파이프라인으로 포커스된 랜딩 페이지를 구동합니다 — 각 페이지는 방문자가 검색한 정확한 작업으로 시작됩니다.
Raw API는 하나의 깨끗한 파일에 대한 텍스트만 반환합니다. Vocce는 그 주변의 파이프라인을 책임집니다: 타임스탬프 드리프트 없는 멀티시간 파일 청킹 및 연결, 안정적인 화자 분리 맵, 포맷 정규화, 멱등성 작업, 재시도, 웹훅 전달 — 하나의 버전 관리된 스키마로 반환됩니다.
현재 MCP, CLI, REST API, n8n 노드, GitHub Action에서 사용 가능하며 Zapier와 Make도 곧 지원됩니다. 모든 채널에서 도구 이름과 출력 스키마가 동일합니다.
아니요. 업로드 실패와 작업 실패는 크레딧을 소모하지 않습니다. 처리는 작업이 성공적으로 완료될 때만 청구되며, 실패 이유는 코드에 명확하게 노출됩니다.
TXT, Markdown, DOCX, SRT, VTT, 정리된 오디오, 압축된 오디오, 요약 Markdown, 품질 리포트, 다운스트림 도구용 에이전트 JSON 스키마를 지원합니다.
프론트엔드는 설정 가능한 API 엔드포인트로 작업을 전송하며 백엔드가 연결되지 않으면 안전하게 실패 처리합니다. 업로드, 큐, ffmpeg, ASR, 내보내기 파이프라인에 연결하세요. 계약은 backend-contract.md에 문서화되어 있습니다.