얼리 액세스에이전트 & 자동화를 위한 미디어 인프라

지저분한 오디오 입력.
깔끔한 JSON 출력.

한 번의 호출로 4시간짜리 파일, 화자 구분 문제, 포맷 지옥을 해결하고 에이전트에 안정적인 스키마를 전달합니다. ffmpeg도, 모니터링도 필요 없습니다.

$
✓ tools registered — try “transcribe this call, give me action items”
API 키가 필요합니다 — agent.v1 · 실패한 작업은 청구되지 않음
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// real output, not a mockup

See what comes back.

Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.

auto-detected · Vietnamese
● produced by the live enginerun it on your file
// 진짜 어려운 부분

텍스트 변환은 공짜입니다. 하지만 신뢰성 있게 대규모로 운영하는 건 다릅니다.

누구나 Whisper를 호출할 수 있습니다. 하지만 주변 시스템을 구축하는 데 몇 주가 소모됩니다. Vocce는 그 부분을 책임지므로 에이전트나 자동화가 한 번의 호출로 결과를 신뢰할 수 있습니다.

멀티시간 파일 청킹

4시간짜리 녹음 파일을 분할하고, 병렬로 텍스트 변환한 후, 이음새에서 드리프트 없이 연속적이고 정확한 타임스탬프로 재조립합니다.

10GB+ 업로드 처리 가능

화자 분리

전체 파일에서 일관된 안정적인 화자 맵을 제공하며, 신뢰도가 낮은 세그먼트는 조용히 추측하지 않고 플래그를 표시합니다.

speaker_map.json

멱등성 작업 & 재시도

동일한 작업을 다시 보내도 동일한 job_id를 반환합니다. 일시적인 백엔드 장애는 자동으로 재시도되며, 실패한 작업은 청구되지 않습니다.

정확히 한 번 실행 의미론

포맷 지옥 해결

MOV, M4A, WebM, 비정상 비트레이트, 정규화되지 않은 오디오가 포함된 비디오 — Vocce가 정리하고, 음량을 정규화하고, ASR에 맞게 압축하며, URL이나 업로드를 모두 처리합니다. ffmpeg를 건드릴 필요가 없습니다.

20+ 포맷 · 정리 · 정규화 · 압축

웹훅 & 단일 스키마

완료된 결과를 웹훅, 큐 또는 자동화로 푸시합니다. 출력 스키마는 MCP, CLI, API, 모든 노드에서 동일합니다.

agent.v1 스키마
// 전달 결과물

텍스트 덩어리가 아닙니다. 코드가 바로 활용할 수 있는 출력입니다.

한 번의 작업으로 다운스트림 도구가 필요로 하는 모든 아티팩트를 구조화되고 버전 관리된 안정적인 형태로 반환합니다.

transcript.agent.json
{
  "speaker_turns": [
    { "speaker": "A", "start": 12.4, "text": "..." }
  ],
  "chapters": ["Problem", "Decision", "Next steps"],
  "artifacts": ["transcript.md", "subtitles.srt"]
}
// 실제로 존재하는 배포 채널

이미 사용 중인 도구에 Vocce를 추가하세요.

실제 발견은 사람들이 개발하는 곳에서 이루어집니다: MCP 레지스트리, 자동화 마켓플레이스, 그리고 CI. 모든 채널에서 안정적인 도구 이름과 단일 스키마를 제공합니다.

install
{
  "mcpServers": {
    "vocce": {
      "command": "npx",
      "args": ["@vocce/transcribe-mcp"],
      "env": { "VOCCE_API_KEY": "vc_..." }
    }
  }
}
MCP 레지스트리게시된 서버 메타데이터로 설치 및 검색이 가능합니다.vocce
n8n · GitHub Action미리 구축된 "미디어 텍스트 변환" 노드와 CI 액션입니다. Zapier 및 Make도 곧 지원 예정입니다.automation marketplaces
GitHub ActionCI에 추가하여 릴리스 미디어나 PR 데모를 텍스트 변환하세요.vocce/transcribe-action
안정적인 계약도구 이름이 변경되지 않으므로 에이전트가 안정적인 사용 패턴을 형성합니다.create_transcription_job
// 플래그십 워크플로우

고객 통화를 CRM에서 바로 활용 가능한 인사이트로 전환하세요.

깊이 있게, 넓게 확장하는 하나의 예시입니다. 동일한 기본 요소로 팟캐스트 게시, 리서치 인터뷰, 컴플라이언스 자막까지 지원하지만 — 팀이 가장 먼저 비용을 지불하는 워크플로우는 바로 이것입니다.

영업 & 성공 팀

녹음 입력. CRM에 실행 가능한 인사이트 출력.

통화 녹음 파일을 업로드하거나 URL을 Vocce에 지정하세요. 오디오를 정리하고, 화자를 분리하고, objection, commitment, next step을 추출한 후 구조화된 요약을 웹훅을 통해 HubSpot, Salesforce 또는 Notion으로 바로 푸시합니다. 재녹음, 수동 메모, 파이프라인 연결 작업이 필요 없습니다.

통화 녹음업로드 또는 URL — 모든 포맷, 모든 길이
Vocce 한 번 호출정리 · 화자 분리 · 텍스트 변환 · 추출
구조화된 인텔리전스objection, commitment, next step, 담당자
CRM으로 푸시웹훅 → HubSpot / Salesforce / Notion
// Vocce의 포지션

Raw API와 헤비 앱 사이의 중간 지점입니다.

저희는 솔직합니다: 가장 저렴한 STT도, 미팅 봇도 아닙니다. 중간에서 신뢰성 있는 레이어를 제공합니다.

Raw ASR API저렴한 분당 요금, 파이프라인 없음.

Deepgram, AssemblyAI, Whisper는 텍스트만 제공합니다. 청킹, 화자 분리 연결, 재시도, 전달은 직접 구축해야 합니다. Vocce가 그 레이어입니다.

텍스트 변환 앱훌륭한 UI, 닫힌 상자.

Otter와 TurboScribe는 대시보드에서 사람이 사용하도록 만들어졌습니다. Vocce는 코드에서 호출하도록 설계되었으며, 안정적인 스키마와 웹훅을 제공합니다.

DIY 파이프라인언젠가는 깨집니다.

직접 만든 ffmpeg + 큐 + ASR 스크립트는 새벽 2시에 4시간짜리 파일에서 멈춥니다. Vocce는 그 스크립트의 유지관리 버전입니다.

// 브라우저에서 직접 테스트

SDK 없이도 출력을 확인할 수 있습니다.

파일을 업로드하고 무료 3분 미리보기를 받으세요: 품질 리포트, 첫 번째 자막 라인, 에이전트 JSON 샘플을 확인할 수 있습니다. 내보내기가 필요할 때는 팩 단위로 결제하거나 API를 연결하세요.

3분 무료 미리보기카드 등록 불필요MP3, MP4, M4A, WAV, MOV
vocce · transcribe● live
클릭하거나 드래그하여 업로드
오디오 또는 비디오 파일 · ≤ 50MB
// 높은 의도의 진입점

하나의 엔진. 다양한 광고 준비 페이지.

동일한 신뢰성 있는 파이프라인으로 포커스된 랜딩 페이지를 구동합니다 — 각 페이지는 방문자가 검색한 정확한 작업으로 시작됩니다.

Convert audio to text, then export the whole pack.
Turn interviews into clean, quotable transcripts.
Whisper-quality transcription without the setup.
Turn video into transcripts, captions, and reusable notes.
Convert MP4 into text, captions, and clean handoff files.
Turn quick voice notes into usable text.
Create subtitles from audio or video without rebuilding the workflow.
Translate subtitles without breaking the timeline.
Drop a video. Get a soundtrack that fits.
Turn podcast episodes into transcripts, notes, and reusable content.
Upload a meeting recording. Get decisions and next steps.
Give your AI agent a media processing tool.
Automate transcription from the terminal.
Give agents transcripts they can actually reason over.
Clean up messy voice recordings.
Make big, messy media easier to transcribe.
Convert M4A to MP3 in seconds.
Convert WAV to MP3 without the bulk.
Convert FLAC to MP3 that plays everywhere.
Convert AAC to MP3 cleanly.
Convert OGG to MP3 that just works.
Turn MP4 video into MP3 audio.
Convert any audio to any format.
Convert MOV to MP4 without re-encoding pain.
Pull the audio out of any video.
Compress MP3 files without killing the sound.
Compress any audio file down to size.
Get any video under 10MB.
Make your clip fit Discord's upload limit.
Shrink video small enough to email.
Compress MP4 files fast.
Compress any video, predictably.
Make any recording sound professional.
Convert MP3 to text you can use.
Turn lectures into notes worth keeping.
Transcribe entire courses, lesson by lesson.
Notes that write themselves.
Generate WebVTT captions for the web.
Translate subtitles into any language.
Translate SRT files without breaking sync.
Turn any recording or file into structured notes.
Long recording in. Short, useful summary out.
Ask your files questions. Get cited answers.
Turn lectures and notes into flashcards automatically.
Compress images without uploading them anywhere.
Make PDFs smaller without wrecking readability.
// FAQ

개발 리스크를 줄여주는 답변.

Vocce는 Raw ASR API와 무엇이 다른가요?+

Raw API는 하나의 깨끗한 파일에 대한 텍스트만 반환합니다. Vocce는 그 주변의 파이프라인을 책임집니다: 타임스탬프 드리프트 없는 멀티시간 파일 청킹 및 연결, 안정적인 화자 분리 맵, 포맷 정규화, 멱등성 작업, 재시도, 웹훅 전달 — 하나의 버전 관리된 스키마로 반환됩니다.

어디에서 호출할 수 있나요?+

현재 MCP, CLI, REST API, n8n 노드, GitHub Action에서 사용 가능하며 Zapier와 Make도 곧 지원됩니다. 모든 채널에서 도구 이름과 출력 스키마가 동일합니다.

실패한 작업에 크레딧이 차감되나요?+

아니요. 업로드 실패와 작업 실패는 크레딧을 소모하지 않습니다. 처리는 작업이 성공적으로 완료될 때만 청구되며, 실패 이유는 코드에 명확하게 노출됩니다.

어떤 내보내기 형식을 지원하나요?+

TXT, Markdown, DOCX, SRT, VTT, 정리된 오디오, 압축된 오디오, 요약 Markdown, 품질 리포트, 다운스트림 도구용 에이전트 JSON 스키마를 지원합니다.

백엔드에 바로 도입할 수 있나요?+

프론트엔드는 설정 가능한 API 엔드포인트로 작업을 전송하며 백엔드가 연결되지 않으면 안전하게 실패 처리합니다. 업로드, 큐, ffmpeg, ASR, 내보내기 파이프라인에 연결하세요. 계약은 backend-contract.md에 문서화되어 있습니다.

똑같은 미디어 파이프라인을 다시 구축하지 마세요.

API 키를 받거나, MCP를 설치하거나, 파일을 업로드하세요. 한 번의 호출, 하나의 스키마, 모든 채널.