early accessMedia-Infrastruktur für Agents & Automatisierungen

Chaotisches Audio rein.
Sauberes JSON raus.

Ein Aufruf frisst die 4-Stunden-Datei, das Stimmengewirr und das Format-Chaos – und übergibt deinem Agenten ein stabiles Schema. Kein ffmpeg. Kein Babysitten.

$
✓ tools registered — try “transcribe this call, give me action items”
braucht einen Key – agent.v1 · fehlgeschlagene Jobs werden nie berechnet
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// real output, not a mockup

See what comes back.

Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.

auto-detected · Vietnamese
● produced by the live enginerun it on your file
// Der eigentliche Knackpunkt

Transkription ist gratis. Sie zuverlässig zu machen, ist es nicht.

Jeder kann Whisper aufrufen. Was Wochen kostet, ist alles drumherum. Vocce übernimmt genau diese Teile, damit dein Agent oder deine Automation einen Aufruf macht und dem Ergebnis vertraut.

Mehrstündige Dateien chunking

Eine 4-Stunden-Aufnahme splitten, parallel transkribieren und mit durchgehenden, korrekten Zeitstempeln zusammensetzen – keine Drift an den Nahtstellen.

verarbeitet Uploads >10 GB

Sprecher-Diarisierung

Stabile Sprecherzuordnung über die gesamte Datei hinweg. Segmente mit niedriger Konfidenz werden markiert, nicht stillschweigend geraten.

speaker_map.json

Idempotente Jobs & Wiederholungen

Denselben Job erneut senden, dieselbe job_id zurückbekommen. Flüchtige Backend-Fehler werden automatisch wiederholt. Fehlgeschlagene Jobs werden nicht berechnet.

Exakt-einmal-Semantik

Format-Chaos, gelöst

MOV, M4A, WebM, krumme Bitraten, Video ohne normalisierte Audiospur – Vocce bereinigt, normalisiert die Lautstärke, komprimiert für ASR und akzeptiert URL oder Upload. Du fasst ffmpeg nie an.

20+ Formate · bereinigen · normalisieren · komprimieren

Webhooks & ein Schema

Ergebnisse per Push an deinen Hook, deine Queue oder Automation. Das Ausgabe-Schema ist identisch über MCP, CLI, API und jeden Knoten hinweg.

agent.v1 Schema
// Das Ergebnis

Keine Textwand. Ausgabe, auf die dein Code reagieren kann.

Ein Job liefert jedes Artefakt, das nachgelagerte Tools brauchen – strukturiert, versioniert und stabil genug, um darauf aufzubauen.

transcript.agent.json
{
  "speaker_turns": [
    { "speaker": "A", "start": 12.4, "text": "..." }
  ],
  "chapters": ["Problem", "Decision", "Next steps"],
  "artifacts": ["transcript.md", "subtitles.srt"]
}
// Verteilung, die es wirklich gibt

Vocce in die Tools einbinden, die du schon nutzt.

Echte Entdeckung passiert dort, wo Leute bauen: im MCP-Registry, in Automatisierungs-Marktplätzen und in deiner CI. Stabile Tool-Namen und ein Schema über alle Kanäle hinweg.

install
{
  "mcpServers": {
    "vocce": {
      "command": "npx",
      "args": ["@vocce/transcribe-mcp"],
      "env": { "VOCCE_API_KEY": "vc_..." }
    }
  }
}
MCP RegistryVeröffentlichte Server-Metadaten – installierbar und indexierbar.vocce
n8n · GitHub ActionEin fertiger „Medien transkribieren“-Node und eine GitHub Action. Zapier und Make bald.automation marketplaces
GitHub ActionIn CI einbinden, um Release-Medien oder PR-Demos zu transkribieren.vocce/transcribe-action
Stabiler VertragTool-Namen ändern sich nie – Agents bilden zuverlässige Gewohnheiten.create_transcription_job
// Flaggschiff-Workflow

Kundenanrufe in CRM-ready Intelligence verwandeln.

Ein Beispiel dafür, wie wir in die Tiefe gehen, nicht in die Breite. Dieselben Bausteine treiben Podcast-Produktion, Forschungsinterviews und Compliance-Untertitel – aber hier ist der Workflow, den Teams zuerst bezahlen.

Sales & Success Teams

Aufnahme rein. Aktion im CRM raus.

Wirf eine Anrufaufzeichnung rein (oder gib Vocce die URL). Es bereinigt das Audio, trennt Sprecher, extrahiert Einwände, Zusagen und nächste Schritte und schiebt eine strukturierte Zusammenfassung per Webhook direkt in HubSpot, Salesforce oder Notion. Kein Neuaufnehmen, keine manuellen Notizen, keine zusammengeklebte Pipeline.

AnrufaufzeichnungUpload oder URL – jedes Format, jede Länge
Ein Vocce-Aufrufbereinigen · diarisieren · transkribieren · extrahieren
Strukturierte IntelligenceEinwände, Zusagen, nächste Schritte, Verantwortliche
Ins CRM gepushtWebhook → HubSpot / Salesforce / Notion
// Wo Vocce hingehört

Zwischen einer rohen API und einer schweren App.

Wir sind ehrlich, wo wir stehen: nicht das billigste STT, kein Meeting-Bot. Die zuverlässige Schicht in der Mitte.

Rohe ASR-APIsGünstige Minuten, keine Pipeline.

Deepgram, AssemblyAI, Whisper liefern Text. Du baust trotzdem Chunking, Diarisierungs-Verknüpfung, Wiederholungen und Zustellung. Vocce ist diese Schicht.

Transkriptions-AppsTolle UI, geschlossene Box.

Otter und TurboScribe sind für Menschen im Dashboard gemacht. Vocce ist dafür gemacht, von Code aufgerufen zu werden – mit stabilem Schema und Webhooks.

DIY-PipelineFunktioniert – bis sie es nicht tut.

Dein eigenes ffmpeg + Queue + ASR-Skript zerschellt an der 4-Stunden-Datei um 2 Uhr nachts. Vocce ist die gewartete Version dieses Skripts.

// Im Browser testen

Kein SDK nötig, um das Ergebnis zu sehen.

Datei hochladen und eine kostenlose 3-Minuten-Vorschau bekommen: Qualitätsbericht, die ersten Untertitelzeilen und eine Kostprobe des Agent-JSONs. Wenn der Export zählt, zahlst du pro Paket oder schaltest die API frei.

3-minütige kostenlose VorschauKeine Karte nötigMP3, MP4, M4A, WAV, MOV
vocce · transcribe● live
Klicken oder ziehen zum Hochladen
Audio- oder Videodatei · ≤ 50MB
// Hochintensive Einstiegspunkte

Eine Engine. Viele anzeigenfertige Seiten.

Dieselbe zuverlässige Pipeline hinter fokussierten Landing Pages – jede öffnet mit genau dem Job, nach dem der Besucher gesucht hat.

Convert audio to text, then export the whole pack.
Turn interviews into clean, quotable transcripts.
Whisper-quality transcription without the setup.
Turn video into transcripts, captions, and reusable notes.
Convert MP4 into text, captions, and clean handoff files.
Turn quick voice notes into usable text.
Create subtitles from audio or video without rebuilding the workflow.
Translate subtitles without breaking the timeline.
Drop a video. Get a soundtrack that fits.
Turn podcast episodes into transcripts, notes, and reusable content.
Upload a meeting recording. Get decisions and next steps.
Give your AI agent a media processing tool.
Automate transcription from the terminal.
Give agents transcripts they can actually reason over.
Clean up messy voice recordings.
Make big, messy media easier to transcribe.
Convert M4A to MP3 in seconds.
Convert WAV to MP3 without the bulk.
Convert FLAC to MP3 that plays everywhere.
Convert AAC to MP3 cleanly.
Convert OGG to MP3 that just works.
Turn MP4 video into MP3 audio.
Convert any audio to any format.
Convert MOV to MP4 without re-encoding pain.
Pull the audio out of any video.
Compress MP3 files without killing the sound.
Compress any audio file down to size.
Get any video under 10MB.
Make your clip fit Discord's upload limit.
Shrink video small enough to email.
Compress MP4 files fast.
Compress any video, predictably.
Make any recording sound professional.
Convert MP3 to text you can use.
Turn lectures into notes worth keeping.
Transcribe entire courses, lesson by lesson.
Notes that write themselves.
Generate WebVTT captions for the web.
Translate subtitles into any language.
Translate SRT files without breaking sync.
Turn any recording or file into structured notes.
Long recording in. Short, useful summary out.
Ask your files questions. Get cited answers.
Turn lectures and notes into flashcards automatically.
Compress images without uploading them anywhere.
Make PDFs smaller without wrecking readability.
// FAQ

Antworten, die das Integrationsrisiko senken.

Was kann Vocce, was eine rohe ASR-API nicht kann?+

Eine rohe API liefert Text für eine saubere Datei. Vocce übernimmt die Pipeline drumherum: mehrstündige Dateien chunking und zusammensetzen ohne Zeitstempel-Drift, Sprecher-Diarisierung mit stabiler Zuordnung, Format-Normalisierung, idempotente Jobs, Wiederholungen und Webhook-Zustellung – alles in einem versionierten Schema.

Von wo aus kann ich Vocce aufrufen?+

MCP, CLI, REST-API, ein n8n-Node und eine GitHub Action sind verfügbar — Zapier und Make folgen bald. Tool-Namen und das Ausgabe-Schema sind über alle Kanäle identisch.

Kosten fehlgeschlagene Jobs Credits?+

Nein. Upload-Fehler und fehlgeschlagene Jobs verbrauchen keine Credits. Die Verarbeitung wird nur berechnet, wenn ein Job erfolgreich abgeschlossen wird – mit einem klaren Fehlergrund für deinen Code.

Welche Exportformate werden unterstützt?+

TXT, Markdown, DOCX, SRT, VTT, bereinigtes Audio, komprimiertes Audio, Zusammenfassung als Markdown, ein Qualitätsbericht und das Agent-JSON-Schema für nachgelagerte Tools.

Ist es bereit für mein Backend?+

Das Frontend schickt Jobs an einen konfigurierbaren API-Endpunkt und schlägt fehl, wenn das Backend nicht angebunden ist. Schließ es an deine Upload-, Queue-, ffmpeg-, ASR- und Export-Pipeline an; der Vertrag ist in backend-contract.md dokumentiert.

Hör auf, dieselbe Media-Pipeline neu zu bauen.

Hol dir einen API-Key, installier das MCP oder wirf einfach eine Datei rein. Ein Aufruf, ein Schema, jeder Kanal.