early accessinfrastructure média pour agents & automatisations

audio désordonné en entrée.
JSON propre en sortie.

Un seul appel avale le fichier de 4 heures, le bazar des intervenants et le calvaire des formats — et livre à votre agent un schéma stable. Pas de ffmpeg. Pas de surveillance.

$
✓ tools registered — try “transcribe this call, give me action items”
besoin d'une clé — agent.v1 · échecs jamais facturés
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// real output, not a mockup

See what comes back.

Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.

auto-detected · Vietnamese
● produced by the live enginerun it on your file
// Le vrai problème

La transcription est gratuite. La rendre fiable à l'échelle, ça ne l'est pas.

N'importe qui peut appeler Whisper. Ce qui brûle des semaines, c'est tout le reste. Vocce gère ces parties pour que votre agent ou votre automatisation fasse un seul appel et ait confiance dans le résultat.

Découpage de fichiers multi-heures

Découpez un enregistrement de 4 heures, transcrivez en parallèle, et reassemblez avec des horodatages continus et corrects — sans dérive aux jointures.

gère les uploads de 10 Go+

Diarisation des locuteurs

Des cartes de locuteurs stables et cohérentes sur tout le fichier, avec les segments de faible confiance signalés plutôt que devinés en silence.

speaker_map.json

Tâches idempotentes & tentatives

Renvoyez la même tâche, obtenez le même job_id. Les échecs transitoires du backend sont réessayés automatiquement. Les tâches échouées ne sont pas facturées.

sémantique exactly-once

L'enfer des formats, résolu

MOV, M4A, WebM, débits bizarres, vidéo sans audio normalisé — Vocce nettoie, normalise le volume, compresse pour l'ASR, accepte une URL ou un upload. Vous ne touchez jamais à ffmpeg.

20+ formats · nettoie · normalise · compresse

Webhooks & un seul schéma

Poussez les résultats terminés vers votre hook, file d'attente ou automatisation. Le schéma de sortie est identique sur MCP, CLI, API et chaque nœud.

schéma agent.v1
// Le livrable

Pas un mur de texte. Une sortie que votre code peut exploiter.

Une tâche retourne tous les artefacts dont les outils aval ont besoin — structurés, versionnés et assez stables pour construire dessus.

transcript.agent.json
{
  "speaker_turns": [
    { "speaker": "A", "start": 12.4, "text": "..." }
  ],
  "chapters": ["Problem", "Decision", "Next steps"],
  "artifacts": ["transcript.md", "subtitles.srt"]
}
// Une distribution qui existe vraiment

Intégrez Vocce dans les outils que vous utilisez déjà.

La vraie découverte se fait là où les gens construisent : le registre MCP, les marketplaces d'automatisation et votre CI. Des noms d'outils stables et un seul schéma sur tous les canaux.

install
{
  "mcpServers": {
    "vocce": {
      "command": "npx",
      "args": ["@vocce/transcribe-mcp"],
      "env": { "VOCCE_API_KEY": "vc_..." }
    }
  }
}
Registre MCPMétadonnées de serveur publiées pour une installation et une indexation faciles.vocce
n8n · GitHub ActionUn nœud « Transcrire un média » prêt et une GitHub Action. Zapier et Make bientôt.automation marketplaces
GitHub ActionÀ glisser dans votre CI pour transcrire les médias d'une release ou les démos d'une PR.vocce/transcribe-action
Contrat stableLes noms d'outils ne dérivent jamais, les agents forment des habitudes fiables.create_transcription_job
// Workflow phare

Transformez les appels clients en intelligence exploitable dans votre CRM.

Un exemple d'approfondissement, pas d'éparpillement. Les mêmes primitives alimentent la publication de podcasts, les entretiens de recherche et le sous-titrage de conformité — mais voici le workflow que les équipes paient en premier.

équipes commerciales & réussite client

Enregistrement en entrée. Actions dans votre CRM en sortie.

Déposez un appel enregistré (ou pointez Vocce vers l'URL). Il nettoie l'audio, sépare les intervenants, extrait les objections, les engagements et les prochaines étapes, puis pousse un résumé structuré directement dans HubSpot, Salesforce ou Notion via webhook. Pas de ré-enregistrement, pas de notes manuelles, pas de pipeline bricolé.

Enregistrement d'appelUpload ou URL — tout format, toute durée
Un seul appel Voccenettoie · diarise · transcrit · extrait
Intelligence structuréeobjections, engagements, prochaines étapes, responsables
Poussé vers votre CRMwebhook → HubSpot / Salesforce / Notion
// La place de Vocce

Entre une API brute et une application lourde.

Nous sommes honnêtes sur notre position : ni le STT le moins cher, ni un bot de réunion. La couche fiable au milieu.

API ASR brutesMinutes bon marché, pas de pipeline.

Deepgram, AssemblyAI, Whisper vous donnent du texte. Vous devez encore construire le découpage, le raccord de diarisation, les tentatives et la livraison. Vocce est cette couche.

Applications de transcriptionSuper interface, boîte fermée.

Otter et TurboScribe sont conçus pour des humains dans un tableau de bord. Vocce est conçu pour être appelé par du code, avec un schéma stable et des webhooks.

Pipeline maisonÇa marche jusqu'à ce que ça casse.

Votre propre ffmpeg + file d'attente + script ASR plante sur le fichier de 4 heures à 2h du matin. Vocce est la version maintenue de ce script.

// Essayez dans le navigateur

Pas besoin de SDK pour voir le résultat.

Déposez un fichier et obtenez un aperçu gratuit de 3 minutes : rapport de qualité, premières lignes de sous-titres et un extrait du JSON agent. Quand l'export compte, payez par pack ou branchez l'API.

Aperçu gratuit de 3 minutesPas de carte bancaire requiseMP3, MP4, M4A, WAV, MOV
vocce · transcribe● live
Cliquez ou glissez pour télécharger
Fichier audio ou vidéo · ≤ 50MB
// Points d'entrée à forte intention

Un moteur. Des pages prêtes pour les campagnes.

Le même pipeline fiable derrière des pages d'atterrissage ciblées — chacune commence par la tâche exacte que le visiteur a recherchée.

Convert audio to text, then export the whole pack.
Turn interviews into clean, quotable transcripts.
Whisper-quality transcription without the setup.
Turn video into transcripts, captions, and reusable notes.
Convert MP4 into text, captions, and clean handoff files.
Turn quick voice notes into usable text.
Create subtitles from audio or video without rebuilding the workflow.
Translate subtitles without breaking the timeline.
Drop a video. Get a soundtrack that fits.
Turn podcast episodes into transcripts, notes, and reusable content.
Upload a meeting recording. Get decisions and next steps.
Give your AI agent a media processing tool.
Automate transcription from the terminal.
Give agents transcripts they can actually reason over.
Clean up messy voice recordings.
Make big, messy media easier to transcribe.
Convert M4A to MP3 in seconds.
Convert WAV to MP3 without the bulk.
Convert FLAC to MP3 that plays everywhere.
Convert AAC to MP3 cleanly.
Convert OGG to MP3 that just works.
Turn MP4 video into MP3 audio.
Convert any audio to any format.
Convert MOV to MP4 without re-encoding pain.
Pull the audio out of any video.
Compress MP3 files without killing the sound.
Compress any audio file down to size.
Get any video under 10MB.
Make your clip fit Discord's upload limit.
Shrink video small enough to email.
Compress MP4 files fast.
Compress any video, predictably.
Make any recording sound professional.
Convert MP3 to text you can use.
Turn lectures into notes worth keeping.
Transcribe entire courses, lesson by lesson.
Notes that write themselves.
Generate WebVTT captions for the web.
Translate subtitles into any language.
Translate SRT files without breaking sync.
Turn any recording or file into structured notes.
Long recording in. Short, useful summary out.
Ask your files questions. Get cited answers.
Turn lectures and notes into flashcards automatically.
Compress images without uploading them anywhere.
Make PDFs smaller without wrecking readability.
// FAQ

Des réponses qui réduisent le risque d'intégration.

Qu'est-ce que Vocce fait qu'une API ASR brute ne peut pas faire ?+

Une API brute retourne du texte pour un fichier propre. Vocce gère le pipeline autour : découpage et reassemblage de fichiers multi-heures sans dérive d'horodatage, diarisation des locuteurs avec une carte stable, normalisation des formats, tâches idempotentes, tentatives et livraison par webhook — le tout retourné dans un schéma versionné.

D'où puis-je l'appeler ?+

MCP, CLI, API REST, un nœud n8n et une GitHub Action déjà disponibles — Zapier et Make bientôt. Les noms d'outils et le schéma de sortie sont identiques sur tous les canaux.

Les tâches échouées coûtent-elles des crédits ?+

Non. Les échecs d'upload et les tâches échouées ne consomment pas de crédits. Le traitement n'est facturé que lorsqu'une tâche aboutit, avec une raison d'échec claire exposée à votre code.

Quels exports sont supportés ?+

TXT, Markdown, DOCX, SRT, VTT, audio nettoyé, audio compressé, résumé Markdown, un rapport de qualité et le schéma JSON agent pour les outils aval.

Est-ce prêt pour mon backend ?+

Le frontend envoie les tâches à un endpoint API configurable et échoue en sécurité si le backend n'est pas connecté. Branchez-le à votre pipeline d'upload, file d'attente, ffmpeg, ASR et export ; le contrat est documenté dans backend-contract.md.

arrêtez de reconstruire le même pipeline média.

Obtenez une clé API, installez le MCP, ou déposez simplement un fichier. Un appel, un schéma, tous les canaux.