acceso anticipadoinfraestructura multimedia para agentes y automatizaciones

audio caótico entra.
JSON limpio sale.

Una llamada procesa el archivo de 4 horas, el desorden de interlocutores y el caos de formatos — y le entrega a tu agente un esquema estable. Sin ffmpeg. Sin supervisión.

$
✓ tools registered — try “transcribe this call, give me action items”
necesitas una clave — agent.v1 · trabajos fallidos sin costo
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// real output, not a mockup

See what comes back.

Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.

auto-detected · Vietnamese
● produced by the live enginerun it on your file
// La parte realmente difícil

Transcribir es gratis. Hacerlo fiable a escala no lo es.

Cualquiera puede llamar a Whisper. Lo que quema semanas es todo lo que lo rodea. Vocce se encarga de esas partes para que tu agente o automatización haga una sola llamada y confíe en el resultado.

Fragmentación de archivos largos

Divide una grabación de 4 horas, transcribe en paralelo y vuelve a unirla con marcas de tiempo continuas y correctas — sin desviaciones en las uniones.

admite subidas de más de 10 GB

Diarización de hablantes

Mapas de interlocutores estables que se mantienen consistentes en todo el archivo, con segmentos de baja confianza marcados en lugar de adivinados en silencio.

speaker_map.json

Trabajos idempotentes y reintentos

Reenvía el mismo trabajo y obtienes el mismo job_id. Los fallos transitorios del backend se reintentan automáticamente. Los trabajos fallidos no se facturan.

semántica de exactamente una vez

El caos de formatos, resuelto

MOV, M4A, WebM, bitrates extraños, video sin audio normalizado — Vocce limpia, normaliza el volumen, comprime para ASR, acepta una URL o subida. Nunca tocas ffmpeg.

más de 20 formatos · limpia · normaliza · comprime

Webhooks y un solo esquema

Envía los resultados completos a tu hook, cola o automatización. El esquema de salida es idéntico en MCP, CLI, API y en todos los nodos.

esquema agent.v1
// El entregable

No un muro de texto. Una salida sobre la que tu código puede actuar.

Un solo trabajo devuelve todos los artefactos que necesitan las herramientas posteriores — estructurados, versionados y lo suficientemente estables como para construir sobre ellos.

transcript.agent.json
{
  "speaker_turns": [
    { "speaker": "A", "start": 12.4, "text": "..." }
  ],
  "chapters": ["Problem", "Decision", "Next steps"],
  "artifacts": ["transcript.md", "subtitles.srt"]
}
// Distribución que realmente existe

Integra Vocce en las herramientas que ya usas.

El descubrimiento real ocurre donde la gente construye: el registro MCP, los marketplaces de automatización y tu CI. Nombres de herramientas estables y un solo esquema en todos los canales.

install
{
  "mcpServers": {
    "vocce": {
      "command": "npx",
      "args": ["@vocce/transcribe-mcp"],
      "env": { "VOCCE_API_KEY": "vc_..." }
    }
  }
}
Registro MCPMetadatos de servidor publicados para que sea instalable e indexable.vocce
n8n · GitHub ActionUn nodo «Transcribir medio» listo y una GitHub Action. Zapier y Make próximamente.automation marketplaces
GitHub ActionIntégralo en tu CI para transcribir medios de lanzamiento o demos de PR.vocce/transcribe-action
Contrato estableLos nombres de las herramientas nunca cambian, así que los agentes forman hábitos fiables.create_transcription_job
// Flujo estrella

Convierte llamadas de clientes en inteligencia lista para tu CRM.

Un ejemplo de ir en profundidad, no en amplitud. Los mismos componentes básicos alimentan la publicación de podcasts, entrevistas de investigación y subtitulado para cumplimiento normativo — pero este es el flujo por el que los equipos pagan primero.

equipos de ventas y éxito

Grabación entra. Acción en tu CRM sale.

Sube una grabación de llamada (o apunta Vocce a la URL). Limpia el audio, separa los interlocutores, extrae objeciones, compromisos y siguientes pasos, y envía un resumen estructurado directamente a HubSpot, Salesforce o Notion vía webhook. Sin regrabar, sin notas manuales, sin tuberías pegadas con cinta.

Grabación de llamadaSube o URL — cualquier formato, cualquier duración
Una llamada a Voccelimpia · diariza · transcribe · extrae
Inteligencia estructuradaobjeciones, compromisos, siguientes pasos, responsables
Enviado a tu CRMwebhook → HubSpot / Salesforce / Notion
// Dónde encaja Vocce

Entre una API bruta y una aplicación pesada.

Somos honestos sobre nuestro carril: no es el STT más barato, ni un bot de reuniones. Es la capa fiable en el medio.

APIs ASR purasMinutos baratos, sin tubería.

Deepgram, AssemblyAI, Whisper te dan texto. Tú aún construyes fragmentación, costura de diarización, reintentos y entrega. Vocce es esa capa.

Apps de transcripciónGran interfaz, caja cerrada.

Otter y TurboScribe están hechos para humanos en un panel. Vocce está hecho para ser llamado por código, con un esquema estable y webhooks.

Tubería caseraFunciona hasta que no funciona.

Tu propio ffmpeg + cola + script ASR se rompe con el archivo de 4 horas a las 2am. Vocce es la versión mantenida de ese script.

// Pruébalo en el navegador

No necesitas SDK para ver el resultado.

Sube un archivo y obtén una vista previa gratuita de 3 minutos: informe de calidad, las primeras líneas de subtítulos y una muestra del JSON del agente. Cuando la exportación importe, paga por paquete o conecta la API.

Vista previa gratuita de 3 minutosSin tarjeta requeridaMP3, MP4, M4A, WAV, MOV
vocce · transcribe● live
Haz clic o arrastra para subir
Archivo de audio o vídeo · ≤ 50MB
// Puntos de entrada de alta intención

Un motor. Muchas páginas listas para campañas.

La misma tubería fiable detrás de páginas de aterrizaje enfocadas — cada una abre con el trabajo exacto que el visitante buscó.

Convert audio to text, then export the whole pack.
Turn interviews into clean, quotable transcripts.
Whisper-quality transcription without the setup.
Turn video into transcripts, captions, and reusable notes.
Convert MP4 into text, captions, and clean handoff files.
Turn quick voice notes into usable text.
Create subtitles from audio or video without rebuilding the workflow.
Translate subtitles without breaking the timeline.
Drop a video. Get a soundtrack that fits.
Turn podcast episodes into transcripts, notes, and reusable content.
Upload a meeting recording. Get decisions and next steps.
Give your AI agent a media processing tool.
Automate transcription from the terminal.
Give agents transcripts they can actually reason over.
Clean up messy voice recordings.
Make big, messy media easier to transcribe.
Convert M4A to MP3 in seconds.
Convert WAV to MP3 without the bulk.
Convert FLAC to MP3 that plays everywhere.
Convert AAC to MP3 cleanly.
Convert OGG to MP3 that just works.
Turn MP4 video into MP3 audio.
Convert any audio to any format.
Convert MOV to MP4 without re-encoding pain.
Pull the audio out of any video.
Compress MP3 files without killing the sound.
Compress any audio file down to size.
Get any video under 10MB.
Make your clip fit Discord's upload limit.
Shrink video small enough to email.
Compress MP4 files fast.
Compress any video, predictably.
Make any recording sound professional.
Convert MP3 to text you can use.
Turn lectures into notes worth keeping.
Transcribe entire courses, lesson by lesson.
Notes that write themselves.
Generate WebVTT captions for the web.
Translate subtitles into any language.
Translate SRT files without breaking sync.
Turn any recording or file into structured notes.
Long recording in. Short, useful summary out.
Ask your files questions. Get cited answers.
Turn lectures and notes into flashcards automatically.
Compress images without uploading them anywhere.
Make PDFs smaller without wrecking readability.
// Preguntas frecuentes

Respuestas que reducen el riesgo de integración.

¿Qué hace Vocce que una API ASR pura no pueda hacer?+

Una API pura devuelve texto para un archivo limpio. Vocce gestiona toda la tubería: fragmentación y costura de archivos de varias horas sin desviación de marcas de tiempo, diarización de hablantes con un mapa estable, normalización de formatos, trabajos idempotentes, reintentos y entrega vía webhook — todo devuelto como un esquema versionado.

¿Desde dónde puedo llamarlo?+

MCP, CLI, API REST, un nodo de n8n y una GitHub Action ya disponibles — Zapier y Make próximamente. Los nombres de las herramientas y el esquema de salida son idénticos en todos los canales.

¿Los trabajos fallidos consumen créditos?+

No. Los fallos de subida y los trabajos fallidos no gastan créditos. El procesamiento solo se cobra cuando un trabajo se completa con éxito, con una razón de fallo clara expuesta a tu código.

¿Qué exportaciones están disponibles?+

TXT, Markdown, DOCX, SRT, VTT, audio limpio, audio comprimido, resumen en Markdown, un informe de calidad y el esquema JSON del agente para herramientas posteriores.

¿Está listo para mi backend?+

El frontend envía trabajos a un endpoint de API configurable y falla de forma controlada si el backend no está conectado. Conéctalo a tu pipeline de subida, cola, ffmpeg, ASR y exportación; el contrato está documentado en backend-contract.md.

deja de reconstruir la misma tubería multimedia.

Obtén una clave API, instala el MCP o simplemente sube un archivo. Una llamada, un esquema, todos los canales.