brudne audio na wejściu.
czysty JSON na wyjściu.
Jeden call połyka 4-godzinny plik, chaos mówców i piekło formatów — i podaje agentowi stabilny schemat. Bez ffmpega. Bez pilnowania.
Jeden call połyka 4-godzinny plik, chaos mówców i piekło formatów — i podaje agentowi stabilny schemat. Bez ffmpega. Bez pilnowania.
Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.
Ngoài kia bao nhiêu câu ca tình nhân thơ tháng Các thế gian nghe như con sông trôi ngẹn ngào Và anh buồn sai bao nhiêu lệch trên bức trấn Để biết em rời đi không khi nào về lại Nói đi em bao dân gió trong đời oan cháy Mà sao em văn thân đi suốt kinh doanh
Każdy może wywołać Whisper. Tygodnie spala wszystko wokół. Vocce bierze to na siebie, żeby twój agent lub automatyzacja zrobiła jeden call i ufała wynikowi.
Podziel 4-godzinne nagranie, transkrybuj równolegle i zszyj z ciągłymi, poprawnymi znacznikami czasu — bez dryftu na łączeniach.
obsługuje uploady 10 GB+Stabilne mapy mówców spójne w całym pliku, z segmentami o niskiej pewności oznaczonymi zamiast po cichu zgadywanymi.
speaker_map.jsonWyślij to samo zlecenie ponownie — dostaniesz to samo job_id. Przejściowe błędy backendu są automatycznie ponawiane. Nieudane zlecenia nie są fakturowane.
semantyka exactly-onceMOV, M4A, WebM, dziwne bitrate'y, wideo bez znormalizowanego audio — Vocce czyści, normalizuje głośność, kompresuje pod ASR, przyjmuje URL lub upload. Nigdy nie dotykasz ffmpega.
20+ formatów · czyszczenie · normalizacja · kompresjaWyniki gotowe do wysłania na twój hook, kolejkę lub automatyzację. Schemat wyjściowy jest identyczny przez MCP, CLI, API i każdy węzeł.
schemat agent.v1Jedno zlecenie zwraca wszystkie artefakty, których potrzebują narzędzia downstream — ustrukturyzowane, wersjonowane i wystarczająco stabilne, by na nich budować.
{
"speaker_turns": [
{ "speaker": "A", "start": 12.4, "text": "..." }
],
"chapters": ["Problem", "Decision", "Next steps"],
"artifacts": ["transcript.md", "subtitles.srt"]
}Prawdziwe odkrywanie dzieje się tam, gdzie ludzie budują: w rejestrze MCP, marketplace'ach automatyzacji i twoim CI. Stabilne nazwy narzędzi i jeden schemat w każdym kanale.
{
"mcpServers": {
"vocce": {
"command": "npx",
"args": ["@vocce/transcribe-mcp"],
"env": { "VOCCE_API_KEY": "vc_..." }
}
}
}Jeden przykład pójścia w głąb, nie wszerz. Te same prymitywy napędzają publikację podcastów, wywiady badawcze i napisy do compliance — ale oto workflow, za który zespoły płacą najpierw.
Wrzuć nagranie rozmowy (lub wskaż Vocce URL). Czyści audio, rozdziela mówców, wyciąga zastrzeżenia, zobowiązania i kolejne kroki, a następnie pushuje ustrukturyzowane podsumowanie prosto do HubSpot, Salesforce lub Notion przez webhook. Żadnego ponownego nagrywania, żadnych ręcznych notatek, żadnego sklejanego pipeline'u.
Jesteśmy uczciwi co do naszej niszy: nie najtańsze STT, nie bot do spotkań. Niezawodna warstwa pośrodku.
Deepgram, AssemblyAI, Whisper dają ci tekst. Ty wciąż budujesz dzielenie, zszywanie diaryzacji, ponowienia i dostarczanie. Vocce jest tą warstwą.
Otter i TurboScribe są dla ludzi w dashboardzie. Vocce jest zbudowane do wywoływania przez kod, ze stabilnym schematem i webhookami.
Twój własny ffmpeg + kolejka + skrypt ASR wysiada przy 4-godzinnym pliku o 2 w nocy. Vocce to utrzymywana wersja tego skryptu.
Wrzuć plik i dostaniesz darmowy 3-minutowy podgląd: raport jakości, pierwsze linie napisów i próbkę JSON-a dla agenta. Gdy eksport ma znaczenie, płać za pakiet lub podłącz API.
Ten sam niezawodny pipeline za skupionymi stronami docelowymi — każda zaczyna się od dokładnie tego zadania, które odwiedzający wyszukał.
Surowe API zwraca tekst dla jednego czystego pliku. Vocce przejmuje cały pipeline: dzielenie i zszywanie wielogodzinnych plików bez dryftu znaczników czasu, diaryzację mówców ze stabilną mapą, normalizację formatów, idempotentne zlecenia, ponowienia i dostarczanie przez webhook — zwrócone jako jeden wersjonowany schemat.
MCP, CLI, REST API, węzeł n8n i GitHub Action — już dziś. Zapier i Make wkrótce. Nazwy narzędzi i schemat wyjściowy są identyczne w każdym kanale.
Nie. Błędy uploadu i nieudane zlecenia nie spalają kredytów. Przetwarzanie jest naliczane tylko wtedy, gdy zlecenie zakończy się sukcesem, z jasną przyczyną błędu wystawioną dla twojego kodu.
TXT, Markdown, DOCX, SRT, VTT, czyste audio, skompresowane audio, podsumowanie w Markdownie, raport jakości oraz schemat JSON dla agenta dla narzędzi downstream.
Frontend wysyła zlecenia na konfigurowalny endpoint API i kończy się awaryjnie, jeśli backend nie jest podłączony. Podepnij go pod swój upload, kolejkę, ffmpeg, ASR i pipeline eksportu — kontrakt jest udokumentowany w backend-contract.md.
Zdobądź klucz API, zainstaluj MCP lub po prostu wrzuć plik. Jeden call, jeden schemat, każdy kanał.