乱れた音声を入れて、
整ったJSONを受け取る。
1回のAPI呼び出しで、4時間のファイル、話者混在、フォーマット地獄を一掃。エージェントに安定したスキーマを渡します。ffmpegも見張り番も不要。
1回のAPI呼び出しで、4時間のファイル、話者混在、フォーマット地獄を一掃。エージェントに安定したスキーマを渡します。ffmpegも見張り番も不要。
Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.
Ngoài kia bao nhiêu câu ca tình nhân thơ tháng Các thế gian nghe như con sông trôi ngẹn ngào Và anh buồn sai bao nhiêu lệch trên bức trấn Để biết em rời đi không khi nào về lại Nói đi em bao dân gió trong đời oan cháy Mà sao em văn thân đi suốt kinh doanh
Whisperを呼ぶだけなら誰でもできます。時間を溶かすのはその周辺です。Vocceはその部分を一手に引き受け、エージェントや自動化が1回の呼び出しで結果を信頼できるようにします。
4時間の録音を分割し、並列で文字起こし、継ぎ目なく結合。タイムスタンプのズレもありません。
10GB以上のアップロード対応ファイル全体で一貫した話者マップを生成。信頼度の低いセグメントは黙って推定 せず、明示的にフラグ付けします。
speaker_map.json同じジョブを再送しても同じjob_idを返します。バックエンドの一時的な障害は自動リトライ。失敗したジョブは課金されません。
exactly-once セマンティクスMOV、M4A、WebM、変なビットレート、正規化されていない音声の動画 — Vocceがクリーニング、ラウドネス正規化、ASR向け圧縮を実施。URLかアップロードを受け付け、ffmpegには触れさせません。
20以上のフォーマット · クリーニング · 正規化 · 圧縮完了結果をフック、キュー、自動化ツールにプッシュ。出力スキーマはMCP、CLI、API、全ノードで同一です。
agent.v1 スキーマ1回のジョブで、下流ツールが必要とするすべてのアーティファクトを返します。構造化され、バージョン管理され、その上に構築できる安定性を持って。
{
"speaker_turns": [
{ "speaker": "A", "start": 12.4, "text": "..." }
],
"chapters": ["Problem", "Decision", "Next steps"],
"artifacts": ["transcript.md", "subtitles.srt"]
}本当のディスカバリーは、人が実際に開発している場所で起こります。MCPレジストリ、自動化マーケットプレイス、そしてCIの中に。全チャネルで安定したツール名と統一スキーマを提供します。
{
"mcpServers": {
"vocce": {
"command": "npx",
"args": ["@vocce/transcribe-mcp"],
"env": { "VOCCE_API_KEY": "vc_..." }
}
}
}深く掘る一例です。同じプリミティブでポッドキャスト公開、研究インタビュー、コンプライアンス字幕もカバーしますが、これがチームが最初に投資するワークフローです。
通話録音をドロップするか、URLを指定するだけ。音声をクリーニングし、話者を分離し、異議、コミットメント、次のアクションを抽出。Webhook経由でHubSpot、Salesforce、Notionに構造化サマリーを直接プッシュします。再録音も手動メモも、継ぎ接ぎパイプラインも不要。
正直に言います。最安のSTT でもなければ、ミーティングボットでもありません。その中間の、信頼できるレイヤーです。
Deepgram、AssemblyAI、Whisperはテキストを返すだけ。チャンク処理、ダイアライゼーションの継ぎ接ぎ、リトライ、配信は自分で作る必要があります。Vocceはそのレイヤーです。
OtterやTurboScribeはダッシュボードで人間が使うために作られています。Vocceはコードから呼ばれるために作られており、安定したスキーマとWebhookを備えています。
自分で組んだffmpeg + キュー + ASRスクリプトは、深夜の4時間ファイルで止まります。Vocceはそのスクリプトのメンテナンス版です。
ファイルをドロップするだけで、無料の3分プレビューを取得。品質レポート、最初の字幕行、エージェントJSONのサンプルを確認できます。エクスポートが必要になったら、パック単位で支払うかAPIを接続してください。
同じ信頼できるパイプラインを、フォーカスしたランディングページの裏側で。各ページは訪問者が検索したジョブに合わせて始まります。
生APIは1つのクリーンなファイルに対してテキストを返すだけです。Vocceはその周辺パイプライン全体を担当します。長時間ファイルのチャンク処理と継ぎ目なし結合、安定した話者マップによるダイアライゼーション、フォーマット正規化、冪等ジョブ、リトライ、Webhook配信 — すべて1つのバージョン管理されたスキーマで返します。
MCP、CLI、REST API、n8n ノード、GitHub Action に対応 — Zapier・Make は近日対応。ツール名と出力スキーマは全チャネルで同一です。
いいえ。アップロード失敗やジョブ失敗でクレジットが消費されることはありません。処理が正常に完了した場合のみ課金され、失敗理由はコードに明確に通知されます。
TXT、Markdown、DOCX、SRT、VTT、クリーン音声、圧縮音声、サマリーMarkdown、品質レポート、そして下流ツール向けのエージェントJSONスキーマに対応しています。
フロントエンドは設定可能なAPIエンドポイントにジョブを送信し、バックエンドが接続されていない場合は安全側に倒れて失敗します。アップロード、キュー、ffmpeg、ASR、エクスポートの各パイプラインに配線してください。契約はbackend-contract.mdに文書化されています。
APIキーを取得するか、MCPをインストールするか、ファイルをドロップするだけ。1回の呼び出し、1つのスキーマ、すべてのチャネル。