アーリーアクセスエージェントと自動化のためのメディア基盤

乱れた音声を入れて、
整ったJSONを受け取る。

1回のAPI呼び出しで、4時間のファイル、話者混在、フォーマット地獄を一掃。エージェントに安定したスキーマを渡します。ffmpegも見張り番も不要。

$
✓ tools registered — try “transcribe this call, give me action items”
APIキーが必要です — agent.v1 · 失敗したジョブは課金されません
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// runs in your agent, ships to your stackClaude CodeCursorGeminiMCPCLIREST APIn8nZapierMakeGitHub ActionsNotionHubSpot
// real output, not a mockup

See what comes back.

Every sample below is an actual file the live engine produced — play it, read it, then run it on your own.

auto-detected · Vietnamese
● produced by the live enginerun it on your file
// 実際の難所

文字起こし自体は無料。でも本番で信頼できる形にするのは別問題。

Whisperを呼ぶだけなら誰でもできます。時間を溶かすのはその周辺です。Vocceはその部分を一手に引き受け、エージェントや自動化が1回の呼び出しで結果を信頼できるようにします。

長時間ファイルのチャンク処理

4時間の録音を分割し、並列で文字起こし、継ぎ目なく結合。タイムスタンプのズレもありません。

10GB以上のアップロード対応

話者ダイアライゼーション

ファイル全体で一貫した話者マップを生成。信頼度の低いセグメントは黙って推定せず、明示的にフラグ付けします。

speaker_map.json

冪等ジョブと自動リトライ

同じジョブを再送しても同じjob_idを返します。バックエンドの一時的な障害は自動リトライ。失敗したジョブは課金されません。

exactly-once セマンティクス

フォーマット地獄、解決

MOV、M4A、WebM、変なビットレート、正規化されていない音声の動画 — Vocceがクリーニング、ラウドネス正規化、ASR向け圧縮を実施。URLかアップロードを受け付け、ffmpegには触れさせません。

20以上のフォーマット · クリーニング · 正規化 · 圧縮

Webhookと統一スキーマ

完了結果をフック、キュー、自動化ツールにプッシュ。出力スキーマはMCP、CLI、API、全ノードで同一です。

agent.v1 スキーマ
// 成果物

ただのテキストの壁じゃない。コードがそのまま扱える出力。

1回のジョブで、下流ツールが必要とするすべてのアーティファクトを返します。構造化され、バージョン管理され、その上に構築できる安定性を持って。

transcript.agent.json
{
  "speaker_turns": [
    { "speaker": "A", "start": 12.4, "text": "..." }
  ],
  "chapters": ["Problem", "Decision", "Next steps"],
  "artifacts": ["transcript.md", "subtitles.srt"]
}
// 実際に存在する配布チャネル

すでに使っているツールにVocceを。

本当のディスカバリーは、人が実際に開発している場所で起こります。MCPレジストリ、自動化マーケットプレイス、そしてCIの中に。全チャネルで安定したツール名と統一スキーマを提供します。

install
{
  "mcpServers": {
    "vocce": {
      "command": "npx",
      "args": ["@vocce/transcribe-mcp"],
      "env": { "VOCCE_API_KEY": "vc_..." }
    }
  }
}
MCP Registry公開されたサーバーメタデータにより、インストール可能かつ検索可能に。vocce
n8n · GitHub Action「メディアを文字起こし」ノードと GitHub Action を用意。Zapier・Make は近日対応。automation marketplaces
GitHub ActionCIに組み込んで、リリースメディアやPRデモの文字起こしを自動化。vocce/transcribe-action
安定したコントラクトツール名が変わらないので、エージェントが確実な習慣を形成。create_transcription_job
// フラグシップワークフロー

顧客通話をCRMで使えるインテリジェンスに。

深く掘る一例です。同じプリミティブでポッドキャスト公開、研究インタビュー、コンプライアンス字幕もカバーしますが、これがチームが最初に投資するワークフローです。

セールス・カスタマーサクセスチーム向け

録音を入れるだけ。CRMにアクションが出てくる。

通話録音をドロップするか、URLを指定するだけ。音声をクリーニングし、話者を分離し、異議、コミットメント、次のアクションを抽出。Webhook経由でHubSpot、Salesforce、Notionに構造化サマリーを直接プッシュします。再録音も手動メモも、継ぎ接ぎパイプラインも不要。

通話録音アップロードまたはURL — あらゆる形式、あらゆる長さ
Vocce 1回の呼び出しクリーニング · 話者分離 · 文字起こし · 抽出
構造化インテリジェンス異議、コミットメント、次のアクション、担当者
CRMにプッシュwebhook → HubSpot / Salesforce / Notion
// Vocceの立ち位置

生のAPIと重厚なアプリの、ちょうど中間。

正直に言います。最安のSTTでもなければ、ミーティングボットでもありません。その中間の、信頼できるレイヤーです。

生ASR API分単位は安いが、パイプラインは自前。

Deepgram、AssemblyAI、Whisperはテキストを返すだけ。チャンク処理、ダイアライゼーションの継ぎ接ぎ、リトライ、配信は自分で作る必要があります。Vocceはそのレイヤーです。

文字起こしアプリUIは優れているが、中身はブラックボックス。

OtterやTurboScribeはダッシュボードで人間が使うために作られています。Vocceはコードから呼ばれるために作られており、安定したスキーマとWebhookを備えています。

自前パイプライン動いているうちはいいが、突然壊れる。

自分で組んだffmpeg + キュー + ASRスクリプトは、深夜の4時間ファイルで止まります。Vocceはそのスクリプトのメンテナンス版です。

// ブラウザで試す

SDK不要で出力を確認。

ファイルをドロップするだけで、無料の3分プレビューを取得。品質レポート、最初の字幕行、エージェントJSONのサンプルを確認できます。エクスポートが必要になったら、パック単位で支払うかAPIを接続してください。

3分間の無料プレビューカード不要MP3、MP4、M4A、WAV、MOV対応
vocce · transcribe● live
クリックまたはドラッグしてアップロード
音声または動画ファイル · ≤ 50MB
// 検索意図の高いエントリーポイント

1つのエンジン。多数のランディングページ。

同じ信頼できるパイプラインを、フォーカスしたランディングページの裏側で。各ページは訪問者が検索したジョブに合わせて始まります。

Convert audio to text, then export the whole pack.
Turn interviews into clean, quotable transcripts.
Whisper-quality transcription without the setup.
Turn video into transcripts, captions, and reusable notes.
Convert MP4 into text, captions, and clean handoff files.
Turn quick voice notes into usable text.
Create subtitles from audio or video without rebuilding the workflow.
Translate subtitles without breaking the timeline.
Drop a video. Get a soundtrack that fits.
Turn podcast episodes into transcripts, notes, and reusable content.
Upload a meeting recording. Get decisions and next steps.
Give your AI agent a media processing tool.
Automate transcription from the terminal.
Give agents transcripts they can actually reason over.
Clean up messy voice recordings.
Make big, messy media easier to transcribe.
Convert M4A to MP3 in seconds.
Convert WAV to MP3 without the bulk.
Convert FLAC to MP3 that plays everywhere.
Convert AAC to MP3 cleanly.
Convert OGG to MP3 that just works.
Turn MP4 video into MP3 audio.
Convert any audio to any format.
Convert MOV to MP4 without re-encoding pain.
Pull the audio out of any video.
Compress MP3 files without killing the sound.
Compress any audio file down to size.
Get any video under 10MB.
Make your clip fit Discord's upload limit.
Shrink video small enough to email.
Compress MP4 files fast.
Compress any video, predictably.
Make any recording sound professional.
Convert MP3 to text you can use.
Turn lectures into notes worth keeping.
Transcribe entire courses, lesson by lesson.
Notes that write themselves.
Generate WebVTT captions for the web.
Translate subtitles into any language.
Translate SRT files without breaking sync.
Turn any recording or file into structured notes.
Long recording in. Short, useful summary out.
Ask your files questions. Get cited answers.
Turn lectures and notes into flashcards automatically.
Compress images without uploading them anywhere.
Make PDFs smaller without wrecking readability.
// FAQ

導入リスクを減らす回答。

Vocceは生のASR APIと何が違うのですか?+

生APIは1つのクリーンなファイルに対してテキストを返すだけです。Vocceはその周辺パイプライン全体を担当します。長時間ファイルのチャンク処理と継ぎ目なし結合、安定した話者マップによるダイアライゼーション、フォーマット正規化、冪等ジョブ、リトライ、Webhook配信 — すべて1つのバージョン管理されたスキーマで返します。

どこから呼び出せますか?+

MCP、CLI、REST API、n8n ノード、GitHub Action に対応 — Zapier・Make は近日対応。ツール名と出力スキーマは全チャネルで同一です。

失敗したジョブはクレジットを消費しますか?+

いいえ。アップロード失敗やジョブ失敗でクレジットが消費されることはありません。処理が正常に完了した場合のみ課金され、失敗理由はコードに明確に通知されます。

どのエクスポート形式に対応していますか?+

TXT、Markdown、DOCX、SRT、VTT、クリーン音声、圧縮音声、サマリーMarkdown、品質レポート、そして下流ツール向けのエージェントJSONスキーマに対応しています。

バックエンドに組み込む準備はできていますか?+

フロントエンドは設定可能なAPIエンドポイントにジョブを送信し、バックエンドが接続されていない場合は安全側に倒れて失敗します。アップロード、キュー、ffmpeg、ASR、エクスポートの各パイプラインに配線してください。契約はbackend-contract.mdに文書化されています。

同じメディアパイプラインを 何度も作るのはやめよう。

APIキーを取得するか、MCPをインストールするか、ファイルをドロップするだけ。1回の呼び出し、1つのスキーマ、すべてのチャネル。