信頼性の高いVocceパイプラインをこのジョブに特化。無料で開始し、さらに必要な場合は月額$9.90からのプラン。
動画は情報を取り出すのに最悪のフォーマットです。斜め読みも検索もできず、30秒のポイントを確認するには再生ヘッドをドラッグして目を凝らすしかない。言葉を取り出す — 動画をテキスト化 — すれば、録画を再生時間の何分の一かで読めるようになります。
Vocceは動画の作り方を問いません。Zoomの書き出し、画面収録、4Kカメラファイル、3人が被るウェビナー — 音声トラックを取り出し、クリーニングして、クリックで戻れるタイムスタンプ付きで文字起こし。コーデックの迷路にもffmpegのオプションにもハマりません。
出力されるのは:ノートや記事に使えるクリーンな文字起こし、そのまま動画に貼れるSRT/VTT字幕、ポイントをまとめた要約、そして自動化向けのJSON版。最初の3分は無料、失敗したジョブは課金されません。
文字起こし前にトラックを抽出、ノイズ除去、ラウドネス調整 — 4Kファイルも480pファイルも同じ音声なら同じテキストに。
すべての動画文字起こしでSRTとVTTを書き出し。タイムスタンプ付きでYouTubeや任意のプレーヤーにそのままアップロード可能。
数時間・数GBの動画もサーバー側でキューイングし、並列で連続タイムスタンプ付き文字起こし — タブを開きっぱなしにする必要なし。
話し言葉は自動検出、手動指定も可能。複数言語が混ざった会議も処理します。
信頼度の低い行にはマークが付くので、全体を見直す代わりに怪しい10秒だけ確認すればOK。
ここで実行するのも、REST API、CLI、エージェント内のMCPサーバーから同じジョブを投げるのも自由。
レッスンを文字起こし・キャプション化して、受講生が検索・斜め読み・学習できるように。検索エンジンにもインデックスされます。
ウェビナーやデモをブログ記事、引用、SNSキャプションに再利用。1分も見返す必要はありません。
録画した会議をテキストと構造化ノートに変換し、ドキュメント、チケット、自動化にそのまま流し込む。
上のエリアにMP4、MOV、WebMをアップロード。Vocceが音声トラックを抽出し、音声認識用に圧縮、文字起こしし、タイムスタンプ付きの文字起こしとSRT/VTT字幕、エージェントJSONを返します。
MP4、MOV、AVI、MKV、WebM、FLV、WMV。変なビットレートや音声ノーマライゼーションの欠落も自動処理 — ffmpegを触る必要はありません。
はい。すべての動画ジョブで、文字起こしと一緒にSRTとVTTの字幕ファイルを書き出せます。信頼度の低い行にはフラグが付くので素早く確認できます。
はい — 数時間の動画もチャンクに分割され、並列で連続タイムスタンプ付き文字起こし。無料の3分プレビューで品質を確認してから課金できます。