信頼性の高いVocceパイプラインをこのジョブに特化。無料で開始し、さらに必要な場合は月額$9.90からのプラン。
1時間の会話はだいたい9,000語。手で打ち起こすとほぼ1日仕事だし、特定の発言を探すために録音を何度も巻き戻すのは独自の苦痛がある。音声をテキストに変換すれば、読めて、検索できて、貼り付けられる——しかも数分で終わる。
実際の録音はきれいなものばかりじゃない。机に置いたスマホ、被る2人の声、教室の端から聞こえる講義。Vocceはどんなファイルでも同じ手順で処理する——音量をならし、ノイズを落とし、単語レベルのタイムスタンプ付きで文字起こし。設定をいじる必要はない。
返ってくるのは、メモ用のプレーンテキスト、動画ならSRTかVTT、決定事項とTODOを抜き出した要約、そして次の処理に使えるJSON。最初の3分間は無料で品質を確認でき、失敗したジョブは課金されない。
文字起こしの前に音量調整とノイズ除去を実行。声が小さい話者やエアコンの音で空白ができるのを防ぐ。
各行が音声に正確に紐づく。長いファイルは分割して並列で文字起こし、つなぎ直すので4時間の録音でもシームレス。
英語、中国語、スペイン語、ヒンディー語、アラビア語など——自動検出するか、自分で言語を指定できる。
TXT、Markdown、DOCX、SRT、VTT、スクリプトやエージェント向けのクリーンなJSONスキーマ——コピーが必要な読み取り専用ボックスではない。
モデルが確信を持てない単語は、静かにでっち上げるのではなくマークされる。どの10秒をもう一度聞くべきか一目でわかる。
ブラウザで動かすのも、REST API、CLI、エージェントに組み込んだMCPサーバーから全く同じリクエストを送るのも自由。
インタビューやエピソードを検索可能で引用できる文字起こしに。記事、ショーノーツ、クリップにすぐ使える。
講義、セミナー、フィールド録音をテキストに変換。何時間も聞き直さずに、読み、注釈をつけ、引用できる。
通話録音をまとめて投入し、クリーンなテキストとエージェントが自動処理できるJSONを取得。
上のツールにMP3、M4A、WAVなどの音声ファイルをドロップ。Vocceが音声を整え、音声認識を実行し、タイムスタンプ付きの文字起こしとTXT、DOCX、SRT、JSONの書き出しを返す。最初の3分は無料、カード不要。
MP3、M4A、WAV、AAC、FLAC、OGG、WMAが直接使える。MP4やMOVなどの動画ファイルも、Vocceが自動で音声トラックを抽出して整えるので問題ない。
文字起こしの前に音声を整え音量を均一にする——精度のほとんどはここで決まる。各ジョブに品質レポートが付き、あいまいな単語は推測ではなくフラグが立つ。
はい——そのための前処理パス。電話録音、アクセントのある声、騒がしい部屋でもそのまま入力してOK。事前加工は不要。
複数人録音向けの話者分離は準備中。現状は各行にタイムスタンプが付くので、2人インタビューのやりとりを追うのは簡単。
可能。長いファイルは分割され、並列で文字起こし、連続したタイムスタンプでつなぎ直される——4時間の録音でもずれない。
ファイルはジョブの処理にのみ使われ、学習には利用されない。必要なものを書き出せば作業用コピーは期限切れで削除——どこにも公開されない。
どのファイルも3分間の無料プレビューと品質レポートが使える。無料枠は月30分まで、有料プランは$9.90/月から——失敗したジョブは課金されない。