// 文字起こし

文字起こしから、そのまま全部持ち帰る。

文字起こしを無料でオンライン実行。MP3・M4A・WAVをタイムスタンプ付きでテキスト化し、要約・SRT/VTT字幕・エージェント用JSONまで一括出力。

MP3M4AWAVAACFLACOGG
vocce · transcribe● live
クリックまたはドラッグしてアップロード
音声または動画ファイル · ≤ 50MB
4 AI engines · 20+ formats · free tier · no signup · failed jobs never billed
// 得られるもの

1回のアップロードで、次のステップに必要なすべてのファイル。

信頼性の高いVocceパイプラインをこのジョブに特化。無料で開始し、さらに必要な場合は月額$9.90からのプラン。

Timestamped transcript
TXT / DOCX
SRT / VTT
Summary + action items
Agent JSON
// 仕組み

音声をテキストにする方法

01
音声をドロップ MP3、M4A、WAV、スマホのボイスメモ、3時間の取締役会——ドラッグ&ドロップかリンクを貼るだけ。
02
整えてから聞く Vocceがまず音量を整えノイズを除去してから文字起こし。精度のカギはこの前処理にある。
03
テキストを持ち帰る タイムスタンプ付き文字起こし、SRT/VTT、短い要約、エージェントJSON——必要なものをコピーか一括ダウンロード。

1時間の会話はだいたい9,000語。手で打ち起こすとほぼ1日仕事だし、特定の発言を探すために録音を何度も巻き戻すのは独自の苦痛がある。音声をテキストに変換すれば、読めて、検索できて、貼り付けられる——しかも数分で終わる。

実際の録音はきれいなものばかりじゃない。机に置いたスマホ、被る2人の声、教室の端から聞こえる講義。Vocceはどんなファイルでも同じ手順で処理する——音量をならし、ノイズを落とし、単語レベルのタイムスタンプ付きで文字起こし。設定をいじる必要はない。

返ってくるのは、メモ用のプレーンテキスト、動画ならSRTかVTT、決定事項とTODOを抜き出した要約、そして次の処理に使えるJSON。最初の3分間は無料で品質を確認でき、失敗したジョブは課金されない。

// 機能

実際のファイルに耐える設計。

読む前に整える

文字起こしの前に音量調整とノイズ除去を実行。声が小さい話者やエアコンの音で空白ができるのを防ぐ。

ずれないタイムスタンプ

各行が音声に正確に紐づく。長いファイルは分割して並列で文字起こし、つなぎ直すので4時間の録音でもシームレス。

100以上の言語

英語、中国語、スペイン語、ヒンディー語、アラビア語など——自動検出するか、自分で言語を指定できる。

そのまま使える書き出し

TXT、Markdown、DOCX、SRT、VTT、スクリプトやエージェント向けのクリーンなJSONスキーマ——コピーが必要な読み取り専用ボックスではない。

推測ではなくフラグ

モデルが確信を持てない単語は、静かにでっち上げるのではなくマークされる。どの10秒をもう一度聞くべきか一目でわかる。

同じ処理、どんな環境でも

ブラウザで動かすのも、REST API、CLI、エージェントに組み込んだMCPサーバーから全く同じリクエストを送るのも自由。

// 文字起こしの利用者

実際のワークフロー向けに設計。

ジャーナリスト&ポッドキャスター

インタビューやエピソードを検索可能で引用できる文字起こしに。記事、ショーノーツ、クリップにすぐ使える。

学生&研究者

講義、セミナー、フィールド録音をテキストに変換。何時間も聞き直さずに、読み、注釈をつけ、引用できる。

チーム&開発者

通話録音をまとめて投入し、クリーンなテキストとエージェントが自動処理できるJSONを取得。

// FAQ

文字起こし、回答します。

音声をテキストに変換するには?+

上のツールにMP3、M4A、WAVなどの音声ファイルをドロップ。Vocceが音声を整え、音声認識を実行し、タイムスタンプ付きの文字起こしとTXT、DOCX、SRT、JSONの書き出しを返す。最初の3分は無料、カード不要。

対応している音声形式は?+

MP3、M4A、WAV、AAC、FLAC、OGG、WMAが直接使える。MP4やMOVなどの動画ファイルも、Vocceが自動で音声トラックを抽出して整えるので問題ない。

精度はどのくらい?+

文字起こしの前に音声を整え音量を均一にする——精度のほとんどはここで決まる。各ジョブに品質レポートが付き、あいまいな単語は推測ではなくフラグが立つ。

アクセントや背景ノイズは大丈夫?+

はい——そのための前処理パス。電話録音、アクセントのある声、騒がしい部屋でもそのまま入力してOK。事前加工は不要。

誰が話したかラベル付けできる?+

複数人録音向けの話者分離は準備中。現状は各行にタイムスタンプが付くので、2人インタビューのやりとりを追うのは簡単。

何時間もの録音を文字起こしできる?+

可能。長いファイルは分割され、並列で文字起こし、連続したタイムスタンプでつなぎ直される——4時間の録音でもずれない。

音声はプライベートに保たれる?+

ファイルはジョブの処理にのみ使われ、学習には利用されない。必要なものを書き出せば作業用コピーは期限切れで削除——どこにも公開されない。

無料版はある?+

どのファイルも3分間の無料プレビューと品質レポートが使える。無料枠は月30分まで、有料プランは$9.90/月から——失敗したジョブは課金されない。