// Whisper Transcription

Whisper品質の文字起こしを、セットアップ不要で。

音声・動画をWhisper large-v3で文字起こし。インストールもGPUもPythonも不要。音声をクリーンにして、TXT・SRT・VTT・エージェント用JSONに書き出し。対応言語100以上。

MP3M4AWAVMP4MOVFLAC
vocce · transcribe● live
クリックまたはドラッグしてアップロード
音声または動画ファイル · ≤ 50MB
4 AI engines · 20+ formats · free tier · no signup · failed jobs never billed
// 得られるもの

1回のアップロードで、次のステップに必要なすべてのファイル。

信頼性の高いVocceパイプラインをこのジョブに特化。無料で開始し、さらに必要な場合は月額$9.90からのプラン。

Timestamped transcript
SRT / VTT
100+ languages
Quality report
Agent JSON
// 仕組み

Whisper文字起こしの使い方

01
ファイルをアップロード 音声・動画、一般的な形式なら何でもOK。インストールもGPUもPythonも不要。
02
Whisperが聞き取る Vocceが音声をクリーンにしてからWhisper large-v3を実行、タイムスタンプ付きで返します。
03
結果を書き出す 文字起こし、SRT/VTT字幕、品質レポート、エージェント用JSONを出力。

OpenAIのWhisperは、高品質な文字起こしを実現するオープンソースモデルですが、自分で動かそうとするとGPU、Python環境、モデルのダウンロード、そして依存関係の解決に半日がかり…というのが現実です。Whisper文字起こしをオンラインで使えば、同じlarge-v3の品質を、セットアップ不要で得られます。

ファイルをアップロードするだけで、Vocceが文字起こしの精度を左右する部分を自動処理。Whisperを実行する前にラウドネスを正規化しノイズを低減、長い音声はチャンクに分割してタイムラグを防ぎ、最後にひとつのきれいなタイムスタンプ付き文字起こしにまとめます。

文字起こし、SRT/VTT字幕、怪しい箇所を教えてくれる品質レポート、パイプライン用のJSONスキーマ — すべて100以上の言語に対応。最初の3分間は無料、失敗したジョブは課金されません。

// 機能

実際のファイルに耐える設計。

Whisper large-v3、ホスティング済み

フルスペックのlarge-v3品質。GPUもPython環境も、何GBものモデルダウンロードも不要。

Whisperの前に音声をクリーンアップ

ラウドネス調整とノイズ低減を先に実施。これがWhisperの実用的な精度を大きく左右します。

長いファイルでもタイムラグなし

音声をチャンクに分割して並列処理、その後ひとつの連続したタイムラインに結合。

100以上の言語

Whisperの全言語に対応。自動検出、または難しい音声は手動で言語指定も可能。

正直な品質レポート

信頼度の低い区間は黙って推測せず、明示的にフラグを立てるので、確認すべき箇所が一目でわかります。

API、CLI、MCP対応

同じWhisperジョブをREST API、CLI、エージェント内のMCPサーバーから実行可能。インフラのホストは不要。

// whisper transcriptionの利用者

実際のワークフロー向けに設計。

開発者

Whisper品質の出力をAPI呼び出し1回で。GPUのホストやモデルバージョン管理から解放されます。

研究者

コーパスをバッチ文字起こし。専用マシンを立てたり、faster-whisperのオプションを覚える必要なし。

セルフホストに挫折した人

Whisperの品質はそのままに、CUDAエラーや依存関係の固定からおさらば。

// FAQ

Whisper Transcription、回答します。

Whisper文字起こしとは?+

WhisperはOpenAIが公開したオープンソースの音声認識モデルです。VocceはWhisper large-v3をホストGPU上で実行し、その前後に音声クリーンアップ処理を加えるので、何もインストールせずにその精度を利用できます。

GPUやPythonは必要ですか?+

いいえ — それが最大のメリットです。ブラウザでファイルをアップロードするか、APIを呼び出すだけで、モデルはこちら側のハードウェアで動作します。CUDAもpipもモデルダウンロードも不要です。

どのWhisperモデルを使っていますか?+

large-v3、最も高精度なWhisperモデルです。文字起こし前にラウドネス正規化とノイズ低減を施し、さらに精度を高めています。

自分でWhisperを動かすのと比べてどうですか?+

同じモデル、同じ品質 — ただし、GPUのレンタル、環境構築、長尺ファイルのチャンク処理、継続的なメンテナンスは不要。さらにSRT/VTT字幕、要約、JSON出力も標準で付いてきます。

対応言語は?+

Whisperの全範囲 — 100以上の言語 — を自動検出。難しい音声は手動で言語指定も可能です。

APIはありますか?+

はい — 同じWhisperジョブをREST API、CLI、MCPサーバーから実行可能。アプリやスクリプト、エージェントに組み込めます。