// Transkription

Transkription mit dem kompletten Export-Paket.

Transkription online: MP3, M4A, WAV und Sprachmemos in Text umwandeln, mit Zeitstempeln. Inklusive Zusammenfassung, SRT/VTT-Untertiteln und JSON.

MP3M4AWAVAACFLACOGG
vocce · transcribe● live
Klicken oder ziehen zum Hochladen
Audio- oder Videodatei · ≤ 50MB
4 AI engines · 20+ formats · free tier · no signup · failed jobs never billed
// Was du bekommst

Ein Upload. Jede Datei, die der nächste Schritt braucht.

Die gleiche zuverlässige Vocce-Pipeline, fokussiert auf diese Aufgabe. Kostenlos starten, dann Pläne ab $9.90/Monat, wenn du mehr brauchst.

Timestamped transcript
TXT / DOCX
SRT / VTT
Summary + action items
Agent JSON
// So funktioniert's

So wird aus Audio Text

01
Audio reinwerfen MP3, M4A, WAV, eine Sprachnotiz vom Handy, eine 3-stündige Vorstandssitzung — einfach reinziehen oder Link einfügen.
02
Erst reinigen, dann zuhören Vocce gleicht die Lautstärke aus und entfernt Rauschen, bevor es transkribiert. Diese Reinigung ist der eigentliche Grund für die hohe Genauigkeit.
03
Text nehmen und loslegen Transkript mit Zeitstempeln, SRT/VTT, eine kurze Zusammenfassung und Agent JSON — kopieren, was du brauchst, oder alles runterladen.

Eine Stunde reden sind etwa 9.000 Wörter auf dem Papier. Das von Hand abzutippen dauert fast einen ganzen Arbeitstag, und in der Aufnahme nach einem bestimmten Zitat zu suchen, ist eine eigene Qual. Audio in Text umzuwandeln gibt dir etwas, das du lesen, durchsuchen und einfügen kannst — meist in ein paar Minuten.

Die Aufnahmen, die Leute wirklich haben, sind selten sauber: ein Handy, das auf dem Tisch liegt, zwei Stimmen, die sich überschneiden, ein Dozent am anderen Ende des Raums. Vocce verarbeitet jede Datei mit denselben Schritten — Lautstärke normalisieren, Rauschen reduzieren, dann mit Wort-für-Wort-Zeitstempeln transkribieren —, damit du keine Einstellungen herumschieben musst, bevor etwas passiert.

Zurück bekommst du Klartext für deine Notizen, SRT oder VTT, wenn die Quelle ein Video war, eine Zusammenfassung mit Entscheidungen und Aufgaben sowie eine JSON-Version für alles, was danach kommt. Die ersten drei Minuten jeder Datei sind kostenlos, um die Qualität zu prüfen, und ein fehlgeschlagener Job kostet dich nichts.

// Funktionen

Gebaut, um echte Dateien zu überstehen.

Bereinigt, bevor es gelesen wird

Lautstärkeangleichung und Rauschunterdrückung laufen vor der Transkription, damit ein leiser Sprecher oder eine brummende Klimaanlage nicht als leere Lücke zurückkommen.

Zeitstempel, die nicht abdriften

Jede Zeile ist am Audio verankert. Lange Dateien werden aufgeteilt, parallel transkribiert und wieder zusammengefügt, sodass eine vierstündige Aufnahme an den Nahtstellen synchron bleibt.

Über 100 Sprachen

Englisch, Mandarin, Spanisch, Hindi, Arabisch und Dutzende weitere — automatisch erkannt oder selbst eingestellt, wenn du es nicht dem Zufall überlassen willst.

Exporte, die du nutzen kannst

TXT, Markdown, DOCX, SRT, VTT und ein sauberes JSON-Schema für Skripte und Agenten — keine reine Anzeigebox, aus der du mühsam kopieren musst.

Markierungen, keine Ratespiele

Wörter, bei denen das Modell unsicher ist, werden markiert statt stillschweigend erfunden, damit du weißt, welche zehn Sekunden ein zweites Hinhören wert sind.

Gleicher Job, jede Oberfläche

Im Browser ausführen oder dieselbe Anfrage über die REST API, die CLI oder einen MCP-Server, der in deinen Agenten eingebunden ist, absetzen.

// wer nutzt transkription

Für echte Workflows entwickelt.

Journalisten & Podcaster

Interviews und Folgen in durchsuchbare, zitierfähige Transkripte mit Zeitstempeln verwandeln — bereit für Artikel, Shownotes und Clips.

Studenten & Forscher

Vorlesungen, Seminare und Feldaufnahmen in Text umwandeln, den du überfliegen, kommentieren und zitieren kannst, statt stundenlang neu zu hören.

Teams & Entwickler

Gesprächsaufzeichnungen in einen Durchlauf stecken und sauberen Text plus agentenfertiges JSON bekommen, auf das deine Tools automatisch reagieren können.

// FAQ

Transkription, beantwortet.

Wie wandle ich Audio in Text um?+

Zieh eine MP3-, M4A-, WAV- oder eine andere gängige Audiodatei in das Tool oben. Vocce bereinigt das Audio, führt die Spracherkennung durch und liefert ein Transkript mit Zeitstempeln sowie Exporte als TXT, DOCX, SRT und JSON. Die ersten drei Minuten sind kostenlos, ohne Karte.

Welche Audioformate kann ich transkribieren?+

MP3, M4A, WAV, AAC, FLAC, OGG und WMA funktionieren direkt — und Videodateien wie MP4 oder MOV sind auch in Ordnung, da Vocce die Tonspur extrahiert und für dich normalisiert.

Wie genau ist das?+

Das Audio wird bereinigt und lautstärkenormalisiert, bevor ein Wort transkribiert wird — daraus ergibt sich der Großteil der Genauigkeit. Jeder Job liefert einen Qualitätsbericht, und unsichere Wörter werden markiert statt geraten.

Funktioniert das auch mit Akzenten und Hintergrundgeräuschen?+

Ja — dafür ist der Reinigungsdurchlauf da. Telefonaufnahmen, akzentbelastete Sprache und laute Räume können so hereingegeben werden; du musst nichts vorverarbeiten.

Werden die Sprecher gekennzeichnet?+

Sprechertrennung ist für Mehrpersonenaufnahmen in Planung. Heute trägt jede Zeile einen Zeitstempel, sodass der Dialog in einem Zwei-Personen-Interview trotzdem leicht nachvollziehbar ist.

Kann ich stundenlange Aufnahmen transkribieren?+

Ja. Lange Dateien werden in Stücke geteilt, parallel transkribiert und mit durchgehenden Zeitstempeln wieder zusammengesetzt — eine vierstündige Aufnahme driftet an den Nahtstellen nicht ab.

Bleibt mein Audio privat?+

Dateien werden nur für deinen Job verarbeitet und nicht zum Training verwendet. Du exportierst, was du brauchst, und die Arbeitskopien verfallen — nichts wird irgendwo veröffentlicht.

Gibt es eine kostenlose Version?+

Jede Datei erhält eine kostenlose Drei-Minuten-Vorschau mit Qualitätsbericht. Darüber hinaus umfasst das kostenlose Kontingent 30 Minuten pro Monat, und kostenpflichtige Pläne beginnen bei $9.90/Monat — fehlgeschlagene Jobs werden nicht berechnet.