Audio zu Text
Eine Seite für jedes Audioformat
Ziehen Sie MP3, M4A, WAV, FLAC, OGG, AAC, WebM und mehr hierher. Erhalten Sie ein sauberes Transkript mit Zeitstempeln, KI-Zusammenfassung und Exporten.
Datei hier ablegen
oder zum Auswählen klicken
MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC · Max. 25 MB · Max. 30 Min.
Wie es funktioniert
- 1
Beliebige Audiodatei hochladen
Laden Sie von Ihrem Gerät hoch oder ziehen Sie Dateien per Drag & Drop. MP3, M4A, WAV, FLAC, OGG, AAC, WebM und mehr.
- 2
Whisper transkribiert das Audio
Whisper large-v3 läuft auf unserem Backend mit automatischer Interpunktion, Absatzumbrüchen und Zeitstempeln pro Segment.
- 3
Bearbeiten, exportieren, teilen
Überprüfen Sie das Transkript, fassen Sie es mit KI zusammen, übersetzen Sie in über 50 Sprachen und exportieren Sie als TXT, DOCX, PDF oder SRT.
Saubereres Layout pro Zeile mit Zeitstempeln. Am besten zum Lesen geeignet.
Warum ein Audio-zu-Text-Tool besser ist
Kein Konvertierungsschritt zuerst
Laden Sie jedes Audioformat direkt hoch. Sparen Sie Zeit und behalten Sie Ihre Originalqualität, kein verlustbehafteter Round-Trip durch einen Konverter.
Automatische Formaterkennung
Mictoo erkennt das Format aus dem Datei-Header und wendet die besten Transkriptionseinstellungen für diesen Codec an.
Gleiche Genauigkeit über alle Formate
Angetrieben von Whisper large-v3 für konsistente Genauigkeit, egal ob Ihre Datei MP3, WAV, FLAC oder WebM ist.
Zusammenfassung und Exporte inklusive
Erhalten Sie KI-Zusammenfassungen, übersetzen Sie in über 50 Sprachen und exportieren Sie als TXT, SRT, VTT oder DOCX. Keine Zusatzpläne.
Wann diese Seite die richtige Wahl ist
Gemischte Formatarchive
Ein Upload für alle Ihre Dateien, egal auf welchem Gerät sie aufgenommen wurden.
Unbekanntes Dateiformat
Nicht sicher, was Ihr Aufnahmegerät produziert hat. Wir erkennen es und transkribieren es.
Schnelle Transkription
Schnelle Ergebnisse ohne Einrichtung, Konverter oder manuelle Formatauswahl.
Cross-Tool-Workflows
Laden Sie Dateien hoch, die von Zoom, Descript, Audacity, GarageBand oder jeder DAW exportiert wurden.
Erstanwender
Keine Anmeldung, einfache Benutzeroberfläche, kostenlos. Ein sicherer erster Versuch, bevor Sie sich für ein Tool entscheiden.
Audiotests
Überprüfen Sie die Klarheit und sehen Sie, wie viel nutzbaren Text Sie aus einer groben Aufnahme erhalten können.
Audioqualität ist wichtiger als das Dateiformat
Wie Mictoo Ihr Format erkennt
1010
Wir lesen den Datei-Header (magic bytes), um Ihr Format sofort zu identifizieren. Dies gewährleistet die besten Einstellungen für eine genaue Transkription und bedeutet, dass Sie das Format nie manuell auswählen müssen.
Unterstützte Audioformate
| Format | Häufige Quelle | Am besten für | Direkter Upload |
|---|---|---|---|
| MP3 | Aufnahmegeräte, Podcasts, Downloads | Allgemeiner Gebrauch, kleine Dateien | |
| M4A | iPhone-Sprachmemos, Apple-Apps | Hohe Qualität, effiziente Größe | |
| WAV | Aufnahmen, DAW-Exporte | Unkomprimiert, professionelle Audioqualität | |
| FLAC | Musikarchive, hohe Wiedergabetreue | Verlustfreie Qualität | |
| OGG | Open-Source-Aufnahmen, Apps | Web und Streaming | |
| AAC | Mobile Aufnahmen, Streaming | Ausgewogene Qualität und Größe | |
| WebM | Web-Aufnahmen, Browser | Online-Video und Audio |
Was Sie über jedes Format wissen sollten
Keines dieser Formate muss vor dem Hochladen konvertiert werden. Die folgenden Hinweise sind die Dinge, die pro Format tatsächlich Probleme verursachen.
MP3
Der Standard für Aufnahmegeräte, Podcast-Downloads und alles, was über Chat geteilt wird. Verlustbehaftet, klein und universell lesbar.
- Was wir akzeptieren
- Jede Bitrate ab 32 kbps, mono oder stereo, CBR oder VBR. Keine Neukodierung vor der Transkription
- Bitrate und Genauigkeit
- Über etwa 64 kbps für Sprache hilft mehr Bitrate nicht weiter. Whisper resampelt intern sowieso auf 16 kHz mono
- Variable Bitrate
- VBR-Dateien geben manchmal die falsche Dauer in älteren Playern an. Das beeinflusst das Transkript oder die Zeitstempel nicht
- ID3-Tags
- Während der Transkription ignoriert. Das Transkript kommt als einfacher Text zurück, also behalten Sie Ihre Episoden-Metadaten in Ihrem eigenen System
M4A
Kein Codec, sondern ein Container: AAC-Audio, gelegentlich ALAC, in einem MP4-Wrapper. Das ist, was ein iPhone Ihnen gibt.
- Wie wir es lesen
- Wir parsen die ftyp-Box, ziehen die AAC-Spur und übergeben sie an Whisper ohne Neukodierung
- Wo es herkommt
- iPhone-Sprachmemos, GarageBand, FaceTime, Apple Podcasts-Downloads
- Von einem iPhone
- Teilen Sie das Memo, speichern Sie es in Dateien oder iCloud, dann hochladen. Kein Konvertierungsschritt nötig
- ALAC innen
- Einige .m4a-Dateien enthalten Apple Lossless statt AAC. Beide funktionieren hier und benötigen keine vorherige Konvertierung
WAV
Unkomprimiertes PCM. Die größten Dateien, die Sie hochladen werden, und die sauberste Quelle, obwohl Raumgeräusche immer noch wichtiger sind als das Format.
- Was wir akzeptieren
- 16, 24 und 32-Bit PCM, jede Abtastrate, mono oder stereo, plus Broadcast Wave (BWF)
- BWF-Metadaten
- bext- und iXML-Chunks, die Timecode, Szene und Take tragen, werden gelesen, nicht gestört. Sie erscheinen nicht im Transkript
- Größenwarnung
- Etwa 10 MB pro Minute in CD-Qualität, sodass eine 25-minütige Stereoaufnahme bereits das anonyme Limit überschreitet
- Zuerst verkleinern
- Der Export in Mono bei 64 kbps verliert nichts für Sprache und reduziert die Datei um das 10- bis 15-fache
FLAC
Verlustfreie Kompression, etwa halb so groß wie dasselbe WAV. Häufig in Oral-History-Archiven und Feldaufnahme-Workflows.
- Was wir akzeptieren
- Native FLAC (magic bytes fLaC) und FLAC in einem OGG-Container, mono oder stereo, bis zu 192 kHz, 16 oder 24-Bit
- Keine Konvertierung nötig
- Die Datei geht direkt durch. Eine vorherige Konvertierung in MP3 würde nur Informationen verlieren
- Vorbis-Kommentare
- Während der Transkription ignoriert. Wenn Ihr Archiv auf diesen Tags basiert, behalten Sie die Zuordnung außerhalb des Transkripts
- Lohnt sich die Größe?
- Für die Genauigkeit nein. FLAC und ein anständiges MP3 transkribieren gleich. Behalten Sie FLAC als Erhaltungskopie, nicht weil Whisper es braucht
WEBM
Ein Matroska-Container, der normalerweise Opus-Audio, manchmal Vorbis enthält. Das ist, was Browser und Bildschirmrekorder produzieren.
- Wo es herkommt
- Loom, OBS, die Browser-MediaRecorder-API, Google Meet-Exporte, YouTube-Downloads
- Video innen?
- Wir demuxen, lassen die Videospur fallen und transkribieren das Audio. Nichts zu extrahieren auf Ihrer Seite
- Codecs
- Opus auf allem Neuen, Vorbis auf älteren Dateien. Beide ohne Konvertierung gehandhabt
- Warum die Datei groß ist
- Bildschirmaufnahmen sind meist Video. Ein 20 MB WEBM enthält oft nur 3 oder 4 MB Audio
Häufig gestellte Fragen
Welche Audioformate kann ich hochladen?
MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, plus AIFF, AU, OPUS und MPEG. Wenn Ihre Datei in einem normalen Mediaplayer abgespielt wird, kann Mictoo sie transkribieren. Videodateien werden ebenfalls akzeptiert, wir extrahieren die Audiospur serverseitig.
Wie lange dauert die Transkription?
In der Regel Sekunden. Eine 10-minütige Audiodatei ist in etwa 15 bis 30 Sekunden fertig; ein 60-minütiger Podcast ist in etwa einer Minute erledigt. Längere Dateien, die automatisch aufgeteilt werden, dauern etwas länger, da die Teile parallel transkribiert und zusammengeführt werden.
Ist die Audiotranskription wirklich kostenlos?
Ja. Kostenlose Transkription bis zu 25 MB pro Datei ohne Anmeldung. Ein kostenloses Konto erhöht das Limit pro Datei auf 60 MB, und Dateien bis zu 180 MB werden automatisch in Teile aufgeteilt und zu einem einzigen Transkript zusammengeführt. Keine Kreditkarte, keine versteckten Gebühren.
Werden meine Audiodateien gespeichert?
Nein. Dateien werden direkt an den Spracherkennungsanbieter gestreamt (Groq für Geschwindigkeit, mit Replicate, Deepgram und OpenAI als Fallback), verarbeitet und dann gelöscht. Mictoo speichert keine Audiodateien und die Anbieter trainieren nicht mit API-Daten.
Beeinflusst das Dateiformat die Genauigkeit?
Die Audioqualität ist weitaus wichtiger als das Format. Saubere Sprache in einem komprimierten MP3 wird besser transkribiert als rauschiges Audio in einem unkomprimierten WAV. Mictoo verwendet das gleiche Whisper large-v3 Modell für jedes Format, sodass die Genauigkeit bei allen unterstützten Typen konsistent bleibt.
Muss ich mein Audio zuerst in ein bestimmtes Format konvertieren?
Nein. Das ist der ganze Punkt dieser Seite. Laden Sie hoch, was auch immer Ihr Aufnahmegerät, DAW, Telefon oder Download-Tool produziert hat. Wir erkennen das Format aus dem Datei-Header und leiten es direkt an Whisper weiter. Kein Konvertierungsschritt, kein Qualitätsverlust.
Kann ich das Transkript vor dem Herunterladen bearbeiten?
Ja. Nach der Transkription können Sie in die Editor-Ansicht wechseln, um falsche Namen oder Fachbegriffe zu korrigieren. Sowohl Leser- (pro Zeile Zeitstempel) als auch Editor- (einfacher Text) Modi sind verfügbar. Exporte verwenden die Version, die Sie zuletzt bearbeitet haben.
Wie viele Sprachen unterstützt die Transkription?
Über 50 Sprachen, darunter Englisch, Spanisch, Französisch, Deutsch, Portugiesisch, Russisch, Ukrainisch, Japanisch, Chinesisch, Arabisch und viele mehr. Die automatische Erkennung funktioniert für die meisten Dateien, oder Sie können die Sprache manuell im Upload-Formular für kurze Clips auswählen.
Kann ich das Transkript übersetzen?
Ja. Nach der Transkription klicken Sie auf Übersetzen und wählen aus 28 Zielsprachen. Die Übersetzung ist in der Leseransicht und in jedem Exportformat verfügbar. Zeitstempel werden beibehalten, sodass die übersetzte SRT immer noch zum Audio passt.
Welche Exportformate sind verfügbar?
TXT (einfacher Text), SRT (Untertitel), mit Zeitstempel versehenes TXT und DOCX (Word-Dokument). Registrierte Benutzer erhalten auch PDF, VTT (Web-Untertitel) und JSON. Alle Exporte sind im Download-Menü verfügbar, nachdem die Transkription abgeschlossen ist.