Audio na tekst
Jedna strona dla dowolnego formatu audio
Przeciągnij MP3, M4A, WAV, FLAC, OGG, AAC, WebM i więcej. Uzyskaj czystą transkrypcję z znacznikami czasu, podsumowaniem AI i eksportami.
Upuść swój plik tutaj
lub kliknij, aby wybrać
MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC · Maks. 25 MB · Maks. 30 min
Jak to działa
- 1
Przeciągnij dowolny plik audio
Prześlij z urządzenia lub przeciągnij i upuść. MP3, M4A, WAV, FLAC, OGG, AAC, WebM i więcej.
- 2
Whisper transkrybuje audio
Whisper large-v3 działa na naszym zapleczu z automatyczną interpunkcją, podziałem na akapity i znacznikami czasu na segment.
- 3
Edytuj, eksportuj, udostępniaj
Przejrzyj transkrypcję, podsumuj za pomocą AI, przetłumacz na 50+ języków i eksportuj jako TXT, DOCX, PDF lub SRT.
Czystszy układ na linię ze znacznikami czasu. Najlepsze do czytania.
Dlaczego jedno narzędzie audio-na-tekst jest lepsze
Bez kroku konwersji
Prześlij dowolny format audio bezpośrednio. Oszczędzaj czas i zachowaj oryginalną jakość, bez stratnego okrążenia przez konwerter.
Automatyczne wykrywanie formatu
Mictoo wykrywa format z nagłówka pliku i stosuje najlepsze ustawienia transkrypcji dla tego kodeka.
Taka sama dokładność we wszystkich formatach
Zasilane przez Whisper large-v3 dla spójnej dokładności, niezależnie od tego, czy Twój plik to MP3, WAV, FLAC, czy WebM.
Podsumowanie i eksporty w zestawie
Uzyskaj podsumowania AI, przetłumacz na 50+ języków i eksportuj jako TXT, SRT, VTT lub DOCX. Bez planów dodatkowych.
Kiedy ta strona jest odpowiednia
Archiwa mieszanych formatów
Jedno przesłanie dla wszystkich Twoich plików, niezależnie od tego, na czym były nagrywane.
Nieznany format pliku
Nie jesteś pewien, co wyprodukował Twój rejestrator. Wykrywamy to i transkrybujemy.
Szybka transkrypcja
Szybkie wyniki bez konfiguracji, konwerterów lub ręcznego wybierania formatu.
Przepływy pracy między narzędziami
Przesyłaj pliki eksportowane z Zoom, Descript, Audacity, GarageBand lub dowolnego DAW.
Użytkownicy po raz pierwszy
Bez rejestracji, prosty interfejs, darmowe. Bezpieczna pierwsza próba przed zobowiązaniem się do jakiegokolwiek narzędzia.
Testowanie jakości dźwięku
Sprawdź klarowność i zobacz, ile użytecznego tekstu możesz uzyskać z trudnego nagrania.
Jakość dźwięku ma większe znaczenie niż format pliku
Jak Mictoo wykrywa Twój format
1010
Odczytujemy nagłówek pliku (magic bytes), aby natychmiast zidentyfikować Twój format. Zapewnia to najlepsze ustawienia dla dokładnej transkrypcji i oznacza, że nigdy nie musisz ręcznie wybierać formatu.
Obsługiwane formaty audio
| Format | Źródło | Najlepsze dla | Bezpośrednie przesłanie |
|---|---|---|---|
| MP3 | Rejestratory, podcasty, pobrania | Ogólne zastosowanie, małe pliki | |
| M4A | iPhone Voice Memos, aplikacje Apple | Wysoka jakość, efektywny rozmiar | |
| WAV | Nagrania, eksporty DAW | Nieskompresowane, profesjonalne audio | |
| FLAC | Archiwa muzyczne, wysoka wierność | Bezstratna jakość | |
| OGG | Nagrania open source, aplikacje | Web i streaming | |
| AAC | Nagrania mobilne, streaming | Zrównoważona jakość i rozmiar | |
| WebM | Nagrania webowe, przeglądarki | Wideo i audio online |
Co warto wiedzieć o każdym formacie
Żaden z nich nie wymaga konwersji przed przesłaniem. Poniższe uwagi to rzeczy, które faktycznie łapią ludzi, w zależności od formatu.
MP3
Domyślny dla rejestratorów, pobrań podcastów i wszystkiego, co jest udostępniane przez czat. Stratny, mały i powszechnie czytelny.
- Co akceptujemy
- Dowolna przepływność od 32 kbps wzwyż, mono lub stereo, CBR lub VBR. Bez ponownego kodowania przed transkrypcją
- Przepływność i dokładność
- Powyżej około 64 kbps dla mowy, więcej przepływności nie pomaga. Whisper wewnętrznie próbuje do 16 kHz mono
- Zmienna przepływność
- Pliki VBR czasami podają błędny czas trwania w starszych odtwarzaczach. To nie wpływa na transkrypcję ani znaczniki czasu
- Tagi ID3
- Ignorowane podczas transkrypcji. Transkrypcja wraca jako czysty tekst, więc zachowaj mapowanie metadanych odcinka w swoim systemie
M4A
Nie kodek, ale kontener: audio AAC, czasami ALAC, w opakowaniu MP4. To jest to, co daje Ci iPhone.
- Jak to czytamy
- Analizujemy pole ftyp, wyciągamy ścieżkę AAC i przekazujemy ją do Whisper bez ponownego kodowania
- Skąd pochodzi
- iPhone Voice Memos, GarageBand, FaceTime, pobrania z Apple Podcasts
- Z iPhone’a
- Udostępnij notatkę, zapisz do Plików lub iCloud, a następnie prześlij. Nie potrzebny krok konwersji
- ALAC wewnątrz
- Niektóre pliki .m4a zawierają Apple Lossless zamiast AAC. Oba działają tutaj i żaden nie wymaga wcześniejszej konwersji
WAV
Nieskompresowany PCM. Największe pliki, które przesyłasz, i najczystsze źródło, chociaż hałas w pomieszczeniu nadal ma większe znaczenie niż format.
- Co akceptujemy
- 16, 24 i 32-bitowy PCM, dowolna częstotliwość próbkowania, mono lub stereo, plus Broadcast Wave (BWF)
- Metadane BWF
- fragmenty bext i iXML zawierające kod czasowy, scenę i ujęcie są pomijane, nie pojawiają się w transkrypcji
- Ostrzeżenie o rozmiarze
- Około 10 MB na minutę przy jakości CD, więc 25-minutowe nagranie stereo już przekracza limit anonimowy
- Zmniejsz to najpierw
- Eksportowanie mono przy 64 kbps nie traci nic dla mowy i zmniejsza plik 10 do 15 razy
FLAC
Kompresja bezstratna, około połowy rozmiaru tego samego WAV. Powszechne w archiwach historii ustnej i przepływach pracy nagrań terenowych.
- Co akceptujemy
- Native FLAC (magic bytes fLaC) i FLAC w kontenerze OGG, mono lub stereo, do 192 kHz, 16 lub 24-bit
- Nie potrzebna konwersja
- Plik przechodzi bezpośrednio. Konwersja do MP3 najpierw tylko straciłaby informacje
- Komentarze Vorbis
- Ignorowane podczas transkrypcji. Jeśli Twoje archiwum polega na tych tagach, zachowaj mapowanie poza transkrypcją
- Wartość rozmiaru?
- Dla dokładności, nie. FLAC i przyzwoite MP3 transkrybują się tak samo. Zachowaj FLAC jako kopię do przechowywania, nie dlatego, że Whisper tego potrzebuje
WEBM
Kontener Matroska, zwykle zawierający audio Opus, czasami Vorbis. To jest to, co produkują przeglądarki i rejestratory ekranu.
- Skąd pochodzi
- Loom, OBS, API MediaRecorder przeglądarki, eksporty Google Meet, pobrania z YouTube
- Wideo w środku?
- Demuksujemy, usuwamy ścieżkę wideo i transkrybujemy audio. Nic do wyodrębnienia po Twojej stronie
- Kodeki
- Opus na czymkolwiek nowoczesnym, Vorbis na starszych plikach. Oba obsługiwane bez konwersji
- Dlaczego plik jest duży
- Nagrania ekranu to głównie wideo. 20 MB WEBM często zawiera tylko 3 lub 4 MB audio
Najczęściej zadawane pytania
Jakie formaty audio mogę przesłać?
MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, plus AIFF, AU, OPUS i MPEG. Jeśli Twój plik odtwarza się w normalnym odtwarzaczu multimedialnym, Mictoo może go transkrybować. Pliki wideo są również akceptowane, wyodrębniamy ścieżkę audio po stronie serwera.
Jak długo trwa transkrypcja?
Zazwyczaj sekundy. Plik audio o długości 10 minut kończy się w około 15 do 30 sekund; podcast o długości 60 minut jest gotowy w około minutę. Dłuższe pliki, które są automatycznie dzielone, zajmują nieco więcej czasu, ponieważ fragmenty są transkrybowane równolegle i scalane.
Czy transkrypcja audio jest naprawdę darmowa?
Tak. Darmowa transkrypcja do 25 MB na plik bez rejestracji. Darmowe konto podnosi limit na plik do 60 MB, a pliki do 180 MB są automatycznie dzielone na fragmenty i scalane w jedną transkrypcję. Bez karty kredytowej, bez ukrytych opłat.
Czy moje pliki audio są przechowywane?
Nie. Pliki są przesyłane bezpośrednio do dostawcy rozpoznawania mowy (Groq dla szybkości, z Replicate, Deepgram i OpenAI jako zapasowymi), przetwarzane, a następnie usuwane. Mictoo nie przechowuje audio, a dostawcy nie trenują na danych API.
Czy format pliku wpływa na dokładność?
Jakość dźwięku ma znacznie większe znaczenie niż format. Czysta mowa w skompresowanym MP3 zostanie lepiej przetranskrybowana niż hałaśliwe audio w nieskompresowanym WAV. Mictoo używa tego samego modelu Whisper large-v3 na każdym formacie, więc dokładność pozostaje spójna we wszystkich obsługiwanych typach.
Czy muszę najpierw przekonwertować moje audio na konkretny format?
Nie. To jest cały sens tej strony. Prześlij cokolwiek, co wyprodukował Twój rejestrator, DAW, telefon lub narzędzie do pobierania. Wykrywamy format z nagłówka pliku i kierujemy go bezpośrednio do Whisper. Bez kroku konwersji, bez utraty jakości.
Czy mogę edytować transkrypcję przed pobraniem?
Tak. Po transkrypcji przejdź do widoku Edytora, aby poprawić błędne nazwy lub żargon. Dostępne są tryby Reader (znaczniki czasu na linię) i Editor (czysty tekst). Eksporty używają wersji, którą ostatnio edytowałeś.
Ile języków obsługuje transkrypcja?
Ponad 50 języków, w tym angielski, hiszpański, francuski, niemiecki, portugalski, rosyjski, ukraiński, japoński, chiński, arabski i wiele innych. Automatyczne wykrywanie działa dla większości plików, lub możesz ręcznie wybrać język w formularzu przesyłania dla krótkich klipów.
Czy mogę przetłumaczyć transkrypcję?
Tak. Po transkrypcji kliknij Tłumacz i wybierz spośród 28 języków docelowych. Tłumaczenie jest dostępne w widoku Reader i w każdym formacie eksportu. Znaczniki czasu są zachowane, więc przetłumaczone SRT nadal pasuje do audio.
Jakie formaty eksportu są dostępne?
TXT (czysty tekst), SRT (napisy), TXT ze znacznikami czasu i DOCX (dokument Word). Zarejestrowani użytkownicy otrzymują również PDF, VTT (napisy internetowe) i JSON. Wszystkie eksporty dostępne z menu Pobierz po zakończeniu transkrypcji.