오디오를 텍스트로
모든 오디오 형식에 대한 한 페이지
MP3, M4A, WAV, FLAC, OGG, AAC, WebM 등을 드롭하세요. 타임스탬프, AI 요약, 내보내기가 포함된 깨끗한 전사를 받으세요.
여기에 파일을 놓으세요
또는 클릭하여 찾아보기
MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC · 최대 25MB · 최대 30분
작동 방식
- 1
어떤 오디오 파일이든 드롭하세요
기기에서 업로드하거나 드래그 앤 드롭하세요. MP3, M4A, WAV, FLAC, OGG, AAC, WebM 등.
- 2
Whisper가 오디오를 전사합니다
Whisper large-v3가 자동 구두점, 단락 구분, 세그먼트별 타임스탬프와 함께 백엔드에서 실행됩니다.
- 3
편집, 내보내기, 공유
전사를 검토하고 AI로 요약하며 50개 이상의 언어로 번역하고 TXT, DOCX, PDF, SRT로 내보내세요.
타임스탬프가 있는 줄별 레이아웃. 읽기에 가장 좋습니다.
왜 하나의 오디오-텍스트 도구가 더 나은가요
변환-첫 단계 없음
어떤 오디오 형식이든 직접 업로드하세요. 시간을 절약하고 원본 품질을 유지하세요, 변환기를 통한 손실이 없습니다.
자동 형식 감지
Mictoo는 파일 헤더에서 형식을 감지하고 해당 코덱에 가장 적합한 전사 설정을 적용합니다.
형식 간 동일한 정확도
Whisper large-v3로 구동되어 파일이 MP3, WAV, FLAC, WebM이든 일관된 정확도를 제공합니다.
요약 및 내보내기 포함
AI 요약을 받고 50개 이상의 언어로 번역하며 TXT, SRT, VTT, DOCX로 내보내세요. 추가 플랜이 없습니다.
이 페이지가 적합한 경우
혼합 형식 아카이브
녹음된 모든 파일을 하나의 업로드로 처리하세요.
알 수 없는 파일 형식
녹음기가 생성한 형식을 모르겠다면, 우리가 감지하고 전사합니다.
빠른 전사
설정, 변환기, 수동 형식 선택 없이 빠른 결과를 얻으세요.
크로스-툴 워크플로우
Zoom, Descript, Audacity, GarageBand 또는 기타 DAW에서 내보낸 파일을 드롭하세요.
첫 사용자
가입 필요 없음, 간단한 UI, 무료. 어떤 도구에 전념하기 전에 안전한 첫 시도입니다.
오디오 품질 테스트
명확성을 확인하고 거친 녹음에서 얼마나 많은 유용한 텍스트를 얻을 수 있는지 확인하세요.
오디오 품질이 파일 형식보다 더 중요합니다
Mictoo가 형식을 감지하는 방법
1010
파일 헤더(매직 바이트)를 읽어 형식을 즉시 식별합니다. 이는 정확한 전사를 위한 최상의 설정을 보장하며 형식을 수동으로 선택할 필요가 없음을 의미합니다.
지원되는 오디오 형식
| 형식 | 일반 소스 | 최적 용도 | 직접 업로드 |
|---|---|---|---|
| MP3 | 녹음기, 팟캐스트, 다운로드 | 일반 사용, 작은 파일 | |
| M4A | iPhone 음성 메모, Apple 앱 | 고품질, 효율적인 크기 | |
| WAV | 녹음, DAW 내보내기 | 비압축, 프로 오디오 | |
| FLAC | 음악 아카이브, 고음질 | 손실 없는 품질 | |
| OGG | 오픈 소스 녹음, 앱 | 웹 및 스트리밍 | |
| AAC | 모바일 녹음, 스트리밍 | 균형 잡힌 품질과 크기 | |
| WebM | 웹 녹음, 브라우저 | 온라인 비디오 및 오디오 |
각 형식에 대해 알아야 할 사항
이들 중 어느 것도 업로드 전에 변환할 필요가 없습니다. 아래의 노트는 형식별로 실제로 사람들을 혼란스럽게 하는 것들입니다.
MP3
녹음기, 팟캐스트 다운로드 및 채팅을 통해 공유되는 모든 것의 기본값입니다. 손실이 있으며 작고 보편적으로 읽을 수 있습니다.
- 수용 가능한 것
- 32 kbps 이상의 모든 비트레이트, 모노 또는 스테레오, CBR 또는 VBR. 전사 전에 재인코딩 없음
- 비트레이트와 정확도
- 음성의 경우 대략 64 kbps 이상에서 비트레이트가 더 이상 도움이 되지 않습니다. Whisper는 어쨌든 내부적으로 16 kHz 모노로 리샘플링합니다
- 가변 비트레이트
- VBR 파일은 이전 플레이어에서 잘못된 지속 시간을 보고할 수 있습니다. 이는 전사나 타임스탬프에 영향을 미치지 않습니다
- ID3 태그
- 전사 중 무시됩니다. 전사는 일반 텍스트로 반환되므로 에피소드 메타데이터 매핑은 자체 시스템에 유지하세요
M4A
코덱이 아니라 컨테이너입니다: MP4 래퍼 안에 AAC 오디오, 가끔 ALAC이 들어 있습니다. 이것은 iPhone이 제공하는 것입니다.
- 읽는 방법
- ftyp 상자를 구문 분석하고 AAC 트랙을 가져와 재인코딩 없이 Whisper에 전달합니다
- 출처
- iPhone 음성 메모, GarageBand, FaceTime, Apple Podcasts 다운로드
- iPhone에서
- 메모를 공유하고 파일 또는 iCloud에 저장한 다음 업로드하세요. 변환 단계가 필요 없습니다
- ALAC 포함
- 일부 .m4a 파일은 AAC 대신 Apple Lossless를 포함합니다. 둘 다 여기서 작동하며 둘 다 먼저 변환할 필요가 없습니다
WAV
비압축 PCM입니다. 업로드할 가장 큰 파일이며 가장 깨끗한 소스이지만, 실내 소음이 형식보다 여전히 더 중요합니다.
- 수용 가능한 것
- 16, 24 및 32비트 PCM, 모든 샘플 레이트, 모노 또는 스테레오, Broadcast Wave(BWF) 포함
- BWF 메타데이터
- 타임코드, 장면 및 테이크를 포함하는 bext 및 iXML 청크는 읽히지만 전사에 나타나지 않습니다
- 크기 경고
- CD 품질에서 분당 약 10 MB이므로, 25분짜리 스테레오 녹음은 이미 익명 제한을 초과합니다
- 먼저 줄이기
- 64 kbps로 모노로 내보내면 음성에 대해 아무것도 잃지 않으며 파일 크기를 10~15배 줄입니다
FLAC
손실 없는 압축으로 동일한 WAV의 절반 크기입니다. 구술 역사 아카이브 및 현장 녹음 워크플로우에서 일반적입니다.
- 수용 가능한 것
- 네이티브 FLAC(매직 바이트 fLaC) 및 OGG 컨테이너 안의 FLAC, 모노 또는 스테레오, 최대 192 kHz, 16 또는 24비트
- 변환 필요 없음
- 파일은 그대로 통과합니다. 먼저 MP3로 변환하면 정보만 손실됩니다
- Vorbis 주석
- 전사 중 무시됩니다. 아카이브가 이러한 태그에 의존하는 경우, 전사 외부에서 매핑을 유지하세요
- 크기 가치가 있나요?
- 정확도를 위해서는 아닙니다. FLAC과 적절한 MP3는 동일하게 전사됩니다. 보존 사본으로 FLAC을 유지하세요, Whisper가 필요해서가 아닙니다
WEBM
보통 Opus 오디오, 가끔 Vorbis를 포함하는 Matroska 컨테이너입니다. 브라우저와 화면 녹화기가 생성하는 것입니다.
- 출처
- Loom, OBS, 브라우저 MediaRecorder API, Google Meet 내보내기, YouTube 다운로드
- 비디오 포함?
- 비디오 트랙을 제거하고 오디오를 전사합니다. 귀하의 측면에서 추출할 것이 없습니다
- 코덱
- 최근에는 Opus, 이전 파일에서는 Vorbis. 둘 다 변환 없이 처리됩니다
- 파일이 큰 이유
- 화면 녹화는 대부분 비디오입니다. 20 MB WEBM은 종종 3~4 MB의 오디오만 포함합니다
자주 묻는 질문
어떤 오디오 형식을 업로드할 수 있나요?
MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, AIFF, AU, OPUS, MPEG 등을 지원합니다. 일반 미디어 플레이어에서 재생되는 파일이라면 Mictoo가 전사할 수 있습니다. 비디오 파일도 허용되며, 서버 측에서 오디오 트랙을 추출합니다.
전사는 얼마나 걸리나요?
보통 몇 초 안에 완료됩니다. 10분짜리 오디오 파일은 약 15~30초, 60분짜리 팟캐스트는 약 1분 안에 완료됩니다. 자동 분할되는 긴 파일은 병렬로 전사되고 병합되므로 약간 더 오래 걸립니다.
오디오 전사가 정말 무료인가요?
네. 파일당 최대 25 MB까지 무료 전사가 가능합니다. 무료 계정은 파일당 제한을 60 MB로 늘려주며, 최대 180 MB까지의 파일은 자동으로 청크로 분할되어 단일 전사로 병합됩니다. 신용카드나 숨겨진 요금이 없습니다.
내 오디오 파일이 저장되나요?
아니요. 파일은 음성 인식 제공자에게 직접 스트리밍되며(Groq로 빠르게 처리, Replicate, Deepgram, OpenAI는 백업으로 사용), 처리 후 삭제됩니다. Mictoo는 오디오를 보관하지 않으며 제공자도 API 데이터를 학습에 사용하지 않습니다.
파일 형식이 정확도에 영향을 미치나요?
오디오 품질이 형식보다 훨씬 중요합니다. 압축된 MP3의 깨끗한 음성이 비압축 WAV의 소음이 많은 오디오보다 더 잘 전사됩니다. Mictoo는 모든 형식에 동일한 Whisper large-v3 모델을 사용하므로 정확도는 지원되는 모든 형식에서 일관됩니다.
오디오를 특정 형식으로 변환해야 하나요?
아니요. 이 페이지의 핵심은 바로 그것입니다. 녹음기, DAW, 전화기, 다운로드 도구에서 생성된 파일을 업로드하세요. 파일 헤더에서 형식을 감지하고 Whisper로 직접 전송합니다. 변환 단계가 없으며 품질 손실도 없습니다.
다운로드 전에 전사를 편집할 수 있나요?
네. 전사가 완료된 후 잘못된 이름이나 용어를 수정하려면 편집기 보기로 전환하세요. Reader(줄별 타임스탬프) 및 Editor(일반 텍스트) 모드가 모두 제공됩니다. 내보내기는 마지막으로 편집한 버전을 사용합니다.
전사는 몇 개의 언어를 지원하나요?
영어, 스페인어, 프랑스어, 독일어, 포르투갈어, 러시아어, 우크라이나어, 일본어, 중국어, 아랍어 등 50개 이상의 언어를 지원합니다. 대부분의 파일에 대해 자동 감지가 작동하며, 짧은 클립의 경우 업로드 양식에서 언어를 수동으로 선택할 수 있습니다.
전사를 번역할 수 있나요?
네. 전사가 완료된 후 번역을 클릭하고 28개의 대상 언어 중에서 선택하세요. 번역은 Reader 보기와 모든 내보내기 형식에서 사용할 수 있습니다. 타임스탬프가 보존되므로 번역된 SRT도 오디오와 일치합니다.
어떤 내보내기 형식을 사용할 수 있나요?
TXT(일반 텍스트), SRT(자막), 타임스탬프가 포함된 TXT, DOCX(Word 문서)를 제공합니다. 등록된 사용자는 PDF, VTT(웹 캡션), JSON도 사용할 수 있습니다. 전사가 완료된 후 다운로드 메뉴에서 모든 내보내기를 사용할 수 있습니다.