Áudio para Texto
Uma página para qualquer formato de áudio
Solte MP3, M4A, WAV, FLAC, OGG, AAC, WebM e mais. Obtenha uma transcrição limpa com timestamps, resumo de IA e exportações.
Solte seu arquivo aqui
ou clique para procurar
MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC · Máx. 25 MB · Máx. 30 min
Como funciona
- 1
Solte qualquer arquivo de áudio
Carregue do seu dispositivo ou arraste e solte. MP3, M4A, WAV, FLAC, OGG, AAC, WebM e mais.
- 2
Whisper transcreve o áudio
Whisper large-v3 roda no nosso backend com pontuação automática, quebras de parágrafo e timestamps por segmento.
- 3
Edite, exporte, partilhe
Revise a transcrição, resuma com IA, traduza para mais de 50 idiomas e exporte como TXT, DOCX, PDF ou SRT.
Layout mais limpo por linha com timestamps. Melhor para leitura.
Por que uma ferramenta de áudio para texto é melhor
Sem etapa de conversão prévia
Carregue qualquer formato de áudio diretamente. Economize tempo e mantenha sua qualidade original, sem perda através de um conversor.
Detecção automática de formato
Mictoo detecta o formato a partir do cabeçalho do arquivo e aplica as melhores configurações de transcrição para esse codec.
Mesma precisão em todos os formatos
Potenciado pelo Whisper large-v3 para precisão consistente, seja seu arquivo MP3, WAV, FLAC ou WebM.
Resumo e exportações incluídos
Obtenha resumos de IA, traduza para mais de 50 idiomas e exporte como TXT, SRT, VTT ou DOCX. Sem planos adicionais.
Quando esta página é a escolha certa
Arquivos de formatos mistos
Um upload para todos os seus arquivos, independentemente de onde foram gravados.
Formato de arquivo desconhecido
Não tem certeza do que seu gravador produziu. Nós detectamos e transcrevemos.
Transcrição rápida
Resultados rápidos sem configuração, conversores ou escolha manual de formato.
Fluxos de trabalho entre ferramentas
Solte arquivos exportados do Zoom, Descript, Audacity, GarageBand ou qualquer DAW.
Usuários de primeira viagem
Sem cadastro, interface simples, gratuito. Uma primeira tentativa segura antes de se comprometer com qualquer ferramenta.
Teste de qualidade de áudio
Verifique a clareza e veja quanto texto utilizável você pode obter de uma gravação bruta.
A qualidade do áudio importa mais do que o formato do arquivo
Como o Mictoo detecta seu formato
1010
Lemos o cabeçalho do arquivo (bytes mágicos) para identificar seu formato instantaneamente. Isso garante as melhores configurações para uma transcrição precisa e significa que você nunca precisa escolher o formato manualmente.
Formatos de áudio suportados
| Formato | Fonte comum | Melhor para | Upload direto |
|---|---|---|---|
| MP3 | Gravadores, podcasts, downloads | Uso geral, arquivos pequenos | |
| M4A | Memórias de Voz do iPhone, apps da Apple | Alta qualidade, tamanho eficiente | |
| WAV | Gravações, exportações de DAW | Não comprimido, áudio profissional | |
| FLAC | Arquivos de música, alta fidelidade | Qualidade sem perdas | |
| OGG | Gravações de código aberto, apps | Web e streaming | |
| AAC | Gravações móveis, streaming | Qualidade equilibrada e tamanho | |
| WebM | Gravações web, navegadores | Vídeo e áudio online |
O que saber sobre cada formato
Nenhum destes precisa ser convertido antes do upload. As notas abaixo são as coisas que realmente pegam as pessoas de surpresa, por formato.
MP3
O padrão para gravadores, downloads de podcasts e qualquer coisa compartilhada por chat. Com perdas, pequeno e universalmente legível.
- O que aceitamos
- Qualquer bitrate a partir de 32 kbps, mono ou estéreo, CBR ou VBR. Sem re-codificação antes da transcrição
- Bitrate e precisão
- Acima de aproximadamente 64 kbps para fala, mais bitrate não ajuda. Whisper reamostra para 16 kHz mono internamente de qualquer forma
- Bitrate variável
- Arquivos VBR às vezes relatam a duração errada em players mais antigos. Isso não afeta a transcrição ou os timestamps
- Tags ID3
- Ignoradas durante a transcrição. A transcrição volta como texto simples, então mantenha seu mapeamento de metadados de episódio em seu próprio sistema
M4A
Não é um codec, mas um contêiner: áudio AAC, ocasionalmente ALAC, dentro de um wrapper MP4. Isto é o que um iPhone lhe dá.
- Como lemos
- Analisamos a caixa ftyp, puxamos a faixa AAC e a entregamos ao Whisper sem re-codificação
- De onde vem
- Memórias de Voz do iPhone, GarageBand, FaceTime, downloads de Podcasts da Apple
- De um iPhone
- Compartilhe a memória, salve em Arquivos ou iCloud e depois carregue. Nenhuma etapa de conversão necessária
- ALAC dentro
- Alguns arquivos .m4a contêm Apple Lossless em vez de AAC. Ambos funcionam aqui, e nenhum precisa ser convertido primeiro
WAV
PCM não comprimido. Os maiores arquivos que você carregará, e a fonte mais limpa, embora o ruído ambiente ainda importe mais do que o formato.
- O que aceitamos
- PCM de 16, 24 e 32 bits, qualquer taxa de amostragem, mono ou estéreo, além de Broadcast Wave (BWF)
- Metadados BWF
- Chunks bext e iXML que carregam código de tempo, cena e tomada são lidos, não travados. Eles não aparecem na transcrição
- Aviso de tamanho
- Cerca de 10 MB por minuto em qualidade de CD, então uma gravação estéreo de 25 minutos já excede o limite anônimo
- Reduza primeiro
- Exportar mono a 64 kbps não perde nada para fala e reduz o arquivo de 10 a 15 vezes
FLAC
Compressão sem perdas, aproximadamente metade do tamanho do mesmo WAV. Comum em arquivos de história oral e fluxos de trabalho de gravação de campo.
- O que aceitamos
- FLAC nativo (bytes mágicos fLaC) e FLAC dentro de um contêiner OGG, mono ou estéreo, até 192 kHz, 16 ou 24 bits
- Nenhuma conversão necessária
- O arquivo passa direto. Converter para MP3 primeiro só perderia informações
- Comentários Vorbis
- Ignorados durante a transcrição. Se seu arquivo depende dessas tags, mantenha o mapeamento fora da transcrição
- Vale o tamanho?
- Para precisão, não. FLAC e um MP3 decente transcrevem da mesma forma. Mantenha FLAC como a cópia de preservação, não porque o Whisper precisa disso
WEBM
Um contêiner Matroska, geralmente contendo áudio Opus, às vezes Vorbis. Isto é o que navegadores e gravadores de tela produzem.
- De onde vem
- Loom, OBS, a API MediaRecorder do navegador, exportações do Google Meet, downloads do YouTube
- Vídeo dentro?
- Demuxamos, descartamos a faixa de vídeo e transcrevemos o áudio. Nada para extrair do seu lado
- Codecs
- Opus em qualquer coisa recente, Vorbis em arquivos mais antigos. Ambos tratados sem conversão
- Por que o arquivo é grande
- Gravações de tela são principalmente vídeo. Um WEBM de 20 MB geralmente carrega apenas 3 ou 4 MB de áudio
Perguntas frequentes
Quais formatos de áudio posso carregar?
MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, além de AIFF, AU, OPUS e MPEG. Se o seu arquivo toca em um reprodutor de mídia normal, o Mictoo pode transcrevê-lo. Arquivos de vídeo também são aceitos, extraímos a faixa de áudio no lado do servidor.
Quanto tempo leva a transcrição?
Normalmente segundos. Um arquivo de áudio de 10 minutos termina em cerca de 15 a 30 segundos; um podcast de 60 minutos é concluído em cerca de um minuto. Arquivos mais longos que são divididos automaticamente demoram um pouco mais, pois os pedaços são transcritos em paralelo e mesclados.
A transcrição de áudio é realmente gratuita?
Sim. Transcrição gratuita até 25 MB por arquivo sem cadastro. Uma conta gratuita aumenta o limite por arquivo para 60 MB, e arquivos de até 180 MB são divididos automaticamente em pedaços e mesclados em uma única transcrição. Sem cartão de crédito, sem taxas ocultas.
Os meus arquivos de áudio são armazenados?
Não. Os arquivos são transmitidos diretamente para o provedor de reconhecimento de fala (Groq para velocidade, com Replicate, Deepgram e OpenAI como alternativas), processados e depois excluídos. O Mictoo não retém áudio e os provedores não treinam com dados da API.
O formato do arquivo afeta a precisão?
A qualidade do áudio importa muito mais do que o formato. Fala limpa em um MP3 comprimido será transcrita melhor do que áudio ruidoso em um WAV não comprimido. O Mictoo executa o mesmo modelo Whisper large-v3 em todos os formatos, portanto, a precisão permanece consistente em todos os tipos suportados.
Preciso converter meu áudio para um formato específico primeiro?
Não. Esse é todo o ponto desta página. Carregue o que quer que seu gravador, DAW, telefone ou ferramenta de download tenha produzido. Detectamos o formato a partir do cabeçalho do arquivo e o direcionamos diretamente para o Whisper. Sem etapa de conversão, sem perda de qualidade.
Posso editar a transcrição antes de baixar?
Sim. Após a transcrição, mude para a visualização do Editor para corrigir nomes errados ou jargões. Os modos Leitor (timestamps por linha) e Editor (texto simples) estão disponíveis. As exportações usam a versão que você editou por último.
Quantos idiomas a transcrição suporta?
Mais de 50 idiomas, incluindo inglês, espanhol, francês, alemão, português, russo, ucraniano, japonês, chinês, árabe e muitos mais. A detecção automática funciona para a maioria dos arquivos, ou você pode escolher o idioma manualmente no formulário de upload para clipes curtos.
Posso traduzir a transcrição?
Sim. Após a transcrição, clique em Traduzir e escolha entre 28 idiomas de destino. A tradução está disponível na visualização do Leitor e em todos os formatos de exportação. Os timestamps são preservados, então o SRT traduzido ainda corresponde ao áudio.
Quais formatos de exportação estão disponíveis?
TXT (texto simples), SRT (legendas), TXT com timestamps e DOCX (documento Word). Usuários registrados também têm PDF, VTT (legendas web) e JSON. Todas as exportações estão disponíveis no menu de Download após a conclusão da transcrição.