Audio a Texto
Una página para cualquier formato de audio
Sube MP3, M4A, WAV, FLAC, OGG, AAC, WebM y más. Obtén una transcripción limpia con marcas de tiempo, resumen de IA y exportaciones.
Suelta tu archivo aquí
o haz clic para buscar
MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC · Máx. 25 MB · Máx. 30 min
Cómo funciona
- 1
Sube cualquier archivo de audio
Carga desde tu dispositivo o arrastra y suelta. MP3, M4A, WAV, FLAC, OGG, AAC, WebM y más.
- 2
Whisper transcribe el audio
Whisper large-v3 se ejecuta en nuestro backend con puntuación automática, saltos de párrafo y marcas de tiempo por segmento.
- 3
Edita, exporta, comparte
Revisa la transcripción, resume con IA, traduce a más de 50 idiomas y exporta como TXT, DOCX, PDF o SRT.
Diseño más limpio por línea con marcas de tiempo. Mejor para leer.
Por qué una herramienta de audio a texto es mejor
Sin paso de conversión primero
Sube cualquier formato de audio directamente. Ahorra tiempo y mantén tu calidad original, sin pérdida por conversión.
Detección automática de formato
Mictoo detecta el formato desde el encabezado del archivo y aplica las mejores configuraciones de transcripción para ese códec.
Misma precisión en todos los formatos
Impulsado por Whisper large-v3 para una precisión constante ya sea que tu archivo sea MP3, WAV, FLAC o WebM.
Resumen y exportaciones incluidas
Obtén resúmenes de IA, traduce a más de 50 idiomas y exporta como TXT, SRT, VTT o DOCX. Sin planes adicionales.
Cuándo esta página es la opción correcta
Archivos de formatos mixtos
Una carga para todos tus archivos, independientemente de en qué se grabaron.
Formato de archivo desconocido
No estás seguro de qué produjo tu grabadora. Lo detectamos y lo transcribimos.
Transcripción rápida
Resultados rápidos sin configuración, convertidores o selección manual de formato.
Flujos de trabajo entre herramientas
Sube archivos exportados de Zoom, Descript, Audacity, GarageBand o cualquier DAW.
Usuarios primerizos
Sin registro, interfaz simple, gratis. Una primera prueba segura antes de comprometerse con cualquier herramienta.
Pruebas de calidad de audio
Verifica la claridad y ve cuánto texto útil puedes obtener de una grabación en bruto.
La calidad del audio importa más que el formato del archivo
Cómo Mictoo detecta tu formato
1010
Leemos el encabezado del archivo (bytes mágicos) para identificar tu formato al instante. Esto asegura las mejores configuraciones para una transcripción precisa y significa que nunca necesitas elegir el formato manualmente.
Formatos de audio compatibles
| Formato | Fuente común | Mejor para | Carga directa |
|---|---|---|---|
| MP3 | Grabadoras, podcasts, descargas | Uso general, archivos pequeños | |
| M4A | Memorandos de voz de iPhone, aplicaciones de Apple | Alta calidad, tamaño eficiente | |
| WAV | Grabaciones, exportaciones de DAW | Sin comprimir, audio profesional | |
| FLAC | Archivos de música, alta fidelidad | Calidad sin pérdidas | |
| OGG | Grabaciones de código abierto, aplicaciones | Web y streaming | |
| AAC | Grabaciones móviles, streaming | Calidad y tamaño equilibrados | |
| WebM | Grabaciones web, navegadores | Vídeo y audio en línea |
Qué saber sobre cada formato
Ninguno de estos necesita conversión antes de la carga. Las notas a continuación son las cosas que realmente atrapan a la gente, por formato.
MP3
El formato predeterminado para grabadoras, descargas de podcasts y cualquier cosa compartida por chat. Con pérdidas, pequeño y universalmente legible.
- Lo que aceptamos
- Cualquier tasa de bits desde 32 kbps en adelante, mono o estéreo, CBR o VBR. Sin recodificación antes de la transcripción
- Tasa de bits y precisión
- Por encima de aproximadamente 64 kbps para el habla, más tasa de bits no ayuda. Whisper vuelve a muestrear a 16 kHz mono internamente de todos modos
- Tasa de bits variable
- Los archivos VBR a veces informan la duración incorrecta en reproductores más antiguos. Eso no afecta la transcripción ni las marcas de tiempo
- Etiquetas ID3
- Ignoradas durante la transcripción. La transcripción se devuelve como texto plano, así que mantén el mapeo de metadatos de tu episodio en tu propio sistema
M4A
No es un códec sino un contenedor: audio AAC, ocasionalmente ALAC, dentro de un envoltorio MP4. Esto es lo que te da un iPhone.
- Cómo lo leemos
- Analizamos el cuadro ftyp, extraemos la pista AAC y la entregamos a Whisper sin recodificación
- De dónde proviene
- Memorandos de voz de iPhone, GarageBand, FaceTime, descargas de Apple Podcasts
- Desde un iPhone
- Comparte el memo, guárdalo en Archivos o iCloud, luego súbelo. No se necesita paso de conversión
- ALAC dentro
- Algunos archivos .m4a contienen Apple Lossless en lugar de AAC. Ambos funcionan aquí, y ninguno necesita conversión primero
WAV
PCM sin comprimir. Los archivos más grandes que subirás, y la fuente más limpia, aunque el ruido de la sala sigue importando más que el formato.
- Lo que aceptamos
- PCM de 16, 24 y 32 bits, cualquier tasa de muestreo, mono o estéreo, además de Wave Broadcast (BWF)
- Metadatos BWF
- Los fragmentos bext e iXML que llevan código de tiempo, escena y toma se leen de paso, no se atascan. No aparecen en la transcripción
- Advertencia de tamaño
- Aproximadamente 10 MB por minuto a calidad de CD, por lo que una grabación estéreo de 25 minutos ya supera el límite anónimo
- Redúcelo primero
- Exportar en mono a 64 kbps no pierde nada para el habla y reduce el archivo de 10 a 15 veces
FLAC
Compresión sin pérdidas, aproximadamente la mitad del tamaño del mismo WAV. Común en archivos de historia oral y flujos de trabajo de grabación de campo.
- Lo que aceptamos
- FLAC nativo (bytes mágicos fLaC) y FLAC dentro de un contenedor OGG, mono o estéreo, hasta 192 kHz, 16 o 24 bits
- No se necesita conversión
- El archivo pasa directamente. Convertir a MP3 primero solo perdería información
- Comentarios Vorbis
- Ignorados durante la transcripción. Si tu archivo depende de esas etiquetas, mantén el mapeo fuera de la transcripción
- ¿Vale la pena el tamaño?
- Para la precisión, no. FLAC y un buen MP3 se transcriben igual. Mantén FLAC como la copia de preservación, no porque Whisper lo necesite
WEBM
Un contenedor Matroska, que generalmente contiene audio Opus, a veces Vorbis. Esto es lo que producen los navegadores y grabadoras de pantalla.
- De dónde proviene
- Loom, OBS, la API MediaRecorder del navegador, exportaciones de Google Meet, descargas de YouTube
- ¿Vídeo dentro?
- Desmultiplexamos, eliminamos la pista de vídeo y transcribimos el audio. Nada que extraer de tu lado
- Códecs
- Opus en cualquier cosa reciente, Vorbis en archivos más antiguos. Ambos manejados sin conversión
- Por qué el archivo es grande
- Las grabaciones de pantalla son principalmente vídeo. Un WEBM de 20 MB a menudo lleva solo 3 o 4 MB de audio
Preguntas frecuentes
¿Qué formatos de audio puedo subir?
MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, además de AIFF, AU, OPUS y MPEG. Si tu archivo se reproduce en un reproductor de medios normal, Mictoo puede transcribirlo. También se aceptan archivos de vídeo, extraemos la pista de audio en el servidor.
¿Cuánto tiempo tarda la transcripción?
Normalmente segundos. Un archivo de audio de 10 minutos se completa en unos 15 a 30 segundos; un podcast de 60 minutos se hace en aproximadamente un minuto. Los archivos más largos que se dividen automáticamente tardan un poco más ya que los fragmentos se transcriben en paralelo y se fusionan.
¿La transcripción de audio es realmente gratuita?
Sí. Transcripción gratuita hasta 25 MB por archivo sin registro. Una cuenta gratuita eleva el límite por archivo a 60 MB, y los archivos de hasta 180 MB se dividen automáticamente en fragmentos y se fusionan en una sola transcripción. Sin tarjeta de crédito, sin tarifas ocultas.
¿Se almacenan mis archivos de audio?
No. Los archivos se transmiten directamente al proveedor de reconocimiento de voz (Groq para velocidad, con Replicate, Deepgram y OpenAI como respaldo), se procesan y luego se eliminan. Mictoo no retiene audio y los proveedores no entrenan con datos de API.
¿El formato del archivo afecta la precisión?
La calidad del audio importa mucho más que el formato. Un discurso limpio en un MP3 comprimido se transcribirá mejor que un audio ruidoso en un WAV sin comprimir. Mictoo ejecuta el mismo modelo Whisper large-v3 en cada formato para que la precisión se mantenga constante en todos los tipos compatibles.
¿Necesito convertir mi audio a un formato específico primero?
No. Ese es el objetivo de esta página. Sube lo que sea que tu grabadora, DAW, teléfono o herramienta de descarga haya producido. Detectamos el formato desde el encabezado del archivo y lo enviamos directamente a Whisper. Sin paso de conversión, sin pérdida de calidad.
¿Puedo editar la transcripción antes de descargarla?
Sí. Después de la transcripción, cambia a la vista de Editor para corregir cualquier nombre o jerga incorrecta. Están disponibles los modos Lector (marcas de tiempo por línea) y Editor (texto plano). Las exportaciones utilizan la versión que editaste por última vez.
¿Cuántos idiomas soporta la transcripción?
Más de 50 idiomas incluyendo inglés, español, francés, alemán, portugués, ruso, ucraniano, japonés, chino, árabe y muchos más. La detección automática funciona para la mayoría de los archivos, o puedes elegir el idioma manualmente en el formulario de carga para clips cortos.
¿Puedo traducir la transcripción?
Sí. Después de la transcripción, haz clic en Traducir y elige entre 28 idiomas de destino. La traducción está disponible en la vista Lector y en todos los formatos de exportación. Las marcas de tiempo se conservan para que el SRT traducido aún coincida con el audio.
¿Qué formatos de exportación están disponibles?
TXT (texto plano), SRT (subtítulos), TXT con marcas de tiempo, y DOCX (documento de Word). Los usuarios registrados también obtienen PDF, VTT (subtítulos web) y JSON. Todas las exportaciones están disponibles desde el menú de Descarga después de que finalice la transcripción.