mictoo
Cualquier formato de audio · Gratis · Sin registro

Audio a Texto
Una página para cualquier formato de audio

Sube MP3, M4A, WAV, FLAC, OGG, AAC, WebM y más. Obtén una transcripción limpia con marcas de tiempo, resumen de IA y exportaciones.

Free
Auto-deleted
50+ languages
AI summary (OpenAI)
Chat with transcript

Suelta tu archivo aquí

o haz clic para buscar

MP3 · MP4 · WAV · M4A · OGG · WEBM · FLAC  ·  Máx. 25 MB  ·  Máx. 30 min

180 min · Iniciar sesión

¿Archivo más grande? Cómo comprimir.

¿Grabación más larga? Cómo dividir.

Todos los formatos de audio comunes, una carga

Cómo funciona

  1. 1

    Sube cualquier archivo de audio

    Carga desde tu dispositivo o arrastra y suelta. MP3, M4A, WAV, FLAC, OGG, AAC, WebM y más.

  2. 2

    Whisper transcribe el audio

    Whisper large-v3 se ejecuta en nuestro backend con puntuación automática, saltos de párrafo y marcas de tiempo por segmento.

  3. 3

    Edita, exporta, comparte

    Revisa la transcripción, resume con IA, traduce a más de 50 idiomas y exporta como TXT, DOCX, PDF o SRT.

interview-notes.mp3
Completado·180 palabras
0:00 / 1:39
Buscar en la transcripción…
0:00Hola, gracias por hacer tiempo hoy. Empecemos sencillo.
0:07Empecé a hacer cortometrajes en la universidad como un pasatiempo.
0:15¿Qué te atrae de una historia antes de comprometerte con ella?
0:24Personas reales, momentos reales. Observo primero, escribo después.
0:34¿Cómo mantienes la energía del equipo en rodajes largos?
0:42Pequeños rituales. Café a la hora de llamada, un paseo antes de la hora mágica.
0:54¿Qué consejo le darías a alguien que está empezando?
1:02Mira mucho. Luego graba aún más. Nada supera la práctica.

Diseño más limpio por línea con marcas de tiempo. Mejor para leer.

Por qué una herramienta de audio a texto es mejor

Sin paso de conversión primero

Sube cualquier formato de audio directamente. Ahorra tiempo y mantén tu calidad original, sin pérdida por conversión.

Detección automática de formato

Mictoo detecta el formato desde el encabezado del archivo y aplica las mejores configuraciones de transcripción para ese códec.

Misma precisión en todos los formatos

Impulsado por Whisper large-v3 para una precisión constante ya sea que tu archivo sea MP3, WAV, FLAC o WebM.

Resumen y exportaciones incluidas

Obtén resúmenes de IA, traduce a más de 50 idiomas y exporta como TXT, SRT, VTT o DOCX. Sin planes adicionales.

Cuándo esta página es la opción correcta

Archivos de formatos mixtos

Una carga para todos tus archivos, independientemente de en qué se grabaron.

Formato de archivo desconocido

No estás seguro de qué produjo tu grabadora. Lo detectamos y lo transcribimos.

Transcripción rápida

Resultados rápidos sin configuración, convertidores o selección manual de formato.

Flujos de trabajo entre herramientas

Sube archivos exportados de Zoom, Descript, Audacity, GarageBand o cualquier DAW.

Usuarios primerizos

Sin registro, interfaz simple, gratis. Una primera prueba segura antes de comprometerse con cualquier herramienta.

Pruebas de calidad de audio

Verifica la claridad y ve cuánto texto útil puedes obtener de una grabación en bruto.

La calidad del audio importa más que el formato del archivo

Discurso claro
Audio limpio con ruido de fondo mínimo ofrece las transcripciones más precisas.
Audio ruidoso
El ruido de fondo o la superposición pueden reducir la precisión, sin importar el formato.
Audio comprimido
Tasas de bits muy bajas o compresión pesada pueden eliminar detalles importantes.

Cómo Mictoo detecta tu formato

1010
1010

Leemos el encabezado del archivo (bytes mágicos) para identificar tu formato al instante. Esto asegura las mejores configuraciones para una transcripción precisa y significa que nunca necesitas elegir el formato manualmente.

Ejemplos
ID3·MP3
ftyp·M4A
RIFF·WAV
fLaC·FLAC
OggS·OGG
ADTS·AAC
EBML·WebM

Formatos de audio compatibles

FormatoFuente comúnMejor paraCarga directa
MP3Grabadoras, podcasts, descargasUso general, archivos pequeños
M4AMemorandos de voz de iPhone, aplicaciones de AppleAlta calidad, tamaño eficiente
WAVGrabaciones, exportaciones de DAWSin comprimir, audio profesional
FLACArchivos de música, alta fidelidadCalidad sin pérdidas
OGGGrabaciones de código abierto, aplicacionesWeb y streaming
AACGrabaciones móviles, streamingCalidad y tamaño equilibrados
WebMGrabaciones web, navegadoresVídeo y audio en línea

Qué saber sobre cada formato

Ninguno de estos necesita conversión antes de la carga. Las notas a continuación son las cosas que realmente atrapan a la gente, por formato.

MP3

El formato predeterminado para grabadoras, descargas de podcasts y cualquier cosa compartida por chat. Con pérdidas, pequeño y universalmente legible.

Lo que aceptamos
Cualquier tasa de bits desde 32 kbps en adelante, mono o estéreo, CBR o VBR. Sin recodificación antes de la transcripción
Tasa de bits y precisión
Por encima de aproximadamente 64 kbps para el habla, más tasa de bits no ayuda. Whisper vuelve a muestrear a 16 kHz mono internamente de todos modos
Tasa de bits variable
Los archivos VBR a veces informan la duración incorrecta en reproductores más antiguos. Eso no afecta la transcripción ni las marcas de tiempo
Etiquetas ID3
Ignoradas durante la transcripción. La transcripción se devuelve como texto plano, así que mantén el mapeo de metadatos de tu episodio en tu propio sistema

M4A

No es un códec sino un contenedor: audio AAC, ocasionalmente ALAC, dentro de un envoltorio MP4. Esto es lo que te da un iPhone.

Cómo lo leemos
Analizamos el cuadro ftyp, extraemos la pista AAC y la entregamos a Whisper sin recodificación
De dónde proviene
Memorandos de voz de iPhone, GarageBand, FaceTime, descargas de Apple Podcasts
Desde un iPhone
Comparte el memo, guárdalo en Archivos o iCloud, luego súbelo. No se necesita paso de conversión
ALAC dentro
Algunos archivos .m4a contienen Apple Lossless en lugar de AAC. Ambos funcionan aquí, y ninguno necesita conversión primero

WAV

PCM sin comprimir. Los archivos más grandes que subirás, y la fuente más limpia, aunque el ruido de la sala sigue importando más que el formato.

Lo que aceptamos
PCM de 16, 24 y 32 bits, cualquier tasa de muestreo, mono o estéreo, además de Wave Broadcast (BWF)
Metadatos BWF
Los fragmentos bext e iXML que llevan código de tiempo, escena y toma se leen de paso, no se atascan. No aparecen en la transcripción
Advertencia de tamaño
Aproximadamente 10 MB por minuto a calidad de CD, por lo que una grabación estéreo de 25 minutos ya supera el límite anónimo
Redúcelo primero
Exportar en mono a 64 kbps no pierde nada para el habla y reduce el archivo de 10 a 15 veces

FLAC

Compresión sin pérdidas, aproximadamente la mitad del tamaño del mismo WAV. Común en archivos de historia oral y flujos de trabajo de grabación de campo.

Lo que aceptamos
FLAC nativo (bytes mágicos fLaC) y FLAC dentro de un contenedor OGG, mono o estéreo, hasta 192 kHz, 16 o 24 bits
No se necesita conversión
El archivo pasa directamente. Convertir a MP3 primero solo perdería información
Comentarios Vorbis
Ignorados durante la transcripción. Si tu archivo depende de esas etiquetas, mantén el mapeo fuera de la transcripción
¿Vale la pena el tamaño?
Para la precisión, no. FLAC y un buen MP3 se transcriben igual. Mantén FLAC como la copia de preservación, no porque Whisper lo necesite

WEBM

Un contenedor Matroska, que generalmente contiene audio Opus, a veces Vorbis. Esto es lo que producen los navegadores y grabadoras de pantalla.

De dónde proviene
Loom, OBS, la API MediaRecorder del navegador, exportaciones de Google Meet, descargas de YouTube
¿Vídeo dentro?
Desmultiplexamos, eliminamos la pista de vídeo y transcribimos el audio. Nada que extraer de tu lado
Códecs
Opus en cualquier cosa reciente, Vorbis en archivos más antiguos. Ambos manejados sin conversión
Por qué el archivo es grande
Las grabaciones de pantalla son principalmente vídeo. Un WEBM de 20 MB a menudo lleva solo 3 o 4 MB de audio

Preguntas frecuentes

¿Qué formatos de audio puedo subir?

MP3, M4A, WAV, FLAC, OGG, AAC, WebM, MP4, MOV, además de AIFF, AU, OPUS y MPEG. Si tu archivo se reproduce en un reproductor de medios normal, Mictoo puede transcribirlo. También se aceptan archivos de vídeo, extraemos la pista de audio en el servidor.

¿Cuánto tiempo tarda la transcripción?

Normalmente segundos. Un archivo de audio de 10 minutos se completa en unos 15 a 30 segundos; un podcast de 60 minutos se hace en aproximadamente un minuto. Los archivos más largos que se dividen automáticamente tardan un poco más ya que los fragmentos se transcriben en paralelo y se fusionan.

¿La transcripción de audio es realmente gratuita?

Sí. Transcripción gratuita hasta 25 MB por archivo sin registro. Una cuenta gratuita eleva el límite por archivo a 60 MB, y los archivos de hasta 180 MB se dividen automáticamente en fragmentos y se fusionan en una sola transcripción. Sin tarjeta de crédito, sin tarifas ocultas.

¿Se almacenan mis archivos de audio?

No. Los archivos se transmiten directamente al proveedor de reconocimiento de voz (Groq para velocidad, con Replicate, Deepgram y OpenAI como respaldo), se procesan y luego se eliminan. Mictoo no retiene audio y los proveedores no entrenan con datos de API.

¿El formato del archivo afecta la precisión?

La calidad del audio importa mucho más que el formato. Un discurso limpio en un MP3 comprimido se transcribirá mejor que un audio ruidoso en un WAV sin comprimir. Mictoo ejecuta el mismo modelo Whisper large-v3 en cada formato para que la precisión se mantenga constante en todos los tipos compatibles.

¿Necesito convertir mi audio a un formato específico primero?

No. Ese es el objetivo de esta página. Sube lo que sea que tu grabadora, DAW, teléfono o herramienta de descarga haya producido. Detectamos el formato desde el encabezado del archivo y lo enviamos directamente a Whisper. Sin paso de conversión, sin pérdida de calidad.

¿Puedo editar la transcripción antes de descargarla?

Sí. Después de la transcripción, cambia a la vista de Editor para corregir cualquier nombre o jerga incorrecta. Están disponibles los modos Lector (marcas de tiempo por línea) y Editor (texto plano). Las exportaciones utilizan la versión que editaste por última vez.

¿Cuántos idiomas soporta la transcripción?

Más de 50 idiomas incluyendo inglés, español, francés, alemán, portugués, ruso, ucraniano, japonés, chino, árabe y muchos más. La detección automática funciona para la mayoría de los archivos, o puedes elegir el idioma manualmente en el formulario de carga para clips cortos.

¿Puedo traducir la transcripción?

Sí. Después de la transcripción, haz clic en Traducir y elige entre 28 idiomas de destino. La traducción está disponible en la vista Lector y en todos los formatos de exportación. Las marcas de tiempo se conservan para que el SRT traducido aún coincida con el audio.

¿Qué formatos de exportación están disponibles?

TXT (texto plano), SRT (subtítulos), TXT con marcas de tiempo, y DOCX (documento de Word). Los usuarios registrados también obtienen PDF, VTT (subtítulos web) y JSON. Todas las exportaciones están disponibles desde el menú de Descarga después de que finalice la transcripción.

Sube cualquier archivo de audio y obtén el texto
Gratis. Sin registro. Sin límites en el formato.
Cualquier formato Sin registro Más de 50 idiomas
Subir audio para transcribir

Más herramientas de transcripción