¿Qué es speech-to-text?
El speech-to-text, también llamado reconocimiento automático del habla (ASR), es la tecnología que convierte el lenguaje hablado de una grabación de audio o vídeo en texto escrito. Analiza los sonidos del habla y produce una transcripción, indicando a menudo quién habló y cuándo. Los sistemas actuales manejan varios interlocutores, muchos idiomas y condiciones de grabación diversas, aunque la precisión baja con el ruido de fondo, la distancia al micrófono, los acentos marcados y las voces superpuestas.
La gente usa el speech-to-text para convertir conversaciones grabadas en algo que se pueda leer, buscar y citar: reuniones, entrevistas, clases, pódcast, llamadas y vídeo. En lugar de reproducir un archivo para encontrar una frase, obtienes un registro escrito que puedes revisar en segundos y compartir.
De un vistazo
| Entradas | Sube audio o vídeo (más de 30 formatos) o pega un enlace compatible; se procesa en nuestros servidores |
|---|---|
| Etiquetas de interlocutor | Sí: cada interlocutor separado e identificado |
| Marcas de tiempo | A nivel de palabra; haz clic en una línea para reproducir ese momento |
| Búsqueda | Dentro de una transcripción y por palabra clave en toda tu biblioteca |
| Pases de IA | Resumen, citas clave, acciones, decisiones, riesgos, plazos (cuenta gratuita) |
| Exportaciones | TXT y JSON gratis; PDF, DOCX, SRT, VTT en planes de pago; audio original gratis |
| Idiomas | Más de 90 idiomas; traducción desde el editor (con cuenta) |
| Límite gratuito | 50 MB gratis, sin registro; se elimina en 24 h; nunca se usa para entrenar IA |
| Transcripción en directo / en tiempo real | No: primero se sube; el texto aparece tras el procesamiento, no mientras hablas |
Un convertidor de voz a texto hecho para audio real
Reconocimiento de voz con Whisper
Nuestro motor de voz a texto se basa en OpenAI Whisper, el modelo de IA conocido por manejar acentos, ruido de fondo y vocabulario técnico que confunde a los dictados convencionales. Cada palabra se convierte en texto limpio y puntuado.


Escucha y lee sincronizado
Reproduce la grabación y mira cómo el texto se resalta en tiempo real. Haz clic en cualquier frase para saltar el audio a ese momento: revisar una hora de voz toma minutos.
Tu voz, en cualquier formato de texto
Exporta el texto final como lo necesites: un documento pulido, texto plano para cualquier editor o subtítulos con marcas de tiempo. Copia directamente a Notion o Google Docs.

Un ejemplo real
Una grabación con dos interlocutores, transcrita y resumida. Ilustrativo.
Ejemplo ilustrativo. La IA resume lo que se dijo realmente en tu grabación en lugar de rellenar una plantilla fija, por lo que la redacción y los campos varían según el contenido.
Speech-to-text frente a voice-to-text
Aquí, speech-to-text significa reconocimiento del habla en sentido amplio: transcribe voz grabada de cualquier medio (reuniones, entrevistas, llamadas, clases, pódcast, vídeo) y separa a varios interlocutores. Si un archivo tiene varias voces, cada una se identifica. Es la herramienta de reconocimiento de uso general para grabaciones que ya existen.
Voice-to-text suele referirse a una sola persona que dicta a un micrófono para redactar un texto. Si es lo que buscas, la página de voice-to-text cubre ese flujo. Esta página sirve para convertir grabaciones existentes de una o varias personas en una transcripción legible y consultable, no para captar tu propio dictado.
En ambos casos, el proceso empieza por la subida: subes una grabación (o pegas un enlace compatible) y recibes la transcripción tras el procesamiento; TranscribeThis no transcribe en directo mientras hablas y no hay grabación desde el micrófono del navegador. La transcripción que se resalta línea a línea mientras se reproduce el audio es una función aparte y real para revisar una transcripción terminada; no es transcripción en tiempo real.

Convierte voz a texto en tres pasos
Sube una grabación — sin instalar nada.
Arrastra y suelta un archivo de audio o vídeo (MP3, WAV, M4A, MP4 — más de 30 formatos) o pega un enlace compatible.
El motor de reconocimiento convierte tu audio en texto en minutos, con marcas de tiempo, puntuación y detección de hablantes.
Pule el texto en el editor integrado y descárgalo como PDF, TXT, DOCX, SRT o VTT — o cópialo donde quieras.
Descubre más herramientas de TranscribeThis
Preguntas frecuentes
¿Cómo funciona el convertidor de voz a texto?
Sube una grabación y el reconocimiento de voz Whisper AI convierte el audio en texto puntuado y con marcas de tiempo que puedes editar y exportar. Tu archivo se procesa en nuestros servidores, sin instalar nada.
¿Es gratis esta herramienta de voz a texto?
Sí: puedes convertir voz a texto online gratis, sin registro, con archivos de hasta 50 MB. Los planes de pago añaden archivos más largos, más volumen y funciones avanzadas.
¿Qué precisión tiene Whisper?
Con voz clara, el reconocimiento basado en Whisper alcanza hasta el 99% de precisión. Las grabaciones con ruido de fondo o acentos fuertes quedan por debajo. La precisión varía según la calidad del audio, el idioma y el solapamiento de voces.
¿Puedo subir una grabación de voz?
Sí. Sube una grabación de audio o vídeo en cualquiera de más de 30 formatos y obtienes una transcripción puntuada y con marcas de tiempo para editar y exportar. TranscribeThis transcribe las grabaciones que subes; no transcribe en directo mientras hablas.
¿Qué idiomas se admiten?
Más de 90 idiomas con detección automática, más traducción de la transcripción final con un clic.
¿Qué formatos de audio y vídeo puedo subir?
MP3, WAV, M4A, MP4, MOV y más de 30 formatos de audio y vídeo. Si contiene voz, podemos convertirlo en texto.
¿Puedo descargar el texto convertido?
Sí: exporta como PDF, TXT, DOCX, SRT o VTT, o copia el texto directamente a Notion, Google Docs o cualquier editor.
¿Mi grabación es privada y segura?
Los archivos se cifran en tránsito y en reposo, se eliminan automáticamente en 24 horas en el plan gratuito y nunca se usan para entrenar modelos de IA.
