No account. No daily cap.Otros te ofrecen tres archivos al día y lo llaman ilimitado. Aquí puedes subir archivos de hasta 60 minutos, tantas veces como quieras.
Las afirmaciones de "¡99% de precisión!" están por todas partes y, en su mayoría, se miden con audio ideal. Aquí te explicamos qué significa realmente la precisión, qué factores la afectan, qué puedes esperar de forma realista de tu grabación y cómo grabar para que la transcripción salga casi perfecta.
La métrica estándar del sector es tasa de error por palabra (WER)Consiste en tomar la transcripción automática, compararla con lo que realmente se dijo y contar tres tipos de errores: sustituciones (palabra incorrecta), Inserciones (palabra adicional), y Eliminaciones (palabra omitida). Divide el total por el número de palabras pronunciadas, y ese será tu WER. Un WER del 5 % significa que aproximadamente una de cada veinte palabras es incorrecta; a menudo se expresa al revés como "95 % de precisión"
Dos aspectos que la gente suele pasar por alto en relación con el WER: primero, considera todos los errores por igual, pero en la práctica, un nombre, una dosis o una cantidad mal transcritos tienen un impacto mucho mayor que un simple "um, bueno" mal dicho. En segundo lugar, las cifras de WER publicadas provienen de conjuntos de datos de referencia: a menudo se trata de audio limpio, con un solo hablante y acento nativo. Tu cifra real depende casi por completo de tu grabación.
Es el factor más importante. El tráfico, las conversaciones en una cafetería, el aire acondicionado, el sonido del teclado y el viento compiten con la voz. Los modelos modernos se entrenan con audio ruidoso y se adaptan sorprendentemente bien al ruido de fondo constante, pero el ruido fuerte o similar a la voz (un televisor, otras conversaciones) corrompe directamente las palabras.
Está estrechamente relacionado con el ruido: un hablante situado a dos metros de un micrófono de portátil suena reverberante y bajo, y la precisión disminuye considerablemente. Un teléfono colocado cerca del hablante es mejor que un micrófono caro al otro lado de la habitación.
Los modelos modernos de reconocimiento de voz se entrenan con cientos de miles de horas de audio multilingüe, por lo que los acentos comunes se transcriben bien. Los acentos regionales muy marcados, los dialectos y la pronunciación fuertemente no nativa siguen generando errores: el modelo sustituye la palabra más parecida a la que "espera".
El vocabulario especializado (términos médicos, nombres de productos, nombres de personas, acrónimos) es donde se concentran los errores, porque es posible que el modelo nunca haya visto esa palabra. Confiadamente escribirá un reemplazo con una sonoridad plausible, y por eso es importante la revisión.
Las conversaciones con turnos de palabra son aceptables. Que las personas se interrumpan entre sí no lo es: el habla superpuesta genera audio realmente ambiguo, y todos los sistemas de transcripción tienen dificultades para procesarlo. Los debates y las reuniones acaloradas son los escenarios más difíciles.
El audio muy comprimido (notas de voz con baja tasa de bits, llamadas telefónicas, grabaciones antiguas) elimina precisamente las frecuencias que distinguen consonantes similares. La distorsión (grabar a un volumen tan alto que la forma de onda se distorsiona) es aún peor.
| Escenario | Resultado típico |
|---|---|
| Podcast / locución, buen micrófono, un solo orador | Excelente: generalmente 97-99% de las palabras correctas; casi listo para su publicación |
| Reunión en Zoom/Teams, todos con auriculares | Muy bueno: espere algunas correcciones por página, principalmente nombres |
| Entrevista, teléfono sobre la mesa en una habitación tranquila | Bueno: transcripción sólida, revise los nombres, los números y los momentos de silencio |
| Conferencia, orador lejos del grabador | Aceptable: el contenido principal se transcribe correctamente; las secciones con eco se degradan |
| Conversación grupal con interferencias y ruido de cafetería | Deficiente: espere lagunas evidentes y voces mezcladas; revise rápidamente, no cite textualmente |
Incluso una transcripción con una precisión del 97% de una entrevista de 1.500 palabras contiene aproximadamente 45 palabras incorrectas, y estas suelen ser los nombres, cifras y términos técnicos que son importantes para ti. El objetivo de la transcripción automática no es eliminar todos los errores; sino que corregir 45 palabras lleva cinco minutos, mientras que escribir 1.500 palabras con marcas de tiempo lleva más de una hora. La sincronización, la estructura y el 95% o más de las palabras ya están hechas por ti.
La forma honesta de responder a la pregunta "¿de qué tan precisa es?" paramí ScribeGrab es probarlo con tus grabaciones reales Utiliza our speech model (uno de los modelos de reconocimiento de voz de código abierto más precisos), de forma gratuita, sin límites diarios ni necesidad de registrarse, y obtén la transcripción junto con subtítulos SRT y VTT a partir de una sola carga. Tu archivo se elimina inmediatamente después del procesamiento.
En grabaciones claras y de buena calidad, los modelos modernos suelen acertar en el 95–98% de las palabras (la tasa de error de palabras [WER] es de aproximadamente del 2 al 5%). El ruido, los acentos marcados, las interferencias, la jerga y los micrófonos de mala calidad reducen esta precisión: el audio con mucho ruido y varias voces puede tener una precisión inferior al 90%.
La métrica estándar de precisión: sustituciones + inserciones + eliminaciones, divididas por el número de palabras pronunciadas. Un WER del 5% equivale aproximadamente a 1 palabra incorrecta cada 20. Cuanto menor sea, mejor.
Utilice un micrófono cerca de la fuente sonora, grabe en una habitación silenciosa, con una sola voz a la vez, con niveles adecuados sin que se produzca distorsión, utilice los archivos originales en lugar de volver a comprimirlos y configure el idioma manualmente en clips muy cortos.
Sí, los errores suelen concentrarse en nombres propios, números y jerga, es decir, precisamente en las palabras que más importan. Pero corregir unas pocas docenas de palabras lleva menos tiempo que volver a escribir todo el texto.