¿Cuál es el mejor modelo de IA para transcribir audio en español ahora mismo? La respuesta corta, si nos ceñimos al Word Error Rate (WER) medido sobre datasets estándar como Common Voice 17 y FLEURS, es Whisper large-v3 de OpenAI, seguido muy de cerca por Google Chirp 2 y Microsoft Azure AI Speech. Detrás quedan AssemblyAI Universal-2 y Amazon Transcribe, ambos solventes pero con margen respecto al trío de cabeza. Todos están operativos y se pueden contratar desde España en 2026, algo que no dábamos por hecho hace dos años con varios de ellos.
Vamos al grano. El criterio manda: menor WER en español, mejor puesto. Empate técnico se rompe por latencia y precio por minuto de audio procesado.
Cómo hemos ordenado el ranking
El WER mide el porcentaje de palabras erróneas (sustituciones, inserciones y borrados) frente a una transcripción de referencia. Cuanto más bajo, mejor. Las cifras que citamos provienen de Common Voice 17.0 y FLEURS (subset es), dos benchmarks públicos que usan tanto Hugging Face en su Open ASR Leaderboard como los propios proveedores en sus papers técnicos. No mezclamos datos de audio limpio con audio ruidoso: todas las comparaciones son sobre las mismas particiones.
Ojo con una trampa habitual: un modelo puede brillar en FLEURS (audio de estudio, locutores nativos) y hundirse en Common Voice (acentos amateur, ruido de fondo, micrófonos malos). Por eso ponderamos ambos.
1. OpenAI Whisper large-v3
Whisper large-v3 sigue marcando la referencia en español a finales de 2026. En FLEURS-es ronda un WER del 4,2% y en Common Voice 17 se queda cerca del 8,1%, según el Open ASR Leaderboard de Hugging Face. Es open source (licencia MIT), lo que permite autoalojarlo en una GPU propia y bajar el coste a prácticamente cero — si tienes la máquina. Vía API de OpenAI cuesta 0,006 $/minuto (unos 0,0055 €), un precio difícil de batir para el nivel de precisión que entrega.
¿Puntos débiles? Latencia. No está pensado para tiempo real puro: procesa por bloques de 30 segundos y penaliza en directo. Para pódcast, entrevistas o vídeo bajo demanda, es el rey.
| Especificación | Valor |
|---|---|
| WER FLEURS-es | 4,2% |
| WER Common Voice 17 es | 8,1% |
| Latencia | Batch (no streaming nativo) |
| Precio API | 0,006 $/min (~0,0055 €/min) |
| Autoalojable | Sí (MIT) |
| Disponibilidad España | API OpenAI + self-hosted |
2. Google Cloud Chirp 2
Chirp 2 es la segunda generación del modelo universal de Google, y en español clava un WER cercano al 4,6% en FLEURS-es y 8,7% en Common Voice, según las cifras publicadas por Google Cloud en su documentación de Speech-to-Text v2. Muy cerca de Whisper, con dos ventajas prácticas: streaming real con latencia sub-300 ms y diarización de hablantes nativa. Se factura a 0,016 €/minuto en la región europe-southwest1 (Madrid), lo cual, para uso empresarial en la UE, resuelve la papeleta de residencia del dato.
Baja al segundo puesto por muy poco. En audio de móvil con ruido, Whisper aguanta algo mejor.
| Especificación | Valor |
|---|---|
| WER FLEURS-es | ~4,6% |
| WER Common Voice 17 es | ~8,7% |
| Latencia streaming | <300 ms |
| Precio | 0,016 €/min |
| Región UE | Madrid (europe-southwest1) |
| Diarización | Sí, nativa |
3. Microsoft Azure AI Speech
Azure AI Speech se apoya en modelos propios reforzados con adaptación por dominio. Sobre FLEURS-es publica un WER en torno al 5,1% y en Common Voice se mueve alrededor del 9,4%. Menos afinado que Whisper o Chirp 2 en audio genérico, pero imbatible cuando personalizas el modelo con vocabulario específico (jurídico, médico, financiero): ahí baja varios puntos porcentuales. Precio estándar: 0,84 €/hora de audio, unos 0,014 €/min. Regiones UE disponibles (West Europe, North Europe) con cumplimiento GDPR fuera de discusión.
Si tu caso de uso es transcripción de reuniones corporativas con jerga interna, este sube al primer puesto en la práctica. Sin personalización, se queda tercero.
| Especificación | Valor |
|---|---|
| WER FLEURS-es | ~5,1% |
| WER Common Voice 17 es | ~9,4% |
| Custom Speech | Sí (baja WER 20-40% con dataset propio) |
| Precio estándar | 0,014 €/min |
| Regiones UE | West/North Europe |
| Streaming | Sí |
4. AssemblyAI Universal-2
Universal-2 es la apuesta de AssemblyAI por competir de tú a tú con los grandes. En inglés ha sacado pecho a base de datos, pero en español todavía va un peldaño por detrás: WER aproximado del 6,3% en FLEURS-es y en torno al 11% en Common Voice, según los benchmarks que la propia AssemblyAI publica junto a comparativas independientes. Su fuerte no es el WER puro sino el paquete: diarización de calidad, detección de sentimiento, resumen automático y capítulos, todo en la misma llamada. Precio: 0,37 $/hora (unos 0,34 €/hora, ~0,0057 €/min).
Buena opción si necesitas pipeline completo sin encadenar cinco APIs. Solo por precisión en español, hay mejores.
| Especificación | Valor |
|---|---|
| WER FLEURS-es | ~6,3% |
| WER Common Voice 17 es | ~11% |
| Extras incluidos | Diarización, sentiment, resumen, capítulos |
| Precio | ~0,0057 €/min |
| Servidores UE | Sí (opción EU) |
| Streaming | Sí |
5. Amazon Transcribe
Amazon Transcribe cierra el ranking. Sus cifras en español rondan el 6,8% en FLEURS-es y el 11,7% en Common Voice, por debajo del resto. A cambio, la integración con el ecosistema AWS (S3, Lambda, Bedrock) es directa, y el modelo Transcribe Streaming funciona con latencias bajas. Precio: 0,024 $/min para el primer millón de minutos (~0,022 €/min), más caro que Whisper vía API y con peor WER.
No es mala herramienta. Es que, si te la juegas solo por precisión en español, el resto le pasa por delante.
| Especificación | Valor |
|---|---|
| WER FLEURS-es | ~6,8% |
| WER Common Voice 17 es | ~11,7% |
| Precio | ~0,022 €/min |
| Región UE | eu-west-1 (Irlanda), eu-south-2 (España) |
| Streaming | Sí |
| Vocabulario personalizado | Sí |
Tabla resumen comparativa
| # | Modelo | WER FLEURS-es | WER CV17 es | Precio €/min | Streaming | Nota /10 |
|---|---|---|---|---|---|---|
| 1 | Whisper large-v3 | 4,2% | 8,1% | 0,0055 | No nativo | 9,3 |
| 2 | Google Chirp 2 | 4,6% | 8,7% | 0,016 | Sí (<300 ms) | 9,0 |
| 3 | Azure AI Speech | 5,1% | 9,4% | 0,014 | Sí | 8,4 |
| 4 | AssemblyAI Universal-2 | 6,3% | 11% | 0,0057 | Sí | 7,6 |
| 5 | Amazon Transcribe | 6,8% | 11,7% | 0,022 | Sí | 6,8 |
Ausencias justificadas
Falta Deepgram Nova-3, que en inglés compite con los mejores pero en español todavía no publica cifras consistentes sobre FLEURS-es. Tampoco entra Speechmatics Ursa: buen producto, pero su modelo en español no ha rebajado el WER de la generación anterior en los tests públicos que hemos podido verificar. Cuando publiquen datos comparables, volveremos a mirar.
Si te interesa el mundo LLM más allá del ASR, ya cubrimos los chatbots con la ventana de contexto más grande del mercado.
Veredicto
- Mejor absoluto por WER: OpenAI Whisper large-v3. Precisión líder, precio bajísimo vía API y opción de autoalojar. Su punto flaco es el streaming.
- Mejor relación precio-prestaciones: OpenAI Whisper large-v3 también, si trabajas por lotes. Si necesitas streaming sí o sí, Google Chirp 2 ofrece el mejor equilibrio a 0,016 €/min con latencia real y datos en Madrid.
Preguntas frecuentes
¿Qué es el WER y por qué se usa para comparar modelos de transcripción?
El Word Error Rate es el porcentaje de palabras mal transcritas (sustituidas, insertadas u omitidas) respecto a una transcripción humana de referencia. Es el estándar de la industria porque permite comparar modelos sobre el mismo audio y misma referencia, aunque no captura errores semánticos ni de puntuación.
¿Puedo usar Whisper gratis en español?
Sí. Whisper large-v3 está bajo licencia MIT y puedes descargarlo de Hugging Face y ejecutarlo en local. Necesitas una GPU con al menos 10 GB de VRAM para la versión large, o usar cuantización (Whisper.cpp, faster-whisper) para correrlo en CPU o GPUs modestas.
¿Cuál es el mejor para transcripción en tiempo real en español?
Google Chirp 2, por latencia sub-300 ms, diarización nativa y región de Madrid. Azure AI Speech es la alternativa si ya trabajas en el ecosistema Microsoft o necesitas Custom Speech con vocabulario propio.
¿Estos servicios cumplen el RGPD para uso empresarial en España?
Los cinco ofrecen regiones o configuraciones europeas: Google Chirp 2 en Madrid, Azure en West/North Europe, Amazon Transcribe en eu-south-2 (España) y eu-west-1, AssemblyAI con opción EU, y Whisper autoalojado sale directamente del scope de terceros. Firma siempre el DPA correspondiente antes de mover datos personales.
