Breve · 1 min de lectura
Un filtro con LLM reduce los errores en las transcripciones de audio policial ruidoso generadas por IA
Un equipo de investigadores presentó un filtro basado en LLM para mejorar el etiquetado pseudoautomático del reconocimiento de voz en comunicaciones policiales de radio con mucho ruido y reducir los errores de transcripción.
Oossa · Acerca de Oossa
El equipo, dirigido por Kaavya Chaparala, evaluó dos modelos fundacionales de reconocimiento de voz —Whisper, de OpenAI, y Qwen3‑ASR— con comunicaciones policiales de radio con mucho ruido de Baltimore y Chicago. Los investigadores descubrieron que las puntuaciones de confianza integradas en los modelos no permitían distinguir las transcripciones automáticas buenas de las malas. Al usar un modelo de lenguaje grande como evaluador externo para descartar las etiquetas pseudoautomáticas poco plausibles en su contexto, redujeron la tasa de error por palabra de los datos de entrenamiento. El artículo, aceptado para la conferencia SLT 2026, también plantea como posible línea futura intercambiar las etiquetas pseudoautomáticas entre modelos.
Por qué importa
Este método permite convertir grabaciones policiales ruidosas en texto legible de forma más económica y precisa, sin necesidad de un etiquetado humano exhaustivo.
Fuentes y referencias
| # | Fuente | Medio | Fecha | Idea clave |
|---|---|---|---|---|
| 1 | Pretrained ASR Pseudo-labeling for Noisy Police Audio ↗ | arXiv | 28 sept 2026 | arXiv:2609.30469v1 Announce Type: new Abstract: Pretrained ASR systems perform poorly on noisy Broadcast Police Communication (BPC), hinderi |
1 fuentes
Última actualización:
Oossa · Boletín
La semana en IA, explicada
Cada lunes: las noticias que vale la pena conocer, en lenguaje sencillo. Gratis, sin spam.