Conceptos
Tecnologías del habla y de la voz
Esta es una traducción automática de la página en inglés y todavía no ha sido revisada por una persona hablante nativa.
Las tecnologías del habla y de la voz — la familia de sistemas de IA en los que el canal hablado soporta la interacción: el reconocimiento automático del habla (ASR) que transcribe, analiza y califica lo que dice quien aprende; la síntesis de voz (TTS) que genera instrucción narrada o en forma de diálogo; los agentes centrados en la voz que mantienen una conversación hablada en tiempo real con quien aprende; y la captura y puntuación automatizadas del desempeño oral. Mientras que la investigación sobre IA conversacional trata sobre todo de chatbots de texto y el aprendizaje de lenguas cubre ampliamente la pedagogía de segundas lenguas, esta página sigue al audio en sí mismo: qué cambia una interfaz de voz en el aprendizaje, cuánto cuesta y a quién incluye o excluye cuando la interfaz es una voz y no una pantalla.
Preguntas para reflexionar
- La retroalimentación del ASR ayuda más a quien aprende con más nivel que a quien tiene menos: en una encuesta a 325 estudiantes de grado chinos, el rendimiento del comportamiento reflexivo y de la motivación era débil y no significativo con competencia baja, y se volvía marcadamente más fuerte en niveles medios y altos. Si una herramienta eleva la media a la vez que amplía la brecha, ¿es un éxito?
- La narración con TTS igualó a la voz del propio docente en comprensión, concentración y valoración global, pero el TTS en formato de diálogo superó al TTS de un solo hablante en comprensión e implicación cognitiva aunque sonaba menos natural. ¿Cuál elegiría para una primera introducción a un concepto, y cuál para un recorrido procedimental denso?
- Dos hallazgos van contra la intuición: el estudiantado que más leyó la salida de la IA durante tareas de interpretación fue el que peor fluidez de entrega tuvo, y a quien respondió con dos palabras se le marcó como correcto mientras que una respuesta hablada más completa fue señalada. ¿Hasta qué punto una interfaz de voz mide fluidez verbal y no comprensión?
- Un agente de voz con acento británico fue tratado como una herramienta, mientras que los agentes con acento indio y afroamericano se antropomorfizaron y se trataron como pares en el trabajo en grupo de K-12. Si el acento cambia cómo se relaciona quien aprende con un agente, ¿quién debería decidir con qué voz se lanza un producto educativo?
- Los sistemas centrados en la voz y sin conexión existen sobre todo para llegar a quien la tecnología educativa basada en pantallas excluyó: niños ciegos, estudiantes sordos y con discapacidad auditiva, estudiantes en talleres sin conectividad. ¿Qué haría falta para que la accesibilidad fuera el supuesto de partida de un producto de voz y no una corrección posterior?
- Casi todas las afirmaciones de esta página provienen de un estudio corto, de un solo sitio, autoinformado y con un orden de presentación fijo. ¿Cuáles de estos hallazgos le parecerían lo bastante fiables como para cambiar su diseño de evaluación o de clase antes de que exista una replicación?
Introducción
El habla es la interfaz educativa más antigua y la más nueva para la IA. Los sistemas que escuchan y hablan ya están en aulas de idiomas, talleres de formación profesional y clases de indagación de secundaria. Atraen por la razón de siempre —el habla es rápida, funciona sin manos y sin mirar, y es el medio en el que viven la pronunciación, la fluidez y el razonamiento oral— y por una más nueva: una respuesta hablada con tiempo limitado es difícil de externalizar a un generador de texto, lo que convierte el canal hablado en una respuesta candidata a la presión de la integridad académica sobre la evaluación escrita.
La investigación aquí se divide en cuatro grupos: retroalimentación de pronunciación con ASR, instrucción generada con TTS, compañeros centrados en la voz y de diálogo hablado, y evaluación oral apoyada por IA. Recorre los cuatro una pregunta sobre la equidad: las interfaces de voz eliminan una barrera (la vista, la velocidad de lectura, la alfabetización escrita) mientras introducen otras (el acento, la precisión del reconocimiento, el hardware, la conectividad).
ASR y retroalimentación de pronunciación
El mensaje más consistente del trabajo sobre ASR es que la herramienta no es el tratamiento: lo es el diseño de la retroalimentación. Chen et al. (2026) encuestaron a 325 estudiantes de grado en una universidad china de formación de docentes y modelaron la precisión, la frecuencia de uso, la calidad de la retroalimentación y el diseño de tareas de reflexión frente al comportamiento reflexivo y la motivación intrínseca, y después frente a la mejora al hablar. La corrección precisa de errores y las tareas de reflexión estructurada impulsaron tanto la internalización de la retroalimentación como la reflexión. Un uso más frecuente aumentó la reflexión, pero no tuvo efecto independiente sobre la motivación. La precisión del reconocimiento elevó la motivación, plausiblemente porque construye confianza en la herramienta, pero por sí sola no desencadenó un procesamiento más profundo: quien aprende puede registrar un error señalado sin analizar su causa. La reflexión fue el predictor más fuerte de las ganancias al hablar, y la competencia moderó ambas vías: débil y no significativa con competencia baja, marcadamente más fuerte en niveles medios y altos. El consejo que se deriva es explicar los errores de forma articulatoria en lugar de señalarlos, aumentar la complejidad según la preparación y enmarcar la corrección de forma comprensiva.
Una segunda línea pregunta si la retroalimentación de pronunciación con IA cambia la disposición de quien aprende a hablar. Lu et al. (2026) encuestaron a 1.701 estudiantes universitarios chinos de inglés como lengua extranjera y usaron modelos de ecuaciones estructurales basados en covarianzas con remuestreo corregido por sesgo para probar si las percepciones de la retroalimentación de pronunciación de la IA generativa se relacionaban con la disposición a comunicarse, con la autoeficacia de pronunciación como mediadora. La asociación fue positiva y la autoeficacia la medió parcialmente: la vía indirecta explicó el 69,9 % del efecto total mientras permanecía un efecto directo. Todos los constructos se autoinformaron en un único punto temporal, de modo que el estudio describe un mecanismo que quien aprende percibe y no uno que se manipuló.
La retroalimentación automatizada de pronunciación también puede construirse sin etiquetas de error. Kawamura (2026) describe Profy, que aprende cómo son una buena y una mala pronunciación a partir de habla en gran medida sin anotar mediante aprendizaje autosupervisado, y después muestra a quien aprende qué regiones de la forma de onda determinaron el juicio y cuánto se aleja su acústica de las distribuciones de hablantes nativos. Con 10 estudiantes japoneses de inglés evaluados por cinco oyentes estadounidenses, la inteligibilidad mejoró y, a diferencia de una línea base de imitación elicitada, los intervalos de confianza antes y después de la práctica no se solaparon: una muestra pequeña, pero que da dónde y cuánto en lugar de un veredicto binario.
El ASR también sirve al aula en un segundo papel: convertir la entrada hablada en texto que el estudiantado lee. Stanchev (2026) locutó un pasaje de 2.692 tokens de un manual de inglés médico sobre proteínas con una voz de síntesis (15:27, voz femenina canadiense) y envió el audio idéntico a cuatro servicios de ASR en línea, y después midió tanto la tasa de error de palabras (WER) como la cobertura (las palabras devueltas como proporción de la referencia). Los dos servicios gratuitos devolvieron transcripciones casi completas (87,96 % y 88,34 % de cobertura, WER 15,23 % y 15,00 %), mientras que los dos servicios de pago exportaron solo vistas previas (32,76 % y 55,35 % de cobertura, WER 73,21 % y 48,77 %). El punto de medición es que la WER por sí sola confunde el texto no disponible con el texto inexacto y clasificaría una restricción de exportación como un fallo de transcripción, de modo que la cobertura pertenece junto a la tasa de error. Las omisiones dominaron en todos los servicios y se concentraron en marcadores estructurales como referencias a figuras y números de página, pero un puñado de sustituciones que alteran el significado —imino → amino, cistina → cisteína, protonado → protonatid, pH → fase— invirtió cada una un hecho bioquímico, razón por la cual los autores proponen un flujo de trabajo en tres etapas (generar la entrada, exportar la transcripción completa, verificar la terminología del dominio) antes de que una transcripción llegue a quien aprende, y por la cual una pasada de terminología es la salvaguarda más barata para el inglés médico.
TTS e instrucción generada por voz
La narración generada resulta ser un sustituto viable de un docente grabado, y la variación interesante está dentro del formato y no entre lo humano y la máquina. Kumoi et al. (2026) construyeron un flujo de trabajo en tres etapas y con intervención humana en el que un LLM redacta diapositivas y narración optimizada para TTS mientras el docente verifica los hechos en cada etapa, y después realizaron un estudio intrasujeto con 245 estudiantes de primer año de secundaria en una prefectura japonesa, comparando vídeo con voz de docente, TTS de un solo hablante y TTS con diálogo Experto-×-Novato. La comprensión, la concentración y la valoración global no difirieron significativamente entre los tres (p > 0,14, r < 0,11), y las pruebas de equivalencia mantuvieron los tres dentro de un margen de ±0,5: la narración sintética no degradó la experiencia. La narración en diálogo fue mejor en comprensión (p = 0,006, r = 0,130), en el pensamiento profundizado declarado (p = 0,019, r = 0,121) y en la capacidad de explicar el contenido a un amigo (p = 0,004, r = 0,152), y el 66,9 % la prefirió como la más amena. Dos salvedades: el audio en diálogo se valoró significativamente como menos natural (r = −0,238), en consonancia con una carga adicional por varios hablantes, y el grupo de diálogo llegó con menos conocimiento previo (el 66,0 % declaró no saber «nada en absoluto» frente al 34,1 %), lo que convierte su ventaja en una estimación conservadora.
El trabajo de seguimiento sostiene que el formato debería ajustarse a quien aprende, no al contenido. Watanabe et al. (2026) dieron a 222 estudiantes de primer año de secundaria lecciones en diálogo docente–estudiante (TS), estudiante–estudiante (SS) y docente–docente (TT) generadas por un LLM y locutadas mediante una API de TTS, y ajustaron modelos lineales mixtos desde la óptica de la interacción aptitud-tratamiento. El TT aumentó la motivación más que el TS, pero el efecto dependió del estilo de aprendizaje: la interacción con el factor de Experiencia Concreta fue positiva (b = 0,162, p < 0,001) mientras que la interacción con el factor de reflexión y conceptualización fue negativa (b = −0,238, p = 0,002). El TT también obtuvo una valoración global significativamente más baja que el TS (b = −0,126, p = 0,005), que los autores atribuyen a la carga cognitiva intrínseca del intercambio denso entre expertos; las respuestas libres mencionan la «rigidez del habla» en el TT y la «forma poco natural de hablar» en el SS. Ambos estudios de TTS confunden el formato con el contenido y un orden de visualización fijo, de modo que sus tamaños de efecto son preliminares.
Compañeros centrados en la voz y socios de diálogo hablado
¿Qué cambia cuando el interlocutor es una máquina? Scheinberg et al. (2026) hicieron que 78 estudiantes universitarios de alemán de cuatro sedes completaran una tarea contrapesada de encontrar las diferencias tanto con un par humano como con un socio de IA en tiempo real, y después analizaron transcripciones diarizadas de ASR. El diálogo humano fue más rápido y mejor equilibrado, con muchos turnos cortos, mientras que la condición con IA parecía un monólogo apoyado: menos turnos y más largos, una cuota menor del uso de la palabra por parte de quien aprende y mayor fluidez dentro del turno. La entrada verbosa y sintácticamente regular de la IA se asoció con una mayor incorporación a corto plazo y un cebado sintáctico más fuerte tras controlar el volumen de entrada, y la satisfacción siguió la fluidez de producción de quien aprende y no cuánto incorporó.
El diseño centrado en la voz se convierte en necesidad y no en comodidad cuando quien aprende no puede usar una pantalla. Kutti AI (Fadurudeen 2026) invierte el supuesto visual de la tecnología educativa para llegar a un estimado de 1,4 millones de niños ciegos en todo el mundo: los niños escuchan contenidos de currículo, responden en voz alta y reciben retroalimentación hablada sin dependencia visual alguna. Tres decisiones sostienen el diseño: un motor ligero de detección de dificultades que fusiona la latencia de respuesta, el número de intentos fallidos y señales de vacilación por palabras clave para decidir cuándo dar una pista o simplificar; un flujo de coincidencia de respuestas entre lenguas para que la alternancia de código y la variación de pronunciación no se penalicen; y una vía de ASR sin conexión en el dispositivo que elimina el requisito de conectividad. Es una contribución de sistemas sin evaluación de resultados de aprendizaje, de modo que sus afirmaciones pedagógicas siguen siendo hipótesis.
El acento, por su parte, es una variable de diseño con consecuencias sociales. Ravi et al. (2026) hicieron que 33 docentes interactuaran con un agente de voz de IA generativa en condiciones de acento británico, indio y afroamericano en el aprendizaje grupal de K-12. El agente con acento británico se trató en gran medida como una herramienta y se abordó de formas distantes y basadas en la utilidad, mientras que los agentes con acento indio y afroamericano se antropomorfizaron más fácilmente y se integraron como pares, con más confianza y dependencia a lo largo del tiempo. Los turnos de palabra, los patrones de preguntas y la presencia social percibida cambiaron todos con el acento: la voz que hace fácil tratar a un agente como un recurso neutral puede hacer más fácil ignorarlo como colaborador.
Un uso más intenso de una herramienta de apoyo hablado no es automáticamente mejor. Kuang, Li y Weng (2026) hicieron que 22 aprendices de interpretación completaran tareas bidireccionales de interpretación consecutiva asistida por ordenador en sistemas construidos sobre ASR y traducción automática, capturando movimientos oculares, notas a mano y salida de voz. Surgieron cuatro perfiles de interacción —implicados intensivos, escáneres rápidos, tradicionalistas y conmutadores frecuentes— y el 58,3 % de las observaciones a nivel de etapa cambió de perfil entre la comprensión de la fuente y la producción del texto meta. Solo los patrones de la etapa de comprensión predijeron la calidad del producto, y el grupo con más uso de IA obtuvo las puntuaciones más bajas en fluidez de la entrega (5,46 frente a 6,17–6,46) y en calidad de la lengua meta (5,70 frente a 6,35–6,67). La atención dedicada a leer una transcripción de IA es atención que no se dedica a construir la propia representación; los autores recomiendan enseñar a quien aprende a reflexionar sobre su propia estrategia en lugar de prescribir una, ya que el patrón es invisible a menos que se haga aflorar.
Un experimento de campo aleatorizado y prerregistrado pone a prueba el canal hablado frente al texto escrito dentro del mismo tutor, y encuentra que el aprendizaje está en la tutoría y no en la voz. Yang, Van Alstyne y Dellarocas (2026) asignaron aleatoriamente a 86 estudiantes de un módulo de finanzas corporativas de un MBA en línea entre un tutor estructurado anclado en los materiales del curso y un grupo de retención, y después alternaron semanalmente el canal de cada estudiante tutorizado entre voz y texto, de modo que la comparación se identifica dentro de cada estudiante: el dominio semanal difirió en −0,01 puntos sobre 11 (p = 0,98), y dos pruebas unilaterales rechazaron cualquier diferencia verdadera mayor que ±0,3 DE. La voz transformó el proceso: 1,34 turnos de diálogo por minuto frente a 0,75 en las semanas de texto, y 11,3 preguntas frente a 4,6, mientras que la pausa de pensamiento se desplomó (mediana de la brecha de respuesta del tutor al estudiante de 27 segundos con voz frente a 54 con texto, donde los turnos escritos dedicaban 25,9 segundos antes de la primera pulsación más 13,9 segundos de composición) y el canal hablado costó 2,8 veces más de servir, a $0,22 por minuto de voz frente a $0,0165 por mensaje de texto ($413,46 con voz y $149,13 con texto a lo largo de cinco semanas para 52 plazas). Con esta evidencia, la voz es una palanca de adopción y de implicación, no de codificación, que es exactamente el compromiso que cualquier institución que añada un canal hablado tiene que poner precio.
La IA en la evaluación oral y hablada
La evaluación oral siempre ha sido pedagógicamente sólida y logísticamente cara, y la tecnología del habla ataca ahora el lado del coste. Pentland, Lowenthal y Krier (2026) describen las evaluaciones orales asíncronas (AOA): consignas entregadas justo a tiempo, respuestas breves con límite de tiempo por webcam que no se pueden revisar y calificación con rúbricas integradas y transcripciones generadas automáticamente. En dos cursos impartidos por un único docente sin restricciones de programación, el estudiantado obtuvo puntuaciones más altas en las AOA que en exámenes presenciales de opción múltiple, de forma significativa en el Estudio 2 (mediana del parcial 92,5 frente a 70, p < 0,001; final 94,2 frente a 86,4, p = 0,002) y direccionalmente en el Estudio 1, con correlaciones moderadas entre formatos (τ = 0,44; τ = 0,25, no significativa). El estudiantado pasó a una preparación más activa, el 90,91 % vio el formato más cercano a la comunicación laboral que los exámenes escritos y el 81,82 % declaró implicarse más activamente con el contenido. Los autores advierten con cuidado de que se trata de diferencias de puntuación entre formatos y no de evidencia de ganancias de aprendizaje, y de que la ventaja de integridad se infiere y no se mide; una comprobación de repuntuación con un LLM encontró puntuaciones del docente sistemáticamente más altas con una concordancia de moderada a buena (CCI 0,73 y 0,60), ofrecida como comprobación de fiabilidad y no como respaldo de la calificación automatizada.
Fenton (2025) aporta la justificación en forma de revisión: como los orales son en tiempo real e interactivos, el estudiantado no puede generar respuestas de antemano y memorizarlas, y el formato sondea el razonamiento en niveles superiores de la taxonomía de Bloom y no el recuerdo. Sus beneficios —personalización, autenticidad, preparación laboral, conocimiento más profundo— vienen con costes nombrados: programación y logística, ansiedad de quien aprende y riesgo de sesgo en torno al género, la etnia, la lengua, la velocidad de respuesta y la calificación no anónima, aunque la evidencia sugiere que los orales pueden ser tan inclusivos como los exámenes escritos para parte del estudiantado, incluidas las personas con dislexia.
Dos despliegues muestran qué añade la tecnología. AkoVoice (Adams 2026) evaluó a 33 estudiantes de cuatro clases de Automoción de Nivel 3 y una clase de Ingeniería de Nivel 3 en Nueva Zelanda, en teléfonos propiedad de quien aprende frente a un único portátil de gama media que ejecutaba modelos de pesos abiertos —Mistral 7B vía Ollama, faster-whisper para voz a texto, Chatterbox para TTS— con hasta 12 estudiantes evaluados simultáneamente y sin conexión a internet en ningún momento. La IA se planteó como quien saca a la luz la evidencia y no como juez, dejando intacto el juicio del evaluador. La reacción del estudiantado fue positiva: 21 de 33 (64 %) consideraron realista la tarea, y ninguno de los 33 estuvo en desacuerdo con que hablar en tiempo real se sintiera adecuado en comparación con un portafolio escrito. Los datos de desempeño son más interesantes. El número de palabras para preguntas idénticas varió entre cinco y ocho veces entre estudiantes de cada cohorte (93–523, 92–796, 309–811), pero la verbosidad no predijo la exactitud en las preguntas cerradas; nueve estudiantes respondieron en 2 a 13 palabras y a todos se les marcó correcto, la más corta «3500 kgs», mientras que la más completa «la carga de trabajo segura es de tres toneladas» fue señalada contra una guía de corrección de 3,5 toneladas. Ensayos adyacentes de Horticultura (14 estudiantes) y Lácteos (11 estudiantes) encontraron una coincidencia del 95 % entre la calificación preliminar del agente y la calificación del tutor humano. En el lado de los ítems, Aryadoust y Wong (2026) compararon la ingeniería de prompts iterativa con el ajuste fino para ítems de comprensión auditiva en L2, produciendo 40 pruebas y 240 ítems de opción múltiple: el refinamiento de prompts mejoró la calidad pero se estancó, mientras que el ajuste fino de GPT-4.1 sobre el prompt optimizado con el diseño de prompts constante mejoró aún más la generación. La evaluación hablada también corre el riesgo de medir lo que no debe: Morphew et al. (2026) registran los gestos junto con el habla transcrita y sostienen que evaluar solo el habla omite la evidencia corporal de la comprensión, de modo que la fluidez puede confundirse con el conocimiento conceptual.
Accesibilidad y equidad en el canal hablado
El historial de accesibilidad de la tecnología del habla es mixto: el mismo canal que elimina una barrera puede instalar otra. El estudiantado sordo y con discapacidad auditiva es el desajuste más claro. Chen et al. (2026) diseñaron un sistema de generación de preguntas con LLM para estudiantes sordos y con discapacidad auditiva que ven vídeo, apoyándose en la Teoría de la Privación Lingüística para explicar por qué las consignas basadas en texto encajan mal con primeras lenguas de base signada. Añadió Preguntas Visuales (marcas de tiempo donde es probable que la información visual se lea mal —movimiento rápido, subtítulos desalineados, texto denso en pantalla) y Preguntas Emocionales (marcas de tiempo donde estudiantes sordos y con discapacidad auditiva anteriores informaron de frustración o confusión), y refinó con estudiantes y docentes un banco final de 30 preguntas. Con 16 usuarios, el prototipo mejoró la autoeficacia (M = 5,70, DE = 1,12 en una escala de 7 puntos), y los participantes sordos seleccionaron preguntas visuales más a menudo que los participantes con discapacidad auditiva, que informaron de que leían los subtítulos lo bastante rápido como para no necesitarlas. Aquí la accesibilidad tuvo que construirse dentro de la generación y no añadirse después.
AkoVoice añade dos consideraciones de equidad que rara vez aparecen juntas. Primero, los datos: las grabaciones se cifraron en reposo, se alojaron localmente y se eliminaron a los 90 días, y los autores tratan la voz de un participante como una expresión personal y cultural y no como un recurso para entrenar modelos o construir perfiles biométricos, una postura que importa porque la Ley de IA de la UE clasifica como de alto riesgo la IA usada para evaluar resultados de aprendizaje en la formación profesional. Segundo, el acento y el registro: la precisión de voz a texto no se probó del todo entre acentos de quien aprende, y criterios de rúbrica como «atractivo» se señalaron como culturalmente específicos y potencialmente penalizadores para hablantes de segundas lenguas, lo que motivó un campo de notas de revisión. Junto a los hallazgos sobre el acento en el trabajo en grupo de K-12 y al supuesto visual casi total de la tecnología educativa dominante, el patrón es que la interfaz de voz elimina las barreras de la vista, la velocidad de lectura y la conectividad, mientras deja abiertas las del acento, la precisión del reconocimiento, el coste del hardware y el registro cultural.
Comprobación de alcance. Esta página trata del canal hablado y de la tecnología que lo soporta. Para la pedagogía de segundas lenguas en general —desarrollo de la escritura, corrección gramatical, motivación, práctica docente— vaya a Aprendizaje de lenguas, que abarca la instrucción en L2 con IA y trata el habla como una línea entre varias. Para los chatbots de texto y el diseño de diálogo independientemente de la modalidad, vaya a IA conversacional; varios artículos de aquí tratan sobre diálogo, pero su pregunta es sobre el habla y no sobre cómo hacer prompts a un modelo de chat. Para lectores de pantalla, subtitulado, gráficos táctiles y herramientas de apoyo que no son principalmente de voz, vaya a Tecnología de asistencia, que se sitúa bajo las líneas más amplias de accesibilidad y aprendizaje inclusivo de esta wiki.
Lo que sigue siendo incierto
Casi todas las afirmaciones sólidas de aquí se apoyan en un único estudio corto. Los dos estudios de lecciones con TTS se realizaron en sendos institutos japoneses con un orden de presentación fijo que confundía el formato con el contenido, y sus medidas de resultados de aprendizaje fueron autoinformadas en escalas internas. El modelo de retroalimentación con ASR provino de una única universidad china y fue transversal, de modo que su hallazgo sobre la moderación por competencia describe covarianza y no causalidad. El estudio sobre la disposición a comunicarse midió percepciones de la retroalimentación, no su calidad. El estudio de perfiles de interpretación es un análisis exploratorio con 22 participantes en el que los efectos de la etapa de producción no alcanzaron significación. Los despliegues de AOA y AkoVoice son de una sola institución, y AkoVoice no informa de evidencia de aprendizaje sumativa porque sus evaluaciones de voz se ejecutaron en paralelo a las evaluaciones reales. Kutti AI es una contribución de sistemas sin evaluación de resultados alguna. Lo que la colección sí respalda es un conjunto de afirmaciones de diseño: la calidad de la retroalimentación supera al volumen de práctica en el uso del ASR, la narración en diálogo puede ayudar a la comprensión a costa de la naturalidad, el formato debería ajustarse a las características de quien aprende en lugar de fijarse, la IA debería sacar a la luz la evidencia en lugar de sustituir al evaluador humano, y hablar en tiempo real mide algo que la escritura no mide, incluida una exactitud sorprendentemente indiferente a cuántas palabras usa quien aprende. Que algo de esto se sostenga en otro sitio, otra lengua u otro año no está probado.
Conceptos conectados
- Aprendizaje de lenguas
- IA conversacional
- Accesibilidad
- Tecnología de asistencia
- Evaluación
- Evaluación auténtica
- IA con intervención humana (HITL)
- IA multimodal
- Aprendizaje inclusivo
- Equidad
Artículos conectados
- ASR Technology in College English Speaking Instruction: The Role of Feedback Internalization and Metacognitive Strategies — Retroalimentación oral con ASR: la calidad supera a la cantidad y la competencia modera quién se beneficia (Chen et al. 2026)
- Associations Between Generative AI–Based Pronunciation Feedback and Willingness to Communicate in English: The Mediating Role of English Pronunciation Self-Efficacy — La autoeficacia de pronunciación media entre la retroalimentación de pronunciación con IA generativa y la disposición a comunicarse (1.701 estudiantes de inglés como lengua extranjera)
- A Semi-Automated System for Generating Dialogue-Based TTS Lessons Using Large Language Models: An Exploratory Study of Educational Potential — Flujo de lecciones con LLM + TTS: la narración sintética igualó la voz del docente; el diálogo ayudó a la comprensión
- Interaction Effects Between Learner Characteristics and Dialogue Format in TTS Dialogue-Based Lessons — Interacciones entre estilo de aprendizaje y formato de diálogo en lecciones generadas con TTS (222 estudiantes)
- What Changes When the Interlocutor Is an AI? Interactional Fluency and Linguistic Uptake in L2 Spoken Dialogue — Interlocutores humanos frente a interlocutores de IA: monólogo apoyado, incorporación y cebado sintáctico en alemán como L2
- Kutti AI: A Voice-First, Offline-Capable Learning Companion with Real-Time Struggle Detection for Visually-Impaired Children — Compañero sin conexión centrado en la voz con detección de dificultades en tiempo real para niños con discapacidad visual
- Exploring How Agent Voice Accents Shape Human-AI Collaboration in K-12 Group Learning — El acento del agente da forma a la antropomorfización y a la colaboración en el trabajo en grupo de K-12 (33 docentes)
- Asynchronous Oral Assessments: Enhancing Integrity, Engagement, and Communication in the AI Era — Evaluaciones orales asíncronas: evaluación hablada escalable, con una advertencia sobre las ganancias de aprendizaje
- Reconsidering the Use of Oral Exams and Assessments: An Old Way to Move Into a New Future — Revisión que defiende los exámenes orales como evaluación auténtica y protectora de la integridad
- Designing AI-Supported Oral Assessment in TVET — AkoVoice: evaluación de voz sin conexión en talleres de formación profesional donde la IA saca a la luz la evidencia y no califica
- Student-AI Interaction in Computer-Assisted Consecutive Interpreting: Patterns and Performance — Cuatro perfiles de interacción entre aprendices de interpretación que usan apoyo de ASR y traducción automática
- How to Train Your Dragon: Evaluating Prompting and Fine-Tuning for GPT-Based Item Generation in L2 Listening Assessment — Prompts frente a ajuste fino de GPT para la generación de ítems de comprensión auditiva en L2
- A Multimodal Framework for Embodied Cognition in Oral Explanations — Gesto más habla: por qué la evaluación oral solo con habla omite evidencia de comprensión
- AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques — Velocidad de audio adaptativa, resúmenes de vídeo que preservan la voz y retroalimentación de pronunciación sin etiquetas
- Exploring the Design of LLM-Powered Question Generation for Deaf and Hard of Hearing Learners — Generación de preguntas con LLM para estudiantes sordos y con discapacidad auditiva
- When AI Tutors Speak: Evidence from a Randomized Field Experiment — Cuando los tutores de IA hablan: evidencia de un experimento de campo aleatorizado
- AI-Mediated Input Transformation in Medical English: Speech Recognition and Transcript Reliability — Transformación de la entrada mediada por IA en inglés médico: reconocimiento del habla y fiabilidad de las transcripciones