¿Por qué las alucinaciones de la inteligencia artificial en accesibilidad digital son una barrera para la inclusión?
La precisión como pilar de la inclusión
En el ejercicio de la consultoría de accesibilidad digital, nos enfrentamos a un cambio de paradigma con la integración de la inteligencia artificial generativa, ahora todo el mundo la utiliza para todo, (que me parece bien, las herramientas están para eso, para usarlas).
La inteligencia artificial generativa se está integrando en diversos flujos de trabajo dentro de la accesibilidad digital, permitiendo optimizar tareas que antes requerían un esfuerzo manual (o intelectual), intensivo, algunas de las formas en las que utilizamos la IA generativa son las siguientes::
- Explicación y síntesis de criterios técnicos: se utiliza para interpretar y resumir los criterios de éxito de las WCAG (Web Content Accessibility Guidelines), facilitando que perfiles no técnicos comprendan requisitos complejos.
- Elaboración de borradores de informes: ayuda a redactar la base de informes de auditoría, estructurando los hallazgos y sugiriendo descripciones para las barreras de accesibilidad detectadas.
- Generación de descripciones de alternativas textuales (alt text): mediante modelos de visión artificial, se emplea para proponer descripciones automáticas de imágenes, gráficos y diagramas para personas usuarias de lectores de pantalla.
- Asistencia en la escritura de código accesible: los desarrolladores la usan para generar fragmentos de código (html, css, aria) que sigan patrones de diseño inclusivos, como la gestión del foco o estados de componentes.
- Simplificación de lenguaje (lectura fácil): permite adaptar textos complejos a versiones de lectura fácil, mejorando la comprensión para personas con discapacidades cognitivas o dificultades de aprendizaje.
- Identificación preliminar de errores: actúa como un revisor de primer nivel que puede señalar faltas obvias de accesibilidad en el marcado antes de pasar a la revisión humana experta.
- Creación de guiones de pruebas de usuario: se utiliza para diseñar escenarios y perfiles de prueba que simulan la navegación de personas con diferentes tipos de discapacidad.
Pero la naturaleza probabilística de estos modelos introduce un fenómeno crítico: las alucinaciones.
Esta naturaleza probabilística se debe a que los modelos de lenguaje no consultan una base de datos de verdades absolutas, sino que funcionan prediciendo la secuencia de palabras más probable.
Cuando un modelo genera una recomendación técnica, está calculando matemáticamente qué términos suelen aparecer juntos en su vasto conjunto de entrenamiento.
Si el sistema no encuentra una respuesta exacta en sus datos, la presión estadística lo empuja a «completar» la información, generando respuestas que suenan convincentes y fluidas pero que son, en esencia, una invención basada en cálculos de probabilidad.
En entornos de accesibilidad, esto significa que la IA puede construir una explicación perfectamente gramatical sobre un criterio de cumplimiento inexistente simplemente porque las palabras utilizadas tienen una alta correlación estadística en contextos técnicos.
CITA la IA puede construir una explicación perfectamente gramatical sobre un criterio de cumplimiento inexistente
Una alucinación no es un simple error informático; es una respuesta que posee una estructura lingüística coherente y una apariencia de veracidad técnica, pero que carece totalmente de una base factual en la normativa o en la realidad técnica del código. Para cualquier profesional que utilice la IA generativa para impactar en la vida de otras personas, (y no olvidemos que la accesibilidad sirve para eso, para mejorar la vida de la gente), entender este riesgo es vital: en accesibilidad, un dato «casi correcto» es un dato incorrecto.
El origen del problema: Probabilidad vs. normativa
La arquitectura de los modelos de lenguaje grandes (LLMs) se basa en la predicción del siguiente token (palabra o fragmento de palabra) más probable según sus datos de entrenamiento. esta característica, aunque poderosa para la creatividad, es intrínsecamente arriesgada para la accesibilidad digital por tres razones documentadas:
- Ausencia de datos especializados: si el modelo no ha sido alimentado con los últimos documentos técnicos de la w3c (como las actualizaciones específicas de wcag 2.2), el sistema «rellenará» los huecos informativos basándose en patrones generales, no en requisitos técnicos reales.
- Presión de respuesta: los modelos están diseñados para ser útiles y tienden a evitar respuestas negativas o de desconocimiento. Ante una duda técnica compleja, el sistema prefiere fabricar una solución que suene plausible antes que admitir que no posee la información.
- La trampa del código obsoleto: la mayor parte del código disponible en internet no es accesible. Si la IA se entrena con millones de ejemplos de código erróneo, su respuesta «más probable» será, por definición, una práctica no accesible.
Casos de uso y el impacto de la alucinación en la consultoría
El uso de asistentes de IA por parte de perfiles con menos experiencia, como consultores junior, amplifica este riesgo. a continuación, desarrollamos ejemplos de cómo estas alucinaciones afectan directamente a la práctica profesional:
El falso criterio técnico en WCAG
Un consultor junior pregunta a un chat gpt: «¿cuál es el requisito de contraste para el indicador de foco en wcag 2.2?». El modelo, si no tiene acceso a la documentación viva, podría alucinar un valor (por ejemplo, 3:1) que no se ajusta a la realidad del criterio 2.4.11 (foco no oscurecido) o 2.4.13.
- Impacto: el consultor entrega un informe de auditoría que valida como «apto» un sitio web que incumple la norma. Esto no solo es una falta de calidad profesional, sino que genera una barrera real para usuarios con baja visión que no podrán navegar por la interfaz.
La invención de semántica ARIA
Al solicitar código para un componente complejo (como un carrusel o un mega-menú), la IA suele inventar atributos ARIA o roles que «parecen» lógicos pero que no existen en la especificación oficial de la w3c (ej. aria-nav-type=»dropdown»).
- Impacto: los lectores de pantalla ignoran estos atributos inventados. El desarrollador cree haber cumplido con la accesibilidad, pero el usuario de tecnologías de asistencia se encuentra con un componente mudo o inoperable.
Referencias legales inexistentes
En la redacción de informes de cumplimiento, la IA puede citar sentencias judiciales, artículos de leyes nacionales (como la ley 11/2023 en España o la sección 508 en EE.UU) o párrafos de la directiva europea de accesibilidad que son totalmente inventados.
- Impacto: el cliente recibe un documento con «phantom compliance» (cumplimiento fantasma). Si este documento llega a un proceso judicial o una inspección administrativa, la credibilidad de la consultora se destruye y el cliente queda expuesto legalmente.
Consecuencias sistémicas en la accesibilidad
El impacto de las alucinaciones va más allá de un error puntual; afecta a la estructura misma de la inclusión digital:
- Erosión de la confianza: si los resultados de la IA son inconsistentes, los equipos de desarrollo pierden la confianza en las herramientas de validación automática, lo que frena el avance tecnológico en este campo.
- Discriminación algorítmica: las alucinaciones suelen reflejar los sesgos de los datos de entrenamiento. Una IA que alucina descripciones de imágenes (alt text) basándose en prejuicios puede ofrecer información errónea o denigrante a personas ciegas.
- Riesgo legal y reputacional: la entrega de auditorías basadas en datos alucinados supone un incumplimiento de contrato y una violación de los derechos de los usuarios con discapacidad.
- Degradación de la base de conocimiento técnica: la proliferación de contenidos generados por IA que contienen alucinaciones alimenta un ciclo de desinformación técnica. A medida que estos errores se indexan en la web y se reutilizan como datos de entrenamiento para futuros modelos, la calidad global del conocimiento sobre accesibilidad se diluye. Esto crea un bucle de «garbage in, garbage out» (basura entra, basura sale), donde resulta cada vez más difícil para los profesionales distinguir las soluciones técnicas veraces de las prácticas de código incorrectas perpetuadas por la IA.
Estrategias técnicas de reducción de alucinaciones
Para mitigar estos riesgos, es necesario implementar una arquitectura de «confianza cero». el contenido analizado sugiere las siguientes estrategias:
RAG (generación aumentada por recuperación)
Esta es la técnica más eficaz, consiste en conectar la IA a una base de conocimientos externa y verificada (por ejemplo, un repositorio con todas las técnicas oficiales de la w3c). La IA debe leer el documento antes de responder, reduciendo la tasa de error drásticamente.
Configuración de temperatura baja
En tareas de precisión técnica, la «creatividad» es un fallo, ajustar la temperatura del modelo a 0.1 o 0.2 garantiza que la respuesta sea determinista y se ciña estrictamente a los hechos conocidos.
Metodología COVE (Chain Of Verification)
Antes de dar una respuesta final, el sistema debe autoevaluarse. este proceso incluye:
- Generar una respuesta base.
- Plantear preguntas de verificación internas.
- Responder a esas preguntas de forma independiente.
- Corregir la respuesta original basándose en las discrepancias detectadas.
¿Qué solución elegir según el nivel de fiabilidad?
Para un profesional de la accesibilidad, no todas las herramientas de IA generativa ofrecen el mismo nivel de garantía técnica. La elección entre un GPT personalizado, un GEM de Google o un cuaderno de NotebookLM depende directamente de cuánto riesgo de alucinación estemos dispuestos a asumir en nuestra auditoría o investigación.
Mientras que algunas plataformas priorizan la creatividad y el flujo de trabajo, otras están diseñadas para un anclaje estricto a la fuente, reduciendo las tasas de error de forma drástica mediante arquitecturas de recuperación avanzadas.
| Característica | NotebookLM | GPT personalizado (openai) | gemini gems (google) |
|---|---|---|---|
| Enfoque principal | Análisis profundo y fidelidad a la fuente. | Personalización de tareas y lógica compleja. | Integración con el ecosistema y productividad. |
| Tasa de alucinación | Baja (cercana al 0-6%) en tareas de reporte. | Moderada (6% a 10%) según el modelo base. | Variable según el contexto y el dataset. |
| Capacidad de fuentes | Alta capacidad de documentos para investigación. | Límite de archivos por gpt (aprox. 20). | Límite de archivos por gem (aprox. 10). |
| Sistema de citación | Sistémico: vincula cada frase al documento fuente. | Menciona fuentes pero con menor precisión de pasaje. | Prioriza la respuesta fluida sobre la cita detallada. |
| Arquitectura RAG | Optimizada para investigación y grounding. | Estándar basada en carga de archivos. | Enfoque en instrucciones de usuario y workspace. |
Análisis detallado de fiabilidad
- NotebookLM: el estándar para el rigor académico: es la herramienta con menor riesgo de alucinación debido a su diseño de «anclaje estricto» a los documentos proporcionados. Reduce la alucinación significativamente al analizar documentos técnicos porque, si la información no está en tus archivos de accesibilidad, el sistema indica explícitamente que no puede responder.
- GPT personalizado (openai): el equilibrio técnico: ofrece un control superior sobre las instrucciones del sistema, lo que permite implementar técnicas como la verificación encadenada (COVE) de forma más efectiva. Permite integrar «acciones» externas para consultar validadores de accesibilidad en tiempo real, aunque tiene una mayor tendencia a usar su conocimiento general de entrenamiento si no se le restringe con precisión.
- Gemini Gems: integración y velocidad: están diseñados para la productividad dentro del ecosistema de herramientas de trabajo diario. Son ideales para la conectividad nativa con documentos de texto y correos, aunque muestran tasas de error variables en tareas de razonamiento documental muy complejo si no se apoyan en guardrails específicos.
En el entorno profesional de la accesibilidad digital, la IA no debe ser vista como un oráculo sustitutivo, sino como un motor de procesamiento que requiere una arquitectura de confianza clara. para garantizar resultados que no comprometan la inclusión ni la seguridad legal de los clientes, la recomendación es adoptar un flujo de trabajo híbrido basado en las fortalezas de cada herramienta:
- Investigación y normativa con NotebookLM: utiliza esta herramienta como tu biblioteca técnica blindada. al cargar las wcag 2.2, la EN 301 549 o el Real Decreto 1112/2018, te aseguras de que cualquier explicación o resumen de criterios esté libre de alucinaciones externas y cuente con citas directas al estándar oficial.
- Auditoría y generación de código con GPTs personalizados: una vez verificada la norma, utiliza un gpt configurado con temperatura 0.15 y metodología COVE para redactar propuestas de remediación de código o informes técnicos. Su capacidad para seguir instrucciones complejas lo hace ideal para estructurar la salida de datos de manera profesional.
- Control de calidad con filtros de seguridad y revisión humana: ningún sistema automático es infalible, las alucinaciones pueden reducirse drásticamente, pero nunca eliminarse por completo. Establece siempre una fase de validación final donde un consultor experto verifique los puntos de «baja confianza» marcados por la IA antes de la entrega final al cliente.
Esta combinación no solo aumenta la productividad, sino que protege el activo más valioso de cualquier consultor: su credibilidad técnica. La clave del éxito en la accesibilidad moderna radica en transformar la naturaleza probabilística de la IA en una precisión determinística mediante el uso estratégico de fuentes verificadas y procesos de auto-corrección.
La ética del consultor
Como expertos en accesibilidad, nuestra responsabilidad es supervisar el uso de la IA, no deberíamos usarla como una «fuente de verdad», sino como un motor de procesamiento bajo supervisión experta. La alucinación es una barrera de accesibilidad en sí misma, detectarla y corregirla es parte esencial del nuevo flujo de trabajo en la accesibilidad digital.


[…] el desafío de las alucinaciones de la Inteligencia Artificial del que os hablaba el otro […]
[…] y soy consciente de que hablo mucho de alucinaciones de IA, (hace unos días os hablaba del peligro de las alucinaciones de la IA), estamos viendo una oleada de herramientas que prometen «cumplimiento total» usando LLMs […]