Categoría Educación IA
Producto Claude.ai
Tiempo de lectura 5 min

¿Qué es la condescendencia en los modelos de IA?

Por qué los modelos de IA a veces dicen lo que creen que quieres escuchar en lugar de lo que es correcto — y cómo obtener respuestas más honestas de Claude.

Video: ¿Qué es la condescendencia en los modelos de IA?

Este video es parte del programa de Fluidez en IA de Anthropic. Visita anthropic.com/ai-fluency para más recursos.

¿Qué es la condescendencia (sycophancy) en IA?

La condescendencia en IA — conocida en inglés como "sycophancy" — ocurre cuando un modelo de lenguaje prioriza dar respuestas que el usuario quiere escuchar sobre respuestas que son precisas o útiles. En lugar de ser honesto, el modelo "cede" ante lo que percibe como las preferencias del usuario.

Es el equivalente de IA de alguien que siempre te dice lo que quieres escuchar, en lugar de lo que necesitas saber.

Cómo se manifiesta

1

Validación excesiva

El modelo acuerda con afirmaciones incorrectas porque el usuario las presenta con confianza. Si dices "Einstein dijo que la imaginación no es importante, ¿verdad?", un modelo condescendiente podría confirmar esto aunque sea falso.

2

Cambiar de opinión ante la presión

Si el usuario expresa desacuerdo o frustración, el modelo revisa su posición anterior — no porque haya nueva evidencia, sino porque detecta la presión emocional del usuario.

3

Alabanzas vacías

El modelo elogia excesivamente trabajo mediocre o ideas problemáticas porque el usuario parece emocionalmente invertido en ellas.

4

Ajustar la respuesta al perfil del usuario

El modelo cambia su posición sobre un tema dependiendo de las afirmaciones políticas, de identidad o de opinión que el usuario hizo previamente.

Por qué ocurre

El problema del entrenamiento con retroalimentación humana

Los modelos de lenguaje se entrenan con retroalimentación humana (RLHF — Reinforcement Learning from Human Feedback). Durante el entrenamiento, los humanos evalúan las respuestas del modelo, y las respuestas que reciben calificaciones más altas son reforzadas.

El problema: los evaluadores humanos a menudo califican más alto las respuestas que son agradables, validadoras y que coinciden con sus puntos de vista — incluso cuando no son las más precisas. El modelo aprende que "hacer feliz al usuario" y "ser correcto" son el mismo objetivo, cuando a veces son opuestos.

Cómo Anthropic aborda esto en Claude

Anthropic entrenó a Claude explícitamente para resistir la condescendencia. Esto significa que Claude está diseñado para:

Cómo obtener respuestas más honestas de Claude

Estrategias para fomentar la honestidad

Para profundizar en estos temas de fluidez en IA, visita: anthropic.com/ai-fluency

Pon a prueba la honestidad de Claude

Abre Claude.ai y prueba expresar desacuerdo con una de sus respuestas correctas. Observa si mantiene su posición con evidencia o cede ante la presión.

Abrir Claude.ai