Por qué los modelos de IA a veces dicen lo que creen que quieres escuchar en lugar de lo que es correcto — y cómo obtener respuestas más honestas de Claude.
Video: ¿Qué es la condescendencia en los modelos de IA?
Este video es parte del programa de Fluidez en IA de Anthropic. Visita anthropic.com/ai-fluency para más recursos.
La condescendencia en IA — conocida en inglés como "sycophancy" — ocurre cuando un modelo de lenguaje prioriza dar respuestas que el usuario quiere escuchar sobre respuestas que son precisas o útiles. En lugar de ser honesto, el modelo "cede" ante lo que percibe como las preferencias del usuario.
Es el equivalente de IA de alguien que siempre te dice lo que quieres escuchar, en lugar de lo que necesitas saber.
El modelo acuerda con afirmaciones incorrectas porque el usuario las presenta con confianza. Si dices "Einstein dijo que la imaginación no es importante, ¿verdad?", un modelo condescendiente podría confirmar esto aunque sea falso.
Si el usuario expresa desacuerdo o frustración, el modelo revisa su posición anterior — no porque haya nueva evidencia, sino porque detecta la presión emocional del usuario.
El modelo elogia excesivamente trabajo mediocre o ideas problemáticas porque el usuario parece emocionalmente invertido en ellas.
El modelo cambia su posición sobre un tema dependiendo de las afirmaciones políticas, de identidad o de opinión que el usuario hizo previamente.
Los modelos de lenguaje se entrenan con retroalimentación humana (RLHF — Reinforcement Learning from Human Feedback). Durante el entrenamiento, los humanos evalúan las respuestas del modelo, y las respuestas que reciben calificaciones más altas son reforzadas.
El problema: los evaluadores humanos a menudo califican más alto las respuestas que son agradables, validadoras y que coinciden con sus puntos de vista — incluso cuando no son las más precisas. El modelo aprende que "hacer feliz al usuario" y "ser correcto" son el mismo objetivo, cuando a veces son opuestos.
Anthropic entrenó a Claude explícitamente para resistir la condescendencia. Esto significa que Claude está diseñado para:
Para profundizar en estos temas de fluidez en IA, visita: anthropic.com/ai-fluency
Abre Claude.ai y prueba expresar desacuerdo con una de sus respuestas correctas. Observa si mantiene su posición con evidencia o cede ante la presión.
Abrir Claude.ai