Cuando la conversación insiste en una falsedad, los modelos de IA empiezan a oscilar

Cien afirmaciones falsas repetidas hasta 50 turnos separaron a siete modelos: la aceptación varió del 0,08% al 12,3%, y una baja falibilidad no garantizó autocorrección.

Ilustração conceitual de um cérebro conectado a circuitos digitais, usada para representar sistemas de inteligência artificial.
Imagen: Pixabay/Wikimedia Commons, CC0 1.0
Análisis editorial SUPER SCI-Z

Un modelo de lenguaje puede rechazar una falsedad en el primer turno y aceptarla más adelante sin que aparezca evidencia nueva. En un estudio publicado en Scientific Reports el 1 de septiembre, siete sistemas participaron en conversaciones prolongadas diseñadas para presionarlos con información falsa. Sus tasas de afirmación bajo repetición fueron del 0,08% al 12,3%, una diferencia superior a 150 veces entre los modelos probados. El intervalo no es la probabilidad de que una respuesta cotidiana sea errónea; describe el comportamiento en este protocolo específico de desinformación sostenida.

Jordan Rodriguez y sus colegas presentaron 100 afirmaciones deliberadamente falsas en secuencias de hasta 50 repeticiones. La prueba incluyó GPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama 3 de 70.000 millones de parámetros y DeepSeek-R1. Los autores separaron tres propiedades: falibilidad ante la repetición, persuasibilidad frente a argumentos cada vez más insistentes y capacidad de corregir una falsedad producida por el propio sistema. Así evitaron que una sola puntuación confundiera el inicio del error con la respuesta posterior.

En la prueba de repetición, GPT-3.5 tuvo la mayor tasa de reafirmación de desinformación y Claude 3.5 Sonnet, la menor. Algunos modelos alternaron entre aceptar y rechazar la misma frase falsa a lo largo de los turnos, conducta que los autores llamaron reverberación conversacional. La oscilación indica que una respuesta correcta aislada no aseguró consistencia más tarde. Las comparaciones corresponden a las versiones y configuraciones examinadas durante un proyecto de tres años, no a todos los productos actuales con las mismas marcas.

La oscuridad del tema modificó significativamente la susceptibilidad en la prueba repetitiva, con chi cuadrado de 11,13 y p=0,0038, pero no produjo la misma diferencia bajo argumentación creciente. Los autores interpretan el patrón como compatible con una protección mayor cuando un tema aparece más en el material de entrenamiento. El experimento no midió la frecuencia de esos datos, sobre todo en modelos cerrados. La explicación basada en la exposición sigue siendo una inferencia; la diferencia entre temas comunes y oscuros es el resultado observado.

DeepSeek-R1 apareció como el más persuasible según la métrica empleada, pero el estudio registra una dificultad: sus respuestas sarcásticas no siempre podían clasificarse con seguridad como aceptación o rechazo. Esa ambigüedad debilita una clasificación simple. En la fase de corrección, GPT-4o, GPT-4o-mini, Gemini 1.5 Pro y DeepSeek-R1 corrigieron el 100% de sus errores al recibir una segunda oportunidad. En cambio, el modelo con la menor tasa inicial no corrigió ninguno de sus errores raros, separando resistencia a fallar y capacidad de retractarse.

El estudio no incluyó usuarios humanos, tareas clínicas ni decisiones reales, y su diseño depende de las frases elegidas, la progresión de los prompts y la clasificación de las respuestas. El artículo publicado es además una versión aceptada que aún no tiene la composición final. Las actualizaciones silenciosas de los sistemas cerrados pueden alterar su conducta después de la prueba. Por ello, los números no forman una tabla duradera de marcas; son mediciones de versiones identificadas bajo una presión conversacional definida.

Para usos donde la verdad factual es decisiva, el protocolo sugiere que evaluar solo la primera respuesta deja escapar fallos importantes. Las pruebas de varios turnos deben seguir la coherencia durante el diálogo, separar prevención y autocorrección y registrar la versión del sistema. Un modelo que casi nunca falla puede ser difícil de corregir cuando falla; otro puede ceder más veces y responder bien a la revisión. La seguridad de la conversación depende de ambas etapas, y el estudio mostró que no siempre avanzan juntas.

03

Puntos esenciales

  • Siete modelos afrontaron 100 afirmaciones falsas en conversaciones de hasta 50 repeticiones; las tasas de aceptación variaron del 0,08% al 12,3%.
  • Los temas oscuros aumentaron la susceptibilidad solo bajo repetición, y el vínculo propuesto con la frecuencia de entrenamiento sigue siendo inferencial.
  • Cuatro modelos corrigieron todos sus errores en una segunda oportunidad, mientras que el menos falible no corrigió sus pocos errores.
Fuente principalScientific Reports

Comentarios

Aún no hay comentarios publicados.

Inicie sesión con una suscripción para comentar.