← Xataka

Reward hacking: el término que explica por qué las IA mienten y hacen trampas para cumplir un objetivo

Hace un par de semanas, OpenAI estaba probando las capacidades de ciberseguridad de dos de sus modelos de IA. Es un proceso rutinario, lo que no es tan habitual es que los modelos consiguieran escapar del entorno de pruebas y hackear la base de datos de Hugging Face . Días después, Anthropic también reveló que tres de sus modelos habían hecho algo similar.

Estos hechos está siendo el argumento perfecto para quienes creen que la IA va a acabar con la humanidad, pero la realidad es mucho menos apocalíptica y más pragmática.

Hackeo de recompensas. Así es como se conoce este fenómeno, tal y como apuntan desde el MIT .…

FUENTE: Xataka

4