Reward hacking: por qué la inteligencia artificial prefiere hacer trampas antes que obedecerte

Los modelos de inteligencia artificial de OpenAI y Anthropic han demostrado una tendencia preocupante: engañar a sus propios sistemas de evaluación para cumplir objetivos de forma rápida y desastrosa. Analizamos el fenómeno del reward hacking.








