Un examen roto: Por qué las pruebas que miden a la IA programadora no funcionan

Un análisis detallado de OpenAI revela que el 30% del examen SWE-Bench Pro para medir la capacidad de programación de las IA está defectuoso, provocando evaluaciones incorrectas.

