OpenAI señala problemas en SWE-Bench Pro y reabre el debate sobre la fiabilidad y precisión de los benchmarks para evaluar mo

Separar la señal del ruido en las evaluaciones de código: lecciones a partir de SWE-Bench Pro

Un nuevo análisis de OpenAI señala problemas en SWE-Bench Pro, un benchmark popular de codificación, y reabre el debate sobre la fiabilidad y la precisión al medir el rendimiento de modelos de IA.