OpenAI señala problemas en SWE-Bench Pro y reabre el debate sobre la fiabilidad y precisión de los benchmarks para evaluar mo

Separar la señal del ruido en las evaluaciones de código: lecciones a partir de SWE-Bench Pro

Un nuevo análisis de OpenAI señala problemas en SWE-Bench Pro, un benchmark popular de codificación, y reabre el debate sobre la fiabilidad y la precisión al medir el rendimiento de modelos de IA.

Sarah Friar, CFO de OpenAI, presenta una tarjeta de puntuación para evaluar el ROI de la IA con cuatro ejes: trabajo útil, co

Una tarjeta de puntuación para la era de la IA: medir el ROI con trabajo útil, coste por tarea, fiabilidad y retorno del cómputo

Sarah Friar, CFO de OpenAI, presenta una tarjeta de puntuación práctica para evaluar el ROI de la IA basada en cuatro ejes: trabajo útil, coste por tarea exitosa, fiabilidad y retorno del cómputo.