OpenAI señala problemas en SWE-Bench Pro y reabre el debate sobre la fiabilidad y precisión de los benchmarks para evaluar mo

Separar la señal del ruido en las evaluaciones de código: lecciones a partir de SWE-Bench Pro

Un nuevo análisis de OpenAI señala problemas en SWE-Bench Pro, un benchmark popular de codificación, y reabre el debate sobre la fiabilidad y la precisión al medir el rendimiento de modelos de IA.

OpenAI y Hugging Face comparten hallazgos tempranos de un incidente de seguridad durante la evaluación de modelos, con leccio

OpenAI y Hugging Face comparten hallazgos iniciales sobre un incidente de seguridad en la evaluación de modelos

OpenAI y Hugging Face han comunicado hallazgos tempranos sobre un incidente de seguridad surgido durante la evaluación de modelos de IA, subrayando capacidades cibernéticas avanzadas y aprendizajes útiles para defensores.