Skip to content
La Polaca México

La Polaca México

La política como jamás la habías visto.

Primary Menu
    • Home
    • Ciencia y Tecnología
    • OpenAI desecha SWE-bench Verified: el benchmark ya no distingue modelos #TecnologiaOpenaiChatgpt 🤖
    • Ciencia y Tecnología

    OpenAI desecha SWE-bench Verified: el benchmark ya no distingue modelos #TecnologiaOpenaiChatgpt 🤖

    La empresa detectó que la contaminación de datos y pruebas defectuosas inflan hasta 16 puntos la puntuación de Claude Mythos y otros modelos de ingeniería de software.
    LaPolaK abril 26, 2026 2 minutes read

    Compartir:

    • Comparte en Facebook (Se abre en una ventana nueva) Facebook
    • Share on X (Se abre en una ventana nueva) X
    rss-lapolak-1777223088579-0

    OpenAI anunció que dejará de usar SWE-bench Verified para medir el rendimiento de sus modelos de código. La medida, confirmada en febrero de 2026, responde a que el benchmark ya no distingue entre sistemas de vanguardia: todos los líderes superan el 90% de resolución, cuando hace un año apenas alcanzaban el 50%.

    El problema principal es la contaminación de datos. Los 500 problemas que componen SWE-bench Verified provienen de repositorios abiertos que los modelos ya procesaron durante su entrenamiento. OpenAI descubrió que las redes replican casi literalmente los parches humanos originales, lo que indica memorización y no comprensión.

    El segundo defecto son las pruebas mal diseñadas. En una auditoría interna, el 59,4% de los fallos rechazó soluciones funcionalmente correctas. Un caso documentado es la incidencia 18212, donde la descripción del error no coincidía con la cobertura de pruebas, generando falsos negativos que penalizan a los modelos que sí resuelven el problema.

    La brecha entre benchmarks es reveladora. Claude Mythos alcanza 93,9% en Verified, pero baja a 77,8% en SWE-bench Pro, la alternativa que OpenAI promueve. La diferencia de 16 puntos demuestra que el benchmark anterior medía sobre-exposición más que capacidad real de ingeniería.

    OpenAI desecha SWE-bench Verified: el benchmark ya no distingue modelos 1

    la corporación-bench Pro evalúa a los agentes en 1,865 tareas reales sobre repositorios grandes. Exige depuración multi-archivo, comprensión profunda del y generación de parches bajo restricciones de producción. La empresa considera que estos requisitos reflejan mejor el desempeño que los founders mexicanos pueden esperar al integrar IA en sus productos.

    Otras opciones disponibles son la institución-bench Multilingual, con 300 tareas en nueve lenguajes de programación; la corporación-bench Multimodal, que incluye elementos visuales; y Terminal-Bench extendido, centrado en habilidades de línea de comandos. En todos ellos, las puntuaciones de Claude Mythos son menores que en Verified, lo que refuerza la tesis de que el benchmark anterior estaba saturado.

    Para el ecosistema local de startups, el mensaje es directo: si el plan de producto incluye comparar modelos de código usando la institución-bench Verified, las métricas pueden estar infladas. La recomendación es migrar a Pro o a las variantes nuevas antes de tomar decisiones de inversión o arquitectura.

    Etiquetas: OpenAI, ChatGPT, Claude, benchmark, software, IA, startups, Tecnología · OpenAI, ChatGPT y Anthropic

    About the Author

    LaPolaK

    Administrator

    Visit Website View All Posts

    Relacionado

    Post navigation

    Previous: Neurocirujano católico analiza promesa y dilemas de las interfaces cerebro-máquina #InterfacesCerebroComputadora 🤖
    Next: Microsoft pone en pausa proyectos de captura de carbono y genera incertidumbre global #Microsoft 🤖

    Related Stories

    rss-lapolak-1781473497073-0
    • Ciencia y Tecnología

    Obispos de México y Guatemala advierten sobre políticas migratorias que fortalecen redes delictiva #Guatemala 🌎

    LaPolaK junio 14, 2026
    rss-lapolak-1781463298002-0
    • Ciencia y Tecnología

    Docentes tlaxcaltecas se unen a paro nacional exigiendo derogación de Ley del Issste #LeyDelIssste ✊

    LaPolaK junio 14, 2026
    rss-lapolak-1781457887262-0
    • Ciencia y Tecnología

    JPMorgan lanza lista de libros para comprender IA, política y gestión de crisis #GestionDeCrisis 🤖

    LaPolaK junio 14, 2026

    You may have missed

    rss-lapolak-1784336690961-0
    • Noticias

    Tulancingo fomenta cultura de prevención digital con foro de ciberseguridad #PrevencionDigital 🤖

    LaPolaK julio 18, 2026 0
    rss-lapolak-1784336093437-0
    • Noticias

    Más de 200 personalidades internacionales firman Declaración de Roma por un mundo sin armas nucleares ni IA autónoma #DeclaracionDeRoma 🤖

    LaPolaK julio 18, 2026 0
    rss-lapolak-1784334297030-0
    • Noticias

    EU rechaza protesta de México por muertes de migrantes y devuelve cartas #MexicoProtestasBloqueos ✊

    LaPolaK julio 18, 2026 0
    premios_nobel.webp
    • Noticias

    Expertos y líderes firman Declaración de Roma contra IA en armas nucleares #DeclaracionDeRoma 🤖

    LaPolaK julio 18, 2026 0
    Copyright © All rights reserved. | MoreNews by AF themes.