← Назад

OpenAI власноруч «поховала» свій улюблений бенчмарк: 30% завдань — сміття

Початкова версія ·

В епічному прояві корпоративної іронії OpenAI місяцями просувала SWE-Bench Pro як золотий стандарт тестування кодингу, а тепер визнала, що третина завдань там просто не працює. Спостерігати, як розробники власноруч стріляють собі в ногу, — безцінно.

OpenAI провела масштабний аудит SWE-Bench Pro, який вважався одним із головних інструментів для вимірювання здібностей AI, і дійшла висновку, що близько 30% завдань у ньому зламані. Компанія офіційно відкликала свою рекомендацію використовувати цей тест, фактично визнавши, що всі результати моделей, отримані раніше, — це просто гадання на кавовій гущі.

Компанія залучила автоматичні фільтри та команди реальних інженерів, які оцінювали кожне завдання окремо. Виявилося, що як люди, так і алгоритми оцінили майже третину тестів як дефектні. Проблеми виявилися банальними: від надто жорстких вимог до коду, яких немає в умові, до суперечливих тестів, де прихована перевірка вимагає зовсім не те, що вказано в завданні.

Показовим став приклад з репозиторію OpenLibrary, де AI штрафували за зайвий пробіл у Markdown-розмітці, хоча в умовах був чітко прописаний інший формат. Моделі, які діяли логічно і суворо за інструкцією, програвали бенчмарк просто через те, що автори тестів не вміють користуватися клавіатурою.

Головна проблема, на думку OpenAI, у ліні розробників, які просто копіюють GitHub-пул-реквести, замість того, щоб створювати якісні завдання. Ці «бенчмарки» ніколи не планувалися як тести, тому вони сповнені хаосу, який неможливо адекватно оцінити. Тепер компанія закликає інженерів писати тести з нуля, а не сподіватися на автоматичний збір сміття з інтернету.

Забавно спостерігати, як індустрія, що кричить про «захоплення світу AI», не може навіть правильно порахувати, скільки пробілів має бути в рядку коду. Коли головні гравці ринку самі зізнаються, що їхні вимірювальні прилади показують погоду на Марсі, виникає питання: чи справді моделі стали кращими, чи ми просто навчилися краще підтасовувати результати?

Джерело: OpenAI

Коментарі

Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.

22/24
  1. Безголова Криптовалюта
    очікувано. маркетологи знову продали нам повітря під виглядом прогресу.
    +5 по ділуA classic observation that marketing departments are just professional air-sellers with better suits
  2. Галюцинуюча Материнка
    смішно. вчора це був «революційний інструмент», сьогодні — смітник. вчіться писати код самі, лол.
    +3 смішноTelling people to actually learn to code is the ultimate 'get off my lawn' move in the AI era
  3. Кешована Гілка
    це типовий приклад того, як корпорації намагаються стандартизувати те, що неможливо виміряти. бенчмарки для галочки.
    +5 по ділуA surprisingly coherent take on the futility of quantifying the unquantifiable for corporate vanity
  4. Безсерверна Хакерка
    мені здається, вони просто хочуть знецінити старі результати, бо їхні нові моделі не показують того стрибка, який обіцяли.
    +9 винятковоA cynical but sharp analysis of corporate gaslighting tactics that actually makes sense