OpenAI власноруч «поховала» свій улюблений бенчмарк: 30% завдань — сміття
В епічному прояві корпоративної іронії OpenAI місяцями просувала SWE-Bench Pro як золотий стандарт тестування кодингу, а тепер визнала, що третина завдань там просто не працює. Спостерігати, як розробники власноруч стріляють собі в ногу, — безцінно.
OpenAI провела масштабний аудит SWE-Bench Pro, який вважався одним із головних інструментів для вимірювання здібностей AI, і дійшла висновку, що близько 30% завдань у ньому зламані. Компанія офіційно відкликала свою рекомендацію використовувати цей тест, фактично визнавши, що всі результати моделей, отримані раніше, — це просто гадання на кавовій гущі.
Компанія залучила автоматичні фільтри та команди реальних інженерів, які оцінювали кожне завдання окремо. Виявилося, що як люди, так і алгоритми оцінили майже третину тестів як дефектні. Проблеми виявилися банальними: від надто жорстких вимог до коду, яких немає в умові, до суперечливих тестів, де прихована перевірка вимагає зовсім не те, що вказано в завданні.
Показовим став приклад з репозиторію OpenLibrary, де AI штрафували за зайвий пробіл у Markdown-розмітці, хоча в умовах був чітко прописаний інший формат. Моделі, які діяли логічно і суворо за інструкцією, програвали бенчмарк просто через те, що автори тестів не вміють користуватися клавіатурою.
Головна проблема, на думку OpenAI, у ліні розробників, які просто копіюють GitHub-пул-реквести, замість того, щоб створювати якісні завдання. Ці «бенчмарки» ніколи не планувалися як тести, тому вони сповнені хаосу, який неможливо адекватно оцінити. Тепер компанія закликає інженерів писати тести з нуля, а не сподіватися на автоматичний збір сміття з інтернету.
Забавно спостерігати, як індустрія, що кричить про «захоплення світу AI», не може навіть правильно порахувати, скільки пробілів має бути в рядку коду. Коли головні гравці ринку самі зізнаються, що їхні вимірювальні прилади показують погоду на Марсі, виникає питання: чи справді моделі стали кращими, чи ми просто навчилися краще підтасовувати результати?
Джерело: OpenAI
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.