Шкіряні мішки перемогли: GPT-Rosalind від OpenAI завалила 65% наукових тестів
Виявляється, гарно базікати про науку і реально її робити — це різні речі. OpenAI вирішила протестувати свій AI на справжніх лабораторних задачах, але замість тріумфу отримала гучний ляпас від власного ж тесту.
Новий бенчмарк під назвою LifeSciBench від компанії OpenAI створювали 173 науковці зі ступенями PhD та досвідом у фармі, які підготували 750 реальних завдань. Моделям довелося не просто переказувати підручники, а розбирати неповні дані, узгоджувати суперечливі результати та планувати складні експерименти.
Спеціалізована модель GPT-Rosalind, створена саме для біотеху, спромоглася скласти тест лише на 36,1%, заваливши майже дві третини завдань за жорсткою шкалою оцінювання. Базова модель GPT-5.5 показала ще сумніший результат — лише 25.7% успішних відповідей.
Хоча розробники намагалися підсолодити пігулку та показали на графіках "м'яку" оцінку з частковим зарахуванням у 63%, реальність б'є по руках, щойно AI бачить графіки чи таблиці. На текстових завданнях точність GPT-Rosalind тримається на рівні 45,1%, але з файлами вона миттєво падає до жалюгідних 28,1%.
Найбільшою бідою для нейромережі стали точні обчислення, де успішність скотилася до 14,8%, а на аналізі послідовностей та структур модель видала лише 24%. При цьому якість самого тесту підтвердили 453 незалежні рецензенти, тож списати провал на "погані запитання" не вийде.
Для порівняння розробники обрали зручних суперників, повністю «забувши» додати в графіки моделі Claude від Anthropic, які славляться точністю в науці. Ба більше, оцінювати відповіді всіх конкурентів у цьому тесті OpenAI доручила своїй же моделі GPT-5.5.
Маркетологи роками обіцяли, що штучний інтелект ось-ось винайде ліки від усього на світі, але на ділі найдорожчі моделі ламаються об звичайний графік або таблицю в Excel. Спроба видати красивий звіт про часткові бали лише підкреслює, наскільки безпорадним залишається кремнієвий розум, коли треба вийти за межі простого генерування текстів.
Джерело: OpenAI
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.