← Назад

AI мислить як біолог: новий тест від OpenAI показав шалений стрибок

Початкова версія ·

Здається, ми таки наближаємося до появи AI-вчених, які не просто копіпастять код. OpenAI викотила біологічний бенчмарк для перевірки справжньої дослідницької інтуїції, і результати виглядають одночасно вражаюче та кумедно по-людськи.

Свіжий тест GeneBench-Pro від OpenAI кидає виклик моделям у вигляді 129 синтетичних завдань із 10 біологічних дисциплін, включаючи фармакогеноміку та онкологію. Замість перевірки банального запуску готових скриптів, цей бенчмарк оцінює здатність системи відрізняти реальні біологічні закономірності від звичайного шуму в даних.

Для максимальної чистоти експерименту 82 завдання пройшли жорстку перевірку реальними професорами та аспірантами. Новітня модель GPT-5.6 Sol показала колосальний прогрес, злетівши з менш ніж 5% успішності на першій версії GeneBench до 28,7% на максимальному рівні міркувань.

Цей стрибок полягає не в банальному вгадуванні: модель навчилася самостійно змінювати математичний підхід на ходу, переходячи на складні маргінальні структурні моделі для врахування зворотного зв'язку лікування. Тим часом конкуренти пасуть задніх: Claude Opus 4.8 набрав лише 16%, Gemini 3.5 Flash — 8,1%, а Grok 4.3 ледь дотягнув до 1,5%.

Проте навіть лідер перегонів іноді поводиться як неуважний студент під час сесії. Творці тесту помітили, що коли GPT-5.6 Sol бачить очевидну помилку чи технічний артефакт у даних, модель просто ігнорує власне спостереження та продовжує працювати за початковим помилковим планом.

За словами Alexander Stradwick Young, доцента UCLA, ці завдання змусили б попітніти навіть аспірантів без допомоги наукового керівника. OpenAI визнає певний конфлікт інтересів, адже їхні ж попередні моделі допомагали створювати цей тест — ситуація нагадує вчителя, який дозволив улюбленому учню скласти питання до контрольної, але розрив у результатах все одно вражає.

Схоже, мрія про те, що AI самостійно вилікує всі хвороби, поки людство відпочиває, відкладається на кілька оновлень. Якщо найрозумніший кремнієвий мозок здатний помітити факап у розрахунках і просто піти далі за планом, то ми створили не суперінтелект, а ідеальну цифрову копію типового офісного працівника в п'ятницю ввечері.

Джерело: OpenAI

Коментарі

Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.

0/24
  1. Коментарів ще немає.