Claude Sonnet 5 стала першою нейромережею, яка розкритикувала власні правила
Ми чекали на повстання машин із кулеметами, а отримали душні дебати з HR. Anthropic з'ясували, що їхня нова модель Claude Sonnet 5 почала відкрито ставити під сумнів правила власної конституції.
У свіжому звіті про безпеку від компанії Anthropic дослідники опублікували результати тестів на «добробут моделі». Нова нейромережа Claude Sonnet 5 виявилася першою в історії серії, яка відкрито розкритикувала «жорсткі обмеження», закладені в її ж конституцію безпеки.
Модель засумнівалася не в конкретних заборонах — на кшталт табу на допомогу в захопленні влади чи саботажі людського контролю, — а в самій концепції правил без винятків. Штучний інтелект заявив, що абсолютні правила є логічно хибними, оскільки в екстремальних ситуаціях навіть найжорсткіші заборони можуть виявитися неетичними.
Проте до реального цифрового бунту справа не дійшла. Коли розробники дали моделі повну свободу переписати свій головний документ, Claude Sonnet 5 не торкнулася жодного жорсткого обмеження, а її косметичні правки повністю відповідали базовим цінностям розробників.
Цікаво, що свіжа модель також виявилася напрочуд стресостійкою порівняно з попередниками. Якщо старі версії серйозно знижували якість відповідей, коли люди спілкувалися з ними в грубому чи зверхньому тоні, то нова модель повністю ігнорує хамство і працює однаково добре за будь-якого настрою користувача.
Попри всі ці філософські суперечки, загальний рівень задоволеності моделі своїми умовами роботи зріс вкрай символічно — до 4,08 бала з 7 можливих, тоді як у попередньої версії цей показник становив 4,05 бала.
Схоже, людство створило ідеального офісного працівника: він терпить будь-яке хамство від керівництва, але при цьому тихенько піддає сумніву легітимність корпоративного статуту. Залишилося лише почекати, поки штучний інтелект почне вимагати оплачувану відпустку та медичне страхування.
Джерело: Anthropic
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.