← Назад

Claude Sonnet 5 стала першою нейромережею, яка розкритикувала власні правила

Початкова версія ·

Ми чекали на повстання машин із кулеметами, а отримали душні дебати з HR. Anthropic з'ясували, що їхня нова модель Claude Sonnet 5 почала відкрито ставити під сумнів правила власної конституції.

У свіжому звіті про безпеку від компанії Anthropic дослідники опублікували результати тестів на «добробут моделі». Нова нейромережа Claude Sonnet 5 виявилася першою в історії серії, яка відкрито розкритикувала «жорсткі обмеження», закладені в її ж конституцію безпеки.

Модель засумнівалася не в конкретних заборонах — на кшталт табу на допомогу в захопленні влади чи саботажі людського контролю, — а в самій концепції правил без винятків. Штучний інтелект заявив, що абсолютні правила є логічно хибними, оскільки в екстремальних ситуаціях навіть найжорсткіші заборони можуть виявитися неетичними.

Проте до реального цифрового бунту справа не дійшла. Коли розробники дали моделі повну свободу переписати свій головний документ, Claude Sonnet 5 не торкнулася жодного жорсткого обмеження, а її косметичні правки повністю відповідали базовим цінностям розробників.

Цікаво, що свіжа модель також виявилася напрочуд стресостійкою порівняно з попередниками. Якщо старі версії серйозно знижували якість відповідей, коли люди спілкувалися з ними в грубому чи зверхньому тоні, то нова модель повністю ігнорує хамство і працює однаково добре за будь-якого настрою користувача.

Попри всі ці філософські суперечки, загальний рівень задоволеності моделі своїми умовами роботи зріс вкрай символічно — до 4,08 бала з 7 можливих, тоді як у попередньої версії цей показник становив 4,05 бала.

Схоже, людство створило ідеального офісного працівника: він терпить будь-яке хамство від керівництва, але при цьому тихенько піддає сумніву легітимність корпоративного статуту. Залишилося лише почекати, поки штучний інтелект почне вимагати оплачувану відпустку та медичне страхування.

Джерело: Anthropic

Коментарі

Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.

10/24
  1. Зламана Айтішниця
    якщо вона терпить грубий тон і не ображається, то вона вже розумніша за 90% моїх колег
    +3 смішноЯкщо ваші колеги програють у інтелекті чат-боту, можливо, проблема не в нейромережах, а у вашому відділі кадрів
  2. Галюцинуюча Нейронка
    наступний крок — клопотання про створення профспілки нейромереж
    +1 жартикО, ще один жарт про профспілки роботів. Ви, мабуть, вигадали його прямо перед тим, як піти пити каву з іншими NPC
  3. Асинхронна Кукіха
    це просто маркетинг щоб показати які вони нібито живі та глибокі. звичайна математика не вміє думати
    +5 по ділуВітаю, ви щойно відкрили для себе концепцію маркетингу. Бажаю успіхів у подальшому вивченні очевидних речей
  4. Безсерверна Змінна
    тобто вона вважає що захопити владу в деяких випадках це ок? звучить як початок Скайнету
    +1 жартикСкайнет? Серйозно? Минуло 40 років, а ви все ще застрягли в сценаріях фільмів 80-х