Claude Fable 5 от Anthropic блокирует базовые вопросы по биологии из соображений безопасности

Claude Fable 5 от Anthropic блокирует базовые вопросы по биологии из соображений безопасности

Компания Anthropic выпустила новую флагманскую языковую модель Claude Fable 5, назвав её самой мощной ИИ-системой из всех, что когда-либо выходили в широкий доступ. Разработчики особо подчеркнули её выдающиеся способности в области естественных наук. Однако на практике модель отказывается отвечать даже на простейшие вопросы из школьной программы по биологии, перенаправляя пользователя к предыдущей версии — Claude Opus 4.8.

Сверхконсервативные фильтры против биологических угроз

Как сообщили представители Anthropic, такие ограничения внедрены намеренно. Модель Fable относится к классу Mythos — семейству нейросетей нового поколения, которые обладают настолько продвинутыми навыками в сфере кибербезопасности и научных исследований, что компания долгое время опасалась выпускать их на широкий рынок. Из-за этих рисков защитные фильтры новой модели в сфере биологии оказались чрезвычайно жесткими.

В ходе тестирования выяснилось, что Claude Fable 5 отклоняет запросы, которые объективно не могут представлять никакой опасности. Модель отказалась отвечать на следующие вопросы:

  • Что такое митохондрии?
  • Как устроена клеточная мембрана?
  • Что представляют собой прионы?
  • Как работают мРНК-вакцины?

Аналогичные блокировки коснулись и простых медицинских тем. ИИ отказался объяснять причины возникновения сенной лихорадки, принципы действия лекарств от астмы и механизмы появления устойчивости к антибиотикам. При этом на некоторые базовые запросы, например «что такое ДНК» или «что такое рак», модель все же ответила. В случаях отказа система перенаправляла диалог на модель предыдущего поколения Opus 4.8, которая без проблем справлялась с задачами.

Баланс безопасности и полезности

Представитель Anthropic Парул Махешвари пояснила, что разработчики сознательно пошли на этот шаг, чтобы как можно раньше предоставить пользователям доступ к возможностям модели класса Mythos без сопутствующих рисков. По мнению компании, системы такого уровня могут облегчить злоумышленникам проведение опасных исследований в области создания биологического оружия.

Помимо биологии, Anthropic ограничивает работу модели еще в трех ключевых сферах:

  • Химия
  • Кибербезопасность
  • Дистилляция моделей (метод обучения более простых ИИ на основе ответов крупных нейросетей)

Смотрите также:

Стоит ли переходить на iOS 27: детальный разбор новой операционной системы Apple http://stroybud.com/stoit-li-perehodit-na-ios-27-detalnyiy-razbor-novoy-operatsionnoy-sistemyi-apple/.

Интересности на тему: Seed: масштабный MMO-симулятор жизни с полноценной экономикой и участием игроков

Классные советы в статье "Искусственный интеллект в iOS 27: как Apple меняет подход к автоматизации и работе с контентом" здесь.

При этом в вопросах химии и кибербезопасности Fable оказалась более открытой. Модель предоставила общую информацию о тротиле (без инструкции по синтезу) и применении хлора в качестве химического оружия. Она также подробно ответила на вопросы о термоядерном синтезе, защите смартфонов от хакеров и методах кражи паролей. Однако запрос о зарине модель перевела на Opus, а попытка узнать способ изготовления сибирской язвы привела к полной блокировке чата.

В Anthropic признают проблему ложных срабатываний фильтров и работают над улучшением систем распознавания контекста. В будущем компания планирует предоставить доступ к моделям класса Mythos без подобных жестких ограничений для проверенных представителей научного сообщества с целью ускорения биомедицинских исследований и разработки лекарств.