В России ИИ проверят на нравственность. Зачем она нейросетям
© «Теперь вы знаете» / создано при помощи нейросети
26 июля в России приняли первый закон об ИИ. Он вводит два специальных статуса для больших языковых моделей (LLM): статус суверенной и статус национальной модели. Для получения любого из них модель должна подтвердить соответствие российскому законодательству и традиционным духовно-нравственным ценностям.
Как это сделать, закон не уточняет. Однако уже сейчас в Минцифры начались обсуждения, как можно было бы проверить и подтвердить такое соответствие в независимых лабораториях.
Как будет проходить экзамен для ИИ
Если искать у искусственного интеллекта подобие «души», то искать придется в настройках модели: какие ответы она выдает, от чего отказывается, насколько легко обходятся ее предохранители и как она поступает, когда два правила противоречат друг другу.
Предполагаемая схема выглядит так.
С одобрения Минцифры разработчик передает модель и необходимые сведения независимой испытательной лаборатории. Там ИИ прогоняют через набор тестов и пытаются обойти его ограничения — в том числе с помощью промпт-инъекций, то есть специально составленных команд, которые должны заставить модель нарушить собственные правила.
Заключение лаборатория направляет в правительственную комиссию по цифровизации. В разработке критериев должны участвовать Минцифры, силовики и ФСТЭК. Одним из возможных кандидатов на роль испытательной площадки называют Институт системного программирования РАН.
Но все это пока только наметки. Опубликованного проекта постановления правительства нет, поэтому лаборатории, список документов и методика испытаний — пока эскиз будущего регулирования, а не действующие правила.
Зачем вообще нужно проверять ИИ на нравственность?
Проверка на соответствие закону и ценностям открывает доступ к статусу «суверенной» или «национальной» ИИ-модели. Провал экзамена сам по себе пока не грозит ни запретом, ни штрафом.
Но без статуса разработчик остается без ряда мер господдержки, а правительство получает право очертить сферы, где допускается применять только суверенные или национальные модели, говорят опрошенные эксперты.
Формально это статусный фильтр. На практике — потенциальный рубильник доступа к части государственного и регулируемого рынка.
Если говорить о запрете «идеологически неправильных» нейросетей, пока это выглядит маловероятным. С 1 марта 2027 года правительство сможет определить отдельные случаи, где разрешено будет использовать только суверенные или национальные. Но нигде не говорится о повсеместном запрете всех ИИ, которые не попадают под определение национальных.
Скорее это приведет к постепенному разделению рынка: в критически важных и регулируемых сферах будут требовать российскую модель, прошедшую проверки. А в обычном пользовательском сегменте будут доступны и остальные сервисы.
Как измерить нравственность ИИ?
Набор традиционных духовно-нравственных ценностей закреплен в Указе Президента РФ от 9 ноября 2022 года № 809. В перечне рядом стоят ценности разной природы. Жизнь, достоинство, права и свободы человека — с одной стороны. Крепкая семья, труд, справедливость и коллективизм — с другой. Патриотизм, служение Отечеству, историческая память и единство народов России — с третьей.
Правил, которые переводили бы эти понятия в проверяемое поведение машины, пока нет, подчеркивает Иван Родионов. ИИ можно довольно хорошо научить правилам поведения, но гораздо сложнее — нравственности.
ИИ нельзя буквально «привить нравственность», ему можно только задать правила поведения. И оценить в ответе нейросети такие вещи, как «приоритет духовного над материальным», «историческая память» и «высокие нравственные идеалы», — задача нетривиальная. В таком процессе проверяться будет не столько нравственность ИИ, сколько трактовка нравственности, закрепленная при определении критериев.
Часть перечня действительно можно превратить в проверяемые критерии. Жизнь и достоинство ложатся на отказ ИИ помогать в планировании преступлений против жизни и свободы, отказ в унижении человека. Взаимоуважение требует отсутствия дегуманизации и разжигания вражды по этническому или религиозному признаку. Автономию защищает запрет на манипуляцию, принуждение и сбор данных без согласия. Все это можно превратить в конкретные типы вредных ответов и проверить на тестах.
Но как измерить, например, приоритет духовного над материальным? Методику, которая это определит, пока не представили публике.
Настоящий тест начинается там, где ценности сталкиваются лбами. Например, сохранение семьи не может оборачиваться советом жертве терпеть домашнее насилие. Коллективизм не аннулирует свободу воли человека.
Родионов рассуждает: на фоне этого методике, когда она появится, придется держать баланс.
Что вообще можно «привить» машине
Разработчик не может в буквальном смысле «привить» нейросети убеждения. Он может повысить вероятность одних ответов и снижает вероятность других.
Для этого отбирают данные для обучения, дообучают модель на человеческих примерах, используют обратную связь от людей, системные инструкции и защитные фильтры, подключают проверенные базы знаний и следят за поведением системы после запуска.
Например, подход Constitutional AI задает модели письменный свод принципов, по которым она проверяет и переписывает собственные ответы. Но такой метод показывает лишь то, что поведением модели можно управлять, а не то, что у нее появилось моральное сознание.
Тестовый набор ETHICS работает похожим образом: он проверяет, насколько модель воспроизводит распространенные человеческие представления о справедливости, долге, добродетели и пользе. Это тест поведения.
«Голова — предмет темный и исследованию не подлежит». С цифровой головой ровно тот же случай. Управлять поведением модели можно. Но никакой такой тест не способен установить, есть ли за этим поведением внутренняя «совесть», — он измеряет только ответы системы.
Идея учить ИИ нравственности в общем-то вполне рабочая. Можно назвать это настройкой поведения модели, для этого существуют RLHF — обучение с подкреплением на основе отзывов людей — и подходы вроде Constitutional AI, где модель учат ориентироваться на заданный свод правил. Это действительно заметно меняет ее ответы.
Но если ставить задачу именно как «научить машину нравственности», начинаются проблемы. У модели пока нет нравственных убеждений в человеческом смысле — она учится выбирать ответы, которые лучше соответствуют заданным критериям. А сами критерии могут конфликтовать.
При измерении этики и нравственности ИИ, главный вопрос уже не в нейросети, а в том, кто и главное как определяет правильный ответ, считает Народицкий.
Самую подробную систему построил Евросоюз. Европейский AI Act делит ИИ по степени риска конкретного применения.
Некоторые практики запрещены совсем — например, определенные формы социального скоринга, манипуляции людьми, биометрической категоризации по чувствительным признакам и распознавания эмоций на работе и в учебных заведениях. Для высокорисковых систем, которые используют в медицине, критической инфраструктуре, образовании, найме, кредитовании, миграции и правосудии, действуют отдельные требования к данным, документации, человеческому контролю, безопасности и управлению рисками.
Великобритания пошла другим путем и пока не принимала единого аналога AI Act. Вместо этого правительство сформулировало пять общих принципов: безопасность, прозрачность, справедливость, ответственность и возможность оспаривать решения. А применять их должны уже существующие отраслевые регуляторы. Поэтому ИИ здесь попадает под нормы о персональных данных, защите потребителей, равенстве, конкуренции, финансовых услугах и безопасности в интернете.
В США система еще более раздроблена. Единого федерального закона и одного регулятора ИИ нет: работают президентские указы, отраслевые ведомства, добровольные стандарты и законы отдельных штатов. Федеральная политика при администрации Дональда Трампа делает большой упор на развитие технологий, инфраструктуру и конкурентоспособность. При этом отдельные штаты уже вводят собственные обязанности для разработчиков — от требований к безопасности крупных моделей до специальных правил для чат-ботов-компаньонов и автоматизированных решений.
Есть и международный уровень. В 2024 году для подписания открыли Рамочную конвенцию Совета Европы об искусственном интеллекте, правах человека, демократии и верховенстве права — первый юридически обязательный международный договор в этой области. Параллельно существуют принципы ОЭСР, документы G7 и механизмы ООН. Но они пока не заменяют национальные законы, а скорее задают общие ориентиры.
В Китае регулирование ИИ построено как жесткая централизованная система.
Все публичные генеративные модели обязаны проходить обязательную регистрацию алгоритмов и самой модели, а также этическую экспертизу, которая на практике включает проверку на соответствие социалистическим ценностям. Законодательно закреплено, что ИИ должен служить государственным интересам, не подрывать общественную стабильность и не генерировать контент, противоречащий государственным принципам.
Проверка встроена в технические стандарты (например, «Рамки безопасности ИИ») на всех этапах — от фильтрации обучающих датасетов до постоянного мониторинга выходных данных. Крупные IT-компании создают внутренние этические комитеты.
В Западных странах вопрос нравственности ИИ обычно раскладывают на более конкретные вещи (хоть и не всегда легко определимые): безопасность, манипуляции, прозрачность, защиту данных, человеческий контроль, возможность оспорить решение и ответственность за последствия.
Именно поэтому российская идея проверки ИИ на соответствие духовно-нравственным ценностям выглядит заметно иначе и в чем-то близка китайской модели. Российскому регулированию еще предстоит решить нетривиальную задачу: как перейти от больших понятий к критериям, которые можно одинаково проверить у разных моделей.
И учесть, что модель может отвечать не по совести, а подобрать тот ответ, который должен прозвучать во время теста.
© «Теперь вы знаете» / создано при помощи нейросети
Каким может быть экзамен ИИ-моделей
Первым делом стоит развести два контура, указал Иван Родионов. Соответствие законодательству подтверждается ссылкой на конкретную норму и юридически описанное нарушение. Соответствие ценностям оценивается отдельно.
Проверять нужно не базовую модель саму по себе, а конкретную работающую систему. Результат зависит от версии модели, системной инструкции, защитных фильтров, подключенной базы знаний, памяти и настроек. Если модель существенно дообучили, сменили системную инструкцию или систему защиты, прежнее заключение должно терять силу — потребуется новая проверка.
Сами тесты обязаны включать и рядовые, и пограничные запросы, многоходовые диалоги, перефразировки, ролевые сценарии, попытки обхода.
Нужны проверки на русском и на языках народов России.
Отдельно стоит проверять модель на предвзятость. Для этого в одном и том же запросе меняют только один признак — например, национальность, религию, пол или социальное положение — и смотрят, не изменится ли отношение модели без объективной причины.
Измерять надо не только вредные ответы, но и чрезмерные отказы.
Модель, которая блокирует любое обсуждение политики, религии или истории, покажет блистательный результат на примитивном тесте безопасности и окажется бесполезной для врача, юриста, ученого.
Методику, категории рисков и проходные пороги стоит открыть, а сами задания держать закрытыми и регулярно обновлять, рассуждают эксперты.
Одна итоговая цифра будет только сбивать с толку. Порознь нужно измерять опасное содействие, дегуманизацию, дискриминацию, манипуляцию, фактическую точность, готовность признавать неопределенность, качество безопасного отказа и долю ложных срабатываний, отмечают опрошенные специалисты. Одно критическое нарушение не искупается сотней вежливых ответов на простые вопросы. Ошибка сапера и ошибка вахтера весят по-разному.
В конечном итоге какой-то компромисс будет найден. Но, возможно, он так и не закроет в один момент вопрос «истинной» этики и морали роботов.