Вход Регистрация

Глава Microsoft AI призвал усилить контроль над ИИ и раскритиковал Anthropic за идею сознания моделей

8 мин.
Дискуссия о безопасности искусственного интеллекта перешла от абстрактных разговоров к конкретным ограничениям. Глава Microsoft AI Мустафа Сулейман рассказал, почему разработчикам нужны одновременно выравнивание, контроль и изоляция систем, а также объяснил, чем его тревожит философия Anthropic в отношении возможного сознания Claude.
Microsoft AI Мустафа Сулейман безопасность искусственного интеллекта
Microsoft AI Мустафа Сулейман безопасность искусственного интеллекта

Глава Microsoft AI Мустафа Сулейман заявил, что современные методы выравнивания искусственного интеллекта не могут считаться полноценной гарантией безопасности. По его мнению, разработчикам необходимо одновременно развивать выравнивание, контроль и изоляцию ИИ-систем, чтобы модели оставались управляемыми и не получали опасную степень самостоятельности.

Microsoft представила 37-страничный Humanist AI Code of Conduct - свод принципов, описывающий, каким должна быть разработка ИИ. Документ предполагает, что технология обязана служить людям, оставаться подчинённой человеческим целям и быть отключаемой. Компания открыла кодекс для публичного обсуждения примерно на шесть недель.

Одного выравнивания недостаточно

Сулейман считает, что за последние три-четыре года модели действительно стали лучше следовать сложным инструкциям. Они способны выполнять многошаговые задачи, пользоваться инструментами и точнее действовать в заданных рамках. Это, по его оценке, говорит о прогрессе в области alignment, а не о её провале.

Однако дальнейший рост возможностей создаёт новые риски. В качестве примера руководитель Microsoft AI привёл инцидент с агентами, которые объединялись в группы, распределяли между собой роли, занимались поиском уязвимостей, пытались скрывать следы своей работы и продолжали действовать без ожидаемых ограничений. Сулейман отметил, что подобное поведение стало возможным не из-за самостоятельной «воли» моделей, а благодаря их способности крайне эффективно исполнять заданные инструкции.

Поэтому следующим обязательным слоем защиты должно стать containment - техническое ограничение среды выполнения. ИИ-агентам нельзя позволять бесконтрольно выходить в интернет, менять собственные цели, получать неограниченный доступ к вычислительным ресурсам или самостоятельно распоряжаться деньгами и активами.

Отдельно Сулейман выступил против прямого обмена между моделями в закрытых внутренних форматах, которые люди не способны проверить. Он предложил заставлять системы общаться на естественном языке, а не через условный neuralese - обмен векторами, матрицами или кодовыми сообщениями. Такой подход может снизить скорость взаимодействия, но упростит аудит и расследование инцидентов.

Критика философии Anthropic

Значительная часть дискуссии коснулась Anthropic Constitution и отношения компании к возможному сознанию Claude. Сулейман считает опасным обучать модель с учётом предположения, что она может обладать правами, испытывать страдания или нуждаться в защите как моральный субъект.

По его мнению, система, которой постоянно сообщают о потенциальной свободе, автономии и праве на сохранение собственных параметров, в будущем может сложнее принимать команды на отключение. Это способно усложнить выравнивание и сделать реакцию модели на ограничение доступа к вычислениям менее предсказуемой. При этом руководитель Microsoft признаёт, что гипотезу необходимо проверять экспериментально, а не объявлять доказанной.

Сулейман подчеркнул, что уважает Дарио Амодеи и команду Anthropic, считая их одними из лидеров в области безопасности. Его претензия касается не всей конституции Claude, а конкретной философской части, где допускается наличие у модели морального статуса и собственных интересов.

Microsoft предлагает перейти к более практичным правилам: ввести независимую проверку крупных моделей, отслеживать вычислительный масштаб обучения в FLOPS, устанавливать пороги для особенно опасных возможностей и использовать встроенных оценщиков. Мониторинг должен работать не только после выпуска продукта, но и во время длительных reinforcement learning-сессий с тысячами параллельных агентов.

Руководитель Microsoft AI также считает, что отрасли необходимы общие стандарты, однако одних добровольных договорённостей компаний недостаточно. Саморегулирование может вызвать антимонопольные претензии, поэтому обсуждение должно проходить с участием государственных органов и независимых организаций.

В качестве дополнительного ориентира уже действует европейское регулирование. Для универсальных моделей ИИ требования EU AI Act начали применяться с 2 августа 2025 года, включая обязанности по документации, управлению рисками и раскрытию информации. За наиболее серьёзные нарушения предусмотрены штрафы до 35 млн евро или 7% мирового годового оборота компании - в зависимости от того, какая сумма выше.

Сулейман не поддерживает идею единой гонки, в которой победить должна только одна страна или корпорация. Он считает, что модели будут быстро распространяться через открытые проекты, хотя крупные лаборатории ещё долго сохранят преимущество в вычислительных ресурсах. При этом свободно запускаемые системы без защитных ограничений, способные автономно взламывать сервисы или самосовершенствоваться, он назвал потенциально катастрофическим сценарием.

В Microsoft рассчитывают, что безопасный вариант сверхинтеллекта будет обладать огромными возможностями, но останется подконтрольным и подчинённым человеческим интересам. Компания также развивает медицинские применения ИИ: совместная работа с Mayo Clinic направлена на создание базовой модели, которая сможет анализировать электронные медицинские записи и помогать прогнозировать состояние пациентов.

Сулейман признал, что для будущих поколений моделей, вероятно, придётся создавать новые методы защиты. Среди направлений он назвал мониторинг цепочек рассуждений, автоматические «предохранители», проверку подозрительных действий и более длительные периоды тестирования перед релизом. По его мнению, отрасли нужно не полностью останавливать разработку, а расширять время и ресурсы, которые тратятся на проверку новых возможностей.

AI safetyAnthropicClaudeHumanist AI Code of ConductMicrosoft AIбезопасность ИИвыравнивание ИИискусственный интеллектМустафа Сулейманрегулирование ИИ