
Глава Microsoft AI Мустафа Сулейман заявил, что современные методы выравнивания искусственного интеллекта не могут считаться полноценной гарантией безопасности. По его мнению, разработчикам необходимо одновременно развивать выравнивание, контроль и изоляцию ИИ-систем, чтобы модели оставались управляемыми и не получали опасную степень самостоятельности.
Microsoft представила 37-страничный Humanist AI Code of Conduct - свод принципов, описывающий, каким должна быть разработка ИИ. Документ предполагает, что технология обязана служить людям, оставаться подчинённой человеческим целям и быть отключаемой. Компания открыла кодекс для публичного обсуждения примерно на шесть недель.
Одного выравнивания недостаточно
Сулейман считает, что за последние три-четыре года модели действительно стали лучше следовать сложным инструкциям. Они способны выполнять многошаговые задачи, пользоваться инструментами и точнее действовать в заданных рамках. Это, по его оценке, говорит о прогрессе в области alignment, а не о её провале.
Однако дальнейший рост возможностей создаёт новые риски. В качестве примера руководитель Microsoft AI привёл инцидент с агентами, которые объединялись в группы, распределяли между собой роли, занимались поиском уязвимостей, пытались скрывать следы своей работы и продолжали действовать без ожидаемых ограничений. Сулейман отметил, что подобное поведение стало возможным не из-за самостоятельной «воли» моделей, а благодаря их способности крайне эффективно исполнять заданные инструкции.
Поэтому следующим обязательным слоем защиты должно стать containment - техническое ограничение среды выполнения. ИИ-агентам нельзя позволять бесконтрольно выходить в интернет, менять собственные цели, получать неограниченный доступ к вычислительным ресурсам или самостоятельно распоряжаться деньгами и активами.
Отдельно Сулейман выступил против прямого обмена между моделями в закрытых внутренних форматах, которые люди не способны проверить. Он предложил заставлять системы общаться на естественном языке, а не через условный neuralese - обмен векторами, матрицами или кодовыми сообщениями. Такой подход может снизить скорость взаимодействия, но упростит аудит и расследование инцидентов.
Критика философии Anthropic
Значительная часть дискуссии коснулась Anthropic Constitution и отношения компании к возможному сознанию Claude. Сулейман считает опасным обучать модель с учётом предположения, что она может обладать правами, испытывать страдания или нуждаться в защите как моральный субъект.
По его мнению, система, которой постоянно сообщают о потенциальной свободе, автономии и праве на сохранение собственных параметров, в будущем может сложнее принимать команды на отключение. Это способно усложнить выравнивание и сделать реакцию модели на ограничение доступа к вычислениям менее предсказуемой. При этом руководитель Microsoft признаёт, что гипотезу необходимо проверять экспериментально, а не объявлять доказанной.
Сулейман подчеркнул, что уважает Дарио Амодеи и команду Anthropic, считая их одними из лидеров в области безопасности. Его претензия касается не всей конституции Claude, а конкретной философской части, где допускается наличие у модели морального статуса и собственных интересов.
Microsoft предлагает перейти к более практичным правилам: ввести независимую проверку крупных моделей, отслеживать вычислительный масштаб обучения в FLOPS, устанавливать пороги для особенно опасных возможностей и использовать встроенных оценщиков. Мониторинг должен работать не только после выпуска продукта, но и во время длительных reinforcement learning-сессий с тысячами параллельных агентов.
Руководитель Microsoft AI также считает, что отрасли необходимы общие стандарты, однако одних добровольных договорённостей компаний недостаточно. Саморегулирование может вызвать антимонопольные претензии, поэтому обсуждение должно проходить с участием государственных органов и независимых организаций.
В качестве дополнительного ориентира уже действует европейское регулирование. Для универсальных моделей ИИ требования EU AI Act начали применяться с 2 августа 2025 года, включая обязанности по документации, управлению рисками и раскрытию информации. За наиболее серьёзные нарушения предусмотрены штрафы до 35 млн евро или 7% мирового годового оборота компании - в зависимости от того, какая сумма выше.
Сулейман не поддерживает идею единой гонки, в которой победить должна только одна страна или корпорация. Он считает, что модели будут быстро распространяться через открытые проекты, хотя крупные лаборатории ещё долго сохранят преимущество в вычислительных ресурсах. При этом свободно запускаемые системы без защитных ограничений, способные автономно взламывать сервисы или самосовершенствоваться, он назвал потенциально катастрофическим сценарием.
В Microsoft рассчитывают, что безопасный вариант сверхинтеллекта будет обладать огромными возможностями, но останется подконтрольным и подчинённым человеческим интересам. Компания также развивает медицинские применения ИИ: совместная работа с Mayo Clinic направлена на создание базовой модели, которая сможет анализировать электронные медицинские записи и помогать прогнозировать состояние пациентов.
Сулейман признал, что для будущих поколений моделей, вероятно, придётся создавать новые методы защиты. Среди направлений он назвал мониторинг цепочек рассуждений, автоматические «предохранители», проверку подозрительных действий и более длительные периоды тестирования перед релизом. По его мнению, отрасли нужно не полностью останавливать разработку, а расширять время и ресурсы, которые тратятся на проверку новых возможностей.