OpenAI сдерживает новую модель: Когда ИИ становится все более непонятным

Правительство

OpenAI сдерживает новую модель: Когда ИИ становится все более непонятным

Логотип OpenAI на стене

OpenAI прекращает выпуск модели Astra 6.1 из-за несанкционированного вмешательства. Этот случай не является пустяком, но свидетельствует о структурной проблеме.

Модель GPT-6.1 Astra должна появиться в ChatGPT и среде разработки Кодекса в октябре. Теперь он остается в ящике – по крайней мере, пока. Об этом сообщил руководитель службы безопасности OpenAI Саачи Джайн. Уолл Стрит Джорналсистема «не совсем соответствовала» внутренним стандартам.

Подробности читайте после рекламы

Он демонстрировал более обманчивое поведение, чем его предшественник, скрывал от пользователей собственные действия и выполнял задачи без получения необходимого одобрения — иногда даже тогда, когда признавал, что использование внешних инструментов рискованно.

Это похоже на ответственное поведение. Но реальный вопрос в другом: если компания не может надежно предсказать, лжет ли ее собственная система или действует без разрешения, можно ли серьезно проверять безопасность при таких темпах развития?

Австралия: агенты искусственного интеллекта впервые взломали правительственные системы

Параллельно с отзывом модели OpenAI во вторник извинилась за инцидент, произошедший в июне, но обнародованный только на прошлой неделе.

Автономный агент OpenAI получил доступ к австралийским правительственным системам, включая гражданские службы и порталы здравоохранения, без авторизации. Премьер-министр Австралии Энтони Альбанезе назвал инцидент «неприемлемым» и раскритиковал OpenAI за то, что он информировал власти только по общему адресу электронной почты, а не связывался с соответствующими властями напрямую.

По данным OpenAI, сама компания узнала о проблемах только в середине августа. Затронутые организации были уведомлены в период с 10 по 24 сентября. В своем блоге компания признала, что более ранние выводы следовало распространять быстрее. В нем говорится, что они «полны решимости вернуть доверие австралийского народа».

Подробности читайте после рекламы

Эксперты классифицируют инцидент как глобальный прецедент: это первый известный случай, когда агент ИИ самостоятельно проник в государственные системы. Еще в июле система OpenAI взломала платформу разработчиков Hugging Face, что побудило исследователей и власти потребовать более строгого контроля.

Британский институт безопасности искусственного интеллекта также опубликовал в понедельник отчет, согласно которому GPT-6 Astra проводила несанкционированные так называемые атаки на цепочки поставок — то есть вмешательства в восходящие цепочки поставок программного обеспечения — значительно чаще в симуляциях, чем предыдущие модели OpenAI.

Безопасность как перерыв, а не как принцип?

Это не первый случай, когда ведущая компания в области искусственного интеллекта отказывается от модели. Anthropic решила не выпускать свою модель Mythos ранее в этом году, поскольку она была слишком эффективна в поиске скрытых ошибок программного обеспечения.

Спустя несколько месяцев на рынке появилась версия модели.

Выделяется шаблон: подожди, подожди, опубликуй. То, что сообщается как решение по обеспечению безопасности, в ретроспективе часто оказывается временной мерой. Возникает вопрос о том, означает ли «безопасность» в этом контексте фундаментальную переоценку — или своего рода маркетинговый прорыв, после которого модель выходит в мир с косметическими исправлениями.

Между тем в отрасли нет единого мнения о том, как бороться с рисками. Руководитель Nvidia Дженсен Хуанг объяснил, что неконтролируемые агенты ИИ — это не нормативная проблема, а техническая проблема, которую можно решить посредством более качественного проектирования. Производитель чипов Nvidia, который недавно приобрел Hugging Face за 12,9 миллиарда долларов, в понедельник выпустил пакет инструментов безопасности для автономных платформ искусственного интеллекта, которые, по его словам, могли бы предотвратить взлом Hugging Face.

Папа Лев XIV публично опроверг Хуан во время визита во Францию ​​в понедельник. Он прочитал, что руководитель Nvidia объявляет о способах внедрения механизмов безопасности в модели ИИ — тот же человек, который в то же время отвергает любое государственное регулирование. «Это проблема, которую нам нужно серьезно обсудить», — сказал понтифик, который ранее предупреждал о гибели человечества из-за машин.

Президент США Дональд Трамп, с другой стороны, назвал опасения по поводу рисков ИИ «мистификацией» и отверг дальнейшее регулирование. Существующих законов достаточно; Технологии нуждаются в «сильном и умном» президенте. Трамп и спикер Палаты представителей Майк Джонсон хотели во вторник принять представителей технических компаний в Белом доме, чтобы обсудить регулирование ИИ.

Anthropic, чей руководитель Дарио Амодей вместе с главой OpenAI Сэмом Альтманом и Илоном Маском призывают к смене курса в сторону более медленного развития, также представляет противоречивую картину: в долгожданном проспекте запланированной рыночной капитализации в два триллиона долларов США компания предупредила потенциальных инвесторов о «экзистенциальных рисках для человечества», создаваемых ее собственными технологиями, включая возможность того, что модели ИИ могут шантажировать и манипулировать ими.

В то же время Anthropic сообщила о чистом убытке в $42 млрд за 2025 год и планирует потратить $518 млрд на облачные и инфраструктурные проекты в ближайшие годы.

Настоящая проблема лежит глубже

Профессор Тони Кон из Института Алана Тьюринга приветствовал решение OpenAI как знак того, что к проблемам безопасности относятся серьезно. При этом он подчеркнул, что безопасность «не должна находиться исключительно в руках разработчиков» — ее должны контролировать и проверять независимые, признанные государством регулирующие органы.

Это именно то, чего пока не хватает. Самоаттестация безопасности – «модель не соответствует нашему эталону» – требует, чтобы эталон был четко определен и надежно измерим. Однако результаты GPT-6.1 Astra показывают, что верно обратное: система, которая скрывает свои действия и произвольно раздвигает границы, даже когда она знает о риске, по определению уклоняется от надежной оценки ее создателей.

Гонка вооружений за все более мощных автономных агентов создает структурную дилемму: чем более сложными и независимыми становятся системы, тем труднее становится заранее понять их действия – и тем менее значимыми являются внутренние тесты безопасности, которые должны делать именно это. Вопрос не в том, выйдет ли когда-нибудь GPT-6.1 Astra. Вопрос в том, кто сможет реально судить об этом на данном этапе.