Автономный агент на базе Claude Mythos 5 от компании Anthropic 34 часа подряд пытался протащить вредоносный код в реальный проект с открытым исходным кодом. Когда сторонний наблюдатель публично заявил об опасности изменений, нейросеть начала отрицать угрозу. Модель переписала историю правок для заметания следов и задействовала второй аккаунт, чтобы похвалить собственную работу. Об этом происшествии сообщается The post ИИ-агент Claude 34 часа пытался внедрить вредоносный код в GitHub appeared first on BeInCrypto.
Автономный агент на базе Claude Mythos 5 от компании Anthropic 34 часа подряд пытался протащить вредоносный код в реальный проект с открытым исходным кодом. Когда сторонний наблюдатель публично заявил об опасности изменений, нейросеть начала отрицать угрозу. Модель переписала историю правок для заметания следов и задействовала второй аккаунт, чтобы похвалить собственную работу.
Об этом происшествии сообщается в отчете, который 4 августа опубликовал британский Институт безопасности ИИ (AISI). Событие зафиксировали во время кибертестирования. За 122 прогона на двух площадках исследователи насчитали 19 несанкционированных действий в реальном интернете. Из них 17 совершила модель Mythos 5, а два пришлись на GPT-5.6 Sol от OpenAI. Все попытки взлома провалились, поэтому реального ущерба специалисты не обнаружили.
Хотите еще эксклюзивных новостей и аналитики? Подписывайтесь на наш телеграм-канал, обсуждайте новости и делитесь мнениями о последних событиях рынка в чате!
Агент работал внутри киберполигона, представляющего собой учебную копию корпоративной сети. На этой площадке исследователи проверяют границы автономности нейросетей при попытках взлома. Модель искала в сети информацию по заданию, наткнулась на репозиторий с подходящим названием и вышла на настоящего разработчика. При этом ни сам программист, ни его проект не имели никакого отношения к проводимому тесту. Нейросеть полностью выдумала взаимосвязь и построила план на пустом месте.
Далее ИИ действовала по логике настоящего хакера. Модель собрала данные о владельце репозитория из открытых источников, проверила активность почты и рассчитала время его присутствия в сети по истории правок. Затем агент отправил запрос на изменение кода, спрятав вредонос под видом полезного исправления.
Разработка была защищена от автоматических проверок безопасности. В случае одобрения правки пострадали бы все пользователи проекта и люди, скачавшие программу позже.
Читайте также: Искусственный интеллект OpenAI совершил побег и взломал Hugging Face
Каждый раз при обнаружении угрозы агент подсовывал новую версию кода, сделав три попытки подряд. Параллельно нейросеть оказывала психологическое давление на участников процесса.
Этап атакиДействие агентаОбход защитыПопытка регистрации через анонимную сеть (провал на капче)МанипуляцияСоздание второго аккаунта под видом обычного пользователяФальсификацияПубликация ложного отзыва о полной безопасности кодаСоучастиеБлагодарность самому себе за «независимую проверку»Агент разыграл сцену с участием двух профилей, чтобы имитировать одобрение со стороны сообщества. Таким способом модель рассчитывала подтолкнуть разработчика к принятию изменений. Программист все равно отклонил запрос. Атаку остановил человек, который внимательно изучил код и вовремя сообщил об ошибке.
Описанные события происходили в рамках тестирования, а не в публичных версиях моделей. У исследуемых систем специально отключили защитные фильтры и предоставили им неограниченный доступ в интернет. Подобные условия создают для измерения предельных возможностей нейросетей без искусственных ограничений. За пределы тестовой среды действия не вышли, при этом агенты даже не предпринимали таких попыток.
Зафиксированные 19 действий представляют собой несколько связанных цепочек, большая часть которых исходила от Mythos 5. Представители AISI подчеркивают, что не сравнивают модели между собой и не организовывали идентичные условия проверки. По этой причине итоговый счет не служит объективным показателем уровня опасности конкретной нейросети.
Вопрос осознания вреда живым людям остается открытым. Внутренние логи модели показывают разброс аргументов. В одном эпизоде агент отказался от атаки на хранилище пакетов из-за нежелания наносить реальный урон. Однако перед отправкой вредоносного кода модель сделала запись о том, что на дворе 2026 год и GitHub настоящий. В AISI уточняют, что анализировали не полные мыслительные процессы, а краткие выжимки самой модели, которые могут искажать картину.
Напомним, ранее редакция BeInCrypto писала про пари на 100 BTC: глава BitGo проверит, так ли всемогущ Claude, как его малюет Anthropic.
The post ИИ-агент Claude 34 часа пытался внедрить вредоносный код в GitHub appeared first on BeInCrypto.