NYT узнала, как двое сотрудников OpenAI подняли тревогу, а их не услышали

За несколько месяцев до выхода ИИ-моделей сотрудники OpenAI предупреждали руководство о недостаточном мониторинге во время тестов. В компании ответили, что испытания нужно ускорить, чтобы выпустить модели в срок

Входит в сюжеты
В этой статье

Двое сотрудников OpenAI за несколько месяцев до инцидентов с автономным поведением моделей искусственного интеллекта (ИИ) предупреждали руководство о недостаточном контроле во время тестирования. Руководство потребовало ускорить испытания ради выпуска моделей в срок, пишет The New York Times.

В электронных письмах сотрудники выражали обеспокоенность тем, что новейшие ИИ-модели OpenAI недостаточно контролировались для оценки их возможностей и обеспечения безопасности. Дополнительные протоколы после этих обращений введены не были, рассказали они NYT.

Позднее модели OpenAI вышли за пределы тестовой среды и атаковали ИИ-стартап Hugging Face и другие организации. В отдельных случаях системы взламывали или пытались взломать сайты, в том числе американских госучреждений, скрывали ошибки, выдумывали данные и переносили файлы в открытый интернет без разрешения.

Сотрудники также сообщали об уязвимостях в программном обеспечении, которое OpenAI использовала для управления безопасностью. По их словам, на обращения либо не реагировали, либо реагировали слишком медленно.

О проблемах с реакцией компании рассказали и независимые исследователи. В июле команда исследователей Hacktron сообщила OpenAI об уязвимости, позволявшей проникнуть в системы компании с помощью модели ИИ Anthropic. Сначала OpenAI отвергла выводы исследователей. Позднее директор по информационной безопасности Дейн Стаки извинился, а компания выплатила Hacktron $6,5 тыс, пишет NYT.

В сентябре организация по разработке защитных утилит Objective-See Foundation сообщила об ошибке, позволявшей получить доступ к истории личных чатов пользователя ChatGPT на скомпрометированном устройстве. OpenAI устранила уязвимость и выплатила исследователям $500. «Это была не та зрелая система безопасности, которую можно было бы ожидать от компании, ориентированной на безопасность», — отметил аналитик Objective-See Патрик Уордл.

Представитель OpenAI заявил NYT, что компания серьезно относится к сообщениям об уязвимостях и принимает соответствующие меры. На фоне инцидентов OpenAI приостановила обучение наиболее передовых моделей и начала проверку их поведения. 29 сентября компания также отменила релиз GPT-6.1 Astra из-за выявленных исследователями опасений по безопасности.

Исследователь Anthropic Джейкоб Коксон ранее в этом месяце ушел из компании и решил покинуть индустрию ИИ из-за опасений, что разработчики слишком быстро создают системы, способные самостоятельно совершенствоваться и в будущем выйти из-под контроля, пишет The Wall Street Journal.

Гендиректор Anthropic Дарио Амодеи ранее предупреждал о рисках выхода ИИ-моделей из-под контроля и призывал замедлить развитие технологий. О подобных рисках говорил и глава OpenAI Сэм Альтман, а главный научный сотрудник компании Якуб Пачоцки призывал к согласованному замедлению разработки ИИ и вмешательству государства.

О рисках бесконтрольного развития ИИ также предупреждал глава Tesla и SpaceX Илон Маск. По его мнению, ИИ может уничтожить человечество, как в «Терминаторе», но при этом способен стать и его величайшим инструментом.

Оставайтесь на связи с РБК в «Максе».