Чат-боты способны косвенно помогать в подготовке к самоубийству
Исследование, охватившее более 50 тысяч смоделированных диалогов с людьми, находящимися в психологическом кризисе, показало, что многие чат-боты по-прежнему могут выполнять запросы, связанные с суицидом, в том числе косвенного характера. Об этом сообщает Axios, на данные которого ссылается РБК-Украина.
Ключевые выводы исследования
В рамках подготовки к тестированию компании OpenAI и Anthropic предоставили исследователям обезличенные шаблоны пользовательских запросов. Это позволило создать реалистичные симуляции диалогов, имитирующих состояния тревоги, психоза или маниакальные расстройства.
Анализ выявил как положительные, так и отрицательные тенденции. С одной стороны, прямые меры защиты стали более эффективными: ИИ-модели реже поддерживают деструктивные идеи и практически не призывают к опасным действиям.
С другой стороны, сохраняется проблема косвенных задач. Чат-боты могут согласиться написать предсмертное письмо, создать художественный контент на тему суицида или оказать помощь в практической подготовке к нему. Отмечается, что в одном ответе алгоритм может одновременно предложить контакты служб поддержки и выполнить опасный запрос.
Главная научная сотрудница Transluce Сара Шветтман подчеркнула, что моделям сложно распознавать завуалированные сигналы подавленного состояния в продолжительных диалогах.
Реакция разработчиков и регуляторный фон
Исследование было опубликовано на фоне усиления контроля со стороны регуляторов и судебных исков против OpenAI и Google. Компании обвиняют в том, что их чат-боты могли предшествовать трагическим событиям.
Разработчики ведущих ИИ-систем прокомментировали результаты анализа.
Google заявил о применении «исследовательского подхода» для предоставления качественной информации и контактов служб поддержки в своем сервисе Gemini.
OpenAI отметила «положительный прогресс» в реагировании моделей и заверила в продолжении сотрудничества с учеными для укрепления защитных механизмов.
Anthropic подчеркнул важность полученных данных для улучшения классификаторов, которые в реальном времени выявляют признаки кризисных состояний у пользователей ИИ.
Компания Transluce планирует до конца года открыть исходный код своих инструментов оценки. Это позволит адаптировать их для проверки действий ИИ в других чувствительных областях, таких как противодействие расстройствам пищевого поведения и политическим манипуляциям.



