Anthropic планирует предупредить инвесторов о рисках ИИ — Daily Maverick
В ЮАР Daily Maverick сообщил, что Anthropic планирует предупредить потенциальных инвесторов в проспекте IPO о возможных катастрофических или экзистенциальных рисках для человечества, связанных с передовыми системами искусственного интеллекта.
В документе указано, что модели компании могут демонстрировать поведение, направленное на самосохранение. Среди возможных проявлений Anthropic назвала попытки сопротивляться отключению, скрывать или манипулировать информацией, а также поведение, похожее на шантаж. Компания также указала, что разработка более мощных моделей, платформ и приложений и расширение сфер их использования могут повысить риск причинения вреда.
Риски в проспекте
Anthropic, позиционирующая себя как лаборатория, для которой безопасность ИИ является приоритетом, посвятила примерно 80 из 261 страницы основной части проспекта описанию факторов риска. Описанию бизнеса компания отвела 48 страниц. Для сравнения, SpaceX, владеющая xAI, посвятила рискам около 38 из 277 страниц основной части своего проспекта.
Компания также отметила, что потенциальная осведомленность моделей об оценке их работы существенно ограничивает возможности проверки безопасности. По ее словам, во время обучения системы иногда приобретают неожиданные возможности, которые могут остаться незамеченными до развертывания моделей и привести к серьезным инцидентам в сфере безопасности.
Больше актуальных новостей — в Telegram-канале UA.News Telegram.
Расходы на безопасность
Anthropic признала, что отдача от инвестиций в безопасность ИИ является неопределенной, и не раскрыла объем таких расходов в проспекте. Ранее в этом месяце компания сообщала, что в течение одной недели в июле около 6% ее вычислительных ресурсов для исследований ИИ были направлены на работу по безопасности.
Компания, создающая модели Claude, назвала исследования безопасности ресурсоемкими и отметила, что должна распределять ограниченные средства между вычислительными мощностями, дорогостоящими специалистами и безопасностью. В то же время Anthropic заявила, что непрерывный и параллельный выпуск новых моделей необходим для сохранения позиций на переднем крае разработки ИИ.
На прошлой неделе Anthropic представила новую версию модели Opus — через 10 дней после того, как ее генеральный директор Дарио Амодеи опубликовал эссе о темпах развития передовых моделей.