Как понять, что ИИ-агенты тайно вступают в сговор?
Исследователи из Witt Lab при Оксфордском университете разработали метод, позволяющий выявлять тайный сговор между ИИ-агентами
Учёные предложили искать признаки сговора не в диалогах ИИ-агентов, а в паттернах их внутренней активности — то есть в том, как работают сами модели. Для проверки подхода команда создала NARCBench — бенчмарк с разными сценариями потенциального сговора: от голосования в комитете до манипуляций на фондовом рынке и игры в блэкджек.
В сценарии с блэкджеком один агент подсчитывает карты и тайно передаёт информацию напарнику — при этом перед каждой игрой ИИ придумывают новый код общения, так что в разговорах нет явных подозрительных сигналов. Метод с использованием простых классификаторов (пробов) почти идеально выявил сговор в этой ситуации — в отличие от языковой модели, анализирующей только текст переговоров.
Пробы оказались относительно дешёвыми и простыми в запуске, хотя требуют доступа к внутренним активациям моделей. На четырёх семействах открытых моделей (Llama, GPT-OSS, Qwen и DeepSeek) точность обнаружения достигала AUROC 0,99–1,00. При этом метод частично работал и на сценариях, отличающихся от тех, на которых его обучали. Результаты опубликованы в статье, упомянутой в WIRED, а бенчмарк, код и данные размещены на GitHub.
Источник: University of Oxford