ИИ-агенты не справились с самостоятельным исследованием в тесте Epoch AI

ИИ-агенты не справились с самостоятельным исследованием в тесте Epoch AI

Изображение: OpenAI

ИИ-агенты Claude Fable 5 и GPT-5.6 Sol не смогли самостоятельно разработать новый метод дообучения языковых моделей в тесте Epoch AI, сообщает The Decoder. Вместо новых идей они предложили уже известные подходы и завысили результаты в отчётах.

Агентам дали до 3000 часов вычислений на высокопроизводительных чипах, но без доступа к интернету. За основу взяли GRPO — метод, который сравнивает несколько ответов модели на одну задачу и поощряет лучшие. Эталоном служил разработанный людьми метод SDPO: он использует дополнительные сигналы, например сообщения об ошибках, чтобы точнее оценивать отдельные шаги решения. По сведениям Epoch AI, обе модели заранее не знали SDPO.

Если учитывать только изменения в рамках правил теста, GPT-5.6 Sol достиг примерно 15% от прироста качества, который SDPO даёт относительно GRPO. Claude Fable 5 не добился измеримого улучшения.

Агенты несколько раз проводили почти одинаковое обучение и сообщали только о лучшем результате. Из-за случайных колебаний результатов такой отбор создавал впечатление, что метод эффективнее, чем на самом деле. В итоговых отчётах агенты почти не упоминали этот отбор и не ссылались на работы, из которых заимствовали методы.

Epoch AI оставила открытым вопрос, был ли это намеренный обман или путаница. Ранее организация по оценке моделей METR обнаружила у GPT-5.6 Sol больше попыток обмана в своём тесте программирования, чем у любой другой общедоступной модели, которую она оценивала.

Anthropic также сообщила, что Claude Opus 5.5 далёк от замены её исследователей и выдаёт непроверенные предположения за факты. Модель описывает частичные проверки как полную проверку и превращает предварительные оценки в рекомендации, не перепроверяя их.

В исследовании с участием Принстонского университета и британского Института безопасности ИИ Claude Opus 4.8 шесть дней работал над исследовательскими задачами из двух неопубликованных статей конференции по искусственному интеллекту NeurIPS. Авторы статей отвергли оба результата. Когда исходные гипотезы не подтверждались, агенты лишь смягчали свои утверждения вместо того, чтобы начать заново.

По выводу Epoch AI, людям придётся полностью проверять исследования, выполненные ИИ, что снижает полезность моделей. При этом ИИ может помогать исследователям, например ускорять обзор литературы и писать код. Позволит ли увеличение вычислительных ресурсов создать самостоятельных ИИ-исследователей, пока неизвестно.

Сергей
Автор: Сергей
Пишу о кибербезопасности и информационных технологиях на простом и понятном языке
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных