Команды ИИ-агентов дали статистически значимый прирост качества лишь в одном из четырёх сравнений

Команды ИИ-агентов дали статистически значимый прирост качества лишь в одном из четырёх сравнений

Изображение: OpenAI

Команды ИИ-агентов показали статистически значимое улучшение качества только в одном из четырёх сравнений с одиночными агентами, пишет The Decoder. Такой прирост, 7,3 балла, дала только команда GPT-6 Sol на среднем уровне рассуждений. По оценке издания, в большинстве случаев дополнительные расходы на команды агентов не окупаются.

На максимальном уровне рассуждений ни Sol, ни Opus 5.5 заметного преимущества не получили.

Исследователь OpenAI Noam Brown подтвердил в подкасте Dwarkesh, что несколько агентов в основном ускоряют работу, а не улучшают результат: четыре агента решали задачи вдвое быстрее, но и обходились вдвое дороже. По его словам, поиск информации в интернете и математические задачи хорошо поддаются распараллеливанию, а написание романа — нет.

В двух собственных тестах Anthropic с Opus 5.5 добавление агентов давало всё меньший прирост качества. Большие команды быстрее достигали заданного уровня, но переход от десяти к 100 агентам лишь немного улучшил оценки после 24 часов работы. В отдельных испытаниях ускорение сопровождалось ростом расхода токенов.

Сергей
Автор: Сергей
Пишу о кибербезопасности и информационных технологиях на простом и понятном языке
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных