Команды ИИ-агентов дали статистически значимый прирост качества лишь в одном из четырёх сравнений

Изображение: OpenAI
Команды ИИ-агентов показали статистически значимое улучшение качества только в одном из четырёх сравнений с одиночными агентами, пишет The Decoder. Такой прирост, 7,3 балла, дала только команда GPT-6 Sol на среднем уровне рассуждений. По оценке издания, в большинстве случаев дополнительные расходы на команды агентов не окупаются.
На максимальном уровне рассуждений ни Sol, ни Opus 5.5 заметного преимущества не получили.
Исследователь OpenAI Noam Brown подтвердил в подкасте Dwarkesh, что несколько агентов в основном ускоряют работу, а не улучшают результат: четыре агента решали задачи вдвое быстрее, но и обходились вдвое дороже. По его словам, поиск информации в интернете и математические задачи хорошо поддаются распараллеливанию, а написание романа — нет.
В двух собственных тестах Anthropic с Opus 5.5 добавление агентов давало всё меньший прирост качества. Большие команды быстрее достигали заданного уровня, но переход от десяти к 100 агентам лишь немного улучшил оценки после 24 часов работы. В отдельных испытаниях ускорение сопровождалось ростом расхода токенов.



