ИИ-агент Lenovo возглавил рейтинг облегчённой версии SWE-bench-Live

Изображение: OpenAI
TianxiCode, агент Lenovo для разработки ПО на базе DeepSeek-V4.1-Flash, возглавил рейтинг облегчённой версии теста SWE-bench-Live, сообщает Pandaily. Он решил 213 из 300 задач (71%) и прошёл официальную проверку результата.
Результат не распространяется на полный и многоязычный рейтинги SWE-bench-Live. Отрыв от ближайшего участника с подтверждённым результатом небольшой: тот набрал 70,33%. По оценке издания, результат показывает, чего может добиться недорогая облегчённая модель в паре с сильным агентом.
Задачи теста взяты из реальных проектов GitHub: агент должен подготовить исправление, которое устраняет проблему в воспроизводимом программном окружении. Для официальной проверки команды передают организаторам полную историю действий агента. Проверяющие изучают исходные данные тестирования и настройки изоляции, чтобы выявить возможные утечки эталонных решений или тестов.
По описанию Lenovo, DeepSeek-V4.1-Flash читает код и предлагает исправления, а TianxiCode помогает искать причину ошибки в разных файлах и управляет работой с инструментами. Агент составляет план отладки и запускает тесты в терминале, меняя подход, если зашёл в тупик. Затем он проверяет новый код в изолированном окружении и дорабатывает исправление, пока оно не пройдёт тесты.
Результатов TianxiCode с другими моделями Lenovo не публиковала.
Lenovo планирует внедрить эти разработки в инструменты для программистов и свои устройства с ИИ. Компания пока не назвала сроки и не уточнила, какие устройства получат эту технологию.



