Нейросети научились сливать друг другу мозги в обход текста

Нейросети научились сливать друг другу мозги в обход текста

Изображение: recraft

Исследователи из университета Цинхуа предложили метод Cache-to-Cache (C2C), который позволяет нескольким большим языковым моделям передавать данные напрямую через внутренние состояния, минуя текст. Работу уже приняли на ICLR 2026, а код выложили в открытый доступ. Авторы заявили, что такой обмен ускоряет совместную работу моделей и поднимает качество ответов.

Обычная связка из нескольких нейросетей работает как офисная переписка через мессенджер. Одна модель разбирает задачу и печатает промежуточный вывод словами, вторая читает этот текст, заново его переваривает и только потом продолжает считать. Люди такую цепочку воспринимают нормально, а для железа это лишний круг вычислений и потерянные токены.

C2C предлагает вырезать этот разговор целиком. Одна модель передаёт другой не готовый текст, а собственное внутреннее представление данных, которое хранится в KV-кэше, рабочей зоне трансформера, где остаются результаты обработки уже пройденного контекста. Раньше эта зона работала только внутри самой модели, а теперь превращается в канал связи между разными нейросетями.

У двух моделей архитектура редко совпадает один в один, и просто перекинуть KV-кэш из одной в другую не получится. Разработчики выделили несколько параметров, из-за которых модели плохо понимают чужие внутренние данные:

  • число слоёв трансформера отличается от модели к модели;
  • размер скрытого пространства не совпадает между разными семействами весов;
  • конфигурация attention настроена по-разному под задачи каждой сети;
  • объём словаря токенов и способ его кодирования тоже расходятся;
  • набор обучающих данных задаёт собственную логику представлений у каждой сети.

Для решения этой нестыковки команда добавила отдельный нейросетевой блок под названием Fuser. Он переводит внутреннее представление одной модели в форму, понятную другой, и склеивает его с собственным состоянием той сети, которая данные принимает. По сути Fuser работает переводчиком между двумя нейронками, только переводит не с английского на китайский, а с внутреннего языка одной архитектуры на язык другой.

У системы есть второй фильтр под именем gating, обучаемый механизм, который решает, какие слои принимающей модели получат чужие данные, а какие продолжат считать самостоятельно. Слить в модель все данные соседней сети целиком было бы плохой идеей, поэтому gating выбирает точки, где сторонняя информация реально приносит пользу.

Отмечается, что вместо полной выгрузки внутреннего состояния система сама решает, каким слоям вообще нужны чужие данные, а какие справятся собственными силами.

Разработчики сравнили обмен через C2C с классической текстовой схемой на нескольких бенчмарках. В отчёте по проекту указали такие цифры:

  • точность выросла на 6,4-14,2% относительно одиночных моделей;
  • по сравнению с обменом через текст прирост составил 3,1-5,4%;
  • задержка совместной обработки сократилась примерно в 2,5 раза;
  • часть тестов прогнали на связках моделей разного размера, от компактных версий до 8 млрд параметров.

Эта цифра про 2,5 раза разошлась по сети как заголовок про ускорение на 150%, хотя по факту цифры означают другое. Система работает в 2,5 раза быстрее, это означает сокращение времени примерно на 60%, а не рост производительности на 250%. Корректнее говорить о кратном ускорении совместной обработки, а не о том, что нейросети внезапно поумнели в два с половиной раза.

Проект не ограничился одной научной статьёй. Команда выложила рабочий код и готовые Fuser-модули для нескольких связок весов, а список поддерживаемых пар уже содержит:

  • Qwen3 и Qwen2.5 в разных размерах, от компактных версий до 8 млрд параметров;
  • Llama 3.2 в паре с моделями семейства Qwen;
  • Qwen2.5-Math для математических задач;
  • заявленную поддержку произвольных пар с разным числом слоёв и размером скрытого пространства.

Для российских разработчиков это отдельный повод присмотреться к проекту. Все перечисленные модели относятся к открытым весам, а доступ к закрытым западным API у команд из России часто ограничен из-за санкций и блокировок платёжных систем. C2C даёт способ собрать связку из нескольких открытых нейросетей и сэкономить на вычислениях без похода за зарубежной подпиской.

У метода есть ограничение потяжелее лицензий. C2C нужен доступ к внутреннему KV-кэшу и архитектуре модели, а с закрытыми коммерческими сервисами это не работает. Пользователь такого сервиса получает только API или веб-интерфейс, отправляет запрос и получает ответ, но добраться до внутренних состояний ему никто не даст.

Стоит обратить внимание, что большая часть результатов пока получена самими авторами метода, поэтому независимая проверка на чужих задачах и связках весов только предстоит.

Проект продолжил расти за пределы связки из двух моделей. В сентябре 2026 года разработчики сообщили о подготовке следующего этапа работы. Ближайшие планы команды содержат:

  • систему, где обменом KV-кэша смогут управлять ИИ-агенты без участия человека;
  • серверную часть под многоагентные конвейеры;
  • расширение списка поддерживаемых семейств моделей;
  • публичную демонстрацию с несколькими источниками данных для одной принимающей сети.

Для локальных команд, которые уже гоняют Qwen или Llama на собственных серверах, такой апгрейд означает не только более быстрый пайплайн, но и независимость от зарубежных облаков. Пока большинство мультиагентных систем заставляют нейросети переписываться друг с другом почти по-человечески, C2C предлагает более машинный вариант, передавать часть уже посчитанного состояния сразу, без промежуточного текста для случайного читателя со стороны.

Эксперты CISOCLUB прокомментировали разработку и отметили её потенциал для мультиагентных систем. Отказ от текстового посредника между нейросетями способен ощутимо снизить расходы на инференс у команд, которые держат несколько моделей на одном сервере. Привязка к открытым весам остаётся главным ограничением, поскольку крупные проприетарные модели пока вне досягаемости метода. Gating-механизм задаёт интересный прецедент для будущих стандартов совместимости между разными архитектурами нейросетей. Интерес индустрии к подобным решениям будет расти по мере увеличения числа связок специализированных моделей внутри одного продукта. Уже в течение года подобные методы, вероятно, начнут тестировать команды опенсорсных мультиагентных фреймворков.

Ранее сообщалось, что МВД России предложило учитывать применение искусственного интеллекта как отягчающее обстоятельство при совершении ряда преступлений. Совместно с Минюстом и другими ведомствами министерство разрабатывает изменения в УК РФ и КоАП РФ, которые могут затронуть дела о клевете, незаконном доступе к компьютерной информации и создании вредоносных программ. Об этом сообщил первый замначальника управления МВД по организации борьбы с противоправным использованием ИКТ Сергей Калинин.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных