Основная навигация

Meta-Harness: безопасные самоулучшающиеся корпоративные ИИ-процессы

Продуманная метаобвязка помогает корпоративным командам безопасно улучшать агентные процессы для долгосрочных задач программирования.

Краткое резюме

  • Существующие системы автономного улучшения показывают высокие результаты в задачах программирования, однако неясно, способны ли они совершенствовать сложные многоэтапные ИИ-процессы, похожие на реальные корпоративные решения.

  • Наш исследовательский проект Meta-Harness применяет автономное самоулучшение к агентному поиску, глубокому исследованию и процессам сигнальной аналитики, дополняя их корпоративными требованиями: оценкой на отложенных данных, возможностью аудита, контролем бюджета и утверждением человеком.

  • В трёх типичных сценариях Meta-Harness существенно повысил производительность: показатели Signal Engine на отложенных тестовых данных улучшились на 84%, а агентный мультимодальный поиск стал точнее при 16-кратном ускорении выполнения.

  • В отличие от большинства предыдущих подходов Meta-Harness по возможности измеряет успех на отложенных наборах данных, чтобы проверить, распространяются ли улучшения за пределы данных, использованных при оптимизации.

  • Результаты показывают, что автономное улучшение рабочих процессов применимо не только к бенчмаркам по программированию, но и к реальным корпоративным ИИ-системам, открывая практический путь к непрерывному совершенствованию ИИ-приложений.

Недавние исследования в области автономного ИИ, включая статью Meta-Harness, фреймворк CORAL и проект karpathy/autoresearch, показали, что при наличии метрики оценки агенты для программирования могут итеративно улучшать решение. Остаётся открытым вопрос, применимы ли эти методы к сложным многоэтапным ИИ-процессам — например, к агентному мультимодальному поиску, где агент должен итеративно выполнять поиск по мультимодальным отраслевым корпусам, чтобы ответить на вопрос, — или к сложным конвейерам обработки данных, требующим множества зависимых этапов, вызовов инструментов и решений по обработке исключений. Более фундаментальный вопрос — сохраняются ли эти улучшения на данных, которых оптимизатор никогда не видел.

Наш проект Meta-Harness R&D отвечает на этот вопрос. Он развивает идеи недавних исследований с учётом корпоративных требований: оценки на отложенных данных, журналов аудита, предельных затрат и чёткой передачи результата человеку на проверку перед выпуском.

Мы протестировали его на трёх многоэтапных задачах, смоделированных на основе реальной работы с клиентами. Signal Engine отслеживает в реальном времени поток публикаций в X о рынке ИИ и формирует структурированные отчёты о тенденциях со ссылками на надёжные источники. Агентный мультимодальный поиск анализирует запросы, сочетающие текст и изображения, и возвращает наиболее релевантные страницы документов. Глубокое исследование координирует нескольких агентов, которые ищут информацию в интернете, перекрёстно проверяют источники и готовят развёрнутые исследовательские отчёты.

Кратко о результатах

  • Signal Engine: сводная оценка на отложенных тестовых данных выросла с 0,456 до 0,841 — относительный прирост составил 84%. При том же бюджете показатели CORAL и karpathy/autoresearch остались ниже 0,50.

  • Агентный мультимодальный поиск: NDCG@10 на отложенных тестовых данных вырос с 0,705 до 0,744, а фактическое время одной оценки сократилось с 869 до 54 секунд. Это означает 16-кратное ускорение при более высокой точности.

  • Глубокое исследование: сводная оценка качества отчётов по 10 контрольным вопросам выросла с 0,449 до 0,802 против примерно 0,52 у базовых методов. Для этой задачи не было отложенной выборки, поэтому результат относится только к данным обучения.

  • Эффективность поиска: благодаря прогнозному переранжированию гипотез Signal Engine достиг 91% лучшего результата эталонного запуска за 3 итерации вместо 20 при том же бюджете оценки.

Большинство систем автономного исследования оптимизируются и оцениваются на одном наборе данных, поэтому невозможно понять, обобщается ли полученный результат на новые данные. Для Signal Engine и агентного мультимодального поиска мы применяем строгое разделение: обучающий набор, на котором оцениваются кандидаты, валидационный набор для базовых проверок и отложенный тестовый набор, который оптимизатор никогда не видит. Каждый опубликованный результат получен для одной конкретной версии кода, оценённой на всех выборках, поэтому мы никогда не объединяем лучший результат одного кандидата на обучающей выборке с лучшим тестовым результатом другого.

Как это работает

В каждом раунде обвязка формирует пакет структурированных гипотез об изменении кода. В каждой гипотезе указываются изменяемый механизм, предыдущая версия, на которой она основана, и целевой сценарий сбоя. На этапе ранжирования пакет фильтруется до запуска ресурсоёмких оценок. Отобранные гипотезы передаются параллельно работающим агентам. Они используют общую базу знаний, но редактируют код в полностью изолированных рабочих областях, поэтому каждый кандидат оценивается объективно и независимо. В конце раунда система выбирает одного победителя: кандидата с наивысшей оценкой, который также прошёл все проверки на доступных выборках. Этот победитель становится основой следующего раунда. Каждое испытание сохраняет фиксированный набор данных в хранилище, где записи можно только добавлять: патч кода, оценки по каждой выборке, журнал событий и четыре кратких анализа от LLM — хода выполнения, ошибок, затрат и результатов рефлексии. На следующем раунде модуль генерации предложений перечитывает эту историю. Так обвязка накапливает знания, а не повторяет уже выявленные тупиковые варианты.

Схема рабочего процесса Meta-Harness: входные данные, оценка исходной версии, поиск гипотез, параллельные команды агентов, рабочая область оценки, результаты проверки, хранилище доказательств, контроль безопасности и затрат.

Безопасность цикла обеспечивают три защитных механизма. Политика области изменений ограничивает файлы, которые может затрагивать кандидат, и отменяет все изменения за её пределами. Бюджеты токенов и времени останавливают запуск при превышении лимита затрат, а ограничения параллелизма удерживают обвязку в рамках квот моделей и GPU. При этом сама обвязка ничего не выпускает в рабочую среду. Она формирует ранжированного и полностью документированного кандидата, после чего инженер проверяет разницу и решает, следует ли переносить изменения в рабочую среду.

Внутреннее устройство

В локальном стеке каждый раунд описанного цикла опирается на пять базовых инженерных механизмов.

  • Изоляция рабочих областей. Отдельное рабочее дерево git для каждого кандидата. Форки используют общую базу объектов, но не имеют доступа к файлам друг друга. Это позволяет запускать кандидатов параллельно при почти неизменном расходе дискового пространства и легко сравнивать их с текущим лидером.

  • Изолированная среда выполнения. Конфигурация задаёт один из двух режимов: нативный подпроцесс для быстрых итераций или полностью изолированную среду выполнения. Корпуса подключаются только для чтения, а временный каталог каждого испытания удаляется после оценки. Поэтому испытание не может изменить набор данных или передать своё состояние следующему испытанию.

  • Политика области изменений. Список разрешённых путей, заданный в конфигурации эксперимента. До оценки испытания любые изменения за его пределами отменяются, а испытание помечается. Таким образом, проверяющий гарантированно видит только разницу в пределах заявленной области.

  • Соблюдение бюджета. Три уровня: лимиты токенов и времени для каждого испытания, общий предел для запуска и ограничение параллелизма. Вместе они обеспечивают предсказуемые затраты и удерживают обвязку в рамках квот моделей и инфраструктуры.

  • Хранилище доказательств. JSONL-файл с дозаписью, содержащий патч кода, оценки по каждой выборке, журнал событий и четыре анализа от LLM. Материализованные представления — таблица лидеров, текущий лидер и индекс сбоев — обновляются после каждого испытания. Благодаря этому следующие раунды учитывают накопленную историю, а каждый запуск можно воспроизвести побайтно.

Все эти механизмы обязательны. Задача обвязки — по завершении запуска предоставить проверяющему результат, который действительно можно утвердить: победившего кандидата, ограниченный набор изменений, полную историю испытанных вариантов и известную стоимость. Если убрать хотя бы один из пяти механизмов, исчезнет одна из этих гарантий.

Прогнозное переранжирование гипотез

Во всех трёх экспериментах используется одна стратегия работы с гипотезами. На каждой итерации модуль генерации предложений создаёт больше гипотез, чем позволяет бюджет на их выполнение: M = 8 кандидатов при лимите запуска K = 4. Затем отдельный LLM-ранжировщик за один тридцатисекундный вызов упорядочивает все 8 вариантов, учитывая всю доступную информацию: текущий лучший результат и его слабые аспекты, анализ ошибок недавних испытаний и все 8 предложений для прямого сравнения. Четыре лучших варианта передаются исполнителю, причём каждый требует от 15 до 30 минут. Остальные четыре отбрасываются без каких-либо затрат.

Оценка

Базовые модели оставались неизменными на протяжении всех экспериментов: обвязка редактировала только окружающий их код. Signal Engine и глубокое исследование работали на gpt-5.5. Агентный мультимодальный поиск работал на модели Qwen3.6-35B-A3B с открытыми весами, локально развёрнутой через vLLM и дополненной системой поиска изображений ColQwen3-4B. Такое сочетание выбрано ради предсказуемой стоимости локальной эксплуатации.

На диаграмме ниже показано изменение оценок по трём основным задачам. Seed — исходный код, написанный инженером. Meta-Harness — лучшая версия, найденная Meta-Harness. На отложенном тестовом наборе результаты улучшились по всем трём задачам.

Столбчатая диаграмма сравнивает исходную версию и Meta-Harness по задачам Signal Engine, агентного мультимодального поиска и глубокого исследования. Meta-Harness лидирует во всех отложенных тестах.

Signal Engine оценивался LLM-судьёй по актуальности, фактической точности, детализации и тону на 150 обучающих и 150 отложенных тестовых публикациях. За время запуска лучшая версия повысила сводную оценку на обучении с 0,431 до 0,756, а оценку на отложенных данных — с 0,456 до 0,841. Прирост обеспечили изменения самой обвязки, а не только корректировки промптов: наиболее успешные итерации научились фильтровать шум из социальных сетей, добавили перекрёстную проверку фактов и обязали каждый ответ опираться на явные доказательства. На схеме ниже показан итерационный процесс.

Линейный график обучающих испытаний Signal Engine: текущий лучший результат и оценки на отложенных данных растут от исходного уровня к цели по мере итераций исследования и доработки.

История испытаний показывает, как накапливались улучшения. Одно из первых структурных изменений повысило текущий лучший результат до 0,625; более детальная работа с подтверждающими данными довела его до 0,679; а усовершенствованный цикл рефлексии и оценки по заданным критериям — до 0,819. Примерно половина всех запусков кандидатов показала худшие результаты или завершилась с ошибкой, однако они не искажали таблицу лидеров: каждый форк работал изолированно, неудачные изменения отбрасывались, а сведения об ошибках записывались в хранилище рефлексии, чтобы следующий модуль предложений не повторял тот же тупиковый путь.

Особенно важно, что на протяжении всего запуска кривая отложенной выборки росла вместе с кривой обучения. Это позволяет предположить, что обвязка действительно улучшала рабочий процесс, а не запоминала обучающий корпус. Оценки на отложенной выборке оказались немного выше обучающих; мы объясняем это обычным шумом выборки между двумя небольшими непересекающимися наборами.

Агентный мультимодальный поиск измеряется по NDCG@10 на общедоступной выборке Computer Science из ViDoRe V3, разделённой на 20 обучающих, 10 проверочных и 20 отложенных тестовых запросов. Обвязка повысила NDCG@10 на отложенной выборке с 0,705 до 0,744, одновременно сократив общее фактическое время оценки с 869 до 54 секунд.

Глубокое исследование оценивается LLM-судьёй по совокупному показателю содержательного качества и качества ссылок в соответствии с DeepResearch-Eval на 10 контрольных вопросах. Улучшенный код повысил среднюю оценку с 0,449 до 0,802. Победившие изменения легко увидеть в разнице версий: предварительный этап планирования, сравнивающий подходы до запуска исследовательских агентов, и финальная проверка аспектов, по которым отчёты ранее получали низкие оценки. Поскольку этот набор невелик, а его оценка обходится дорого, мы не стали разделять данные и считаем результат полученным на обучающей выборке.

Сравнение с CORAL и karpathy/autoresearch

Столбчатые диаграммы сравнивают Meta-Harness, CORAL и karpathy/autoresearch по оценкам Signal Engine, агентного мультимодального поиска и глубокого исследования, а также по задержке оценки.

Мы сравнили все три метода при одинаковом бюджете: одни и те же наборы данных, базовые модели, лимит итераций и общее число оценок кандидатов. В Signal Engine Meta-Harness достигает 0,841 на отложенном тесте, тогда как результаты обоих базовых методов остались ниже 0,50. В агентном мультимодальном поиске наша команда получила наивысший NDCG@10 на отложенном тесте — 0,744 против 0,700 у CORAL и 0,738 у karpathy — и выполняет официальную оценку в 12–14 раз быстрее: за 54 секунды против 786 и 650 секунд. В глубоком исследовании наша команда достигла 0,802, тогда как результаты обоих базовых методов остались около 0,52. Есть важная оговорка: мы воссоздали CORAL и karpathy/autoresearch по опубликованным описаниям, поэтому разрыв может быть обусловлен не только различиями методов, но и особенностями реализации.

Разрыв объясняют четыре архитектурных решения. Во-первых, наша команда создаёт структурированную архитектурную спецификацию до редактирования кода. Это способствует выбору структурных изменений, например добавлению новых этапов конвейера, вместо корректировки промптов. Во-вторых, она параллельно запускает форки на основе общего кандидата-лидера, поэтому улучшения накапливаются быстрее, чем у независимых агентов CORAL или в строго последовательном цикле karpathy. В-третьих, каждое испытание создаёт структурированные артефакты — оценки, журналы событий и четыре анализа от LLM, — которые затем читает модуль генерации предложений, тогда как базовые методы сохраняют лишь простые журналы попыток. В-четвёртых, адаптивный контроллер после периода без улучшений направляет модуль предложений на исследование, а после успеха — на доработку. Поверх него работает прогнозное переранжирование гипотез, отбрасывающее слабые идеи до расходования бюджета.

Чего мы пока не показали

Кривые отложенной выборки демонстрируют обобщение внутри предметной области, а не перенос между областями: не следует ожидать, что процесс, настроенный на извлечение сигналов о рынке ИИ, без повторного запуска обвязки так же хорошо справится с юридическими или биомедицинскими текстами. Кроме того, обвязка оптимизирует только то, что измеряет оценщик. Поэтому при зашумлённом обучающем наборе или неверно откалиброванном судье она будет столь же последовательно переобучаться под их недостатки. Перед серьёзным запуском мы рекомендуем подготовить не менее 20 тщательно отобранных обучающих примеров и отдельную проверочную выборку. Главное практическое ограничение — стоимость. При каждой оценке весь конвейер повторно выполняется на всех выборках. Только выбранный кандидат для поиска израсходовал около 2,2 миллиона входных токенов, а серьёзная оптимизация с моделью класса gpt-5.5 обходится в сумму от нескольких сотен до нескольких тысяч долларов на задачу. Наконец, эти показатели получены в одиночных запусках, а не в повторных испытаниях, поэтому мы публикуем их в инженерном блоге, а не в виде формального исследования.

Заключение

Meta-Harness показывает, что автономное улучшение кода можно сделать достаточно управляемым для корпоративного применения. Для этого нужны структурные гипотезы, прогнозная предварительная фильтрация, изолированная оценка, тестирование на отложенных данных везде, где это возможно, и полный аудиторский след каждого принятого изменения. Вместе они дают инженерной команде предсказуемый путь от работающего исходного конвейера к измеримо лучшему, а руководителю эксплуатации — понятную модель: преимущества автономного исследования в строгих рамках с контролем бюджета и обязательным участием человека перед выпуском.

Авторы

David Huang, Bjorn Jee