Назад к блогу

Обвязка важна не меньше модели

Модель является лишь частью агентной системы. Промпты, инструменты, контекст, восстановление после ошибок, оценка и память образуют обвязку вокруг нее. Что говорят исследования и как измерять влияние на качество и расход токенов.

Обвязка важна не меньше модели
VISUAL INPUT harness-not-model

Обвязка важна не меньше модели

Одна и та же языковая модель может вести себя по-разному в зависимости от окружающей системы. Постановка задачи, доступные инструменты, выбор контекста, повторы, оценка и память влияют на траекторию агента. Вместе эти части образуют его обвязку.

Это не делает модель неважной. Качество модели является лишь одной переменной агентной системы. Прежде чем менять модель или делать выводы по счету за токены, стоит проверить runtime вокруг нее.

Что входит в обвязку

Обвязка ставит задачу, предоставляет инструменты, выбирает релевантный контекст, проверяет действия, сохраняет результаты и определяет поведение после ошибки. Claude Code, Codex, Cursor и самописный цикл агента принимают разные решения в каждой из этих частей.

Эти решения могут менять и качество, и стоимость. Четкая схема действия способна предотвратить неудачный вызов. Релевантные фрагменты файлов могут сократить лишнее чтение. Ограниченная политика повторов может остановить цикл. Ни один из этих контролей не гарантирует успех, но каждый можно проверить на конкретном режиме отказа.

Расход токенов зависит от траектории

Токены накапливаются по всей траектории, а не только в финальном успешном ответе. Повторные вызовы инструментов, широкое чтение файлов, неверные действия и неограниченные повторы увеличивают входной контекст и генерацию. Более точный выбор контекста или восстановление после ошибки может снизить этот расход, но результат зависит от задачи, модели, инструментов и политики.

Измеряйте всю систему: успех задачи, задержку, входные и выходные токены, долю повторов, ошибки инструментов и цену оценки. Меньший расход токенов не полезен, если он получен ценой пропуска важной работы или худшего ответа.

Что сообщает Life-Harness

Life-Harness исследует замороженные LLM-агенты в семи детерминированных средах из tau-bench, tau²-bench и AgentBench. Вокруг модели добавляются environment contract, procedural skill, action realization и trajectory regulation. Веса модели и среды остаются фиксированными, а обвязка развивается на обучающих траекториях без обновления весов.

Авторы сообщают улучшения в 116 из 126 сочетаний модели и среды на 18 тестируемых моделях, со средним относительным приростом 88.5%. Они также сообщают перенос обвязки, развитой на траекториях Qwen3-4B-Instruct, на 17 других тестируемых моделей. Это результаты по успешности в средах статьи, а не прямое измерение общей экономии токенов или надежности в production.

Четыре компонента помогают поставить практические вопросы. Предотвращает ли contract предсказуемое неверное действие? Убирает ли сохраненная процедура повторяющийся шаг восстановления? Упрощает ли action realization проверку вызова инструмента? Останавливает ли regulation наблюдаемый цикл? На эти вопросы нужны тесты, а не предположения.

Что сообщает Meta-Harness

Meta-Harness ищет код обвязки во внешнем цикле оптимизации, используя исходный код, оценки и трассы прошлых кандидатов. Результаты статьи охватывают онлайн-классификацию текста, RAG-математику и агентное программирование. В режиме онлайн-классификации авторы сообщают до четырех раз меньше контекстных токенов по сравнению с конкретным baseline управления контекстом и прирост в 7.7 пункта.

Эта цифра относится к бенчмарку и baseline статьи. Ее нельзя переносить на кодовые задачи или всех агентов. Более устойчивый вывод в том, что обвязку можно системно проверять и улучшать, а не считать неизменной оболочкой модели.

Улучшайте систему осознанно

Начните с одной наблюдаемой ошибки. Уберите лишний вывод инструментов. Передавайте подтвержденные данные вместе с задачей, вместо того чтобы заставлять модель находить их заново. Изолируйте рискованные эксперименты, ограничивайте повторы и добавляйте проверки там, где детерминированный инструмент может дать ответ. Затем сравните старую и новую политику на типичных задачах.

Это инженерия обвязки. Она дополняет выбор модели, retrieval, инструменты и оценку, а не заменяет их. Цель не в лозунге о моделях, а в системе, которая показывает, почему она сработала, где ошиблась и во что обошлось изменение.


Связанная статья: Как экономить токены в LLM.