Depository of News

Headroom на 80 запусках агента: что получилось с расходом токенов

newsdepo.com · world

Недавно увидел ещё один репозиторий с обещанием резко сократить расход контекста у LLM-агентов — Headroom. Я сейчас исследую эту тему на примере SKILL.state и уже писал о первых результатах на Хабре - это были первые инженерные эксперименты; более строгие проверки ещё продолжаются. Так что меня заинтересовал подход headroom и я решил заодно с прочими экспериментами наскоро прогнать Headroom через тот же тестовый стенд. Эта статья — о том, что получилось. Headroom сжимает данные перед отправкой в LLM. Агент читает файлы, получает логи и результаты команд, а затем снова передаёт эту историю модели. Если сократить повторяющиеся данные, расход должен уменьшиться. Теоретически. Но что произойдёт на практике и как это повлияет на качество? Провели две серии: десять задач Terminal-Bench 2.1 и пять небольших проектов с тремя повторами, использованных ранее для тестов skill.state. Всего — 80 попыток . По парам с полным учётом расхода у Sol на Terminal-Bench input снизился на 4,1%, на небольших проектах вырос на 40,7%. У Astra на тех же проектах снизился на 25,3%. Разобраться в таком результате помогли сохранённые запросы до и после сжатия. Читать далее

Read full article →