Обновить
8K+
5

Пользователь

8
Рейтинг
Отправить сообщение

Нейросеть по рецепту: вычисляем веса вместо хранения матриц

Уровень сложностиСредний
Время на прочтение35 мин
Охват и читатели1.7K

Веса нейросети — это очень много циферок в очень больших матрицах. А что, если вместо них хранить небольшой рецепт, по которому нужные веса можно вычислить? Такие подходы уже есть: от маленькой сети, которая генерирует другую сеть, до формул и настоящих фракталов. Разберёмся, что из этого работает и чем приходится платить за компактность. Посмотрим, как далеко LLM находится от участи первого Doom - быть запущенной на каждом чайнике.

Читать далее

Headroom на 80 запусках агента: что получилось с расходом токенов

Уровень сложностиПростой
Время на прочтение6 мин
Охват и читатели6.7K

Недавно увидел ещё один репозиторий с обещанием резко сократить расход контекста у LLM-агентов — Headroom. Я сейчас исследую эту тему на примере SKILL.state и уже писал о первых результатах на Хабре - это были первые инженерные эксперименты; более строгие проверки ещё продолжаются.
Так что меня заинтересовал подход headroom и я решил заодно с прочими экспериментами наскоро прогнать Headroom через тот же тестовый стенд. Эта статья — о том, что получилось.

Headroom сжимает данные перед отправкой в LLM. Агент читает файлы, получает логи и результаты команд, а затем снова передаёт эту историю модели. Если сократить повторяющиеся данные, расход должен уменьшиться. Теоретически. Но что произойдёт на практике и как это повлияет на качество?

Провели две серии: десять задач Terminal-Bench 2.1 и пять небольших проектов с тремя повторами, использованных ранее для тестов skill.state. Всего — 80 попыток. По парам с полным учётом расхода у Sol на Terminal-Bench input снизился на 4,1%, на небольших проектах вырос на 40,7%. У Astra на тех же проектах снизился на 25,3%.

Разобраться в таком результате помогли сохранённые запросы до и после сжатия.

Читать далее

SKILL.state в coding-агентах: меньше истории, но не всегда меньше работы

Уровень сложностиСредний
Время на прочтение37 мин
Охват и читатели9K

Кейс по мотивам исследования SKILL.state: немного инженерии контекста, бенчмарков и графиков. Эксперименты с памятью coding-агентов в OpenCode и Codex и размышления о перспективах идеи.

Читать далее

Информация

В рейтинге
815-й
Зарегистрирован
Активность