Обновить
1
Максим@Petroleum_man

Шило в мягких тканях ягодиц

0,1
Рейтинг
Отправить сообщение

от создателей "просто предсказывают следующий токен"

Qwen3.6 27b по всем бенчам обходит gemma 31b, требования к железу аналогичные в целом.

Про ручную сборку промптов не понял, любой движок конвертирует запрос через chat template. Я не прав? Там конечно есть нюансы - разные модели чуть по разному обрабатывают входные роли, но уж токены а-ля <start_of_turn> зачем руками расставлять? И нет никакой проблемы перенести промпт между моделями, если движок конвертирует через корректный chat template.

Про используемые сэмплинг параметры ещё бабка надвое сказала, не такой там большой диапазон рабочих параметров, чтобы ими гибко управлять. На маленькой модели нестандартная температура скорее приведет к более частым протечкам токенов в ответ или циклам.

Отдельно стоит сказать про то, что новые модели это всегда баги движка, особенно если используется mtp, стриминг, тул колинг.

Реальный опыт это:

- обновили vllm, всё сломалось

- поставили корректную версию, гпу недозагружена

- модель 1 раз из 10 выдаёт цикл, 1 раз из 10 неправильно генерирует порядок токенов, движок неправильно парсит, получаете thinking секцию в content или тул колл как сырой json. 1 раз из 10 модель выдает рандомный бред. Количество проблем увеличивается с ростом сложности задачи и входных токенов.

Сдаётся, что фот это копейки в структуре затрат, основа - кап затраты на железо, электричество, обслуживание, при чем не только для текущих продаж, но и трен новых моделей. Если остановить инвестиции в железо и будущие модели, все компании первый год получат хорошую прибыль. Но через год тю тю, конкуренты обойдут

.

В целом всë эссе построено на том, что ИИ заменит человека. А потом мимоходом говорится про то, что ИИ до сих пор никак не повлиял на макроэкономические параметры. Так он заменит или никак не повлияет?

Штраф за что прилетал? Платная парковка всегда либо знаком, либо разметкой отмечена. Нет знака, нет разметки - значит бесплатная. То же самое - про то, а можно ли там вообще парковаться (ПДД, знаки, разметка)

С бензом история завелась, но будут ли люди делиться бесплатными местами - большой вопрос

Какие тулы есть у вашего агента?

Обычно все дают что то вроде grep, search files, web query

Интересны технические детали для маленькой модели. Если агент сам подтягивает контекст, то он может несколькими тул коллами забить себе контекст. Если делать compaction, то контекст в рамках одного хода рвётся. Как решали это?

У вас просто qa rag бот или умеет тулы вызывать и работать в агентском цикле?

Придумал только детектить косячные ответы и делать ретрай. Косячные ответ это пустой или обрезанный по max tokens, там вроде в поле stop reason будет length, циклы (детектил встроенной в vllm функцией, на openrouter такого нет, придется самому делать). Детекциию протечек управляющих токенов нужно делать под модель, у них разные токены, у кого-то think, у кого-то thought, у кого то протекает Тул колл | tool | - что то вроде этого.

С опенроутер ещё нужно быть осторожным. Во первых, он не до конца openai compatible - нужно по документации уточнять что он принимает и как обрабатывает. Ризонинг там вроде включается через extra body. Во-вторых, он перенаправляет запросы сторонним провайдерам. А их поведение не гарантированно. Запрашиваешь ризонинг, может прислать без ризонинга

Если делаешь агента, который в цикле вызывает тулы, то везде дефолтное поведение - есть тул колл, цикл продолжается, нет тул колла - цикл завершается. Локальная модель может написать в content : вызову тул... И не вызвать его в секции тул кола. Цикл закрывается. Никак особо не решается, ответ модели формально кокорректный.

Делаю аи приложение для работы с доками на локальных моделях, почти все перечисленные грабли собрал и решения примерно такие же)

Могу добавить, что локальные модели ещё могут не только циклы выдавать, но писать ответ в секцию reasoning и наоборот. С max tokens свои приколы. Запрошенный max tokens должен покрывать основной ответ и thinking токены, число которых неизвестно. А все это вместе input tokens + max tokens должно укладываться в контекстное окно модели. А если нет - либо получаем ошибку от провайдера, либо обрезку ответа

Это не просто ещё один подход, это то, к чему уже все переходят, векторный раг говно

Грубо говоря - да, но можно хранить промежуточные артефакты работы нейронки в виде specs, plans, docs, чтобы нейронка нейронку признала (ооо, да тут проделана большая работа!)

Конкретно этот случай вряд ли спасло бы, но в репозитории (claude.md, agents.md) нужно хранить инструкции для нейронки, как оценивать проект, какие решения были приняты и почему.

P. S опенроутер не провайдер, а роутер на других провайдеров

Можно затюнить функцию потерь при обучении моделей, чтобы инструмент перестал работать)

лучший способ выспаться в самолете - беруши и снотворное/транквилизаторы

Как разбиение кода на модули поможет приложению не упасть?

Верно лишь отчасти. Рефлексия от модели может показать проблемы в контексте, документации, промптах.

Будет 600 pr висеть вечно

1

Информация

В рейтинге
3 716-й
Откуда
Санкт-Петербург, Санкт-Петербург и область, Россия
Зарегистрирован
Активность