хотелось бы добавить: если вы используете локальный инференс для компании, можно смело брать облачных гигантов для валидации (ЛЛМ судья поверх ответов маленькой модели) которой для валидации прописать классы (если классификатор) сущности и тд. К тому же на время валидации не обязательно собирать ответы в том формате, в котором вы будете использовать их в проде, например: вход - выяви ключевые сущности - строгий json, можно декомпозировать ответ до отдельных задач и сравнивать только их.Так проверять значительно приятнее. Ну а если бот "с базой знаний" (я понял это как ретривал), то там специально валидировать на выходе не нужно - у вас и так косинусное расстояние рассчитывается на уровне векторной бд.
если у вас есть подписка chat gpt или Gemini - то у них есть Codex и Antigravity - отдельные ide которые пишут код, лимиты там бешеные, за 20 долларов то, что они предлагают это считай "бесплатно". Кстати насколько помню Antigravity и бесплатный тоже есть, но нужно уточнить если подписки нет и не хотите оформлять я бы присмотрел https://openrouter.ai/upstage/solar-pro-3:free который вышел дня два назад, корейская модель, я ее тестил - пишет сносно, бесплатная на промопериод. еще слышал что grok fast бесплатный в Cursor. Но по бесплатным нейронкам я не особо, если честно, разбираюсь
А, я понял о чем вы! здесь "галлюцинации" не совсем подходит, забывает о чем вообще речь была - это проблема потери "контекста". Вы, вероятно, используете модели в интерфейсе, у каждой модели есть ограничение контекста (Gemini 1 миллион, chat gpt 256 тысяч.) Что это значит? Грубо говоря конкретная модель может обработать 1 миллион токенов (ориентировочно 4 тома войны и мира) в одном окне. Под окном подразумевается отдельный чат, где у модели нет памяти по остальным вашим запросам (ниже прикрепил скрин, логика везде одинаковая куда вы не пойдете)
то есть в одном чате модель может обработать n количества текста, после прохождения порога внутри модели матричные вычисления начинают расти квадратично, вычислений для обработки не хватает и модель начинает забывать о чем вы вообще разговаривали.
Как бороться?
Всегда, когда вы выполняете задачу с помощью нейросети, держите в голове одно единственное правило - если я обсуждаю задачу больше получаса - я сразу создаю новый чат. Со временем вы начнете эмпирически понимать когда вы набрали 1 млн контекста, но первично следуйте этому правилу. Важно также соблюдать гигиену, давайте на примере: Я решаю аналитическую задачу (скинул нейронке какую-то табличку и мне нужно на основе нее проверить очень много гипотез). Я сразу применяю несколько правил: 1) я не спрашиваю в этом чате нейросеть ничего, что не требует памяти по проекту (например мне нужно уточнить часть кода которую она написала или параллельно узнать о какой-то компании в таблице) - для этого мне не нужен весь контекст нашего проекта, поэтому я создам новый чат и спрошу в отдельном чате, чтобы сэкономить место. 2) Чтобы нейронка не переделывала одну и ту же задачу много раз - я четко описываю критерии, инструкции и тд. Все то, что я хочу получить и как получить. 3) Если задача обширная, я обычно сам ее декомпозирую - делаю на подзадачи и отдаю в разных чатах 4) Если чувствую, что контекст почти дошел до пика - пишу в этом же чате "сделай ревью всего что мы успели сделать детально" и иду в новый чат с этим описанием что уже выполнено
А по поводу автоматизации если задача подразумевает, например, 50 ответов на задачи или подразумевает, что вашим продуктом будете пользоваться не только вы или вам не хватает инструментов базовой Gemini в окне - вы всегда идете в автоматизацию через запросы "напрямую" То есть пишите питон код, который будет исполняться под вашу задачу. Для этого нужен api ключ сервиса: openai, Gemini, https://openrouter.ai и тд. И это стоит денег. У таких запросов огромный ряд преимуществ, здесь конечно в идеале вам спросить саму нейронку как это работает, потому что объясняю я всегда стабильно криво к тому же для этого отдельную статью нужно писать. Но если вы пишете код с помощью Gemini, то попросите ее написать responses api запрос к openai модели, она вам детально обьяснит куда сходить что сделать и сама скрипт напишет)
цепочка такая: отдельная задача для Gemini flash для получения baseline [промпт + задача] затем каскад: первичная модель [свой промпт + задача], получили ответ - отправляем модели-критику [свой промпт + задача + ответ первичной модели], затем модель-корректор [свой промпт + задача + ответ критика + ответ 1 модели] и так далее, то есть промпты у каждой модели разные, это 3 разных автоматизированных запроса к api кодом.
можете меня поправить, но по-моему лучше взять 2b модель, хотя даже 2b ту мач для таких задач, тем более что вы её квантуете в итоге. Вам 16 gb базовой теслы на колабе в таком случае хватит с головой. В идеале instruct модель, какое-нибудь семейство qwen (не помню, есть ли у геммы instruct модели). Но 70 строк на лору с таким лоссом в проде… будет печально
интересно, насколько синтетическая разметка актуальна в работе разметчика? видел в cvat функции типа SAM, opencv автобоксы. И еще интересно какие обьемы работы у разметчика и самые сложные задачи в разметке (предполагаю что сегментация или доменная классификация), в общем нужна еще одна статья)
Спасибо за перевод! Но, конечно, ждать от LLM адекватных детерминированных познаний в любой области это слишком амбициозно) RLHF, энтертеймент, синтетический датасет - все это только больше закапывает и так не идеальную архитектуру. Интересно было бы почитать про доменные LLM, а в идеале про применение узкоспециализированных архитектур типа PINNs у которого loss функция напрямую завязана с физическими законами, если есть такие статьи
1 это модель собранная норникелем и выложенная в опен сурс на хг
3 и 5 - это буквально Идея именно в доступности локального развертывания и компактности, которые позволят создать вокруг таких моделей свое сообщество энтузиастов, которые начнут экспериментировать
. "новая Алиса AI инициализирована весами Qwen3 это очень смешно потому что Иными словами, наши современные решения, вероятнее всего, "зависят" от китайских коллег.Сделаем вид что это не де факто стандарт для подобных моделей и что это является каким-то показателем по оценке моделей))
1234 5 это только то что в памяти, новая Алиса AI инициализирована весами Qwen3 очень смешно. Наверное, прежде чем писать подобные статьи, стоит все таки разобраться в вопросе, а не Я не активный пользователь Алисы или GigaChat )))
хотелось бы добавить: если вы используете локальный инференс для компании, можно смело брать облачных гигантов для валидации (ЛЛМ судья поверх ответов маленькой модели) которой для валидации прописать классы (если классификатор) сущности и тд. К тому же на время валидации не обязательно собирать ответы в том формате, в котором вы будете использовать их в проде, например: вход - выяви ключевые сущности - строгий json, можно декомпозировать ответ до отдельных задач и сравнивать только их.Так проверять значительно приятнее. Ну а если бот "с базой знаний" (я понял это как ретривал), то там специально валидировать на выходе не нужно - у вас и так косинусное расстояние рассчитывается на уровне векторной бд.
если у вас есть подписка chat gpt или Gemini - то у них есть Codex и Antigravity - отдельные ide которые пишут код, лимиты там бешеные, за 20 долларов то, что они предлагают это считай "бесплатно". Кстати насколько помню Antigravity и бесплатный тоже есть, но нужно уточнить
если подписки нет и не хотите оформлять я бы присмотрел https://openrouter.ai/upstage/solar-pro-3:free который вышел дня два назад, корейская модель, я ее тестил - пишет сносно, бесплатная на промопериод. еще слышал что grok fast бесплатный в Cursor. Но по бесплатным нейронкам я не особо, если честно, разбираюсь
А, я понял о чем вы! здесь "галлюцинации" не совсем подходит,
забывает о чем вообще речь была- это проблема потери "контекста". Вы, вероятно, используете модели в интерфейсе, у каждой модели есть ограничение контекста (Gemini 1 миллион, chat gpt 256 тысяч.) Что это значит? Грубо говоря конкретная модель может обработать 1 миллион токенов (ориентировочно 4 тома войны и мира) в одном окне. Под окном подразумевается отдельный чат, где у модели нет памяти по остальным вашим запросам (ниже прикрепил скрин, логика везде одинаковая куда вы не пойдете)то есть в одном чате модель может обработать n количества текста, после прохождения порога внутри модели матричные вычисления начинают расти квадратично, вычислений для обработки не хватает и модель начинает забывать о чем вы вообще разговаривали.
Как бороться?
Всегда, когда вы выполняете задачу с помощью нейросети, держите в голове одно единственное правило - если я обсуждаю задачу больше получаса - я сразу создаю новый чат. Со временем вы начнете эмпирически понимать когда вы набрали 1 млн контекста, но первично следуйте этому правилу. Важно также соблюдать гигиену, давайте на примере:
Я решаю аналитическую задачу (скинул нейронке какую-то табличку и мне нужно на основе нее проверить очень много гипотез). Я сразу применяю несколько правил:
1) я не спрашиваю в этом чате нейросеть ничего, что не требует памяти по проекту (например мне нужно уточнить часть кода которую она написала или параллельно узнать о какой-то компании в таблице) - для этого мне не нужен весь контекст нашего проекта, поэтому я создам новый чат и спрошу в отдельном чате, чтобы сэкономить место.
2) Чтобы нейронка не переделывала одну и ту же задачу много раз - я четко описываю критерии, инструкции и тд. Все то, что я хочу получить и как получить.
3) Если задача обширная, я обычно сам ее декомпозирую - делаю на подзадачи и отдаю в разных чатах
4) Если чувствую, что контекст почти дошел до пика - пишу в этом же чате "сделай ревью всего что мы успели сделать детально" и иду в новый чат с этим описанием что уже выполнено
А по поводу автоматизации
если задача подразумевает, например, 50 ответов на задачи или подразумевает, что вашим продуктом будете пользоваться не только вы или вам не хватает инструментов базовой Gemini в окне - вы всегда идете в автоматизацию через запросы "напрямую"
То есть пишите питон код, который будет исполняться под вашу задачу. Для этого нужен api ключ сервиса: openai, Gemini, https://openrouter.ai и тд. И это стоит денег. У таких запросов огромный ряд преимуществ, здесь конечно в идеале вам спросить саму нейронку как это работает, потому что объясняю я всегда стабильно криво к тому же для этого отдельную статью нужно писать. Но если вы пишете код с помощью Gemini, то попросите ее написать responses api запрос к openai модели, она вам детально обьяснит куда сходить что сделать и сама скрипт напишет)
цепочка такая: отдельная задача для Gemini flash для получения baseline [промпт + задача]
затем каскад: первичная модель [свой промпт + задача], получили ответ - отправляем модели-критику [свой промпт + задача + ответ первичной модели], затем модель-корректор [свой промпт + задача + ответ критика + ответ 1 модели] и так далее, то есть промпты у каждой модели разные, это 3 разных автоматизированных запроса к api кодом.
по сути да, но здесь мы усиляем каждый ответ отдельным экспертом. Разница между мое только в том, что там параллельно, а здесь последовательно
можете меня поправить, но по-моему лучше взять 2b модель, хотя даже 2b ту мач для таких задач, тем более что вы её квантуете в итоге. Вам 16 gb базовой теслы на колабе в таком случае хватит с головой. В идеале instruct модель, какое-нибудь семейство qwen (не помню, есть ли у геммы instruct модели). Но 70 строк на лору с таким лоссом в проде… будет печально
интересно, насколько синтетическая разметка актуальна в работе разметчика? видел в cvat функции типа SAM, opencv автобоксы. И еще интересно какие обьемы работы у разметчика и самые сложные задачи в разметке (предполагаю что сегментация или доменная классификация), в общем нужна еще одна статья)
Спасибо за перевод! Но, конечно, ждать от LLM адекватных детерминированных познаний в любой области это слишком амбициозно) RLHF, энтертеймент, синтетический датасет - все это только больше закапывает и так не идеальную архитектуру. Интересно было бы почитать про доменные LLM, а в идеале про применение узкоспециализированных архитектур типа PINNs у которого loss функция напрямую завязана с физическими законами, если есть такие статьи
1 это модель собранная норникелем и выложенная в опен сурс на хг
3 и 5 - это буквально
Идея именно в доступности локального развертывания и компактности, которые позволят создать вокруг таких моделей свое сообщество энтузиастов, которые начнут экспериментировать. "
новая Алиса AI инициализирована весами Qwen3это очень смешно потому чтоИными словами, наши современные решения, вероятнее всего, "зависят" от китайских коллег.Сделаем вид что это не де факто стандарт для подобных моделей и что это является каким-то показателем по оценке моделей))гигачат 3 на хг, yandex lite хг
1 2 3 4 5 это только то что в памяти,
новая Алиса AI инициализирована весами Qwen3очень смешно. Наверное, прежде чем писать подобные статьи, стоит все таки разобраться в вопросе, а неЯ не активный пользователь Алисы или GigaChat)))