Обновить
-4

Back to the roots

Отправить сообщение

на чем бенчмарки проводились - на их данных. это не бенчмарки - это для галочки. вот и проводите тесты у себя, если вам делать нечего

чем-то напомнило тот случай, когда я вырезал маркировки “AI-generated” из пачки генеративного музла без замены кодека. всё то же самое почти, только не видео, а звук. А Вы, кстати, попробуйте фрагмент мультика отрендеренного проанализировать на ИИ

Херня все эти ваши претрейны, где мой русский claude? Когда начнете размечать веса по структуре бизнеса в РФ? Или для кого все эти ИИ чудеса вы придумываете? Два провайдера в РФ, у тех хоть какие-то пыхтения в нужную сторону

Брат, прям в точку. Они этого не понимают походу.

какой толк от выката этой модели и кому от нее горячо, кроме как не самому яндексу? 80B апачи2 запускать на AWS чтоли предлагаете? Яндекс качает деньги из продажи курсов мл -> тратит эти деньги на очередной файнтюн модели, которую не запустить в продакшене и никому не нужна, как и не нужны млы, которых они обучили, которые будут дальше файнтюнить веса обреченной ллм. Вы гении.

AGI уже создан с помощью квантовых запутанностей и когерентности на IBM кластере. https://www.youtube.com/watch?v=oW5_CvKDuHM&list=PLv0h9xFwpMaKUTtHdPxZaC47ssIqIqGBS Трансформеры всё - пока! Теперь будем хайпить на кубитах

Это же Вайб-ресёрчинг

IMG-20260625-203428-080.jpg Вот примерную схему накидал, как должен выглядеть современный ai-driven для любого горизонтального масштабирования, включая, бизнес-аналитику, продакшн, ИБ, ресёрч, внешние сервисы. Названия инструментов как пример привел. NoSQL скоро будет маст хэв везде.

Фичевые агенты должны быть stateless в контейнерах, далее надстройки, требующие серверную оперативку: события через условную Kafka, состояния через условный Redis, потом это все оборачивается в feature-store и валидируется единственным и окончательным фидбеком человека RLHF дообучением, которое так же попадает в первоначальное хранилище данных, откуда агенты снова берут новую информацию. А если все в statefull агентике генерить и тестить и затем мержить, то у вас каждый мерж все токены и бабки съест, наслышан про джиру) рекомендую юзать confluence как нативный offline store/rag для джиры, без всяких фичей в агентике. У atlassian есть модуль/плагин для confluens в виде векторного хранилища, если мне память не изменяет, настраивайте все там.

deepseek поясняет: · Агенты — фильтры первого уровня (синтаксис, стиль, тесты, типовые уязвимости). · Kafka + Redis — обеспечивают асинхронность и состояние без привязки к сессиям. · Feature store — аккумулирует все метрики и контекст для принятия решений. · Человек — подключается только к сложным кейсам (бизнес-логика, безопасность, архитектура). · RLHF-фидбек — замыкает контур: данные от человека уходят в дообучение, модели улучшаются, и следующий цикл требует ещё меньше ручного вмешательства.

Чтобы первая настройка не превратилась в хаос, заложите:

  1. Чёткие границы ответственности агентов (зафиксируйте в промптах/инструкциях).

  2. Сбор обратной связи от человека в структурированном виде (не просто комментарии, а размеченные категории).

  3. Мониторинг ключевых метрик: время от коммита до мёржа, доля авто-одобренных PR, частота возвратов на доработку.

  4. Периодическую ревизию — пересматривайте, какие задачи делегировать агентам по мере их дообучения.

Когда это настроено — масштабирование сводится к увеличению числа подов, а человек остаётся только финальным арбитром.

Есть определенная стилизация кода, и там все на English, поэтому либо пишите по общепринятому стилю на английском, либо дообучите модель на dense преобразование, чтобы он взял целый проект (full context) + сделал анализ (каждую строчку кода , каждый класс и объект), а затем выписал это все списком в отдельный .md себе.

link - ссылка
button - кнопка

Но лучше первый вариант, потому что рано или поздно он все равно периодически будет писать как его обучили на уровне тензоров.

Еще вариант - сменить LLM, авось другая обучалась на коде в кириллице

8Gb VRAM

16Gb RAM

250Gb Nvme

Реально вообще qwen3.6 MoE запустить в llama.cpp?)

Ща буду пробовать сперва эти модельки, потом уже turboquant и танцы с бубном подключать.

Qwen3.6-35B-A3B-UD-IQ4_NL
Qwen3.6-35B-A3B-UD-IQ4_XS
Qwen3.6-35B-A3B-UD-IQ3_S
Qwen3.6-35B-A3B-UD-IQ3_XXS

Спасибо за наводку.

почему статью еще не потерли, а автор не в бане?

а md для чего? Впринципе не проблема так сделать. У меня там ChromaDB при нахождении чанка возвращает весь документ целиком, я посчитал, что для регуляторки это то, что нужно и md тут лишний, т.к метаданные из доков нужны минимальные (номера, заголовки, пункты, типизированные обозначения и названия), а основное выполнение энкодера будет ориентироваться на dense/lexical. Документы - ГОСТы скачанные с Консультант+ с мусором и банерами и кривыми кодировками внутри доков. То есть они очищаются и могут лежать в оюбом формате doc/md/txt/json/pdf. У меня там docx. Сейчас такой RAG уже во всех IDE есть в виде встроенной тулзы - добавление документаций в контекст модели, вот там .md как раз must have

Вопрос знатокам, а ведь можно же расширить model context (который 32k) до условных 128k, задействуя не VRAM видеокарты, а RAM/Nvme?

GPU Direct Storage/HiFC - это тут применимо вообще? Скорость t/s вообще не важна, главное чтобы слабое железо тянуло сложные задачи. Или все-таки порекомендуете лучше думать в сторону выбора другой модели и квантизации? Ну просто 32к это совсем ниочем, функцию написать и задебаждить максимум…

Инструкции из системного промпта берутся, которые всегда сидят в кеше и работают только в stateless (без сохранения состояния модели/без сохранения истории предыдущих запросов). Вы говорите про attention. Снижение температуры как раз на attention влияет, но на моей практике температуру лучше не трогать, а грамотно и кратко составить инструкцию, подбирая каждое слово так, чтобы их векторные представления были далеко друг от друга.

Лучше киньте боевой пример, я наглядно вам покажу

Continue это oss плагин в VS code, в виде чат-интерфейса как и встроенный copilot, но без привязок и лимитов как copilot, а работающий как отдельный агент (инстанс). Ты сам выбираешь, какой llm/cli/backend использовать. Единственное, нужно немножко попариться, чтобы четко настроить backend (mcp/tools/docs/rag и т.д)

  • в continue можно много инстансов поднять на разных агентах, то есть это полноценный agentic-workflow инструмент, хотя изначально он создавался как авто-комплитер.

Информация

В рейтинге
Не участвует
Откуда
Москва и Московская обл., Россия
Зарегистрирован
Активность

Специализация

Инженер по компьютерному зрению, Инженер электронных устройств
Средний
От 262 144 ₽
OpenCV
FPGA
UVM
RISC-V
Операционная система реального времени
ООП