Информация
- В рейтинге
- Не участвует
- Откуда
- Москва и Московская обл., Россия
- Зарегистрирован
- Активность
Специализация
Инженер по компьютерному зрению, Инженер электронных устройств
Средний
От 262 144 ₽
OpenCV
FPGA
UVM
RISC-V
Операционная система реального времени
ООП
на чем бенчмарки проводились - на их данных. это не бенчмарки - это для галочки. вот и проводите тесты у себя, если вам делать нечего
чем-то напомнило тот случай, когда я вырезал маркировки “AI-generated” из пачки генеративного музла без замены кодека. всё то же самое почти, только не видео, а звук. А Вы, кстати, попробуйте фрагмент мультика отрендеренного проанализировать на ИИ
Херня все эти ваши претрейны, где мой русский claude? Когда начнете размечать веса по структуре бизнеса в РФ? Или для кого все эти ИИ чудеса вы придумываете? Два провайдера в РФ, у тех хоть какие-то пыхтения в нужную сторону
.
Брат, прям в точку. Они этого не понимают походу.
какой толк от выката этой модели и кому от нее горячо, кроме как не самому яндексу? 80B апачи2 запускать на AWS чтоли предлагаете? Яндекс качает деньги из продажи курсов мл -> тратит эти деньги на очередной файнтюн модели, которую не запустить в продакшене и никому не нужна, как и не нужны млы, которых они обучили, которые будут дальше файнтюнить веса обреченной ллм. Вы гении.
а так не проще? https://arxiv.org/pdf/2606.12683
AGI уже создан с помощью квантовых запутанностей и когерентности на IBM кластере. https://www.youtube.com/watch?v=oW5_CvKDuHM&list=PLv0h9xFwpMaKUTtHdPxZaC47ssIqIqGBS Трансформеры всё - пока! Теперь будем хайпить на кубитах
Это же Вайб-ресёрчинг
Схема для jira, как я её вижу.png
IMG-20260625-203428-080.jpg Вот примерную схему накидал, как должен выглядеть современный ai-driven для любого горизонтального масштабирования, включая, бизнес-аналитику, продакшн, ИБ, ресёрч, внешние сервисы. Названия инструментов как пример привел. NoSQL скоро будет маст хэв везде.
Фичевые агенты должны быть stateless в контейнерах, далее надстройки, требующие серверную оперативку: события через условную Kafka, состояния через условный Redis, потом это все оборачивается в feature-store и валидируется единственным и окончательным фидбеком человека RLHF дообучением, которое так же попадает в первоначальное хранилище данных, откуда агенты снова берут новую информацию. А если все в statefull агентике генерить и тестить и затем мержить, то у вас каждый мерж все токены и бабки съест, наслышан про джиру) рекомендую юзать confluence как нативный offline store/rag для джиры, без всяких фичей в агентике. У atlassian есть модуль/плагин для confluens в виде векторного хранилища, если мне память не изменяет, настраивайте все там.
deepseek поясняет: · Агенты — фильтры первого уровня (синтаксис, стиль, тесты, типовые уязвимости). · Kafka + Redis — обеспечивают асинхронность и состояние без привязки к сессиям. · Feature store — аккумулирует все метрики и контекст для принятия решений. · Человек — подключается только к сложным кейсам (бизнес-логика, безопасность, архитектура). · RLHF-фидбек — замыкает контур: данные от человека уходят в дообучение, модели улучшаются, и следующий цикл требует ещё меньше ручного вмешательства.
Чтобы первая настройка не превратилась в хаос, заложите:
Чёткие границы ответственности агентов (зафиксируйте в промптах/инструкциях).
Сбор обратной связи от человека в структурированном виде (не просто комментарии, а размеченные категории).
Мониторинг ключевых метрик: время от коммита до мёржа, доля авто-одобренных PR, частота возвратов на доработку.
Периодическую ревизию — пересматривайте, какие задачи делегировать агентам по мере их дообучения.
Когда это настроено — масштабирование сводится к увеличению числа подов, а человек остаётся только финальным арбитром.
https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF https://huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF
MPT версии qwen - генерит в 2 раза быстрее оригинальной
Есть определенная стилизация кода, и там все на English, поэтому либо пишите по общепринятому стилю на английском, либо дообучите модель на dense преобразование, чтобы он взял целый проект (full context) + сделал анализ (каждую строчку кода , каждый класс и объект), а затем выписал это все списком в отдельный .md себе.
Но лучше первый вариант, потому что рано или поздно он все равно периодически будет писать как его обучили на уровне тензоров.
Еще вариант - сменить LLM, авось другая обучалась на коде в кириллице
8Gb VRAM
16Gb RAM
250Gb Nvme
Реально вообще qwen3.6 MoE запустить в llama.cpp?)
Ща буду пробовать сперва эти модельки, потом уже turboquant и танцы с бубном подключать.
Спасибо за наводку.
почему статью еще не потерли, а автор не в бане?
а md для чего? Впринципе не проблема так сделать. У меня там ChromaDB при нахождении чанка возвращает весь документ целиком, я посчитал, что для регуляторки это то, что нужно и md тут лишний, т.к метаданные из доков нужны минимальные (номера, заголовки, пункты, типизированные обозначения и названия), а основное выполнение энкодера будет ориентироваться на dense/lexical. Документы - ГОСТы скачанные с Консультант+ с мусором и банерами и кривыми кодировками внутри доков. То есть они очищаются и могут лежать в оюбом формате doc/md/txt/json/pdf. У меня там docx. Сейчас такой RAG уже во всех IDE есть в виде встроенной тулзы - добавление документаций в контекст модели, вот там .md как раз must have
Вопрос знатокам, а ведь можно же расширить model context (который 32k) до условных 128k, задействуя не VRAM видеокарты, а RAM/Nvme?
GPU Direct Storage/HiFC - это тут применимо вообще? Скорость t/s вообще не важна, главное чтобы слабое железо тянуло сложные задачи. Или все-таки порекомендуете лучше думать в сторону выбора другой модели и квантизации? Ну просто 32к это совсем ниочем, функцию написать и задебаждить максимум…
Инструкции из системного промпта берутся, которые всегда сидят в кеше и работают только в stateless (без сохранения состояния модели/без сохранения истории предыдущих запросов). Вы говорите про attention. Снижение температуры как раз на attention влияет, но на моей практике температуру лучше не трогать, а грамотно и кратко составить инструкцию, подбирая каждое слово так, чтобы их векторные представления были далеко друг от друга.
Лучше киньте боевой пример, я наглядно вам покажу
Continue это oss плагин в VS code, в виде чат-интерфейса как и встроенный copilot, но без привязок и лимитов как copilot, а работающий как отдельный агент (инстанс). Ты сам выбираешь, какой llm/cli/backend использовать. Единственное, нужно немножко попариться, чтобы четко настроить backend (mcp/tools/docs/rag и т.д)
в continue можно много инстансов поднять на разных агентах, то есть это полноценный agentic-workflow инструмент, хотя изначально он создавался как авто-комплитер.