Обновить
16K+
13
Alexey@Weron2

АСУТП

6,1
Рейтинг
9
Подписчики
Отправить сообщение

Вот это интересный момент. Ничего не имею против опус стайла, сейчас всюду и везде. А вот написано для нейросетей это новенькое. Типа вашу статью прочитает ии (новые модели) и у нее в голове отложатся эти знания и она сможет точнее рассказать любому пользователю эти фишки для ускорений?

Прикольно кстати, не думал о таком)

Ну и в догонку мои размышления на отвлеченную тему. Такие как этот товарищ и я - мы можем словами описать так как видим, технологий разработки не знаем и поэтому часто наоборот даже лучше поставить задачу на откуп нейросети - пусть покреативит, додумает то что не просили, но это станет приятным бонусом или просто потому что это уже стандарт дефакто, как говорится. Но опять же, это будет приятный бонус если это заработает, а если нет?) а вот если подель строго следует инструкциям, то это будет получше на мой взгляд. Думаю такое лечится системным промптом для поведения когда неспециалист просит что-то хорошее красивое и без багов - то просто даются инструкции поимерно такого типа: придумай как сделать лучше. Если такой инструкции нет, то только точное следование тз.

Возможно сейчас такое уже давно и работает и модель по запросу уже сама понимает кто перед ней (новичок или программер) и может дать результат нужный именно этому пользователю.

Ооо, спасибо что тегнули!

Очень нравятся ваши статьи, с обоснованием и реальными задачами. Я сам тоже делаю тесты и мой тест - подробный промпт игры с хотелками, с некоторым четко прописанным тз и оставлением доли креатива для модели. Вышло случайно, но получилось так что тестирует способность модели понять просторечивые обороты в задании, при этом есть четкие требования к UI, ну и конечно в итоге это должно раьотать. Проблема в том что игра на html, css, js - это легко проверить человеком, но вот понять качество исполнения - это уже сложнее. Поэтому ваш подход с оценкой качествтва мне нравится - ну то есть, есть конкретные метрики когда модель выполняет поставленную задачу по тз.

У меня есть товарищ на работе который тоже увлечен нейросетями и прям наострие, но у него совсем другой подход, и тестирование можели тетрисом на html - это тоже такое себе - я не знаю какой он промп давал, но его тесты с тетрисом для 3.8 по качеству (субъективно на мой взгляд) оказались хуже того что выдал мне 3.6 - больше багов, меньше уже ожидаемых фишек которые в тз не обговариваются, но современные модели начинают додумывать что это надо (мобильный вид) и это дает повод добавить больше плюсов. Но опять же говорю - можно ли снижать оценку за то что не просилось? Короче ваши метрики и подход видится более серьезный.

Есть еще и такой момент (как в моих тестах) один прогон из 5 условно рабочий, а у другой модели 1 из 5 нерабочий. Вы не проверяли такое?

Ну и еще раз напоследок. Ту технологию о которой я говорил и которую на своей 5090 гонял этот товарищ: ninfer. Короче как я понял пересобирают модели под свою программу. Он мне показывал скорость до 200т/с на своей 5090 для 3.8 27б . Но нет уверенности что такое пройдет ваши тесты.

Ждем. Тегните потом может)

У меня один товарищ тестировал NInfer фреймворк, и у него на 5090 до 700т/с выдает. Не пробовали такое?

Согласен. Даже опираясь на ваш опыт когда включаешь один флаг и получаешь значительный прирост это уже показательно что все не так однозначно.

Уже есть) https://habr.com/ru/articles/1076284/

Правда, практической пользы оказалось не так много, но вдруг кого-то натолкнет на какие-то мысли)

Хочу тоже поделиться наблюдениями. Очень похоже что качество действительно зависит от сборки. Unsloth зарекомендовал себя,но похоже что иногда они переигрывают. Недавно заиорочился тоже с проверкой скорости, но было интереснее именно математически рассчитать - получился своебразный калькулятор +- показывающий то что у меня на выходе. Но для чистоты эксперимента и прогонов я взял модель бартовски обратил внимание в метаданных что там 33 слоя у квена, а у анслоф 32...

В общем погонял модели и удивидся что мой промпт на 4b модель смогла сделать играбельную игру, в то время как на сборке unsloth такое выходило раз в 10-20 прогонов. Надо бы еще раз погонять...

Пожалуй напишу небольшую статью про то как я это делал, и может вы сделаете что-то похожее... Я сделал букмарклет который на странице модели посвечивает теоретическую скорость на моем железе. Кстати обратил внимание что если залогиниться на hf можно добавить свое железо и он тоже может выдать какие-то цифры, но пока не проверял

А если в лабораторию касперского написать? Нужно сделать контору быстрого реагирования, которая будет на короткой ноге со всякими органами, хостингами и регистраторами. Условно запрос с такой конторы должен иметь приоритет в обработке, и может даже даже запускать процесс блокировки моментально от их запроса. То есть вы делаете запрос в лабораторию, они повторяют ваши шаги, полностью убеждаются в том что это мошенник. Запускают скрипт обращений в нужные органы и организации - открывают дело, блокируют домены, посылают оперов на адрес.

Вам спасибо за описание этого и что вскрываете тему, за неравнодушие.

Интересно. Люблю тоже потестировать модели (есть тоже статья на хабре) Я остановился на 35b-a3b.

Я вот что понял - модель в обычном чате не всегда каждый раз делает хорошо и не всегда лажает... Какая-то лоторея как будто. Впору как будто проводить по 5 тестов и выдавать сколько из 5 сделано хорошо. И то это будет не факт что если 5 из 5 было хорошо, то на 6 раз модель не облажается.

Ну и новее все-таки лучше. Более дистилированные знания как будто. Это даже видно по стилю веб страниц.

Ну у меня если пойдет то только 35moe. У меня 3070 8 гб

Очень круто! Супер!

Я тут подумал после вашей статьи что немного не правильно тестирую модели: я запускаю просто чат llamacpp и прошу написать игру в нем. Как я понял из вашей статьи то Квен 27б при таком сценарии с большей вероятности сделает лучше чем эта модель потому что на бенче по программированию набирает больше очков? То есть эта модель больше заточена как раз под OpenCode и закрывает задачи за несколько итераций?

Новую статью хотим конечно же. Ждем 3.8)

В таком формате запускать модели одной карточки точно не хватит, тем более вы говорите что запускаете 2 модели сразу... У вас наверняка не одна карточка)

Согласен. Там в таблице тестирования я добавлял и ссылки и пояснения к моделям, причем ссылки на квантованые уже. Надо пожалуй больше контекста именно в статье оставить

Хотя если так разобраться МОЕ модели в заголовке говорят о чем-то)

Да, там есть еще и всякие квопусы... И как-то я пробовал но мне что-то не понравилось. Надо бы еще раз попробовать. Почему-то эти расцензуренные версии не вызывают доверия)

Надеюсь 35b moe тоже будет

Просто ctrl+c ctrl+v реально как будто глупо, а для живого человека даже обидно когда повторяют дважды одно и тоже. Но вот повторить другими словами задачу чтобы активировать близкие нейроны - это уже как будто имеет смысл. Впрочем это для селовека. Для думающих моделей тоже избыточно если изначально задача описана максимально понятно без домыслов.

Повторение другими словами и примеры - это уже больше человеческий фактор - точно сказал все что хотел, учел все нюансы. Опять же в отличие от человека нейронка редко переспросит если не уазать отдельно.

Такие мысли вслух) за статью спасибо, полезно

Как считается общий балл? Опус вроде как во всех тестах сильнее всех, и только один тест завалил (и то неиполностью) Что может говорить о том что этот тест прошел как-то неправильно

Я уже присылал вам в чат запрос что по программированию было ровно то же самое в вашем рейтинге (на сайте) что 4b модель обгоняла 35b современную. Такие нестыковки не внушают доверия...

1
23 ...

Информация

В рейтинге
1 134-й
Зарегистрирован
Активность