Комментарии 5
Когда уже мы сообразим, что "xhigh" не значит "лучше"
Ооо, спасибо что тегнули!
Очень нравятся ваши статьи, с обоснованием и реальными задачами. Я сам тоже делаю тесты и мой тест - подробный промпт игры с хотелками, с некоторым четко прописанным тз и оставлением доли креатива для модели. Вышло случайно, но получилось так что тестирует способность модели понять просторечивые обороты в задании, при этом есть четкие требования к UI, ну и конечно в итоге это должно раьотать. Проблема в том что игра на html, css, js - это легко проверить человеком, но вот понять качество исполнения - это уже сложнее. Поэтому ваш подход с оценкой качествтва мне нравится - ну то есть, есть конкретные метрики когда модель выполняет поставленную задачу по тз.
У меня есть товарищ на работе который тоже увлечен нейросетями и прям наострие, но у него совсем другой подход, и тестирование можели тетрисом на html - это тоже такое себе - я не знаю какой он промп давал, но его тесты с тетрисом для 3.8 по качеству (субъективно на мой взгляд) оказались хуже того что выдал мне 3.6 - больше багов, меньше уже ожидаемых фишек которые в тз не обговариваются, но современные модели начинают додумывать что это надо (мобильный вид) и это дает повод добавить больше плюсов. Но опять же говорю - можно ли снижать оценку за то что не просилось? Короче ваши метрики и подход видится более серьезный.
Есть еще и такой момент (как в моих тестах) один прогон из 5 условно рабочий, а у другой модели 1 из 5 нерабочий. Вы не проверяли такое?
Ну и еще раз напоследок. Ту технологию о которой я говорил и которую на своей 5090 гонял этот товарищ: ninfer. Короче как я понял пересобирают модели под свою программу. Он мне показывал скорость до 200т/с на своей 5090 для 3.8 27б . Но нет уверенности что такое пройдет ваши тесты.
Ну и в догонку мои размышления на отвлеченную тему. Такие как этот товарищ и я - мы можем словами описать так как видим, технологий разработки не знаем и поэтому часто наоборот даже лучше поставить задачу на откуп нейросети - пусть покреативит, додумает то что не просили, но это станет приятным бонусом или просто потому что это уже стандарт дефакто, как говорится. Но опять же, это будет приятный бонус если это заработает, а если нет?) а вот если подель строго следует инструкциям, то это будет получше на мой взгляд. Думаю такое лечится системным промптом для поведения когда неспециалист просит что-то хорошее красивое и без багов - то просто даются инструкции поимерно такого типа: придумай как сделать лучше. Если такой инструкции нет, то только точное следование тз.
Возможно сейчас такое уже давно и работает и модель по запросу уже сама понимает кто перед ней (новичок или программер) и может дать результат нужный именно этому пользователю.
Модель по запросу не понимает. Она нацелена на причинение максимальной пользы. А вот пользу каждая из моделей подразумевает по разному. Если вы работаете с топовыми облачными моделями, то можете заметить такое поведение: сначала агент бодро дает новые идеи и рекомендации в какой-то момент просто стихает, хотя идей еще может быть много. Все дело в том, что чем длиннее контекст тем дороже он обходится поставщику облачной. Это связано с особенностями работы LLM. Думаю, в скором времени я напишу статью по этому вопросу. В моем ТГ канале https://t.me/itaiowl есть посты на эту тему.

Дело о лишних размышлениях: почему вредно много думать