Комментарии 6
Странно, что обошли вниманием бесплатные модели, например, Kev, Julia 1 и подобные.
Да, справедливо, их тут не хватает. Я сознательно взял релизы крупных компаний, чтобы сравнить разные подходы к архитектуре, и открытые модели сообщества в этот срез не попали.
Но про них, мне кажется, лучше написать отдельный пост. Там другие вопросы: как запустить у себя, сколько стоит дообучить на своих данных, какая модель лучше на CPU. Их уже набралось достаточно, чтобы сравнить между собой на одной задаче. Плюс llama.cpp недавно добавил поддержку decision-моделей, так что пробовать стало сильно проще.
clef 9B с виженом классный.
скриншоты за секунду прогоняет - "есть это, а есть то?" в одном запросе несколько вопросов за пару секунд на локальной 3090. Плюс влезает орнит и они вдвоем все могут прям.
Может определить присутствие человека в кадре?
да, взял кадр с вебкамеры в парке:
"запроси clef -- есть ли люди на картинке (да/нет) -- картинка webcam.jpg".
ответ: "Есть люди на картинке — да. (probability_of_true ≈ 0.97)"
затрачено по времени - 1.3 сек.
UPD:
(2 собаки в кадре) -- "запроси сколько собак на той же картинке – (варианты: 0,1,2,3, больше 3)"
Ответ: Собаки — 2 собаки. (вероятность ≈ 0.84, confidence ≈ 0.79)
Распределение:
│ Вариант │ Вероятность │
│ 2 │ 0.835 │
│ 3 │ 0.071 │
│ 1 │ 0.058 │
│ больше 3 │ 0.020 │
│ 0 │ 0.017 │

Decision-модели изнутри: как устроены Jev, Clef, pplx-decider, Strands Decider, Laya и GLiDE