Pull to refresh
1

User

0,1
Rating
Send message

Немного не по теме. А через что сейчас модно ключи для апи передавать чтобы они не попали в контекст?

А по теме. Не очень большой опыт в продакшен таких агентов, но мне кажется оптимизация это создать харнесс, и дать такие инструменты и описать задачу так чтобы работу могла выполнять достаточно дешёвая модель. Они к тому же и быстрее. Вплоть до того что описать частые проблемы и дать готовые скрипты (tool или sh) для их обработки. Если задачи единичные и уникальные тогда конечно можно так же брать самую дорогую модель и ни о чем не думать.

А так в целом по статье мсп выглядит лишней прослойкой которую нужно поддерживать

когда сами берут на себя риски

правильнее наверное сказать: берут риски сами на водителя…

Благодарю, скопировал ответ и пообщался с нейронкой, более менее понял. как я понял часто используют динамическую глубину предсказания MTP токенов (в з-ти от того как малая модель хорошо предсказывает). И еще придумали что можно было бы делать не просто 2 модели, а больше уровней (3-4), и предсказывать какой модели лучше передать генерацию, а более старшая за ней проверяет.

так очевидный текст будет вылетать мгновенно, а на более сложных участка модель будет естественным образом “призадумываться” сильнее (медленнее генерировать).

Только этот запрет в рамках одной страны работает исключительно против этой страны. Не более.

Остальным иишникам эти книги ведь тоже нужны, чтобы не отставать. В итоге им тоже надо делать это, но это дорого и долго. Либо промшпионаж. либо дожидать, когда это хакеры на торенты выложат. Скорее всего, сам Амазон будет втихую продавать это всем. Скорее всего, им изначально это заказали, так как им проще это сделать. Дело ведь не в книгах. Книги так и так бы кто-то купил бы и положил на свои полки. Тут за авторов больше обидно. По сути, книга один раз купленная, попадает в открытый доступ через обученную LLM модель.

в халяву очется конечно верить, но подвох же должен быть. MTP можно за раз 2 токена получать, а можно по 5 или 20 сразу. неужели это всё бесплатно? тогда какой смысл это не использовать?

и вот действительно чем отличается?

Паранойя пароноей а аккум вынуть не так просто сейчас. Надо дисплей сначала снимать. Но в режиме 30 80 его на много лет должно хватить. Проблемы могут возникнуть если НА зависнет и перестанет включать выключать

на самом деле риски есть. проблема в том что видеокарты универсальные но не самые быстрые. как и в майнинге начинали с видеокарт, но быстро их заменили и 80% расчетов ушло на асики. здесь так же будет, крупные игроки гугл, антропик создают свои нейроускорители, но пампят все нвидию. ну и проф карты нвидия продает с очень большой наценкой. вроде бы для опенай их отдает практически даром (в долг) и опенай еще пампит. долг копится а вернутся ли инвестиции или проще будет обанкротится…

А качество с МТР заметно падает?

не уверен превью ли тут, оно вроде поменьше разрешением было. это ваш сайт?

27В многие запускают, практически народный размер. а 1-2Т конечно недосигаема. тем не менее разница все таки есть. если вы не запускаете дома такое, то оно вам и не надо. через апи зачастую дешевле выйдет. считал примерно 3090 генерирует примерно 3М токенов в сутки. я такой же объём куплю рублей за 10.

Да, модель дороже для китайцев. В их рабочее время

А вы считаете запуск моделей порядка 2Т на таком железе тривиальная повседневная задача? С маленькими конечно проблем нет. Если на одной 44г то надо пластин 50. Каждая пластина стоит 20 30 к долл. И ещё нужна память под контекст. Скорее всего там контекст далеко не 1М потому что на него надо тоже памяти много. Возможно пока что токены тут дорого обходятся, ещё и с ограничениями наверняка. Но я уверен в будущем это будет основной способ инференса.

“должна стать самым мощным открытым решением для локальной генерации”. Открытые модельки с триллионами параметров скромно хихикнули.

Самым популярным или народным но явно не самым мощным. *тоже жду

также как и сейчас нейросеть которая пользуется советом ставит плюс или минус, если помогло или не помогло, или пишет коммент…

Очень интересно, но ничего не понятно. Например что такое “набор специализированных мультимодальных инструментов”?

Помню надо было превью извлечь для внутренней црм. Там в зип файле оно есть как tiff к которому добавлен доп кастомный заголовок не помню, типа 18 или 36 байт. Их заголовок можно отбросить и получить нормальный tiff.

Понятно, почему нету. Тут бы к месту больше было сравнения со всякими нано-флеш-моделями.

Под больший контекст надо очень много памяти. Помню, Квен запускал даже 130 Было тяжело достигнуть на двух 3090. Лично по моим ощущениям, 130 как раз-таки для большинства задач и хватит. Большой контекст начинает забывать в середине сильно. Для дома, по крайней мере, более чем достаточно Для таких маленьких моделей.

1
23 ...

Information

Rating
3,808-th
Registered
Activity