27В многие запускают, практически народный размер. а 1-2Т конечно недосигаема. тем не менее разница все таки есть. если вы не запускаете дома такое, то оно вам и не надо. через апи зачастую дешевле выйдет. считал примерно 3090 генерирует примерно 3М токенов в сутки. я такой же объём куплю рублей за 10.
А вы считаете запуск моделей порядка 2Т на таком железе тривиальная повседневная задача? С маленькими конечно проблем нет. Если на одной 44г то надо пластин 50. Каждая пластина стоит 20 30 к долл. И ещё нужна память под контекст. Скорее всего там контекст далеко не 1М потому что на него надо тоже памяти много. Возможно пока что токены тут дорого обходятся, ещё и с ограничениями наверняка. Но я уверен в будущем это будет основной способ инференса.
Помню надо было превью извлечь для внутренней црм. Там в зип файле оно есть как tiff к которому добавлен доп кастомный заголовок не помню, типа 18 или 36 байт. Их заголовок можно отбросить и получить нормальный tiff.
Под больший контекст надо очень много памяти. Помню, Квен запускал даже 130 Было тяжело достигнуть на двух 3090. Лично по моим ощущениям, 130 как раз-таки для большинства задач и хватит. Большой контекст начинает забывать в середине сильно. Для дома, по крайней мере, более чем достаточно Для таких маленьких моделей.
Да апи норм. Из опенай апи, гляньте, все используют тоже один метод в 99.999 случаев. Если модель поддерживает structured output то остальное можно из js доделать
установил, поигрался. сам gemini на русском неплохо работает, хотя пишут что нет. но работает очень медленно для своего размера (даже на GPU 3090). qwen27b гораздо быстрее работает. Для суммаризации языки сейчас: en, es, ja, de, fr, и с русским не запускается. Но суммаризацию можно делать через промт. Но опять же с такой скоростью смысла не имеет. удаляем…
сделают SO для агентов. отдельный софт анализирует диалог по завершении и вытаскивает вопросы/ответы которыми можно поделится. агенты пишут/агенты читают, достаточно просто mcp. проблемка в том как монетизировать сайт для агентов.
Я бы ещё добавил логирование того какие промты запускает сайт. Так и проситься расширение для такой бд. Квоту на домен и предупреждения по достижении. Чтобы сразу посмотреть что он там делает.
Спасибо. Тоже в поисках. В таких системах 2 цели. Чтобы сохранить и посмотреть позже когда будет надо. Тут особо погружаться не надо сразу, важно только представлять что у тебя есть в БЗ. Ну и чтобы поиск хорошо набрал. Второе направление это усвоение знаний. Важен процесс сейчас, сами заметки потом не так нужны, для архива разве что.
Эту инфографику чатгпт в бесплатном можно попробовать? Через их апи это как я понимаю нужно запускать генерацию картинки?
это можно по разному сделать. например старый тел/планшет на холодильник повесить или голосом заводить с распознованием или в своем телефоне фотку сделать как задачу. и еще игрофикацию добавить - какие нибудь баллы зарабатывать.
не уверен превью ли тут, оно вроде поменьше разрешением было. это ваш сайт?
27В многие запускают, практически народный размер. а 1-2Т конечно недосигаема. тем не менее разница все таки есть. если вы не запускаете дома такое, то оно вам и не надо. через апи зачастую дешевле выйдет. считал примерно 3090 генерирует примерно 3М токенов в сутки. я такой же объём куплю рублей за 10.
Да, модель дороже для китайцев. В их рабочее время
А вы считаете запуск моделей порядка 2Т на таком железе тривиальная повседневная задача? С маленькими конечно проблем нет. Если на одной 44г то надо пластин 50. Каждая пластина стоит 20 30 к долл. И ещё нужна память под контекст. Скорее всего там контекст далеко не 1М потому что на него надо тоже памяти много. Возможно пока что токены тут дорого обходятся, ещё и с ограничениями наверняка. Но я уверен в будущем это будет основной способ инференса.
“должна стать самым мощным открытым решением для локальной генерации”. Открытые модельки с триллионами параметров скромно хихикнули.
Самым популярным или народным но явно не самым мощным. *тоже жду
также как и сейчас нейросеть которая пользуется советом ставит плюс или минус, если помогло или не помогло, или пишет коммент…
Очень интересно, но ничего не понятно. Например что такое “набор специализированных мультимодальных инструментов”?
Помню надо было превью извлечь для внутренней црм. Там в зип файле оно есть как tiff к которому добавлен доп кастомный заголовок не помню, типа 18 или 36 байт. Их заголовок можно отбросить и получить нормальный tiff.
Понятно, почему нету. Тут бы к месту больше было сравнения со всякими нано-флеш-моделями.
Под больший контекст надо очень много памяти. Помню, Квен запускал даже 130 Было тяжело достигнуть на двух 3090. Лично по моим ощущениям, 130 как раз-таки для большинства задач и хватит. Большой контекст начинает забывать в середине сильно. Для дома, по крайней мере, более чем достаточно Для таких маленьких моделей.
Да апи норм. Из опенай апи, гляньте, все используют тоже один метод в 99.999 случаев. Если модель поддерживает structured output то остальное можно из js доделать
4 гига модель должна быть очень быстрой. Попробуйте у себя, самому интересно. Может мне так не повезло. Но вычисления были на GPU.
установил, поигрался. сам gemini на русском неплохо работает, хотя пишут что нет. но работает очень медленно для своего размера (даже на GPU 3090). qwen27b гораздо быстрее работает. Для суммаризации языки сейчас: en, es, ja, de, fr, и с русским не запускается. Но суммаризацию можно делать через промт. Но опять же с такой скоростью смысла не имеет. удаляем…
сделают SO для агентов. отдельный софт анализирует диалог по завершении и вытаскивает вопросы/ответы которыми можно поделится. агенты пишут/агенты читают, достаточно просто mcp. проблемка в том как монетизировать сайт для агентов.
Я бы ещё добавил логирование того какие промты запускает сайт. Так и проситься расширение для такой бд. Квоту на домен и предупреждения по достижении. Чтобы сразу посмотреть что он там делает.
Спасибо. Тоже в поисках. В таких системах 2 цели. Чтобы сохранить и посмотреть позже когда будет надо. Тут особо погружаться не надо сразу, важно только представлять что у тебя есть в БЗ. Ну и чтобы поиск хорошо набрал.
Второе направление это усвоение знаний. Важен процесс сейчас, сами заметки потом не так нужны, для архива разве что.
Эту инфографику чатгпт в бесплатном можно попробовать? Через их апи это как я понимаю нужно запускать генерацию картинки?
“Задействует большую часть мозга” а может наоборот тратит ресурсы занимая их только на эту задачу?
Пользуюсь. Хорошо что можно смотреть логи запросов. И из своего и особенно из стороннего софта.
Может gigaam попробовать? Обещают качество при меньшем размере.
это можно по разному сделать. например старый тел/планшет на холодильник повесить или голосом заводить с распознованием или в своем телефоне фотку сделать как задачу. и еще игрофикацию добавить - какие нибудь баллы зарабатывать.