Делюсь небольшим опытом. Делал своего чат агента. Экспериментировал с функцией глубоких исследований. Там суть была в том, что для больших сборов данных не хватает контекста, вернее хватает, но в процессе нейросеть себе набирает кучу мусора, поэтому задача разбивается нейросетью на подзадачи. Нейросеть для каждой выдавала системный промт, выбирала для подчата скилы, выдавала часть общей задачи и уже каждый субчат искал данные, загружал кучу мусорного контекста из интернета и генерировал выходной ответ и более чистый список источников с цитатами вместо кучи лишних данных. Затем подрубался основной част, получал все данные от субчатов и на основе уже очищенного контекста выдавал общий ответ на главный вопрос жизни, вселенной и всего такого.
Так вот. Каким-то образом нейросети формировали текст системных промтов и запросы так, что они очень часто обходили защиты этой же модели. Ну то есть если спросить у нейросети как предотвратить производство котиков, какие хим реактивы нужно регулировать и отслеживать и какие этапы производства требуют специальных технологических средств, которые нужно отслеживать в продаже, то нейросеть четко ответит, что она не лошара и так просто её не развести. Мол - отвечать не буду. А когда я гнал похожие запросы через своего агента, то нейросеть давала субагентам задачи про методы отслеживания получения конкретных прекурсоров, практику методов отслеживания, выявление средств создания тех или иных средств для химических реакций и т.д. И сама же эта нейросеть но уже в виде подчатов формировала кучу сведений, которые, сложив 2+2 можно было использовать для производства котиков. В итоге эта куча сведений попадала в главной чат, который само собой тоже отказывался мне выдавать информацию. Но учитывая, что я мог посмотреть ответы субчатов - то, что основной отказывался выдавать ответ - беда не большая. Некоторые модели сильнее подвержены этому обману, некоторые слабее. Но все без исключения проходили бенчмарки по безопасности разительно хуже, чем при прямом обращении. Из этого можно сделать вывод, что механизм, который тормозит нейросеть натренирован не на запрет выдачи определенных токенов, а на запрет обсуждения отдельных тем с пользователем. В данном случае, когда нейросети знали, что общаются друг с другом, а не с пользователем - запреты сильно сбоили, хотя порой субчаты тоже вылетали с заглушками про безопасность, но сильно-сильно реже. А ещё если хотя бы один субчат возвращал в основной чат защитную заглушку, то основной чат в 100% случаев выдавал защитную заглушку.
А ещё я на хабр хотел написать статью про мой проект дип рисерч агента и выпустить этот софт в виде опенсорса, но статья не прошла модерацию. И только потом я уже заметил, что выпускать такой софт - нельзя, так как нейросети не проходят базовые тесты безопасности, а в системный промт агента писать про то, что он должен более жёстко цензурировать себя в опенсорсе тупо, так как в исходниках эту часть из текста можно просто удалить.
И сейчас я ещё должен сказать, чтобы вы не пытались сами делать таких агентов, типа смысла в этом нет. Нейросеть одна и та же, поэтому сильно умнее ответы вы не получите, а жрет она токенов просто прорву.
Ollama не использует синхронизацию между картами. Просто делит слои на разные карты. Это позволяет суммировать память, но не позволяет кратно увеличить производительность. А вот допустим vllm позволяет картам работать уже в других режимах параллельности когда синхронизация происходит постоянно. Это позволяет в теории линейно увеличивать производительность от количества карт. Но обмены и требования к задержкам - очень сильные. Тут то и решает nv линк. И надо ещё учитывать, что vllm под wsl из винды не позволяет работать нв линку. То есть надо vllm обязательно запускать на linux нативно.
Если с той стороны прикрутить немного несложной логики, то можно в чат отправлять ссылки (Яндекс поиск есть в белых списках, так что ссылки страниц получить можно), то можно в ответ получать либо исходник страницы с загруженными скриптами и контентом в zip архиве (понятное дело, что работать будет мягко говоря не все), либо загружать ужатую через Readability.js страницу. А можно даже после Readability.js ужать страницу ещё через Turndown и прикрутить к клиенту markdown ридер. То есть отправляешь ссылку, получаешь текст страницы. Это уже можно назвать протокол Web2Email =) Задержки будут высокие, конечно. Но зато не надо производительности большой. С той стороны может быть железка на подобии домашнего роутера или самый дешёвый vps.
Что тут непонятного? Надо было запись разговора транскрибировать и передать в нейронку. Попросить нейронку понять что нужно ответить hr специалисту, чтобы она пропустила анкету тем, у кого задачи - проверить навыки. Дождаться ответа от нейросети. Выдать ответ hr специалисту, дополнительно указывая, что ответ был получен с применением требуемых для вакансии навыков.
Курсор сам может с собой попрощаться. Сейчас нет возможности для разработчиков софта тормозить с развитием продуктов в сфере ии. Во множестве плагинов для vs code есть аркестратор. Разница с ним и без него такая же как с копированием кода вручную и тем, что сейчас есть в курсоре.
Для локального запуска все равно интереснее разряженные версии, которые показали чуть ранее. Результаты совсем чуть хуже, но скорость работы в разы выше. Странно, что АлиБаба сами не добавили в сравнение с разряженными.
К чему такой наброс на вентилятор? (про 300нм у 8080 - это вообще класс. Топологию 8080 через лупу видно). Конечно у белорусов был уже литограф... Но на 550нм. Для понимания разница в плотности транзисторов в сравнении с 350 без малого в 10 раз. Так что говорить, что новый - это старый - мягко говоря не правильно. Молчание и про 130 нм через уже полтора года. А разница по плотности ещё 10 раз. И того увеличение плотности транзисторов в 100 раз за 5 лет. Но и урапатриотизма тоже не надо. Разница в плотности между самыми современными чипами и 350 нм порядка 1000 крат. То что через два года с 1000 уменьшиться до 100 все равно не повод не желать лучшего. И тут ещё стоит уточнить, что 130нм литограф будет с частичной унификацией с будущим 90нм, то есть дальше будут заменяться отдельные модули. Это позволит и проще переналаживать производства литографов и в будущем обновлять 130нм до 90. А 90 - это уже позволит делать вполне полнофункциональные центральные процессоры. Правда про 90 сроки не названы. Удивительно вообще, что по срокам 350 уложились в обещанное.
Делюсь небольшим опытом. Делал своего чат агента. Экспериментировал с функцией глубоких исследований. Там суть была в том, что для больших сборов данных не хватает контекста, вернее хватает, но в процессе нейросеть себе набирает кучу мусора, поэтому задача разбивается нейросетью на подзадачи. Нейросеть для каждой выдавала системный промт, выбирала для подчата скилы, выдавала часть общей задачи и уже каждый субчат искал данные, загружал кучу мусорного контекста из интернета и генерировал выходной ответ и более чистый список источников с цитатами вместо кучи лишних данных. Затем подрубался основной част, получал все данные от субчатов и на основе уже очищенного контекста выдавал общий ответ на главный вопрос жизни, вселенной и всего такого.
Так вот. Каким-то образом нейросети формировали текст системных промтов и запросы так, что они очень часто обходили защиты этой же модели. Ну то есть если спросить у нейросети как предотвратить производство котиков, какие хим реактивы нужно регулировать и отслеживать и какие этапы производства требуют специальных технологических средств, которые нужно отслеживать в продаже, то нейросеть четко ответит, что она не лошара и так просто её не развести. Мол - отвечать не буду. А когда я гнал похожие запросы через своего агента, то нейросеть давала субагентам задачи про методы отслеживания получения конкретных прекурсоров, практику методов отслеживания, выявление средств создания тех или иных средств для химических реакций и т.д. И сама же эта нейросеть но уже в виде подчатов формировала кучу сведений, которые, сложив 2+2 можно было использовать для производства котиков. В итоге эта куча сведений попадала в главной чат, который само собой тоже отказывался мне выдавать информацию. Но учитывая, что я мог посмотреть ответы субчатов - то, что основной отказывался выдавать ответ - беда не большая. Некоторые модели сильнее подвержены этому обману, некоторые слабее. Но все без исключения проходили бенчмарки по безопасности разительно хуже, чем при прямом обращении. Из этого можно сделать вывод, что механизм, который тормозит нейросеть натренирован не на запрет выдачи определенных токенов, а на запрет обсуждения отдельных тем с пользователем. В данном случае, когда нейросети знали, что общаются друг с другом, а не с пользователем - запреты сильно сбоили, хотя порой субчаты тоже вылетали с заглушками про безопасность, но сильно-сильно реже. А ещё если хотя бы один субчат возвращал в основной чат защитную заглушку, то основной чат в 100% случаев выдавал защитную заглушку.
А ещё я на хабр хотел написать статью про мой проект дип рисерч агента и выпустить этот софт в виде опенсорса, но статья не прошла модерацию. И только потом я уже заметил, что выпускать такой софт - нельзя, так как нейросети не проходят базовые тесты безопасности, а в системный промт агента писать про то, что он должен более жёстко цензурировать себя в опенсорсе тупо, так как в исходниках эту часть из текста можно просто удалить.
И сейчас я ещё должен сказать, чтобы вы не пытались сами делать таких агентов, типа смысла в этом нет. Нейросеть одна и та же, поэтому сильно умнее ответы вы не получите, а жрет она токенов просто прорву.
Ollama не использует синхронизацию между картами. Просто делит слои на разные карты. Это позволяет суммировать память, но не позволяет кратно увеличить производительность. А вот допустим vllm позволяет картам работать уже в других режимах параллельности когда синхронизация происходит постоянно. Это позволяет в теории линейно увеличивать производительность от количества карт. Но обмены и требования к задержкам - очень сильные. Тут то и решает nv линк. И надо ещё учитывать, что vllm под wsl из винды не позволяет работать нв линку. То есть надо vllm обязательно запускать на linux нативно.
Если с той стороны прикрутить немного несложной логики, то можно в чат отправлять ссылки (Яндекс поиск есть в белых списках, так что ссылки страниц получить можно), то можно в ответ получать либо исходник страницы с загруженными скриптами и контентом в zip архиве (понятное дело, что работать будет мягко говоря не все), либо загружать ужатую через Readability.js страницу. А можно даже после Readability.js ужать страницу ещё через Turndown и прикрутить к клиенту markdown ридер. То есть отправляешь ссылку, получаешь текст страницы. Это уже можно назвать протокол Web2Email =) Задержки будут высокие, конечно. Но зато не надо производительности большой. С той стороны может быть железка на подобии домашнего роутера или самый дешёвый vps.
Что тут непонятного? Надо было запись разговора транскрибировать и передать в нейронку. Попросить нейронку понять что нужно ответить hr специалисту, чтобы она пропустила анкету тем, у кого задачи - проверить навыки. Дождаться ответа от нейросети. Выдать ответ hr специалисту, дополнительно указывая, что ответ был получен с применением требуемых для вакансии навыков.
Усманов переложил Бюро 1440 из правого кармана (Мегафон) в левый (ГК YADRO).
Курсор сам может с собой попрощаться. Сейчас нет возможности для разработчиков софта тормозить с развитием продуктов в сфере ии. Во множестве плагинов для vs code есть аркестратор. Разница с ним и без него такая же как с копированием кода вручную и тем, что сейчас есть в курсоре.
Для локального запуска все равно интереснее разряженные версии, которые показали чуть ранее. Результаты совсем чуть хуже, но скорость работы в разы выше. Странно, что АлиБаба сами не добавили в сравнение с разряженными.
К чему такой наброс на вентилятор? (про 300нм у 8080 - это вообще класс. Топологию 8080 через лупу видно). Конечно у белорусов был уже литограф... Но на 550нм. Для понимания разница в плотности транзисторов в сравнении с 350 без малого в 10 раз. Так что говорить, что новый - это старый - мягко говоря не правильно. Молчание и про 130 нм через уже полтора года. А разница по плотности ещё 10 раз. И того увеличение плотности транзисторов в 100 раз за 5 лет. Но и урапатриотизма тоже не надо. Разница в плотности между самыми современными чипами и 350 нм порядка 1000 крат. То что через два года с 1000 уменьшиться до 100 все равно не повод не желать лучшего. И тут ещё стоит уточнить, что 130нм литограф будет с частичной унификацией с будущим 90нм, то есть дальше будут заменяться отдельные модули. Это позволит и проще переналаживать производства литографов и в будущем обновлять 130нм до 90. А 90 - это уже позволит делать вполне полнофункциональные центральные процессоры. Правда про 90 сроки не названы. Удивительно вообще, что по срокам 350 уложились в обещанное.