Нефиг было выкатывать. Не, тут правило простое... Напясали тяп-ляп, поняли требования, переписали как надо. Проблема с вайбкодингом в том, что на первом тяп-ляп зачастую и заканчивают
Мну пока остановился на варианте - пользователь говорит голосом, агент отвечает текстом (а для этого как раз есть HUD). Как ни странно, такое несимметричное взаимодействие наиболее эргономично
Тут фокус в том, что владелец агента - это вы. То есть ваш личный агент, который, вероятнее всего, хостится на вашем собственном железе создаёт инфографику для вас, сообразуясь с вашими привычками и предпочтениями. Это будет не сегодня и не завтра, но мы придём мы к этому неизбежно.
А вот попытки встроить агентов на стороне владельца api - вот это вряд ли будет иметь успех. Я высказывался на эту тему ещё месяца три назад. Пользователь не хочет, чтобы консультант на сайте протыкал за него. Пользователь хочет, что его собственный агент пошёл на сайт и нажал всё, что надо
У меня немного другая идея. Нейронка переводит текст по ходу чтения. С учётом возникающих комментариев пользователя и памятью о его замечаниях. А заодно сразу идёт обсуждение текста. Получается модель не переводим-читаем, а скорее этакое совместное чтение с агентом. Эксперементируем пока
Там, где процесс проверки можно свести к классическим алгоритмам, логично выбрать классические алгоритмы. Это следует из формулы. У классики надёжность выше.
Энкодер/декодер как отдельные модели образуются, если разобраться очень естественно. Собственно, первое, что мы делаем - строим сокращённое пространство (оно же пространство латентов).
Как мы его строим? Очень просто - выбираем размерность, а потом совместно обучаем энкодер и декодер в задаче архивации/деархивации без потери качества. Если получилось - вот вам и латентное пространство, заданное прямым encoder и обратным decoder отображениями.
Прелесть в том, что нам для этого даже не надо заранее закладывать, что мы собираемся с данными делать. Достаточно сказать, с каким классом данных мы собираемся что-то делать. Удивительно...
Генерацию текста всё равно надо делать в символьных токенах, потому как это естественно, но нейросеть вполне может думать векторами. Собственно, нынешние диффузионные модели, картиночки рисующие, типа qwen image - ровно так и делают. У них шаг вычислений - это направление, в котором надо смещаться в латентном пространстве. И LLM, вполне может статься - надо строить также. И таки да. На выходе не токен, а цельный вектор смысла
Я уже высказывался на страницах хабра, но таки, чего бы не повторить базу ещё раз.
Агенты, да и нейросети вообще, работают как весьма универсальные, но довольно нестабильные функции. У них есть вероятность отказа. Нейросети могут то, чего не могут классические алгоритмы. Это плюс. Их вывод имеет хаотическую природу - это минус. При этом проверить их работу класическими алгоритмами - нетривиальная задача.
Естественный способ уменьшить проблему нестабильности нейросети и существенно поднять надёжность - поставить вторую нейросеть надзирать за первой.
Логично. Вероятность неудачи равно вероятность того, что налажает исполнитель на вероятность того, что налажает проверяющий.
Пример. Конвееру нужно восемь картинок одного объекта отрисованного под разными углами. Проблема в том, что модель-художник иногда лажает и поворачивает объект неправильно. Решение - поставить модель понимающую изображение проверять работу художника. В случае недовольства - перегенерировать с другим зерном.
Такая схема двойной нейронки весьма универсальна. Накладывается практически на любую задачу, какую можно поручить сетке. Из раза в раз паттерн срабатывает, существенно повышая надёжность системы.
Что-то я вижу тут противоречащие параграфы... Учитывая, что Jepa как правило реализуется на трансформерах. Coconut - аналогично. Вот Mamba-3 - действительно не трансформер (за отсутствием механизма self-attention). Но так-то вопрос не ставиться о том, что надо срочно убивать трансформер. Вопрос иной. Наметился пункт для усовершенствования, а именно, что граф вычислений нейросети незачем вынимать из латентного пространства. Пусть себе думает в латентах. Это довольно очевидная мысль, если рассудить. Сейчас LLM спамят текст на выходе и обратно вычитывают его на входе. А могли бы не делать этот roundtrip.
Полидигидрогеномоноксид. Дожили...
Нефиг было выкатывать. Не, тут правило простое... Напясали тяп-ляп, поняли требования, переписали как надо. Проблема с вайбкодингом в том, что на первом тяп-ляп зачастую и заканчивают
ChatGPT 5.4 - это реально был тот ещё кусок госсэ. Пользоваться им было нереально. Хотя, может, я с 5.3 путаю
Мну пока остановился на варианте - пользователь говорит голосом, агент отвечает текстом (а для этого как раз есть HUD). Как ни странно, такое несимметричное взаимодействие наиболее эргономично
Тут фокус в том, что владелец агента - это вы. То есть ваш личный агент, который, вероятнее всего, хостится на вашем собственном железе создаёт инфографику для вас, сообразуясь с вашими привычками и предпочтениями. Это будет не сегодня и не завтра, но мы придём мы к этому неизбежно.
А вот попытки встроить агентов на стороне владельца api - вот это вряд ли будет иметь успех. Я высказывался на эту тему ещё месяца три назад. Пользователь не хочет, чтобы консультант на сайте протыкал за него. Пользователь хочет, что его собственный агент пошёл на сайт и нажал всё, что надо
У меня немного другая идея. Нейронка переводит текст по ходу чтения. С учётом возникающих комментариев пользователя и памятью о его замечаниях. А заодно сразу идёт обсуждение текста. Получается модель не переводим-читаем, а скорее этакое совместное чтение с агентом. Эксперементируем пока
Кнопки не нужны. Агент выводящий по запросу инфографику - нужен
Полгода назад... вы б ещё данными с прошлого века поделились. Тут какждую неделю всё переворачивается
Различайте пишет лучше и проектирует лучше.
Пишет лучше значит, что нейронка будет соблюдать стиль, обработает исключения, сделает единообразно и попендикурлярно.
Архитектуру нейронки с первого раза нормально не делают. Зато делают со второго
А почему скобочки не египетские?
Стоп! Скобочки египетские...
А почему скобочки египетские?
А выбрать между табами и пробелами можно? А там два символа или четыре?
Что вы ржёте? Это ВАЖНО!
А это правда, что он с включенным экраном только два часа работает?
А мы уже локально развернули :)
Да. Это проблема. Когда сидел в армии без интернета (это ещё задолго до нейронок было) натурально казалось, что половину мозга отрезали
Там, где процесс проверки можно свести к классическим алгоритмам, логично выбрать классические алгоритмы. Это следует из формулы. У классики надёжность выше.
Энкодер/декодер как отдельные модели образуются, если разобраться очень естественно. Собственно, первое, что мы делаем - строим сокращённое пространство (оно же пространство латентов).
Как мы его строим? Очень просто - выбираем размерность, а потом совместно обучаем энкодер и декодер в задаче архивации/деархивации без потери качества. Если получилось - вот вам и латентное пространство, заданное прямым encoder и обратным decoder отображениями.
Прелесть в том, что нам для этого даже не надо заранее закладывать, что мы собираемся с данными делать. Достаточно сказать, с каким классом данных мы собираемся что-то делать. Удивительно...
Генерацию текста всё равно надо делать в символьных токенах, потому как это естественно, но нейросеть вполне может думать векторами. Собственно, нынешние диффузионные модели, картиночки рисующие, типа qwen image - ровно так и делают. У них шаг вычислений - это направление, в котором надо смещаться в латентном пространстве. И LLM, вполне может статься - надо строить также. И таки да. На выходе не токен, а цельный вектор смысла
От токенов мы никуда не денемся. Они фундаментальны. Это следствие дискретной природы вычислителей. Разве что можно их назвать подругому
Я уже высказывался на страницах хабра, но таки, чего бы не повторить базу ещё раз.
Агенты, да и нейросети вообще, работают как весьма универсальные, но довольно нестабильные функции. У них есть вероятность отказа. Нейросети могут то, чего не могут классические алгоритмы. Это плюс. Их вывод имеет хаотическую природу - это минус. При этом проверить их работу класическими алгоритмами - нетривиальная задача.
Естественный способ уменьшить проблему нестабильности нейросети и существенно поднять надёжность - поставить вторую нейросеть надзирать за первой.
Логично. Вероятность неудачи равно вероятность того, что налажает исполнитель на вероятность того, что налажает проверяющий.
Пример. Конвееру нужно восемь картинок одного объекта отрисованного под разными углами. Проблема в том, что модель-художник иногда лажает и поворачивает объект неправильно. Решение - поставить модель понимающую изображение проверять работу художника. В случае недовольства - перегенерировать с другим зерном.
Такая схема двойной нейронки весьма универсальна. Накладывается практически на любую задачу, какую можно поручить сетке. Из раза в раз паттерн срабатывает, существенно повышая надёжность системы.
Что-то я вижу тут противоречащие параграфы... Учитывая, что Jepa как правило реализуется на трансформерах. Coconut - аналогично. Вот Mamba-3 - действительно не трансформер (за отсутствием механизма self-attention). Но так-то вопрос не ставиться о том, что надо срочно убивать трансформер. Вопрос иной. Наметился пункт для усовершенствования, а именно, что граф вычислений нейросети незачем вынимать из латентного пространства. Пусть себе думает в латентах. Это довольно очевидная мысль, если рассудить. Сейчас LLM спамят текст на выходе и обратно вычитывают его на входе. А могли бы не делать этот roundtrip.
Ну, ноты от того не поменялись. Второй тоже не промах был