Pull to refresh
73

Техножрец

1,4
Rating
50
Subscribers
Send message

Различайте пишет лучше и проектирует лучше.

Пишет лучше значит, что нейронка будет соблюдать стиль, обработает исключения, сделает единообразно и попендикурлярно.

Архитектуру нейронки с первого раза нормально не делают. Зато делают со второго

А почему скобочки не египетские?

Стоп! Скобочки египетские...

А почему скобочки египетские?

А выбрать между табами и пробелами можно? А там два символа или четыре?

Что вы ржёте? Это ВАЖНО!

А это правда, что он с включенным экраном только два часа работает?

А мы уже локально развернули :)

Да. Это проблема. Когда сидел в армии без интернета (это ещё задолго до нейронок было) натурально казалось, что половину мозга отрезали

Там, где процесс проверки можно свести к классическим алгоритмам, логично выбрать классические алгоритмы. Это следует из формулы. У классики надёжность выше.

Энкодер/декодер как отдельные модели образуются, если разобраться очень естественно. Собственно, первое, что мы делаем - строим сокращённое пространство (оно же пространство латентов).

Как мы его строим? Очень просто - выбираем размерность, а потом совместно обучаем энкодер и декодер в задаче архивации/деархивации без потери качества. Если получилось - вот вам и латентное пространство, заданное прямым encoder и обратным decoder отображениями.

Прелесть в том, что нам для этого даже не надо заранее закладывать, что мы собираемся с данными делать. Достаточно сказать, с каким классом данных мы собираемся что-то делать. Удивительно...

Генерацию текста всё равно надо делать в символьных токенах, потому как это естественно, но нейросеть вполне может думать векторами. Собственно, нынешние диффузионные модели, картиночки рисующие, типа qwen image - ровно так и делают. У них шаг вычислений - это направление, в котором надо смещаться в латентном пространстве. И LLM, вполне может статься - надо строить также. И таки да. На выходе не токен, а цельный вектор смысла

От токенов мы никуда не денемся. Они фундаментальны. Это следствие дискретной природы вычислителей. Разве что можно их назвать подругому

Я уже высказывался на страницах хабра, но таки, чего бы не повторить базу ещё раз.

Агенты, да и нейросети вообще, работают как весьма универсальные, но довольно нестабильные функции. У них есть вероятность отказа. Нейросети могут то, чего не могут классические алгоритмы. Это плюс. Их вывод имеет хаотическую природу - это минус. При этом проверить их работу класическими алгоритмами - нетривиальная задача.

Естественный способ уменьшить проблему нестабильности нейросети и существенно поднять надёжность - поставить вторую нейросеть надзирать за первой.

Логично. Вероятность неудачи равно вероятность того, что налажает исполнитель на вероятность того, что налажает проверяющий.

Пример. Конвееру нужно восемь картинок одного объекта отрисованного под разными углами. Проблема в том, что модель-художник иногда лажает и поворачивает объект неправильно. Решение - поставить модель понимающую изображение проверять работу художника. В случае недовольства - перегенерировать с другим зерном.

Такая схема двойной нейронки весьма универсальна. Накладывается практически на любую задачу, какую можно поручить сетке. Из раза в раз паттерн срабатывает, существенно повышая надёжность системы.

Что-то я вижу тут противоречащие параграфы... Учитывая, что Jepa как правило реализуется на трансформерах. Coconut - аналогично. Вот Mamba-3 - действительно не трансформер (за отсутствием механизма self-attention). Но так-то вопрос не ставиться о том, что надо срочно убивать трансформер. Вопрос иной. Наметился пункт для усовершенствования, а именно, что граф вычислений нейросети незачем вынимать из латентного пространства. Пусть себе думает в латентах. Это довольно очевидная мысль, если рассудить. Сейчас LLM спамят текст на выходе и обратно вычитывают его на входе. А могли бы не делать этот roundtrip.

Ну, ноты от того не поменялись. Второй тоже не промах был

Ну, я не японец, но таки посмотреть могу...

Потому что нейронка пишет лучше человека.

А ещё нейронка лучше понимает код написанный нейронкой, чем код написанный человеком. А поскольку нейронка - основное средство написания кода, вставлять ей палки в колёса, разбавляя её код человеческим - довольно дрянная идея

Это правильный порядок действий. Сначала гуглим/спрашиваем chatgpt, только потом начинаем думать. Всё так и должно быть. Так и надо действовать

У них детство было сложное. Они ноты разумели.

27? Всего-то? Пахнешь слабостью

P.S. У мну и без нейронок было под двести репозиториев

Ох, если бы вы знали, какую шикарную песню suno на мои стихи написал...

Вы мне напомнили, что у меня прога для квантового компьютера лежит написанная, но неизученная.

Любопытно. Я в этой истории про деда слышу ровно обратный посыл. Он же не велел вам становиться автомехаником. Он говорил, чтобы вы немного разумели в тот, как чинить машину. То есть предлагаеться развитие вширь, а не вглубь. Ровно то, что сейчас очень легко получить с помощью агентов

Это называется широкий кругозор. Вообще-то это стоит ценить. Возможность потыкать семнадцать областей за день - достоинство, а не недостаток.

Information

Rating
1,819-th
Registered
Activity