Комментарии 6
Не бейте меня(
Гитхаба в некоторое время не будет, потому что там надо 2FA этот проходить, а у меня рекавери 2FA код лежит в другом месте (к которому я пока не могу получить доступ), так что возможно только через неделю точно будет гитхаб.
Зачем бить? Хорошая работа: расковыряли, потестили, поделились. Сам также делаю.
По поводу вашего LSWM, это очень похоже Linear Attention (линейное внимание), которому уже лет двадцать. То, что Softsign снижает проблему затухания градиента (затухая полиномиально, а не экспоненциально), также известно давненько. Интересно было бы прочитать в чем ваш вариант лучше тех методов, я глубоко не вникал если честно.
Про Linear Attention - да, знаю, я впринципе вроде того и хотел сделать, просто там вроде бы Q, K, V, а у меня нету этого.
Про ту статью (где про softsign) - ну там вроде бы про инициализацию модели писали и про CV вообще писали (но, хотя NLP тоже упоминали).
А так по поводу LSWM - я хочу на самом деле переработать LWM слой, а SWM сделать намного стабильнее.
И ещё - сеть всё равно чувствительна к сиду, кажется потому что у меня не конкатенация.

Моя собственная Gated RNN: как работает? (и бенчмарки, конечно же)