Pull to refresh
8K+
6
@linabessonread⁠-⁠only

User

1
Rating
28
Subscribers
Send message

Вопросов по сути два

  1. сможете ли разобраться в стеке без агента

  2. сможете ли поддерживать проект на долгой дистанции

вопрос в качестве данных и качестве седиментации, а также качестве и количестве практики по новым навыкам из управленческого опыта, сотрудник научится только если узнает - попробует - получит результат - оценит результат если у него есть офигенного объема база знаний по компании с кучей кейсов то что толку

от меня плюс в карму Илья, мы идем с другого конца, от нервной системы к метаболизму но пришли примерно туда же, ценно что вы один из немногих, кто понимает зачем это вообще нужно надеюсь после формальной экспертизы смогу показать больше

В mixer.py, строка 86: self.out_proj = nn.Identity() if self.n_heads == 1 else nn.Linear(…). Output-проекция отсутствует при n_heads=1. Решение нестандартное и в статье не обоснованное. Есть ablation?

Репозиторий LibratioAI/sessa создан 20 апреля 2026 (за неделю до публикации статьи), 2 коммита, 1097 строк кода всего, из которых 457 — mixer.py. Организация LibratioAI зарегистрирована 18 февраля 2026, 1 публичный репозиторий. Это уровень готовности проекта, который не соответствует тону «я создал альтернативу трансформерам».

В bibtex репозитория цитата @article{horbatko2026sessa}. По Google Scholar других публикаций автора в области ML нет. Это первая работа без рецензирования и без публикационной истории. В таком контексте формулировка «альтернатива трансформерам» избыточна.

Просьба «поддержите голосом на Hugging Face» в конце статьи — это запрос на накрутку upvotes на платформе с голосованием, что является известным вектором манипуляции рейтингами (см. arXiv:2507.08983).

В репозитории нет ни одного признанного long-context бенчмарка: RULER, LongBench, ∞-Bench, Needle-in-a-Haystack, PG19, BookSum — ничего. Единственный датасет — datasets/SymbolSoup.py, синтетический генератор собственного авторства. Сравнивать архитектуры на одном самодельном синтетическом тесте — методологически некорректно.

В репозитории нет ни одного Transformer-baseline и ни одного Mamba-baseline. Нет training loop, нет evaluation-скриптов, нет конфигов запуска, нет чекпоинтов. На основании чего сделано заявление о «strongest performance»?

По issue #51 в репозитории Mamba (https://github.com/state-spaces/mamba/issues/51) Albert Gu пишет: «We don’t use positional encodings» и обсуждается, что диагональные SSM могут реализовывать вариант RoPE через мнимую часть A(n,n). Это значит, что «имплицитная позиционная информация» — общее свойство SSM, а не уникальное свойство Sessa.

Все нижние оценки в работе тривиальны — «больше или равна нулю». По таким теоремам можно утверждать только, что верхняя граница Sessa не хуже, но нельзя утверждать, что Transformer или Mamba действительно затухают быстрее. Чтобы доказать преимущество, нужны нижние оценки для оппонентов того же порядка или хуже. Их нет.

Power-law tails O(\ell^{-\beta}) при 0 < \beta < 1 — это верхняя граница, а не достигаемая скорость. По одной верхней границе нельзя сравнивать архитектуры.

Сложность Sessa: forward-attention O(T^2 \cdot D) + feedback-attention O(T^2 \cdot D) + torch.linalg.solve_triangular O(T^2 \cdot D) (mixer.py, строки 147–156, 248–256). Это тяжелее обычного трансформера. При этом квадратичная сложность подаётся как мотивация ухода от трансформера. Где выигрыш по сложности?

Forward-ветка Sessa — это обычный multi-head causal self-attention с RoPE, GQA и опциональным FlashAttention (from flash_attn import flash_attn_func, mixer.py, строка 6). То есть Sessa не «альтернатива трансформерам», а трансформер плюс ещё один attention-блок в feedback. Заголовок статьи технически некорректен.

В abstract на arXiv заявлено: «across matched experiments, Sessa achieves the strongest performance on long-context benchmarks». В Хабр-статье автор пишет: «в ближайших планах обучить модель на несколько миллиардов параметров и посмотреть». Это прямое противоречие самому себе. Где experiments, на которых построено заявление в abstract?

«Универсальная теорема аппроксимации для отображения последовательности в последовательность» подаётся как дополнительный результат для Sessa. Универсальная аппроксимация для многослойных SSM с нелинейностями уже доказана: Wang & Xue, 2023, arXiv:2309.13414. Какова новизна именно для Sessa относительно этого результата?

В статье вообще отсутствуют ссылки на ключевые первоисточники: Vaswani et al., 2017 (Transformer); Gu & Dao, 2023, arXiv:2312.00752 (Mamba); Gu et al., 2022 (S4); Su et al., 2021 (RoPE — используется в вашем коде); Yun et al., 2019 (universal approximation для трансформера). Для исследовательской работы это серьёзный пропуск.

В разделе «Память» все сравнения проводятся в специально подобранных режимах: «диффузный режим» для Transformer и «failed freezing time» для Mamba. Цитата из самой статьи: «Потому что можно подобрать такие параметры, при которых каждая из них будет лучше другой, или наоборот». То есть это не доказательство превосходства, а выбор худшего случая для оппонентов.

Тезис «трансформеру для универсальной аппроксимации необходим именно внешний APE» — это пересказ теоремы 3 из Yun et al., 2019 (arXiv:1912.10077). Без ссылки на первоисточник.

В статье утверждается: «Sessa, как и Mamba, может кодировать APE внутри себя без явных таблиц или экстраполяции, в отличие от трансформера». Однако в sessa/mixer.py, строки 91–96 и 234–239, явно реализован RoPE, и параметр use_forward_rope=True стоит по умолчанию. RoPE — это позиционное кодирование (Su et al., 2021, arXiv:2104.09864). То есть Sessa кодирует позицию явно, как и любой современный трансформер, а не «эмерджентно, как Mamba».

Прочитала статью, покопалась в репо, несколько технических вопросов и замечаний по существу:

В requirements.txt указан только tqdm>=4.0. PyTorch в зависимостях отсутствует, хотя в README репозиторий заявлен как «Official PyTorch implementation». При pip install -e . в чистом окружении импорт упадёт. https://github.com/LibratioAI/sessa/blob/main/requirements.txt

и вот сюда еще) не “Вторая — седиментация — подсмотрена в одной статье на Хабре про управление знаниями (здесь должна быть ссылка на мою работу). Метафора точная: знания как геологические слои. Свежее лежит сверху, важное со временем оседает глубже, а мусор разрушается.”

приятно за признание нижегородских девов)) а по существу - в похожую сторону сейчас думают Антропики, на мой взгляд, но конечно очень осторожно и без резких движений

не только зачем, но и как он влияет)

а что если документы противоречат друг другу?

У тебя ансамбль ретриверов может вытащить чанки из разных источников с разной информацией (например, старая и новая редакция документа). Как LLM решает кому верить?

Information

Rating
Does not participate
Location
Нижний Новгород, Нижегородская обл., Россия
Registered
Activity