Комментарии 2
неожиданно хорошая статья. Неожиданно потому как ожидал очередной нейротекст по такому же нейроиссследованию, а тут прям хорошо. И схемы и реальные тесты с проверками.
Но вообще я думаю что сравнение не сильно актуально. Во первых нейронки затачивают проходить тесты, во вторых те задачи на которых можно реально сравнить быстро - обычно они влазят в контекстное окно.
Да и в целом относительно фабла лично у меня сложилось мнение что это просто на 4.8 вернули те настройки что были у зимнего 4.6. Не вижу я прям революции в фабле, а вот то что он нормально работает в отличии от 4.8 это да.
Потому мое мнение что изначально даунгрейд всего антропика этой зимой был как раз прогревом для выпуска фабла.
На сейчас без учета фабла лучшее на рынке это 5.5 от chatGPT, хотя его и излишне несет. Но если смотреть по опыту то зимний 4.6 разнес бы даже современный 5.5 просто за счет системности и придерживаемости установленных правил.
Кстати так и не удалось мне до конца проверить фабл на системность - лимиты он жрет дай боже. Я даже боюсь представить сколько стоило ваше исследование, ведь подписка такое не покроет, не за одну неделю по крайней мере точно.
Спасибо на добром слове.
Революции в фабле пока тоже не ощущаю на своих задачах. А на моих задачах - это на проектировании доработок. Я проектирую на опус/фабл, а исполняю план на GPT чаще всего. Если только мелочь какая-то, то имплементирую сразу в антропике. Потому что антропиковские модели делают более конкретные планы, а опеновские более внимательно проверяют себя на ошибки при исполнении. На данный момент. Зимой действительно было скорее наоборот.
Вы, судя по всему, говорите о наблюдениях именно при исполнении задач. Фабл и впрямь как будто более аккуратно исполняет, чем опус. Но стоит это слишком дорого, если это всё чем он революционен. Поглядим дальше по использованию.
Что касается цены, не то чтобы очень дорого. Проект всё-таки учебный, не бог весть какой контекст там. У меня подписки на антропик, гпт, гитхаб и opencode. Так что о цене можно говорить только в пересчёте на API. За пропозал/анализ - в пределах 3-5 баксов для американцев, до 10 для фабла и примерно 1-1,5 для китайцев. Так что всё вместе вряд ли выскочит за 100.
А вот в часах эта статья мне обошлась очень дорого. Сам эксперимент в реальной жизни занял один день на запуски + полистать отчёты и принять решение по дальнейшей судьбе кода. Зато на формализацию и описание этого всего для статьи... Очень трудоёмкое это дело, оказывается.

Гибель богов. Fable и ещё 10 LLM реорганизуют код. Сравнение