Обновить

Комментарии 3

интересно, 4.6 держит планку или со временем деградирует? и главное - как ведёт себя на задачах где важен аналитический отклик а не скорость ответа, типа математики или кода?

Любопытный расклад по бенчмаркам. То, что модель вытягивают синтетикой и SFT-траекториями без раздувания параметров — правильный тренд для ценника в $2/$6. Но просадка на Terminal-Bench v3.0 до 26% огорчает. Не пробовал ещё затестить её в Cursor на реальном проекте? Интересно, как ощущается эта самопроверка на длинных дистанциях в сравнении со стандартной Fable 5.

грустно, что в курсоре у неё пока всё также контекстное окно в 256k

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации