Comments 3
интересно, 4.6 держит планку или со временем деградирует? и главное - как ведёт себя на задачах где важен аналитический отклик а не скорость ответа, типа математики или кода?
Любопытный расклад по бенчмаркам. То, что модель вытягивают синтетикой и SFT-траекториями без раздувания параметров — правильный тренд для ценника в $2/$6. Но просадка на Terminal-Bench v3.0 до 26% огорчает. Не пробовал ещё затестить её в Cursor на реальном проекте? Интересно, как ощущается эта самопроверка на длинных дистанциях в сравнении со стандартной Fable 5.
грустно, что в курсоре у неё пока всё также контекстное окно в 256k
Sign up to leave a comment.
Вышел Grok 4.6 — разбираем, как модель взяла уровень GPT-5.6 по цене вдвое ниже