Pull to refresh

Comments 7

Не правильно считать что кто-то "вышел" только по цифрам и заявлениям. Может у них УЖЕ есть что-то что готово перевернуть наше текущее состояние на этом рынке и они просто решили на этом сфокусироваться. И никак этот факт не измерить, ни финансами, ни датацентрами. Потому-что ИИ следующего поколения может вполне комфортно существовать в единственном экземпляре и потреблать в 100 раз меньше ресурсов чем современные громоздкие LLM.

Да какое нам до них дело...

Вообще Google явно делает ставку на скорость моделей. Возможно, готовит тот самый пресловутый фундамент для RSI - ведь для того, чтобы быстро совершенствоваться, нужны быстрые инструменты. Ситуация была такова:

У Гугла до эпохи Fable - были Gemini Pro 3.1 (умная, для рассуждений и сложных задач) и Flash 3.1 (быстрая, для несложных, и очень дёшево), вполне конкурирующие с другими моделями.

После выхода Fable - все ждали Pro 3.5. И он был в работе, доступ даже раздали партнёрам Гугла, он мелькнул на LMArena, но... не вышел. Злые языки шептались, что он оказался далёк от SOTA-моделей конкурентов.

Зато вышел Flash 3.5 (буквально через пару недель пропатченный до 3.6). На тестах он кое-где умудрился обойти Opus, хотя в целом был середнячком, но главное - был ЧЕРТОВСКИ быстр, порядка 150-200 токенов/сек. Пишешь запрос, и через пять секунд модель выплёвывает буквально страницы текста, бегунок прокрутки стремительно убегает вверх. Впечатляет.

А недавно, буквально неделю назад, вышел Flash 3.7 - и это оказался прорыв. Он всё ещё быстр как молния, но результаты показывает почти на уровне SOTA. При этом он ОЧЕНЬ дешёвый.

Из личной статистики, на моих задачах (кодинг C#, Unity, отладка, работа со сценой через MCP) средний показатель "число запросов до решения задачи":

  • Gemini Pro 3.1 - 4-5 запросов.

  • Opus 4.6 - 2-3 запроса.

  • Gemini Flash 3.1 - 10-15 запросов (не решает).

  • Sonnet 4.6 - 3-4 запроса.

  • Gemini Flash 3.5/3.6 - 3-4 запроса.

  • Gemini Flash 3.7 - 2-3 запроса.

  • ChatGPT Sol 5.6 - 1-2 запроса.

Причём Sol очень медленный (либо очень дорогой) - дал задачу, ушёл пить чай, вернулся, а он только её завершает. Flash же работает практически мгновенно, основное время он тратит на вызовы инструментов.

В итоге получается, что "бросовый" Flash 3.7 достигает успеха с задачей куда быстрее, чем Sol, причём дешевле чуть не в 10 раз.

Вероятно, в этом и ставка Гугла - удешевить токен, чтобы токенами можно было "залить" любую задачу, в том числе и совершенствование моделей.

это произойдёт не так легко и не так быстро, как переход от чатботов к рассуждающим моделям и агентам

Если что это одно и то же. Технология сама практически не изменилась, это лишь форма работы с переданным контекстом. Вообще без tool-calling и reasoning можно обойтись и на "голых моделях" генерировать такие же обвязки для агентов.

Странный текст. Мне так показалось. Я почему-то думал, что все ИИ-конторы открыто или скрыто работают над ИИ, который строит модель мира, как человек. Потому что, думал я, это же очевидно, что стат-обработка мегатонн текста по определению не способна выйти на уровень реальных рассуждений и понимания мира.

Но, если верить автору, так думает только Google. Что опять же, странно.

Кстати, везде показаны цифры по выручке, а где прибыль?

И кстати, зачем надо было генерить так много букв?)

Чтобы сделать модель мира его нужно описать, а для этого вроде как нужно всё в нем понять). Чувствуется тут тоже есть противоречия да и в таких объемах симуляцию вообще сложно на данный момент представить. Кстати чем ближе мы к возможности создания такой симуляции, тем уверенней себя чувствуют сторонники теории заговоров о нашей собственной жизни в симуляции.

Sign up to leave a comment.

Articles