Там в Википедии совсем чуть-чуть написано, но остальное можно загуглить.
Но должен признать, что мне очень понравилась ваша картинка про математические темы, доступные первокласснику. А также пример рабочей тетради. Правда, с птичками и котом немного выбивается из колеи задание - это скорее про тест на дальтонизм. Но в остальном - очень здравый подход!
Там есть какие то частные школы, но в том же Краснодаре не сказать что в них больше толку, чем в обычной традиционной школе.
Так почему бы вам эту самую частную школу не организовать? Тем более, что вы уже преподаёте. Наверняка есть такие же прогрессивные люди среди преподавателей по другим предметам, в том числе гуманитарным. Если бы вы с ними объединились, то смогли бы решить все те проблемы, которые вам тут в комментариях инкриминировали:
программа стала бы более всеобъемлющей, позволяющей расширять кругозор ребёнка;
на групповых занятиях были бы все те элементы социализации, которых ребёнок не получает, обучаясь в одиночку;
у вас бы появилась возможность модифицировать программу под детей разного уровня умственных способностей;
и много других рисков, связанных с невозможностью учесть все побочные эффекты индивидуального обучения.
То, что ребёнок социализируется где-то в других местах - это очень хорошо. Но он при этом всё равно остаётся "белой вороной", потому что не ходит именно в школу.
Также вы как-то опрометчиво обходите стороной вопрос о том, что не у всех детей умственные способности одинаковые. И нельзя сделать олимпиадника из кого-угодно. Даже если мама с папой олимпиадники, это ещё не даёт никаких гарантий. Даже при активном натаскивании с детства. Надо понимать, что одному ребёнку освоить математику легко, а другому - сложно. И тот, которому сложно, может вытянуть экзамены на отлично, но для него это будет стоить неимоверных усилий, в том числе эмоциональных. И это совсем не то же самое, как сдавать все предметы на пятёрки буквально одной левой, потому что умственные способности позволяют.
Поэтому и важно именно всестороннее развитие, особенно в раннем детстве. Потому что ребёнок может иметь склонность к чему-то другому, к сочинению стихов или к музицированию, футболу, актёрской игре, врачеванию, кулинарии, да мало ли к чему ещё. Он не обязан быть хорош именно в том, в чём хороши вы сами.
Но в узком смысле, именно в плане обучения математике, вы явно преуспели. Похожий подход можно встретить у Пола Локхарта в книге Measurment - но там про математику на уровне старших классов. А про рабочие тетради - есть такая книга, называется «Все, что нужно, чтобы понимать математику, в одном очень толстом конспекте» (она для 5-9 классов). Страницы там выглядят примерно так:
Скрытый текст
Ваш подход очень хорошо уложился бы в подобный стиль изложения.
Ну факт остаётся фактом - если дать одну и ту же задачу GPT-3.5 и GPT-5.6, то последний с ней справится лучше. То же самое касается работы в агентском окружении и просто в чате. Но люди, которые этого не пробовали и не хотят, начинают придумывать оправдания про казино.
Автор даже не упомянул, о какой именно модели идёт речь. И о каком временном периоде. Что-то не очень похоже, что он пользовался Fable 5. Скорее всего, он даже не подозревает о существовании Claude Code и общался в чатике на сайте. Ещё и ссылается на какое-то видео на ютубе больше чем полуторагодовалой давности и на исследование 2-летней давности - про LLM тех времён. Хотя кое-где он прав (например, про недостаток в обучающей выборке больших игровых проектов). Но это всё какие-то детские претензии. Те, кто LLM-ками пользуется давно, уже давно этим переболел.
Мысль интересная. С другой стороны, можно предположить, что прожорливость родного агента также коррелирует с его эффективностью. Ведь зачастую именно в родной обвязке модель показывает лучшие результаты. А вообще, проблемой сжигания токенов агентами уже много кто озаботился. Например, есть такой проект - https://www.rtk-ai.app/ - там вообще всё что только можно попытались ужать. Говорят, сокращает расход токенов до 90%.
А в чём проблема всё это обновлять программным образом? Почему винду 11 можно поставить на 775 сокет 20-летней давности, и всё прекрасно работает, а тут прям всё устарело, ничего нельзя сделать, только в морг. В примере с виндой, конечно, производитель тоже попытался чё-то там изобразить подобное, но его потуги быстро иссякли.
Бритва была Braun - лет 15 отслужила (и ещё 15 бы отслужила, если б я её смазывал).
Моник Viewsonic лет 15 отслужил, блок питания вышел из строя (запчастей нет).
Холодильник Indesit - 13 лет верой и правдой.
Так что все эти жизненные циклы смартфонов - просто курам на смех. Они должны служить 20 лет минимум. Старые телефонные аппараты вообще по 50 лет служат и более. С какого хрена они должны вообще переставать служить?
Предскажи точный финальный вывод этого кода на Python до последнего знака после запятой без использования сторонних библиотек:
x = 0.0
for _ in range(150):
x += 0.1
print(f"{x:.17f}")
На самом деле, даже на сайте дипсика после долгих размышлений модель таки дошла до правильного ответа - 14.99999999999996270. Но сами размышления были прерваны до того, как она их завершила.
Дипсик думает долго, да. И токены расходует долго.
Ну есть же Arena.ai, где люди тестируют модели и оценивают ответы. Даже там Клод первый. Да и в целом если бы это всё было накруткой бенчмарков, то люди бы давно это раскусили (как раскусывают с многими другими "убийцами Клода"). Но в реальности ещё с прошлой зимы люди заметили резкое улучшение именно у Клода на реальных задачах. Так что вряд ли тут можно говорить про какую-то аферу. Вот про ухудшение модели из-за цензуры скорее можно высказывать подозрения. Да и в целом периодически может урезаться test time compute по-тихому, из-за чего модель будет выдавать ерунду. Также не забываем, что Клод бывает не только Fable 5, но и какой-нибудь старый Sonnet, например.
Спасибо, интересный обзор. Немного смутило, что твит Маска на китайском. Только потом до меня дошло, что вы китаянка, поэтому у вас твиты на китайском. Кстати, если вы женщина (вроде на аватарке женщина?), то это желательно учитывать при переводе с китайского на русский. Потому что в русском языке речь от имени мужчины и от имени женщины обозначается по-разному (с помощью окончаний в словах). Просто просите ИИ при переводе это учитывать.
А имя совершенно необязательно менять на русское, вполне можно указать реальное китайское имя, просто русскими буквами.
С учётом цен на Muse Spark 1.2 (contributor edition), который по производительности между дипсиком-флеш и дипсиком-про, особого смысла платить за дипсик-про не будет, если ценник вырастет.
Что будет, если вы перейдёте в агентный режим (расшарите проект) и повторите свой вопрос?
Расширится контекст. В первом случае весь контекст - это один ваш маленький промпт. Во втором - это все данные, которые доступны агенту + инструментарий. В современном виде агент - это такой напарник, который иногда помогает вам, а иногда вы помогаете ему. В случае с чат-ботом - это просто оператор коллцентра, к которому вы обратились за поддержкой.
Финансированием экстремистской деятельности следует признавать наряду с оказанием финансовых услуг предоставление или сбор не только денежных средств (в наличной или безналичной форме), но и материальных средств (например, предметов обмундирования, экипировки, средств связи) с осознанием того, что они предназначены для финансирования...
То есть недостаточно просто платить. Нужно платить с умыслом именно на совершение преступления. И наличие умысла должен будет доказывать прокурор.
Оплата за подписку - это абсолютно законное действие, не подпадающее под финансирование преступлений. Потому что умысел здесь - купить подписку.
И все эти разговоры депутатов по телеку о том, что типа лучше не покупать подписку на инсту (и телегу, если Дурова признают экстремистом) - это всё туфта, не имеющая отношения к юридической плоскости.
Я бы сказал, что примечательно здесь не только само по себе математическое достижение, а тот факт, что это теперь будет ещё одним своеобразным бенчмарком. Теперь каждая новая передовая модель будет стараться преодолеть рекорд, установленный Антропиком. И самый очевидный вектор атаки тут - "дизайн" эксперимента. Сами авторы кичатся тем, что промптили кое-как. И если какие-нибудь усердные ребята (например, из Китая) всерьёз решат этим заняться, то у них есть все шансы побить этот рекорд за счёт одного лишь продуманного взаимодействия с моделью. Ещё один очевидный лайфхак - убрать переполнение контекста. Потому что при контекстном окне в 1 миллион токенов 30 миллионов выходных - это 30 раз прочищенный и ужатый контекст. Можно было бы после каждого миллиона делать развилку и просто загружать в новый пустой чат полученные результаты, чтобы модель могла ими оперировать с чистого листа. Причём, это можно делать параллельно в нескольких чатах, а потом выбирать тот результат, который получился наиболее перспективным, и снова отправлять в пустой чат. Наверняка есть ещё куча других подобных методов, которые не были использованы.
Если в агентском режиме модель даст вам результат (что будет говорить о наличии корреляции с /Yc), а в диалоговом нет, значит вас просто разводят на исходники.
Не совсем понятно, откуда такой вывод. Тут уже куча людей написали с примерами, что это именно так и работает. А вы продолжаете теоретизировать, опасаясь за свои исходники. Если у вас исходники нельзя никому показывать, пользуйтесь локальными LLM. Вон Kimi K3 можно у себя в датацентре развернуть, если надо. Или что поменьше, если своего датацентра нет. Но если речь просто о проверке способностей LLM в агентском режиме, то совсем необязательно им скармливать какие-то чувствительные исходники.
Она ещё параллельно закончила бакалавриат по специальности "Информационные технологии и вычислительная техника".
Вероятно, модель "2 в одном" дешевле обходится с точки зрения инференса, чем одновременный запуск двух разных моделей.
Не знаю, в курсе вы этой истории или нет, но на всякий случай оставлю ссылку - https://ru.wikipedia.org/wiki/Теплякова,_Алиса_Евгеньевна
Там в Википедии совсем чуть-чуть написано, но остальное можно загуглить.
Но должен признать, что мне очень понравилась ваша картинка про математические темы, доступные первокласснику. А также пример рабочей тетради. Правда, с птичками и котом немного выбивается из колеи задание - это скорее про тест на дальтонизм. Но в остальном - очень здравый подход!
Так почему бы вам эту самую частную школу не организовать? Тем более, что вы уже преподаёте. Наверняка есть такие же прогрессивные люди среди преподавателей по другим предметам, в том числе гуманитарным. Если бы вы с ними объединились, то смогли бы решить все те проблемы, которые вам тут в комментариях инкриминировали:
программа стала бы более всеобъемлющей, позволяющей расширять кругозор ребёнка;
на групповых занятиях были бы все те элементы социализации, которых ребёнок не получает, обучаясь в одиночку;
у вас бы появилась возможность модифицировать программу под детей разного уровня умственных способностей;
и много других рисков, связанных с невозможностью учесть все побочные эффекты индивидуального обучения.
То, что ребёнок социализируется где-то в других местах - это очень хорошо. Но он при этом всё равно остаётся "белой вороной", потому что не ходит именно в школу.
Также вы как-то опрометчиво обходите стороной вопрос о том, что не у всех детей умственные способности одинаковые. И нельзя сделать олимпиадника из кого-угодно. Даже если мама с папой олимпиадники, это ещё не даёт никаких гарантий. Даже при активном натаскивании с детства. Надо понимать, что одному ребёнку освоить математику легко, а другому - сложно. И тот, которому сложно, может вытянуть экзамены на отлично, но для него это будет стоить неимоверных усилий, в том числе эмоциональных. И это совсем не то же самое, как сдавать все предметы на пятёрки буквально одной левой, потому что умственные способности позволяют.
Поэтому и важно именно всестороннее развитие, особенно в раннем детстве. Потому что ребёнок может иметь склонность к чему-то другому, к сочинению стихов или к музицированию, футболу, актёрской игре, врачеванию, кулинарии, да мало ли к чему ещё. Он не обязан быть хорош именно в том, в чём хороши вы сами.
Но в узком смысле, именно в плане обучения математике, вы явно преуспели. Похожий подход можно встретить у Пола Локхарта в книге Measurment - но там про математику на уровне старших классов. А про рабочие тетради - есть такая книга, называется «Все, что нужно, чтобы понимать математику, в одном очень толстом конспекте» (она для 5-9 классов). Страницы там выглядят примерно так:
Скрытый текст
Ваш подход очень хорошо уложился бы в подобный стиль изложения.
Сразу вспомнились уроки по информатике, где учили, как правильно писать в ворде и рисовать в пэинте.
Ну факт остаётся фактом - если дать одну и ту же задачу GPT-3.5 и GPT-5.6, то последний с ней справится лучше. То же самое касается работы в агентском окружении и просто в чате. Но люди, которые этого не пробовали и не хотят, начинают придумывать оправдания про казино.
Автор даже не упомянул, о какой именно модели идёт речь. И о каком временном периоде. Что-то не очень похоже, что он пользовался Fable 5. Скорее всего, он даже не подозревает о существовании Claude Code и общался в чатике на сайте. Ещё и ссылается на какое-то видео на ютубе больше чем полуторагодовалой давности и на исследование 2-летней давности - про LLM тех времён. Хотя кое-где он прав (например, про недостаток в обучающей выборке больших игровых проектов). Но это всё какие-то детские претензии. Те, кто LLM-ками пользуется давно, уже давно этим переболел.
Мысль интересная. С другой стороны, можно предположить, что прожорливость родного агента также коррелирует с его эффективностью. Ведь зачастую именно в родной обвязке модель показывает лучшие результаты. А вообще, проблемой сжигания токенов агентами уже много кто озаботился. Например, есть такой проект - https://www.rtk-ai.app/ - там вообще всё что только можно попытались ужать. Говорят, сокращает расход токенов до 90%.
Иосиф Виссарионович, перелогиньтесь.
Поначалу утверждали якобы "кровь из носа нужен", а по факту - ничего там не нужно.
А в чём проблема всё это обновлять программным образом? Почему винду 11 можно поставить на 775 сокет 20-летней давности, и всё прекрасно работает, а тут прям всё устарело, ничего нельзя сделать, только в морг. В примере с виндой, конечно, производитель тоже попытался чё-то там изобразить подобное, но его потуги быстро иссякли.
У меня телек Sony уже лет 20 служит.
Бритва была Braun - лет 15 отслужила (и ещё 15 бы отслужила, если б я её смазывал).
Моник Viewsonic лет 15 отслужил, блок питания вышел из строя (запчастей нет).
Холодильник Indesit - 13 лет верой и правдой.
Так что все эти жизненные циклы смартфонов - просто курам на смех. Они должны служить 20 лет минимум. Старые телефонные аппараты вообще по 50 лет служат и более. С какого хрена они должны вообще переставать служить?
Сериал на Netflix, сезонов на 10 минимум.
На самом деле, даже на сайте дипсика после долгих размышлений модель таки дошла до правильного ответа - 14.99999999999996270. Но сами размышления были прерваны до того, как она их завершила.
Дипсик думает долго, да. И токены расходует долго.
Ну есть же Arena.ai, где люди тестируют модели и оценивают ответы. Даже там Клод первый. Да и в целом если бы это всё было накруткой бенчмарков, то люди бы давно это раскусили (как раскусывают с многими другими "убийцами Клода"). Но в реальности ещё с прошлой зимы люди заметили резкое улучшение именно у Клода на реальных задачах. Так что вряд ли тут можно говорить про какую-то аферу. Вот про ухудшение модели из-за цензуры скорее можно высказывать подозрения. Да и в целом периодически может урезаться test time compute по-тихому, из-за чего модель будет выдавать ерунду. Также не забываем, что Клод бывает не только Fable 5, но и какой-нибудь старый Sonnet, например.
Спасибо, интересный обзор. Немного смутило, что твит Маска на китайском. Только потом до меня дошло, что вы китаянка, поэтому у вас твиты на китайском. Кстати, если вы женщина (вроде на аватарке женщина?), то это желательно учитывать при переводе с китайского на русский. Потому что в русском языке речь от имени мужчины и от имени женщины обозначается по-разному (с помощью окончаний в словах). Просто просите ИИ при переводе это учитывать.
А имя совершенно необязательно менять на русское, вполне можно указать реальное китайское имя, просто русскими буквами.
С учётом цен на Muse Spark 1.2 (contributor edition), который по производительности между дипсиком-флеш и дипсиком-про, особого смысла платить за дипсик-про не будет, если ценник вырастет.
Расширится контекст. В первом случае весь контекст - это один ваш маленький промпт. Во втором - это все данные, которые доступны агенту + инструментарий. В современном виде агент - это такой напарник, который иногда помогает вам, а иногда вы помогаете ему. В случае с чат-ботом - это просто оператор коллцентра, к которому вы обратились за поддержкой.
Нет. В законе сказано:
Кроме того, есть отдельное постановление Верховного Суда РФ:
То есть недостаточно просто платить. Нужно платить с умыслом именно на совершение преступления. И наличие умысла должен будет доказывать прокурор.
Оплата за подписку - это абсолютно законное действие, не подпадающее под финансирование преступлений. Потому что умысел здесь - купить подписку.
И все эти разговоры депутатов по телеку о том, что типа лучше не покупать подписку на инсту (и телегу, если Дурова признают экстремистом) - это всё туфта, не имеющая отношения к юридической плоскости.
Я бы сказал, что примечательно здесь не только само по себе математическое достижение, а тот факт, что это теперь будет ещё одним своеобразным бенчмарком. Теперь каждая новая передовая модель будет стараться преодолеть рекорд, установленный Антропиком. И самый очевидный вектор атаки тут - "дизайн" эксперимента. Сами авторы кичатся тем, что промптили кое-как. И если какие-нибудь усердные ребята (например, из Китая) всерьёз решат этим заняться, то у них есть все шансы побить этот рекорд за счёт одного лишь продуманного взаимодействия с моделью. Ещё один очевидный лайфхак - убрать переполнение контекста. Потому что при контекстном окне в 1 миллион токенов 30 миллионов выходных - это 30 раз прочищенный и ужатый контекст. Можно было бы после каждого миллиона делать развилку и просто загружать в новый пустой чат полученные результаты, чтобы модель могла ими оперировать с чистого листа. Причём, это можно делать параллельно в нескольких чатах, а потом выбирать тот результат, который получился наиболее перспективным, и снова отправлять в пустой чат. Наверняка есть ещё куча других подобных методов, которые не были использованы.
Не совсем понятно, откуда такой вывод. Тут уже куча людей написали с примерами, что это именно так и работает. А вы продолжаете теоретизировать, опасаясь за свои исходники. Если у вас исходники нельзя никому показывать, пользуйтесь локальными LLM. Вон Kimi K3 можно у себя в датацентре развернуть, если надо. Или что поменьше, если своего датацентра нет. Но если речь просто о проверке способностей LLM в агентском режиме, то совсем необязательно им скармливать какие-то чувствительные исходники.